MiniMax H3 视频生成初体验

Yuxino,•试验
中EN

MiniMax H3 刚发布那阵,我正好打开 B 站,刷到一条 AI 变身视频。角色在画面里换造型,头发、衣服和武器跟着变。看大家生成的效果好像蛮不错的,我也就试试。

用的是《英雄联盟》里的格温。她有不同皮肤的原画,也就是同一个角色的几套造型。这次取了六张,相邻两张生成一段变化,一共五段,再接成一条视频。

格温怎么站着不动

最开始在阿里云试「欢乐马」,给一张起始图片;后来又试万相,把起始图和结束图一起传进去。文件生成出来了,换装却没做好:前几秒几乎不动,快结束时才突然换了一身。

首尾帧规定的是两端的画面,中间仍要模型生成。笔记里的提示词写了「最终定格为第二张图」。这是在描述终点,不能保证头发、衣服、武器在中间自然变过去。只在最后突然换张图,并不是连续的变身过程。

按当时记下的花费,阿里云这轮探索用了八十多元。视频有了,想要的成片没有。我先停下这套尝试,去找别的素材。

素材本身也有问题。我最开始用的是游戏加载界面里的窄图,只有 308×560。人物是完整的,左右两边却没有画面。硬扩成横版以后,不是留下黑边,就是让模型自己猜两边应该长什么样。

格温的竖版游戏加载图,人物两侧的场景被裁掉
308 × 560 的加载图:人物两侧的场景被裁掉了。

后来换成了 Riot Games 的完整皮肤原画。保存下来的这六张都是 1215×717,人物两侧有完整场景。放大加载图不会找回裁掉的内容;有现成横图,就不用先让模型补背景了。

1 / 6
2 / 6
3 / 6
4 / 6
5 / 6
6 / 6

左右滑动看六张原画,点图可以放大。原画来自 Riot Games。

这一轮也换用了 MiniMax H3 (opens in a new tab)。提示词把过程写在前面:整段都要持续运动,头发、衣服和武器逐渐变化,别等到结尾突然切换。

这一轮能看见格温逐渐换造型。不过,模型、图片和提示词都换了,不能把改善全算在某一句提示词上。

六张图,怎么接成一条视频

六张皮肤图一共要生成五段。每一段都用相邻两张图做首尾帧。比如第一段从图 1 变到图 2,第二段再从图 2 变到图 3,相邻两段以同一张图衔接。

相邻两段共用一张图,是为了让连接处的造型对得上。动作还得另看:前一段停下、后一段开始,速度和方向未必接得自然。FFmpeg 可以把文件拼起来,不能替模型补上没生成好的动作。

我用视频处理工具 FFmpeg 把五段按顺序拼起来,再处理声音。

声音是后来加的

画面拼好以后,我从格温的国服语音里挑了五句台词,又加上她的官方主题曲。

配音合集很长,我先用本地语音识别找出台词的大致位置,再裁出需要的几句,放到视频里。成片里的主题曲持续播放,台词在选好的位置进入。这些声音是后来配的。

最后的视频大约 26 秒:六张皮肤、五次连续变化、五句中文台词。

打开或下载这段视频

当时用的提示词和处理顺序,留在了这份制作笔记里。

当时记下的 MiniMax 账户花费是三十五元,里面包括测试片段和试过的配乐。这个数不能代表单独生成五段画面花了多少,更不能除以 26 秒当作生成单价。阿里云那轮的八十多元则留在了前面的试错里。

评论