MiniMax H3 视频模型
这里唯一不会给你默片的模型——H3 的立体声是画面的一部分,不是事后配上去的。
- 32 kHz 立体声,恒开
- 4–15 秒,768p 或 2K
- 六种比例,含 21:9
- 只给尾帧也能生成
MiniMax H3 是 MiniMax 的全模态生成模型,官方的说法是「支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频」。落到用起来就是:声音不是第二道工序,人声、音效和配乐跟画面一起被建模,随成片一次给到,32 kHz 立体声、24 fps。
在 Labnana 上它出 4 到 15 秒、768p 或 2K。768p 指的是短边 768 像素,所以 16:9 的成片是 1344×768。2K 不是把 768p 放大——MiniMax 是把结果连同原始上下文送回模型按 2K 重新生成,而不是跑一遍超分,小字和细节因此能留住。
在 Labnana 上能拿 MiniMax H3 做什么
拿到的片子自带声音
把该听到的和该看到的一起写进提示词——一句台词、一段环境声、一段配乐,都会出现在成片里。台词在 11 种语言上表现稳定,含中文、英语、日语、韩语、法语、德语、西班牙语、意大利语、葡萄牙语、俄语和阿拉伯语。生成器里没有音频开关,因为这个模型没有静音模式。
把镜头的任意一头钉住
可以只给首帧、只给尾帧,或者两头都给。这里其它模型都必须先有首帧,H3 能从最后一帧倒推——想让镜头精确落在某个收尾构图上,走这条。
让人物、产品或声音在镜头间保持一致
最多挂 5 张参考图,用来稳住角色或物体。它还收参考视频和参考音频,各最多 3 条,参考视频每条 2 到 15 秒——运动和音色可以直接来自你手上已有的素材。
按超宽画幅取景
除了 16:9、4:3、1:1、3:4、9:16,还有 21:9。这是 Labnana 上唯一给 21:9 的模型;片子如果要放进加黑边的成片里,而不是后期裁出来,这一条就有用。
MiniMax H3 规格一览
生成器会按模型支持的范围过滤参数。积分消耗取决于分辨率和时长,提交前实时显示,这里不再重复。
| 档位 | 时长 | 分辨率 | 画面比例 | 尾帧 | 提示词上限 | 最适合 |
|---|---|---|---|---|---|---|
| MiniMax H3MiniMax | 4–15 秒,整秒 | 768p / 2K,24 fps | 6 种(21:9、16:9、4:3、1:1、3:4、9:16) | 支持,且不需要先给首帧 | 2500 字符 | 需要声音的片子、超宽画幅 |
怎么用
写清画面,也写清声音
画面和声音写进同一段提示词。文生视频必须写提示词,挂了参考素材也仍然必须写,最长 2500 字符。
有素材就挂上去
首帧、尾帧,或者两个都给。参考图最多 5 张,参考视频和参考音频各最多 3 条。传了输入图之后画面比例跟着那张图走,比例控件会让位。
选时长和分辨率,然后生成
4 到 15 秒的整秒,768p 或 2K。改任意一项积分消耗都会实时更新;提交后可以离开页面,回来再看结果。
和别的模型比一比
在哪儿用 MiniMax H3
全部模型视频生成只有一个输入框,在那里换模型不会丢掉已经写好的内容。片子不需要声音、或者要超过 15 秒,可以看看另外两个模型。