Labnana
登录
MiniMax H3 · MiniMax

MiniMax H3 视频模型

这里唯一不会给你默片的模型——H3 的立体声是画面的一部分,不是事后配上去的。

  • 32 kHz 立体声,恒开
  • 4–15 秒,768p 或 2K
  • 六种比例,含 21:9
  • 只给尾帧也能生成

MiniMax H3 是 MiniMax 的全模态生成模型,官方的说法是「支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频」。落到用起来就是:声音不是第二道工序,人声、音效和配乐跟画面一起被建模,随成片一次给到,32 kHz 立体声、24 fps。

在 Labnana 上它出 4 到 15 秒、768p 或 2K。768p 指的是短边 768 像素,所以 16:9 的成片是 1344×768。2K 不是把 768p 放大——MiniMax 是把结果连同原始上下文送回模型按 2K 重新生成,而不是跑一遍超分,小字和细节因此能留住。

在 Labnana 上能拿 MiniMax H3 做什么

01

拿到的片子自带声音

把该听到的和该看到的一起写进提示词——一句台词、一段环境声、一段配乐,都会出现在成片里。台词在 11 种语言上表现稳定,含中文、英语、日语、韩语、法语、德语、西班牙语、意大利语、葡萄牙语、俄语和阿拉伯语。生成器里没有音频开关,因为这个模型没有静音模式。

02

把镜头的任意一头钉住

可以只给首帧、只给尾帧,或者两头都给。这里其它模型都必须先有首帧,H3 能从最后一帧倒推——想让镜头精确落在某个收尾构图上,走这条。

03

让人物、产品或声音在镜头间保持一致

最多挂 5 张参考图,用来稳住角色或物体。它还收参考视频和参考音频,各最多 3 条,参考视频每条 2 到 15 秒——运动和音色可以直接来自你手上已有的素材。

04

按超宽画幅取景

除了 16:9、4:3、1:1、3:4、9:16,还有 21:9。这是 Labnana 上唯一给 21:9 的模型;片子如果要放进加黑边的成片里,而不是后期裁出来,这一条就有用。

MiniMax H3 规格一览

生成器会按模型支持的范围过滤参数。积分消耗取决于分辨率和时长,提交前实时显示,这里不再重复。

档位时长分辨率画面比例尾帧提示词上限最适合
MiniMax H3MiniMax4–15 秒,整秒768p / 2K,24 fps6 种(21:9、16:9、4:3、1:1、3:4、9:16)支持,且不需要先给首帧2500 字符需要声音的片子、超宽画幅

怎么用

1

写清画面,也写清声音

画面和声音写进同一段提示词。文生视频必须写提示词,挂了参考素材也仍然必须写,最长 2500 字符。

2

有素材就挂上去

首帧、尾帧,或者两个都给。参考图最多 5 张,参考视频和参考音频各最多 3 条。传了输入图之后画面比例跟着那张图走,比例控件会让位。

3

选时长和分辨率,然后生成

4 到 15 秒的整秒,768p 或 2K。改任意一项积分消耗都会实时更新;提交后可以离开页面,回来再看结果。

和别的模型比一比

在哪儿用 MiniMax H3

全部模型

视频生成只有一个输入框,在那里换模型不会丢掉已经写好的内容。片子不需要声音、或者要超过 15 秒,可以看看另外两个模型。

常见问题

用 MiniMax H3 生成

4 到 15 秒,768p 或 2K,自带声音。提交前会显示消耗。