Skip to content
带声音的 AI 视频·原生音频·MiniMax H3·AI 视频生成器·

自带声音的 AI 视频生成器:MiniMax H3 原生音频

大多数 AI 视频生成器是无声的。MiniMax H3 把对白、环境声和音效与画面一起生成——双声道、带口型。它在 Pixo 上的用法。

Pixo 团队·11 min read
自带声音的 AI 视频生成器:MiniMax H3 原生音频

每条 AI 视频工作流都会撞上这样一个时刻:片段看起来很棒,但它完全是无声的。于是你去找配乐、找 TTS 工具做旁白、再找点音效——然后你发现真正难的部分:录在视频之上的声音永远不真正属于它。房间底噪不对、嘴不动、脚步声落不到地上。声音设计变成了第二场制作。

这正是 MiniMax 的 H3 在 7 月 31 日发布时补上的缺口:它不是给视频加音频,而是把两者一起生成。我们运营着 Pixo,一个多模型视频平台,H3 已上线其中的 Playground——在 H3 的整张规格表里,这是最能改变日常工作的能力,所以下面精确讲清它的行为方式和提示词写法。

『原生音频』究竟是什么意思

每条 H3 输出都自带与画面同一次生成的立体声。一条提示词产出三层声音:

  • 对白。 台词逐字写出,角色就会把它说出来——带口型同步,因为嘴部运动和音频来自同一次生成。改写台词,表演也会跟着变。
  • 环境声。 场景听起来就像那个场景:湿地上的风、厨房的嗡鸣、玻璃后的车流。与其说是你请求它,不如说是你没能排除它。
  • 音效。 接触音落在物理发生的地方——盖子打开时有咔哒声,鸟起飞时有振翅声。

这与配音的差别并不微妙。后期叠加的音频是关于视频的;生成的音频是属于视频的。角色说到一半转身时,声音会跟着一起转。

谁有声音,谁没有

音频已经悄悄成为模型代际的分界线:

模型原生音频
MiniMax H3✅ 所有输出双声道——对白、环境声、音效
Seedance 2.5✅ 有
Veo 3.1✅ 有
Wan 2.6✅ 有——同步的对白与音效
Kling 3.0❌ 无声输出

H3 在『有音频』之上多出的是声音这一整套:覆盖多种语言的文本转语音,以及从参考音轨克隆音色——上传一把声音,对白就以那个音色生成。(这项能力值得单独深挖;这里只讲日常用法。)

给声音写提示词的四条规则

1. 对白必须写出原文。 H3 不会即兴编词。疲惫的声音说:“我们五分钟后开门。”生成的就是这句话——别的没有。模糊的要求(『她说了句安慰的话』)产出模糊的结果。

2. 决定谁在画面里。 可见的说话人有口型同步;画外的声音就是旁白。两者都只是一行提示词——区别在于你把不把说话人放进画框。

3. 不想要音乐就明确禁掉。 H3 会很乐意给你的片段配乐。如果你要在后期加授权音乐——大多数品牌项目都是——就在提示词结尾写 非叙事性音乐:N/A,保持音轨干净。

4. 音频参考只能搭车,不能单飞。 你可以上传一条音轨(≤15MB)来定节奏或声音气质,但它必须搭配图片或视频参考——音频不能是唯一输入。

三条即拷即用的提示词

1. 画内对白带口型(16:9)

该案例的参考文件

人物参考
人物参考
场景参考
场景参考

同一写法的官方手册案例

深夜温馨的小餐馆,暖色钨丝灯光,窗上有细雨。一位三十多岁的女人坐在吧台前,双手捧着咖啡杯。她抬头看向镜头说:“你每次都点一样的。”说完后她微微一笑。安静的餐馆环境声——雨声、远处的收音机、餐具轻响。非叙事性音乐:N/A。

*为什么有效:*一位说话人、一句写出的台词、一个反应节拍。环境声清单搭好了声音舞台,又不与对白抢戏。

2. 旁白式产品时刻(9:16)

该案例的参考文件

音色样本

同一写法的官方手册案例

竖屏视频。木质台面上的一套手冲咖啡器具,清晨光线。热水从手冲壶螺旋注入滤杯;蒸汽升起;镜头缓慢推近。平静的男声说:“三十克。三分钟。没有捷径。”注水声与轻柔的蒸汽声。非叙事性音乐:N/A。

*为什么有效:*画外旁白意味着完全没有口型翻车的风险,而物理声音(注水、蒸汽)干的正是配乐通常用来伪装的氛围活。

3. 参考驱动的表演(三段视频进,一首歌出)

该案例的参考文件

运镜参考(希区柯克变焦)
主体素材
歌曲与表演参考

本提示词改编自的官方手册案例

参考视频1的希区柯克镜头运动,让视频2中的人物唱歌,歌声和唱歌表演参考视频3。

*为什么有效:*三个参考、三种分工——运镜、主体、歌曲——而音频是作为一场表演生成的,不是作为一条音轨盖上去的。这是手册自己的演示:声音指导也不过是另一种参考分工。

上手试试

MiniMax H3 已上线 Pixo 的 Playground:选择视频 → MiniMax H3,把想让角色说的台词写进提示词,生成一条 4–15 秒、768p 或 2K 的镜头——声音齐备,导出无水印。想看模型全貌,从 MiniMax H3 是什么开始;想知道它的音频栈与同日发布的另一个旗舰怎么比,见 MiniMax H3 vs Seedance 2.5

常见问题

AI 视频生成器能生成声音吗?

有的能,大多数不能。MiniMax H3、Seedance、Veo 3.1 和 Wan 2.6 原生生成音频;Kling 3.0 输出无声视频。H3 走得最远:每条输出都自带双声道音频——对白、环境声和音效——与画面同一次生成,不是事后叠上去的。

MiniMax H3 的对白有口型同步吗?

有。把台词原文写进提示词,H3 会随画面一起生成人声,角色的口型与台词匹配。它的文本转语音覆盖多种语言,对白不限于英语。

怎么做一条带旁白的 AI 视频?

在提示词里逐字写出旁白文本——例如:平静的男声说:“好工具会消失在工作里。”H3 会随视频一起生成这段语音。说话人在画面里就有口型同步;在画外就是旁白。

背景音乐能关掉吗?

能——在提示词结尾写『非叙事性音乐:N/A』,H3 就会保持音轨干净:只有对白、环境声和音效。打算在后期加授权品牌音乐时,就用这个模式。

我能用自己的音频当参考吗?

能。上传一条音轨(最大 15MB),搭配图片或视频参考——音频不能是唯一输入——用它来定节奏或声音气质。H3 还支持从参考音轨克隆音色。

怎么试用?

MiniMax H3 已上线 Pixo 的 Playground——生成 4–15 秒、768p 或 2K 的镜头。新用户注册即得 200 免费积分,套餐折扣目前最高达 55%。


MiniMax H3 现已上线 Pixo 的 Playground——生成 4–15 秒、768p 或 2K 的镜头,支持图片、视频和音频参考。立即注册——新用户注册即得 200 免费积分,套餐折扣目前最高达 55%。要把产品搬上画面?见用 H3 做电商产品视频

准备好颠覆你的创作流了吗?

加入成千上万Pixo创作者行列,将故事变化为视觉现实

立即注册

无需信用卡 • 免费 200 积分