自带声音的 AI 视频生成器:MiniMax H3 原生音频
大多数 AI 视频生成器是无声的。MiniMax H3 把对白、环境声和音效与画面一起生成——双声道、带口型。它在 Pixo 上的用法。

每条 AI 视频工作流都会撞上这样一个时刻:片段看起来很棒,但它完全是无声的。于是你去找配乐、找 TTS 工具做旁白、再找点音效——然后你发现真正难的部分:录在视频之上的声音永远不真正属于它。房间底噪不对、嘴不动、脚步声落不到地上。声音设计变成了第二场制作。
这正是 MiniMax 的 H3 在 7 月 31 日发布时补上的缺口:它不是给视频加音频,而是把两者一起生成。我们运营着 Pixo,一个多模型视频平台,H3 已上线其中的 Playground——在 H3 的整张规格表里,这是最能改变日常工作的能力,所以下面精确讲清它的行为方式和提示词写法。
『原生音频』究竟是什么意思
每条 H3 输出都自带与画面同一次生成的立体声。一条提示词产出三层声音:
- 对白。 台词逐字写出,角色就会把它说出来——带口型同步,因为嘴部运动和音频来自同一次生成。改写台词,表演也会跟着变。
- 环境声。 场景听起来就像那个场景:湿地上的风、厨房的嗡鸣、玻璃后的车流。与其说是你请求它,不如说是你没能排除它。
- 音效。 接触音落在物理发生的地方——盖子打开时有咔哒声,鸟起飞时有振翅声。
这与配音的差别并不微妙。后期叠加的音频是关于视频的;生成的音频是属于视频的。角色说到一半转身时,声音会跟着一起转。
谁有声音,谁没有
音频已经悄悄成为模型代际的分界线:
| 模型 | 原生音频 |
|---|---|
| MiniMax H3 | ✅ 所有输出双声道——对白、环境声、音效 |
| Seedance 2.5 | ✅ 有 |
| Veo 3.1 | ✅ 有 |
| Wan 2.6 | ✅ 有——同步的对白与音效 |
| Kling 3.0 | ❌ 无声输出 |
H3 在『有音频』之上多出的是声音这一整套:覆盖多种语言的文本转语音,以及从参考音轨克隆音色——上传一把声音,对白就以那个音色生成。(这项能力值得单独深挖;这里只讲日常用法。)
给声音写提示词的四条规则
1. 对白必须写出原文。 H3 不会即兴编词。疲惫的声音说:“我们五分钟后开门。”生成的就是这句话——别的没有。模糊的要求(『她说了句安慰的话』)产出模糊的结果。
2. 决定谁在画面里。 可见的说话人有口型同步;画外的声音就是旁白。两者都只是一行提示词——区别在于你把不把说话人放进画框。
3. 不想要音乐就明确禁掉。 H3 会很乐意给你的片段配乐。如果你要在后期加授权音乐——大多数品牌项目都是——就在提示词结尾写 非叙事性音乐:N/A,保持音轨干净。
4. 音频参考只能搭车,不能单飞。 你可以上传一条音轨(≤15MB)来定节奏或声音气质,但它必须搭配图片或视频参考——音频不能是唯一输入。
三条即拷即用的提示词
1. 画内对白带口型(16:9)
该案例的参考文件


同一写法的官方手册案例
深夜温馨的小餐馆,暖色钨丝灯光,窗上有细雨。一位三十多岁的女人坐在吧台前,双手捧着咖啡杯。她抬头看向镜头说:“你每次都点一样的。”说完后她微微一笑。安静的餐馆环境声——雨声、远处的收音机、餐具轻响。非叙事性音乐:N/A。
*为什么有效:*一位说话人、一句写出的台词、一个反应节拍。环境声清单搭好了声音舞台,又不与对白抢戏。
2. 旁白式产品时刻(9:16)
该案例的参考文件
同一写法的官方手册案例
竖屏视频。木质台面上的一套手冲咖啡器具,清晨光线。热水从手冲壶螺旋注入滤杯;蒸汽升起;镜头缓慢推近。平静的男声说:“三十克。三分钟。没有捷径。”注水声与轻柔的蒸汽声。非叙事性音乐:N/A。
*为什么有效:*画外旁白意味着完全没有口型翻车的风险,而物理声音(注水、蒸汽)干的正是配乐通常用来伪装的氛围活。
3. 参考驱动的表演(三段视频进,一首歌出)
该案例的参考文件
本提示词改编自的官方手册案例
参考视频1的希区柯克镜头运动,让视频2中的人物唱歌,歌声和唱歌表演参考视频3。
*为什么有效:*三个参考、三种分工——运镜、主体、歌曲——而音频是作为一场表演生成的,不是作为一条音轨盖上去的。这是手册自己的演示:声音指导也不过是另一种参考分工。
上手试试
MiniMax H3 已上线 Pixo 的 Playground:选择视频 → MiniMax H3,把想让角色说的台词写进提示词,生成一条 4–15 秒、768p 或 2K 的镜头——声音齐备,导出无水印。想看模型全貌,从 MiniMax H3 是什么开始;想知道它的音频栈与同日发布的另一个旗舰怎么比,见 MiniMax H3 vs Seedance 2.5。
常见问题
AI 视频生成器能生成声音吗?
有的能,大多数不能。MiniMax H3、Seedance、Veo 3.1 和 Wan 2.6 原生生成音频;Kling 3.0 输出无声视频。H3 走得最远:每条输出都自带双声道音频——对白、环境声和音效——与画面同一次生成,不是事后叠上去的。
MiniMax H3 的对白有口型同步吗?
有。把台词原文写进提示词,H3 会随画面一起生成人声,角色的口型与台词匹配。它的文本转语音覆盖多种语言,对白不限于英语。
怎么做一条带旁白的 AI 视频?
在提示词里逐字写出旁白文本——例如:平静的男声说:“好工具会消失在工作里。”H3 会随视频一起生成这段语音。说话人在画面里就有口型同步;在画外就是旁白。
背景音乐能关掉吗?
能——在提示词结尾写『非叙事性音乐:N/A』,H3 就会保持音轨干净:只有对白、环境声和音效。打算在后期加授权品牌音乐时,就用这个模式。
我能用自己的音频当参考吗?
能。上传一条音轨(最大 15MB),搭配图片或视频参考——音频不能是唯一输入——用它来定节奏或声音气质。H3 还支持从参考音轨克隆音色。
怎么试用?
MiniMax H3 已上线 Pixo 的 Playground——生成 4–15 秒、768p 或 2K 的镜头。新用户注册即得 200 免费积分,套餐折扣目前最高达 55%。
MiniMax H3 现已上线 Pixo 的 Playground——生成 4–15 秒、768p 或 2K 的镜头,支持图片、视频和音频参考。立即注册——新用户注册即得 200 免费积分,套餐折扣目前最高达 55%。要把产品搬上画面?见用 H3 做电商产品视频。


