MiniMax H3 提示词指南:官方公式与三种模式
写出真正有效的 MiniMax H3 提示词:官方三段式公式、@文件引用、三种生成模式,以及最容易毁掉输出的六个坑。

关于 MiniMax H3 提示词的大部分文章都是猜的——这个模型才发布一周多。这篇指南不靠猜。MiniMax 在 7 月 31 日 H3 发布的同时公开了一份详尽的官方使用手册,里面藏着一份少见的东西:由工程师写下的明确提示词公式、一套文件参考用途的分类法,以及一份直白的『最常毁掉生成结果的错误』清单。这些内容到目前为止极少出现在英文世界。
我们开发的 Pixo 是一个多模型 AI 视频平台,模型手册发布当天逐行读完是我们的本职——我们的 Agent 要为平台上运行的每个模型写出生产级提示词。下面是为职业创作者整理好的 H3 提示词体系。(还不了解模型本身?先看我们的 H3 首发解读。)
官方公式
手册原文:
完整提示词 = 参考素材说明 + 核心创意 + 画面过程说明
三个板块,按这个顺序写。没上传任何素材时跳过第一块。大多数失败的 H3 提示词恰恰是坏在其中某一块——最常见的是把所有东西糊成一段无结构的话,这正是手册列出的第一号错误。
板块一:参考素材说明
你上传的每个文件都会按上传顺序获得编号,在文中以 @图片1、@视频2、@音频3 引用。而且每个文件都需要一个明确声明的用途。手册的用途分类值得背下来,因为它实际上就是 H3 用自然语言表达的 API 界面:
- 人物参考 —— 锁定脸或形象
- 物体参考 —— 锁定产品或道具
- 场景参考 —— 锁定场景
- 关键帧 —— 锁定帧(明确说是首帧还是尾帧)
- 音色参考 —— 锁定音色
- 故事版 —— 根据故事版分镜生成镜头内容
- 风格参考 —— 匹配图片的风格
- 构图参考 —— 匹配取景与排布
- 音频复用 —— 生成视频的音频直接复用参考音轨(或部分复用)
- 动作参考 —— 锁定视频中的动作
- 运镜参考 —— 锁定运镜
- 视频编辑 —— 要被修改的那段视频
手册的示例:『@图片1 是人物参考(锁这位女子的脸),@视频1 是动作参考(用里面的舞剑动作),@音频1 是情绪参考(古风配乐)。让这位女子在樱花庭院里按视频里的动作舞剑。』
板块二:核心创意
手册明确点名了四个要素:主体(谁或什么)、地点(在哪里)、事件(在做什么)、题材/风格(写实、动画、电影感、广告片、纪录片——或者赛博朋克、霓虹灯美学之类的具名风格)。此外还可以写镜头行为:H3 默认会切镜,想要一镜到底就必须明说。关于运镜,手册给得异常具体——写清楚 『truck left + pan right』 这样的具体动作,而不是笼统地说『环绕运镜』。切镜也可以指定风格:普通切镜(cut)、叠化切镜(fade)、随节奏卡点切镜、快切。
板块三:画面过程说明
按时间轴分段描述发生了什么——『0–3 秒:……,3–7 秒:……』——凡是与素材相关的元素都用 @ 引用挂上。台词也写在这里,规则是绝对的:写出台词原文。『她说了句动人的话』只会生成一团糊;*『她说:「你来了,剑等你好久了。」』*才会生成这句台词,并配上口型。
能救回一次生成的几条规则
手册里还有四条小规则,作用远超篇幅:
写镜头看得见的,不写它意味着什么。 H3 奖励具体、可视、直接的描述,栽在比喻上。『雨水打湿的霓虹倒映在她的皮夹克上』永远胜过『一种都市忧郁的氛围』。
画面内文字必须逐字写出。 想让画面里出现文字,就把原文写出来:『手机屏幕上显示标题:「AI Video Creation」,按钮文字为:「Start Now」。』
明确禁掉不想要的音乐。 不要 BGM?在提示词末尾写 non_diegetic_music: N/A。而且永远别自相矛盾——一句话要配乐、另一句话禁 BGM,是手册列出的失败模式。
切镜时点名镜头。 指定切镜时,写清切到什么景别、画面里是之前哪个角色——这正是跨切镜保持脸部一致的关键。
三种模式各自怎么写
全能参考模式(最多 9 张图片 + 3 段视频 + 3 段音频):完整公式全部适用——参考素材说明这一块是必填项,没标用途的文件就是浪费掉的文件。
首/尾帧模式:上传一张图并说明它是开头画面还是结尾画面;上传两张,H3 会补全两者之间的运动、光影和声音。关键在于,这个模式下它不会自作主张加切镜——手册的示例:『@图片1 是首帧参考图:女子持剑站在樱花树下。让她从持剑起势到舞剑完毕,自然衔接,不要切镜。』
纯文生视频:不传任何文件,提示词最多 7,000 字符。手册给出的可用结果底线是:主体外观 + 场景细节 + 动作 + 风格。比这更短的提示词是记录在案的失败模式,不是一种风格选择。
可直接复制的起手模板
三条基于官方公式的提示词(可自由改编):
该案例的参考文件

【参考素材说明】@图片1 中人物的动作、表情与表演节奏,严格参考 @视频1。
【画面过程说明】男生站在画面中右侧的水槽前,把洗好的盘子递给画面左侧的女生;随后转身,突然用右手向画面左侧边缘的女生甩出洗洁精泡沫。女生受惊后立刻反击,两人开始开心地互相泼洒泡沫、闪躲,伴随着大笑。该案例的参考文件
【对两段已有视频的编辑指示】将 @视频1 的绿幕背景去除,替换为类似 @视频2 的童话感背景。背景元素需要完全匹配 @视频1 中人物的动作。调整人物的光线,使之与新背景完全匹配。该案例的参考文件
【编辑指令,针对已有视频】把视频中的猫换成一只金毛犬。保持运镜、光线和背景不变。
公式实战:四个拆解案例
以下每一条都改编自官方手册案例,各自只放大公式的某一部分。(完整素材库见 20 条 MiniMax H3 提示词。)
纯文字——【核心创意】和【画面过程】扛起一切。 没有任何参考,美术方向依然稳,因为每条视觉规则都被写成了约束:
15 秒,16:9 横屏,完整模仿高级感品牌新品发布视频的视觉语言:纯黑背景、棚拍级灯光、超慢速旋转特写、极简巨型无衬线标题、空灵电子配乐。产品是——一只完美烤制的北京烤鸭。
字体必须极简、留白充足、统一使用纤细无衬线字体;中文不能有错别字。禁止:卡通风格、杂乱背景、水印。参考素材说明的极限拉满——三张图,三个明确分工。 提示词自始至终没描述模特的脸和眼镜;身份交给参考图,文字只负责态度:
该案例的参考文件



生成一支竖屏 9:16 高级时尚眼镜广告片。画面是极简白棚,无缝白色背景,强烈的高定广告感,干净、简约、帅气、先锋、国际一线时装大片质感。主视觉人物参考图片1,两位全身女模特,保持她们的服装高级感、身体姿态、白棚光影、时装秀场气质和整体冷峻态度。两人都佩戴未来感高级眼镜,眼镜设计参考图3,强调包覆式弧面、锐利几何猫眼/护目镜混合轮廓、镜面反射、流线型镜腿、高级时尚配饰质感。两个人物的外貌细节参考图2。逐镜头的【画面过程】加文字包装。 切镜、标题卡和逐镜头声音全部按镜头顺序写出——正是手册科幻案例里的预告片语法:
该案例的参考文件


写实电影感,高反差光影,节奏紧凑。图1作为整体氛围、风格参考。图2作为主角人物参考。
Shot 1 — 超广角建立镜头。巨大圆形宇宙门几乎占满画面,人物只是门前一个很小的背影,站在画面下方偏右。地面潮湿反光,门中心一片黑暗。镜头慢慢向前推进。大标题从黑暗边缘渐入,先模糊后清晰:“THE STARS WERE LISTENING” 字体极窄、厚重、全大写,暗红混合铁锈红,带轻微颗粒和雾化边缘。
Audio: 深低频脉冲,远处金属轻震,文字清晰时一记轻 hit。 → Hard cut.三个参考,三种模态。 运镜取自一段视频,主体取自另一段,歌声和表演来自第三段——公式的参考素材说明推广到了声音:
该案例的参考文件
参考视频1的希区柯克镜头运动,让视频2中的人物唱歌,歌声和唱歌表演参考视频3。手册点名的六个错误
| 错误 | 修法 |
|---|---|
| 糊成一段无结构的话 | 按公式拆成三个板块 |
| 上传了素材却没写用途 | 给每个文件补一句『@图片1 是 XX 参考』 |
| 一边要配乐一边禁 BGM | 删掉其中一个——或者分场景各说各的 |
| 想要一镜到底却写了『镜头 1 / 镜头 2』 | 全文保持一段连续情节描述,删掉分镜结构 |
| 想要脸部一致却没传参考图 | 上传一张,并标注『人物参考(锁脸)』 |
| 没传文件时提示词太短 | 至少覆盖主体外观 + 场景 + 动作 + 风格 |
一条诚实的捷径
手册结尾的建议——『把写提示词的任务交给专业的合作伙伴』——是 MiniMax 亲口承认了我们在每个前沿模型上都看到的趋势:提示词已经悄悄变成了规格书,带素材清单、时间轴板块和排版规则。懂公式决定了你的输出是能用还是一团糊,但为一条多场景视频的每个镜头写出规格级提示词,是实打实的工作量。
这正是我们为 Pixo 的 Agent 设计的工作:描述你想要的视频,Agent 会写好脚本、分镜和逐镜头提示词——用每个模型自己的方言,包括上面这套公式。MiniMax H3 今天已上线 Pixo 的 Playground——粘贴这些提示词,加上你的参考素材(文件会按上传顺序编号为图片1、视频1……),生成 4–15 秒、768p 或 2K 的镜头。立即注册——新用户注册即得 200 免费积分,套餐折扣目前最高达 55%。
常见问题
MiniMax H3 的官方提示词公式是什么?
MiniMax 官方手册的定义是:完整提示词 = 参考素材说明 + 核心创意 + 画面过程说明。先声明每个上传文件的用途,再写清主体、地点、事件和风格,最后按时间轴描述动作——需要的话加上时间戳。
在 MiniMax H3 提示词里怎么引用上传的文件?
按上传顺序编号并在文中引用——@图片1、@视频2、@音频3。每个文件都要声明用途:锁脸、锁物体、场景参考、动作参考、音色参考、节奏音轨等等。上传了素材却不写用途,是参考被忽略的头号原因。
怎么让 MiniMax H3 不要加背景音乐?
在提示词末尾明确写出:『non_diegetic_music: N/A』(或等义的自然语言)。没写下来的否定性要求往往会被忽略——也永远不要一句话要配乐、另一句话又禁 BGM。
怎么在 MiniMax H3 里保持角色的脸一致?
上传一张人物参考图,并明确标注为锁脸——例如『@图片1 是人物参考(锁这位女子的脸)』。想要面部一致却不上传带标注的参考图,是手册明确列出的常见错误之一。
MiniMax H3 的三种生成模式是什么?
全能参考(最多 12 个文件——9 张图片、3 段视频、3 段音频,每个都声明用途)、首/尾帧(一到两张图片;H3 补全中间的运动,且不会自作主张加切镜)、以及纯文生视频(提示词最多 7,000 字符)。
MiniMax H3 的提示词能写多长?
最多 7,000 字符,H3 支持的任何语言都可以。提示词太短是官方记录在案的失败模式:没有参考文件时,至少要覆盖主体外观、场景细节、动作和风格。


