MiniMax H3 提示词指南:官方公式与三种模式
怎样写出真正管用的 MiniMax H3 提示词:官方的三段式公式、@文件引用法、三种生成模式,以及必须避开的六个错误。

关于 MiniMax H3 该怎么写提示词,目前流传的内容大多是猜的——这个模型才发布一周出头。这篇指南不是猜的。MiniMax 在 7 月 31 日发布 H3 的同时公布了一份详尽的使用手册,里面藏着一样稀罕东西:一条明确的、工程师写的提示词公式、一套文件引用角色的分类法,以及一份坦率列出的、最常毁掉生成结果的错误清单。这些内容此前几乎没有以英文形式流传出来。
我们做的是 Pixo,一个多模型 AI 视频平台,模型手册发布当天就读完是我们的日常——我们的 agent 必须为每一个接入的模型写出生产级提示词。下面就是 H3 的这套提示词体系,为一线创作者做了翻译和重新组织,并与 MiniMax 官方视频生成文档做了交叉核对。(还不了解这个模型?先看我们的 H3 首发解读。)
官方公式
直接来自手册:
完整提示词 = 参考素材说明 + 核心创意 + 分段过程描述
三个板块,就按这个顺序。没上传任何文件就跳过第一块。绝大多数失败的 H3 提示词,恰恰是砸在其中某一块上——通常是把所有内容糊成一整段不分层的文字,而这正是手册列在第一位的错误。
板块一:参考素材说明
你上传的每个文件都会按上传顺序拿到一个编号,在正文里以 @image1、@video2、@audio3 的形式就地引用。而每个文件都需要一个被声明的角色。这套角色分类法值得背下来,因为它实际上就是 H3 用自然语言写成的 API:
- 角色参考 —— 锁定一张脸或一个形象
- 物体参考 —— 锁定一件产品或道具
- 场景参考 —— 锁定一个地点
- 关键帧 —— 锁定一帧(要明说它是首帧还是尾帧)
- 声音参考 —— 锁定一种音色
- 分镜稿 —— 按故事板画面生成镜头
- 风格参考 —— 匹配某张图的观感
- 构图参考 —— 匹配取景与版面
- 音频复用 —— 把这条音轨直接(或部分)用作视频的声音
- 动作参考 —— 从一段视频里锁定一个动作
- 运镜参考 —— 锁定一段镜头运动
- 视频编辑 —— 待修改的那段视频
手册给的例子:"@image1 是角色参考(锁定这位女性的脸),@video1 是动作参考(使用其中的剑舞动作),@audio1 是氛围参考(古琴古典配乐)。让这位女性在樱花庭院中表演视频里的这段剑舞。"
别忘了模型卡里那条硬上限:合计 12 个文件——最多 9 张图像、3 段视频和 3 条音轨,其中视频和音频各自的总时长上限均为 15 秒。
板块二:核心创意
手册明确点名了四个要素:主体(谁或什么)、地点(在哪)、事件(做什么)和类型/风格(实拍、动画、电影感、商业广告、纪录片——或者赛博朋克、霓虹这类具名美学)。此外还可以选填镜头行为:H3 默认会在镜头之间切换,所以你若想要一镜到底,就得说出来。在运镜上手册格外具体——要写*"左移轨道 + 右摇"*这样的具体动作,而不是"环绕这个场景"这类含糊要求。至于切换,你可以指定风格:硬切、淡入淡出、卡点切、快速蒙太奇。
板块三:分段过程描述
按时间顺序、一段一段描述发生了什么——"0–3s:……,3–7s:……"——并在有关联的地方用 @ 引用把元素和文件挂上钩。对白也写在这里,规则不容商量:把台词原句写出来。"她说了句动人的话"只会产出一团糊;而*"她说:'你来了。这把剑等得够久了。'"*会真的产出这句话,并配好唇形。
能救回一次生成的几条规则
手册里四条不起眼的小规则,实际分量远超篇幅:
写镜头看得见的东西,别写它的含义。 H3 奖励具体、可视、直白的描述,一遇隐喻就翻车。"雨水打湿的霓虹在她皮夹克上反光"永远胜过"一种都市忧郁的氛围"。
画面内的文字必须原样加引号写出。 想让文字出现在画面里,就把它写出来:"手机屏幕上显示标题'AI 视频创作',下方按钮写着'立即开始'。"
明确掐掉不想要的音乐。 不要背景音乐?就在提示词末尾写上 non_diegetic_music: N/A。而且千万别自相矛盾——一行里要配乐、另一行里又禁背景音乐,是手册明列的失败模式。
切镜头时要指明景别。 指定切换时,说清新镜头的景别,以及它拍的是此前已确立的哪个主体——这正是让脸在切换之间保持一致的关键。
三种模式各自怎么写
参考模式(最多 9 张图像 + 3 段视频 + 3 条音频):整套公式全部适用——参考说明这一块是必填的,没标注的文件就是浪费掉的文件。
图生视频/首尾帧:上传一张图并说明它是开头还是结尾帧;上传两张,H3 就会补出两者之间的运动、光线和声音。关键在于,这个模式下它不会自作主张地加入切换——手册的例子是:"@image1 是首帧:樱花树下一位手持长剑的女性。让她从起手式一路完成整套剑舞,动作自然流畅,不要切镜头。"
纯文生视频:不带文件,上限相当宽裕——手册给出的提示词长度上限是 7000 字符。而可用结果的下限是:主体外貌 + 场景细节 + 动作 + 风格。比这更短的提示词是一种有据可查的失败模式,而不是什么风格选择。
可直接复制的起手模板
三条基于官方公式搭好的提示词(可自由改写):
[References] @image1 is the character reference (lock her face). @image2 is the scene reference.
[Core idea] A woman in a rain-soaked neon alley in Tokyo at night; cinematic live-action; one continuous take, slow push-in.
[Process] 0–4s: she walks toward camera, rain on her jacket, distant traffic hum. 4–8s: she stops, looks up; she says: "It was never about the money." Ambient rain continues. non_diegetic_music: N/A[References] @image1 is the object reference (lock the perfume bottle, label included). @audio1 is the audio reuse track.
[Core idea] Luxury product film, 21:9, studio-to-sunset lighting shift; beat-synced cuts.
[Process] 0–3s: bottle rises from black marble, side light. 3–6s: cut on beat to golden-hour terrace, bottle identical. 6–8s: macro on the label, on-screen text reads "NOCTURNE".[Edit instruction, against an existing video] Replace the cat in the video with a golden retriever. Keep the camera move, lighting and background unchanged.手册点名的六个错误
| 错误 | 修法 |
|---|---|
| 糊成一整段不分层的文字 | 拆成公式的三个板块 |
| 上传了文件却没交代角色 | 为每个文件补上"@image1 是某某参考" |
| 既要配乐又禁背景音乐 | 删掉其中一条——或者把它们限定在不同段落 |
| 想要一镜到底却写了"镜头 1/镜头 2" | 保持一整段连贯叙述,不要分镜结构 |
| 想要面部一致却没给参考图 | 上传一张,并标注为"角色参考(锁脸)" |
| 提示词太短又没有文件 | 至少覆盖主体外貌 + 场景 + 动作 + 风格 |
一条诚实的捷径
手册最后的建议——把提示词写作交给一个专业的搭档——正是 MiniMax 自己对我们在每个前沿模型上都看到的那个趋势的承认:提示词已经悄然变成了规格书,带着参考清单、时间块和格式规则。懂这套公式,是可用输出和一团糊之间的分界线;但要为一支多场景视频的每个镜头都写出规格级提示词,是实打实的工作量。
这正是我们打造 Pixo agent 的目的:描述你想要的视频,agent 会写出剧本、分镜,以及用每个模型母语方言写成的逐镜头提示词——上面这套公式也包含在内。不同模型想听不同的方言,而这正是我们做 H3 与 Seedance 2.5 对比的意义所在。MiniMax H3 即将进入 Pixo 的分镜,与 Seedance、Kling 和 Veo 并列。立即注册——新用户注册即得 200 免费额度——等 H3 一上线,你就能马上让它开工。
常见问题
MiniMax H3 的官方提示词公式是什么?
MiniMax 的使用手册把它定义为:完整提示词 = 参考素材说明 + 核心创意 + 分段过程描述。先声明每个上传文件是干什么用的,再交代主体、地点、事件和风格,最后按时间顺序描述动作——需要的话可以带时间戳。
在 MiniMax H3 的提示词里怎么引用上传的文件?
按上传顺序编号,并在正文里就地引用——@image1、@video2、@audio3。每个文件都要有一个明确声明的角色:锁脸、锁物体、场景参考、动作参考、声音参考、节奏音轨等等。没写清楚用途的文件,是参考被无视的头号原因。
怎样阻止 MiniMax H3 自作主张加背景音乐?
在提示词末尾明确写出来:"non_diegetic_music: N/A"(或等价的自然语言表述)。没写下来的否定诉求往往会被忽略——另外,千万不要一行里要配乐、另一行里又禁背景音乐。
怎样让 MiniMax H3 里角色的脸保持一致?
上传一张角色参考图,并明确标注它是用来锁脸的——例如"@image1 是角色参考(锁定这位女性的脸)"。想要面部一致却不上传带标注的参考图,正是手册列出的常见错误之一。
MiniMax H3 的三种生成模式是什么?
参考生视频(最多 12 个文件——9 张图像、3 段视频、3 条音频,每个都要声明角色)、用一到两张关键帧的图生视频(H3 补出中间的运动,且不会自作主张地加切换),以及纯文生视频。
本指南翻译并重新组织了 MiniMax 自家的 H3 使用手册,并于 2026 年 8 月 5 日与官方视频生成文档及已公开的模型卡做了交叉核对。文中的提示词范式正是我们的 agent 在生产环境中使用的;模型行为会随版本更新而变化,因此请把任何单个示例当作起点,而不是保证。


