Skip to content
MiniMax H3·Hailuo 3.0·AI 视频生成器·AI 视频模型·

MiniMax H3 是什么?规格、模式与首发实测(2026)

MiniMax H3(Hailuo 3.0)详解:15 秒视频、原生立体声、12 个多模态输入文件、指令式编辑,以及开放权重背后的地域限制。

Pixo 团队·15 min read
MiniMax H3 是什么?规格、模式与首发实测(2026)

2026 年 7 月 31 日,MiniMax 发布了 Hailuo 系列中最有野心的一款模型——顺带悄悄改写了"视频模型"这个词的含义。MiniMax H3(社区已经叫它 Hailuo 3.0)不只是把提示词变成片段。它把文本、图像、视频音频当作同一份统一上下文来读,生成自带立体声的 15 秒场景——然后允许你用一句自然语言指令去编辑结果,而不是重新掷一次骰子。

我们做的是 Pixo,一个多模型 AI 视频平台。这意味着每当有前沿模型发布,我们都会做两件事:逐行读官方文档,以及把它和我们已经在跑的模型放在一起实测。这篇首发解读基于 MiniMax 官方视频生成文档H3 模型卡——包括不少还没进入英文报道的细节,比如精确的输入上限、三种生成模式,以及那条决定你到底能不能跑这个模型的许可限制。

下面讲清楚 H3 是什么、哪些是真正的新东西,以及如果你靠做视频吃饭,这一切意味着什么。

MiniMax H3 关键规格一览

规格MiniMax H3
发布2026 年 7 月 31 日(权重于 8 月 3 日跟进)
架构33B 参数稠密单流全模态 transformer
输出时长4–15 秒,24 fps
分辨率默认 768p;最高 2K
画幅比例21:9、16:9、4:3、1:1、3:4、9:16
音频32 kHz 原生立体声——对白、环境声、音效同一遍产出
多模态输入合计最多 12 个文件:≤9 张图像 + ≤3 段视频 + ≤3 条音轨
编辑针对已有素材的指令式编辑
语言11 种语言的语音
使用方式Hailuo AI 应用、MiniMax API(模型 ID MiniMax-H3)、开放权重

核心思路:一份上下文,容纳所有模态

大多数 AI 视频工具都是一串专用模型拼成的流水线:一个做文生视频,一个做唇形同步,一个做超分,再来点别的做声音。MiniMax 对 H3 的主张,是把这条流水线压缩成一个"全模态"系统——从架构上说,是一个 33B 参数的稠密 transformer,在单一数据流里读取每一种模态,而不是往视频主干上外挂各类编码器。落到实处,它不再把图像、视频和声音的生成当成彼此独立的任务,而是把你的全部素材——一段脚本、一张脸部参考、一段动作片段、一条音乐——读成同一份创作简报,再由此产出一个成品级的视听场景。

具体来说,你可以在一次提示词里交给 H3 最多 12 个文件:最多 9 张图像、3 段视频(合计 15 秒)、3 条音轨。每个参考都要声明自己的角色——这张图锁定角色的脸,这段视频是动作参考,这条音轨定节奏。模型是在融合它们,而不是把它们拼贴起来。如果你曾经试过在保持角色一致的同时,还要匹配一段动作参考并且卡准节拍,还要横跨好几个工具,你就明白这件事的分量。

声音不是补丁

每一次 H3 生成都自带 32 kHz 原生立体声——带唇形同步的对白、房间声、音效——与画面在同一遍里产出。真正做到原生音频的模型本就不多,而 H3 在语言这一侧走得更远:语音覆盖 11 种语言——阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。它还能从参考音轨里克隆并迁移音色,这让"把这条广告本地化到三个市场"从一个制作项目变成了一条提示词。

编辑才是头号卖点

下面这一点,把 H3 和我们跟踪的几乎所有片段生成器区分开来:它接受针对已有素材的编辑指令。MiniMax 自己给的例子朴素得可爱——"把视频里的猫换成狗"——然后一路升级到:换掉便利店的发光招牌、把一罐汽水换成某个品牌的可乐,并且改写结尾那句对白,全都在一条指令里完成,而镜头里的其他一切原地不动。你可以更换背景、重新布光,可以替换一句台词并让表演随之微调,也可以把角色的声音迁移到一个克隆音色上。

对于一线创作者来说,这直击 AI 视频里最烧钱的习惯:重抽。当一个镜头已经对了 90%,你要的不是一个新镜头——你要的是剩下那 10%。

三种生成模式

文档定义了驱动 H3 的三条不同路径,而你身处哪一种,会改变你该怎么写提示词(我们已经基于官方公式写了一份完整的 MiniMax H3 提示词指南):

1. 参考模式。 就是上文说的完整 12 文件多模态输入。你为每个素材标注角色——锁脸、动作参考、节奏音轨——然后描述场景。

2. 图生视频/首尾帧模式。 给它一张或两张图。给两张时,H3 会把它们当作首帧和尾帧,补出中间的运动、光线和声音——值得注意的是,这个模式下它不会自作主张地加入分镜切换。画幅比例跟随你的输入图。

3. 纯文生视频。 完全没有参考;模型从你的描述里搭出主体、场景和动作。H3 奖励具体、可视、懂镜头语言的写法,而不是含糊的氛围词。

开放权重——但附带地域限制

这是大多数报道跳过的细节,也是决定 H3 对你是否可用的那一条。

8 月 3 日,MiniMax 把 H3 的权重发布到了 Hugging Face——一次货真价实的前沿视频模型开放,与 ByteDance 让 Seedance 保持闭源正好相反。但它落地时采用的是 MiniMax H3 社区许可协议,而非 Apache 或 MIT,而协议原文把"适用地域"定义为全球范围,但不含欧盟、英国、大韩民国和美利坚合众国

直白地说:如果你在美国、欧盟、英国或韩国,这份社区许可并不授予你在本地运行这些权重的权利。在其他地区,年收入超过 2000 万美元的商业使用同样需要单独的书面授权,并且要在产品中显著标注"MiniMax H3"。

对我们的大多数读者而言,这意味着托管 API——或者一个已获授权的平台——才是现实路径,而不是本地部署。这是一条不寻常的限制,值得在你为一个可能没权限运行的模型预留 GPU 预算之前先弄清楚。

H3 在当前模型格局中的位置

诚实的答案是:H3 并没有在每一条轴上碾压对手,而且它挑了个非常拥挤的日子发布。Kling 3.0 和 Veo 3.1 在原始分辨率上依然更高。而在 7 月 31 日——正是 H3 发布的同一天——ByteDance 在 Dreamina 上全球发布了 Seedance 2.5,把连续生成推到 30 秒单镜头、长视频模式可达三分钟,并加入了自己的时间戳编辑模式。"先生成、再编辑"这套思路显然已经不是 H3 独有了;我们在 MiniMax H3 与 Seedance 2.5 对比里详细比过这两款旗舰。

H3 至今仍然独占的,是编辑能力里声音与语言的那一半:改写一句对白并让表演随之调整、从参考音轨克隆声音,以及在生成画面的同一套系统里覆盖 11 种语言的语音。如果你的工作牵涉品牌、对白或多个市场——而不是一次性的奇观镜头——这套组合比多一档分辨率值钱得多。

不过,一个模型仍然拼不出一部片子。当一个 15 秒的生成器嵌进分镜、和其他模型并排站好时,它才真正好用——物理感强的动作节拍交给 Seedance,之后大概率要返工的对白戏交给 H3。这种逐镜头、多模型的工作流,正是我们围绕 Pixo 的 agent 打造的东西,也是我们正准备把 H3 引入 Pixo 分镜、与 Seedance 2.0、Kling 3.0 和 Veo 3.1 并列的原因。

使用方式与定价

H3 已经在消费级 Hailuo AI 应用中上线,也可以通过 MiniMax 开放平台 API 以模型 ID MiniMax-H3 调用。官方定价为 2K 视频每秒 0.13 美元——一段 6 秒带音频的片段约 0.78 美元——另有更便宜的 768p 档位。这个价格明显高于老一代 Hailuo 2.3,也说明了 MiniMax 认为这个模型该站在市场的哪个位置。而 API 优先的策略显然奏效了:发布第一周内,H3 就出现在了一大批第三方创作平台上。对这个模型的原始访问权正在飞快扩散,不会长久成为任何人的护城河。

如果比起原始片段,你更想在成片这个层级上干活,Pixo 把主流视频模型——Seedance、Kling、Veo、Hailuo 等等——都收在同一套由 agent 驱动的分镜工作流背后,而 MiniMax H3 正在加入这份阵容的路上。立即注册——新用户注册即得 200 免费额度——等 H3 一上线,你就能直接开拍。

常见问题

MiniMax H3 是什么?

MiniMax H3(也被称作 Hailuo 3.0)是 MiniMax 于 2026 年 7 月 31 日发布的全模态视频模型。它把文本、图像、视频和音频视为同一份统一上下文,一次生成 4–15 秒、最高 2K、带原生立体声的视频。

MiniMax H3 和 Hailuo 3.0 是同一个东西吗?

是的。MiniMax 是公司名,Hailuo 是它面向消费者的视频品牌,H3 则是第三代模型。API 的模型 ID 是 MiniMax-H3,社区里大多称它为 Hailuo 3.0——指的是同一个模型。

MiniMax H3 能生成音频吗?

能。每一次 H3 输出都自带 32 kHz 原生立体声,与画面在同一遍生成中产出:带唇形同步的对白、环境声和音效。语音覆盖 11 种语言,包括中文、英语、日语、韩语、阿拉伯语、法语、德语、意大利语、葡萄牙语、俄语和西班牙语。

MiniMax H3 能编辑视频吗?

能,这也是它最独特的能力。H3 可以针对已有素材接收自然语言的编辑指令——替换某个角色或物体、更换背景或光线、改写一句对白、迁移一个声音——同时让未被编辑的区域保持稳定。

MiniMax H3 是开源的吗?

MiniMax 于 2026 年 8 月 3 日把 33B 参数权重发布到了 Hugging Face,但采用的是社区许可协议,而非标准开源协议。该协议把美国、欧盟、英国和韩国排除在适用地域之外,因此这些地区的创作者应当使用托管 API,而不是自行部署。

本文中的规格,来自 2026 年 8 月 5 日对 MiniMax 官方视频生成文档、MiniMax-H3 Hugging Face 模型卡以及已公开的许可协议原文的阅读,并与我们在 Pixo 生产环境中运行的模型做了交叉核对。定价和许可条款会变——在做预算之前,请以一手来源为准。

准备好颠覆你的创作流了吗?

加入成千上万Pixo创作者行列,将故事变化为视觉现实

立即注册

无需信用卡 • 免费 200 积分