一个上下文,全部模态
单条提示词最多引用 12 个文件——9 张图、3 段视频、3 段音频。锁定一张脸、借用一段动作、跟着配乐卡节奏,H3 把它们当作同一份创作简报来理解,而不是素材拼贴。
一条提示词,同时引用人脸、动作和配乐。
把文本、图像、视频与音频当作同一上下文理解的全模态视频模型。生成一个镜头、替换一个角色、改一句台词——其余部分逐帧不动。
为什么选 MiniMax H3
单条提示词最多引用 12 个文件——9 张图、3 段视频、3 段音频。锁定一张脸、借用一段动作、跟着配乐卡节奏,H3 把它们当作同一份创作简报来理解,而不是素材拼贴。
一条提示词,同时引用人脸、动作和配乐。
每条输出自带原生立体声——对白、环境音和音效与画面同轨生成,不是事后配上去的。
没有无声草稿,不用后期对轨。
换角色、换背景、改一句台词——H3 精准执行局部编辑,你没动的部分保持逐帧稳定。
只有指令在变,其余全部不动。
品牌大片、产品展示、剧情场景、风格化动画——电影级画面,字幕、Logo 和产品细节始终待在你放的位置。
从品牌片到产品演示——H3 可与 Seedance、Kling 同轨混剪。
实拍示例
品牌大片
产品资产逐帧锁定的品牌 campaign,自带原生配乐。
产品与电商
同一 SKU 三个场景零漂移——形状、材质、Logo 全程一致。
AI 短剧
多切镜对白场景,生成即有声,口型精准同步。
风格化动画
真实街景局部风格化——运动轨迹与光影全部保留。
规格
使用流程
把想法告诉 Pixo 的智能体,在提示词里直接选定画幅和分辨率——它会为你起草脚本和完整分镜。
指定使用 MiniMax H3,或交给智能体选择最合适的模型。参考素材随提示词一起生效,每个镜头依序生成。
在时间线上调整镜头顺序、微调需要打磨的镜头,导出成片——无水印。
常见问题
MiniMax H3 是海螺(Hailuo)团队 MiniMax 推出的新一代全模态视频模型。它把文本、图像、视频和音频当作同一个上下文理解,生成 4–15 秒、自带原生立体声的多镜头视频。在 Pixo 上,它与 Seedance、Kling、Veo 共用同一个故事板。
4–15 秒、24 fps 的视频,支持从 21:9 影院宽幅到 9:16 竖屏共六种画幅——在写提示词时直接选定。每条结果都自带声音。
最长 7,000 字符的文字提示词,以及参考文件——用图片锁定人脸或场景,用视频片段参考动作与运镜,用音频控制节奏与音色。
可以。在 Pixo 的故事板里,每个镜头都可以使用不同的模型——把 MiniMax H3 与 Seedance 2.0、Kling 3.0 或 Veo 3.1 混在同一条时间线上。
在 pixo.video 注册即可——新用户注册即得 200 积分,订阅方案目前最高优惠 55%。
可以。先用 768p 快速迭代,再把结果升级到 1440p——这是官方推荐的成片模式。21:9 画幅在 1440p 模式下渲染为 2976×1248。
最多 12 个:9 张图片、总计 15 秒的 3 段视频,以及 3 段音频(音频必须搭配图片或视频输入)。H3 把它们当作同一个上下文——用图片锁脸、用片段借动作、用音轨定节奏。
生成语音精准覆盖 11 种语言并保持口型同步——包括中文、英语、日语、韩语、法语、德语、西班牙语等,另有阿拉伯语、泰语、印地语等 40 余种语言可探索,适合多语种广告与本地化产品视频。