MiniMax H3·Hailuo 3.0·Générateur de vidéo IA·Modèles de vidéo IA·

MiniMax H3 : specs, modes et premier aperçu (2026)

MiniMax H3 (Hailuo 3.0) décrypté : vidéo multi-plans de 15 s avec audio stéréo natif, 12 fichiers en entrée et édition par instruction. Toutes les specs.

MiniMax H3 : specs, modes et premier aperçu (2026)

Le 31 juillet 2026, MiniMax a livré le modèle le plus ambitieux de sa gamme Hailuo — et redéfini au passage, sans faire de bruit, ce que veut dire « modèle vidéo ». MiniMax H3 (que la communauté appelle déjà Hailuo 3.0) ne se contente pas de transformer des prompts en clips. Il lit le texte, les images, la vidéo et l'audio comme un seul contexte unifié, génère des scènes multi-plans de 15 secondes avec le son stéréo intégré — puis vous laisse retoucher le résultat avec une instruction en langage courant, au lieu de relancer les dés.

Nous développons Pixo, une plateforme de vidéo IA multi-modèles : à chaque sortie d'un modèle de pointe, nous faisons deux choses — lire la documentation officielle ligne à ligne, et confronter le modèle à ceux que nous exploitons déjà. Ce premier aperçu s'appuie sur le manuel d'utilisation officiel de H3 et sur les documents de lancement de MiniMax — y compris des détails encore absents de la plupart des articles anglophones, comme les limites exactes en entrée, les trois modes de génération, et le fonctionnement réel du format de prompt.

Voici ce qu'est H3, ce qui est réellement nouveau, et ce que cela change quand on fait de la vidéo pour vivre.

MiniMax H3 en un coup d'œil

CaractéristiqueMiniMax H3
Sortie31 juillet 2026 (présenté en avant-première à la WAIC 2026)
Durée de sortie4 à 15 secondes, 24 ips
Résolutionmode 768p (upgradable en 1440p) ; mode 1440p « 2K » officiellement recommandé — jusqu'à 2976×1248 en 21:9
Formats d'image21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Audiostéréo natif sur chaque sortie — dialogues, ambiances, effets dans la même passe
Entrée multimodalejusqu'à 12 fichiers : 9 images + 3 clips vidéo + 3 pistes audio
Éditionmodifications par instruction sur des rushes existants (personnages, décors, dialogues, voix)
Languesprompts multilingues ; synthèse vocale en 11 langues avec précision, ~40 par dérivation
Limite de promptjusqu'à 7 000 caractères
Accèsapplication Hailuo AI, API MiniMax (identifiant MiniMax-H3)

L'idée forte : un seul contexte, toutes les modalités

La plupart des outils de vidéo IA sont des chaînes de modèles spécialisés : un pour le texte-vers-vidéo, un autre pour la synchronisation labiale, un troisième pour l'upscaling, un quatrième pour le son. Avec H3, MiniMax propose de replier toute cette chaîne dans un seul système « omni-modal ». Selon les termes du manuel officiel, H3 cesse de traiter la génération d'image, de vidéo et de son comme des tâches séparées et lit tous vos matériaux — un script, une référence de visage, un clip de mouvement, une piste musicale — comme un seul brief, puis en tire une scène audiovisuelle finie.

Concrètement, vous pouvez confier à H3 jusqu'à 12 fichiers dans un même prompt : jusqu'à 9 images, 3 clips vidéo (15 secondes cumulées) et 3 pistes audio. Chaque référence reçoit un rôle déclaré — cette image verrouille le visage du personnage, cette vidéo sert de référence de mouvement, cette piste impose le rythme. Le modèle les fusionne au lieu de les coller les unes à côté des autres. Si vous avez déjà tenté de garder un personnage cohérent tout en respectant une référence de mouvement et en calant le montage sur un tempo, avec trois outils différents, vous voyez immédiatement l'intérêt.

Le son n'est pas une pièce rapportée

Chaque génération H3 arrive avec un audio stéréo natif — dialogues synchronisés, son de pièce, effets — créé dans la même passe que les pixels. Seule une poignée de modèles propose un véritable audio natif (Seedance 2.0, Veo 3.1 et Wan 2.6 sont les autres noms notables), et H3 pousse plus loin côté langues : sa synthèse vocale couvre 11 langues avec précision — dont le chinois, l'anglais, le japonais, le coréen, le français, l'allemand et l'espagnol — et environ 40 de plus par dérivation. Il sait aussi cloner et transposer un timbre de voix à partir d'une piste de référence, ce qui fait passer « localiser cette pub sur trois marchés » du statut de projet de production à celui de simple prompt.

L'édition est la vraie tête d'affiche

Voilà ce qui sépare H3 de presque tous les générateurs de clips que nous suivons : il accepte des instructions de modification appliquées à des rushes existants. Les exemples du manuel sont d'une banalité réjouissante — « remplace le chat de la vidéo par un chien » — puis montent en puissance : changer l'enseigne lumineuse d'une supérette, transformer une canette de soda en cola de marque, et réécrire la dernière réplique, le tout en une seule instruction, sans que rien d'autre ne bouge dans le plan. Vous pouvez changer les décors et refaire la lumière d'une scène, remplacer une réplique et laisser le jeu s'ajuster subtilement, ou transposer la voix d'un personnage vers un timbre cloné. Vous pouvez l'essayer dès aujourd'hui dans le Playground de Pixo — uploadez vos rushes en référence vidéo et écrivez l'instruction dessus.

Pour un créateur en production, cela attaque l'habitude la plus coûteuse de la vidéo IA : la régénération. Quand un plan est bon à 90 %, on ne veut pas un nouveau plan — on veut les 10 % restants.

Pixo

Créez des vidéos IA avec Pixo

Transformez vos idées en vidéos prêtes à publier. Une phrase suffit.

Les trois modes de génération

Le manuel définit trois façons distinctes de piloter H3, et savoir dans lequel on se trouve change la manière d'écrire ses prompts (nous avons rédigé un guide complet des prompts MiniMax H3 à partir de la formule officielle) :

1. Mode omni-référence. L'entrée multimodale complète à 12 fichiers décrite plus haut. Vous étiquetez le rôle de chaque asset — verrouillage de visage, référence de mouvement, piste de rythme — puis vous décrivez la scène.

2. Mode première/dernière image. Vous fournissez une ou deux images. Avec deux, H3 les traite comme la première et la dernière image et remplit le mouvement, la lumière et le son entre les deux — et, point notable, il n'inventera pas de coupes de caméra dans ce mode. Le format d'image suit celui de votre image d'entrée.

3. Texte-vers-vidéo pur. Aucune référence : le modèle construit le sujet, le décor et l'action à partir de votre description. Les prompts peuvent atteindre 7 000 caractères, et H3 récompense une écriture précise, visuelle et consciente de la caméra, plutôt que des ambiances vagues.

Où H3 se situe dans le paysage actuel des modèles

Réponse honnête : H3 ne domine pas sur tous les axes, et il a choisi une journée chargée pour sortir. Kling 3.0 et Veo 3.1 produisent toujours une résolution brute supérieure (4K). Et le 31 juillet — le jour même de la sortie de H3 — ByteDance a lancé Seedance 2.5, qui pousse la génération en une seule passe jusqu'à 180 secondes et ajoute ses propres modes d'édition par instruction. L'idée « générer puis éditer » n'appartient clairement plus à H3 seul ; nous avons comparé les deux modèles phares en détail dans MiniMax H3 vs Seedance 2.5.

Ce qui reste vraiment la propriété de H3, c'est la moitié voix et langues de l'édition : réécrire une réplique en laissant le jeu s'ajuster, cloner une voix à partir d'une piste de référence, et une synthèse vocale en 11 langues dans le système même qui a généré l'image. Si votre travail touche aux marques, aux dialogues ou à plusieurs marchés — plutôt qu'à des plans spectaculaires isolés — cette combinaison vaut plus qu'un cran de résolution supplémentaire.

Un modèle ne fait toujours pas un film, cela dit. Un générateur de 15 secondes devient réellement utile quand il s'insère dans un storyboard aux côtés d'autres modèles — Seedance pour un temps fort d'action chargé en physique, H3 pour la scène de dialogue que vous voudrez retoucher plus tard. Ce flux de travail multi-modèles, plan par plan, est précisément ce autour de quoi nous avons construit l'agent de Pixo. H3 est désormais en ligne dans le Playground de Pixo pour la génération de plans individuels, et le storyboard fait tourner Seedance 2.0, Kling 3.0 et Veo 3.1 dès aujourd'hui — utilisez le hub Hailuo comme point de départ.

Accès et tarifs

H3 est en ligne dans l'application grand public Hailuo AI et via l'API de la plateforme ouverte de MiniMax, sous l'identifiant MiniMax-H3. Au lancement, le tarif API revient à environ 0,78 $ pour un clip 2K de 6 secondes avec le son — nettement au-dessus des tarifs de l'ancien Hailuo 2.3 (0,28 $ en 768p), ce qui vous dit où MiniMax situe ce modèle sur le marché. MiniMax a aussi annoncé que des poids ouverts arrivaient. Et la stratégie API-first fonctionne visiblement : dès la première semaine, H3 est apparu sur toute une vague de plateformes créatives tierces — l'accès brut à ce modèle se diffuse vite, et ne constituera pas longtemps l'avantage concurrentiel de qui que ce soit.

Si vous préférez travailler au niveau de la vidéo finie plutôt que du clip brut, Pixo fait tourner les grands modèles vidéo — Seedance, Kling, Veo, Hailuo et d'autres — derrière un flux de storyboard piloté par un agent. MiniMax H3 est désormais en ligne dans le Playground de Pixo — générez des plans de 4 à 15 secondes en 768p ou 2K, avec références image, vidéo et audio. Inscrivez-vous — les nouveaux utilisateurs reçoivent 200 crédits gratuits à l'inscription, et les abonnements sont actuellement jusqu'à -55 %.

Foire aux questions

Qu'est-ce que MiniMax H3 ?

MiniMax H3 (aussi appelé Hailuo 3.0) est un modèle vidéo omni-modal sorti par MiniMax le 31 juillet 2026. Il traite le texte, les images, la vidéo et l'audio comme un seul contexte unifié et génère des vidéos multi-plans de 4 à 15 secondes, jusqu'en 2K (1440p), avec un audio stéréo natif produit en une seule passe.

MiniMax H3 et Hailuo 3.0, est-ce la même chose ?

Oui. MiniMax est l'entreprise, Hailuo sa marque vidéo grand public, et H3 le modèle de troisième génération. L'identifiant de modèle dans l'API est MiniMax-H3, et une grande partie de la communauté l'appelle Hailuo 3.0 : c'est le même modèle.

Quelles résolution et durée MiniMax H3 peut-il produire ?

H3 génère des clips de 4 à 15 secondes à 24 ips, dans six formats d'image du 21:9 au 9:16. Il propose un mode 768p (résultats upgradables en 1440p) et un mode 1440p que MiniMax recommande officiellement — en 21:9, cela monte jusqu'à 2976×1248.

MiniMax H3 génère-t-il du son ?

Oui — chaque sortie de H3 comprend un audio stéréo natif généré dans la même passe que la vidéo : dialogues synchronisés avec les lèvres, ambiances et effets sonores. Sa synthèse vocale couvre 11 langues avec précision, et environ 40 de plus par dérivation.

MiniMax H3 peut-il modifier des vidéos ?

Oui, et c'est sa capacité la plus distinctive. H3 accepte des instructions de modification en langage courant appliquées à des rushes existants — remplacer un personnage ou un objet, changer le décor ou la lumière, réécrire une réplique, ou transposer une voix — tout en laissant stables les zones non modifiées.

Comment essayer MiniMax H3 ?

H3 est en ligne dans l'application Hailuo AI, via l'API de la plateforme ouverte de MiniMax (identifiant MiniMax-H3), et apparaît déjà sur plusieurs plateformes créatives tierces. Au lancement, le tarif API revient à environ 0,78 $ pour un clip 2K de 6 secondes avec le son.

De l'idée à la vidéo finale.
En une seule conversation.

Commencer à créer

Aucune carte bancaire requise • 200 crédits gratuits