MiniMax H3 : specs, modes et premier aperçu (2026)
MiniMax H3 (Hailuo 3.0) décrypté : 15 s de vidéo, audio stéréo natif, 12 fichiers en entrée, édition par instruction et poids ouverts sous conditions.

Le 31 juillet 2026, MiniMax a livré le modèle le plus ambitieux de sa gamme Hailuo — et redéfini au passage, sans faire de bruit, ce que veut dire « modèle vidéo ». MiniMax H3 (que la communauté appelle déjà Hailuo 3.0) ne se contente pas de transformer des prompts en clips. Il lit le texte, les images, la vidéo et l'audio comme un seul contexte unifié, génère des scènes de 15 secondes avec le son stéréo intégré — puis vous laisse retoucher le résultat avec une instruction en langage courant, au lieu de relancer les dés.
Nous développons Pixo, une plateforme de vidéo IA multi-modèles : à chaque sortie d'un modèle de pointe, nous faisons deux choses — lire la documentation officielle ligne à ligne, et confronter le modèle à ceux que nous exploitons déjà. Ce premier aperçu s'appuie sur la documentation officielle de génération vidéo de MiniMax et sur la fiche du modèle H3 — y compris des détails encore absents de la plupart des articles publiés : les limites exactes en entrée, les trois modes de génération, et la restriction de licence qui décide si vous avez le droit, ou non, de faire tourner ce modèle.
Voici ce qu'est H3, ce qui est réellement nouveau, et ce que cela change quand on fait de la vidéo pour vivre.
MiniMax H3 en un coup d'œil
| Caractéristique | MiniMax H3 |
|---|---|
| Sortie | 31 juillet 2026 (poids publiés le 3 août) |
| Architecture | transformeur omni-modal dense à flux unique, 33 milliards de paramètres |
| Durée de sortie | 4 à 15 secondes, 24 ips |
| Résolution | 768p par défaut ; jusqu'à 2K |
| Formats d'image | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Audio | stéréo natif en 32 kHz — dialogues, ambiances et bruitages dans la même passe |
| Entrée multimodale | jusqu'à 12 fichiers au total : ≤9 images + ≤3 clips vidéo + ≤3 pistes audio |
| Édition | modifications par instruction sur des rushes existants |
| Langues | parole en 11 langues |
| Accès | application Hailuo AI, API MiniMax (identifiant MiniMax-H3), poids ouverts |
L'idée forte : un seul contexte, toutes les modalités
La plupart des outils de vidéo IA sont des chaînes de modèles spécialisés : un pour le texte-vers-vidéo, un autre pour la synchronisation labiale, un troisième pour l'upscaling, un quatrième pour le son. Avec H3, MiniMax propose de replier toute cette chaîne dans un seul système « omni-modal » — sur le plan architectural, un transformeur dense de 33 milliards de paramètres qui lit chaque modalité dans un flux unique, au lieu de greffer des encodeurs sur une ossature vidéo. Concrètement, il cesse de traiter l'image, la vidéo et le son comme des tâches séparées : il lit tous vos matériaux — un script, une référence de visage, un clip de mouvement, une piste musicale — comme un seul brief, puis en tire une scène audiovisuelle finie.
Dans les faits, vous pouvez confier à H3 jusqu'à 12 fichiers dans un même prompt : jusqu'à 9 images, 3 clips vidéo (15 secondes cumulées) et 3 pistes audio. Chaque référence reçoit un rôle déclaré — cette image verrouille le visage du personnage, cette vidéo sert de référence de mouvement, cette piste impose le rythme. Le modèle les fusionne au lieu de les coller les unes à côté des autres. Si vous avez déjà tenté de garder un personnage cohérent tout en respectant une référence de mouvement et en calant le montage sur un tempo, avec trois outils différents, vous voyez immédiatement l'intérêt.
Le son n'est pas une pièce rapportée
Chaque génération H3 arrive avec un audio stéréo natif en 32 kHz — dialogues synchronisés, ambiance de pièce, effets — créé dans la même passe que les pixels. Rares sont les modèles à proposer un véritable audio natif, et H3 pousse plus loin côté langues : sa parole couvre 11 langues — arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe et espagnol. Il sait aussi cloner et transposer un timbre de voix à partir d'une piste de référence, ce qui fait passer « localiser cette pub sur trois marchés » du statut de projet de production à celui de simple prompt.
L'édition est la vraie tête d'affiche
Voilà ce qui sépare H3 de presque tous les générateurs de clips que nous suivons : il accepte des instructions de modification appliquées à des rushes existants. Les exemples de MiniMax sont d'une banalité réjouissante — « remplace le chat de la vidéo par un chien » — puis montent en puissance : changer une enseigne lumineuse de supérette, transformer une canette de soda en cola de marque et réécrire la dernière réplique, le tout en une seule instruction, sans que rien d'autre ne bouge dans le plan. Vous pouvez changer les décors et refaire la lumière d'une scène, remplacer une réplique et laisser le jeu s'ajuster subtilement, ou transposer la voix d'un personnage vers un timbre cloné.
Pour un créateur en production, cela attaque l'habitude la plus coûteuse de la vidéo IA : la régénération. Quand un plan est bon à 90 %, on ne veut pas un nouveau plan — on veut les 10 % restants.
Les trois modes de génération
La documentation définit trois façons distinctes de piloter H3, et savoir dans lequel on se trouve change la manière d'écrire ses prompts (nous avons rédigé un guide complet des prompts MiniMax H3 à partir de la formule officielle) :
1. Mode référence. L'entrée multimodale complète à 12 fichiers décrite plus haut. Vous étiquetez le rôle de chaque asset — verrouillage de visage, référence de mouvement, piste de rythme — puis vous décrivez la scène.
2. Mode image-vers-vidéo / première-dernière image. Vous fournissez une ou deux images. Avec deux, H3 les traite comme la première et la dernière image et invente le mouvement, la lumière et le son entre les deux — et, point notable, il n'ajoutera pas de coupes de caméra dans ce mode. Le format d'image suit celui de votre image d'entrée.
3. Texte-vers-vidéo pur. Aucune référence : le modèle construit le sujet, le décor et l'action à partir de votre description. H3 récompense une écriture précise, visuelle et consciente de la caméra, plutôt que des ambiances vagues.
Des poids ouverts — avec une restriction territoriale
C'est le détail que la plupart des articles ont sauté, et c'est celui qui décide si H3 vous est utilisable ou non.
Le 3 août, MiniMax a publié les poids de H3 sur Hugging Face — une ouverture véritable pour un modèle vidéo de pointe, et l'exact opposé stratégique de ByteDance, qui garde Seedance fermé. Mais la publication s'est faite sous la MiniMax H3 Community Licence, et non sous Apache ou MIT, et le texte de la licence définit son « territoire d'application » comme le monde entier à l'exclusion de l'Union européenne, du Royaume-Uni, de la République de Corée et des États-Unis d'Amérique.
En clair : si vous êtes aux États-Unis, dans l'Union européenne, au Royaume-Uni ou en Corée du Sud, la licence communautaire ne vous accorde aucun droit d'exécuter ces poids en local. Ailleurs, l'usage commercial exige en outre une autorisation écrite distincte au-delà de 20 M$ de chiffre d'affaires annuel, ainsi qu'une mention « MiniMax H3 » visible dans votre produit.
Pour la plupart de nos lecteurs, la voie praticable est donc l'API hébergée — ou une plateforme qui en licencie l'accès — et non un déploiement local. La restriction est inhabituelle, et il vaut mieux la connaître avant de budgéter des heures de GPU pour un modèle que vous n'avez peut-être pas le droit de faire tourner.
Où H3 se situe dans le paysage actuel
Réponse honnête : H3 ne domine pas sur tous les axes, et il a choisi une journée chargée pour sortir. Kling 3.0 et Veo 3.1 produisent toujours une résolution brute supérieure. Et le 31 juillet — le jour même de la sortie de H3 — ByteDance a lancé Seedance 2.5 dans le monde entier sur Dreamina, qui pousse la génération à des prises uniques de 30 secondes, avec un mode vidéo longue atteignant trois minutes, et ajoute ses propres modes d'édition horodatés. L'idée « générer puis éditer » n'appartient clairement plus à H3 seul ; nous avons comparé les deux modèles phares en détail dans MiniMax H3 vs Seedance 2.5.
Ce qui reste vraiment la propriété de H3, c'est la moitié voix et langues de l'édition : réécrire une réplique en laissant le jeu s'ajuster, cloner une voix à partir d'une piste de référence, et parler 11 langues dans le système même qui a généré l'image. Si votre travail touche aux marques, aux dialogues ou à plusieurs marchés — plutôt qu'à des plans spectaculaires isolés — cette combinaison vaut plus qu'un cran de résolution supplémentaire.
Un modèle ne fait toujours pas un film, cela dit. Un générateur de 15 secondes devient réellement utile quand il s'insère dans un storyboard aux côtés d'autres modèles — Seedance pour un temps fort d'action chargé en physique, H3 pour la scène de dialogue que vous voudrez retoucher plus tard. Ce flux de travail multi-modèles, plan par plan, est précisément ce autour de quoi nous avons construit l'agent de Pixo, et c'est pourquoi nous préparons l'arrivée de H3 dans le storyboard de Pixo, aux côtés de Seedance 2.0, Kling 3.0 et Veo 3.1.
Accès et tarifs
H3 est en ligne dans l'application grand public Hailuo AI et via l'API de la plateforme ouverte de MiniMax, sous l'identifiant MiniMax-H3. Le tarif public est de 0,13 $ par seconde de vidéo 2K — environ 0,78 $ pour un clip de 6 secondes avec son — avec un palier 768p moins cher. C'est nettement au-dessus des tarifs de l'ancien Hailuo 2.3, ce qui vous dit où MiniMax situe ce modèle sur le marché. Et la stratégie API-first fonctionne visiblement : dès la première semaine, H3 est apparu sur toute une vague de plateformes créatives tierces. L'accès brut à ce modèle se diffuse vite, et ne constituera pas longtemps l'avantage concurrentiel de qui que ce soit.
Si vous préférez travailler au niveau de la vidéo finie plutôt que du clip brut, Pixo fait tourner les grands modèles vidéo — Seedance, Kling, Veo, Hailuo et d'autres — derrière un flux de storyboard piloté par un agent, et MiniMax H3 est en route pour rejoindre cette liste. Inscrivez-vous — 200 crédits gratuits offerts à l'inscription — et vous serez prêt à diriger H3 dès son arrivée.
Foire aux questions
Qu'est-ce que MiniMax H3 ?
MiniMax H3 (aussi appelé Hailuo 3.0) est un modèle vidéo omni-modal sorti par MiniMax le 31 juillet 2026. Il traite le texte, les images, la vidéo et l'audio comme un seul contexte unifié et génère des vidéos de 4 à 15 secondes, jusqu'en 2K, avec un audio stéréo natif produit dans la même passe.
MiniMax H3 et Hailuo 3.0, est-ce la même chose ?
Oui. MiniMax est l'entreprise, Hailuo sa marque vidéo grand public, et H3 le modèle de troisième génération. L'identifiant de modèle dans l'API est MiniMax-H3, et une grande partie de la communauté l'appelle Hailuo 3.0 : c'est le même modèle.
MiniMax H3 génère-t-il du son ?
Oui — chaque sortie de H3 comprend un audio stéréo natif en 32 kHz généré dans la même passe que la vidéo : dialogues synchronisés avec les lèvres, ambiances et effets sonores. Sa parole couvre 11 langues, dont le chinois, l'anglais, le japonais, le coréen, l'arabe, le français, l'allemand, l'italien, le portugais, le russe et l'espagnol.
MiniMax H3 peut-il modifier des vidéos existantes ?
Oui, et c'est sa capacité la plus distinctive. H3 accepte des instructions de modification en langage courant appliquées à des rushes existants — remplacer un personnage ou un objet, changer le décor ou la lumière, réécrire une réplique, transposer une voix — tout en laissant intactes les zones non modifiées.
MiniMax H3 est-il open source ?
MiniMax a publié les poids du modèle de 33 milliards de paramètres sur Hugging Face le 3 août 2026, mais sous une licence communautaire et non sous une licence open source standard. Cette licence exclut les États-Unis, l'Union européenne, le Royaume-Uni et la Corée du Sud de son territoire d'application : les créateurs de ces régions doivent passer par l'API hébergée plutôt que par un déploiement local.
Les caractéristiques de cet article ont été relevées le 5 août 2026 dans la documentation officielle de génération vidéo de MiniMax, la fiche du modèle MiniMax-H3 sur Hugging Face et le texte de licence publié, puis recoupées avec les modèles que nous exploitons en production sur Pixo. Les tarifs et les conditions de licence évoluent : vérifiez auprès des sources primaires avant de budgéter.
Commencez à créer des vidéos IA cinématographiques dès aujourd'hui.
Rejoignez des milliers de créateurs qui utilisent Pixo pour transformer leurs histoires en réalité visuelle.
Commencer gratuitementAucune carte bancaire requise • 200 crédits gratuits


