Skip to content
Vidéo IA avec son·Audio natif·MiniMax H3·Générateur de vidéo IA·

Générateur de vidéo IA avec audio : le son natif MiniMax H3

La plupart des générateurs de vidéo IA sont muets. MiniMax H3 génère dialogues, ambiances et effets avec l'image — en stéréo, lip-sync compris. Sur Pixo.

Équipe Pixo·9 min read
Générateur de vidéo IA avec audio : le son natif MiniMax H3

Il y a un moment que tout flux de travail vidéo IA finit par rencontrer : le clip est superbe, et il est complètement muet. Alors vous partez chercher un fond musical, un outil de TTS pour la voix off, quelque chose pour les effets sonores — et vous découvrez le vrai problème : une voix enregistrée par-dessus une vidéo ne lui appartient jamais tout à fait. Le son de la pièce sonne faux, la bouche ne bouge pas, les pas ne se posent nulle part. Le sound design devient une seconde production.

C'est l'écart que le H3 de MiniMax a comblé à sa sortie le 31 juillet : il n'ajoute pas d'audio à la vidéo, il les génère ensemble. Nous développons Pixo, une plateforme vidéo multi-modèles où H3 est disponible dans le Playground, et de toute la fiche technique de H3, c'est la capacité qui change le plus le travail quotidien — voici donc exactement comment elle se comporte et comment la prompter.

Ce que « audio natif » veut vraiment dire

Chaque sortie H3 est livrée avec un son stéréo généré dans la même passe que l'image. Trois couches sortent d'un seul prompt :

  • Les dialogues. Écrivez la réplique mot pour mot et un personnage la prononce — avec synchronisation labiale, parce que le mouvement de la bouche et l'audio viennent de la même génération. Réécrivez la réplique et le jeu d'acteur suit.
  • L'ambiance. La scène sonne comme la scène : le vent sur une zone humide, le bourdonnement d'une cuisine, la circulation derrière une vitre. Vous ne la demandez pas tant que vous omettez de l'exclure.
  • Les effets. Les sons de contact tombent là où la physique se produit — un couvercle clique quand il s'ouvre, les battements d'ailes frappent quand l'oiseau s'envole.

La différence avec le doublage n'est pas subtile. L'audio superposé en post parle de la vidéo ; l'audio généré est de la vidéo. Quand un personnage se détourne au milieu d'une phrase, la voix tourne avec lui.

Qui a du son, qui n'en a pas

L'audio est discrètement devenu la ligne de partage entre générations de modèles :

ModèleAudio natif
MiniMax H3✅ Stéréo sur chaque sortie — dialogues, ambiances, effets
Seedance 2.5✅ Oui
Veo 3.1✅ Oui
Wan 2.6✅ Oui — dialogues et effets synchronisés
Kling 3.0❌ Sortie muette

Ce que H3 ajoute au-delà du simple « a de l'audio », c'est la pile vocale : synthèse vocale en plusieurs langues, et clonage de voix à partir d'une piste de référence — uploadez une voix, et le dialogue est généré dans ce timbre. (Cette capacité mérite son propre article approfondi ; ici nous restons sur le cas de tous les jours.)

Quatre règles pour prompter le son

1. Le dialogue doit être écrit en toutes lettres. H3 n'improvise pas les répliques. Une voix fatiguée dit : « On ouvre dans cinq minutes. » génère cette phrase — rien d'autre. Les demandes vagues (« elle dit quelque chose de rassurant ») produisent des résultats vagues.

2. Décidez qui est à l'écran. Un intervenant visible obtient la synchronisation labiale ; une voix hors champ se lit comme une narration. Les deux tiennent en une ligne de prompt — la différence est de placer ou non l'intervenant dans le cadre.

3. Tuez la musique sauf si vous la voulez. H3 mettra volontiers votre clip en musique. Si vous ajoutez de la musique sous licence en post — ce qui est le cas de la plupart des travaux de marque — terminez le prompt par musique non narrative : N/A et gardez la piste propre.

4. Les références audio accompagnent, jamais seules. Vous pouvez uploader une piste audio (≤15MB) pour fixer le rythme ou le caractère de la voix, mais elle doit accompagner une référence image ou vidéo — l'audio ne peut pas être la seule entrée.

Trois prompts à copier-coller

1. Dialogue à l'écran avec synchronisation labiale (16:9)

Fichiers de référence de la démonstration

Référence du personnage
Référence du personnage
Référence de la scène
Référence de la scène

Une démonstration du manuel dans le même registre

Un diner cosy tard le soir, lumière tungstène chaude, pluie légère sur la vitre. Une femme
d'une trentaine d'années est assise au comptoir, les mains autour d'un mug de café. Elle lève
les yeux vers la caméra et dit : « Tu commandes toujours la même chose. » Elle sourit
légèrement après la réplique. Ambiance calme de diner — pluie, une radio lointaine, des
couverts. Musique non narrative : N/A.

Pourquoi ça marche : un seul intervenant, une seule réplique écrite, un seul temps de réaction. La liste d'ambiances installe la scène sonore sans concurrencer le dialogue.

2. Moment produit narré (9:16)

Fichiers de référence de la démonstration

Échantillon de timbre de voix

Une démonstration du manuel dans le même registre

Vidéo verticale. Un dispositif de café pour-over sur un comptoir en bois, lumière du matin.
L'eau chaude spirale d'une bouilloire dans le filtre ; la vapeur monte ; la caméra avance
lentement. Une voix masculine calme dit : « Trente grammes. Trois minutes. Aucun raccourci. »
Bruit d'eau versée et vapeur légère. Musique non narrative : N/A.

Pourquoi ça marche : la narration hors champ élimine tout risque de synchronisation labiale, et les sons physiques (versement, vapeur) assurent l'atmosphère qu'un fond musical simule d'habitude.

3. La performance pilotée par références (trois vidéos en entrée, une chanson en sortie)

Fichiers de référence de la démonstration

Référence de mouvement de caméra (dolly zoom)
Métrage du sujet
Référence de chanson et de performance

La démonstration du manuel que ce prompt adapte

La Vidéo 1 fournit le mouvement de caméra : un dolly zoom à la Hitchcock. La Vidéo 2 est le
sujet : une femme prenant un café à la terrasse d'un café. La Vidéo 3 fournit la chanson et
la performance chantée. Faites chanter la femme de la Vidéo 2 — voix, phrasé et performance
de la Vidéo 3 — pendant que la caméra exécute sur elle le dolly zoom de la Vidéo 1.

Pourquoi ça marche : trois références, trois rôles — caméra, sujet, chanson — et l'audio est généré comme une performance, pas posé comme une piste. C'est la propre démonstration du manuel que la direction sonore n'est qu'un rôle de référence parmi d'autres.

Essayez-le

MiniMax H3 est disponible dans le Playground de Pixo : sélectionnez Vidéo → MiniMax H3, écrivez un prompt avec la réplique que vous voulez entendre, et générez un plan de 4-15 secondes en 768p ou 2K — son inclus, export sans filigrane. Pour la vue d'ensemble du modèle, commencez par ce qu'est MiniMax H3 ; pour comparer sa pile audio à l'autre modèle phare sorti le même jour, voyez MiniMax H3 vs Seedance 2.5.

Foire aux questions

Les générateurs de vidéo IA peuvent-ils créer du son ?

Certains oui, la plupart non. MiniMax H3, Seedance, Veo 3.1 et Wan 2.6 génèrent de l'audio nativement ; Kling 3.0 produit une vidéo muette. H3 va le plus loin : chaque sortie est livrée avec de l'audio stéréo — dialogues, ambiances et effets — généré dans la même passe que l'image, pas superposé après coup.

MiniMax H3 synchronise-t-il les dialogues sur les lèvres ?

Oui. Écrivez la réplique exacte dans votre prompt et H3 génère la voix avec l'image, les mouvements de bouche du personnage correspondant aux mots. Sa synthèse vocale couvre plusieurs langues, si bien que le dialogue n'est pas limité à l'anglais.

Comment faire une vidéo IA avec une voix off ?

Écrivez le texte de la voix off mot pour mot dans votre prompt — par exemple : Une voix masculine calme dit : « Les bons outils s'effacent dans le travail. » H3 génère la parole avec la vidéo. Si l'intervenant est à l'écran, la synchronisation labiale suit ; hors champ, elle se lit comme une narration.

Puis-je désactiver la musique de fond ?

Oui — terminez votre prompt par « musique non narrative : N/A » et H3 garde la piste propre : dialogues, ambiances et effets uniquement. C'est le mode à utiliser quand vous ajouterez de la musique de marque sous licence en post.

Puis-je utiliser mon propre audio comme référence ?

Oui. Uploadez une piste audio (jusqu'à 15MB) accompagnée d'une référence image ou vidéo — l'audio ne peut pas être la seule entrée — et utilisez-la pour fixer le rythme ou le caractère de la voix. H3 prend aussi en charge le clonage de voix à partir d'une piste de référence.

Comment l'essayer ?

MiniMax H3 est disponible dans le Playground de Pixo — générez des plans de 4-15 secondes en 768p ou 2K. Les nouveaux utilisateurs reçoivent 200 crédits gratuits à l'inscription, et les abonnements sont actuellement jusqu'à 55% de réduction.


MiniMax H3 est désormais disponible dans le Playground de Pixo — générez des plans de 4-15 secondes en 768p ou 2K, avec références image, vidéo et audio. Inscrivez-vous maintenant — les nouveaux utilisateurs reçoivent 200 crédits gratuits à l'inscription, et les abonnements sont actuellement jusqu'à 55% de réduction. Vous mettez des produits à l'écran ? Voyez les vidéos produit e-commerce avec H3.

Commencez à créer des vidéos IA cinématographiques dès aujourd'hui.

Rejoignez des milliers de créateurs qui utilisent Pixo pour transformer leurs histoires en réalité visuelle.

Commencer gratuitement

Aucune carte bancaire requise • 200 crédits gratuits