MiniMax H3·Guide de prompts·Prompts vidéo IA·Hailuo 3.0·

MiniMax H3 : guide des prompts et formule officielle

La formule officielle en trois blocs pour MiniMax H3 : références @fichier, les trois modes de génération et les six erreurs qui ruinent vos rendus.

MiniMax H3 : guide des prompts et formule officielle

L'essentiel de ce qui s'est écrit sur le prompting de MiniMax H3 relève de la conjecture — le modèle a à peine une semaine. Ce guide, lui, n'en relève pas. MiniMax a publié un manuel d'utilisation officiel détaillé en même temps que le lancement de H3 le 31 juillet, et il contient quelque chose de rare : une formule de prompt explicite écrite par des ingénieurs, une taxonomie des rôles des fichiers de référence, et une liste franche des erreurs qui ruinent le plus souvent les générations. Très peu de tout cela avait émergé en dehors du chinois jusqu'ici.

Nous construisons Pixo, une plateforme de vidéo IA multi-modèles, et lire les manuels des modèles le jour de leur sortie fait partie du travail — notre agent doit écrire des prompts de niveau production pour chaque modèle que nous opérons. Voici le système de prompting de H3, traduit et organisé pour les créateurs en activité. (Le modèle lui-même vous est nouveau ? Commencez par notre premier aperçu de H3.)

La formule officielle

Tout droit sortie du manuel :

Prompt complet = notes sur les fichiers de référence + idée centrale + description scène par scène

Trois blocs, dans cet ordre. Sautez le premier si vous n'avez rien téléversé. La plupart des prompts H3 ratés cassent exactement un de ces blocs — le plus souvent en écrasant tout dans un seul paragraphe indifférencié, l'erreur numéro 1 listée par le manuel.

Bloc 1 : notes sur les fichiers de référence

Chaque fichier téléversé reçoit un numéro dans l'ordre de téléversement, cité dans le texte comme @image1, @video2, @audio3. Et chaque fichier a besoin d'un rôle déclaré. La taxonomie des rôles du manuel mérite d'être mémorisée, car c'est en pratique la surface d'API de H3 en langage naturel :

  • Référence de personnage — verrouiller un visage ou une silhouette
  • Référence d'objet — verrouiller un produit ou un accessoire
  • Référence de scène — verrouiller un lieu
  • Image clé — verrouiller une image (dites explicitement s'il s'agit de la première ou de la dernière)
  • Référence de voix — verrouiller un timbre de voix
  • Storyboard — générer les plans en suivant une planche d'histoire
  • Référence de style — reproduire le rendu d'une image
  • Référence de composition — reproduire le cadrage et la mise en page
  • Réutilisation audio — utiliser la piste directement comme audio de la vidéo (ou en réutiliser une partie)
  • Référence de mouvement — verrouiller une action tirée d'une vidéo
  • Référence de caméra — verrouiller un mouvement de caméra
  • Édition de vidéo — la vidéo à modifier

L'exemple du manuel, traduit : « @image1 est la référence du personnage (verrouiller le visage de cette femme), @video1 est la référence de mouvement (reprendre les mouvements de danse à l'épée qu'elle contient), @audio1 est la référence d'ambiance (partition classique au guqin). Faites exécuter à cette femme la danse à l'épée de la vidéo dans une cour aux cerisiers en fleurs. »

Bloc 2 : idée centrale

Quatre éléments, explicitement nommés dans le manuel : le sujet (qui ou quoi), le lieu (où), l'événement (faisant quoi) et le genre/style (prise de vue réelle, animation, cinématographique, publicitaire, documentaire — ou une esthétique nommée comme le cyberpunk ou le néon). Plus, en option, le comportement de caméra : H3 coupe entre les plans par défaut, donc si vous voulez un plan-séquence, dites-le. Pour les mouvements de caméra, le manuel est inhabituellement précis — écrivez des mouvements concrets comme « travelling gauche + panoramique droite » plutôt que des demandes vagues du type « orbiter autour de la scène ». Pour les coupes, vous pouvez en préciser le style : cut franc, fondu, calé sur le rythme, montage rapide.

Bloc 3 : description scène par scène

Décrivez ce qui se passe dans le temps, segment par segment — « 0–3 s : …, 3–7 s : … » — en reliant les éléments aux fichiers via des références @ partout où ils sont liés. C'est aussi là que vivent les dialogues, et la règle est absolue : écrivez la réplique exacte. « Elle dit quelque chose d'émouvant » produit de la bouillie ; « Elle dit : “Tu es venu. La lame a assez attendu.” » produit la réplique, synchronisée sur les lèvres.

Les règles qui sauvent des générations

Quatre règles plus modestes du manuel pèsent bien plus lourd qu'il n'y paraît :

Écrivez ce que la caméra voit, pas ce que cela signifie. H3 récompense la description concrète, visuelle et directe et trébuche sur la métaphore. « Le néon détrempé de pluie se reflète sur sa veste en cuir » bat « une atmosphère de mélancolie urbaine » à chaque fois.

Le texte à l'écran doit être cité mot pour mot. Si vous voulez du texte dans le cadre, écrivez-le : « L'écran du téléphone affiche le titre “Création vidéo IA” avec un bouton indiquant “Commencer”. »

Éliminez explicitement la musique indésirable. Pas de BGM ? Terminez le prompt par non_diegetic_music: N/A. Et ne vous contredisez jamais — demander une bande-son sur une ligne et bannir la BGM sur une autre est un mode d'échec listé.

Nommez le plan quand vous coupez. Quand vous spécifiez une coupe, indiquez la nouvelle valeur de plan et quel sujet déjà établi elle cadre — c'est ce qui garde les visages cohérents d'une coupe à l'autre.

Prompter chacun des trois modes

Mode omni-référence (jusqu'à 9 images + 3 vidéos + 3 audio) : la formule complète s'applique — le bloc de notes de référence est obligatoire, et les fichiers non étiquetés sont des fichiers gaspillés.

Mode première/dernière image : téléversez une image et dites s'il s'agit de l'image d'ouverture ou de clôture ; téléversez-en deux et H3 comble le mouvement, la lumière et le son entre les deux. Point critique : il n'inventera pas de coupes de caméra dans ce mode — l'exemple du manuel : « @image1 est la première image : une femme tenant une épée sous un cerisier. Emmenez-la de la position de garde jusqu'à la danse à l'épée complète, avec fluidité, sans coupes. »

Texte-vers-vidéo pur : aucun fichier, jusqu'à 7000 caractères de prompt. Le plancher pour un résultat exploitable, selon le manuel : apparence du sujet + détails de la scène + action + style. Les prompts plus courts que cela sont un mode d'échec documenté, pas un choix de style.

Points de départ à copier-coller

Trois prompts construits sur la formule officielle (adaptez librement) :

Les fichiers de référence de la démonstration

@image1 — les deux personnages
@image1 — les deux personnages
@video1 — référence d'action et de jeu
[Références] Les personnages de @image1 suivent strictement les mouvements, les expressions et le rythme de jeu de @video1.
[Déroulé] L'homme se tient devant l'évier, à droite du cadre, et tend une assiette lavée à la femme placée à gauche ; puis il se retourne et lui projette soudain de la mousse de liquide vaisselle de la main droite, vers le bord gauche du cadre. Surprise, elle riposte aussitôt, et tous deux se mettent à s'asperger joyeusement de mousse, en esquivant et en riant aux éclats.

Les fichiers de référence de la démonstration

@video1 — source sur fond vert
@video2 — référence de style conte de fées
[Instruction d'édition, sur deux vidéos existantes] Supprime le fond vert de @video1 et remplace-le par un décor de conte de fées dans le style de @video2. Les éléments du décor doivent correspondre exactement aux mouvements du personnage dans @video1. Ajuste l'éclairage du personnage pour qu'il corresponde parfaitement au nouveau décor.

Les fichiers de référence de la démonstration

Séquence source (chat)
[Instruction d'édition, sur une vidéo existante] Remplace le chat de la vidéo par un golden retriever. Garde le mouvement de caméra, la lumière et l'arrière-plan inchangés.
Pixo

Créez des vidéos IA avec Pixo

Transformez vos idées en vidéos prêtes à publier. Une phrase suffit.

La formule à l'épreuve : quatre cas travaillés

Chacun de ces cas est adapté d'une démonstration du manuel, et chacun isole une partie de la formule. (La bibliothèque complète est dans 20 prompts MiniMax H3.)

Texte seul — [idée centrale] et [déroulé] portent tout. Aucune référence, et la direction artistique tient quand même, parce que chaque règle visuelle est énoncée comme une contrainte :

15 secondes, 16:9. Imite entièrement le langage visuel d'un film de
lancement de marque premium : fond noir pur, éclairage de qualité studio,
gros plans rotatifs ultra-lents, titres géants minimalistes en sans-serif,
musique électronique éthérée. Le produit est — un canard laqué de Pékin
parfaitement rôti. Typographie minimaliste, généreusement espacée, une
seule sans-serif fine du début à la fin. Interdits : style cartoon,
arrière-plans encombrés, filigranes.

Les notes de référence à pleine puissance — trois images, trois rôles déclarés. Le prompt ne décrit jamais les visages des mannequins ni les lunettes ; les références portent l'identité pendant que le texte porte l'attitude :

Les fichiers de référence de la démonstration

Image 1 — les looks des mannequins
Image 1 — les looks des mannequins
Image 2 — détails du visage sous plusieurs angles
Image 2 — détails du visage sous plusieurs angles
Image 3 — design des lunettes
Image 3 — design des lunettes
Une publicité de lunetterie haute couture, verticale 9:16. Look studio
blanc minimaliste : fond blanc sans raccord, forte allure de campagne
haute couture — net, tranchant, avant-gardiste, avec le poli d'une
campagne internationale. L'Image 1 fixe les deux silhouettes en pied ;
garder leur finition vestimentaire, leur posture, l'éclairage studio et
la froideur de podium. Toutes deux portent des lunettes futuristes haut
de gamme — design selon l'Image 3 : surfaces courbes enveloppantes,
contour géométrique tranchant hybride œil-de-chat/masque, reflets
miroir, branches profilées. Détails du visage selon l'Image 2.

Un [déroulé] plan par plan, avec habillage. Coupes, cartons de titre et audio par plan écrits dans l'ordre caméra — la grammaire de bande-annonce du propre cas de science-fiction du manuel :

Les fichiers de référence de la démonstration

Image 1 — atmosphère et style
Image 1 — atmosphère et style
Image 2 — protagoniste
Image 2 — protagoniste
Cinéma photoréaliste, lumière très contrastée, rythme serré. L'Image 1
est la référence d'atmosphère et de style d'ensemble ; l'Image 2 est le
protagoniste.
Plan 1 — très large plan d'établissement : une colossale porte cosmique
circulaire remplit presque le cadre ; le personnage est une minuscule
silhouette en bas à droite, devant elle. Sol mouillé réfléchissant,
obscurité au centre de la porte. La caméra avance lentement. Un titre
suinte depuis le bord sombre, flou puis net : « THE STARS WERE
LISTENING » — capitales lourdes ultra-étroites, rouge sombre mêlé de
rouille, léger grain et bords voilés.
Audio : pulsation grave profonde, tremblement métallique lointain, un
impact doux quand le titre devient net. -> Cut franc.

Trois références, trois modalités. Le mouvement de caméra d'une vidéo, le sujet d'une autre, la chanson et la performance d'une troisième — les notes de référence de la formule généralisées au son :

Les fichiers de référence de la démonstration

Vidéo 1 — mouvement de caméra (dolly zoom)
Vidéo 2 — sujet
Vidéo 3 — chanson et performance
La Vidéo 1 fournit le mouvement de caméra : un dolly zoom hitchcockien.
La Vidéo 2 est le sujet : une femme qui prend un café à la terrasse d'un
café. La Vidéo 3 fournit la chanson et la performance chantée. Fais
chanter la femme de la Vidéo 2 — voix, phrasé et performance issus de la
Vidéo 3 — pendant que la caméra exécute sur elle le dolly zoom de la
Vidéo 1.

Les six erreurs contre lesquelles le manuel met en garde

ErreurCorrectif
Un seul paragraphe indifférenciéDécouper selon les trois blocs de la formule
Fichiers téléversés, rôles non déclarésAjouter « @image1 est la référence de X » pour chaque fichier
Demander une musique et bannir la BGMSupprimer l'un des deux — ou les limiter à des scènes différentes
Vouloir un plan-séquence mais écrire « Plan 1 / Plan 2 »Garder un seul paragraphe narratif continu, sans structure en plans
Vouloir une cohérence faciale sans image de référenceEn téléverser une, étiquetée « référence de personnage (verrouiller le visage) »
Prompt trop court sans fichiersCouvrir au minimum apparence du sujet + scène + action + style

Le raccourci honnête

Le conseil final du manuel — « confiez l'écriture des prompts à un partenaire professionnel » — est l'aveu par MiniMax même du schéma que nous observons sur chaque modèle de pointe : les prompts sont discrètement devenus des spécifications, avec manifestes de références, blocs d'horodatage et règles de mise en forme. Connaître la formule est ce qui sépare un rendu exploitable de la bouillie, mais écrire des prompts de niveau spécification pour chaque plan d'une vidéo multi-scènes est un vrai travail.

C'est précisément le métier pour lequel nous avons construit l'agent de Pixo : décrivez la vidéo que vous voulez, et l'agent écrit le script, le storyboard et les prompts par plan dans le dialecte natif de chaque modèle — formule ci-dessus comprise. Et MiniMax H3 est disponible dès aujourd'hui dans le Playground de Pixo — collez ces prompts, ajoutez vos références (les fichiers sont numérotés Image 1, Vidéo 1… au fil du téléversement), et générez des plans de 4 à 15 secondes en 768p ou 2K. Inscrivez-vous maintenant — les nouveaux utilisateurs reçoivent 200 crédits gratuits à l'inscription, et les abonnements sont actuellement jusqu'à 55 % moins chers.

FAQ

Quelle est la formule de prompt officielle de MiniMax H3 ?

Le manuel de MiniMax la définit ainsi : prompt complet = notes sur les fichiers de référence + idée centrale + description scène par scène. Déclarez d'abord le rôle de chaque fichier téléversé, puis énoncez le sujet, le lieu, l'événement et le style, puis décrivez l'action dans le temps — avec des horodatages si nécessaire.

Comment référencer des fichiers téléversés dans un prompt MiniMax H3 ?

Numérotez-les dans l'ordre de téléversement et citez-les dans le texte — @image1, @video2, @audio3. Chaque fichier doit avoir un rôle déclaré : verrouillage de visage, verrouillage d'objet, référence de scène, référence de mouvement, référence de voix, piste de rythme, etc. Les fichiers sans rôle énoncé sont la cause numéro un des références ignorées.

Comment empêcher MiniMax H3 d'ajouter une musique de fond ?

Dites-le explicitement à la fin du prompt : « non_diegetic_music: N/A » (ou l'équivalent en langage courant). Les interdictions non écrites tendent à être ignorées — et ne demandez jamais une bande-son sur une ligne tout en bannissant la BGM sur une autre.

Comment garder le visage d'un personnage cohérent dans MiniMax H3 ?

Téléversez une image de référence du personnage et étiquetez-la explicitement comme verrouillage de visage — p. ex. « @image1 est la référence du personnage (verrouiller le visage de cette femme) ». Vouloir une cohérence faciale sans référence étiquetée figure parmi les erreurs courantes listées par le manuel.

Quels sont les trois modes de génération de MiniMax H3 ?

L'omni-référence (jusqu'à 12 fichiers — 9 images, 3 vidéos, 3 audio — chacun avec un rôle déclaré), le mode première/dernière image (une ou deux images ; H3 comble le mouvement entre les deux et n'invente pas de coupes), et le texte-vers-vidéo pur (prompts jusqu'à 7000 caractères).

Quelle longueur peut atteindre un prompt MiniMax H3 ?

Jusqu'à 7000 caractères, dans n'importe quelle langue que H3 comprend. Les prompts trop courts sont un mode d'échec documenté : sans fichiers de référence, couvrez toujours au minimum l'apparence du sujet, les détails de la scène, l'action et le style.

De l'idée à la vidéo finale.
En une seule conversation.

Commencer à créer

Aucune carte bancaire requise • 200 crédits gratuits