Skip to content
MiniMax H3·Guía de Prompts·Prompts de Video con IA·Hailuo 3.0·

Guía de prompts de MiniMax H3: fórmula oficial y modos

Prompts de MiniMax H3 que funcionan: la fórmula oficial de tres bloques, referencias @archivo, los tres modos y los seis errores a evitar.

Equipo Pixo·10 min read
Guía de prompts de MiniMax H3: fórmula oficial y modos

Casi todo lo que se ha escrito sobre cómo escribir prompts para MiniMax H3 son conjeturas: el modelo apenas tiene una semana. Esta guía no lo es. MiniMax publicó un manual de uso detallado junto al lanzamiento de H3 el 31 de julio, y dentro hay algo poco frecuente: una fórmula de prompt explícita escrita por ingeniería, una taxonomía de roles de referencia y una lista franca de los errores que más arruinan generaciones. Casi nada de ello había salido en inglés hasta ahora.

Nosotros construimos Pixo, una plataforma de video con IA multimodelo, y leer los manuales de los modelos el día que salen es parte del trabajo: nuestro agente tiene que escribir prompts de calidad de producción para cada modelo que ejecutamos. Este es el sistema de prompting de H3, traducido y organizado para quien crea a diario, contrastado con la documentación oficial de generación de video de MiniMax. (¿No conoces el modelo todavía? Empieza por nuestro primer vistazo a H3.)

La fórmula oficial

Directamente del manual:

Prompt completo = notas del material de referencia + idea central + descripción escena por escena

Tres bloques, en ese orden. Sáltate el primero si no has subido nada. La mayoría de los prompts fallidos de H3 rompen exactamente uno de estos bloques, casi siempre metiéndolo todo en un único párrafo indiferenciado, que es el error número 1 de la lista del manual.

Bloque 1: notas del material de referencia

Cada archivo que subes recibe un número según el orden de subida y se cita en línea como @image1, @video2, @audio3. Y cada archivo necesita un rol declarado. Vale la pena memorizar la taxonomía de roles, porque es en la práctica la superficie de API de H3 en lenguaje natural:

  • Referencia de personaje — fija un rostro o una figura
  • Referencia de objeto — fija un producto o un atrezo
  • Referencia de escena — fija una localización
  • Fotograma clave — fija un fotograma (di explícitamente si es el primero o el último)
  • Referencia de voz — fija un timbre de voz
  • Storyboard — genera planos siguiendo una viñeta de guion gráfico
  • Referencia de estilo — replica el aspecto de una imagen
  • Referencia de composición — replica el encuadre y la disposición
  • Reutilización de audio — usa la pista directamente como audio del video (o reutiliza una parte)
  • Referencia de movimiento — fija una acción a partir de un video
  • Referencia de cámara — fija un movimiento de cámara
  • Edición de video — el video que se va a modificar

El ejemplo del manual, traducido: «@image1 es la referencia de personaje (fija el rostro de esta mujer), @video1 es la referencia de movimiento (usa los movimientos de danza con espada que aparecen en él), @audio1 es la referencia de ambiente (partitura clásica de guqin). Haz que esta mujer ejecute la danza con espada del video en un patio de cerezos en flor.»

Recuerda el techo duro que marca la ficha del modelo: 12 archivos en total, como máximo 9 imágenes, 3 clips de video y 3 pistas de audio, con el video y el audio limitados a 15 segundos en total cada uno.

Bloque 2: idea central

Cuatro elementos, nombrados explícitamente en el manual: sujeto (quién o qué), lugar (dónde), acción (haciendo qué) y género/estilo (imagen real, animación, cinematográfico, publicitario, documental, o una estética con nombre propio como ciberpunk o neón). Y, de forma opcional, el comportamiento de la cámara: H3 corta entre planos por defecto, así que si quieres una toma continua, dilo. Para los movimientos de cámara el manual es inusualmente concreto: escribe movimientos precisos como «travelling a la izquierda + paneo a la derecha» en lugar de peticiones vagas como «da una vuelta alrededor de la escena». Para los cortes puedes especificar el estilo: corte seco, fundido, sincronizado con el beat, montaje rápido.

Bloque 3: descripción escena por escena

Describe lo que ocurre a lo largo del tiempo, segmento a segmento —«0-3 s: …, 3-7 s: …»—, conectando elementos con archivos mediante referencias @ allí donde estén vinculados. Aquí es también donde va el diálogo, y la regla es absoluta: escribe la frase exacta. «Dice algo emotivo» produce papilla; «Ella dice: "Has venido. La hoja ya ha esperado bastante."» produce esa frase, con sincronía labial.

Reglas que salvan generaciones

Cuatro reglas menores del manual pesan mucho más de lo que aparentan:

Escribe lo que ve la cámara, no lo que significa. H3 premia la descripción concreta, visual y directa, y tropieza con la metáfora. «Neones reflejados en su chaqueta de cuero mojada por la lluvia» le gana siempre a «una atmósfera de melancolía urbana».

El texto en pantalla debe citarse literalmente. Si quieres texto dentro del cuadro, escríbelo: «La pantalla del móvil muestra el título "Creación de video con IA" con un botón que dice "Empezar ahora".»

Elimina la música no deseada de forma explícita. ¿Nada de música de fondo? Termina el prompt con non_diegetic_music: N/A. Y nunca te contradigas: pedir una banda sonora en una línea y prohibir la música de fondo en otra es un modo de fallo documentado.

Nombra el plano cuando cortas. Al especificar un corte, indica el nuevo tamaño de plano y a qué sujeto ya establecido encuadra: eso es lo que mantiene los rostros consistentes entre cortes.

Cómo escribir prompts en cada uno de los tres modos

Modo referencia (hasta 9 imágenes + 3 videos + 3 audios): se aplica la fórmula completa, el bloque de notas de referencia es obligatorio y los archivos sin etiquetar son archivos desperdiciados.

Imagen a video / primer-último fotograma: sube una imagen e indica si es el fotograma inicial o el final; sube dos y H3 rellenará el movimiento, la iluminación y el sonido intermedios. Es clave que en este modo no se inventará cortes de cámara. El ejemplo del manual: «@image1 es el primer fotograma: una mujer sosteniendo una espada bajo un cerezo. Llévala desde la posición de guardia hasta la danza con espada completa, con fluidez natural, sin cortes.»

Texto a video puro: sin archivos y con un techo generoso; el manual sitúa el límite del prompt en 7.000 caracteres. El mínimo para un resultado utilizable: aspecto del sujeto + detalles de la escena + acción + estilo. Los prompts más cortos que eso son un modo de fallo documentado, no una elección estilística.

Puntos de partida para copiar y pegar

Tres prompts construidos sobre la fórmula oficial (adáptalos con libertad):

[References] @image1 is the character reference (lock her face). @image2 is the scene reference.
[Core idea] A woman in a rain-soaked neon alley in Tokyo at night; cinematic live-action; one continuous take, slow push-in.
[Process] 0–4s: she walks toward camera, rain on her jacket, distant traffic hum. 4–8s: she stops, looks up; she says: "It was never about the money." Ambient rain continues. non_diegetic_music: N/A
[References] @image1 is the object reference (lock the perfume bottle, label included). @audio1 is the audio reuse track.
[Core idea] Luxury product film, 21:9, studio-to-sunset lighting shift; beat-synced cuts.
[Process] 0–3s: bottle rises from black marble, side light. 3–6s: cut on beat to golden-hour terrace, bottle identical. 6–8s: macro on the label, on-screen text reads "NOCTURNE".
[Edit instruction, against an existing video] Replace the cat in the video with a golden retriever. Keep the camera move, lighting and background unchanged.

Los seis errores contra los que advierte el manual

ErrorSolución
Un único párrafo indiferenciadoDivídelo en los tres bloques de la fórmula
Archivos subidos sin rol declaradoAñade «@image1 es la referencia de X» para cada archivo
Pedir música y prohibir la música de fondoElimina una de las dos, o acótalas a escenas distintas
Querer una toma continua y escribir «Plano 1 / Plano 2»Mantén un párrafo narrativo continuo, sin estructura de planos
Querer consistencia facial sin imagen de referenciaSube una, etiquetada como «referencia de personaje (fija el rostro)»
Prompt demasiado corto y sin archivosCubre como mínimo aspecto del sujeto + escena + acción + estilo

El atajo honesto

El consejo final del manual —delegar la escritura de prompts en un profesional— es la admisión del propio MiniMax de un patrón que vemos en todos los modelos de frontera: los prompts se han convertido en silencio en especificaciones, con manifiestos de referencias, bloques temporales y reglas de formato. Conocer la fórmula es lo que separa un resultado utilizable de la papilla, pero escribir prompts a nivel de especificación para cada plano de un video de varias escenas es trabajo de verdad.

Para eso exactamente construimos el agente de Pixo: describe el video que quieres y el agente escribe el guion, el storyboard y los prompts plano a plano en el dialecto nativo de cada modelo, incluida la fórmula de arriba. Cada modelo quiere un dialecto distinto, que es justo de lo que va nuestra comparativa H3 vs Seedance 2.5. MiniMax H3 llegará al storyboard de Pixo junto a Seedance, Kling y Veo. Regístrate ahora —los nuevos usuarios reciben 200 créditos gratis al registrarse— y estarás listo para poner H3 a trabajar en cuanto aterrice.

Preguntas frecuentes

¿Cuál es la fórmula oficial de prompts de MiniMax H3?

El manual de uso de MiniMax la define así: prompt completo = notas del material de referencia + idea central + descripción escena por escena. Primero declaras para qué sirve cada archivo subido, después indicas sujeto, lugar, acción y estilo, y por último describes la acción a lo largo del tiempo, con marcas de tiempo si las necesitas.

¿Cómo se hace referencia a los archivos subidos en un prompt de MiniMax H3?

Numéralos en el orden en que los subes y cítalos en línea: @image1, @video2, @audio3. Cada archivo necesita un rol declarado: fijar rostro, fijar objeto, referencia de escena, referencia de movimiento, referencia de voz, pista de ritmo, etc. Los archivos sin un propósito indicado son, con diferencia, la causa más común de que el modelo ignore una referencia.

¿Cómo evito que MiniMax H3 añada música de fondo?

Dilo de forma explícita al final del prompt: "non_diegetic_music: N/A" (o su equivalente en lenguaje natural). Los deseos en negativo que no se escriben tienden a ignorarse, y nunca pidas una banda sonora en una línea mientras prohíbes la música de fondo en otra.

¿Cómo mantengo consistente el rostro de un personaje en MiniMax H3?

Sube una imagen de referencia del personaje y etiquétala explícitamente como fijación de rostro; por ejemplo: "@image1 es la referencia de personaje (fija el rostro de esta mujer)". Querer consistencia facial sin subir una referencia etiquetada es uno de los errores habituales que enumera el manual.

¿Cuáles son los tres modos de generación de MiniMax H3?

Referencia a video (hasta 12 archivos: 9 imágenes, 3 videos y 3 audios, cada uno con un rol declarado), imagen a video con uno o dos fotogramas clave (H3 rellena el movimiento entre ellos y no se inventa cortes) y texto a video puro.

Esta guía traduce y reorganiza el propio manual de uso de H3 de MiniMax, contrastado con la documentación oficial de generación de video y la ficha del modelo publicada, leídos el 5 de agosto de 2026. Los patrones de prompt son los que usa nuestro agente en producción; el comportamiento del modelo cambia con las actualizaciones, así que trata cualquier ejemplo concreto como un punto de partida y no como una garantía.

Empieza a crear videos con IA cinematográficos hoy.

Únete a miles de creadores que usan Pixo para convertir sus historias en realidad visual.

Comenzar Gratis

Sin tarjeta de crédito • 200 créditos gratis