MiniMax H3·Guía de Prompts·Prompts de Video con IA·Hailuo 3.0·

MiniMax H3: guía de prompts, fórmula oficial y modos

Prompts de MiniMax H3 que funcionan: la fórmula oficial de tres bloques, referencias @archivo, los tres modos y los seis errores que arruinan resultados.

MiniMax H3: guía de prompts, fórmula oficial y modos

La mayor parte de lo que se ha escrito sobre cómo hacer prompts para MiniMax H3 son conjeturas: el modelo apenas tiene una semana. Esta guía no es una conjetura. MiniMax publicó un manual de uso oficial muy detallado junto al lanzamiento de H3 el 31 de julio, y enterrado en él hay algo poco común: una fórmula de prompts explícita escrita por ingenieros, una taxonomía de roles para los archivos de referencia y una lista franca de los errores que más a menudo arruinan las generaciones. Casi nada de esto había salido a la luz fuera del chino hasta ahora.

Nosotros construimos Pixo, una plataforma multimodelo de video con IA, y leer los manuales de los modelos el día que salen es parte del trabajo: nuestro agente tiene que escribir prompts con calidad de producción para cada modelo que operamos. Aquí tienes el sistema de prompting de H3, traducido y organizado para creadores en activo. (¿Nuevo con el modelo? Empieza por nuestro primer vistazo a H3.)

La fórmula oficial

Directa del manual:

Prompt completo = notas de material de referencia + idea central + descripción escena por escena

Tres bloques, en ese orden. Sáltate el primero si no subiste nada. La mayoría de los prompts fallidos de H3 rompen exactamente uno de estos bloques, normalmente amontonándolo todo en un único párrafo indiferenciado, que es el error n.º 1 de la lista del manual.

Bloque 1: notas de material de referencia

Cada archivo que subes recibe un número en orden de subida y se cita en línea como @image1, @video2, @audio3. Y cada archivo necesita un rol declarado. Vale la pena memorizar la taxonomía de roles del manual, porque es en la práctica la superficie de API de H3 en lenguaje natural:

  • Referencia de personaje — fijar un rostro o una figura
  • Referencia de objeto — fijar un producto o un atrezo
  • Referencia de escena — fijar una ubicación
  • Fotograma clave — fijar un fotograma (di explícitamente si es el primero o el último)
  • Referencia de voz — fijar un timbre de voz
  • Storyboard — generar planos siguiendo un panel de historia
  • Referencia de estilo — imitar el look de una imagen
  • Referencia de composición — imitar el encuadre y la disposición
  • Reutilización de audio — usar la pista directamente como audio del video (o reutilizar una parte)
  • Referencia de movimiento — fijar una acción a partir de un video
  • Referencia de cámara — fijar un movimiento de cámara
  • Edición de video — el video que se va a modificar

El ejemplo del manual, traducido: «@image1 es la referencia del personaje (fija el rostro de esta mujer), @video1 es la referencia de movimiento (usa los movimientos de danza de espada que contiene), @audio1 es la referencia de atmósfera (música clásica de guqin). Haz que esta mujer ejecute la danza de espada del video en un patio de cerezos en flor.»

Bloque 2: idea central

Cuatro elementos, nombrados explícitamente en el manual: sujeto (quién o qué), lugar (dónde), acción (haciendo qué) y género/estilo (acción real, animación, cinematográfico, comercial, documental, o una estética con nombre como cyberpunk o neón). Y, opcionalmente, el comportamiento de cámara: H3 corta entre planos por defecto, así que si quieres una única toma continua, dilo. Para los movimientos de cámara el manual es inusualmente específico: escribe movimientos concretos como «truck a la izquierda + paneo a la derecha» en lugar de peticiones vagas como «orbita la escena». Para los cortes puedes especificar el estilo: corte seco, fundido, sincronizado al ritmo, montaje rápido.

Bloque 3: descripción escena por escena

Describe lo que ocurre en el tiempo, segmento a segmento —«0–3s: …, 3–7s: …»—, conectando los elementos con sus archivos mediante referencias @ allí donde estén vinculados. Aquí es también donde vive el diálogo, y la regla es absoluta: escribe la línea exacta. «Ella dice algo conmovedor» produce papilla; «Ella dice: 'Viniste. La hoja ya ha esperado suficiente.'» produce la línea, con sincronía labial.

Reglas que salvan generaciones

Cuatro reglas menores del manual rinden mucho más de lo que parecen:

Escribe lo que ve la cámara, no lo que significa. H3 premia la descripción concreta, visual y directa, y tropieza con la metáfora. «Neón reflejado en su chaqueta de cuero mojada por la lluvia» gana siempre a «una atmósfera de melancolía urbana».

El texto en pantalla debe citarse exactamente. Si quieres texto en el encuadre, escríbelo: «La pantalla del teléfono muestra el título 'Creación de video con IA' con un botón que dice 'Empezar ahora'.»

Elimina la música no deseada de forma explícita. ¿Sin BGM? Termina el prompt con non_diegetic_music: N/A. Y nunca te contradigas: pedir una banda sonora en una línea y prohibir la BGM en otra es un modo de fallo de la lista.

Nombra el plano cuando cortes. Al especificar un corte, indica el nuevo tamaño de plano y qué sujeto ya establecido contiene: eso es lo que mantiene los rostros consistentes a través de los cortes.

Cómo hacer prompts en cada uno de los tres modos

Modo de referencia omni (hasta 9 imágenes + 3 videos + 3 audios): se aplica la fórmula completa; el bloque de notas de referencia es obligatorio, y un archivo sin etiquetar es un archivo desperdiciado.

Modo primer/último fotograma: sube una imagen y di si es el fotograma inicial o el final; sube dos y H3 rellena el movimiento, la iluminación y el sonido entre ambas. Un detalle crítico: en este modo no inventará cortes de cámara. El ejemplo del manual: «@image1 es el primer fotograma: una mujer sosteniendo una espada bajo un cerezo. Llévala desde la posición de guardia hasta la danza de espada completa, con fluidez natural, sin cortes.»

Texto a video puro: sin archivos, hasta 7000 caracteres de prompt. El mínimo para un resultado usable, según el manual: apariencia del sujeto + detalles de la escena + acción + estilo. Los prompts más cortos que eso son un modo de fallo documentado, no una elección de estilo.

Puntos de partida para copiar y pegar

Tres prompts construidos sobre la fórmula oficial (adáptalos libremente):

Los archivos de referencia del showcase

@image1 — los dos personajes
@image1 — los dos personajes
@video1 — referencia de acción e interpretación
[Referencias] Los personajes de @image1 siguen estrictamente los movimientos, las expresiones y el ritmo interpretativo de @video1.
[Proceso] El hombre está de pie frente al fregadero, a la derecha del encuadre, y le pasa un plato lavado a la mujer que está a la izquierda; entonces se gira y de repente le lanza espuma de detergente con la mano derecha, hacia el borde izquierdo del encuadre. Sobresaltada, ella responde al instante, y los dos empiezan a salpicarse espuma alegremente, esquivándose y riéndose a carcajadas.

Los archivos de referencia del showcase

@video1 — fuente con croma
@video2 — referencia de estilo de cuento
[Instrucción de edición, sobre dos videos existentes] Elimina el fondo de croma de @video1 y sustitúyelo por un fondo de cuento al estilo de @video2. Los elementos del fondo deben coincidir por completo con los movimientos del personaje en @video1. Ajusta la iluminación del personaje para que encaje del todo con el nuevo fondo.

Los archivos de referencia del showcase

Metraje original (gato)
[Instrucción de edición, sobre un video existente] Sustituye el gato del video por un golden retriever. Mantén sin cambios el movimiento de cámara, la iluminación y el fondo.
Pixo

Crea vídeos con IA en Pixo

Convierte tus ideas en vídeos listos para publicar. Solo necesitas una frase.

La fórmula en acción: cuatro casos resueltos

Cada uno está adaptado de un showcase del manual, y cada uno aísla una parte de la fórmula. (La biblioteca completa está en 20 prompts de MiniMax H3.)

Solo texto: [idea central] y [proceso] lo cargan todo. Sin referencias, y la dirección de arte se sostiene porque cada regla visual está formulada como una restricción:

15 segundos, 16:9. Imita por completo el lenguaje visual de un film de
lanzamiento de una marca premium: fondo negro puro, iluminación de calidad
de estudio, primeros planos rotatorios ultralentos, títulos gigantes
minimalistas en sans-serif, banda electrónica etérea. El producto es… un
pato laqueado de Pekín en su punto perfecto. La tipografía debe ser
minimalista, con espaciado generoso, una única sans-serif fina en todo el
video. Prohibido: estilo caricatura, fondos recargados, marcas de agua.

Notas de referencia al límite: tres imágenes, tres trabajos declarados. El prompt nunca describe los rostros de las modelos ni las gafas; las referencias cargan con la identidad mientras el texto carga con la actitud:

Los archivos de referencia del showcase

Imagen 1 — looks de las modelos
Imagen 1 — looks de las modelos
Imagen 2 — vistas de detalle facial
Imagen 2 — vistas de detalle facial
Imagen 3 — diseño de las gafas
Imagen 3 — diseño de las gafas
Un comercial vertical 9:16 de gafas de alta moda. Look minimalista de
estudio blanco: fondo blanco sin costuras, fuerte sensación de anuncio de
alta costura — limpio, nítido, vanguardista, con acabado de campaña
internacional. La Imagen 1 define los dos looks de cuerpo entero; mantén el
acabado del vestuario, la postura, la iluminación de estudio y la frialdad
de pasarela. Ambas llevan gafas futuristas de alta gama — diseño según la
Imagen 3: superficies curvas envolventes, silueta geométrica afilada híbrida
cat-eye/goggle, reflejos de espejo, patillas aerodinámicas. Detalles
faciales según la Imagen 2.

[Proceso] plano a plano con empaquetado. Cortes, rótulos y audio por plano escritos en orden de cámara: la gramática de tráiler del propio caso de ciencia ficción del manual:

Los archivos de referencia del showcase

Imagen 1 — atmósfera y estilo
Imagen 1 — atmósfera y estilo
Imagen 2 — protagonista
Imagen 2 — protagonista
Cine fotorrealista, luz de alto contraste, ritmo tenso. La Imagen 1 es la
referencia general de atmósfera y estilo; la Imagen 2 es el protagonista.
Plano 1 — gran plano general de apertura: una colosal puerta cósmica
circular casi llena el encuadre; la figura es una silueta diminuta abajo a
la derecha, frente a ella. Suelo mojado y reflectante, oscuridad en el
centro de la puerta. La cámara hace un push-in lento. Un título emerge del
borde oscuro, borroso y luego nítido: "LAS ESTRELLAS ESCUCHABAN" — mayúsculas
ultracondensadas y pesadas, rojo oscuro mezclado con óxido, grano ligero y
bordes velados.
Audio: pulso grave de baja frecuencia, temblor metálico lejano, un golpe
suave cuando el título se enfoca. -> Corte seco.

Tres referencias, tres modalidades. El movimiento de cámara de un video, el sujeto de otro, la canción y la interpretación de un tercero: las notas de referencia de la fórmula generalizadas al sonido:

Los archivos de referencia del showcase

Video 1 — movimiento de cámara (dolly zoom)
Video 2 — sujeto
Video 3 — canción e interpretación
El Video 1 aporta el movimiento de cámara: un dolly zoom hitchcockiano. El
Video 2 es el sujeto: una mujer tomando café en una cafetería de calle. El
Video 3 aporta la canción y la interpretación vocal. Haz que la mujer del
Video 2 cante — voz, fraseo e interpretación del Video 3 — mientras la
cámara ejecuta sobre ella el dolly zoom del Video 1.

Los seis errores sobre los que advierte el manual

ErrorSolución
Un único párrafo indiferenciadoDivídelo en los tres bloques de la fórmula
Archivos subidos, roles sin declararAñade «@image1 es la referencia de X» para cada archivo
Pedir música y prohibir la BGMElimina una de las dos, o limítalas a escenas distintas
Querer una toma única pero escribir «Plano 1 / Plano 2»Mantén un único párrafo narrativo continuo, sin estructura de planos
Querer consistencia facial sin imagen de referenciaSube una, etiquetada «referencia de personaje (fija el rostro)»
Prompt demasiado corto y sin archivosCubre como mínimo apariencia del sujeto + escena + acción + estilo

El atajo honesto

El consejo final del manual —«confía la escritura de prompts a un socio profesional»— es la admisión del propio MiniMax del patrón que vemos en todos los modelos de frontera: los prompts se han convertido silenciosamente en especificaciones, con manifiestos de referencias, bloques de tiempos y reglas de formato. Conocer la fórmula es lo que separa un resultado usable de la papilla, pero escribir prompts con calidad de especificación para cada plano de un video multiescena es trabajo de verdad.

Ese es exactamente el trabajo para el que construimos el agente de Pixo: describe el video que quieres y el agente escribe el guion, el storyboard y los prompts por plano en el dialecto nativo de cada modelo, incluida la fórmula anterior. Y MiniMax H3 ya está disponible en el Playground de Pixo: pega estos prompts, añade tus referencias (los archivos se numeran Imagen 1, Video 1… según los subes) y genera planos de 4–15 segundos a 768p o 2K. Regístrate ahora: los nuevos usuarios reciben 200 créditos gratis al registrarse, y los planes tienen ahora hasta un 55% de descuento.

Preguntas frecuentes

¿Cuál es la fórmula oficial de prompts de MiniMax H3?

El propio manual de MiniMax la define así: prompt completo = notas de material de referencia + idea central + descripción escena por escena. Primero declara para qué sirve cada archivo subido, luego indica sujeto, lugar, acción y estilo, y después describe la acción en el tiempo, con marcas de tiempo si las necesitas.

¿Cómo se referencian los archivos subidos en un prompt de MiniMax H3?

Numéralos en orden de subida y cítalos en línea: @image1, @video2, @audio3. Cada archivo necesita un rol declarado: fijar un rostro, fijar un objeto, referencia de escena, referencia de movimiento, referencia de voz, pista de ritmo, etc. Los archivos sin propósito declarado son la causa más común de referencias ignoradas.

¿Cómo evito que MiniMax H3 añada música de fondo?

Dilo explícitamente al final del prompt: «non_diegetic_music: N/A» (o su equivalente en lenguaje natural). Los deseos negativos que no se escriben tienden a ignorarse, y nunca pidas una banda sonora en una línea mientras prohíbes la BGM en otra.

¿Cómo mantengo consistente el rostro de un personaje en MiniMax H3?

Sube una imagen de referencia del personaje y etiquétala explícitamente como fijación de rostro, p. ej. «@image1 es la referencia del personaje (fija el rostro de esta mujer)». Querer consistencia facial sin subir una referencia etiquetada es uno de los errores comunes que lista el manual.

¿Cuáles son los tres modos de generación de MiniMax H3?

Referencia omni (hasta 12 archivos: 9 imágenes, 3 videos, 3 audios, cada uno con rol declarado), primer/último fotograma (una o dos imágenes; H3 rellena el movimiento intermedio y no inventa cortes) y texto a video puro (prompts de hasta 7000 caracteres).

¿Qué longitud puede tener un prompt de MiniMax H3?

Hasta 7000 caracteres, en cualquiera de los idiomas que H3 entiende. Los prompts demasiado cortos son un modo de fallo documentado: cuando no hay archivos de referencia, cubre siempre al menos la apariencia del sujeto, los detalles de la escena, la acción y el estilo.

De la idea al video final.
En una sola conversación.

Empezar a crear

Sin tarjeta de crédito • 200 créditos gratis