Video con IA con audio: sonido nativo de MiniMax H3
La mayoría de los generadores de video con IA son mudos. MiniMax H3 genera diálogo, ambiente y efectos con la imagen — estéreo y con lip-sync, en Pixo.

Hay un momento al que llega todo flujo de trabajo de video con IA: el clip se ve genial, y está completamente mudo. Así que vas a buscar una cama musical, una herramienta de TTS para la voz en off, algo para los efectos de sonido — y entonces descubres la parte difícil: una voz grabada encima de un video nunca termina de pertenecerle. El tono de sala es incorrecto, la boca no se mueve, los pasos no aterrizan en ningún sitio. El diseño de sonido se convierte en una segunda producción.
Esa es la brecha que cerró H3 de MiniMax cuando se lanzó el 31 de julio: no añade audio al video, los genera juntos. Nosotros llevamos Pixo, una plataforma de video multimodelo donde H3 ya está disponible en el Playground, y de todo lo que hay en la ficha técnica de H3, esta es la capacidad que más cambia el trabajo diario — así que aquí tienes exactamente cómo se comporta y cómo escribirle el prompt.
Qué significa realmente «audio nativo»
Cada salida de H3 incluye sonido estéreo generado en la misma pasada que la imagen. De un solo prompt salen tres capas:
- Diálogo. Escribe la frase literal y un personaje la dice — con sincronización labial, porque el movimiento de la boca y el audio provienen de la misma generación. Reescribe la frase y la interpretación la sigue.
- Ambiente. La escena suena como la escena: viento sobre un humedal, el zumbido de una cocina, tráfico tras el cristal. Más que pedirlo, lo que haces es no excluirlo.
- Efectos. Los sonidos de contacto aterrizan donde ocurre la física — una tapa hace clic al abrirse, los aleteos suenan cuando el pájaro despega.
La diferencia con el doblaje no es sutil. El audio superpuesto en posproducción habla sobre el video; el audio generado es parte de él. Cuando un personaje se gira a mitad de frase, la voz se gira con él.
Quién tiene sonido y quién no
El audio se ha convertido silenciosamente en la línea divisoria entre generaciones de modelos:
| Modelo | Audio nativo |
|---|---|
| MiniMax H3 | ✅ Estéreo en cada salida — diálogo, ambiente, efectos |
| Seedance 2.5 | ✅ Sí |
| Veo 3.1 | ✅ Sí |
| Wan 2.6 | ✅ Sí — diálogo y efectos sincronizados |
| Kling 3.0 | ❌ Salida muda |
Lo que H3 añade por encima de «tiene audio» es la pila de voz: texto a voz en varios idiomas y clonación de voz a partir de una pista de referencia — sube una voz, y el diálogo se genera con ese timbre. (Esa capacidad merece su propio análisis en profundidad; aquí nos quedamos con el caso cotidiano.)
Cuatro reglas para escribir prompts con sonido
1. El diálogo debe estar escrito. H3 no improvisa frases. Una voz cansada dice: "Abrimos en cinco minutos." genera esa frase — nada más. Las peticiones vagas («ella dice algo tranquilizador») producen resultados vagos.
2. Decide quién está en pantalla. Un interlocutor visible recibe sincronización labial; una voz fuera de plano se percibe como narración. Ambas son una línea de prompt — la diferencia está en si pones al interlocutor dentro del encuadre.
3. Elimina la música salvo que la quieras. H3 pondrá banda sonora a tu clip encantado. Si vas a añadir música con licencia en posproducción — como ocurre en la mayoría del trabajo de marca — termina el prompt con non-narrative music: N/A y mantén la pista limpia.
4. Las referencias de audio siempre acompañan, nunca van solas. Puedes subir una pista de audio (≤15MB) para marcar el ritmo o el carácter de la voz, pero debe acompañar a una referencia de imagen o video — el audio no puede ser la única entrada.
Tres prompts para copiar y pegar
1. Diálogo en pantalla con sincronización labial (16:9)
Archivos de referencia del ejemplo


Un ejemplo del manual en el mismo registro
Un diner acogedor de madrugada, luz cálida de tungsteno, lluvia ligera en la ventana.
Una mujer de unos treinta años está sentada en la barra, con las manos alrededor de una
taza de café. Levanta la vista hacia la cámara y dice: "Siempre pides lo mismo."
Sonríe levemente tras la frase. Ambiente tranquilo de diner — lluvia, una radio lejana,
cubiertos. Non-narrative music: N/A.
Por qué funciona: un interlocutor, una frase escrita, un gesto de reacción. La lista de ambiente construye el escenario sonoro sin competir con el diálogo.
2. Momento de producto narrado (9:16)
Archivos de referencia del ejemplo
Un ejemplo del manual en el mismo registro
Video vertical. Un montaje de café de filtrado manual sobre una encimera de madera, luz
de mañana. El agua caliente cae en espiral desde una tetera hacia el filtro; sube el
vapor; la cámara avanza lentamente. Una voz masculina serena dice: "Treinta gramos.
Tres minutos. Sin atajos." Sonido de agua vertiéndose y vapor suave.
Non-narrative music: N/A.
Por qué funciona: la narración fuera de plano elimina todo riesgo de sincronización labial, y los sonidos físicos (el vertido, el vapor) hacen el trabajo de atmósfera que una cama musical suele fingir.
3. La interpretación guiada por referencias (tres videos de entrada, una canción de salida)
Archivos de referencia del ejemplo
El ejemplo del manual que este prompt adapta
El Video 1 aporta el movimiento de cámara: un dolly zoom a lo Hitchcock. El Video 2 es
el sujeto: una mujer tomando café en una cafetería de calle. El Video 3 aporta la
canción y la interpretación cantada. Haz que la mujer del Video 2 cante — voz, fraseo
e interpretación del Video 3 — mientras la cámara ejecuta sobre ella el dolly zoom
del Video 1.
Por qué funciona: tres referencias, tres roles — cámara, sujeto, canción — y el audio se genera como una interpretación, no como una pista superpuesta. Es la propia demostración del manual de que la dirección de sonido es solo otro rol de referencia.
Pruébalo
MiniMax H3 ya está disponible en el Playground de Pixo: selecciona Video → MiniMax H3, escribe un prompt con la frase que quieres que se diga y genera un plano de 4–15 segundos a 768p o 2K — con sonido incluido y exportación sin marca de agua. Para el panorama completo del modelo, empieza con qué es MiniMax H3; para saber cómo se compara su pila de audio con la del otro buque insignia lanzado el mismo día, mira MiniMax H3 vs Seedance 2.5.
Preguntas frecuentes
¿Pueden los generadores de video con IA crear sonido?
Algunos sí, la mayoría no. MiniMax H3, Seedance, Veo 3.1 y Wan 2.6 generan audio de forma nativa; Kling 3.0 produce video mudo. H3 es el que más lejos llega: cada salida incluye audio estéreo — diálogo, ambiente y efectos — generado en la misma pasada que la imagen, no superpuesto después.
¿MiniMax H3 sincroniza los labios con el diálogo?
Sí. Escribe la frase exacta en tu prompt y H3 genera la voz junto con la imagen, con los movimientos de la boca del personaje coincidiendo con las palabras. Su texto a voz abarca varios idiomas, así que el diálogo no se limita al inglés.
¿Cómo hago un video con IA con voz en off?
Escribe el texto de la voz en off de forma literal en tu prompt — por ejemplo: Una voz masculina serena dice: "Las buenas herramientas desaparecen en el trabajo." H3 genera la locución junto con el video. Si el interlocutor está en pantalla, la sincronización labial lo sigue; si está fuera de plano, se percibe como narración.
¿Puedo desactivar la música de fondo?
Sí — termina tu prompt con "non-narrative music: N/A" y H3 mantiene la pista limpia: solo diálogo, ambiente y efectos. Ese es el modo a usar cuando vas a añadir música de marca con licencia en posproducción.
¿Puedo usar mi propio audio como referencia?
Sí. Sube una pista de audio (hasta 15MB) junto con una referencia de imagen o video — el audio no puede ser la única entrada — y úsala para marcar el ritmo o el carácter de la voz. H3 también admite clonación de voz a partir de una pista de referencia.
¿Cómo lo pruebo?
MiniMax H3 ya está disponible en el Playground de Pixo — genera planos de 4–15 segundos a 768p o 2K. Los nuevos usuarios reciben 200 créditos gratis al registrarse, y los planes tienen ahora hasta un 55% de descuento.
MiniMax H3 ya está disponible en el Playground de Pixo — genera planos de 4–15 segundos a 768p o 2K, con referencias de imagen, video y audio. Regístrate ahora — los nuevos usuarios reciben 200 créditos gratis al registrarse, y los planes tienen ahora hasta un 55% de descuento. ¿Vas a poner productos en pantalla? Mira videos de producto para e-commerce con H3.
Empieza a crear videos con IA cinematográficos hoy.
Únete a miles de creadores que usan Pixo para convertir sus historias en realidad visual.
Comenzar GratisSin tarjeta de crédito • 200 créditos gratis


