MiniMax H3: o que é, especificações e modos (2026)
MiniMax H3 (Hailuo 3.0) explicado: vídeo multi-plano de 15s com áudio estéreo nativo, entrada de 12 arquivos e edição por instrução. Especificações completas.

Em 31 de julho de 2026, a MiniMax lançou o modelo mais ambicioso da sua linha Hailuo — e, discretamente, mudou o que significa «modelo de vídeo». O MiniMax H3 (que a comunidade já chama de Hailuo 3.0) não se limita a transformar prompts em clipes. Ele lê texto, imagens, vídeo e áudio como um único contexto unificado, gera cenas multi-plano de 15 segundos com som estéreo embutido — e depois deixa você editar o resultado com uma instrução em linguagem natural, em vez de jogar os dados de novo.
Nós construímos o Pixo, uma plataforma de vídeo com IA multimodelo, o que significa que toda vez que um modelo de fronteira é lançado fazemos duas coisas: lemos a documentação oficial linha por linha e o testamos contra os modelos que já rodamos. Este primeiro contato se baseia no manual oficial de uso do H3 e nos materiais de lançamento da MiniMax — incluindo detalhes que ainda não chegaram à maior parte da cobertura em outras línguas, como os limites exatos de entrada, os três modos de geração e como o formato de prompt realmente funciona.
Aqui está o que o H3 é, o que é genuinamente novo e o que ele significa se você produz vídeos profissionalmente.
MiniMax H3 em resumo
| Especificação | MiniMax H3 |
|---|---|
| Lançamento | 31 de julho de 2026 (prévia na WAIC 2026) |
| Duração de saída | 4–15 segundos, 24 fps |
| Resolução | Modo 768p (atualizável para 1440p); modo 1440p «2K» oficialmente recomendado — até 2976×1248 em 21:9 |
| Proporções de tela | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Áudio | Estéreo nativo em toda saída — diálogo, ambiente e efeitos na mesma passada |
| Entrada multimodal | Até 12 arquivos: 9 imagens + 3 clipes de vídeo + 3 faixas de áudio |
| Edição | Edições por instrução sobre filmagem existente (personagens, fundos, diálogos, vozes) |
| Idiomas | Prompts multilíngues; TTS cobre 11 idiomas com precisão, ~40 por derivação |
| Limite do prompt | Até 7.000 caracteres |
| Acesso | App Hailuo AI, API da MiniMax (ID do modelo MiniMax-H3) |
A grande ideia: um contexto, todas as modalidades
A maioria das ferramentas de vídeo com IA é um encadeamento de modelos especializados: um para texto-para-vídeo, outro para sincronia labial, outro para upscaling, mais alguma coisa para o som. A aposta da MiniMax com o H3 é colapsar esse encadeamento em um único sistema «omni-modal». Nas palavras do manual oficial, o H3 deixa de tratar a geração de imagem, vídeo e som como tarefas separadas e passa a ler todos os seus materiais — um roteiro, uma referência de rosto, um clipe de movimento, uma faixa de música — como um único briefing, produzindo a partir dele uma cena audiovisual finalizada.
Na prática, isso significa que você pode entregar ao H3 até 12 arquivos em um único prompt: até 9 imagens, 3 clipes de vídeo (15 segundos no total) e 3 faixas de áudio. Cada referência recebe um papel declarado — esta imagem trava o rosto do personagem, este vídeo é a referência de movimento, esta faixa define o ritmo. O modelo os funde em vez de colá-los. Se você já tentou manter um personagem consistente enquanto também seguia uma referência de movimento e sincronizava com uma batida usando ferramentas separadas, vai entender por que isso importa.
O som não é um detalhe
Toda geração do H3 sai com áudio estéreo nativo — diálogo com sincronia labial, som de ambiente, efeitos — criado na mesma passada dos pixels. Só um punhado de modelos faz áudio nativo de verdade (Seedance 2.0, Veo 3.1 e Wan 2.6 são os outros nomes notáveis), e o H3 vai além no lado dos idiomas: seu texto-para-fala cobre 11 idiomas com precisão — chinês, inglês, japonês, coreano, francês, alemão e espanhol entre eles — com cerca de 40 outros alcançáveis por derivação. Ele também consegue clonar e migrar o timbre de voz a partir de uma faixa de referência, o que transforma «localize este anúncio para três mercados» de um projeto de produção em um prompt.
A edição é o recurso de destaque
Aqui está a parte que separa o H3 de quase todos os geradores de clipes que acompanhamos: ele aceita instruções de edição sobre filmagem existente. Os exemplos do próprio manual são maravilhosamente banais — «substitua o gato do vídeo por um cachorro» — e escalam para coisas como trocar o letreiro luminoso de uma loja de conveniência, transformar uma lata de refrigerante em um refrigerante de marca e reescrever a última fala do diálogo, tudo em uma única instrução, com todo o resto do plano permanecendo no lugar. Você pode mudar fundos e reiluminar cenas, substituir uma fala e ver a atuação se ajustar sutilmente para acompanhar, ou migrar a voz de um personagem para um timbre clonado. Dá para testar isso hoje no Playground do Pixo — envie a sua filmagem como referência de vídeo e escreva a instrução sobre ela.
Para criadores profissionais, isso ataca o hábito mais caro do vídeo com IA: regenerar do zero. Quando um plano está 90% certo, você não quer um plano novo — quer os outros 10%.

Crie vídeos com IA no Pixo
Transforme suas ideias em vídeos prontos para publicar. Basta uma frase.
Os três modos de geração
O manual define três formas distintas de conduzir o H3, e saber em qual delas você está muda como você deve escrever o prompt (escrevemos um guia de prompts do MiniMax H3 completo baseado na fórmula oficial):
1. Modo omni-referência. A entrada multimodal completa de 12 arquivos descrita acima. Você rotula o papel de cada material — trava de rosto, referência de movimento, faixa de ritmo — e descreve a cena.
2. Modo primeiro/último quadro. Dê a ele uma ou duas imagens. Com duas, o H3 as trata como primeiro e último quadros e preenche o movimento, a iluminação e o som entre elas — e, importante, ele não inventa cortes de câmera nesse modo. A proporção de tela segue a da sua imagem de entrada.
3. Texto-para-vídeo puro. Nenhuma referência; o modelo constrói sujeito, cena e ação a partir da sua descrição. Os prompts podem chegar a 7.000 caracteres, e o H3 recompensa uma escrita específica, visual e atenta à câmera, em vez de descrições vagas.
Como o H3 se encaixa no cenário atual de modelos
A resposta honesta: o H3 não domina todos os eixos, e escolheu um dia lotado para estrear. O Kling 3.0 e o Veo 3.1 ainda entregam resolução bruta maior (4K). E em 31 de julho — exatamente o mesmo dia em que o H3 saiu — a ByteDance lançou o Seedance 2.5, que estica a geração em passada única para até 180 segundos e adiciona seus próprios modos de edição por instrução. A ideia de gerar-e-depois-editar claramente não é mais exclusiva do H3; comparamos os dois carros-chefe em detalhe em MiniMax H3 vs Seedance 2.5.
O que o H3 ainda possui de forma distinta é a metade de voz e idioma da edição: reescrever uma fala e ver a atuação se ajustar, clonar uma voz a partir de uma faixa de referência e TTS em 11 idiomas no mesmo sistema que gerou a imagem. Se o seu trabalho envolve marcas, diálogos ou múltiplos mercados — em vez de planos espetaculares avulsos — essa combinação vale mais do que mais um degrau de resolução.
Um modelo sozinho ainda não é um filme, porém. Um gerador de 15 segundos se torna genuinamente útil quando entra em um storyboard ao lado de outros modelos — Seedance para uma cena de ação pesada em física, H3 para a cena de diálogo que você vai querer revisar depois. Esse fluxo multimodelo, plano a plano, é exatamente o que construímos em torno do agente do Pixo. O H3 já está disponível no Playground do Pixo para geração de plano único, e o storyboard roda Seedance 2.0, Kling 3.0 e Veo 3.1 hoje — use o hub do Hailuo como ponto de partida.
Acesso e preços
O H3 está disponível no app Hailuo AI para consumidores e pela API da plataforma aberta da MiniMax sob o ID de modelo MiniMax-H3. O preço de lançamento da API fica em torno de US$ 0,78 por um clipe 2K de 6 segundos com áudio — visivelmente acima das tarifas do Hailuo 2.3 legado (US$ 0,28 em 768p), o que mostra onde a MiniMax acha que este modelo se posiciona no mercado. A MiniMax também disse que pesos abertos estão a caminho. E a estratégia API-first claramente está funcionando: já na primeira semana, o H3 apareceu em uma onda de plataformas criativas de terceiros — o acesso bruto a este modelo está se espalhando rápido e não será o diferencial de ninguém por muito tempo.
Se você prefere trabalhar no nível de vídeos finalizados em vez de clipes brutos, o Pixo roda os principais modelos de vídeo — Seedance, Kling, Veo, Hailuo e outros — por trás de um único fluxo de storyboard conduzido por agente. O MiniMax H3 já está disponível no Playground do Pixo — gere planos de 4 a 15 segundos em 768p ou 2K, com referências de imagem, vídeo e áudio. Cadastre-se agora — novos usuários ganham 200 créditos grátis no cadastro, e os planos estão com até 55% de desconto no momento.
Perguntas frequentes
O que é o MiniMax H3?
O MiniMax H3 (também chamado de Hailuo 3.0) é um modelo de vídeo omni-modal lançado pela MiniMax em 31 de julho de 2026. Ele trata texto, imagens, vídeo e áudio como um único contexto unificado e gera vídeos multi-plano de 4 a 15 segundos em até 2K (1440p) com áudio estéreo nativo em uma única passada.
MiniMax H3 é o mesmo que Hailuo 3.0?
Sim. MiniMax é a empresa, Hailuo é a sua marca de vídeo para o consumidor e H3 é o modelo de terceira geração. O ID do modelo na API é MiniMax-H3, e boa parte da comunidade o chama de Hailuo 3.0 — é o mesmo modelo.
Qual resolução e duração o MiniMax H3 consegue gerar?
O H3 gera clipes de 4 a 15 segundos a 24 fps em seis proporções de tela, de 21:9 a 9:16. Ele roda em um modo 768p (com resultados atualizáveis para 1440p) e em um modo 1440p que a MiniMax recomenda oficialmente — em 21:9, isso chega a 2976×1248.
O MiniMax H3 gera áudio?
Sim — toda saída do H3 inclui áudio estéreo nativo gerado na mesma passada do vídeo: diálogo com sincronia labial, som ambiente e efeitos. Seu texto-para-fala cobre 11 idiomas com precisão, com cerca de 40 outros disponíveis por derivação.
O MiniMax H3 consegue editar vídeos?
Sim, e essa é a sua capacidade mais distintiva. O H3 aceita instruções de edição em linguagem natural sobre uma filmagem existente — trocar um personagem ou objeto, mudar o fundo ou a iluminação, reescrever uma fala de diálogo ou migrar uma voz — mantendo estáveis as regiões não editadas.
Como posso testar o MiniMax H3?
O H3 está disponível no app Hailuo AI, pela API da plataforma aberta da MiniMax (ID do modelo MiniMax-H3) e já aparece em diversas plataformas criativas de terceiros. O preço de lançamento da API fica em torno de US$ 0,78 por um clipe 2K de 6 segundos com áudio.
Gerar resumo com IA
Da ideia ao vídeo final.
Em uma única conversa.
Começar a criarSem necessidade de cartao de credito - 200 creditos gratis


