O que é o MiniMax H3? Specs, modos e primeira análise
MiniMax H3 (Hailuo 3.0) explicado: vídeo de 15s com áudio estéreo nativo, 12 arquivos de entrada, edição por instrução — e pesos abertos com ressalva.

Em 31 de julho de 2026, a MiniMax lançou o modelo mais ambicioso da sua linha Hailuo — e, sem alarde, mudou o que significa «modelo de vídeo». O MiniMax H3 (que a comunidade já chama de Hailuo 3.0) não se limita a transformar prompts em clipes. Ele lê texto, imagens, vídeo e áudio como um único contexto unificado, gera cenas de 15 segundos com som estéreo embutido — e depois deixa você editar o resultado com uma instrução em linguagem comum, em vez de jogar os dados de novo.
Nós construímos o Pixo, uma plataforma multimodelo de vídeo com IA, o que significa que a cada modelo de fronteira que sai fazemos duas coisas: ler a documentação oficial linha por linha e testá-lo contra os modelos que já rodamos. Esta primeira análise se baseia na documentação oficial de geração de vídeo da MiniMax e no model card do H3 — incluindo detalhes que ainda não apareceram na maior parte da cobertura em inglês, como os limites exatos de entrada, os três modos de geração e a restrição de licença que decide se você pode ou não rodar este modelo.
Aqui está o que é o H3, o que há de genuinamente novo e o que isso significa para quem vive de fazer vídeo.
MiniMax H3 em resumo
| Especificação | MiniMax H3 |
|---|---|
| Lançamento | 31 de julho de 2026 (pesos vieram em 3 de agosto) |
| Arquitetura | Transformer omnimodal denso de fluxo único, 33B de parâmetros |
| Duração da saída | 4 a 15 segundos, 24 fps |
| Resolução | 768p por padrão; até 2K |
| Proporções | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Áudio | Estéreo nativo a 32 kHz — diálogo, ambiência e efeitos na mesma passada |
| Entrada multimodal | Até 12 arquivos no total: ≤9 imagens + ≤3 clipes de vídeo + ≤3 faixas de áudio |
| Edição | Edições por instrução sobre material existente |
| Idiomas | Fala em 11 idiomas |
| Acesso | App Hailuo AI, API da MiniMax (ID do modelo MiniMax-H3), pesos abertos |
A grande ideia: um contexto, todas as modalidades
A maioria das ferramentas de vídeo com IA é uma cadeia de modelos de propósito específico: um para texto para vídeo, outro para sincronia labial, outro para upscaling, mais algum para som. A proposta da MiniMax com o H3 é colapsar essa cadeia em um único sistema «omnimodal» — arquiteturalmente, um transformer denso de 33B de parâmetros que lê todas as modalidades em um só fluxo, em vez de pendurar encoders num backbone de vídeo. Na prática, isso significa que ele deixa de tratar geração de imagem, vídeo e som como tarefas separadas e passa a ler todo o seu material — um roteiro, uma referência de rosto, um clipe de movimento, uma faixa musical — como um único briefing, e a partir dele produz uma cena audiovisual acabada.
Concretamente, você pode entregar ao H3 até 12 arquivos em um único prompt: até 9 imagens, 3 clipes de vídeo (15 segundos no total) e 3 faixas de áudio. Cada referência recebe um papel declarado — esta imagem trava o rosto do personagem, este vídeo é a referência de movimento, esta faixa define o ritmo. O modelo funde as referências em vez de colar uma ao lado da outra. Se você já tentou manter um personagem consistente ao mesmo tempo em que segue uma referência de movimento e sincroniza com uma batida usando ferramentas separadas, vai entender por que isso importa.
Som não é um detalhe de última hora
Toda geração do H3 vem com áudio estéreo nativo a 32 kHz — diálogo com sincronia labial, som de ambiente, efeitos — criado na mesma passada dos pixels. Apenas um punhado de modelos faz áudio nativo de verdade, e o H3 vai além no lado dos idiomas: a fala cobre 11 idiomas — árabe, chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo e espanhol. Ele também clona e migra o timbre de voz a partir de uma faixa de referência, o que transforma «localizar este anúncio para três mercados» de um projeto de produção em um prompt.
A edição é o recurso de destaque
Aqui está a parte que separa o H3 de quase todo gerador de clipes que acompanhamos: ele aceita instruções de edição sobre material já existente. Os próprios exemplos da MiniMax são deliciosamente banais — «substitua o gato do vídeo por um cachorro» — e escalam para coisas como trocar o letreiro luminoso de uma loja de conveniência, transformar uma lata de refrigerante em uma cola de marca e reescrever a fala final, tudo em uma única instrução e com todo o resto do plano intacto. Você pode trocar fundos e reiluminar cenas, substituir uma fala e ver a atuação se ajustar sutilmente, ou migrar a voz de um personagem para um timbre clonado.
Para quem produz no dia a dia, isso ataca o hábito mais caro do vídeo com IA: gerar de novo. Quando um plano está 90% certo, você não quer um plano novo — quer os outros 10%.
Os três modos de geração
A documentação define três formas distintas de comandar o H3, e saber em qual você está muda a maneira de escrever o prompt (fizemos um guia completo de prompts do MiniMax H3 baseado na fórmula oficial):
1. Modo referência. A entrada multimodal completa de 12 arquivos descrita acima. Você rotula o papel de cada ativo — trava de rosto, referência de movimento, faixa de ritmo — e descreve a cena.
2. Modo imagem para vídeo / primeiro-último quadro. Você dá uma ou duas imagens. Com duas, o H3 as trata como primeiro e último quadro e preenche o movimento, a iluminação e o som entre elas — e, notadamente, não inventa cortes de câmera nesse modo. A proporção segue a da imagem de entrada.
3. Texto para vídeo puro. Sem nenhuma referência; o modelo constrói sujeito, cena e ação a partir da sua descrição. O H3 recompensa escrita específica, visual e consciente de câmera, não «vibes».
Pesos abertos — com uma ressalva territorial
Este é o detalhe que a maior parte da cobertura pulou, e é o que decide se o H3 é utilizável para você.
Em 3 de agosto, a MiniMax publicou os pesos do H3 no Hugging Face — um lançamento genuinamente aberto de um modelo de vídeo de fronteira, e o oposto estratégico da ByteDance mantendo o Seedance fechado. Mas ele veio sob a MiniMax H3 Community Licence, não sob Apache ou MIT, e o texto da licença define seu «Território Aplicável» como o mundo todo exceto União Europeia, Reino Unido, República da Coreia e Estados Unidos da América.
Em bom português: se você está nos EUA, na UE, no Reino Unido ou na Coreia do Sul, a licença comunitária não lhe concede o direito de rodar esses pesos localmente. Uso comercial nos demais territórios também exige autorização por escrito separada acima de US$ 20 milhões de receita anual, além de atribuição visível a «MiniMax H3» no seu produto.
Para a maioria dos nossos leitores, isso faz da API hospedada — ou de uma plataforma que licencia o acesso — o caminho prático, e não uma implantação local. É uma restrição incomum, e vale conhecer antes de você orçar horas de GPU para um modelo que talvez não tenha licença para rodar.
Onde o H3 se encaixa no cenário atual de modelos
A resposta honesta: o H3 não domina todos os eixos, e escolheu um dia lotado para estrear. Kling 3.0 e Veo 3.1 ainda entregam resolução bruta maior. E em 31 de julho — exatamente o mesmo dia do H3 — a ByteDance lançou o Seedance 2.5 globalmente no Dreamina, que leva a geração a tomadas únicas de 30 segundos com um modo de vídeo longo chegando a três minutos, e adiciona seus próprios modos de edição com marcação de tempo. A ideia de gerar e depois editar claramente não é mais exclusividade do H3; comparamos os dois carros-chefe em detalhe em MiniMax H3 vs Seedance 2.5.
O que o H3 ainda tem de exclusivo é a metade de voz e idioma da edição: reescrever uma fala e ver a atuação se ajustar, clonar uma voz a partir de uma faixa de referência e falar 11 idiomas no mesmo sistema que gerou a imagem. Se o seu trabalho envolve marcas, diálogo ou vários mercados — em vez de planos espetaculares avulsos —, essa combinação vale mais do que mais um degrau de resolução.
Ainda assim, um modelo não é um filme. Um gerador de 15 segundos se torna realmente útil quando entra num storyboard ao lado de outros modelos — Seedance para uma batida de ação carregada de física, H3 para a cena de diálogo que você vai querer revisar depois. Esse fluxo multimodelo por plano é exatamente aquilo em torno do qual construímos o agente do Pixo, e é por isso que estamos preparando a chegada do H3 ao storyboard do Pixo ao lado de Seedance 2.0, Kling 3.0 e Veo 3.1.
Acesso e preços
O H3 já está no ar no app de consumo Hailuo AI e na API da plataforma aberta da MiniMax sob o ID de modelo MiniMax-H3. O preço de tabela é US$ 0,13 por segundo de vídeo em 2K — cerca de US$ 0,78 por um clipe de 6 segundos com áudio — com uma faixa mais barata em 768p. Isso fica visivelmente acima das tarifas do antigo Hailuo 2.3, o que diz onde a MiniMax acha que esse modelo se posiciona no mercado. E a estratégia API-first está claramente funcionando: já na primeira semana, o H3 apareceu em uma leva de plataformas criativas de terceiros. O acesso bruto a este modelo se espalha rápido, e não será o diferencial de ninguém por muito tempo.
Se você prefere trabalhar no nível de vídeos acabados em vez de clipes soltos, o Pixo roda os principais modelos de vídeo — Seedance, Kling, Veo, Hailuo e outros — por trás de um fluxo de storyboard conduzido por agente, e o MiniMax H3 está a caminho desse elenco. Cadastre-se agora — novos usuários ganham 200 créditos grátis no cadastro — e você estará pronto para dirigir o H3 assim que ele chegar.
Perguntas frequentes
O que é o MiniMax H3?
O MiniMax H3 (também chamado de Hailuo 3.0) é um modelo de vídeo omnimodal lançado pela MiniMax em 31 de julho de 2026. Ele trata texto, imagens, vídeo e áudio como um único contexto unificado e gera vídeos de 4 a 15 segundos em até 2K com áudio estéreo nativo em uma só passada.
MiniMax H3 e Hailuo 3.0 são a mesma coisa?
Sim. MiniMax é a empresa, Hailuo é a marca de vídeo voltada ao consumidor e H3 é o modelo de terceira geração. O ID do modelo na API é MiniMax-H3, e boa parte da comunidade chama o modelo de Hailuo 3.0 — é o mesmo modelo.
O MiniMax H3 gera áudio?
Sim — toda saída do H3 inclui áudio estéreo nativo a 32 kHz gerado na mesma passada do vídeo: diálogo com sincronia labial, som ambiente e efeitos. A fala cobre 11 idiomas, incluindo chinês, inglês, japonês, coreano, árabe, francês, alemão, italiano, português, russo e espanhol.
O MiniMax H3 consegue editar vídeos?
Sim, e esse é o recurso mais distintivo dele. O H3 aceita instruções de edição em linguagem comum sobre material já existente — trocar um personagem ou objeto, mudar o fundo ou a iluminação, reescrever uma fala ou migrar uma voz — mantendo estáveis as regiões que não foram editadas.
O MiniMax H3 é open source?
A MiniMax publicou os pesos de 33B de parâmetros no Hugging Face em 3 de agosto de 2026, mas sob uma licença comunitária, não uma licença open source padrão. A licença exclui Estados Unidos, União Europeia, Reino Unido e Coreia do Sul do seu Território Aplicável, então criadores nessas regiões devem usar a API hospedada em vez de rodar o modelo por conta própria.
As especificações deste artigo foram lidas na documentação oficial de geração de vídeo da MiniMax, no model card do MiniMax-H3 no Hugging Face e no texto publicado da licença em 5 de agosto de 2026, e cruzadas com os modelos que rodamos em produção no Pixo. Preços e termos de licença mudam — confira as fontes primárias antes de fazer seu orçamento.
Comece a criar videos com IA cinematograficos hoje.
Junte-se a milhares de criadores usando o Pixo para transformar suas histórias em realidade visual.
Comece GratuitamenteSem necessidade de cartao de credito - 200 creditos gratis


