Guia de prompts do MiniMax H3: fórmula oficial e modos
Como escrever prompts que funcionam no MiniMax H3: a fórmula oficial em três blocos, referências @arquivo, os três modos de geração e seis erros a evitar.

Quase tudo o que já se escreveu sobre como escrever prompts para o MiniMax H3 é chute — o modelo tem pouco mais de uma semana de vida. Este guia não é chute. A MiniMax publicou um manual de uso detalhado junto com o lançamento do H3 em 31 de julho, e enterrado nele há algo raro: uma fórmula de prompt explícita, escrita por engenheiros, uma taxonomia de papéis para arquivos de referência e uma lista franca dos erros que mais estragam gerações. Quase nada disso tinha aparecido em inglês até agora.
Nós construímos o Pixo, uma plataforma multimodelo de vídeo com IA, e ler manuais de modelos no dia em que saem faz parte do trabalho — nosso agente precisa escrever prompts de nível de produção para cada modelo que rodamos. Aqui está o sistema de prompts do H3, traduzido e organizado para quem produz de verdade, conferido com a documentação oficial de geração de vídeo da MiniMax. (Não conhece o modelo ainda? Comece pela nossa primeira análise do H3.)
A fórmula oficial
Direto do manual:
Prompt completo = notas sobre o material de referência + ideia central + descrição cena a cena
Três blocos, nessa ordem. Pule o primeiro se você não enviou nenhum arquivo. A maioria dos prompts que falham no H3 quebra exatamente um desses blocos — normalmente amontoando tudo num único parágrafo indiferenciado, que é o erro nº 1 listado no manual.
Bloco 1: notas sobre o material de referência
Todo arquivo enviado recebe um número na ordem de envio, citado no texto como @image1, @video2, @audio3. E todo arquivo precisa de um papel declarado. Vale memorizar essa taxonomia de papéis, porque ela é, na prática, a superfície de API do H3 em linguagem natural:
- Referência de personagem — trava um rosto ou uma figura
- Referência de objeto — trava um produto ou objeto de cena
- Referência de cena — trava uma locação
- Quadro-chave — trava um quadro (diga explicitamente se é o primeiro ou o último)
- Referência de voz — trava um timbre de voz
- Storyboard — gera planos seguindo um quadro de história
- Referência de estilo — replica a aparência de uma imagem
- Referência de composição — replica enquadramento e layout
- Reuso de áudio — usa a faixa diretamente como áudio do vídeo (ou reaproveita parte dela)
- Referência de movimento — trava uma ação vinda de um vídeo
- Referência de câmera — trava um movimento de câmera
- Edição de vídeo — o vídeo a ser modificado
O exemplo do manual, traduzido: «@image1 é a referência de personagem (trave o rosto desta mulher), @video1 é a referência de movimento (use os movimentos da dança com espada), @audio1 é a referência de clima (peça clássica de guqin). Faça esta mulher executar a dança com espada do vídeo em um pátio de cerejeiras em flor.»
Lembre-se do teto rígido do model card: 12 arquivos no total — no máximo 9 imagens, 3 clipes de vídeo e 3 faixas de áudio, com vídeo e áudio limitados a 15 segundos cada no total.
Bloco 2: ideia central
Quatro elementos, nomeados explicitamente no manual: sujeito (quem ou o quê), lugar (onde), evento (fazendo o quê) e gênero/estilo (live-action, animação, cinematográfico, publicitário, documental — ou uma estética nomeada, como cyberpunk ou neon). Além disso, opcionalmente, o comportamento de câmera: o H3 corta entre planos por padrão, então, se você quer uma única tomada contínua, diga. Para movimentos de câmera, o manual é incomumente específico — escreva movimentos concretos, como «travelling para a esquerda + panorâmica para a direita», em vez de pedidos vagos como «orbite a cena». Para os cortes, você pode especificar o estilo: corte seco, fusão, sincronizado com a batida, montagem rápida.
Bloco 3: descrição cena a cena
Descreva o que acontece ao longo do tempo, trecho a trecho — «0–3s: …, 3–7s: …» —, ligando elementos aos arquivos com referências @ sempre que houver vínculo. É também aqui que mora o diálogo, e a regra é absoluta: escreva a fala exata. «Ela diz algo emocionante» produz papa; «Ela diz: ‹Você veio. A lâmina já esperou o bastante.›» produz a fala, com sincronia labial.
Regras que salvam gerações
Quatro regrinhas do manual valem muito mais do que o tamanho sugere:
Escreva o que a câmera vê, não o que aquilo significa. O H3 recompensa descrição concreta, visual e direta, e tropeça em metáfora. «Neon refletindo na jaqueta de couro molhada de chuva» vence «uma atmosfera de melancolia urbana» sempre.
Texto em tela precisa vir entre aspas, exatamente. Se você quer texto no quadro, escreva-o: «A tela do celular mostra o título ‹AI Video Creation› com um botão escrito ‹Start Now›.»
Mate a música indesejada de forma explícita. Nada de música de fundo? Termine o prompt com non_diegetic_music: N/A. E nunca se contradiga — pedir trilha sonora em uma linha e proibir música de fundo em outra é um modo de falha listado.
Nomeie o plano quando cortar. Ao especificar um corte, diga o novo tamanho de plano e qual sujeito já estabelecido ele contém — é isso que mantém os rostos consistentes entre cortes.
Como escrever para cada um dos três modos
Modo referência (até 9 imagens + 3 vídeos + 3 áudios): vale a fórmula completa — o bloco de notas de referência é obrigatório, e arquivo sem rótulo é arquivo desperdiçado.
Imagem para vídeo / primeiro-último quadro: envie uma imagem e diga se ela é o quadro de abertura ou de fechamento; envie duas e o H3 preenche o movimento, a iluminação e o som entre elas. Fundamental: nesse modo ele não inventa cortes de câmera — o exemplo do manual: «@image1 é o primeiro quadro: uma mulher segurando uma espada sob uma cerejeira. Leve-a da posição de guarda até a dança com espada completa, com fluidez, sem cortes.»
Texto para vídeo puro: sem arquivos, e com um teto generoso — o manual coloca o limite do prompt em 7.000 caracteres. O piso para um resultado utilizável: aparência do sujeito + detalhes da cena + ação + estilo. Prompts mais curtos que isso são um modo de falha documentado, não uma escolha estilística.
Pontos de partida para copiar e colar
Três prompts construídos sobre a fórmula oficial (adapte à vontade):
[Referências] @image1 é a referência de personagem (trave o rosto dela). @image2 é a referência de cena.
[Ideia central] Uma mulher em um beco de neon encharcado de chuva em Tóquio, à noite; live-action cinematográfico; uma única tomada contínua, aproximação lenta.
[Processo] 0–4s: ela caminha em direção à câmera, chuva na jaqueta, ruído distante de tráfego. 4–8s: ela para, olha para cima; ela diz: "Nunca foi por dinheiro." A chuva ambiente continua. non_diegetic_music: N/A[Referências] @image1 é a referência de objeto (trave o frasco de perfume, rótulo incluído). @audio1 é a faixa de reuso de áudio.
[Ideia central] Filme de produto de luxo, 21:9, transição de luz de estúdio para pôr do sol; cortes sincronizados com a batida.
[Processo] 0–3s: o frasco sobe do mármore preto, luz lateral. 3–6s: corte na batida para um terraço em golden hour, frasco idêntico. 6–8s: macro no rótulo, texto em tela lê "NOCTURNE".[Instrução de edição, sobre um vídeo existente] Substitua o gato do vídeo por um golden retriever. Mantenha o movimento de câmera, a iluminação e o fundo inalterados.Os seis erros contra os quais o manual alerta
| Erro | Correção |
|---|---|
| Um único parágrafo indiferenciado | Divida nos três blocos da fórmula |
| Arquivos enviados, papéis não declarados | Escreva «@image1 é a referência de X» para cada arquivo |
| Pedir música e proibir música de fundo | Apague um dos dois — ou delimite cada um a cenas diferentes |
| Querer tomada única e escrever «Plano 1 / Plano 2» | Mantenha um parágrafo narrativo contínuo, sem estrutura de planos |
| Querer consistência facial sem imagem de referência | Envie uma, rotulada como «referência de personagem (trave o rosto)» |
| Prompt curto demais e sem arquivos | Cubra, no mínimo, aparência do sujeito + cena + ação + estilo |
O atalho honesto
O conselho final do manual — entregar a escrita dos prompts a um parceiro profissional — é a própria MiniMax admitindo o padrão que vemos em todo modelo de fronteira: prompts viraram, discretamente, especificações, com manifesto de referências, blocos de tempo e regras de formatação. Conhecer a fórmula é o que separa resultado utilizável de papa, mas escrever prompts de nível de especificação para cada plano de um vídeo de várias cenas é trabalho de verdade.
Foi exatamente para isso que construímos o agente do Pixo: descreva o vídeo que você quer e o agente escreve o roteiro, o storyboard e os prompts plano a plano no dialeto nativo de cada modelo — a fórmula acima incluída. Modelos diferentes querem dialetos diferentes, que é justamente o ponto do nosso comparativo H3 vs Seedance 2.5. O MiniMax H3 está chegando ao storyboard do Pixo ao lado de Seedance, Kling e Veo. Cadastre-se agora — novos usuários ganham 200 créditos grátis no cadastro — e você estará pronto para colocar o H3 para trabalhar assim que ele chegar.
Perguntas frequentes
Qual é a fórmula oficial de prompt do MiniMax H3?
O manual de uso da MiniMax define assim: prompt completo = notas sobre o material de referência + ideia central + descrição cena a cena. Primeiro declare para que serve cada arquivo enviado, depois informe sujeito, lugar, evento e estilo, e então descreva a ação ao longo do tempo — com marcações de tempo, se precisar.
Como referenciar arquivos enviados em um prompt do MiniMax H3?
Numere os arquivos na ordem de envio e cite-os no texto — @image1, @video2, @audio3. Todo arquivo precisa de um papel declarado: trava de rosto, trava de objeto, referência de cena, referência de movimento, referência de voz, faixa de ritmo e assim por diante. Arquivos sem finalidade declarada são a causa mais comum de referências ignoradas.
Como impedir que o MiniMax H3 acrescente música de fundo?
Diga isso explicitamente no fim do prompt: "non_diegetic_music: N/A" (ou o equivalente em linguagem comum). Desejos negativos que não estão escritos tendem a ser ignorados — e nunca peça uma trilha sonora em uma linha e proíba música de fundo em outra.
Como manter o rosto de um personagem consistente no MiniMax H3?
Envie uma imagem de referência do personagem e rotule-a explicitamente como trava de rosto — por exemplo, "@image1 é a referência de personagem (trave o rosto desta mulher)". Querer consistência facial sem enviar uma referência rotulada é um dos erros comuns listados no manual.
Quais são os três modos de geração do MiniMax H3?
Referência para vídeo (até 12 arquivos — 9 imagens, 3 vídeos, 3 áudios — cada um com um papel declarado), imagem para vídeo usando um ou dois quadros-chave (o H3 preenche o movimento entre eles e não inventa cortes) e texto para vídeo puro.
Este guia traduz e reorganiza o próprio manual de uso do H3 da MiniMax, conferido com a documentação oficial de geração de vídeo e o model card publicado em 5 de agosto de 2026. Os padrões de prompt são os que nosso agente usa em produção; o comportamento do modelo muda a cada atualização, então trate qualquer exemplo isolado como ponto de partida, não como garantia.
Comece a criar videos com IA cinematograficos hoje.
Junte-se a milhares de criadores usando o Pixo para transformar suas histórias em realidade visual.
Comece GratuitamenteSem necessidade de cartao de credito - 200 creditos gratis


