MiniMax H3: guia de prompts, fórmula oficial e modos
Prompts para o MiniMax H3 que funcionam: a fórmula oficial em três partes, referências @arquivo, os três modos de geração e os seis erros que arruínam saídas.

A maior parte do que foi escrito sobre prompting no MiniMax H3 é chute — o modelo mal completou uma semana. Este guia não é chute. A MiniMax publicou um manual oficial de uso detalhado junto do lançamento do H3 em 31 de julho, e enterrado nele há algo raro: uma fórmula de prompt explícita, escrita por engenheiros, uma taxonomia de papéis das referências de arquivo e uma lista franca dos erros que mais frequentemente arruínam as gerações. Quase nada disso tinha aparecido fora do chinês até agora.
Nós construímos o Pixo, uma plataforma de vídeo com IA multimodelo, e ler os manuais dos modelos no dia em que saem faz parte do trabalho — nosso agente precisa escrever prompts de nível de produção para cada modelo que rodamos. Aqui está o sistema de prompting do H3, traduzido e organizado para criadores profissionais. (Novo no modelo em si? Comece pelo nosso primeiro contato com o H3.)
A fórmula oficial
Direto do manual:
Prompt completo = notas dos materiais de referência + ideia central + descrição cena a cena
Três blocos, nessa ordem. Pule o primeiro se você não enviou nada. A maioria dos prompts fracassados do H3 quebra exatamente um desses blocos — geralmente amassando tudo em um único parágrafo indiferenciado, que é o erro nº 1 listado pelo manual.
Bloco 1: notas dos materiais de referência
Todo arquivo que você envia recebe um número na ordem de envio, citado no texto como @image1, @video2, @audio3. E todo arquivo precisa de um papel declarado. A taxonomia de papéis do manual vale a pena decorar, porque ela é, na prática, a superfície de API do H3 em linguagem natural:
- Referência de personagem — travar um rosto ou uma figura
- Referência de objeto — travar um produto ou adereço
- Referência de cena — travar uma locação
- Quadro-chave — travar um quadro (diga explicitamente se é o primeiro ou o último)
- Referência de voz — travar um timbre de voz
- Storyboard — gerar planos seguindo um painel de história
- Referência de estilo — reproduzir o visual de uma imagem
- Referência de composição — reproduzir enquadramento e layout
- Reuso de áudio — usar a faixa diretamente como o áudio do vídeo (ou reutilizar parte dela)
- Referência de movimento — travar uma ação a partir de um vídeo
- Referência de câmera — travar um movimento de câmera
- Edição de vídeo — o vídeo a ser modificado
O exemplo do manual, traduzido: «@image1 é a referência do personagem (trave o rosto desta mulher), @video1 é a referência de movimento (use os movimentos de dança com espada que aparecem nele), @audio1 é a referência de clima (trilha clássica de guqin). Faça esta mulher executar a dança com espada do vídeo em um pátio de cerejeiras em flor.»
Bloco 2: ideia central
Quatro elementos, nomeados explicitamente no manual: sujeito (quem ou o quê), lugar (onde), evento (fazendo o quê) e gênero/estilo (live-action, animação, cinematográfico, comercial, documental — ou uma estética nomeada, como cyberpunk ou neon). Mais, opcionalmente, o comportamento de câmera: o H3 corta entre planos por padrão, então, se você quer uma única tomada contínua, diga isso. Para movimentos de câmera, o manual é incomumente específico — escreva movimentos concretos como «truck para a esquerda + pan para a direita» em vez de pedidos vagos como «orbite a cena». Para os cortes, você pode especificar o estilo: corte seco, fade, sincronizado com a batida, montagem rápida.
Bloco 3: descrição cena a cena
Descreva o que acontece ao longo do tempo, segmento por segmento — «0–3s: …, 3–7s: …» — conectando os elementos aos arquivos com referências @ sempre que estiverem vinculados. É aqui também que mora o diálogo, e a regra é absoluta: escreva a fala exata. «Ela diz algo comovente» produz mingau; «Ela diz: 'Você veio. A lâmina já esperou o bastante.'» produz a fala, com sincronia labial.
Regras que salvam gerações
Quatro regras menores do manual rendem muito mais do que parecem:
Escreva o que a câmera vê, não o que aquilo significa. O H3 recompensa descrições concretas, visuais e diretas, e tropeça em metáforas. «Neon refletido no asfalto molhado sobre a jaqueta de couro dela» ganha de «uma atmosfera de melancolia urbana» todas as vezes.
Texto na tela deve ser citado exatamente. Se você quer texto no quadro, escreva-o: «A tela do celular mostra o título 'Criação de Vídeo com IA' com um botão escrito 'Comece Agora'.»
Mate a música indesejada explicitamente. Sem BGM? Termine o prompt com non_diegetic_music: N/A. E nunca se contradiga — pedir trilha sonora em uma linha e proibir BGM em outra é um modo de falha listado.
Nomeie o plano quando cortar. Ao especificar um corte, declare o novo tamanho de plano e qual sujeito já estabelecido ele contém — é isso que mantém os rostos consistentes entre os cortes.
Como escrever para cada um dos três modos
Modo omni-referência (até 9 imagens + 3 vídeos + 3 áudios): a fórmula completa se aplica — o bloco de notas de referência é obrigatório, e arquivos sem rótulo são arquivos desperdiçados.
Modo primeiro/último quadro: envie uma imagem e diga se ela é o quadro de abertura ou de fechamento; envie duas e o H3 preenche o movimento, a iluminação e o som entre elas. Ponto crítico: ele não inventa cortes de câmera nesse modo — o exemplo do manual: «@image1 é o primeiro quadro: uma mulher segurando uma espada sob uma cerejeira. Leve-a da posição de prontidão até a dança com espada completa, fluindo naturalmente, sem cortes.»
Texto-para-vídeo puro: nenhum arquivo, até 7.000 caracteres de prompt. O mínimo para um resultado utilizável, segundo o manual: aparência do sujeito + detalhes da cena + ação + estilo. Prompts mais curtos que isso são um modo de falha documentado, não uma escolha de estilo.
Pontos de partida para copiar e colar
Três prompts construídos sobre a fórmula oficial (adapte à vontade):
Arquivos de referência do showcase

[Referências] Os personagens de @image1 seguem estritamente os movimentos, as expressões e o ritmo de atuação de @video1.
[Processo] O homem está em pé diante da pia, à direita do quadro, e entrega um prato lavado à mulher à esquerda; em seguida se vira e de repente lança espuma de detergente nela com a mão direita, em direção à borda esquerda do quadro. Assustada, ela revida na hora, e os dois começam a se ensopar de espuma alegremente, desviando e rindo muito.Arquivos de referência do showcase
[Instrução de edição, sobre dois vídeos existentes] Remova o fundo de chroma key de @video1 e substitua-o por um fundo de conto de fadas no estilo de @video2. Os elementos do fundo devem corresponder totalmente aos movimentos do personagem em @video1. Ajuste a iluminação do personagem para que combine completamente com o novo fundo.Arquivos de referência do showcase
[Instrução de edição, sobre um vídeo existente] Substitua o gato do vídeo por um golden retriever. Mantenha o movimento de câmera, a iluminação e o fundo inalterados.
Crie vídeos com IA no Pixo
Transforme suas ideias em vídeos prontos para publicar. Basta uma frase.
A fórmula na prática: quatro casos comentados
Cada um destes é adaptado de um showcase do manual, e cada um isola uma parte da fórmula. (A biblioteca completa está em 20 prompts para o MiniMax H3.)
Só texto — [ideia central] e [processo] carregam tudo. Nenhuma referência, e a direção de arte se sustenta mesmo assim, porque cada regra visual está declarada como restrição:
15 segundos, 16:9. Imite integralmente a linguagem visual de um filme de
lançamento de marca premium: fundo preto puro, iluminação de estúdio,
close-ups giratórios ultralentos, títulos gigantes minimalistas em
sans-serif, trilha eletrônica etérea. O produto é — um pato de Pequim
perfeitamente assado. A tipografia deve ser minimalista, com espaçamento
generoso, uma única sans-serif fina do início ao fim. Proibido: estilo
cartoon, fundos poluídos, marcas d'água.Notas de referência no limite — três imagens, três papéis declarados. O prompt nunca descreve os rostos das modelos nem os óculos; as referências carregam a identidade enquanto o texto carrega a atitude:
Arquivos de referência do showcase



Um comercial vertical 9:16 de óculos de alta moda. Visual de estúdio branco
minimalista: fundo branco contínuo, forte clima de anúncio de alta-costura —
limpo, nítido, vanguardista, acabamento de campanha internacional. A Imagem
1 define os dois looks de corpo inteiro; mantenha o acabamento do figurino,
a postura, a iluminação de estúdio e a frieza de passarela. Ambas usam
óculos futuristas de alto padrão — design conforme a Imagem 3: superfícies
curvas envolventes, contorno geométrico afiado híbrido de gatinho/goggle,
reflexos espelhados, hastes aerodinâmicas. Detalhes faciais conforme a
Imagem 2.[Processo] plano a plano com embalagem. Cortes, cartelas de título e áudio por plano escritos na ordem da câmera — a gramática de trailer do caso de ficção científica do próprio manual:
Arquivos de referência do showcase


Cinema fotorrealista, luz de alto contraste, ritmo apertado. A Imagem 1 é a
referência geral de atmosfera e estilo; a Imagem 2 é o protagonista.
Plano 1 — grande plano geral de estabelecimento: um colossal portal cósmico
circular quase preenche o quadro; a figura é uma silhueta minúscula no canto
inferior direito diante dele. Chão molhado e reflexivo, escuridão no centro
do portal. A câmera avança lentamente. Um título surge sangrando da borda
escura, desfocado e depois nítido: "AS ESTRELAS ESTAVAM OUVINDO" — caixa
alta ultraestreita e pesada, vermelho-escuro misturado com ferrugem, granulação
leve e bordas esfumadas.
Áudio: pulso grave de baixa frequência, tremor metálico distante, um golpe
suave quando o título fica nítido. -> Corte seco.Três referências, três modalidades. Movimento de câmera de um vídeo, sujeito de outro, música e atuação de um terceiro — as notas de referência da fórmula generalizadas para o som:
Arquivos de referência do showcase
O Vídeo 1 fornece o movimento de câmera: um dolly zoom hitchcockiano. O
Vídeo 2 é o sujeito: uma mulher tomando café em um café de rua. O Vídeo 3
fornece a música e a performance de canto. Faça a mulher do Vídeo 2 cantar —
voz, fraseado e atuação do Vídeo 3 — enquanto a câmera executa o dolly zoom
do Vídeo 1 sobre ela.Os seis erros contra os quais o manual alerta
| Erro | Correção |
|---|---|
| Um parágrafo único indiferenciado | Divida nos três blocos da fórmula |
| Arquivos enviados, papéis não declarados | Adicione «@image1 é a referência de X» para cada arquivo |
| Pedir música e proibir BGM ao mesmo tempo | Apague um dos dois — ou restrinja cada um a cenas diferentes |
| Querer uma tomada única mas escrever «Plano 1 / Plano 2» | Mantenha um único parágrafo narrativo contínuo, sem estrutura de planos |
| Querer consistência facial sem imagem de referência | Envie uma, rotulada «referência de personagem (trave o rosto)» |
| Prompt curto demais sem arquivos | Cubra aparência do sujeito + cena + ação + estilo, no mínimo |
O atalho honesto
O conselho final do manual — «entregue a escrita de prompts a um parceiro profissional» — é a admissão da própria MiniMax do padrão que vemos em todos os modelos de fronteira: prompts silenciosamente viraram especificações, com manifestos de referências, blocos de tempo e regras de formatação. Conhecer a fórmula é o que separa uma saída utilizável de mingau, mas escrever prompts de nível de especificação para cada plano de um vídeo de múltiplas cenas é trabalho de verdade.
É precisamente para esse trabalho que construímos o agente do Pixo: descreva o vídeo que você quer, e o agente escreve o roteiro, o storyboard e os prompts por plano no dialeto nativo de cada modelo — incluindo a fórmula acima. E o MiniMax H3 está no ar no Playground do Pixo hoje — cole estes prompts, adicione as suas referências (os arquivos são numerados Imagem 1, Vídeo 1… conforme você envia) e gere planos de 4 a 15 segundos em 768p ou 2K. Cadastre-se agora — novos usuários ganham 200 créditos grátis no cadastro, e os planos estão com até 55% de desconto no momento.
Perguntas frequentes
Qual é a fórmula oficial de prompt do MiniMax H3?
O próprio manual da MiniMax a define assim: prompt completo = notas dos materiais de referência + ideia central + descrição cena a cena. Primeiro declare para que serve cada arquivo enviado, depois enuncie sujeito, lugar, evento e estilo, e então descreva a ação ao longo do tempo — com timestamps se precisar.
Como referencio arquivos enviados em um prompt do MiniMax H3?
Numere-os na ordem de envio e cite-os no texto — @image1, @video2, @audio3. Todo arquivo precisa de um papel declarado: trava de rosto, trava de objeto, referência de cena, referência de movimento, referência de voz, faixa de ritmo e assim por diante. Arquivos sem propósito declarado são a causa mais comum de referências ignoradas.
Como impeço o MiniMax H3 de adicionar música de fundo?
Declare explicitamente no final do prompt: «non_diegetic_music: N/A» (ou o equivalente em linguagem natural). Desejos negativos que não estão escritos tendem a ser ignorados — e nunca peça trilha sonora em uma linha enquanto proíbe BGM em outra.
Como mantenho o rosto de um personagem consistente no MiniMax H3?
Envie uma imagem de referência do personagem e a rotule explicitamente como trava de rosto — por exemplo, «@image1 é a referência do personagem (trave o rosto desta mulher)». Querer consistência facial sem enviar uma referência rotulada é um dos erros comuns listados no manual.
Quais são os três modos de geração do MiniMax H3?
Omni-referência (até 12 arquivos — 9 imagens, 3 vídeos, 3 áudios — cada um com papel declarado), primeiro/último quadro (uma ou duas imagens; o H3 preenche o movimento entre elas e não inventa cortes) e texto-para-vídeo puro (prompts de até 7.000 caracteres).
Qual o tamanho máximo de um prompt do MiniMax H3?
Até 7.000 caracteres, em qualquer um dos idiomas que o H3 entende. Prompts curtos demais são um modo de falha documentado: quando não há arquivos de referência, cubra sempre pelo menos a aparência do sujeito, os detalhes da cena, a ação e o estilo.
Gerar resumo com IA
Da ideia ao vídeo final.
Em uma única conversa.
Começar a criarSem necessidade de cartao de credito - 200 creditos gratis


