MiniMax H3·Guia de Prompts·Prompts de Vídeo com IA·Hailuo 3.0·

MiniMax H3: guia de prompts, fórmula oficial e modos

Prompts para o MiniMax H3 que funcionam: a fórmula oficial em três partes, referências @arquivo, os três modos de geração e os seis erros que arruínam saídas.

MiniMax H3: guia de prompts, fórmula oficial e modos

A maior parte do que foi escrito sobre prompting no MiniMax H3 é chute — o modelo mal completou uma semana. Este guia não é chute. A MiniMax publicou um manual oficial de uso detalhado junto do lançamento do H3 em 31 de julho, e enterrado nele há algo raro: uma fórmula de prompt explícita, escrita por engenheiros, uma taxonomia de papéis das referências de arquivo e uma lista franca dos erros que mais frequentemente arruínam as gerações. Quase nada disso tinha aparecido fora do chinês até agora.

Nós construímos o Pixo, uma plataforma de vídeo com IA multimodelo, e ler os manuais dos modelos no dia em que saem faz parte do trabalho — nosso agente precisa escrever prompts de nível de produção para cada modelo que rodamos. Aqui está o sistema de prompting do H3, traduzido e organizado para criadores profissionais. (Novo no modelo em si? Comece pelo nosso primeiro contato com o H3.)

A fórmula oficial

Direto do manual:

Prompt completo = notas dos materiais de referência + ideia central + descrição cena a cena

Três blocos, nessa ordem. Pule o primeiro se você não enviou nada. A maioria dos prompts fracassados do H3 quebra exatamente um desses blocos — geralmente amassando tudo em um único parágrafo indiferenciado, que é o erro nº 1 listado pelo manual.

Bloco 1: notas dos materiais de referência

Todo arquivo que você envia recebe um número na ordem de envio, citado no texto como @image1, @video2, @audio3. E todo arquivo precisa de um papel declarado. A taxonomia de papéis do manual vale a pena decorar, porque ela é, na prática, a superfície de API do H3 em linguagem natural:

  • Referência de personagem — travar um rosto ou uma figura
  • Referência de objeto — travar um produto ou adereço
  • Referência de cena — travar uma locação
  • Quadro-chave — travar um quadro (diga explicitamente se é o primeiro ou o último)
  • Referência de voz — travar um timbre de voz
  • Storyboard — gerar planos seguindo um painel de história
  • Referência de estilo — reproduzir o visual de uma imagem
  • Referência de composição — reproduzir enquadramento e layout
  • Reuso de áudio — usar a faixa diretamente como o áudio do vídeo (ou reutilizar parte dela)
  • Referência de movimento — travar uma ação a partir de um vídeo
  • Referência de câmera — travar um movimento de câmera
  • Edição de vídeo — o vídeo a ser modificado

O exemplo do manual, traduzido: «@image1 é a referência do personagem (trave o rosto desta mulher), @video1 é a referência de movimento (use os movimentos de dança com espada que aparecem nele), @audio1 é a referência de clima (trilha clássica de guqin). Faça esta mulher executar a dança com espada do vídeo em um pátio de cerejeiras em flor.»

Bloco 2: ideia central

Quatro elementos, nomeados explicitamente no manual: sujeito (quem ou o quê), lugar (onde), evento (fazendo o quê) e gênero/estilo (live-action, animação, cinematográfico, comercial, documental — ou uma estética nomeada, como cyberpunk ou neon). Mais, opcionalmente, o comportamento de câmera: o H3 corta entre planos por padrão, então, se você quer uma única tomada contínua, diga isso. Para movimentos de câmera, o manual é incomumente específico — escreva movimentos concretos como «truck para a esquerda + pan para a direita» em vez de pedidos vagos como «orbite a cena». Para os cortes, você pode especificar o estilo: corte seco, fade, sincronizado com a batida, montagem rápida.

Bloco 3: descrição cena a cena

Descreva o que acontece ao longo do tempo, segmento por segmento — «0–3s: …, 3–7s: …» — conectando os elementos aos arquivos com referências @ sempre que estiverem vinculados. É aqui também que mora o diálogo, e a regra é absoluta: escreva a fala exata. «Ela diz algo comovente» produz mingau; «Ela diz: 'Você veio. A lâmina já esperou o bastante.'» produz a fala, com sincronia labial.

Regras que salvam gerações

Quatro regras menores do manual rendem muito mais do que parecem:

Escreva o que a câmera vê, não o que aquilo significa. O H3 recompensa descrições concretas, visuais e diretas, e tropeça em metáforas. «Neon refletido no asfalto molhado sobre a jaqueta de couro dela» ganha de «uma atmosfera de melancolia urbana» todas as vezes.

Texto na tela deve ser citado exatamente. Se você quer texto no quadro, escreva-o: «A tela do celular mostra o título 'Criação de Vídeo com IA' com um botão escrito 'Comece Agora'.»

Mate a música indesejada explicitamente. Sem BGM? Termine o prompt com non_diegetic_music: N/A. E nunca se contradiga — pedir trilha sonora em uma linha e proibir BGM em outra é um modo de falha listado.

Nomeie o plano quando cortar. Ao especificar um corte, declare o novo tamanho de plano e qual sujeito já estabelecido ele contém — é isso que mantém os rostos consistentes entre os cortes.

Como escrever para cada um dos três modos

Modo omni-referência (até 9 imagens + 3 vídeos + 3 áudios): a fórmula completa se aplica — o bloco de notas de referência é obrigatório, e arquivos sem rótulo são arquivos desperdiçados.

Modo primeiro/último quadro: envie uma imagem e diga se ela é o quadro de abertura ou de fechamento; envie duas e o H3 preenche o movimento, a iluminação e o som entre elas. Ponto crítico: ele não inventa cortes de câmera nesse modo — o exemplo do manual: «@image1 é o primeiro quadro: uma mulher segurando uma espada sob uma cerejeira. Leve-a da posição de prontidão até a dança com espada completa, fluindo naturalmente, sem cortes.»

Texto-para-vídeo puro: nenhum arquivo, até 7.000 caracteres de prompt. O mínimo para um resultado utilizável, segundo o manual: aparência do sujeito + detalhes da cena + ação + estilo. Prompts mais curtos que isso são um modo de falha documentado, não uma escolha de estilo.

Pontos de partida para copiar e colar

Três prompts construídos sobre a fórmula oficial (adapte à vontade):

Arquivos de referência do showcase

@image1 — os dois personagens
@image1 — os dois personagens
@video1 — referência de ação e atuação
[Referências] Os personagens de @image1 seguem estritamente os movimentos, as expressões e o ritmo de atuação de @video1.
[Processo] O homem está em pé diante da pia, à direita do quadro, e entrega um prato lavado à mulher à esquerda; em seguida se vira e de repente lança espuma de detergente nela com a mão direita, em direção à borda esquerda do quadro. Assustada, ela revida na hora, e os dois começam a se ensopar de espuma alegremente, desviando e rindo muito.

Arquivos de referência do showcase

@video1 — fonte com chroma key
@video2 — referência de estilo de conto de fadas
[Instrução de edição, sobre dois vídeos existentes] Remova o fundo de chroma key de @video1 e substitua-o por um fundo de conto de fadas no estilo de @video2. Os elementos do fundo devem corresponder totalmente aos movimentos do personagem em @video1. Ajuste a iluminação do personagem para que combine completamente com o novo fundo.

Arquivos de referência do showcase

Filmagem original (gato)
[Instrução de edição, sobre um vídeo existente] Substitua o gato do vídeo por um golden retriever. Mantenha o movimento de câmera, a iluminação e o fundo inalterados.
Pixo

Crie vídeos com IA no Pixo

Transforme suas ideias em vídeos prontos para publicar. Basta uma frase.

A fórmula na prática: quatro casos comentados

Cada um destes é adaptado de um showcase do manual, e cada um isola uma parte da fórmula. (A biblioteca completa está em 20 prompts para o MiniMax H3.)

Só texto — [ideia central] e [processo] carregam tudo. Nenhuma referência, e a direção de arte se sustenta mesmo assim, porque cada regra visual está declarada como restrição:

15 segundos, 16:9. Imite integralmente a linguagem visual de um filme de
lançamento de marca premium: fundo preto puro, iluminação de estúdio,
close-ups giratórios ultralentos, títulos gigantes minimalistas em
sans-serif, trilha eletrônica etérea. O produto é — um pato de Pequim
perfeitamente assado. A tipografia deve ser minimalista, com espaçamento
generoso, uma única sans-serif fina do início ao fim. Proibido: estilo
cartoon, fundos poluídos, marcas d'água.

Notas de referência no limite — três imagens, três papéis declarados. O prompt nunca descreve os rostos das modelos nem os óculos; as referências carregam a identidade enquanto o texto carrega a atitude:

Arquivos de referência do showcase

Imagem 1 — looks das modelos
Imagem 1 — looks das modelos
Imagem 2 — detalhes faciais em vários ângulos
Imagem 2 — detalhes faciais em vários ângulos
Imagem 3 — design dos óculos
Imagem 3 — design dos óculos
Um comercial vertical 9:16 de óculos de alta moda. Visual de estúdio branco
minimalista: fundo branco contínuo, forte clima de anúncio de alta-costura —
limpo, nítido, vanguardista, acabamento de campanha internacional. A Imagem
1 define os dois looks de corpo inteiro; mantenha o acabamento do figurino,
a postura, a iluminação de estúdio e a frieza de passarela. Ambas usam
óculos futuristas de alto padrão — design conforme a Imagem 3: superfícies
curvas envolventes, contorno geométrico afiado híbrido de gatinho/goggle,
reflexos espelhados, hastes aerodinâmicas. Detalhes faciais conforme a
Imagem 2.

[Processo] plano a plano com embalagem. Cortes, cartelas de título e áudio por plano escritos na ordem da câmera — a gramática de trailer do caso de ficção científica do próprio manual:

Arquivos de referência do showcase

Imagem 1 — atmosfera e estilo
Imagem 1 — atmosfera e estilo
Imagem 2 — protagonista
Imagem 2 — protagonista
Cinema fotorrealista, luz de alto contraste, ritmo apertado. A Imagem 1 é a
referência geral de atmosfera e estilo; a Imagem 2 é o protagonista.
Plano 1 — grande plano geral de estabelecimento: um colossal portal cósmico
circular quase preenche o quadro; a figura é uma silhueta minúscula no canto
inferior direito diante dele. Chão molhado e reflexivo, escuridão no centro
do portal. A câmera avança lentamente. Um título surge sangrando da borda
escura, desfocado e depois nítido: "AS ESTRELAS ESTAVAM OUVINDO" — caixa
alta ultraestreita e pesada, vermelho-escuro misturado com ferrugem, granulação
leve e bordas esfumadas.
Áudio: pulso grave de baixa frequência, tremor metálico distante, um golpe
suave quando o título fica nítido. -> Corte seco.

Três referências, três modalidades. Movimento de câmera de um vídeo, sujeito de outro, música e atuação de um terceiro — as notas de referência da fórmula generalizadas para o som:

Arquivos de referência do showcase

Vídeo 1 — movimento de câmera (dolly zoom)
Vídeo 2 — sujeito
Vídeo 3 — música e atuação
O Vídeo 1 fornece o movimento de câmera: um dolly zoom hitchcockiano. O
Vídeo 2 é o sujeito: uma mulher tomando café em um café de rua. O Vídeo 3
fornece a música e a performance de canto. Faça a mulher do Vídeo 2 cantar —
voz, fraseado e atuação do Vídeo 3 — enquanto a câmera executa o dolly zoom
do Vídeo 1 sobre ela.

Os seis erros contra os quais o manual alerta

ErroCorreção
Um parágrafo único indiferenciadoDivida nos três blocos da fórmula
Arquivos enviados, papéis não declaradosAdicione «@image1 é a referência de X» para cada arquivo
Pedir música e proibir BGM ao mesmo tempoApague um dos dois — ou restrinja cada um a cenas diferentes
Querer uma tomada única mas escrever «Plano 1 / Plano 2»Mantenha um único parágrafo narrativo contínuo, sem estrutura de planos
Querer consistência facial sem imagem de referênciaEnvie uma, rotulada «referência de personagem (trave o rosto)»
Prompt curto demais sem arquivosCubra aparência do sujeito + cena + ação + estilo, no mínimo

O atalho honesto

O conselho final do manual — «entregue a escrita de prompts a um parceiro profissional» — é a admissão da própria MiniMax do padrão que vemos em todos os modelos de fronteira: prompts silenciosamente viraram especificações, com manifestos de referências, blocos de tempo e regras de formatação. Conhecer a fórmula é o que separa uma saída utilizável de mingau, mas escrever prompts de nível de especificação para cada plano de um vídeo de múltiplas cenas é trabalho de verdade.

É precisamente para esse trabalho que construímos o agente do Pixo: descreva o vídeo que você quer, e o agente escreve o roteiro, o storyboard e os prompts por plano no dialeto nativo de cada modelo — incluindo a fórmula acima. E o MiniMax H3 está no ar no Playground do Pixo hoje — cole estes prompts, adicione as suas referências (os arquivos são numerados Imagem 1, Vídeo 1… conforme você envia) e gere planos de 4 a 15 segundos em 768p ou 2K. Cadastre-se agora — novos usuários ganham 200 créditos grátis no cadastro, e os planos estão com até 55% de desconto no momento.

Perguntas frequentes

Qual é a fórmula oficial de prompt do MiniMax H3?

O próprio manual da MiniMax a define assim: prompt completo = notas dos materiais de referência + ideia central + descrição cena a cena. Primeiro declare para que serve cada arquivo enviado, depois enuncie sujeito, lugar, evento e estilo, e então descreva a ação ao longo do tempo — com timestamps se precisar.

Como referencio arquivos enviados em um prompt do MiniMax H3?

Numere-os na ordem de envio e cite-os no texto — @image1, @video2, @audio3. Todo arquivo precisa de um papel declarado: trava de rosto, trava de objeto, referência de cena, referência de movimento, referência de voz, faixa de ritmo e assim por diante. Arquivos sem propósito declarado são a causa mais comum de referências ignoradas.

Como impeço o MiniMax H3 de adicionar música de fundo?

Declare explicitamente no final do prompt: «non_diegetic_music: N/A» (ou o equivalente em linguagem natural). Desejos negativos que não estão escritos tendem a ser ignorados — e nunca peça trilha sonora em uma linha enquanto proíbe BGM em outra.

Como mantenho o rosto de um personagem consistente no MiniMax H3?

Envie uma imagem de referência do personagem e a rotule explicitamente como trava de rosto — por exemplo, «@image1 é a referência do personagem (trave o rosto desta mulher)». Querer consistência facial sem enviar uma referência rotulada é um dos erros comuns listados no manual.

Quais são os três modos de geração do MiniMax H3?

Omni-referência (até 12 arquivos — 9 imagens, 3 vídeos, 3 áudios — cada um com papel declarado), primeiro/último quadro (uma ou duas imagens; o H3 preenche o movimento entre elas e não inventa cortes) e texto-para-vídeo puro (prompts de até 7.000 caracteres).

Qual o tamanho máximo de um prompt do MiniMax H3?

Até 7.000 caracteres, em qualquer um dos idiomas que o H3 entende. Prompts curtos demais são um modo de falha documentado: quando não há arquivos de referência, cubra sempre pelo menos a aparência do sujeito, os detalhes da cena, a ação e o estilo.

Da ideia ao vídeo final.
Em uma única conversa.

Começar a criar

Sem necessidade de cartao de credito - 200 creditos gratis