MiniMax H3·Гайд по промптам·Промпты для AI-видео·Hailuo 3.0·

Промпты MiniMax H3: официальная формула и режимы

Рабочие промпты для MiniMax H3: официальная формула из трёх блоков, референсы @file, все три режима генерации и шесть ошибок, которые портят результат.

Промпты MiniMax H3: официальная формула и режимы

Большая часть написанного о промптинге MiniMax H3 — догадки: модели едва исполнилась неделя. Этот гайд — не догадки. Вместе с запуском H3 31 июля MiniMax опубликовала подробный официальный мануал, и в нём скрыто нечто редкое: явная, написанная инженерами формула промпта, таксономия ролей файловых референсов и честный список ошибок, которые чаще всего портят генерации. До сих пор почти ничего из этого не появлялось на других языках.

Мы делаем Pixo — мультимодельную платформу AI-видео, и читать мануалы моделей в день их выхода — часть нашей работы: наш агент должен писать промпты продакшен-уровня для каждой модели, которую мы запускаем. Вот система промптинга H3, переведённая и организованная для практикующих креаторов. (Впервые слышите о модели? Начните с нашего первого обзора H3.)

Официальная формула

Прямо из мануала:

Полный промпт = примечания к референсным материалам + основная идея + посценовое описание

Три блока, именно в этом порядке. Первый пропустите, если ничего не загружали. Большинство неудачных промптов для H3 ломают ровно один из этих блоков — обычно сваливая всё в один недифференцированный абзац, а это ошибка №1 в списке мануала.

Блок 1: примечания к референсным материалам

Каждый загруженный файл получает номер в порядке загрузки и цитируется в тексте как @image1, @video2, @audio3. И каждому файлу нужна объявленная роль. Таксономию ролей из мануала стоит выучить наизусть, потому что это фактически API-поверхность H3 на естественном языке:

  • Референс персонажа — зафиксировать лицо или фигуру
  • Референс объекта — зафиксировать продукт или реквизит
  • Референс сцены — зафиксировать локацию
  • Ключевой кадр — зафиксировать кадр (явно скажите, первый он или последний)
  • Референс голоса — зафиксировать тембр голоса
  • Раскадровка — сгенерировать кадры по сюжетной панели
  • Референс стиля — повторить визуальный облик изображения
  • Референс композиции — повторить кадрирование и компоновку
  • Переиспользование аудио — использовать трек напрямую как аудио видео (или его часть)
  • Референс движения — зафиксировать действие из видео
  • Референс камеры — зафиксировать движение камеры
  • Редактирование видео — видео, которое нужно изменить

Пример из мануала в переводе: «@image1 — референс персонажа (зафиксировать лицо этой женщины), @video1 — референс движения (использовать движения танца с мечом из него), @audio1 — референс настроения (классическая партитура гуциня). Пусть эта женщина исполнит танец с мечом из видео во дворике среди цветущей сакуры».

Блок 2: основная идея

Четыре элемента, прямо названные в мануале: субъект (кто или что), место (где), событие (что делает) и жанр/стиль (игровое кино, анимация, кинематографично, реклама, документалистика — или именованная эстетика вроде киберпанка или неона). Плюс, опционально, поведение камеры: H3 по умолчанию монтирует между планами, поэтому если нужен один непрерывный дубль — скажите об этом. С движениями камеры мануал необычно конкретен — пишите чёткие движения вроде «truck влево + панорама вправо», а не расплывчатые просьбы вроде «облети сцену». Для склеек можно указать стиль: жёсткая склейка, затемнение, монтаж в ритм, быстрый монтаж.

Блок 3: посценовое описание

Опишите, что происходит во времени, сегмент за сегментом — «0–3с: …, 3–7с: …» — связывая элементы с файлами через @-референсы везде, где они связаны. Здесь же живут диалоги, и правило абсолютно: пишите точную реплику. «Она говорит что-то трогательное» даёт кашу; «Она говорит: „Ты пришёл. Клинок ждал достаточно долго“» даёт реплику — с липсинком.

Правила, которые спасают генерации

Четыре небольших правила из мануала работают куда сильнее, чем кажется:

Пишите то, что видит камера, а не то, что это значит. H3 вознаграждает конкретное, визуальное, прямое описание и спотыкается на метафорах. «Мокрый от дождя неон отражается на её кожаной куртке» всегда бьёт «атмосферу городской меланхолии».

Текст в кадре должен быть процитирован дословно. Хотите текст в кадре — напишите его: «Экран телефона показывает заголовок „AI Video Creation“ и кнопку с надписью „Start Now“».

Явно убивайте ненужную музыку. Не нужен BGM? Завершите промпт non_diegetic_music: N/A. И никогда не противоречьте себе — просить саундтрек в одной строке и запрещать BGM в другой — задокументированный режим отказа.

Называйте план при склейке. Указывая склейку, назовите новую крупность и какой из уже установленных субъектов в кадре — именно это сохраняет лица консистентными между склейками.

Промптинг каждого из трёх режимов

Режим omni-reference (до 9 изображений + 3 видео + 3 аудио): применяется вся формула — блок примечаний к референсам обязателен, а непомеченные файлы — потраченные впустую файлы.

Режим первого/последнего кадра: загрузите одно изображение и скажите, открывающий это кадр или финальный; загрузите два — и H3 достроит между ними движение, свет и звук. Критично: в этом режиме модель не придумывает монтажные склейки — пример из мануала: «@image1 — первый кадр: женщина с мечом под сакурой. Проведи её от исходной стойки через весь танец с мечом, плавно, без склеек».

Чистый text-to-video: без файлов, промпт до 7000 символов. Минимум для пригодного результата, по мануалу: внешность субъекта + детали сцены + действие + стиль. Промпты короче этого — задокументированный режим отказа, а не стилистический выбор.

Готовые отправные точки

Три промпта, построенные на официальной формуле (свободно адаптируйте):

Референсные файлы шоукейса

@image1 — двое персонажей
@image1 — двое персонажей
@video1 — референс действия и игры
[Референсы] Персонажи на @image1 строго следуют движениям, мимике и ритму игры из @video1.
[Процесс] Мужчина стоит у раковины в правой части кадра и передаёт вымытую тарелку женщине слева, затем разворачивается и внезапно правой рукой брызгает в неё пеной от средства для мытья посуды — к левому краю кадра. Вздрогнув, она мгновенно отвечает тем же, и оба начинают весело обливать друг друга пеной, уворачиваясь и громко смеясь.

Референсные файлы шоукейса

@video1 — исходник с хромакеем
@video2 — референс сказочного стиля
[Инструкция редактирования двух существующих видео] Убери хромакейный фон в @video1 и замени его сказочным фоном в стиле @video2. Элементы фона должны полностью соответствовать движениям персонажа в @video1. Отрегулируй освещение персонажа так, чтобы оно полностью совпадало с новым фоном.

Референсные файлы шоукейса

Исходное видео (кот)
[Инструкция редактирования существующего видео] Замени кота в видео на золотистого ретривера. Движение камеры, свет и фон оставь без изменений.
Pixo

Создавайте ИИ-видео с Pixo

Превратите идею в видео, готовое к публикации. Достаточно одного предложения.

Формула в деле: четыре разобранных кейса

Каждый из них адаптирован из шоукейса мануала, и каждый изолирует одну часть формулы. (Полная библиотека — в подборке 20 промптов для MiniMax H3.)

Только текст — [основная идея] и [процесс] несут всё. Референсов нет, а арт-дирекшен держится, потому что каждое визуальное правило записано как ограничение:

15 секунд, 16:9. Полностью имитируй визуальный язык презентационного
фильма премиального бренда: чисто чёрный фон, студийный свет,
сверхмедленные вращающиеся крупные планы, гигантские минималистичные
гротесковые титры, эфирный электронный саундтрек. Продукт — идеально
запечённая утка по-пекински. Типографика минимальная, с щедрыми
интервалами, один тонкий гротеск на всём протяжении. Запрещено:
мультяшный стиль, захламлённые фоны, вотермарки.

Примечания к референсам на пределе — три изображения, три объявленные задачи. Промпт ни разу не описывает лица моделей или очки; референсы несут идентичность, а текст — характер:

Референсные файлы шоукейса

Изображение 1 — образы моделей
Изображение 1 — образы моделей
Изображение 2 — детали лиц с разных ракурсов
Изображение 2 — детали лиц с разных ракурсов
Изображение 3 — дизайн очков
Изображение 3 — дизайн очков
Вертикальная 9:16 fashion-реклама очков. Минималистичный вид белой
студии: бесшовный белый фон, сильное ощущение haute-couture рекламы —
чисто, резко, авангардно, лоск международной кампании. Изображение 1
задаёт два образа в полный рост; сохрани фактуру их гардероба, позы,
студийный свет и подиумную холодность. Оба носят футуристичные
хай-энд очки — дизайн по Изображению 3: обтекаемые изогнутые
поверхности, резкий геометричный контур гибрида cat-eye и googles,
зеркальные отражения, обтекаемые дужки. Детали лиц — по Изображению 2.

[Процесс] план за планом с упаковкой. Склейки, титры и звук по каждому плану, записанные в порядке съёмки — грамматика трейлера из собственного sci-fi кейса мануала:

Референсные файлы шоукейса

Изображение 1 — атмосфера и стиль
Изображение 1 — атмосфера и стиль
Изображение 2 — протагонист
Изображение 2 — протагонист
Фотореалистичное кино, контрастный свет, плотный ритм. Изображение 1 —
референс общей атмосферы и стиля; Изображение 2 — протагонист.
План 1 — сверхширокий устанавливающий: колоссальные круглые космические
врата почти заполняют кадр; фигура — крошечный силуэт внизу справа перед
ними. Мокрая отражающая земля, тьма в центре врат. Камера медленно
наезжает. Из тёмного края проступает титр, размытый, затем резкий: "THE
STARS WERE LISTENING" — сверхузкий тяжёлый шрифт капсом, тёмно-красный с
ржавчиной, лёгкое зерно и затуманенные края.
Звук: глубокая низкочастотная пульсация, отдалённая дрожь металла, один
мягкий удар, когда титр становится резким. -> Жёсткая склейка.

Три референса, три модальности. Движение камеры из одного видео, субъект из другого, песня и исполнение из третьего — примечания к референсам, обобщённые на звук:

Референсные файлы шоукейса

Видео 1 — движение камеры (dolly zoom)
Видео 2 — субъект
Видео 3 — песня и исполнение
Видео 1 задаёт движение камеры: хичкоковский dolly zoom. Видео 2 —
субъект: женщина пьёт кофе в уличном кафе. Видео 3 задаёт песню и
вокальное исполнение. Пусть женщина из Видео 2 поёт — голос, фразировка
и исполнение из Видео 3, — пока камера выполняет по ней dolly zoom из
Видео 1.

Шесть ошибок, о которых предупреждает мануал

ОшибкаИсправление
Один недифференцированный абзацРазбейте на три блока формулы
Файлы загружены, роли не указаныДобавьте «@image1 — референс X» для каждого файла
Просьба о музыке и запрет BGM одновременноУдалите одно — или разнесите их по разным сценам
Нужен один дубль, а написано «План 1 / План 2»Держите один непрерывный нарративный абзац, без структуры планов
Нужна консистентность лица без референсного изображенияЗагрузите его с пометкой «референс персонажа (зафиксировать лицо)»
Слишком короткий промпт без файловОпишите минимум: внешность субъекта + сцена + действие + стиль

Честный шорткат

Завершающий совет мануала — «передайте написание промптов профессиональному партнёру» — это признание самой MiniMax паттерна, который мы видим у каждой фронтирной модели: промпты незаметно стали спецификациями — с манифестами референсов, блоками таймингов и правилами форматирования. Знание формулы отделяет пригодный результат от каши, но писать промпты уровня спецификации для каждого кадра многосценового видео — это настоящая работа.

Именно для этой работы мы и построили агента Pixo: опишите видео, которое хотите, и агент напишет сценарий, раскадровку и промпты для каждого кадра на родном диалекте каждой модели — включая формулу выше. А MiniMax H3 уже доступна в Playground Pixo — вставьте эти промпты, добавьте свои референсы (файлы нумеруются Image 1, Video 1… по мере загрузки) и генерируйте кадры по 4–15 секунд в 768p или 2K. Зарегистрируйтесь сейчас — новые пользователи получают 200 бесплатных кредитов при регистрации, а на тарифы сейчас скидки до 55%.

Часто задаваемые вопросы

Какова официальная формула промпта для MiniMax H3?

Собственный мануал MiniMax определяет её так: полный промпт = примечания к референсным материалам + основная идея + посценовое описание. Сначала объявите, для чего нужен каждый загруженный файл, затем укажите субъект, место, событие и стиль, а после опишите действие во времени — с таймкодами, если они нужны.

Как ссылаться на загруженные файлы в промпте MiniMax H3?

Нумеруйте их в порядке загрузки и цитируйте прямо в тексте — @image1, @video2, @audio3. Каждому файлу нужна объявленная роль: фиксация лица, фиксация объекта, референс сцены, референс движения, референс голоса, трек для ритма и так далее. Файлы без заявленного назначения — самая частая причина проигнорированных референсов.

Как запретить MiniMax H3 добавлять фоновую музыку?

Укажите это явно в конце промпта: «non_diegetic_music: N/A» (или эквивалент обычным языком). Незаписанные негативные пожелания обычно игнорируются — и никогда не просите саундтрек в одной строке, запрещая BGM в другой.

Как сохранить лицо персонажа консистентным в MiniMax H3?

Загрузите референсное изображение персонажа и явно пометьте его как фиксацию лица — например, «@image1 — референс персонажа (зафиксировать лицо этой женщины)». Желание получить консистентность лица без загруженного и помеченного референса — одна из перечисленных в мануале типичных ошибок.

Какие три режима генерации есть у MiniMax H3?

Omni-reference (до 12 файлов — 9 изображений, 3 видео, 3 аудио — каждый с объявленной ролью), первый/последний кадр (одно или два изображения; H3 достраивает движение между ними и не придумывает монтажные склейки) и чистый text-to-video (промпты до 7000 символов).

Насколько длинным может быть промпт MiniMax H3?

До 7000 символов на любом из языков, которые понимает H3. Слишком короткие промпты — задокументированный режим отказа: когда референсных файлов нет, всегда описывайте как минимум внешность субъекта, детали сцены, действие и стиль.

От идеи до готового видео.
За один разговор.

Начать создавать

Банковская карта не нужна • 200 бесплатных кредитов

Похожие статьи

Гайд по промптам Wan 3.0: шесть официальных формул, от одной строки до многокадрового сценария

Гайд по промптам Wan 3.0: шесть официальных формул, от одной строки до многокадрового сценария

Официальная методика промптинга Wan 3.0 в сжатом виде: шесть формул из руководства для авторов от Alibaba — базовая, продвинутая, первый/последний кадр, звук, референсы и мультикадр — каждая с готовым промптом и роликом, который из него вышел.

Wan 3.0 · Гайд по промптам · Генератор AI-видео · Промпты для AI-видео

MiniMax H3: обзор, характеристики и режимы (2026)

MiniMax H3: обзор, характеристики и режимы (2026)

MiniMax H3 (Hailuo 3.0): 15-секундные мультишотовые видео с нативным стереозвуком, 12 файлов на входе и монтаж по инструкции. Полные характеристики.

MiniMax H3 · Hailuo 3.0 · AI-генератор видео · Модели AI-видео

Клонирование голоса в AI-видео: MiniMax H3 и 11 языков

Клонирование голоса в AI-видео: MiniMax H3 и 11 языков

Клонируйте голос, сохраните лицо и выпустите одно видео на одиннадцати языках: как работают клонирование голоса и мультиязычный TTS в MiniMax H3 на Pixo.

Клонирование голоса · Локализация видео · MiniMax H3 · Мультиязычное видео