MiniMax H3: обзор, характеристики и режимы (2026)
MiniMax H3 (Hailuo 3.0): 15-секундные мультишотовые видео с нативным стереозвуком, 12 файлов на входе и монтаж по инструкции. Полные характеристики.

31 июля 2026 года MiniMax выпустила самую амбициозную модель линейки Hailuo — и незаметно изменила само значение слов «видеомодель». MiniMax H3 (сообщество уже зовёт её Hailuo 3.0) не просто превращает промпты в клипы. Она читает текст, изображения, видео и аудио как единый контекст, генерирует 15-секундные мультишотовые сцены с уже встроенным стереозвуком — а затем позволяет отредактировать результат инструкцией на обычном языке вместо новой лотереи перегенерации.
Мы делаем Pixo, мультимодельную платформу AI-видео, а значит, каждый раз, когда выходит фронтирная модель, мы делаем две вещи: читаем официальную документацию строка за строкой и тестируем модель против тех, что уже запускаем. Этот первый обзор основан на официальном мануале H3 от MiniMax и материалах запуска — включая детали, которых пока нет в большинстве англоязычных публикаций: точные лимиты ввода, три режима генерации и то, как на самом деле устроен формат промпта.
Вот что такое H3, что в ней действительно ново и что это значит, если вы делаете видео профессионально.
MiniMax H3 в двух словах
| Характеристика | MiniMax H3 |
|---|---|
| Релиз | 31 июля 2026 (анонс на WAIC 2026) |
| Длительность | 4–15 секунд, 24 fps |
| Разрешение | Режим 768p (с апгрейдом до 1440p); режим 1440p «2K» официально рекомендован — до 2976×1248 при 21:9 |
| Соотношения сторон | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Звук | Нативное стерео в каждом результате — диалоги, эмбиент и эффекты в том же проходе |
| Мультимодальный ввод | До 12 файлов: 9 изображений + 3 видеоклипа + 3 аудиодорожки |
| Редактирование | Монтаж существующей съёмки по инструкции (персонажи, фоны, реплики, голоса) |
| Языки | Мультиязычные промпты; TTS точно покрывает 11 языков, ~40 через деривацию |
| Лимит промпта | До 7000 символов |
| Доступ | Приложение Hailuo AI, API MiniMax (ID модели MiniMax-H3) |
Главная идея: один контекст, все модальности
Большинство инструментов AI-видео — это конвейеры узкоспециализированных моделей: одна для text-to-video, другая для липсинка, третья для апскейла, что-то ещё для звука. Заявка MiniMax с H3 — схлопнуть этот конвейер в единую «омнимодальную» систему. Как сказано в официальном мануале, H3 перестаёт считать генерацию изображения, видео и звука отдельными задачами и вместо этого читает все ваши материалы — сценарий, референс лица, клип движения, музыкальный трек — как один бриф, а затем производит из него готовую аудиовизуальную сцену.
Конкретно это значит, что H3 можно передать до 12 файлов в одном промпте: до 9 изображений, 3 видеоклипа (суммарно 15 секунд) и 3 аудиодорожки. Каждый референс получает объявленную роль — это изображение фиксирует лицо персонажа, это видео задаёт движение, этот трек определяет темп. Модель их сплавляет, а не коллажирует. Если вы когда-нибудь пытались удержать консистентного персонажа, одновременно следуя референсу движения и попадая в бит через разрозненные инструменты, вы поймёте, почему это важно.
Звук — не запоздалая мысль
Каждая генерация H3 выходит с нативным стереозвуком — диалоги с липсинком, тон комнаты, эффекты — созданным в том же проходе, что и пиксели. По-настоящему нативный звук умеет лишь горстка моделей (из заметных — Seedance 2.0, Veo 3.1, Wan 2.6), и H3 идёт дальше в языковой части: её синтез речи точно покрывает 11 языков — среди них китайский, английский, японский, корейский, французский, немецкий, испанский — и ещё около 40 достижимы через деривацию. Она также умеет клонировать и переносить тембр голоса из референсного трека, что превращает «локализуйте эту рекламу на три рынка» из продакшн-проекта в промпт.
Редактирование — главная фича
А вот часть, которая отделяет H3 почти от всех клип-генераторов, за которыми мы следим: она принимает редакторские инструкции к существующей съёмке. Примеры в самом мануале восхитительно будничны — «замени кота в видео на собаку» — и эскалируют до замены светящейся вывески магазина, превращения банки газировки в брендированную колу и переписывания финальной реплики диалога — всё в одной инструкции, при этом всё остальное в кадре остаётся на месте. Можно менять фоны и переосвещать сцены, заменять реплику так, что актёрская игра тонко подстраивается под неё, или переносить голос персонажа на клонированный тембр. Это можно попробовать уже сегодня в Playground от Pixo — загрузите свою съёмку как видео-референс и напишите инструкцию к ней.
Для работающих креаторов это удар по самой дорогой привычке в AI-видео — перегенерации. Когда шот хорош на 90%, вам не нужен новый шот — вам нужны оставшиеся 10%.

Создавайте ИИ-видео с Pixo
Превратите идею в видео, готовое к публикации. Достаточно одного предложения.
Три режима генерации
Мануал определяет три разных способа управлять H3, и понимание того, в каком вы находитесь, меняет то, как стоит промптить (мы написали полный гайд по промптам MiniMax H3 на основе официальной формулы):
1. Режим омни-референсов. Полный мультимодальный ввод из 12 файлов, описанный выше. Вы помечаете роль каждого ассета — фиксация лица, референс движения, трек темпа — и описываете сцену.
2. Режим первого/последнего кадра. Дайте модели одно или два изображения. С двумя H3 считает их первым и последним кадрами и достраивает движение, свет и звук между ними — примечательно, что в этом режиме она не придумывает монтажные склейки. Соотношение сторон следует за входным изображением.
3. Чистый text-to-video. Вообще без референсов; модель строит субъект, сцену и действие из вашего описания. Промпты могут достигать 7000 символов, и H3 вознаграждает конкретное, визуальное, осознающее камеру письмо, а не вайбы.
Место H3 в текущем ландшафте моделей
Честный ответ: H3 не доминирует по всем осям и выбрала для запуска людный день. Kling 3.0 и Veo 3.1 всё ещё выдают более высокое сырое разрешение (4K). А 31 июля — в тот самый день, когда вышла H3, — ByteDance выпустила Seedance 2.5, которая растягивает генерацию за один проход до 180 секунд и добавляет собственные режимы монтажа по инструкции. Идея «сгенерировать, потом отредактировать» явно больше не принадлежит одной H3; два флагмана мы детально сравнили в MiniMax H3 против Seedance 2.5.
Что H3 по-прежнему безраздельно принадлежит — так это голосовая и языковая половина редактирования: переписать реплику так, чтобы игра подстроилась, клонировать голос из референсного трека и синтезировать речь на 11 языках в той же системе, что сгенерировала картинку. Если ваша работа связана с брендами, диалогами или несколькими рынками — а не с разовыми зрелищными шотами — эта комбинация стоит больше, чем ещё одна ступень разрешения.
Впрочем, одна модель — всё ещё не фильм. 15-секундный генератор становится по-настоящему полезным, когда встаёт в раскадровку рядом с другими моделями — Seedance для экшн-бита с тяжёлой физикой, H3 для диалоговой сцены, которую вы захотите потом переписать. Именно этот пошотовый мультимодельный процесс мы и построили вокруг агента Pixo. H3 уже доступна в Playground от Pixo для генерации одиночных шотов, а в раскадровке сегодня работают Seedance 2.0, Kling 3.0 и Veo 3.1 — начните с хаба Hailuo.
Доступ и цены
H3 доступна в потребительском приложении Hailuo AI и через API открытой платформы MiniMax под ID модели MiniMax-H3. Стартовая цена API — примерно $0.78 за 6-секундный клип в 2K со звуком — заметно выше ставок легаси Hailuo 2.3 ($0.28 в 768p), что подсказывает, где MiniMax видит место этой модели на рынке. MiniMax также заявила, что открытые веса на подходе. И стратегия API-first явно работает: за первую неделю H3 уже всплыла на целой волне сторонних креативных платформ — сырой доступ к этой модели распространяется быстро и надолго ничьим рвом не станет.
Если вам ближе работать на уровне готовых видео, а не сырых клипов, Pixo запускает ведущие видеомодели — Seedance, Kling, Veo, Hailuo и другие — в едином агентном процессе с раскадровкой. MiniMax H3 уже доступна в Playground от Pixo — генерируйте шоты длиной 4–15 секунд в 768p или 2K с референсами изображений, видео и аудио. Зарегистрируйтесь сейчас — новые пользователи получают 200 бесплатных кредитов при регистрации, а на тарифы сейчас скидки до 55%.
Часто задаваемые вопросы
Что такое MiniMax H3?
MiniMax H3 (также известная как Hailuo 3.0) — омнимодальная видеомодель, выпущенная MiniMax 31 июля 2026 года. Она воспринимает текст, изображения, видео и аудио как единый контекст и генерирует мультишотовые видео длиной 4–15 секунд в разрешении до 2K (1440p) с нативным стереозвуком за один проход.
MiniMax H3 и Hailuo 3.0 — это одно и то же?
Да. MiniMax — компания, Hailuo — её потребительский видеобренд, а H3 — модель третьего поколения. ID модели в API — MiniMax-H3, и значительная часть сообщества называет её Hailuo 3.0 — это одна и та же модель.
Какие разрешение и длительность выдаёт MiniMax H3?
H3 генерирует клипы длиной 4–15 секунд с частотой 24 fps в шести соотношениях сторон от 21:9 до 9:16. Есть режим 768p (результаты можно повысить до 1440p) и режим 1440p, который MiniMax официально рекомендует — при 21:9 это до 2976×1248.
Генерирует ли MiniMax H3 звук?
Да — каждый результат H3 включает нативный стереозвук, созданный в том же проходе, что и видео: диалоги с липсинком, эмбиент и эффекты. Её синтез речи точно покрывает 11 языков, и ещё примерно 40 доступны через деривацию.
Умеет ли MiniMax H3 редактировать видео?
Да, и это её самая отличительная способность. H3 принимает редакторские инструкции на обычном языке к существующей съёмке — заменить персонажа или объект, изменить фон или освещение, переписать реплику или перенести голос — сохраняя нетронутые области стабильными.
Как попробовать MiniMax H3?
H3 доступна в приложении Hailuo AI, через API открытой платформы MiniMax (ID модели MiniMax-H3) и уже появляется на ряде сторонних креативных платформ. Стартовая цена API — примерно $0.78 за 6-секундный клип в 2K со звуком.
Создать резюме с ИИ
От идеи до готового видео.
За один разговор.
Начать создаватьБанковская карта не нужна • 200 бесплатных кредитов


