Что такое MiniMax H3? Характеристики и режимы (2026)
MiniMax H3 (Hailuo 3.0): видео до 15 секунд со стереозвуком, 12 файлов на входе, правки по инструкции и открытые веса с оговоркой.

31 июля 2026 года MiniMax выпустила самую амбициозную модель в линейке Hailuo — и тихо изменила смысл слова «видеомодель». MiniMax H3 (сообщество уже зовёт её Hailuo 3.0) не просто превращает промпты в клипы. Она читает текст, изображения, видео и аудио как единый контекст, генерирует 15-секундные сцены со встроенным стереозвуком — а затем позволяет отредактировать результат обычной фразой, вместо того чтобы снова бросать кости.
Мы делаем Pixo, мультимодельную платформу для AI-видео, и потому при выходе каждой фронтир-модели делаем две вещи: читаем официальную документацию построчно и тестируем модель против тех, что у нас уже работают. Этот первый обзор основан на официальной документации MiniMax по генерации видео и карточке модели H3 — включая детали, которых пока нет в большинстве обзоров: точные лимиты на вход, три режима генерации и лицензионное ограничение, от которого зависит, сможете ли вы вообще запустить эту модель.
Вот что такое H3, что в ней действительно новое и что она значит, если вы снимаете видео на жизнь.
MiniMax H3: коротко о главном
| Параметр | MiniMax H3 |
|---|---|
| Релиз | 31 июля 2026 (веса — 3 августа) |
| Архитектура | Плотный омнимодальный трансформер на 33 млрд параметров, единый поток |
| Длина выхода | 4–15 секунд, 24 fps |
| Разрешение | 768p по умолчанию; до 2K |
| Соотношения сторон | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Аудио | Нативное стерео 32 кГц — диалоги, эмбиенс, эффекты в том же проходе |
| Мультимодальный вход | Всего до 12 файлов: ≤9 изображений + ≤3 видеоклипа + ≤3 аудиодорожки |
| Редактирование | Правки готового видео по текстовой инструкции |
| Языки | Речь на 11 языках |
| Доступ | Приложение Hailuo AI, API MiniMax (ID модели MiniMax-H3), открытые веса |
Главная идея: один контекст, все модальности
Большинство AI-видеоинструментов — это конвейеры из узкоспециализированных моделей: одна для text-to-video, другая для липсинка, третья для апскейла, четвёртая для звука. Ставка MiniMax в H3 — свернуть весь этот конвейер в одну «омнимодальную» систему: архитектурно это плотный трансформер на 33 млрд параметров, который читает все модальности одним потоком, а не подвешивает энкодеры к видеобэкбону. На практике это значит, что генерация изображения, видео и звука перестаёт быть отдельными задачами: модель читает все ваши материалы — сценарий, референс лица, клип с движением, музыкальную дорожку — как единое ТЗ и выдаёт по нему готовую аудиовизуальную сцену.
Конкретно: в один промпт можно отдать до 12 файлов — до 9 изображений, 3 видеоклипа (суммарно 15 секунд) и 3 аудиодорожки. У каждого референса есть объявленная роль: это изображение фиксирует лицо персонажа, это видео — референс движения, эта дорожка задаёт ритм. Модель сплавляет их, а не склеивает коллажем. Если вы когда-нибудь пытались удержать персонажа консистентным, одновременно попадая в референс движения и в бит, разными инструментами — вы понимаете, почему это важно.
Звук здесь не довесок
Каждая генерация H3 приходит с нативным стереозвуком 32 кГц — диалоги с липсинком, тон помещения, эффекты — созданным в том же проходе, что и пиксели. По-настоящему нативное аудио умеют лишь несколько моделей, и H3 идёт дальше по языкам: её речь охватывает 11 языков — арабский, китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский и испанский. Она также умеет клонировать и переносить тембр голоса с референсной дорожки, что превращает «локализовать этот ролик на три рынка» из продакшен-проекта в один промпт.
Редактирование — главная фича
Вот что отличает H3 почти от всех генераторов клипов, за которыми мы следим: она принимает инструкции по правке уже готового видео. Собственные примеры MiniMax восхитительно бытовые — «замени кота в видео на собаку» — и доходят до вещей вроде: подменить светящуюся вывеску магазина у дома, превратить банку газировки в брендированную колу и переписать финальную реплику, всё одной инструкцией и с сохранением всего остального в кадре. Можно менять фон и переосвещать сцены, заменять реплику так, что актёрская подача подстроится под неё, или переносить голос персонажа на клонированный тембр.
Для практикующих авторов это удар по самой дорогой привычке в AI-видео — перегенерации. Когда кадр готов на 90%, вам не нужен новый кадр — вам нужны оставшиеся 10%.
Три режима генерации
Документация описывает три разных способа управлять H3, и от того, в каком вы режиме, зависит, как писать промпт (полный гайд по промптам MiniMax H3 мы собрали по официальной формуле):
1. Режим референсов. Полный мультимодальный вход на 12 файлов, описанный выше. Вы подписываете роль каждого ассета — фиксация лица, референс движения, ритмическая дорожка — и описываете сцену.
2. Image-to-video / первый и последний кадр. Даёте одно или два изображения. С двумя H3 считает их первым и последним кадром и достраивает между ними движение, свет и звук — и, что важно, в этом режиме она не придумывает монтажных склеек. Соотношение сторон берётся из вашего изображения.
3. Чистый text-to-video. Никаких референсов; модель строит субъекта, сцену и действие из вашего описания. H3 вознаграждает конкретный, визуальный текст с пониманием камеры, а не «вайб».
Открытые веса — с территориальной оговоркой
Эту деталь пропустило большинство обзоров, а именно она решает, применима ли H3 лично для вас.
3 августа MiniMax выложила веса H3 на Hugging Face — по-настоящему открытый релиз фронтир-видеомодели и стратегическая противоположность закрытой Seedance от ByteDance. Но вышел он под MiniMax H3 Community Licence, а не под Apache или MIT, и текст лицензии определяет «зону действия» как весь мир за исключением Евросоюза, Великобритании, Республики Корея и Соединённых Штатов Америки.
Проще говоря: если вы в США, ЕС, Великобритании или Южной Корее, community-лицензия не даёт вам права запускать эти веса локально. Коммерческое использование в остальных регионах при годовой выручке выше $20 млн тоже требует отдельного письменного разрешения плюс видимого упоминания «MiniMax H3» в продукте.
Для большинства наших читателей это значит, что практический путь — облачный API или платформа, у которой есть лицензионный доступ, а не локальное развёртывание. Ограничение необычное, и о нём стоит знать до того, как закладывать бюджет на GPU под модель, запускать которую вы, возможно, не вправе.
Где H3 находится в текущем ландшафте моделей
Честный ответ: H3 не доминирует по всем осям и выбрала для запуска очень людный день. Kling 3.0 и Veo 3.1 по-прежнему выдают более высокое исходное разрешение. А 31 июля — ровно в день выхода H3 — ByteDance запустила Seedance 2.5 глобально на Dreamina: до 30 секунд одним дублем, режим длинного видео до трёх минут и собственные режимы правок по таймкоду. Идея «сгенерируй, потом отредактируй» явно больше не принадлежит одной H3; подробное сравнение двух флагманов — в материале MiniMax H3 vs Seedance 2.5.
Что H3 по-прежнему держит за собой безраздельно — это голосовая и языковая половина редактирования: переписать реплику так, чтобы подача подстроилась, клонировать голос с референсной дорожки и говорить на 11 языках в той же системе, что сгенерировала картинку. Если ваша работа связана с брендами, диалогами или несколькими рынками, а не с разовыми зрелищными кадрами, эта связка стоит дороже, чем ещё одна ступень разрешения.
Впрочем, одна модель — это всё ещё не фильм. 15-секундный генератор становится по-настоящему полезным, когда встаёт в раскадровку рядом с другими моделями: Seedance — на экшен-бит с тяжёлой физикой, H3 — на диалоговую сцену, которую вы наверняка захотите потом переписать. Именно такой покадровый мультимодельный процесс мы и заложили в агента Pixo, и потому готовим интеграцию H3 в раскадровку Pixo рядом с Seedance 2.0, Kling 3.0 и Veo 3.1.
Доступ и цены
H3 уже работает в потребительском приложении Hailuo AI и через открытый API MiniMax под ID модели MiniMax-H3. Прайс — $0,13 за секунду 2K-видео, около $0,78 за 6-секундный клип со звуком, есть более дешёвый тариф на 768p. Это заметно выше расценок прежней Hailuo 2.3 — и говорит о том, куда MiniMax помещает эту модель на рынке. Ставка на API явно работает: за первую же неделю H3 появилась на волне сторонних креативных платформ. Сырой доступ к модели расходится быстро и ничьим конкурентным рвом надолго не станет.
Если вам ближе работать на уровне готовых видео, а не сырых клипов, Pixo запускает ведущие видеомодели — Seedance, Kling, Veo, Hailuo и другие — в едином процессе раскадровки под управлением агента, и MiniMax H3 уже на пути в этот список. Зарегистрируйтесь — новым пользователям 200 бесплатных кредитов при регистрации — и вы сможете взяться за H3 в тот же день, когда она появится.
Часто задаваемые вопросы
Что такое MiniMax H3?
MiniMax H3 (её же называют Hailuo 3.0) — омнимодальная видеомодель, выпущенная MiniMax 31 июля 2026 года. Она воспринимает текст, изображения, видео и аудио как единый контекст и за один проход генерирует видео длиной 4–15 секунд в разрешении до 2K с нативным стереозвуком.
MiniMax H3 и Hailuo 3.0 — это одно и то же?
Да. MiniMax — это компания, Hailuo — её потребительский видеобренд, а H3 — модель третьего поколения. ID модели в API — MiniMax-H3, а сообщество чаще говорит Hailuo 3.0. Это одна и та же модель.
Генерирует ли MiniMax H3 звук?
Да — каждый результат H3 содержит нативное стерео 32 кГц, созданное в том же проходе, что и картинка: диалоги с липсинком, эмбиенс и звуковые эффекты. Речь поддерживает 11 языков, включая китайский, английский, японский, корейский, арабский, французский, немецкий, итальянский, португальский, русский и испанский.
Умеет ли MiniMax H3 редактировать видео?
Да, и это её самая отличительная возможность. H3 принимает правки, сформулированные обычным языком, к уже готовому видео — заменить персонажа или объект, сменить фон или свет, переписать реплику, перенести голос — сохраняя нетронутые области стабильными.
MiniMax H3 — это открытая модель?
MiniMax выложила веса на 33 млрд параметров на Hugging Face 3 августа 2026 года, но под community-лицензией, а не под стандартной открытой. Лицензия исключает США, Евросоюз, Великобританию и Южную Корею из зоны действия, поэтому авторам из этих регионов стоит использовать облачный API, а не разворачивать модель у себя.
Характеристики в этой статье прочитаны из официальной документации MiniMax по генерации видео, карточки модели MiniMax-H3 на Hugging Face и опубликованного текста лицензии по состоянию на 5 августа 2026 года и сверены с моделями, которые мы запускаем в продакшене на Pixo. Цены и условия лицензии меняются — проверяйте первоисточники, прежде чем закладывать бюджет.
Готовы совершить революцию в работе?
Присоединяйтесь к тысячам авторов, которые используют Pixo, чтобы превращать истории в визуальную реальность.
ЗарегистрироватьсяБанковская карта не нужна • 200 бесплатных кредитов


