Skip to content
AI-видео со звуком·Нативное аудио·MiniMax H3·AI-генератор видео·

AI-генератор видео со звуком: нативное аудио MiniMax H3

Большинство AI-генераторов видео беззвучны. MiniMax H3 создаёт диалоги, эмбиенс и эффекты вместе с картинкой — стерео, с липсинком. Как это работает на Pixo.

Pixo Team·7 min read
AI-генератор видео со звуком: нативное аудио MiniMax H3

Есть момент, к которому приходит каждый рабочий процесс с AI-видео: клип выглядит отлично — и он абсолютно беззвучен. Вы идёте искать музыкальную подложку, TTS-инструмент для закадрового голоса, что-нибудь для звуковых эффектов — и обнаруживаете самое сложное: голос, записанный поверх видео, никогда по-настоящему ему не принадлежит. Тон помещения не тот, рот не двигается, шаги звучат в пустоту. Саунд-дизайн превращается во второе производство.

Именно этот разрыв закрыла H3 от MiniMax, выйдя 31 июля: она не добавляет звук к видео — она генерирует их вместе. Мы делаем Pixo, мультимодельную видеоплатформу, где H3 уже доступна в Playground, и из всей спецификации H3 именно эта возможность сильнее всего меняет ежедневную работу — поэтому вот как она ведёт себя на практике и как её промптить.

Что на самом деле значит «нативное аудио»

Каждый результат H3 выходит со стереозвуком, сгенерированным в одном проходе с картинкой. Из одного промпта получаются три слоя:

  • Диалоги. Напишите реплику дословно — и персонаж её произнесёт, с липсинком, потому что движение рта и звук происходят из одной генерации. Перепишите реплику — и актёрская игра последует за ней.
  • Эмбиенс. Сцена звучит как сцена: ветер над болотом, гул кухни, трафик за стеклом. Его не столько запрашивают, сколько забывают исключить.
  • Эффекты. Контактные звуки ложатся туда, где происходит физика: крышка щёлкает при открытии, взмахи крыльев звучат, когда птица взлетает.

Отличие от дубляжа не тонкое. Наложенный пост-звук существует по поводу видео; сгенерированный звук — часть его. Когда персонаж отворачивается посреди фразы, голос поворачивается вместе с ним.

У кого есть звук, у кого нет

Аудио незаметно стало границей между поколениями моделей:

МодельНативное аудио
MiniMax H3✅ Стерео в каждом результате — диалоги, эмбиенс, эффекты
Seedance 2.5✅ Да
Veo 3.1✅ Да
Wan 2.6✅ Да — синхронные диалоги и эффекты
Kling 3.0❌ Беззвучный результат

Поверх «есть аудио» H3 добавляет голосовой стек: text-to-speech на нескольких языках и клонирование голоса из референсной дорожки — загрузите голос, и диалоги будут генерироваться этим тембром. (Эта возможность заслуживает отдельного разбора; здесь остановимся на повседневном сценарии.)

Четыре правила промптинга звука

1. Диалог нужно прописывать. H3 не импровизирует реплики. Усталый голос говорит: «Открываемся через пять минут». сгенерирует именно это предложение — и ничего больше. Расплывчатые запросы («она говорит что-то ободряющее») дают расплывчатые результаты.

2. Решите, кто в кадре. Видимый говорящий получает липсинк; голос за кадром читается как повествование. И то и другое — одна строка промпта; разница лишь в том, помещаете ли вы говорящего в кадр.

3. Убейте музыку, если она не нужна. H3 с удовольствием озвучит ваш клип саундтреком. Если лицензированную музыку вы добавляете на посте — а в брендовой работе обычно так, — завершите промпт non-narrative music: N/A и держите дорожку чистой.

4. Аудиореференсы идут в связке, никогда — отдельно. Можно загрузить аудиодорожку (≤15MB), чтобы задать темп или характер голоса, но она должна сопровождать референсное изображение или видео — аудио не может быть единственным входом.

Три промпта для копирования

1. Диалог в кадре с липсинком (16:9)

Референсные файлы примера

Референс персонажа
Референс персонажа
Референс сцены
Референс сцены

Пример из мануала в том же регистре

Уютная ночная закусочная, тёплый вольфрамовый свет, лёгкий дождь за окном. Женщина
за тридцать сидит у стойки, обхватив руками кружку кофе. Она поднимает взгляд на
камеру и говорит: «Ты всегда заказываешь одно и то же». После реплики слегка
улыбается. Тихий эмбиенс закусочной — дождь, далёкое радио, столовые приборы.
Non-narrative music: N/A.

Почему это работает: один говорящий, одна прописанная реплика, один бит реакции. Список эмбиенса выстраивает звуковую сцену, не конкурируя с диалогом.

2. Продуктовый момент с закадровым голосом (9:16)

Референсные файлы примера

Образец тембра голоса

Пример из мануала в том же регистре

Вертикальное видео. Воронка для пуровера на деревянной стойке, утренний свет.
Горячая вода спиралью льётся из чайника в фильтр; поднимается пар; камера медленно
наезжает. Спокойный мужской голос говорит: «Тридцать граммов. Три минуты. Без
компромиссов». Звук льющейся воды и лёгкого пара. Non-narrative music: N/A.

Почему это работает: закадровое повествование полностью снимает риск липсинка, а физические звуки (льющаяся вода, пар) делают ту атмосферную работу, которую обычно имитирует музыкальная подложка.

3. Перформанс по референсам (три видео на входе, одна песня на выходе)

Референсные файлы примера

Референс движения камеры (долли-зум)
Материал с субъектом
Референс песни и вокального исполнения

Пример из мануала, который адаптирует этот промпт

Video 1 задаёт движение камеры: хичкоковский долли-зум. Video 2 — субъект: женщина
пьёт кофе в уличном кафе. Video 3 задаёт песню и вокальное исполнение. Заставь
женщину из Video 2 петь — голос, фразировка и исполнение из Video 3, — пока камера
выполняет долли-зум из Video 1 на ней.

Почему это работает: три референса, три роли — камера, субъект, песня, — и аудио генерируется как исполнение, а не накладывается дорожкой. Это собственная демонстрация мануала: звуковая режиссура — просто ещё одна роль референса.

Попробуйте

MiniMax H3 уже доступна в Playground от Pixo: выберите Video → MiniMax H3, напишите промпт с репликой, которую нужно произнести, и сгенерируйте шот на 4–15 секунд в 768p или 2K — со звуком, с экспортом без водяного знака. Общую картину модели даёт материал что такое MiniMax H3; о том, как её аудиостек сравнивается со вторым флагманом, вышедшим в тот же день, — MiniMax H3 vs Seedance 2.5.

Часто задаваемые вопросы

Могут ли AI-генераторы видео создавать звук?

Некоторые могут, большинство — нет. MiniMax H3, Seedance, Veo 3.1 и Wan 2.6 генерируют аудио нативно; Kling 3.0 выдаёт беззвучное видео. H3 идёт дальше всех: каждый результат выходит со стереозвуком — диалоги, эмбиенс и эффекты, — сгенерированным в одном проходе с картинкой, а не наложенным потом.

Делает ли MiniMax H3 липсинк диалогов?

Да. Впишите точную реплику в промпт — и H3 сгенерирует голос вместе с картинкой, а движения губ персонажа совпадут со словами. Её text-to-speech охватывает несколько языков, так что диалоги не ограничены английским.

Как сделать AI-видео с закадровым голосом?

Впишите текст закадрового голоса дословно в промпт — например: Спокойный мужской голос говорит: «Хорошие инструменты растворяются в работе». H3 сгенерирует речь вместе с видео. Если говорящий в кадре — будет липсинк; если за кадром — это читается как повествование.

Можно ли отключить фоновую музыку?

Да — завершите промпт строкой «non-narrative music: N/A», и H3 оставит дорожку чистой: только диалоги, эмбиенс и эффекты. Этот режим нужен, когда лицензированную музыку бренда вы добавите на постпродакшене.

Могу ли я использовать собственное аудио как референс?

Да. Загрузите аудиодорожку (до 15MB) вместе с референсным изображением или видео — аудио не может быть единственным входом — и задавайте ею темп или характер голоса. H3 также поддерживает клонирование голоса из референсной дорожки.

Как это попробовать?

MiniMax H3 уже доступна в Playground от Pixo — генерируйте шоты по 4–15 секунд в 768p или 2K. Новые пользователи получают 200 бесплатных кредитов при регистрации, а на тарифы сейчас скидки до 55%.


MiniMax H3 уже доступна в Playground от Pixo — генерируйте шоты по 4–15 секунд в 768p или 2K с референсами изображений, видео и аудио. Зарегистрируйтесь сейчас — новые пользователи получают 200 бесплатных кредитов при регистрации, а на тарифы сейчас скидки до 55%. Снимаете продукты? См. видео товаров для e-commerce с H3.

Готовы совершить революцию в работе?

Присоединяйтесь к тысячам авторов, которые используют Pixo, чтобы превращать истории в визуальную реальность.

Зарегистрироваться

Банковская карта не нужна • 200 бесплатных кредитов