MiniMax H3란? 사양·모드·첫인상 정리 (2026)
MiniMax H3(Hailuo 3.0) 완전 정리: 네이티브 스테레오 오디오가 포함된 15초 멀티샷 영상, 12개 파일 멀티모달 입력, 지시문 기반 편집. 전체 사양을 확인하세요.

2026년 7월 31일, MiniMax는 Hailuo 라인에서 가장 야심 찬 모델을 출시하며 '비디오 모델'의 의미를 조용히 바꿔 놓았습니다. MiniMax H3(커뮤니티에서는 이미 Hailuo 3.0이라고 부릅니다)는 단순히 프롬프트를 클립으로 바꾸는 데 그치지 않습니다. 텍스트, 이미지, 비디오, 그리고 오디오를 하나의 통합 컨텍스트로 읽고, 스테레오 사운드가 내장된 15초 멀티샷 장면을 생성한 다음 — 주사위를 다시 던지는 대신 자연어 지시 한 줄로 결과물을 편집할 수 있게 해줍니다.
우리는 멀티 모델 AI 비디오 플랫폼 Pixo를 만들고 있습니다. 프론티어 모델이 나올 때마다 두 가지를 합니다. 공식 문서를 한 줄씩 읽고, 이미 운영 중인 모델들과 맞붙여 테스트하는 것이죠. 이 첫인상 리뷰는 MiniMax의 공식 H3 사용 매뉴얼과 출시 자료를 기반으로 합니다 — 정확한 입력 한도, 세 가지 생성 모드, 프롬프트 형식이 실제로 작동하는 방식처럼 대부분의 영어권 커버리지에 아직 등장하지 않은 세부 사항까지 포함해서요.
H3가 무엇인지, 무엇이 진짜 새로운지, 그리고 영상으로 먹고사는 사람에게 어떤 의미인지 정리했습니다.
MiniMax H3 한눈에 보기
| 항목 | MiniMax H3 |
|---|---|
| 출시 | 2026년 7월 31일 (WAIC 2026에서 사전 공개) |
| 출력 길이 | 4~15초, 24fps |
| 해상도 | 768p 모드(1440p로 업그레이드 가능); 공식 권장 1440p "2K" 모드 — 21:9 기준 최대 2976×1248 |
| 화면비 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| 오디오 | 모든 출력에 네이티브 스테레오 — 대사, 환경음, 효과음을 같은 패스에서 생성 |
| 멀티모달 입력 | 최대 12개 파일: 이미지 9장 + 비디오 클립 3개 + 오디오 트랙 3개 |
| 편집 | 기존 영상에 대한 지시문 기반 편집 (캐릭터, 배경, 대사, 목소리) |
| 언어 | 다국어 프롬프트 지원; TTS는 11개 언어 정밀 지원, 파생으로 약 40개 추가 |
| 프롬프트 길이 | 최대 7,000자 |
| 접근 | Hailuo AI 앱, MiniMax API (모델 ID MiniMax-H3) |
핵심 발상: 하나의 컨텍스트, 모든 모달리티
대부분의 AI 비디오 도구는 특수 목적 모델들의 파이프라인입니다. 텍스트-투-비디오용 하나, 립싱크용 하나, 업스케일링용 하나, 사운드용은 또 다른 것. H3로 MiniMax가 내세우는 것은 이 파이프라인을 하나의 '옴니모달' 시스템으로 접어 넣겠다는 제안입니다. 공식 매뉴얼의 표현을 빌리면, H3는 이미지·비디오·사운드 생성을 별개의 작업으로 다루기를 멈추고, 여러분의 모든 재료 — 대본, 얼굴 레퍼런스, 모션 클립, 음악 트랙 — 를 하나의 브리프로 읽은 뒤 완성된 시청각 장면을 만들어 냅니다.
구체적으로는, 하나의 프롬프트에 최대 12개 파일을 넘길 수 있습니다. 이미지 최대 9장, 비디오 클립 3개(총 15초), 오디오 트랙 3개입니다. 각 레퍼런스에는 선언된 역할이 붙습니다 — 이 이미지는 캐릭터 얼굴을 고정하고, 이 비디오는 모션 레퍼런스이고, 이 트랙은 페이스를 정한다는 식으로요. 모델은 이것들을 콜라주하지 않고 융합합니다. 별개의 도구들을 오가며 캐릭터 일관성을 지키면서 동시에 모션 레퍼런스를 맞추고 동시에 비트에 싱크를 맞춰 본 적이 있다면, 이게 왜 중요한지 바로 이해하실 겁니다.
사운드는 나중에 붙이는 것이 아니다
모든 H3 생성물에는 네이티브 스테레오 오디오가 함께 나옵니다 — 립싱크가 맞는 대사, 룸 톤, 효과음이 픽셀과 같은 패스에서 만들어집니다. 진짜 네이티브 오디오를 지원하는 모델은 소수이며(Seedance 2.0, Veo 3.1, Wan 2.6이 대표적), H3는 언어 쪽에서 한발 더 나아갑니다. TTS가 11개 언어를 정밀하게 커버하고 — 중국어, 영어, 일본어, 한국어, 프랑스어, 독일어, 스페인어 등 — 파생을 통해 약 40개 언어를 추가로 쓸 수 있습니다. 레퍼런스 트랙에서 목소리 음색을 복제·이전하는 것도 가능해서, "이 광고를 세 개 시장에 로컬라이즈하라"는 일이 프로덕션 프로젝트에서 프롬프트 한 줄로 바뀝니다.
편집이 헤드라인 기능이다
H3를 우리가 추적하는 거의 모든 클립 생성기와 갈라놓는 지점이 여기입니다. H3는 기존 영상에 대한 편집 지시를 받습니다. 매뉴얼의 예시는 놀랍도록 일상적입니다 — "영상 속 고양이를 강아지로 바꿔줘" — 그리고 편의점의 빛나는 간판을 교체하고, 음료수 캔을 브랜드 콜라로 바꾸고, 마지막 대사까지 재작성하는 것을 지시 하나로, 나머지는 전부 그대로 둔 채 해내는 수준까지 올라갑니다. 배경을 바꾸고 장면 조명을 다시 잡을 수도, 대사 한 줄을 교체하면서 연기가 미세하게 따라 조정되게 할 수도, 캐릭터 목소리를 복제한 음색으로 이전할 수도 있습니다. Pixo의 Playground에서 오늘 바로 시도해 볼 수 있습니다 — 여러분의 영상을 비디오 레퍼런스로 업로드하고 그에 대한 지시문을 쓰면 됩니다.
일하는 크리에이터에게 이것은 AI 비디오에서 가장 비싼 습관을 정면으로 공격합니다. 바로 다시 뽑기(re-rolling)죠. 샷이 90% 맞았을 때 필요한 건 새 샷이 아니라 나머지 10%입니다.

세 가지 생성 모드
매뉴얼은 H3를 구동하는 세 가지 방식을 구분해 정의하며, 지금 어느 모드에 있는지에 따라 프롬프트 작성법이 달라집니다(공식 공식에 기반한 MiniMax H3 프롬프트 가이드를 따로 정리했습니다).
1. 옴니 레퍼런스 모드. 위에서 설명한 12개 파일 풀 멀티모달 입력입니다. 모든 에셋의 역할 — 얼굴 고정, 모션 레퍼런스, 페이싱 트랙 — 을 라벨링하고 장면을 설명합니다.
2. 첫/끝 프레임 모드. 이미지를 한두 장 줍니다. 두 장을 주면 H3는 이를 첫 프레임과 마지막 프레임으로 취급하고 그 사이의 모션, 조명, 사운드를 채워 넣습니다 — 주목할 점은, 이 모드에서는 카메라 컷을 임의로 만들어 내지 않는다는 것입니다. 화면비는 입력 이미지를 따라갑니다.
3. 순수 텍스트-투-비디오. 레퍼런스 없이 설명만으로 피사체, 장면, 액션을 구성합니다. 프롬프트는 7,000자까지 쓸 수 있으며, H3는 분위기 위주의 글보다 구체적이고 시각적이며 카메라를 의식한 글에 보상합니다.
지금의 모델 지형에서 H3의 자리
솔직한 답은 이렇습니다. H3가 모든 축에서 압도하는 것은 아니며, 하필 가장 붐비는 날에 출시됐습니다. Kling 3.0과 Veo 3.1은 여전히 더 높은 원시 해상도(4K)를 출력합니다. 그리고 H3가 출시된 바로 그날인 7월 31일, ByteDance는 단일 패스 생성을 최대 180초까지 밀어붙이고 자체 지시문 편집 모드까지 더한 Seedance 2.5를 내놓았습니다. '생성 후 편집' 아이디어는 이제 분명히 H3만의 것이 아닙니다. 두 플래그십은 MiniMax H3 vs Seedance 2.5에서 상세히 비교했습니다.
H3가 여전히 뚜렷하게 소유한 것은 편집의 목소리와 언어 절반입니다. 대사 한 줄을 재작성하면 연기가 따라 조정되고, 레퍼런스 트랙에서 목소리를 복제하고, 그림을 생성한 바로 그 시스템 안에서 11개 언어 TTS를 돌리는 것. 일회성 스펙터클 샷이 아니라 브랜드, 대사, 복수 시장을 다루는 일을 한다면, 이 조합은 해상도 한 눈금보다 훨씬 가치가 큽니다.
다만 모델 하나가 곧 영화는 아닙니다. 15초 생성기는 스토리보드 안에서 다른 모델들 옆에 놓일 때 진짜 쓸모가 생깁니다 — 물리 중심의 액션 비트는 Seedance에게, 나중에 수정하고 싶어질 대사 장면은 H3에게. 이 샷 단위 멀티 모델 워크플로가 바로 Pixo의 에이전트가 중심에 둔 것입니다. H3는 현재 Pixo Playground에서 단일 샷 생성으로 서비스 중이고, 스토리보드는 오늘 Seedance 2.0, Kling 3.0, Veo 3.1을 구동합니다 — Hailuo 허브를 출발점으로 삼으세요.
이용 경로와 가격
H3는 소비자용 Hailuo AI 앱과 MiniMax 오픈 플랫폼 API에서 모델 ID MiniMax-H3로 서비스 중입니다. 출시 시점 API 가격은 오디오 포함 6초 2K 클립 기준 약 $0.78 — 기존 Hailuo 2.3 요율(768p 기준 $0.28)보다 눈에 띄게 높은데, MiniMax가 이 모델을 시장 어디에 자리매김하려는지 말해 주는 대목입니다. MiniMax는 오픈 웨이트도 예고했습니다. 그리고 API 우선 전략은 분명히 통하고 있습니다. 첫 주 만에 H3는 이미 여러 서드파티 크리에이티브 플랫폼에 퍼졌습니다 — 이 모델에 대한 원시 접근은 빠르게 확산 중이며, 오래 누군가의 해자가 되지는 못할 겁니다.
원시 클립이 아니라 완성된 영상 단위로 작업하고 싶다면, Pixo는 Seedance, Kling, Veo, Hailuo 등 주요 비디오 모델을 하나의 에이전트 기반 스토리보드 워크플로 뒤에서 구동합니다. MiniMax H3는 지금 Pixo Playground에서 사용할 수 있습니다 — 이미지·비디오·오디오 레퍼런스와 함께 768p 또는 2K로 4~15초 샷을 생성하세요. 지금 가입하면 신규 사용자에게 무료 크레딧 200개가 제공되며, 플랜은 현재 최대 55% 할인 중입니다.
자주 묻는 질문
MiniMax H3란 무엇인가요?
MiniMax H3(Hailuo 3.0이라고도 불립니다)는 MiniMax가 2026년 7월 31일에 공개한 옴니모달 비디오 모델입니다. 텍스트, 이미지, 비디오, 오디오를 하나의 통합 컨텍스트로 다루며, 최대 2K(1440p) 해상도에서 네이티브 스테레오 오디오가 포함된 4~15초 멀티샷 영상을 단일 패스로 생성합니다.
MiniMax H3와 Hailuo 3.0은 같은 모델인가요?
네, 같습니다. MiniMax는 회사 이름, Hailuo는 그 소비자용 비디오 브랜드, H3는 3세대 모델입니다. API 모델 ID는 MiniMax-H3이며, 커뮤니티 상당수가 Hailuo 3.0이라고 부릅니다 — 동일한 모델입니다.
MiniMax H3의 해상도와 길이는 어느 정도인가요?
H3는 21:9부터 9:16까지 6가지 화면비로 24fps 4~15초 클립을 생성합니다. 768p 모드(결과물을 1440p로 업그레이드 가능)와 MiniMax가 공식 권장하는 1440p 모드로 동작하며, 21:9 기준 최대 2976×1248까지 출력합니다.
MiniMax H3는 오디오도 생성하나요?
네 — 모든 H3 결과물에는 영상과 같은 패스에서 생성된 네이티브 스테레오 오디오가 포함됩니다. 립싱크가 맞는 대사, 환경음, 효과음까지요. TTS는 11개 언어를 정밀하게 지원하며, 파생을 통해 약 40개 언어를 추가로 쓸 수 있습니다.
MiniMax H3로 영상을 편집할 수 있나요?
네, 그리고 이것이 H3의 가장 차별화된 기능입니다. H3는 기존 영상에 대한 자연어 편집 지시를 받습니다 — 캐릭터나 사물 교체, 배경·조명 변경, 대사 한 줄 재작성, 목소리 이전까지 — 편집하지 않은 영역은 그대로 유지하면서요.
MiniMax H3는 어디서 써볼 수 있나요?
H3는 Hailuo AI 앱과 MiniMax 오픈 플랫폼 API(모델 ID MiniMax-H3)에서 서비스 중이며, 이미 여러 서드파티 크리에이티브 플랫폼에도 등장하고 있습니다. 출시 시점 API 가격은 오디오 포함 6초 2K 클립 기준 약 $0.78입니다.


