Skip to content
MiniMax H3·Hailuo 3.0·AI 비디오 생성기·AI 비디오 모델·

MiniMax H3란? 사양·모드·첫인상 정리 (2026)

MiniMax H3(Hailuo 3.0) 정리: 네이티브 스테레오 오디오가 붙는 15초 영상, 12개 멀티모달 입력, 지시문 편집, 그리고 함정이 있는 오픈 웨이트.

Pixo 팀·19 min read
MiniMax H3란? 사양·모드·첫인상 정리 (2026)

2026년 7월 31일, MiniMax는 Hailuo 라인에서 가장 야심 찬 모델을 내놓으면서 조용히 "비디오 모델"의 정의를 바꿔 놓았습니다. MiniMax H3(커뮤니티에서는 이미 Hailuo 3.0이라고 부릅니다)는 단순히 프롬프트를 클립으로 바꾸는 데 그치지 않습니다. 텍스트, 이미지, 비디오, 그리고 오디오를 하나의 통합 컨텍스트로 읽고, 스테레오 사운드가 처음부터 박혀 있는 15초짜리 장면을 만들어 낸 다음, 주사위를 다시 굴리는 대신 일상어 지시문으로 그 결과물을 편집하게 해 줍니다.

우리는 멀티 모델 AI 비디오 플랫폼 Pixo를 만듭니다. 그래서 프론티어 모델이 나올 때마다 두 가지를 합니다. 공식 문서를 한 줄씩 읽고, 이미 운영 중인 모델들과 비교해 테스트하는 것이죠. 이 첫인상 정리는 MiniMax 공식 비디오 생성 문서H3 모델 카드를 근거로 했습니다 — 정확한 입력 한도, 세 가지 생성 모드, 그리고 이 모델을 아예 돌릴 수 있는지 없는지를 좌우하는 라이선스 제한처럼 아직 영어권 기사에도 거의 안 나온 내용까지 포함해서요.

H3가 무엇이고, 진짜 새로운 것은 무엇이며, 영상으로 먹고사는 사람에게 어떤 의미인지 정리했습니다.

MiniMax H3 한눈에 보기

항목MiniMax H3
공개2026년 7월 31일 (가중치는 8월 3일 공개)
아키텍처330억 파라미터 덴스, 단일 스트림 옴니모달 트랜스포머
출력 길이4~15초, 24fps
해상도기본 768p, 최대 2K
화면비21:9, 16:9, 4:3, 1:1, 3:4, 9:16
오디오32kHz 네이티브 스테레오 — 대사, 앰비언스, 효과음을 같은 패스에서
멀티모달 입력총 12개까지: 이미지 9장 이하 + 비디오 클립 3개 이하 + 오디오 트랙 3개 이하
편집기존 푸티지에 대한 지시문 기반 편집
언어11개 언어 음성
이용 경로Hailuo AI 앱, MiniMax API(모델 ID MiniMax-H3), 오픈 웨이트

핵심 발상: 하나의 컨텍스트, 모든 모달리티

대부분의 AI 비디오 도구는 특수 목적 모델들을 이어 붙인 파이프라인입니다. 텍스트-투-비디오용 하나, 립싱크용 하나, 업스케일용 하나, 사운드용은 또 따로죠. H3로 MiniMax가 내미는 제안은 그 파이프라인을 하나의 "옴니모달" 시스템으로 접어 넣는 것입니다 — 구조적으로는 비디오 백본에 인코더를 덧붙이는 대신 모든 모달리티를 한 스트림에서 읽는 330억 파라미터 덴스 트랜스포머입니다. 실질적으로는 이미지, 비디오, 사운드 생성을 별개 작업으로 취급하지 않고 여러분이 넣은 자료 전부 — 대본, 얼굴 레퍼런스, 모션 클립, 음악 트랙 — 를 하나의 브리프로 읽은 뒤 완성된 시청각 장면을 뽑아낸다는 뜻입니다.

구체적으로는 한 프롬프트에 최대 12개 파일을 넘길 수 있습니다. 이미지 최대 9장, 비디오 클립 3개(합쳐서 15초), 오디오 트랙 3개입니다. 각 레퍼런스에는 역할을 선언해 줍니다 — 이 이미지는 캐릭터 얼굴을 고정하고, 이 비디오는 모션 레퍼런스이며, 이 트랙은 리듬을 잡는다는 식으로요. 모델은 이들을 콜라주하지 않고 융합합니다. 캐릭터를 일관되게 유지하면서 동시에 모션 레퍼런스를 맞추고 비트에 싱크를 맞추는 작업을 서로 다른 도구로 해 본 적이 있다면, 이게 왜 중요한지 바로 아실 겁니다.

사운드는 곁다리가 아닙니다

모든 H3 생성물에는 32kHz 네이티브 스테레오 오디오가 함께 나옵니다 — 립싱크가 맞는 대사, 룸톤, 효과음이 픽셀과 같은 패스에서 만들어집니다. 진짜 네이티브 오디오를 하는 모델은 손에 꼽는데, H3는 언어 쪽으로 한 발 더 나갑니다. 음성이 11개 언어를 커버합니다 — 아랍어, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어입니다. 레퍼런스 트랙에서 음색을 복제해 이식할 수도 있어서, "이 광고를 세 개 시장용으로 현지화하기"가 프로덕션 프로젝트에서 프롬프트 한 줄로 내려옵니다.

진짜 헤드라인은 편집

우리가 추적하는 거의 모든 클립 생성기와 H3를 갈라놓는 지점이 여기입니다. 기존 푸티지에 대한 편집 지시문을 받는다는 것이죠. MiniMax가 든 예시는 놀랄 만큼 소박합니다 — "영상 속 고양이를 강아지로 바꿔라" — 그러다 빛나는 편의점 간판을 교체하고, 탄산음료 캔을 브랜드 콜라로 바꾸고, 동시에 마지막 대사까지 다시 쓰는 수준으로 올라갑니다. 이 모든 걸 지시문 하나로, 샷의 나머지는 전부 그대로 둔 채로요. 배경을 바꾸고 장면 조명을 다시 잡거나, 대사 한 줄을 교체하면 연기가 미묘하게 거기 맞춰 조정되게 하거나, 캐릭터의 목소리를 복제한 음색으로 이식할 수도 있습니다.

현업 크리에이터에게 이건 AI 비디오에서 가장 비싼 습관을 정면으로 공격합니다. 바로 재생성이죠. 샷이 90% 맞았을 때 필요한 건 새 샷이 아니라 나머지 10%입니다.

세 가지 생성 모드

문서는 H3를 다루는 세 가지 방식을 정의하는데, 지금 어느 모드에 있는지에 따라 프롬프트를 쓰는 법이 달라집니다(공식 공식을 바탕으로 MiniMax H3 프롬프트 가이드를 따로 정리했습니다).

1. 레퍼런스 모드. 위에서 설명한 12개 파일 멀티모달 입력 전부입니다. 모든 에셋의 역할 — 얼굴 고정, 모션 레퍼런스, 리듬 트랙 — 을 라벨링하고 장면을 서술합니다.

2. 이미지-투-비디오 / 첫-끝 프레임 모드. 이미지를 한 장 또는 두 장 줍니다. 두 장이면 H3는 그것을 첫 프레임과 마지막 프레임으로 보고 그 사이의 움직임, 조명, 사운드를 채웁니다 — 주목할 점은 이 모드에서는 카메라 컷을 임의로 만들어 내지 않는다는 것입니다. 화면비는 입력 이미지를 따라갑니다.

3. 순수 텍스트-투-비디오. 레퍼런스 없이, 모델이 설명만으로 주체, 장면, 액션을 세웁니다. H3는 분위기 위주 문장보다 구체적이고 시각적이며 카메라를 의식한 글쓰기에 잘 반응합니다.

오픈 웨이트 — 그런데 지역 제한이라는 함정

대부분의 기사가 건너뛴 대목이고, 여러분이 H3를 쓸 수 있는지 없는지를 결정하는 대목입니다.

8월 3일, MiniMax는 H3의 가중치를 Hugging Face에 공개했습니다 — 프론티어 비디오 모델의 진짜 오픈 릴리스이며, Seedance를 닫아 둔 ByteDance와는 전략적으로 정반대입니다. 다만 이 공개는 Apache나 MIT가 아니라 MiniMax H3 커뮤니티 라이선스 아래 이뤄졌고, 라이선스 본문은 "적용 지역(Applicable Territory)"을 유럽연합, 영국, 대한민국, 미합중국을 제외한 전 세계로 규정합니다.

그대로 읽으면 이렇습니다. 미국, EU, 영국, 그리고 한국에 있다면 이 커뮤니티 라이선스는 가중치를 로컬에서 돌릴 권리를 주지 않습니다. 그 외 지역이라도 연 매출 2,000만 달러를 넘는 상업적 이용에는 별도의 서면 허가가 필요하고, 제품에 "MiniMax H3" 표기를 노출해야 합니다.

즉 한국 크리에이터에게 현실적인 경로는 로컬 배포가 아니라 호스팅 API — 또는 접근 권한을 라이선싱한 플랫폼입니다. 흔치 않은 제한이고, 돌릴 권리가 없을지도 모르는 모델에 GPU 예산을 잡기 전에 반드시 알아 둘 만합니다.

지금의 모델 지형에서 H3의 자리

솔직히 말하면 H3가 모든 축에서 앞서지는 않고, 하필 붐비는 날에 나왔습니다. 순수 해상도는 Kling 3.0과 Veo 3.1이 여전히 더 높습니다. 그리고 H3가 나온 바로 그날인 7월 31일, ByteDance는 Dreamina에서 Seedance 2.5를 글로벌 출시했습니다. 단일 테이크를 30초까지, 롱 비디오 모드로는 3분까지 밀어붙이고 자체 타임스탬프 편집 모드까지 얹었죠. "생성한 다음 편집한다"는 발상은 이제 확실히 H3만의 것이 아닙니다. 두 플래그십은 MiniMax H3 vs Seedance 2.5에서 자세히 비교했습니다.

H3가 여전히 독보적으로 쥐고 있는 것은 편집의 목소리와 언어 쪽 절반입니다. 대사 한 줄을 다시 쓰면 연기가 거기 맞춰 조정되고, 레퍼런스 트랙에서 목소리를 복제하며, 그림을 만든 바로 그 시스템 안에서 11개 언어 음성이 나옵니다. 일회성 스펙터클 샷이 아니라 브랜드, 대사, 여러 시장이 걸린 작업을 한다면, 그 조합은 해상도 한 단계보다 값어치가 큽니다.

물론 모델 하나가 곧 영화는 아닙니다. 15초 생성기는 다른 모델들과 나란히 스토리보드에 꽂힐 때 비로소 진짜 쓸모가 생깁니다 — 물리가 중요한 액션 비트에는 Seedance, 나중에 고칠 일이 뻔한 대사 장면에는 H3처럼요. 샷 단위 멀티 모델 워크플로가 바로 Pixo의 에이전트를 만든 이유이고, 그래서 우리는 Seedance 2.0, Kling 3.0, Veo 3.1과 함께 H3를 Pixo 스토리보드에 들이는 작업을 준비하고 있습니다.

이용 경로와 가격

H3는 소비자용 Hailuo AI 앱과 MiniMax 오픈 플랫폼 API에서 모델 ID MiniMax-H3로 이용할 수 있습니다. 정가는 2K 영상 초당 $0.13 — 오디오 포함 6초 클립이 약 $0.78 — 이고, 더 저렴한 768p 등급도 있습니다. 구형 Hailuo 2.3 요금보다 눈에 띄게 높은데, MiniMax가 이 모델을 시장 어디에 두려 하는지 보여 줍니다. 그리고 API 우선 전략은 확실히 먹히고 있습니다. 공개 첫 주 만에 H3는 여러 서드파티 창작 플랫폼에 줄줄이 올라왔습니다. 이 모델에 대한 접근 자체는 빠르게 퍼지고 있고, 오래 누군가의 해자가 되지는 못할 겁니다.

원본 클립보다 완성된 영상 단위로 작업하고 싶다면, Pixo는 주요 비디오 모델들 — Seedance, Kling, Veo, Hailuo 등 — 을 에이전트 기반 스토리보드 워크플로 하나로 묶어 돌리고 있고, MiniMax H3도 그 라인업에 합류하는 중입니다. 지금 가입하기 — 신규 가입 시 무료 크레딧 200 제공 — 하면 H3가 들어오는 순간 바로 연출을 시작할 수 있습니다.

자주 묻는 질문

MiniMax H3란 무엇인가요?

MiniMax H3(Hailuo 3.0이라고도 불립니다)는 MiniMax가 2026년 7월 31일에 공개한 옴니모달 비디오 모델입니다. 텍스트, 이미지, 비디오, 오디오를 하나의 통합 컨텍스트로 다루며, 최대 2K 해상도에서 네이티브 스테레오 오디오가 포함된 4~15초 영상을 단일 패스로 생성합니다.

MiniMax H3와 Hailuo 3.0은 같은 모델인가요?

네. MiniMax는 회사 이름, Hailuo는 소비자용 비디오 브랜드, H3는 3세대 모델입니다. API 모델 ID는 MiniMax-H3이고 커뮤니티에서는 주로 Hailuo 3.0이라고 부릅니다 — 같은 모델입니다.

MiniMax H3는 오디오도 생성하나요?

네 — 모든 H3 출력에는 영상과 같은 패스에서 생성된 32kHz 네이티브 스테레오 오디오가 포함됩니다. 립싱크가 맞는 대사, 앰비언트 사운드, 효과음까지 함께 나옵니다. 음성은 중국어, 영어, 일본어, 한국어, 아랍어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 러시아어, 스페인어 등 11개 언어를 지원합니다.

MiniMax H3로 영상을 편집할 수 있나요?

네, 그리고 이것이 H3의 가장 차별화된 기능입니다. H3는 기존 푸티지에 대해 일상어로 쓴 편집 지시문을 받습니다. 캐릭터나 사물 교체, 배경이나 조명 변경, 대사 한 줄 수정, 목소리 이식이 가능하며, 편집하지 않은 영역은 그대로 유지됩니다.

MiniMax H3는 오픈 소스인가요?

MiniMax는 2026년 8월 3일 330억 파라미터 가중치를 Hugging Face에 공개했지만, 표준 오픈 소스 라이선스가 아닌 커뮤니티 라이선스를 적용했습니다. 이 라이선스는 미국, 유럽연합, 영국, 대한민국을 적용 지역에서 제외하므로, 해당 지역 크리에이터는 직접 배포하지 말고 호스팅 API를 사용해야 합니다.

이 글의 사양은 2026년 8월 5일에 읽은 MiniMax 공식 비디오 생성 문서, MiniMax-H3 Hugging Face 모델 카드, 공개된 라이선스 본문에서 확인했으며, Pixo에서 프로덕션으로 운영 중인 모델들과 교차 검증했습니다. 가격과 라이선스 조건은 바뀝니다 — 예산을 잡기 전에 원문을 직접 확인하세요.

오늘부터 시네마틱 AI 비디오 제작을 시작하세요.

Pixo를 사용하여 이야기를 시각적 현실로 바꾸는 수천 명의 크리에이터에 합류하세요.

무료로 시작하기

신용카드 불필요 • 무료 200 크레딧