Skip to content
MiniMax H3·Hailuo 3.0·Công cụ tạo video AI·Mô hình video AI·

MiniMax H3 là gì? Thông số, chế độ và đánh giá đầu tiên (2026)

Giải mã MiniMax H3 (Hailuo 3.0): video 15 giây kèm âm thanh stereo nguyên bản, 12 tệp đa phương thức, chỉnh sửa bằng câu lệnh và trọng số mở.

Pixo Team·13 min read
MiniMax H3 là gì? Thông số, chế độ và đánh giá đầu tiên (2026)

Ngày 31 tháng 7 năm 2026, MiniMax tung ra mô hình tham vọng nhất trong dòng Hailuo — và lặng lẽ thay đổi ý nghĩa của hai chữ "mô hình video". MiniMax H3 (cộng đồng đã gọi luôn là Hailuo 3.0) không chỉ biến prompt thành clip. Nó đọc văn bản, ảnh, video âm thanh như một ngữ cảnh hợp nhất, tạo ra cảnh dài 15 giây có sẵn âm thanh stereo bên trong — rồi cho bạn chỉnh sửa kết quả bằng một câu lệnh đời thường thay vì đổ lại xúc xắc.

Chúng tôi xây dựng Pixo, một nền tảng video AI đa mô hình, nghĩa là mỗi lần có mô hình tiên phong ra mắt, chúng tôi làm hai việc: đọc tài liệu chính thức từng dòng một, và thử nó cạnh những mô hình chúng tôi đang vận hành. Bài đánh giá đầu tiên này dựa trên tài liệu tạo video chính thức của MiniMaxmodel card của H3 — bao gồm cả những chi tiết chưa xuất hiện trong hầu hết bài viết tiếng Anh, như giới hạn đầu vào chính xác, ba chế độ tạo, và hạn chế giấy phép quyết định việc bạn có được phép chạy mô hình này hay không.

Dưới đây là H3 thực chất là gì, đâu là điều mới mẻ thật sự, và nó có ý nghĩa gì nếu bạn sống bằng nghề làm video.

Nhìn nhanh MiniMax H3

Thông sốMiniMax H3
Ra mắt31/7/2026 (trọng số theo sau ngày 3/8)
Kiến trúcTransformer đa phương thức toàn diện, đơn luồng, dạng dense 33 tỷ tham số
Độ dài đầu ra4–15 giây, 24 fps
Độ phân giảiMặc định 768p; tối đa 2K
Tỷ lệ khung hình21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Âm thanhStereo nguyên bản 32 kHz — lời thoại, tiếng nền, hiệu ứng trong cùng một lượt
Đầu vào đa phương thứcTối đa 12 tệp: ≤9 ảnh + ≤3 clip video + ≤3 bản âm thanh
Chỉnh sửaChỉnh sửa cảnh quay có sẵn bằng câu lệnh
Ngôn ngữGiọng nói ở 11 ngôn ngữ
Cách truy cậpỨng dụng Hailuo AI, API MiniMax (model ID MiniMax-H3), trọng số mở

Ý tưởng lớn: Một ngữ cảnh, mọi phương thức

Hầu hết công cụ video AI là một chuỗi các mô hình chuyên dụng: một cho text-to-video, một cho khớp khẩu hình, một để nâng độ phân giải, thêm cái nữa cho âm thanh. Lời chào hàng của MiniMax với H3 là gộp cả chuỗi ấy vào một hệ thống "đa phương thức toàn diện" duy nhất — về mặt kiến trúc, đó là một transformer dense 33 tỷ tham số đọc mọi phương thức trong cùng một luồng thay vì gắn thêm encoder lên một bộ khung video. Trên thực tế, nó thôi xem việc tạo ảnh, video và âm thanh là những tác vụ tách rời, và thay vào đó đọc toàn bộ nguyên liệu của bạn — một kịch bản, một ảnh gương mặt tham chiếu, một clip chuyển động, một bản nhạc — như một bản brief duy nhất, rồi cho ra một cảnh nghe-nhìn hoàn chỉnh.

Cụ thể, bạn có thể đưa cho H3 tối đa 12 tệp trong một prompt: tối đa 9 ảnh, 3 clip video (tổng 15 giây), và 3 bản âm thanh. Mỗi tham chiếu được khai báo một vai trò — ảnh này khóa gương mặt nhân vật, video này là tham chiếu chuyển động, bản nhạc này định nhịp. Mô hình hợp nhất chúng chứ không dán chúng lại cạnh nhau. Nếu bạn từng cố giữ một nhân vật nhất quán đồng thời bám theo một tham chiếu chuyển động khớp nhịp nhạc trên nhiều công cụ rời rạc, bạn sẽ hiểu vì sao điều này đáng giá.

Âm thanh không phải thứ nghĩ sau

Mỗi lần tạo của H3 đều đi kèm âm thanh stereo nguyên bản ở 32 kHz — lời thoại khớp khẩu hình, tiếng phòng, hiệu ứng — được dựng trong cùng lượt với từng điểm ảnh. Chỉ một số ít mô hình làm được âm thanh nguyên bản thực sự, và H3 còn đi xa hơn ở mặt ngôn ngữ: giọng nói của nó phủ 11 thứ tiếng — Ả Rập, Trung, Anh, Pháp, Đức, Ý, Nhật, Hàn, Bồ Đào Nha, Nga và Tây Ban Nha. Nó cũng có thể sao chép và chuyển chất giọng từ một bản tham chiếu, biến "bản địa hóa quảng cáo này cho ba thị trường" từ một dự án sản xuất thành một câu prompt.

Chỉnh sửa mới là tính năng đinh

Đây là phần tách H3 khỏi gần như mọi công cụ tạo clip mà chúng tôi theo dõi: nó nhận câu lệnh chỉnh sửa áp lên cảnh quay có sẵn. Ví dụ của chính MiniMax bình dị đến đáng yêu — "thay con mèo trong video bằng một con chó" — rồi leo thang tới những việc như đổi tấm biển hiệu cửa hàng tiện lợi đang phát sáng, biến lon nước ngọt thành một lon cola có thương hiệu, viết lại câu thoại kết, tất cả trong một câu lệnh, trong khi mọi thứ khác trong khung hình vẫn nằm yên. Bạn có thể đổi nền và thắp sáng lại cảnh, thay một câu thoại và để diễn xuất tự điều chỉnh theo, hoặc chuyển giọng nhân vật sang một chất giọng đã sao chép.

Với người làm nghề, điều này đánh thẳng vào thói quen tốn kém nhất trong video AI: tạo lại từ đầu. Khi một cảnh đã đúng 90%, bạn không muốn một cảnh mới — bạn muốn 10% còn lại.

Ba chế độ tạo video

Tài liệu định nghĩa ba cách khác nhau để điều khiển H3, và biết mình đang ở chế độ nào sẽ đổi cách bạn viết prompt (chúng tôi đã viết một hướng dẫn prompt MiniMax H3 đầy đủ dựa trên công thức chính thức):

1. Chế độ tham chiếu. Toàn bộ đầu vào đa phương thức 12 tệp nói ở trên. Bạn gắn nhãn vai trò cho từng tài nguyên — khóa gương mặt, tham chiếu chuyển động, bản nhạc định nhịp — rồi mô tả cảnh.

2. Chế độ ảnh-thành-video / khung đầu-khung cuối. Đưa cho nó một hoặc hai ảnh. Với hai ảnh, H3 xem chúng là khung đầu và khung cuối rồi lấp đầy chuyển động, ánh sáng và âm thanh ở giữa — đáng chú ý là ở chế độ này nó sẽ không tự bịa ra cắt cảnh. Tỷ lệ khung hình theo ảnh đầu vào của bạn.

3. Text-to-video thuần túy. Không có tham chiếu nào; mô hình dựng chủ thể, bối cảnh và hành động từ mô tả của bạn. H3 ưu ái lối viết cụ thể, trực quan và có ý thức về máy quay hơn là những câu cảm tính mơ hồ.

Trọng số mở — kèm một điều kiện về lãnh thổ

Đây là chi tiết mà hầu hết bài viết bỏ qua, và cũng là chi tiết quyết định H3 có dùng được cho bạn hay không.

Ngày 3 tháng 8, MiniMax đăng trọng số của H3 lên Hugging Face — một lần mở thực sự cho một mô hình video tiên phong, và là đối cực chiến lược với việc ByteDance giữ kín Seedance. Nhưng nó đi kèm MiniMax H3 Community Licence, không phải Apache hay MIT, và văn bản giấy phép định nghĩa "phạm vi lãnh thổ áp dụng" là toàn cầu ngoại trừ Liên minh châu Âu, Vương quốc Anh, Hàn Quốc và Hoa Kỳ.

Nói thẳng: nếu bạn ở Mỹ, EU, Anh hay Hàn Quốc, giấy phép cộng đồng này không trao cho bạn quyền chạy các trọng số đó tại máy của mình. Việc dùng thương mại ở nơi khác cũng cần văn bản cho phép riêng nếu doanh thu năm vượt 20 triệu đô, cộng thêm dòng ghi công "MiniMax H3" hiển thị trong sản phẩm.

Với phần lớn độc giả của chúng tôi, điều đó khiến API lưu trữ sẵn — hoặc một nền tảng đã mua quyền truy cập — mới là con đường thực tế, chứ không phải tự triển khai. Đó là một hạn chế bất thường, và đáng biết trước khi bạn tính tiền GPU cho một mô hình mà có thể bạn không được phép chạy.

H3 nằm ở đâu trên bản đồ mô hình hiện nay

Câu trả lời thật lòng: H3 không áp đảo trên mọi phương diện, và nó chọn đúng một ngày đông đúc để ra mắt. Kling 3.0 và Veo 3.1 vẫn cho độ phân giải thô cao hơn. Và ngày 31 tháng 7 — đúng ngày H3 xuất xưởng — ByteDance ra mắt Seedance 2.5 toàn cầu trên Dreamina, đẩy khả năng tạo lên một cú máy liền 30 giây với chế độ video dài chạm mốc ba phút, đồng thời bổ sung các chế độ chỉnh sửa theo mốc thời gian của riêng nó. Ý tưởng tạo-rồi-sửa rõ ràng không còn của riêng H3 nữa; chúng tôi đã so sánh chi tiết hai mô hình đầu bảng này trong bài MiniMax H3 vs Seedance 2.5.

Thứ H3 vẫn sở hữu riêng là nửa giọng nói và ngôn ngữ của việc chỉnh sửa: viết lại một câu thoại và để diễn xuất tự điều chỉnh, sao chép giọng từ một bản tham chiếu, và nói được 11 thứ tiếng ngay trong chính hệ thống đã tạo ra hình ảnh. Nếu công việc của bạn dính tới thương hiệu, lời thoại hay nhiều thị trường — thay vì những cảnh phô diễn đơn lẻ — thì tổ hợp đó đáng giá hơn một nấc độ phân giải nữa.

Dù vậy, một mô hình vẫn chưa phải một bộ phim. Một công cụ tạo 15 giây chỉ thực sự hữu dụng khi nó nằm trong một storyboard cạnh các mô hình khác — Seedance cho một nhịp hành động nặng vật lý, H3 cho cảnh thoại mà bạn sẽ muốn sửa lại sau. Quy trình đa mô hình theo từng cảnh đó chính là thứ chúng tôi xây dựng agent của Pixo quanh nó, và cũng là lý do chúng tôi đang chuẩn bị đưa H3 vào storyboard của Pixo bên cạnh Seedance 2.0, Kling 3.0 và Veo 3.1.

Truy cập và giá

H3 đã chạy trong ứng dụng Hailuo AI dành cho người dùng cuối và qua API nền tảng mở của MiniMax với model ID MiniMax-H3. Giá niêm yết là 0,13 đô mỗi giây video 2K — khoảng 0,78 đô cho một clip 6 giây kèm âm thanh — cùng một bậc 768p rẻ hơn. Mức đó cao hơn hẳn giá của Hailuo 2.3 đời cũ, cho thấy MiniMax nghĩ mô hình này thuộc phân khúc nào. Và chiến lược ưu tiên API rõ ràng đang phát huy: chỉ trong tuần đầu, H3 đã xuất hiện trên hàng loạt nền tảng sáng tạo của bên thứ ba. Quyền truy cập thô vào mô hình này đang lan rất nhanh, và sẽ không còn là lợi thế riêng của ai được lâu.

Nếu bạn muốn làm việc ở cấp độ video hoàn chỉnh thay vì clip thô, Pixo vận hành những mô hình video hàng đầu — Seedance, Kling, Veo, Hailuo và nhiều hơn nữa — sau một quy trình storyboard do agent dẫn dắt, và MiniMax H3 đang trên đường gia nhập đội hình đó. Đăng ký ngay — người dùng mới nhận 200 tín dụng miễn phí khi đăng ký — để sẵn sàng chỉ đạo H3 ngay khi nó có mặt.

Câu hỏi thường gặp

MiniMax H3 là gì?

MiniMax H3 (còn gọi là Hailuo 3.0) là mô hình video đa phương thức toàn diện do MiniMax phát hành ngày 31 tháng 7 năm 2026. Nó xem văn bản, ảnh, video và âm thanh như một ngữ cảnh hợp nhất, và tạo ra video dài 4–15 giây ở độ phân giải tới 2K kèm âm thanh stereo nguyên bản chỉ trong một lượt.

MiniMax H3 có phải là Hailuo 3.0 không?

Đúng vậy. MiniMax là tên công ty, Hailuo là thương hiệu video dành cho người dùng cuối, còn H3 là mô hình thế hệ thứ ba. Model ID trên API là MiniMax-H3, và phần lớn cộng đồng gọi nó là Hailuo 3.0 — vẫn là cùng một mô hình.

MiniMax H3 có tạo được âm thanh không?

Có — mọi đầu ra của H3 đều kèm âm thanh stereo nguyên bản ở 32 kHz, được tạo trong cùng lượt với hình ảnh: lời thoại khớp khẩu hình, tiếng nền và hiệu ứng. Phần giọng nói hỗ trợ 11 ngôn ngữ, gồm tiếng Trung, Anh, Nhật, Hàn, Ả Rập, Pháp, Đức, Ý, Bồ Đào Nha, Nga và Tây Ban Nha.

MiniMax H3 có chỉnh sửa được video không?

Có, và đây là năng lực đặc trưng nhất của nó. H3 nhận câu lệnh chỉnh sửa bằng ngôn ngữ đời thường áp lên cảnh quay có sẵn — thay một nhân vật hay vật thể, đổi nền hoặc ánh sáng, viết lại một câu thoại, hay chuyển giọng nói — trong khi những vùng không chỉnh vẫn giữ nguyên.

MiniMax H3 có phải mã nguồn mở không?

MiniMax đã đăng bộ trọng số 33 tỷ tham số lên Hugging Face ngày 3 tháng 8 năm 2026, nhưng theo giấy phép cộng đồng chứ không phải một giấy phép mã nguồn mở tiêu chuẩn. Giấy phép loại Hoa Kỳ, Liên minh châu Âu, Vương quốc Anh và Hàn Quốc khỏi phạm vi lãnh thổ áp dụng, nên nhà sáng tạo ở những khu vực này nên dùng API lưu trữ sẵn thay vì tự triển khai.

Các thông số trong bài này được đọc từ tài liệu tạo video chính thức của MiniMax, model card MiniMax-H3 trên Hugging Face và văn bản giấy phép đã công bố vào ngày 5 tháng 8 năm 2026, rồi đối chiếu với những mô hình chúng tôi đang chạy trong môi trường sản xuất trên Pixo. Giá và điều khoản giấy phép có thể thay đổi — hãy kiểm tra lại nguồn gốc trước khi lên ngân sách.

Sẵn sàng cách mạng hóa quy trình làm việc?

Tham gia cùng hàng nghìn nhà sáng tạo sử dụng Pixo để biến câu chuyện thành hiện thực.

Đăng ký ngay

Không cần thẻ tín dụng • Miễn phí 200 credits