Trình tạo video AI có âm thanh: Âm thanh gốc MiniMax H3
Hầu hết trình tạo video AI đều câm lặng. MiniMax H3 tạo lời thoại, tiếng động môi trường và hiệu ứng cùng hình ảnh — stereo, khớp môi. Cách vận hành trên Pixo.

Có một khoảnh khắc mọi quy trình video AI đều chạm phải: clip trông tuyệt vời, và nó hoàn toàn câm lặng. Thế là bạn đi tìm một nền nhạc, một công cụ TTS cho lời dẫn, một thứ gì đó cho hiệu ứng âm thanh — rồi bạn phát hiện phần khó, đó là một giọng nói thu đè lên video không bao giờ thực sự thuộc về nó. Room tone sai, khuôn miệng không cử động, tiếng bước chân rơi vào hư không. Thiết kế âm thanh trở thành một cuộc sản xuất thứ hai.
Đó là khoảng trống mà H3 của MiniMax khép lại khi xuất xưởng ngày 31/07: nó không thêm âm thanh vào video, nó tạo cả hai cùng nhau. Chúng tôi vận hành Pixo, một nền tảng video đa mô hình nơi H3 đang chạy trong Playground, và trong mọi thứ ở bảng thông số của H3, đây là năng lực thay đổi công việc hằng ngày nhiều nhất — nên đây là chính xác cách nó hành xử và cách prompt nó.
"Âm thanh gốc" thực sự nghĩa là gì
Mọi đầu ra của H3 đều kèm âm thanh stereo tạo trong cùng lần chạy với hình ảnh. Ba lớp âm thanh ra đời từ một prompt:
- Lời thoại. Viết câu thoại nguyên văn và một nhân vật nói nó ra — kèm khớp môi, vì khẩu hình và âm thanh đến từ cùng một lần tạo. Viết lại câu thoại và màn diễn đi theo.
- Tiếng động môi trường. Cảnh nghe đúng như cảnh: gió trên đầm lầy, tiếng rì rầm gian bếp, xe cộ sau lớp kính. Bạn không hẳn phải yêu cầu nó — bạn chỉ có thể quên loại trừ nó.
- Hiệu ứng. Âm thanh va chạm rơi đúng chỗ vật lý xảy ra — nắp hộp click khi mở, tiếng vỗ cánh vang lên khi con chim cất cánh.
Khác biệt so với lồng tiếng không hề tinh vi. Âm thanh hậu kỳ phủ lên là thứ nói về video; âm thanh được tạo là thứ thuộc về nó. Khi một nhân vật quay đi giữa câu nói, giọng nói xoay theo họ.
Ai có âm thanh, ai không
Âm thanh đã lặng lẽ trở thành lằn ranh giữa các thế hệ mô hình:
| Mô hình | Âm thanh gốc |
|---|---|
| MiniMax H3 | ✅ Stereo trên mọi đầu ra — lời thoại, tiếng động môi trường, hiệu ứng |
| Seedance 2.5 | ✅ Có |
| Veo 3.1 | ✅ Có |
| Wan 2.6 | ✅ Có — lời thoại và hiệu ứng đồng bộ |
| Kling 3.0 | ❌ Đầu ra câm |
Thứ H3 bồi thêm bên trên chuyện "có âm thanh" là bộ năng lực giọng nói: text-to-speech trải nhiều ngôn ngữ, và nhân bản giọng từ track tham chiếu — tải một giọng lên, và lời thoại được tạo bằng đúng âm sắc đó. (Năng lực đó xứng đáng một bài đào sâu riêng; ở đây ta bám vào ca dùng thường ngày.)
Bốn quy tắc khi prompt âm thanh
1. Lời thoại phải được viết ra. H3 không ứng tác câu chữ. Một giọng mệt mỏi nói: "Năm phút nữa mình mở cửa." tạo ra đúng câu đó — không gì khác. Yêu cầu mơ hồ ("cô ấy nói gì đó trấn an") sinh kết quả mơ hồ.
2. Quyết định ai trong khung hình. Người nói nhìn thấy được thì có khớp môi; giọng ngoài khung hình đọc lên như lời dẫn chuyện. Cả hai chỉ là một dòng prompt — khác biệt nằm ở chỗ bạn có đặt người nói vào khung hình hay không.
3. Diệt nhạc trừ khi bạn muốn nó. H3 sẵn lòng phối nhạc cho clip của bạn. Nếu bạn sẽ thêm nhạc bản quyền ở hậu kỳ — như phần lớn công việc thương hiệu — hãy kết thúc prompt bằng non-narrative music: N/A và giữ track sạch.
4. Tham chiếu âm thanh luôn đi cùng, không bao giờ đi một mình. Bạn có thể tải một track âm thanh (≤15MB) để đặt nhịp độ hoặc chất giọng, nhưng nó phải kèm một tham chiếu ảnh hoặc video — audio không thể là đầu vào duy nhất.
Ba prompt copy-paste
1. Lời thoại trong khung hình có khớp môi (16:9)
File tham chiếu của showcase


Một showcase trong tài liệu cùng chất liệu
Một quán ăn khuya ấm cúng, ánh đèn tungsten vàng ấm, mưa nhẹ trên ô cửa kính. Một
người phụ nữ ngoài ba mươi ngồi bên quầy, hai tay ôm cốc cà phê. Cô ngước nhìn máy
quay và nói: "Anh lúc nào cũng gọi đúng món đó." Cô khẽ mỉm cười sau câu nói.
Tiếng quán ăn yên ắng — mưa, radio xa xăm, tiếng dao dĩa. Non-narrative music: N/A.
Vì sao hiệu quả: một người nói, một câu thoại viết ra, một nhịp phản ứng. Danh sách tiếng động môi trường tạo sân khấu âm thanh mà không tranh chỗ với lời thoại.
2. Khoảnh khắc sản phẩm có lời dẫn (9:16)
File tham chiếu của showcase
Một showcase trong tài liệu cùng chất liệu
Video dọc. Một bộ pha cà phê pour-over trên mặt quầy gỗ, nắng sớm. Nước nóng xoáy
tròn từ ấm rót xuống phễu lọc; hơi nước bốc lên; máy quay đẩy vào chậm rãi.
Một giọng nam điềm tĩnh nói: "Ba mươi gam. Ba phút. Không đường tắt."
Tiếng nước rót và hơi nước dịu nhẹ. Non-narrative music: N/A.
Vì sao hiệu quả: lời dẫn ngoài khung hình đồng nghĩa hoàn toàn không có rủi ro khớp môi, và các âm thanh vật lý (tiếng rót, hơi nước) làm phần không khí mà một nền nhạc thường phải giả vờ.
3. Màn trình diễn dẫn bằng tham chiếu (ba video vào, một bài hát ra)
File tham chiếu của showcase
Showcase trong tài liệu mà prompt này phỏng theo
Video 1 cung cấp chuyển động máy: một cú dolly zoom kiểu Hitchcock. Video 2 là chủ
thể: một người phụ nữ uống cà phê ở quán vỉa hè. Video 3 cung cấp bài hát và màn
trình diễn hát. Cho người phụ nữ trong Video 2 hát — giọng, cách nhả chữ và màn
trình diễn lấy từ Video 3 — trong khi máy quay thực hiện cú dolly zoom của Video 1
lên cô.
Vì sao hiệu quả: ba tham chiếu, ba nhiệm vụ — máy quay, chủ thể, bài hát — và âm thanh được tạo như một màn trình diễn, không phải đặt đè lên như một track. Đây là chính màn trình diễn của tài liệu rằng đạo diễn âm thanh cũng chỉ là một vai trò tham chiếu nữa.
Thử ngay
MiniMax H3 đã có trong Playground của Pixo: chọn Video → MiniMax H3, viết một prompt kèm câu bạn muốn được nói ra, và tạo một cảnh 4–15 giây ở 768p hoặc 2K — có sẵn âm thanh, xuất không watermark. Để có bức tranh mô hình đầy đủ, bắt đầu với MiniMax H3 là gì; về việc bộ âm thanh của nó so với flagship còn lại ra mắt cùng ngày, xem MiniMax H3 vs Seedance 2.5.
Câu hỏi thường gặp
Trình tạo video AI có tạo được âm thanh không?
Một số có, phần lớn thì không. MiniMax H3, Seedance, Veo 3.1 và Wan 2.6 tạo âm thanh nguyên bản; Kling 3.0 xuất video câm. H3 đi xa nhất: mọi đầu ra đều kèm âm thanh stereo — lời thoại, tiếng động môi trường và hiệu ứng — được tạo trong cùng lần chạy với hình ảnh, không phải phủ lên sau.
MiniMax H3 có khớp môi lời thoại không?
Có. Viết đúng câu thoại vào prompt và H3 tạo giọng nói cùng hình ảnh, với khẩu hình nhân vật khớp với lời. Text-to-speech của nó trải nhiều ngôn ngữ, nên lời thoại không bị giới hạn ở tiếng Anh.
Làm video AI có lời dẫn như thế nào?
Viết nguyên văn phần lời dẫn vào prompt — ví dụ: Một giọng nam điềm tĩnh nói: "Công cụ tốt tan biến vào công việc." H3 tạo giọng nói cùng video. Nếu người nói trong khung hình, khớp môi đi theo; nếu ngoài khung hình, nó thành lời dẫn chuyện.
Tôi có tắt được nhạc nền không?
Có — kết thúc prompt bằng "non-narrative music: N/A" và H3 giữ track sạch: chỉ lời thoại, tiếng động môi trường và hiệu ứng. Đó là chế độ nên dùng khi bạn sẽ thêm nhạc thương hiệu có bản quyền ở hậu kỳ.
Tôi có dùng được âm thanh của riêng mình làm tham chiếu không?
Có. Tải một track âm thanh lên (tới 15MB) kèm một tham chiếu ảnh hoặc video — audio không thể là đầu vào duy nhất — và dùng nó để đặt nhịp độ hoặc chất giọng. H3 cũng hỗ trợ nhân bản giọng từ track tham chiếu.
Dùng thử thế nào?
MiniMax H3 đã có trong Playground của Pixo — tạo các cảnh 4–15 giây ở 768p hoặc 2K. Người dùng mới nhận 200 tín dụng miễn phí khi đăng ký, và các gói hiện đang giảm tới 55%.
MiniMax H3 đã có mặt trong Playground của Pixo — tạo các cảnh 4–15 giây ở 768p hoặc 2K, với tham chiếu ảnh, video và âm thanh. Đăng ký ngay — người dùng mới nhận 200 tín dụng miễn phí khi đăng ký, và các gói hiện đang giảm tới 55%. Đưa sản phẩm lên màn hình? Xem video sản phẩm TMĐT với H3.
Sẵn sàng cách mạng hóa quy trình làm việc?
Tham gia cùng hàng nghìn nhà sáng tạo sử dụng Pixo để biến câu chuyện thành hiện thực.
Đăng ký ngayKhông cần thẻ tín dụng • Miễn phí 200 credits


