AI動画のボイスクローン: MiniMax H3 と11言語対応
声をクローンし、顔はそのまま、同じ動画を11言語で出荷する。MiniMax H3 のボイスクローンと多言語 TTS の仕組み、そして Pixo での試し方を解説します。

大半のローカライズ計画を殺す計算がこれです。ヒーロー動画1本、6つの市場、そしてどの市場もスポークスパーソンがその言語を話すことを求める。従来の答えは、6人の声優、6回の吹き替えセッション、そしてスペイン語のトラックの下で口が明らかに英語を話している6つのバージョン。字幕の方が安く、そしてその安さなりの成果しか出ません。
MiniMax H3 は、この問題を生成の側から攻めます。モデル仕様は、ボイスクローンと、11言語を高精度で、さらに約40言語を派生でカバーするテキスト読み上げを組み合わせています — それも映像を生成するのと同じシステムの中で。つまりローカライズはポストプロダクションのオーバーレイであることをやめ、再生成になります。同じシーン、同じ顔、同じ声質 — 異なる言語、ネイティブなリップシンク。これはこのモデルが本当に独占している能力です。同日にローンチしたもう1つの旗艦は編集では H3 に並びましたが、声のスタックでは並べませんでした。
私たちはマルチモデル動画プラットフォーム Pixo を運営しており、H3 は Playground で稼働中です。声のパイプラインの仕組みと実行方法を解説します。
声のスタックはどう噛み合うか
3つの能力が連動します。
- ボイスクローン。 声のサンプルを音声リファレンスとしてアップロードすると、生成されるセリフはその声質で出てきます。マニュアルのデモは魅力的なほどシンプル — 牧場の少女がクローンされた声でセリフを言う — ですが、メカニズムこそがプロダクトです。声は、顔と同じく、入力なのです。
- 多言語 TTS。 セリフはあなたが書いたもの、あなたが書いた言語で。モデルは11言語を高精度でカバーし、さらに多くの言語へ伸ばせます。Pixo では、正確な言語サポートは想定するのではなく、ターゲット市場向けにテストすべきものとして扱いましょう。
- ネイティブリップシンク。 音声と映像がワンパスで生成されるため、口はあなたが書いたセリフを話します — 日本語で、スペイン語で、アラビア語で。これは吹き替えでは決して後付けできない部分です。
これらを積み重ねると、この記事のタイトルどおりのワークフローになります。一度クローンし、セリフをN回書き、Nバージョンを生成する。
ワークフロー: 1人のスポークスパーソン、N個の市場
- 話者を固定する。 明瞭なポートレートをアップロードします。それが画像1になり、すべての言語バージョンで顔をアンカーします。
- 声のサンプルを追加する。 権利を持つ声のクリーンな録音を、音声リファレンスとしてアップロード(15MB以下)。ルールを忘れずに: 音声は決して単独では乗れません — 必ず画像かビデオリファレンスに添えます。
- 言語ごとにセリフを書く。 一字一句、ターゲット言語で。コピーはネイティブスピーカーにチェックしてもらいましょう。モデルはあなたが書いたセリフを、その間違いも含めて話します。
- 各バージョンを生成する。 同じプロンプトの骨組み、差し替えたセリフ。1ショット4〜15秒、9:16 または 16:9、ドラフトは 768p、出荷版は 2K で。
- ネイティブの耳でQAする。 発音とレジスターは言語ごとに変わります。ローンチ前に聴きましょう。
コピペで使える2つのプロンプト
1. 多言語スポークスパーソン(言語ごとに1回生成)
このショーケースのリファレンスファイル
マニュアルのボイスクローン・ショーケース
画像1が話者の顔を固定する。音声1がクローンする声質を提供する。
16:9、明るいモダンなオフィスラウンジ、柔らかい日中の光。話者はカメラに向かって
リラックスして立ち、手を軽く組み、クローンされた声でこう言う:「[ターゲット言語で
書いた2〜3文のメッセージ]」自然なリップシンク、最後の文で小さくうなずく。
静かな室内の環境音。Non-narrative music: N/A。
なぜ効くか: セリフ以外のすべてが釘付けにされているため、ドイツ語版と日本語版の間で変わるのはセリフの文字列だけです。ブランドの一貫性のために欲しいのは、まさにそれです。
2. ローカライズされたドラマのセリフ(1人のキャラクターの言語を差し替え)
このショーケースのリファレンスファイル
同じ書式によるマニュアル収録ショーケース
画像1が女性主演の顔を固定する。音声1が彼女の声質を提供する。
9:16 の縦型シーン、雨の夜、店の日よけの下の通り、ネオンの反射。
クローズアップ: 彼女はカメラの向こうを見て、クローンされた声で、[ターゲット言語]で
言う:「[セリフ]」最後の言葉で、表情が張り詰めたものから柔らかいものへ変わる。
セリフの下に雨と遠くの車の音。Non-narrative music: N/A。
なぜ効くか: 演技の指示(「最後の言葉で張り詰めたものから柔らかいものへ」)は、言葉が変わっても言語をまたいで通用します。それこそが、10個のローカライズを1本の映画のように感じさせるものです。

再生成 vs 吹き替え: それぞれが勝つ場面
| 吹き替え / 翻訳ツール | H3 の再生成 | |
|---|---|---|
| 口の動き | 元の言語のまま | 各バージョンにネイティブ |
| 声 | 市場ごとに声優か汎用 TTS | どこでも1つのクローン声質 |
| 対象 | 任意の完成映像、任意の長さ | 4〜15秒の生成ショット |
| 最適 | 長尺コンテンツ、アーカイブ、インタビュー | 広告、フック、スポークスパーソンのスポット |
正直な線引きはこうです。40分のインタビューなら吹き替え。有料キャンペーンを支える15秒のスポット — 口がクローズアップされ、信頼性こそが商品である場面 — なら再生成が勝ちます。しかもそれは、H3 がもともと生成する長さです。ローカライズされたクリエイティブを大量に回しているなら、UGC 風広告のワークフローと自然に組み合わさります。
同意のライン
クローンしてよいのは、権利を持つ声だけです。自分の声、書面の同意を得たスポークスパーソンの声、ライセンスされた声。創業者の声をローカライズできるのと同じ機能は、同意していない誰かを模倣することもできます — そのユースケースにならないでください。FTC はまさにこの悪用について警告しています。(Pixo の利用規約は、アップロードするリファレンスへの権利を要求しています。)
よくある質問
AIで動画用の声をクローンできますか?
できます。MiniMax H3 はリファレンス音声トラックから声をクローンします。声のサンプルを画像またはビデオリファレンスと一緒にアップロードすると、生成されるセリフはその声質で出力されます。画面上のキャラクターが話し、リップシンクは映像と同じパスで生成されます。
1本の動画はどうやって11言語になるのですか?
吹き替えではなく、再生成によってです。モデル仕様は11言語の高精度なテキスト読み上げをカバーし(約40言語を派生で追加可能)、同じシーン、同じ話者、同じクローン声質を保ったまま、言語ごとに書かれたセリフを差し替えます。各バージョンは口の動きが一致した状態で生成されます。
AI吹き替えツールとどう違うのですか?
吹き替えツールは完成した映像に翻訳されたトラックを重ねるため、口は元の言語を話し続けます。ここでは声と映像が一緒に生成されるため、各言語バージョンはネイティブなリップシンクと、そのセリフに帰属する演技を持ちます。
声をクローンするには何をアップロードしますか?
2つです。声のサンプルを音声リファレンスとして(最大15MB。音声は必ず画像か動画に添え、単独では不可)、そして話者を画像リファレンスとして。その後、ターゲット言語でセリフを一字一句書きます。
誰の声をクローンできますか?
使用する権利を持つ声だけです。自分の声、同意を得たスポークスパーソンの声、ライセンスされた声。許可なく実在の人物の声をクローンすることは、法的にも倫理的にも論外です。
どうやって試せますか?
MiniMax H3 は Pixo の Playground で稼働中です。ポートレートと声のサンプルをアップロードし、セリフを書いて、4〜15秒のショットを 768p または 2K で生成します。新規ユーザーには登録時に200無料クレジット、プランは現在最大55%オフです。
MiniMax H3 は Pixo の Playground で稼働中です。ポートレートと声のサンプルをアップロードし、ローカライズされた4〜15秒のショットを 768p または 2K で生成しましょう。今すぐ登録 — 新規ユーザーには登録時に200無料クレジット、プランは現在最大55%オフです。この背後にある音声の基礎は H3 のネイティブ音声を解説をどうぞ。


