MiniMax H3 正式リリース:2K出力とネイティブステレオ対応の汎用マルチモーダル動画モデル
MiniMaxは、テキスト、画像、動画、音声を統一された生成フレームワークで理解できる汎用マルチモーダル動画生成モデル「MiniMax H3」を正式にリリースしました。

MiniMax H3 発表:2K出力とネイティブステレオオーディオに対応した汎用マルチモーダル動画モデル
はじめに
MiniMax は、テキスト・画像・動画・音声を同一の生成ワークフロー内で理解できる汎用マルチモーダル動画生成モデル MiniMax H3 を正式に発表しました。
今回の発表は、テキストから動画への生成、画像から動画への生成、参照動画の生成、音声同期、編集を、それぞれ独立したタスクとして扱う時代の終わりを意味します。その代わりに、H3 は複数タイプのコンテキストを同時に受け取り、自然言語の指示を用いて、これらの参照コンテンツが互いにどのように相互作用すべきかを記述できるよう設計されています。
MiniMax によると、H3 はネイティブなステレオ音声付き動画出力に対応し、最長15秒のクリップを生成でき、現在の API を通じて2K解像度の出力を提供します。
同社はこのモデルを、広告、ブランドプロモーション、Eコマース、プロダクトデザイン、UI/UX、ゲームなどの商業コンテンツ制作分野に位置づけています。

今回の発表では、生成コストも強調されています。MiniMax は、H3 がマルチモーダル参照と高解像度出力の機能を維持しながら、1秒あたりの生成コストが多くの主流動画生成システムよりも低いと述べています。
H3:専門特化型動画タスクから統合マルチモーダル生成へ
初期の動画モデルは、独立したワークフローごとに編成される傾向がありました。
クリエイターは、テキストから動画を生成するために特定のモデルやインターフェースを選び、画像アニメーションには別のものを使用し、参照動画の編集や音声同期にはさらに異なるプロセスを採用することがありました。
H3 はこれらのユースケースを、共有されたマルチモーダルコンテキストに統合しようと試みています。
MiniMax の現在の API ドキュメントには、3つの主要な生成モードが記載されています:
| 生成モード | 入力 | 典型的な用途 |
|---|---|---|
| テキストから動画 | テキストプロンプト | テキストの説明に基づいて新規動画を生成 |
| 先頭/末尾フレーム画像から動画 | プロンプト+先頭フレームおよび/または末尾フレーム | 画像を動かす、または動画クリップの開始と終了を制御 |
| 参照生成 | プロンプト+画像、動画、および/または音声 | 被写体、動作、カメラスタイル、音声、または編集リズムを保持 |
したがって、このモデルは単に一文を動画に変換するだけに留まりません。
参照メディアを生成コンテキストの一部として使用することもできます。
参照生成の場合、MiniMax の API は以下の組み合わせをサポートしています:
- 最大9枚の参照画像
- 最大3本の参照動画
- 最大3つの参照音声
- 合計最大12個のメディアファイル
参照動画は合計で最大15秒まで指定可能で、音声には少なくとも1つの画像または動画の参照が添付されている必要があります。
この構造により、クリエイターは各モダリティを独立した段階として手動処理することなく、異なる入力間の関係を記述できます。
自然言語が各モダリティをつなぐ架け橋に
AIBase の情報源は、H3 の核心理念の1つを コンテキスト型オムニ表現(Contextual Omni Representation) と表現しています。
そのコンセプトは、自然言語を各
メディアタイプを接続するための橋渡しとして使用することです。
ユーザーは複数の参照資料を同時に提供し、日常言語でそれらの間に期待される関係性を記述できます。
例えば、あるワークフローでは概念的には H3 に次のことを要求するかもしれません:
- 特定の参照動画のカメラワークを踏襲する
- 特定の参照画像に登場する人物を保持する
- 特定の音声参照のリズムやサウンドに従う
- これらすべての制約を、新規に生成するシーンに同時に適用する
これは、単純なテキストから動画へのプロンプトとは本質的に異なります。
モデルは、各メディア入力に何が含まれているかを理解するだけでなく、各入力が最終生成においてどのような役割を果たすべきかを理解する必要があります。
MiniMax の公開 API は、以下のようなロールベースのマルチモーダル入力によってこの設計を具体化しています:
first_frame(先頭フレーム)last_frame(末尾フレーム)reference_image(参照画像)reference_video(参照動画)reference_audio(参照音声)
ユーザーは依然としてテキストプロンプトを提供する必要がありますが、この時点でプロンプトは複数のメディアソースの上に重なる指示レイヤーとして機能できます。
H3はネイティブステレオ音声と最長15秒の2K出力をサポート
MiniMax によると、H3 は後続の独立した音声生成プロセスを追加で使用することなく、ネイティブなステレオ音声付き動画を直接生成できます。
現在の開発者ドキュメントに記載されている情報は以下の通りです:
- モデル名:
MiniMax-H3 - 出力解像度: 2K
- 出力時間: 最長15秒
- 一般的なアスペクト比: 対応
- アダプティブアスペクト比: 適切な参照ワークフローに対応
API リファレンスは現在、4〜15秒の整数値の長さを受け付けていますが、より高度な開発者ガイドでは、通常の出力範囲は5〜15秒と説明されています。
このドキュメント上の微妙な差異は、API ベースで開発する際に注意に値します。開発者は、自身のアカウントと SDK に対応する現在のエンドポイントパターンに従う必要があります。
テキストのみの生成の場合、アスペクト比を明示的に指定する必要があります。
現在の API リファレンスでサポートされているアスペクト比は以下の通りです:
- 21:9
- 16:9
- 4:3
- 1:1
- 3:4
- 9:16
参照ワークフローではアダプティブサイズも使用できます。
初期テストは商業コンテンツ制作に焦点
MiniMax は、初期テストにおいて複数の実用的なアプリケーション領域で堅調なパフォーマンスを示したと述べています。
これらの領域には以下が含まれます:
- 指示への追従
- ブランドおよびテキスト表現
- 動画から動画へのモーション転送
- マルチモーダル生成
- 制御された編集
- 商業クリエイティブ制作
同社は特に以下のアプリケーションシナリオを強調しています:
- 広告
- ブランド構築
- Eコマース
- プロダクトデザイン
- UI/UX(ユーザーインターフェース/ユーザーエクスペリエンス)
- ゲーム
これらのパフォーマンスの説明は、MiniMax 自身および関連する発表記事からのものであり、独立した公開ベンチマークテストからのものではありません。
この区別は重要です。
動画生成の品質は、単一のスコアで単純に要約することは困難です。あるモデルがモーション転送に優れていても、微細な顔のディテール、タイポグラフィ、長期的なアイデンティティの一貫性、または複雑な複数オブジェクトの相互作用では比較的弱い可能性があります。
したがって、H3 が本番環境に適しているかを評価する最も信頼できる方法は、チームが実際に制作する必要のあるコンテンツでテストすることです。
H3は新しいマルチモーダル技術アーキテクチャを採用
AIBase の報道と MiniMax の発表資料は、H3 の背後にある複数の技術を説明しています:
- コンテキスト型オムニ表現(Contextual Omni Representation)
- H3-VAE
- H3-Omni Transformer(オムニトランスフォーマー)
- コンテキスト内再生成(In-Context Regeneration)
公開されている API ドキュメントは現在、技術的な詳細の完全な公開よりも、H3 の使用方法に重点を置いています。
これらのコンポーネントに関する研究論文はまだ公開されておらず、追加の再現可能な詳細を提供する技術レポートがない限り、詳細なアーキテクチャの説明は MiniMax の製品説明として見なすべきです。
コンテキスト型オムニ表現
このコンポーネントは、テキスト、画像、動画、音声を共有コンテキスト内で共同表現することを目的としています。
その役割は、H3 が複数の参照ソースと自然言語指示との間の関連性を理解するのを支援することです。
H3-VAE
H3-VAE は、モデルの動画表現および生成スタックの一部として説明されています。
動画 VAE は通常、高次元の動画情報を、生成とデコードにより管理しやすい潜在表現に圧縮します。
本稿執筆時に調査したドキュメントでは、MiniMax は H3-VAE の正確な設計を独立して説明するのに十分な公開技術詳細をまだ公開していません。
H3-Omni Transformer
H3-Omni Transformer は、統一マルチモーダル生成を担当するモデルコンポーネントとして位置づけられています。
その名称は、モデルのより広範な目標を反映しています:複数の独立した専門モデル間を切り替えるのではなく、1つのシステムが複数のメディアタイプの推論を処理できることです。
コンテキスト内再生成
MiniMax はまた、コンテキスト内再生成 を H3 の技術スタックの一部として挙げています。
その想定される役割は、マルチモーダルコンテキスト内の既存情報を活用して生成品質を向上させることです。
他のアーキテクチャ名と同様に、詳細なトレーニング手順やアブレーション実験の結果は、公開時点のAPIドキュメントには記載されていませんでした。
H3の価格設定は動画時間に基づく
AIBaseの記事では、H3のコストパフォーマンスが強調されていました。
MiniMaxが現在公式に発表している従量課金制の価格は、より明確な数値的参考値を示しています。
| 解像度 | 公式APIの表示価格 |
|---|---|
| 2K | 1秒あたり生成ごとに $0.13 |
| 768P | 1秒あたり生成ごとに $0.09 |
入力参考素材には、別途の課金ルールがあります。
MiniMaxは現在、以下のように明記しています。
- 音声参考:無料
- 最初の5枚の画像参考:無料
- 追加の画像参考:1枚あたり $0.04
- 動画参考:入力動画の長さとターゲット出力解像度に基づいて課金
MiniMaxは、1秒あたりのコストで比較すると、H3は2K解像度において主流の競合モデルの3分の1以下、768P解像度において主流の720P代替案の価格の半分以下になると述べています。
これらの相対比較はベンダーの主張であり、結果は含まれる競合モデル、プラン、解像度、課金方法に大きく依存します。
予算計画を立てる際、開発者はまず公開されているH3のAPI料金をもとに、自身が実際に使用する代替案との正確な比較を行うべきです。
AI動画にとって秒あたりのコストが重要な理由
動画生成のコストは出力時間に比例して増加するため、費用は急速に高額になる可能性があります。
これにより、反復的な試行錯誤の経済性が変わります。
クリエイターが完璧な映像を一度で生成できることはほとんどありません。
完全な制作パイプラインには、次のようなものが含まれる可能性があります。
- 複数回のプロンプト実験
- 複数回のキャラクター一貫性の試行
- カメラワークの変化
- 異なるアスペクト比
- ブランドや製品の修正
- 最終的な高解像度生成
たとえ1秒あたりの生成コストの削減がわずかであっても、チームが数十から数百の代替バージョンを作成する場合、累積的な節約はかなりのものになります。
この点は、以下のシナリオで特に重要です。
広告やEC分野では、1つのマーケティングキャンペーンに次のようなものが必要になる場合があります。
- 複数の製品
- 複数の市場
- 異なる言語
- 横向きと縦向きのフォーマット
- 複数のクリエイティブバリエーション
したがって、H3の価格設定は、単一の最終動画のコストだけでなく、反復的な制作の経済性も考慮しています。
参照生成はH3の最も重要な機能の一つ
現在、MiniMax APIは、画像、動画、音声を組み合わせた参照生成をサポートしています。
これにより、以下のようなワークフローが可能になります。
- 画像から製品やキャラクターの一貫性を維持する
- 参照動画の動きに従う
- 別の動画クリップのカメラワークを借用する
- 参照音声トラックを使用して時間制御やナレーションを行う
- 単一のリクエストで複数形式の参照素材を組み合わせる
MiniMaxは、H3が生成出力全体を通じて参照対象や素材の特徴を保持できると述べています。
これは商業的な作業にとって特に重要です。
一般的なテキストプロンプトでは、視覚的に魅力的な動画クリップを生成できますが、次のようなものを変更してしまう可能性があります。
- ロゴ
- 製品の比率
- 衣装
- キャラクターのアイデンティティ
- パッケージ
- ブランドカラー
参照駆動型のワークフローは、これらの変数に対してより多くの制御を提供します。
しかし、完全なアイデンティティ保持を保証するものではないため、チームは各生成素材を公開する前にレビューを行う必要があります。
先頭フレームと末尾フレームの制御が別の制作ワークフローを追加
H3は、先頭フレーム、末尾フレーム、またはその両方を使用した生成もサポートしています。
クリエイターがショットの開始方法や終了方法をすでに把握している場合に役立ちます。
典型的な用途には以下が含まれます。
- 製品の静止画像を動かす
- 2つの画像間のトランジションを作成する
- あるショットの先頭を別のショットの末尾に一致させる
- 変形の最終状態を制御する
- より予測可能な編集シーケンスを構築する
MiniMaxのAPIは、先頭フレーム/末尾フレーム生成と参照生成を2つの独立したモードとして扱います。
1つのリクエストで、同じタスク内にfirst_frameやlast_frameのロールと、reference_image、reference_video、reference_audioのロールを混在させることはできません。
この制限は、APIを統合する開発者にとって非常に重要です。
MiniMaxはH3モデルの重みを公開する計画
この発表の中で最も注目すべき点の一つは、MiniMaxがH3モデルの重みを公開する計画です。
同社は、重みは数日以内に公開される予定であり、適用法規に従うと述べています。
MiniMaxは、重みの公開が以下のことに役立つと考えています。
- オープンモデルエコシステムの拡大
- カスタマイズ版のサポート
- 異なるハードウェアへの適応の加速
- 単一のホスティングサービスへの依存の低減
- 研究とデプロイメントの実験の促進
同社はまた、H3は設計当初からハードウェア互換性を考慮しており、より広範なAIハードウェアとの互換性も含まれていると述べています。
本稿の執筆時点では、MiniMaxの公式GitHubおよびHugging Face組織ページは公開アクセス可能ですが、ここで確認した公式H3 APIドキュメントには、確認済みの公開H3重みリポジトリへのリンクはまだ含まれていません。
つまり、開発者は非公式のミラーから重みをダウンロードするのではなく、MiniMaxの公式リリースリンクを待つべきです。
「初のオープンウェイト中国製ビデオモデル」という主張の訂正
AIBase
この記事は、H3のリリース計画が中国のビデオ生成基盤モデルとしては初めてコミュニティにその重みを公開するものであると述べています。
広い意味で、この主張は歴史的に正確ではありません。
Alibabaは2025年2月にそのWan2.1ビデオ生成モデルの重みと推論コードをリリースし、その後続のWan2.1バリアントも公開されています。
H3のより説得力のある差別化ポイントは、汎用統一マルチモーダルビデオアーキテクチャ、すなわちテキスト、画像、動画、音声の参照、そしてネイティブな音声・映像出力を含む点であり、「初のオープンウェイト中国製ビデオモデル」という点ではありません。
オープンウェイトはハードウェア適応に役立つ
組織がインフラをより強く制御したい市場では、オープンモデルの重みが重要です。
ホスト型APIは使い始めるのが簡単ですが、オープンウェイトにより以下が可能になります。
- プライベートインフラでのデプロイ
- ローカルハードウェア向けのカーネル最適化
- モデルの量子化
- 専用推論ランタイムの構築
- ライセンスが許す範囲での微調整やコンポーネントの適応
- 国産アクセラレータとの統合
- 機密データを制御された環境に保持
H3が実際にセルフホスティング可能かどうかは、元の記事にはまだ公開されていない情報に依存します。これには以下が含まれます。
- パラメータ数
- VRAM要件
- 推論精度
- 並列化要件
- 最小ハードウェア構成
- ライセンス条項
- トレーニングまたは微調整のサポート
公式の重みと技術文書が公開されるまで、コンシューマー向けGPU互換性やセルフホスティングのコストに関する主張は単なる推測です。
MiniMaxはH3にまだ改善の余地があることを認めている
MiniMaxはまた、このモデルがHシリーズの最終的な到達点ではないと述べています。
同社は以下の方向性を指摘しています。
- 精細な画像ディテール
- モデル全体の規模
- さらなる能力の拡張
MiniMaxはHシリーズのモデルを拡張し続け、最終的にはHとMのモデルファミリーの能力を統合する計画です。
Hファミリーは現在、特にビデオにおけるマルチモーダル生成に焦点を当てています。
Mファミリーは、MiniMaxの言語モデルとエージェントモデルを含みます。
将来の融合は、単一のモデルファミリーが以下を処理できるシステムを指し示す可能性があります。
- 言語推論
- エージェント実行
- 画像理解
- 動画理解
- 音声
- 動画制作
- 編集
これはまだ将来の方向性であり、現在リリースされている統合製品ではありません。
H3がビデオ生成ワークフローにもたらす変化
H3の最も重要な貢献は、単により高い解像度だけではありません。
より大きな変革は、これまで互いに独立していた複数の創作操作が、現在では単一のコンテキストで実行できるようになったことです。
クリエイターは以下から移行できます。
この文に基づいて動画を生成してください。
以下へと進むことができます。
この人物を使用し、この動画の動作に従い、この視覚的アイデンティティを維持し、
この音声からリズムのヒントを得て、このプロンプトに基づいて新しいシーンを作成してください。
これにより、ビデオモデルの役割が変わります。
これは、単一目的のジェネレーターというよりも、マルチモーダルなクリエイティブエンジンのように機能します。
商業チームにとって、その価値は、H3が参照の一貫性を維持し、複雑な指示に従い、ブランド情報をレンダリングし、コスト効率を保つことができる度合いに依存します。
世代を超えて受け継がれています。
よくある質問
MiniMax H3とは何ですか?
MiniMax H3は、MiniMaxが開発した汎用マルチモーダル動画生成モデルです。テキスト、画像、動画、音声をコンテキストとして受け入れ、テキストから動画、画像から動画、参照素材に基づく生成、および制御された動画作成をサポートしています。
MiniMax H3はどの解像度をサポートしていますか?
MiniMaxの現在のAPIドキュメントでは、2KがH3の主要な出力解像度として挙げられています。価格ページには768Pの課金段階も記載されています。
MiniMax H3の動画は最大どのくらいの長さですか?
公式H3ドキュメントでは、最大15秒の動画出力をサポートしています。APIリファレンスは現在、4秒から15秒の間の整数値の長さを受け付けています。
MiniMax H3は音声を生成できますか?
はい、生成できます。MiniMaxはH3を「ネイティブなステレオ音声と動画の出力をサポートする」と説明しており、音声は動画制作ワークフローの一部として生成できるため、必ずしも別途のポストプロダクションモデルに依存する必要はありません。
MiniMax H3 APIの料金はいくらですか?
MiniMaxは現在、H3を2K解像度で1秒あたり0.13ドル、768P解像度で1秒あたり0.09ドルと価格設定しています。公開されている課金ルールによると、参照動画や追加画像には入力メディア料金が発生する場合があります。
H3は参照画像、動画、音声を同時に使用できますか?
はい、使用できます。公式APIは同じ参照生成ワークフロー内で参照画像、動画、音声をサポートしていますが、ファイル数、長さ、サイズ、入力の組み合わせに関する制限が適用されます。
MiniMax H3はオープンソースですか?
MiniMaxは、適用される規制を遵守した上で、数日以内にH3モデルの重みを公開する計画を発表しています。本稿の執筆時点では、公式APIはすでに利用可能ですが、今回確認した公式ドキュメントでは、公開されたH3の重みリポジトリへのリンクは確認されていません。
H3は最初の中国製オープンソース重み動画モデルですか?
いいえ、広い歴史的な意味ではそうではありません。Alibabaは2025年にWan2.1動画生成モデルの重みを公開しました。H3がより注目に値するのは、汎用動画モデルにマルチモーダル参照とネイティブな音声・動画生成機能を組み合わせた点にあります。
関連ツール
- MiniMax H3 API:H3のテキストから動画、画像から動画、参照生成ワークフローに関する公式ドキュメント。
- MiniMax オープンプラットフォーム:MiniMax開発者プラットフォーム。APIキー、モデルアクセス、課金、開発者リソースを提供。
- MiniMax GitHub:公開コードおよびモデル関連プロジェクトのための同社公式GitHub組織。
- MiniMax Hugging Face:公開モデルリソースのためのMiniMax公式Hugging Face組織。
- Wan2.1:Alibabaのオープンソース動画生成モデルシリーズ。オープンソース重み動画モデルの歴史的背景として参照可能。
関連リンク
- MiniMax 公式サイト:MiniMax公式サイト。現在H3を新しい動画生成モデルとして掲載。
- MiniMax H3 動画生成ガイド:公式モデル仕様、サポートされるモード、入力制限、ワークフローに関するドキュメント。
- MiniMax H3 API リファレンス:H3動画生成タスクを作成するための公式V2エンドポイント仕様。
- MiniMax API 価格:H3とその参照メディアの課金ルールに関する現在の公式従量課金価格。
- MiniMax 公式GitHub:公開コードとモデルリソースを追跡するための公式組織。
- Alibaba:Wan 2.1 オープンソース動画モデル:H3より前に中国製オープンソース重み動画モデルが存在したことの公式な歴史的確認。
- Wan 2.1 GitHubリポジトリ:Alibabaの初期のオープンソース動画生成ファミリーの公開推論コードと重み。
まとめ
MiniMax H3は、テキスト、画像、動画、音声を単一の汎用動画生成ワークフローに統合します。最大15秒の2K出力、ネイティブなステレオ音声、最初のフレーム/最後のフレーム制御、および複数のメディアタイプを使用した参照生成をサポートしています。
その商業的な売りは、制御能力とコストの2点に集中しています。MiniMaxによると、H3は指示追従、ブランド表現、動作転移に優れており、公式APIは現在、2K生成を1秒あたり0.13ドル、768Pを1秒あたり0.09ドルで提供しています。
MiniMaxはモデル重みの公開も計画していますが、公開時に確認した公式ドキュメントでは、確認済みのH3重みリポジトリへのリンクはまだありません。
H3の最も重要な転換点は、単なる2K動画ではなく、テキスト、画像、動画、音声がどのように連携すべきかを理解する、統一されたマルチモーダル生成システムへの移行です。