MiniMax H3はマルチモーダルプロンプトをネイティブオーディオ付きの2K公開可能な動画に変換します

動画生成モデルは急速に発展しているが、そのほとんどは依然としてショットジェネレーターのように機能する。クリップを生成し、その後クリエイターが字幕、タイポグラフィ、トランジションを自分で処理することになる。

发布于 2026年8月3日generalGEO 评分: 08 次阅读
MiniMax H3はマルチモーダルプロンプトをネイティブオーディオ付きの2K公開可能な動画に変換します

MiniMax H3は、マルチモーダルプロンプトを公開可能な2K動画に変換する

はじめに

動画生成モデルは急速に発展しているが、その多くは依然として素材生成器の域を出ていない。短いクリップを生成し、その後クリエイターは別の編集アプリで字幕、レイアウト、トランジション、カラコレ、音楽、リズム、視覚効果を自分で処理しなければならない。

MiniMax H3は、まさにこのワークフローを変えるために設計された。

H3は2026年7月31日にリリースされた、テキスト・画像・動画・音声入力を同一コンテキストで受け付ける汎用マルチモーダル動画モデルである。4秒から15秒の同期ステレオ音声付き動画を生成でき、出力解像度は768pまたは最大2Kに対応する。

MiniMaxによると、このモデルは生の素材を生成するだけでなく、コンテンツ制作プロセス全体に参加することを目的としている。ターゲットとなるユースケースには、広告、ブランドプロモーション、Eコマース、プロダクトデザイン、UI/UX、ゲーム、モーションポスター、オープニングシーケンス、ソーシャルメディアコンテンツが含まれる。

MiniMaxはH3をオープンウェイトの汎用型マルチモーダル動画モデルとして位置づけている。

元のレポートでは、この変化を「動画生成におけるプログラミングの瞬間」と表現している。この比喩は文字通りの意味ではないが、その考え方には価値がある。クリエイターは、求める結果を記述し、参考資料を提供し、出力を確認し、自然言語の指示によって反復できるようになってきている。すべてのレイヤーを手動で構築する必要はない。

オープンウェイトのステータス: MiniMaxは当初、ウェイトを数日以内に公開すると述べていた。公式のH3-Baseチェックポイントは現在Hugging Faceで入手可能で、MiniMax H3コミュニティライセンスに準拠している。ただし、H3-Context-IR、H3-Regenerate-2K、スパースアテンション実装は、初期のウェイトリリースにはすべて含まれていない。

MiniMax H3はエンドツーエンドの動画制作モデルとして登場

最初に公開された印象的なサンプルは、単純な映画的なショットではない。それらには、モーショングラフィックのタイポグラフィ、ハンドドローイングエフェクト、プロダクトグラフィックス、アニメーションのオープニングシーケンス、音楽、会話、トランジションが含まれている。

これらは通常、独立したポストプロダクションタスクと見なされる。

従来のワークフローは次のようになるかもしれない:

  1. 生の素材を生成または撮影する。
  2. クリップを編集ソフトに取り込む。
  3. 使えるカットを選別する。
  4. カットとトランジションを追加する。
  5. タイトルと字幕をデザインする。
  6. 音楽と効果音を追加する。
  7. リズムと色彩を調整する。
  8. 最終版を書き出す。

H3は、これらの意思決定の多くをひとつのモデルに統合することを試みている。

ひとつのプロンプトで、視覚スタイル、カット順、リズム、画面内テキスト、演技指示、サウンドスケープ、トランジション効果を記述できる。参照ファイルは、キャラクター、製品、アクション、カメラスタイル、サウンド、楽曲、または編集リズムを提供できる。

画像はMiniMax H3の初期テスト結果を示している。左側はTSUBAKIのツイートで、MiniMax H3を使用して制作された動画クリップ(人物像、動的テキスト、背景パターンなどが含まれ、再生時間1分11秒、視聴回数3.1万回)を提示。右側はpadiphoneのツイートで、白いラジオを紹介し、再生時間1分21秒、視聴回数15.5千回。これらの動画は、MiniMax H3がマルチモーダルプロンプトを2Kの完成品動画に変換する能力を示しており、文脈で紹介されたH3がより完成品に近い短編コンテンツを生成できることと呼応している。

初期テスターはH3を使用してスタイライズされたキャラクタービデオや洗練された製品を作成した

これはプロの編集ソフトウェアが時代遅れになったことを意味するわけではない。長めのプロジェクトでは、正確なタイムライン制御、アセット管理、修正、法務レビュー、複数フォーマットでの納品が依然として必要である。

重要な変化は、モデルが1回の生成で、より完成品に近いショート動画コンテンツを生み出せるようになった点にある。

プロモーションビデオとマルチショットプロンプトでH3をテストする

原著者は、MiniMaxのHailuoインターフェースを通じてH3をテストした。

最初の実験は、AI業界の著名人を主演にした架空のボーイズグループのメイキング風ビデオだった。テキストプロンプトは意図したトーンと編集スタイルを記述し、H3が映像シーケンスを生成した。

次に、アップル風のプレゼンテーション美学を持つリリースビデオをテストした。短いスタイルタグを追加するだけで、半透明のガラス効果、グラデーション、モーショングラフィックス、プレゼン風のリズムが生成結果に含まれていた。

より挑戦的なテストでは、6ショットの予告編を記述する長いプロンプトを使用した。各ショットにはそれぞれ独自の感情的方向性、演技指示、リズムがあった。

レポートによると、H3はショット順序に厳密に従い、指示を単一の漠然としたクリップに圧縮するのではなく、シーンが明確に区別されたクイックモンタージュを生成した。

このようなタスクは、複数の能力を同時に試す:

  • マルチショットプランニング
  • キャラクターとシーンの一貫性
  • プロンプト追従度
  • 感情表現
  • カメラワーク
  • 編集リズム
  • トランジションデザイン
  • 音画同期

結果は依然として主観的なデモであり、制御されたベンチマークテストではない。ソーシャルメディアでの成功事例が、すべての長いプロンプトが一回で成功することを保証するわけではない。

それでも、短い視覚的記述だけを期待していた従来の動画システムと比較すると、このモデルは構造化されたクリエイティブな指示に対して明らかにより適している。

テキストレンダリングはH3の最も商業的価値のある機能のひとつ

テキストは、AI生成動画において歴史的に最も脆弱な要素のひとつである。

画像モデルは、1フレーム内で単語を正しくレンダリングするだけでよい。動画モデルは、カメラ、サーフェス、照明、周囲のシーンが動き続ける中で、膨大なフレームにわたって同じグリフを維持しなければならない。

どのフレームでも小さなエラーが発生すると、フリッカー、スペルミス、タイポグラフィの不安定さにつながる可能性がある。

オリジナルのテストでは、H3が以下の分野で実用レベルに達していることが示された:

  • アニメーションタイトル
  • プロモーション用タイポグラフィ
  • 歌詞動画
  • ブランド名
  • 製品ラベル
  • 字幕
  • モーショングラフィックテキスト
  • UIおよびウェブビジュアル

MiniMaxの公式発表資料でも、正確なテキストとブランドレンダリングを中核機能として挙げている。

このモデルは、毎回完璧なテキストを生成することを保証するわけではない。小さいフォントサイズ、長い文章、特殊なフォント、複雑なモーションは依然として失敗を引き起こす可能性がある。

H3のより価値のある点は、テキストとシーンの関係をモデリングできるように見えることだ。

ある例では、ダイヤモンドのネックレスに関連付けられたテキストが、単純なフラットなオーバーレイではなく、反射光と奥行き感を示していた。これは通常の字幕配置というよりは、ビジュアル合成に近い。

商業チームにとって、信頼性の高いタイポグラフィは、華やかな映画的カメラワークよりも価値があることが多い。広告、製品

リリース、ソーシャルメディアコンテンツなどは、読みやすい情報に依存している。

ネイティブオーディオ:音声・効果音・音楽をつなぐ

H3は音声と動画を共同生成する。

公式モデルカードには以下のように記載されている:

  • 32kHzステレオオーディオ
  • 11言語の会話を安定してサポート
  • 音声・音楽・効果音のネイティブモデリング
  • 独立したポストプロダクションの音声処理段階ではなく、視聴覚の共同生成

MiniMaxがリストアップしたサポート対象会話言語:

  • アラビア語
  • 中国語
  • 英語
  • フランス語
  • ドイツ語
  • イタリア語
  • 日本語
  • 韓国語
  • ポルトガル語
  • ロシア語
  • スペイン語

他の言語も使用できる可能性があるが、品質に差が出る可能性がある。

原文はまた、ユーザーがオーディオを参照として提供できることにも言及している。H3は、音声クリップ、音楽、その他のオーディオ素材を、画像および動画参照と組み合わせて使用できる。

現在のAPIでは、オーディオは唯一の参照入力として使用できず、画像または動画も同時に提供する必要がある。

この統合は重要である。生成された音声は、シーンのリズムや感情にマッチする必要があるからだ。動画に後付けで追加されたナレーションは、音は正しく聞こえても、口の動きやリズム、カット切り替えとずれる可能性がある。

H3のネイティブな視聴覚設計は、これらの要素を整列させることを目的としている。

価格設定:2K動画は毎秒0.13ドル

MiniMaxは、生成動画の長さに基づいてH3の価格を設定している。

現在のグローバル従量課金レートは以下の通り:

出力 価格
2K動画 毎秒0.13ドル
768p動画 毎秒0.08ドル
768pから2Kへの再生成 出力毎秒0.05ドル
H3-Context-IR入力 100万トークンあたり0.90ドル
H3-Context-IR出力 100万トークンあたり3.60ドル

現在のレートでは、10秒の直接生成にかかる費用はおおよそ以下の通り:

概算出力コスト |
|-|-|
| 768p | 0.80米ドル |
| 2K | 1.30米ドル |

参照入力を用いる場合の課金は、個別のルールに従います。

  • 音声参照は無料です。
  • 最初の5枚の画像参照は無料です。
  • 直接生成の場合、最初の5枚を超える画像は1枚につき0.04米ドルが課金されます。
  • 参照動画は、その長さと選択した出力解像度に応じて課金されます。

出典記事では、H3の初期の入力素材と出力価格が抜粋されています。

上記のスクリーンショットでは、768p生成の価格が毎秒0.09米ドルと記載されています。MiniMaxの現在のグローバル価格ページでは毎秒0.08米ドルと表示されているため、最新の公式ドキュメントを現時点での情報源とすべきです。

MiniMaxは、2K解像度ではH3のコストは主要な競合製品の3分の1未満であり、768p解像度では主要な720pモデルのコストの半分未満であると主張しています。

この比較は、MiniMaxが選定した競合製品と設定に基づいています。各動画の実際のコストは、リトライ回数、参照素材、クリップ長、再生成、および最初の出力がそのまま使用可能かどうかによって異なります。

Artificial Analysisの動画編集リーダーボードでH3が1位に

Artificial Analysisは現在、音声付き動画編集リーダーボードでMiniMax H3を1位に位置付けています。

本ドキュメント作成時点でのランキングは以下の通りです。

ランク モデル Elo API価格
1 MiniMax H3 1,129 7.80米ドル/分
2 Gemini Omni Flash 1,122 6.00米ドル/分
3 HappyHorse-1.0 1,096 27.04米ドル/分
4 Wan 2.7 1,080 16.90米ドル/分
5 Dreamina Seedance 2.0 720p 1,037 5.57米ドル/分

出典記事では、H3がArtificial Analysisの動画編集リーダーボードで1位とされています。

H3は、テキストから動画への生成テストや画像から動画への生成テストでも上位にランクインしています。

リーダーボードの結果は、新しいモデルや投票が追加されるにつれて変化します。これらは特定のプロンプトセットに対する集団の好みを測定したものであり、特定のモデルがあらゆる制作ワークフローに適していることを証明するものではありません。

この結果は依然として注目に値します。なぜなら、H3は高い編集スコアと公開済みの基本ウェイトを組み合わせている一方で、多くの主要な動画モデルは依然としてクローズドな状態を維持しているからです。

統一されたマルチモーダル入力システム

H3は、テキスト、画像、動画、音声を互いに関連のない入力モダリティとして扱いません。

これらを統一されたマルチモーダルコンテキストとして受け入れ、これらの素材と要求された出力の間の関係を理解しようとします。

例えば、プロンプトでH3に以下のことを要求できます。

  • 特定の動画内のカメラワークを使用する
  • 画像に写っている人物を保持する
  • 音声参照内のサウンドを使用する
  • 別のクリップのリズムに従う
  • 指定されたタイトルスタイルを適用する
  • これらすべての関係を含む新しいシーンを生成する

公式APIは現在、以下をサポートしています。

参照タイプ 制限
画像 最大9枚
動画クリップ 最大3つ
音声クリップ 最大3つ
混在ファイルの総数 最大12個

参照動画および音声クリップの長さは2秒から15秒の間である必要があり、各メディアタイプの最大合計時間は15秒です。

プロンプトは7,000文字に制限されています。

この画像はMiniMax H3の創作動画機能インターフェースを示しており、上部には「創作動画」「創作画像」「Conch Agent」の3つのオプションがあり、「創作動画」が選択状態です。インターフェース中央には「H3正式上線 让灵感跃然成片」の文字が表示され、下部には入力エリアが設定されており、プラス記号の参照ボタン、生成関連のパラメータオプション、「創作」ボタンが含まれ、動画生成のサンプルプロンプトも示されています。このインターフェースは、ドキュメントで紹介されているMiniMax H3がマルチモーダルプロンプトを2K動画に変換できるという内容に対応しており、この製品の動画創作操作エントリとインターフェースデザインを示しています。

Conchインターフェースは、プロンプト、マルチモーダル参照、解像度、長さ、アスペクト比を統合しています。

この設計により、参照素材は長大なプロンプトを書くよりも重要になっています。

テキストで必要な照明効果を説明することはできますが、参照画像を使えば同じ視覚効果をより直接的に伝えられます。テキストで動作を説明することはできますが、参照動画は正確なタイミングを示すことができます。

このモデルの価値は、これらの参照をどう再構成すべきかを解釈することにあり、単にそれらを複製することではありません。

最近の素材により重複アップロードが削減

出典記事は、小さくても実用的な製品機能を強調しています。アップロードした素材が「最近使用した素材」パネルに表示されることです。

画像はMiniMax H3の動画生成インターフェースを示しています。アップロードの進行状況が99%で、動画を生成中です。左側には「アップロード」と「アセットを選択」ボタンがあり、その下には「参照」エリアがあり、複数の人物画像が表示されており、そのうちの1枚は「参照(2/12)」とマークされています。右側は動画生成の説明で、シーン設定、サウンド説明、技術仕様のサフィックスなどが含まれています。この画像は文脈と密接に関連しており、MiniMax H3を使用した動画生成時のインターフェースと操作手順の一部を視覚的に示しています。

以前にアップロードした画像や参照素材は、「最近の素材」パネルから再利用できます。

これは実用的です。

同じキャラクター、製品、ロゴ、ブランドカラー、サウンド、ビジュアルスタイル、場所、またはモーション参照を繰り返し使用するワークフローにとって有益です。

毎回の生成時に同じファイルをアップロードして整理する手間が省けます。

H3がクリエイティブな意図をどう理解するか

MiniMaxはH3を、独立した専門モデルの集合ではなく、タスクの一般化を中心に構築されたシステムとして説明しています。

初期の生成システムでは、クリエイティブな作業はテキストから動画へ、画像から動画へ、開始・終了フレーム生成、キャラクター参照、スタイル参照、モーショントランスファー、音声参照、動画編集、効果音生成、音楽生成などの孤立したタスクに分割されることが一般的でした。

H3は、これらの関係を単一のマルチモーダルシステム内で自然言語を通じて表現できるようにトレーニングされています。

完全なオンラインH3ワークフローには、主に3つのモジュールが含まれます。

マルチモーダル入力
      ↓
H3-Context-IR
      ↓
H3-Base(768p)
      ↓
H3-Regenerate-2K
      ↓
最終動画(ステレオ音声付き)

H3-Context-IR

H3-Context-IRは、ホスト型の前処理およびオーケストレーションシステムです。

テキスト、画像、動画、音声の間の関係を分析し、H3-Baseが使用できる構造化された中間表現を生成します。

このシステムは、命令解析、クロスモーダル関連付け、時間分析、シーン分解、音声・動画関係モデリング、欠落した詳細のプロンプト補完、複雑な論理的推論を実行できます。

MiniMaxの技術ブログによると、一部のソース素材は、約4,000トークンの平均コンテキスト表現に蒸留される前に、約100,000トークンの推論計算を必要とします。

H3-Context-IRは、複数のホスト型モデルとサービスに依存するため、初期のオープンソースウェイトリリースには含まれていません。

MiniMaxはこの機能をAPIを通じて提供し、独自の前処理システムを構築したいチーム向けにプロンプトガイドを公開しています。

H3-Base

H3-Baseは768p解像度で動画とステレオオーディオを生成します。

異なる入力モダリティは対応するエンコーダーまたはVAEによってエンコードされ、統一されたマルチモーダルシーケンスにパッケージ化された後、H3-Omni Transformerに送られます。

公開されたモデルは、タスク専用の2つのチェックポイントを提供します:

チェックポイント 主なタスク
H3-Base-FL2VA テキストから動画、および最初と最後のフレームから動画への変換
H3-Base-Ref2VA 参照に基づく音声・動画生成

両チェックポイントともBF16精度を使用します。

H3-Regenerate-2K

H3の2Kワークフローは、従来の超解像度アップスケーリングツールではありません。

768pの結果と元のマルチモーダルコンテキストがH3にフィードバックされ、モデルがより高い解像度で出力を再生成できるようにします。

MiniMaxはこれをコンテキスト内再生成と呼んでいます。

従来の超解像度システムは、低解像度の動画から欠落したディテールを推測しようとします。H3は元のプロンプトと参照情報を再利用できるため、小さな文字、製品のディテール、シーン情報をより正確に復元するのに役立つ可能性があります。

H3-Regenerate-2Kは初期のオープンソースウェイトリリースには含まれていません。現在はMiniMaxのマネージドワークフローとAPIを通じて利用可能です。

H3の主要な技術コンポーネント

MiniMaxは、このシステムの背景にある4つの主要技術を特定しました。

コンテキスト全モダリティ表現

従来の動画プロンプトでは、テキストによる説明がターゲットクリップを記述します。

一方H3では、

キャプションは、各参照と出力の関係、参照間の相互関係、どのアクションがどの動画から来るべきか、どのサウンドがどのキャラクターに属するか、オーディオが複数のショット間でどのように変化するか、そしてどのコンテンツを保持または編集すべきかも説明する必要があります。

言語はこれらのマルチモーダル関係を結びつける架け橋です。

MiniMaxは、この表現を生成するための専用モデルと全モダリティ理解パイプラインを構築しました。

H3-VAE

H3は独立した視覚およびオーディオ潜在空間を使用します。

視覚VAEは、16倍の空間圧縮、4倍の時間圧縮、24個の潜在チャンネルを持つ時間因果動画オートエンコーダーであり、Transformerの前に追加のチャンク処理を行います。

MiniMaxによると、新しいVAEは以前のアプローチと比較して有効なシーケンス長で4倍の改善を提供し、トレーニングと推論のコストを削減するとともに、ネイティブ2K生成をサポートします。

オーディオVAEは、左右のステレオチャンネルを個別に処理してから再結合します。32 kHzオーディオをチャンネルあたり40 Hzの潜在トークンに圧縮します。

H3-Omni Transformer

H3-Omni Transformerは、高密度のシングルストリームTransformerです。

公式モデルカードには以下が記載されています:

  • 合計330億パラメータ
  • AdaLN関連ブランチに約130億パラメータ
  • 動画とオーディオ潜在変数の共同予測
  • 3次元マルチモーダル回転位置埋め込み
  • モダリティ専用モジュールのない統一されたアテンションメカニズムとフィードフォワード層

MiniMaxは、AdaLN変調出力は事前計算してキャッシュできるため、推論専用のデプロイメントではこれらのパラメータをロードする必要がないと述べています。

このモデルは、マルチモーダルシーケンス長の大きな変動をより適切に処理するために、トレーニング中に理解タスクと生成タスクを分離します。MiniMaxは、これによりエンドツーエンドのトレーニングスループットが約30%向上したと報告しています。

スパースアテンション

H3は、長いマルチモーダルシーケンスのコストを削減するために、トレーニング中にネイティブのスパースアテンションを使用します。

初期のオープンソースウェイトリリースは現在、推論にフルアテンションを使用しています。MiniMaxは、スパースアテンションの実装は将来のアップデートでリリースされると述べています。

この違いはローカルデプロイメントにとって重要です。現在利用可能な実装は、MiniMaxの内部で最適化されたサービススタックよりも多くの計算リソースを必要とする可能性があるためです。

オープンウェイト:実際のリリース内容

MiniMaxはHugging FaceでMiniMax H3コミュニティライセンス契約のもとでH3-Baseウェイトをリリースしました。

このリポジトリには、H3-Base-FL2VA、H3-Base-Ref2VA、プロセッサファイル、トークナイザファイル、テキストエンコーダー、Omni Transformerウェイト、視覚およびオーディオVAE、サンプルスクリプト、デプロイメント手順、再現可能な768pサンプルが含まれています。

チェックポイントは、Qwen3-VL-32Bの完全な事前学習ウェイトをH3エンコーダーとして使用し、その第50層の隠れ状態をH3-Omni Transformerに提供します。

モデルは次のコマンドでダウンロードできます:

hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3

MiniMaxは、SGLang、vLLM、Diffusers、ComfyUIをサポートまたは推奨される推論フレームワークとして挙げています。

そのSGLangのサンプルは4つのGPUを使用します:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

これは公式なサンプルであり、一般的な最低要件ではありません。実際のメモリとパフォーマンスは、チェックポイント、長さ、解像度、実装方法、ハードウェアによって異なります。

オンラインシステム全体はまだ完全にオープンになっていない

H3を単に「完全オープンソース」と呼ぶことは誤解を招く可能性があります。

リリースされたH3-Baseウェイトはかなりのものであり、ローカルでの768p生成をサポートしています。ただし:

  • H3-Context-IRは依然としてマネージドシステムです。
  • H3-Regenerate-2Kはまだリリースされていません。
  • スパースアテンション推論は最初のリリースには含まれていません。
  • このモデルはApache 2.0などの標準的な寛容なライセンスではなく、MiniMaxコミュニティライセンスを採用しています。

チームは商用デプロイメントを計画する前に、ライセンスとアーキテクチャの説明を注意深く確認する必要があります。

プライベートブランド資産にとって、このリリースは依然として有意義な選択肢を生み出します。企業はライセンス条項の範囲内で、すべてのソース資産を第三者生成インターフェースに送信することなく、ベースモデルを研究、微調整、デプロイできます。

APIを通じてMiniMax H3を使用する

公式APIは3つの主要な生成モードをサポートしています:

  1. テキストから動画
  2. 最初/最後のフレーム画像から動画
  3. マルチモーダル参照生成

生成ワークフローは非同期モードです:

  1. タスクを送信し、task_idを受け取ります。
  2. タスクのステータスをポーリングします。
  3. タスク成功後に動画URLを取得します。
  4. ダウンロードして結果を保存します。

開発者は公式のMiniMax CLIも使用できます:

npm install -g mmx-cli
mmx auth login
mmx video generate \
  --model MiniMax-H3 \
  --prompt "A polished product commercial with animated typography"

マルチモーダル参照ワークフローの場合:

mmx video generate \
  --model MiniMax-H3 \
  --prompt "Keep the same character and follow the reference motion" \
  --reference-image character.png \
  --reference-video motion.mp4

本番環境で使用する前に、CLIとAPIのドキュメントを確認してください。入力制限、課金、サポートされるパラメータは変更される可能性があります。

H3が動画制作にもたらす意味

H3はすべてのポストプロダクションタスクを排除するわけではありません。

プロフェッショナルなマーケティングプロジェクトでは、依然としてフレーム単位の正確な編集、クライアントレビュー、ライセンス済み音楽、法的・著作権チェック、正確なブランドコンプライアンス、長編の連続性、複数のアスペクト比での書き出し、実写パフォーマンスディレクション、カラーマネジメント納品が必要になる場合があります。

H3が変えるのはスタート地点です。

クリエイターは無音の素材を受け取る代わりに、編集、サウンド、タイポグラフィ、ナレーション、エフェクト、認識可能な視覚的方向性を含む短いアセットを取得できます。

これにより、このモデルは特に以下の用途に適しています:

  • ソーシャルメディア広告
  • 製品プロモーション動画
  • Eコマース動画
  • ミュージックビジュアル
  • モーションポスター
  • ブランドコンセプトテスト
  • 迅速なキャンペーンバリエーション
  • ゲームおよびUI

コンセプトビデオ

このモデルは、動画生成がますます特定のタスクに限定されなくなっていることも示しています。単一のシステムが、クリエイティブなアセットをますます解釈し、より完全なクリエイティブブリーフを実行できるようになりつつあります。

よくある質問

MiniMax H3とは何ですか?

MiniMax H3は、汎用マルチモーダル動画生成・編集システムです。テキスト、画像、動画、音声入力を処理し、同期したステレオサウンド付きの4〜15秒の動画を生成できます。

音声。

MiniMax H3は2K動画を生成できますか?

はい。ホスト型APIは2K出力をサポートしています。完全なパイプラインでは、まずH3-Baseで768pの結果を生成し、その後H3-Regenerate-2Kを使用して、元のコンテキストを保持したまま高解像度で動画を再生成します。

MiniMax H3はオープンソースですか?

MiniMaxは、コミュニティライセンスに基づいてH3-Baseの重みを公開しています。完全なオンラインシステムは完全にはオープンソース化されておらず、H3-Context-IR、H3-Regenerate-2K、スパースアテンション推論は初期リリースにはすべて含まれていません。

MiniMax H3はローカルで実行できますか?

はい、公開されたH3-Baseチェックポイントは、768p生成用にローカルにデプロイできます。MiniMaxはSGLangの例を提供し、vLLM、Diffusers、ComfyUIワークフローへのリンクも提供していますが、このモデルは大量のGPUリソースを必要とします。

MiniMax H3 APIの料金はいくらですか?

現在のグローバル価格は、2K解像度で1秒あたり0.13ドル、768p解像度で1秒あたり0.08ドルです。最初の5枚を超える参照画像、参照動画、再生成、およびH3-Context-IRには追加料金が発生する場合があります。

H3は動画とともに音声も生成しますか?

はい。H3は、セリフ、音楽、効果音を含む、ネイティブな32kHzステレオ音声とともに動画を共同生成します。

H3はいくつの参照ファイルを受け入れられますか?

APIは、最大9枚の画像、3本の動画、3つの音声クリップ、最大12個の混合ファイルをサポートしています。また、時間長とファイルサイズの制限もあります。

H3は商用動画制作に適していますか?

MiniMaxは、H3を広告、ブランドプロモーション、電子商取引、製品デザイン、UI/UX、その他の商用利用向けに設計しました。チームは引き続き出力コンテンツをレビューし、すべての入力素材の権利を検証し、コミュニティライセンスとプラットフォーム利用規約を確認する必要があります。

関連ツール

  • Hailuo AI:MiniMaxがH3を使用して動画を作成するグローバルWebアプリ。
  • Hugging FaceのMiniMax H3:公式のH3-Base重み、モデルカード、アーキテクチャ説明、ローカルデプロイ例。
  • MiniMax API:APIを介してH3動画を生成する公式グローバルプラットフォーム。
  • MiniMax CLI:動画、画像、音声、音楽、テキストを生成するための公式コマンドラインツール。
  • SGLang:MiniMax H3ローカルデプロイ例でサポートされている推論サービスフレームワーク。
  • ComfyUI:公式のH3動画生成チュートリアルを備えたノードベースのビジュアルワークフロー環境。
  • Artificial Analysis Video Arena:動画編集モデルを比較するためのブラインド評価投票リーダーボード。

関連リンク

料金:現在のH3生成、参照入力、再生成、Context-IRの価格。

まとめ

MiniMax H3は、AI動画を単なるクリップ生成から次のレベルへと押し上げ、単一のシステム内に視覚生成、編集ロジック、字幕レイアウト、セリフ、効果音、音楽、マルチモーダル参照を統合します。

ホスト型バージョンは、ネイティブなステレオ音声付きの4〜15秒の動画を生成でき、出力解像度は最大2Kです。現在、このバージョンはArtificial Analysis動画編集リーダーボードで首位に立っており、MiniMaxグローバルAPIを通じて、生成1秒あたり0.13ドルで2K出力を提供しています。

MiniMaxは現在、H3-Baseチェックポイントを公開しており、ローカルでの768p生成とその後の開発をサポートしています。ただし、Context-IR、2K再生成、スパースアテンション推論はまだ完全にはオープンソース化されていないため、完全なホスト型ワークフローは一部閉じたままです。

H3の中核的な変革は、単により高品質な映像を生成することではなく、クリップを生成することから、完全なショート動画制作ブリーフを理解して実行することへの進化です。