MiniMax H3 がMetaSoに登場:768p AI動画は毎秒わずか¥0.09、ローカル導入不要

MiniMax H3が発表されたばかりだが、その話題はモデルの品質から、より現実的な問題へと移りつつある。一般のクリエイターは、一体どのくらい低コストで、どのくらい手軽に実際に……

发布于 2026年8月7日generalGEO 评分: 08 次阅读
この画像は、8月7日のMiniMax H3関連コンテンツ用に作成されたSEOカバー画像で、深い黒紫の16:9の暗めの背景を使用し、視覚的にすっきりとしており、余分な混雑した要素はありません。画像の中心には「MiniMax H3 on MetaSo」という文字が強調表示され、その下に2つの主要なサービス価格、すなわち毎秒¥0.09の動画と2K生成が明確に記載され、APIとComfyUIへのアクセス権にも言及しています。背景には抽象的な紫色のオーディオ波形と青いAIのアイコンが配置され、下部には映画の再生ボタン、コードタグ、ネットワークノードスタイルのテクノロジーアイコンが配置されており、AI動画生成の製品特性に対応し、MiniMax H3がMetaSoに統合された後の核となる利点と付随する権限を直感的に伝えています。

MiniMax H3がMetaSoに登場:768pのAI動画は毎秒わずか¥0.09、ローカル導入不要

はじめに

MiniMax H3が発表されたばかりだが、このモデルに関する議論はすでにモデル品質から、より実用的な問題へと移行している。一般のクリエイターが実際に使うとき、どれだけ安く、どれだけ便利なのか?

このモデルは、テキスト・画像・動画・音声を統合した条件制御、ネイティブステレオ音声、動画編集、参照ベース生成、最大2K出力などの機能で注目を集めている。また、オープンウェイトモデルでもあり、開発者は自前でのデプロイを選択できる。

しかし、オープンソースだからといって、ローカル導入が簡単にできるわけではない。

大規模なマルチモーダル動画モデルを実行するには、モデルファイル、推論フレームワーク、GPUメモリ、依存関係、環境設定、生成レイテンシーなどの問題に対処する必要がある。MiniMax公式のオープンソースドキュメントでは、SGLang、vLLM、Diffusers、ComfyUIなどのフレームワークが推奨されており、SGLangでのデプロイ例では4基のGPUが使用されている。

アイデアを動画にしたいだけのクリエイターにとって、これは「動画制作」とはまったく別の話だ。

元記事では、サードパーティのパスに注目している。MetaSo(秘塔AI) は、ブラウザベースの動画生成製品にMiniMax H3を統合済みだ。元記事で示されているインターフェースでは、ユーザーはローカル環境を構築することなく、直接H3を使用できる。

最も注目すべきは、テスト時に表示されたプラットフォーム限定の価格だ:

  • 768p:毎秒生成 ¥0.09
  • 2K:毎秒生成 ¥0.15

これらは元記事でMetaSoが表示した価格であり、MiniMaxの一般的な公式API価格ではない。サードパーティの価格にはプロモーション、補助金、その後の調整が含まれる可能性があるため、本番運用前に必ず再確認すること。

この画像は、秘塔AI(MetaSo)プラットフォーム上でMiniMax H3を使用した動画生成インターフェースを示している。左側は機能操作エリアで、上部に「文/図生動画」「多参照」オプションがあり、MiniMax H3と表示され、「プロンプト」入力ボックスがあり、アップロード済み素材の参照に対応し、H3 Context IRを有効にするスイッチ、および「開始フレーム」「終了フレーム」の設定エリアがある。右側は動画生成プレビューエリアで、生成済みのサイバーパンクスタイルの動画が表示され、「完了」とマークされ、タイムスタンプと関連操作ボタンが付いている。このインターフェースは、ユーザーがローカル環境を設定せずに、このプラットフォームでMiniMax H3を直接便利に使用して動画生成ができることを示している。

複雑なデプロイから直接生成へ

MiniMax H3は優れた能力を持つオープンウェイトの動画モデルだが、「オープンソース」と「実行が容易」は同じではない。

MiniMax公式リポジトリは、H3を以下の要素で構成されるコンテキストを理解できる汎用全モーダル生成システムとして説明している:

  • テキスト
  • 画像
  • 動画
  • 音声

4〜15秒のクリップに対して、同期した動画とネイティブステレオ音声を生成できる。

現在のオープンソース版では、2つの主要なベースモデルバリアントが提供されている:

モデルバリアント 主な用途 入力
H3-Base-FL2VA テキストからの動画生成、および先頭・末尾フレーム生成 テキスト+0枚、1枚、または2枚の画像
H3-Base-Ref2VA マルチ参照音声・動画生成 テキスト+参照画像、動画、および/または音声

参照モデルは最大で以下に対応:

  • 9枚の画像
  • 3本の動画
  • 3つの音声
  • 合計12ファイル

MiniMaxはまた、H3-BaseをH3-Context-IRおよびH3-Regenerate-2Kと組み合わせた完全な2Kワークフローを文書化している。

H3は実力十分、リアルタイム動画編集ランキングで首位に

元記事では、MiniMax H3がArtificial Analysisプラットフォームで公開された直後に発表された動画編集ランキングについて言及している。

この記述は、2026年8月7日に確認された現在のスナップショットによって検証可能である。

Artificial Analysisは、MiniMax H3を現在の音声付き動画編集ランキングの第1位としてリストしており、このビューではGemini Omni Flashをリードしている。これらはユーザー選好に基づくリアルタイムランキングであり、より多くのサンプルが提出されるにつれて、正確な順位は変わる可能性がある。

これはArtificial Analysisの音声付き動画編集ランキングのスクリーンショットで、ページ上部にランキング名が表示され、現在のモデルのみ表示、音声の有無などのカテゴリフィルタオプションも設定されている。ランキングの1位はMiniMax-H3で、そのモデルラベルの横に「Open Weights」と明確に表示されており、このモデルのElo値は1130、サンプル数は5035、2026年7月に公開され、API価格は近日公開と表示されている。2位はGoogleのGemini Omni Flashで、Elo値は1121、API価格は毎分6ドルで、順位はすぐ後ろだが、そのElo値はMiniMax-H3に及ばない。このスクリーンショットは、ドキュメントで言及されているMiniMax H3が音声付き動画編集ランキングで首位になったという内容に対応し、関連する記述に対して検証可能なリアルタイムスナップショットの根拠を提供している。

これはH3の編集品質における競争力を示す有力な証拠だが、H3がすべての動画生成カテゴリーで恒久的に第1位であるというより広範な主張に拡大解釈すべきではない。

テキストからの動画生成、画像からの動画生成、参照生成、動画編集はそれぞれ独立したタスクであり、ランキングは選択されたフィルタ条件、日付、音声設定、ユーザー投票によって異なる。

デプロイの障壁は依然として現実的

元記事は、オープンモデルの議論で見落とされがちな点を提起している。多くのクリエイターは、クリエイティブなアイデアをテストするために推論エンジニアになりたくないのだ。

H3ワークフローのセルフホスティングには、以下のことが関わってくる可能性がある:

  1. 公式コードリポジトリの検索
  2. 対応するチェックポイントファイルのダウンロード
  3. サポートされている推論フレームワークのインストール
  4. GPUリソースの準備
  5. 依存関係の設定
  6. モデルサービスの起動
  7. クライアントまたはワークフローインターフェースへの接続
  8. メモリと互換性の問題のデバッグ

MiniMax公式コードリポジトリは、以下のようなSGLangの例を提供している:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

参照生成バリアントも、モデルバリアントとポートが異なるだけで、同じ4GPUの例を使用する。

これは、すべての可能なH3デプロイが正確に4つのGPUを必要とするという意味ではない。ハードウェア要件は、フレームワーク、精度、並列度、解像度、動画の長さ、最適化方法によって異なる。

しかし、公式の参照デプロイが一般的なコンシューマー向けノートPCを対象としていないことは確かだ。

オープンウェイトでも計算コストは消えない

モデルのウェイトは入手可能だが、推論には依然として大量の計算リソースが必要である。

ローカルハードウェアを使用するクリエイターは、以下を考慮する必要がある:

  • GPUの購入またはレンタル費用
  • ビデオメモリ(VRAM)
  • システムメモリ
  • ストレージ容量
  • モデルのダウンロードサイズ
  • 推論時間
  • 消費電力
  • ドライバの互換性
  • フレームワークのアップデート
  • 生成失敗への対応

ソースには、ユーザーがローカルでH3をダウンロードした後にメモリ不足エラーが発生したコミュニティの投稿が含まれている。

この逸話は普遍的なハードウェアベンチマークとして扱うべきではないが、より重要な点は正しい。モデルをダウンロードできることと、それをスムーズに実行できることは同じではない。

ローカル生成は遅い場合もある

ソースは、ローカルで約10秒の動画を生成する場合、特定のハードウェア構成では20分から40分かかると報じている。

これはMiniMax公式の遅延仕様ではなく、実際の所要時間はハードウェアとソフトウェアの構成によって大きく異なる。

それでも、クリエイティブな作業において、遅延は依然として極めて重要です。

動画生成は反復作業です。ユーザーは以下の問題を修正するために、何度も試行する必要があるかもしれません:

  • カメラワーク
  • キャラクターの動き
  • プロダクトの一貫性
  • テキストレンダリング
  • カット選択
  • テンポ調整
  • スタイル調整

毎回の試行に長い時間がかかるのであれば、たとえモデル自体を無料でダウンロードできたとしても、実験や探索の難易度は大幅に高まります。

MetaSo が H3 をブラウザツールに変える

ソース記事で重点的に紹介されているワークフローは、ローカル環境でのセットアップ手順の大部分を省いています。

MetaSo のホームページには、既存の検索・生産性ツールに加えて、新たに 動画生成 のエントリポイントが追加されています。

ソース記事のテストによると、基本的な流れは以下の通りです:

  1. MetaSo を開く。
  2. 動画生成エリアに入る。
  3. MiniMax H3 を選択する。
  4. 生成モードを選択する。
  5. プロンプトを入力し、必要に応じて参照素材を追加する。
  6. ブラウザ上で動画クリップを生成する。

最初の動画を作成する前に、H3 のコードベースをダウンロードしたり、CUDA 環境を設定したりする必要はありません。

対応している作成モード

記事で示されたインターフェースには、クリエイターが H3 に期待する主要なワークフローが含まれています:

  • テキストから動画生成
  • 画像から動画生成
  • 複数参照による生成

スクリーンショットには H3 Context IR オプションも表示されており、これは MiniMax の公式アーキテクチャと一致しています。

H3-Context-IR は、MiniMax がホストする前処理・オーケストレーションシステムで、自由形式のマルチモーダル命令を解釈します。テキスト、画像、音声、参照動画間の関係を分析し、そのコンテキストを H3-Base がより効果的に活用できる表現に変換します。

MiniMax は、オープンソースの重み付けでは完全な H3-Context-IR ホスティングシステムを提供していません。公式ワークフローを再現するための API を提供しています。

この違いは、ホスティングサービスが純粋なローカルオープンソースの重み付けインストールよりも、なぜ始めやすいのかを説明するのに役立ちます。

15 秒のウエスタン風テスト、約3分で完了

ソース記事の著者は MetaSo を通じて H3 をテストしました。短いウエスタン風の宝探しコンセプトを使用しました。

生成された動画クリップには以下が含まれます:

  • 砂漠の全景ショット
  • カウボーイのクローズアップショット
  • 乗馬アクションシーン
  • 複数のカット切り替え
  • 一貫したウエスタン風の雰囲気

著者は、生成ページを開いてから、完成した15秒の結果を受け取るまで、約3分かかったと報告しています。

これは単独のテスト結果であり、保証されたサービスレベルの遅延ではありません。

実際の生成時間は以下の要因によって異なる場合があります:

  • キューの負荷
  • 解像度
  • 動画の長さ
  • 生成モード
  • 参照数
  • プラットフォームのキャパシティ

実際の違いは、ユーザーが自分で推論インフラストラクチャを管理する必要がないことです。

多くのクリエイターにとって、これはモデルが技術的にオープンソースの重み付けであるかどうかよりも重要です。

MetaSo は ComfyUI 向けワークフローもサポート

ソース記事によると、上級ユーザーはこのサービスを ComfyUI ワークフローに接続できます。

これは、オールインワンのウェブジェネレーターと完全なセルフホストモデルの中間にある、有用な選択肢を提供します。

ComfyUI は、オープンソースのノードベース生成 AI ワークフローシステムです。MiniMax 公式の H3 コードベースも、推奨される H3 推論/ワークフローオプションの一つとして ComfyUI を挙げています。

また、H3 テンプレートへのリンクも用意されています。

ノードベースのワークフローにより、ユーザーは以下をより細かく制御できます:

  • 入力準備
  • プロンプト段階
  • 参照素材
  • 分岐処理
  • 後処理
  • 再利用可能な生成パイプライン

実際の運用上の役割分担は次のようになります:

ユーザータイプ 適したワークフロー
アイデアをテストするクリエイター ブラウザのプロンプトインターフェース
参照素材を使うクリエイター ブラウザの複数参照ワークフロー
上級ユーザー ComfyUI または API ワークフロー
インフラチーム ローカルまたはクラウドでのオープンソース重み付けデプロイ

これも、ホスト型アクセスとオープンソースの重み付けが、互いに排他的ではなく補完的である理由の一つです。

毎秒0.09元が反復のコストを変える

記事の後半は価格に焦点を当てています。

著者のテスト時、MetaSo は以下を表示していました:

解像度 ソース内でMetaSoが表示した価格
768p 0.09元/秒
2K 0.15元/秒

画像はMiniMax H3生成動画の出力価格情報を示しています。2K動画は秒単位で課金され、価格は0.15元/秒、17.0クレジット/秒が獲得できます。768P動画は現在公開されており、秒単位で課金され、価格は0.09元/秒、10.2クレジット/秒が獲得できます。この画像はコンテキストと密接に関連しており、コンテキストでは著者のテスト時にMetaSoが表示した768pと2K動画の価格がそれぞれ0.09元/秒と0.15元/秒であると言及されており、この図はこれらの価格を視覚的に示し、読者がMiniMax H3の動画生成価格をより明確に理解するのに役立ちます。

これらの料金は、1本あたりの動画コストを非常に小さなものにします。

768p の例

長さ 0.09元/秒での計算
5秒 0.45元
10秒 0.90元
15秒 1.35元

2K の例

長さ 0.15元/秒での計算
5秒 0.75元
10秒 1.50元
15秒 2.25元

これが、元記事が AI 動画を、人民元ベースで「数分」の時代に入りつつあると表現した理由です。

より正確には、これはある時点におけるサードパーティホスティングの価格設定であり、H3 エコシステム全体に一般化すべきではありません。

MiniMax 自身の API や他のプロバイダーは、異なる価格、通貨、解像度、課金ロジック、プロモーション割引を採用している可能性があります。

Artificial Analysis は現在、そのリーダーボード比較において、H3 のクリエイター向け API 価格をデフォルト設定で毎分1080p動画あたり約7.80米ドルとしています。これは MetaSo のスクリーンショットの価格設定基盤とは異なり、各プロバイダーの具体的な料金を明確に示すことの重要性を説明しています。

なぜ安価な生成が表面以上に重要なのか

AI 動画は通常、一回の試行で最終結果を生み出しません。

クリエイターは動画を生成し、問題を見つけ、プロンプトを修正し、再試行するかもしれません。

つまり、真のコストは次のようにはなりません:

1本の動画の価格

それよりも、次のように近くなります:

試行ごとのコスト × 許容できる結果を得るための試行回数

あるクリエイターが、10秒の768p動画を生成するために8回試行し、ようやく使えるバージョンを選んだとします。

ソース内のMetaSo表示価格に基づいて計算すると:

10秒 × 0.09元 × 8回試行 = 7.20元

毎回の試行コストが数十元になると、同じ基本的な制作プロセスははるかに困難になります。

低価格はユーザーの行動を変えることができます。

クリエイターは以下をテストする余裕が生まれます:

  • より多くのカメラ方向
  • より多くのキャラクターアクション
  • より多くのプロンプトバリエーション
  • 異なるアスペクト比
  • 同じ広告の複数バージョン
  • 代替のストーリー展開

その価値は、最終成果物の費用を節約するだけにとどまりません。

それは、試行に対する心理的なハードルを下げることでもあります。

安価な反復が特に動画にとって重要な理由

テキスト生成はコストが十分に低いため、ユーザーがドラフトをもう一版生成してほしいと依頼する前に躊躇することはほとんどありません。

動画は異なります。

毎回の生成ははるかに多くの計算リソースを消費し、結果には複数の次元で同時に問題が発生する可能性があります:

  • 画質
  • 時間的一貫性
  • モーション
  • カメラ挙動
  • オーディオ
  • セリフ
  • キャラクターのアイデンティティ
  • 文字
  • プロダクトの詳細
  • 編集テンポ

これにより、反復的なサンプリングが標準となります。

したがって、実用的な制作指標は次の通りです:

総費用
──────────────
採用可能な出力数

モデルが毎秒あたりの生成コストが低く、かつ採用可能な生成結果を十分に生み出し、採用されたクリップあたりのコストを低く保てるなら、それは価値があります。

クリエイターは価格とヒット率の両方を評価すべきです。

H3 の能力が低コストの反復をより魅力的にする

価格が重要なのは、H3 が簡素化されたテキスト生成動画モデルではないからです。

MiniMax公式リポジトリがH3のサポートを確認:

  • ネイティブステレオ
  • 4〜15秒の出力
  • 24 FPS
  • 複数のアスペクト比
  • 先頭フレーム生成
  • 末尾フレーム生成
  • 先頭・末尾フレーム生成
  • 参照画像
  • 参照動画
  • 参照音声
  • マルチ参照ワークフロー
  • 2K再生成

このアーキテクチャは、H3-Omni-Transformerを介してビデオとオーディオの潜在変数を共同で予測します。

つまり、1回の生成で視覚と音声の構造を同時に含めることができ、別途ナレーション録音の工程が不要になります。

オープンワークフローでは、2Kは独立した再生成段階です

公式H3リポジトリは、完全なシステムを次のように説明しています:

  1. H3-Context-IR
  2. H3-Base
  3. H3-Regenerate-2K

H3-Baseは768p出力を生成します。

その後、H3-Regenerate-2Kはベース結果を元のコンテキストと共に入力し、より高い解像度でクリップを再生成します。

これは単純なピクセル拡大とは異なります。

ホスティングAPIはこれらの段階をユーザーから隠すことができます。

APIアクセスにより、H3はウェブインターフェースを超えます

ソース記事には、MetaSoのH3 APIパネルも示されています。

画像はMetaSoのMiniMax H3 API呼び出し例を示しています。左側はリクエスト例で、curlコマンドを使用し、POSTリクエスト、URL、ヘッダー、Content-Typeなどの情報と、data内のmodel、type、text、resolution、durationなどのパラメータを含みます。右側はレスポンス結果で、208ステータスコードとtask_idを表示しています。この画像は文脈と密接に関連しており、前述のH3 APIパネルのリクエスト例を視覚的に示し、開発者がMetaSo APIを使用してビデオ生成などの操作を行う方法を理解するのに役立ちます。

スクリーンショットは、MetaSo独自のAPIホストとMiniMax-H3モデル名を使用したリクエスト例を提供しています。

示されている構造の簡略版は以下の通りです:

curl --request POST \
  --url https://metaso.cn/api/minimax/v2/video_generation \
  --header 'Authorization: Bearer <YOUR_API_KEY>' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "MiniMax-H3",
    "content": [
      {
        "type": "text",
        "text": "生成したい動画の説明を記述してください。"
      }
    ],
    "resolution": "2K",
    "duration": 5,
    "ratio": "16:9"
  }'

このコードは、ソーススクリーンショットに見えるリクエスト形式を反映しています。開発者は本番環境にデプロイする前に、MetaSoの最新ドキュメントまたは製品内のAPIパネルを使用してください。エンドポイント、フィールド、認証形式、および制限は変更される可能性があります。

このAPIは実用的です

反復的なワークフロー向け

チームが以下の機能を必要とする場合、プログラムによるアクセスはブラウザよりも有用です:

  • 複数のバリエーションを生成
  • コンテンツパイプラインに接続
  • 製品ビデオを自動化
  • 社内クリエイティブツールを構築
  • ComfyUIからタスクを送信
  • 出力を自動保存
  • レビューと承認ステップを追加

ホスティング推論により、アプリケーションは実際のモデルサービングスタックを管理せずにH3を呼び出すことができます。

ホスティングAPIとローカルオープンソースウェイトは異なるユーザーにサービスを提供します

H3エコシステムは現在、開発者に複数の作業方法を提供しています。

オプション1:ホスティングされたクリエイティブインターフェースを使用

最適なユーザー:

  • 個人クリエイター
  • マーケティングチーム
  • 迅速な実験
  • GPUを持たない人々

利点:

  • デプロイ不要
  • セットアップ時間が短い
  • シンプルなインターフェース
  • プロバイダーが計算リソースを管理

トレードオフ:

  • プロバイダー固有の価格設定
  • 待ち時間
  • 使用制限
  • プラットフォーム依存

オプション2:ホスティングAPIを使用

最適なユーザー:

  • 開発者
  • SaaS製品
  • 内部自動化
  • セルフホスト推論を望まないComfyUIユーザー

利点:

  • プログラムによる制御
  • GPU運用不要
  • スケールが容易

トレードオフ:

  • 使用料金
  • API依存
  • プロバイダー制限

オプション3:セルフホストのオープンソースウェイト

最適なユーザー:

  • 研究チーム
  • インフラストラクチャチーム
  • 自社GPU能力を持つ組織
  • カスタム推論ワーク

利点:

  • より強力なインフラ制御
  • オープンモデルアクセス
  • カスタムパイプライン
  • コンポーネントのオフライン/プライベート実行の可能性

トレードオフ:

  • ハードウェアコスト
  • デプロイの複雑さ
  • 運用保守
  • セットアップ時間の長期化

正しい選択は、イデオロギーよりもワークフローの経済性に依存します。

オープンモデルでも、ホスティングサービスを通じて最大限の利便性を実現できます。

クリエイター向けの実用的ワークフロー

ローカルデプロイなしでH3をテストしたいユーザーにとって、合理的なプロセスは以下の通りです:

ステップ1:768pから始める

プロンプトとシーンを探索する際は、低コストモードを使用します。

コンセプトが実現可能になるまで高解像度に投資しないでください。

ステップ2:複数のバリエーションを生成

一度に1つの変数だけを変更します:

  • カメラアングル
  • 被写体の動き
  • 照明
  • カメラのリズム
  • 参照強度

これにより、何が結果を改善したかを理解しやすくなります。

ステップ3:最適なプロンプトと参照を保存

成功した組み合わせを保存します。

再利用可能なプロンプトは、一度の幸運な出力よりも価値があるかもしれません。

ステップ4:最終候補を2Kにアップグレード

構図と動きが許容可能になったら、より高い解像度レベルで生成または再生成します。

ステップ5:ComfyUIまたはAPIを使用して反復作業

同じワークフローが頻繁に繰り返される場合は、ノードグラフまたはアプリケーションパイプラインに移行します。

ステップ6:通常のエディターで仕上げ

商用利用の場合は、以下を確認します:

  • ロゴ
  • テキスト
  • 製品詳細
  • オーディオレベル
  • 字幕
  • 著作権
  • 最終カラーグレーディング
  • エクスポート設定

AI生成は制作チェーンの一部と見なすべきであり、唯一のレビュー段階ではありません。

開発者向けの実用的ワークフロー

開発者はモデルアクセスをビジネスロジックから分離する必要があります。

シンプルなアーキテクチャは以下のようになります:

アプリケーション
    ↓
生成サービス
    ↓
プロバイダーアダプター
    ↓
MetaSo H3 API / MiniMax API / セルフホストH3
    ↓
タスク状態 + 出力URL
    ↓
ストレージ / レビュー / 公開

プロバイダーアダプターにより、後で推論バックエンドを変更しやすくなります。

以下のフィールドを保存できます:

  • プロンプト
  • 参照コンテンツ
  • 解像度
  • 時間
  • アスペクト比
  • プロバイダー
  • モデルバージョン
  • コスト
  • タスクID
  • 生成時間
  • 出力URL
  • レビュー状態

これにより、利用可能な各クリップの実際のコストを比較するための効果的なデータセットを構築できます。

¥0.09という価格は何も意味しない

この目を引く数字は魅力的ですが、いくつかの境界問題に注意する必要があります。

MiniMaxの一般的な公式価格ではない

¥0.09/秒と¥0.15/秒は、ソース記事に表示されているMetaSoの価格です。

これをMiniMaxのグローバルAPI標準価格として引用すべきではありません。

価格は変動する可能性があります

サードパーティプロバイダーは以下の理由で価格を調整する可能性があります:

  • プロモーション活動
  • 計算リソースの供給
  • バルク契約
  • キューの戦略
  • モデルアップデート
  • ビジネス戦略

必ずリアルタイムのインターフェースを確認してください。

低価格が最終ビデオの単位コストの低さを保証するわけではない

失敗した生成を多く含むワークフローは、依然として高額になる可能性があります。

受け入れ率を測定してください。

ホスティングアクセスはオープンソースデプロイとは異なる

MetaSoはユーザーに代わってインフラストラクチャを処理します。

セルフホストはより多くの制御を提供しますが、計算と運用の負担もユーザーに移します。

より大きな変革:オープンモデルがますます使いやすくなっている

ソースの中で最も注目に値する点は、単に特定のプロバイダーの価格が安いということではありません。

むしろ、二つのトレンドが合流していることです。

第一に、高品質な動画モデルがよりオープンになっています。

MiniMaxはH3のウェイトを公開し、ComfyUIを含む複数の推論フレームワークをサポートしています。

第二に、ホスティングプラットフォームがこれらのオープンモデルをワンクリックサービスに変えつつあります。

これにより、より幅広いユーザー層が生まれています:

  • 研究者はモデルを検査し、デプロイできます。
  • 開発者はAPIを使用できます。
  • 上級ユーザーはComfyUIのフローチャートを構築できます。
  • クリエイターはブラウザを開いて直接生成できます。

モデル内部がより単純になるわけではありません。

インフラストラクチャはユーザーにとって見えなくなっているのです。

よくある質問

MiniMax H3とは何ですか?

MiniMax H3は、MiniMaxが提供するオープンウェイトの全モダリティ対応動画生成システムです。テキスト、画像、動画、音声をコンテキストとして使用し、ネイティブのステレオオーディオ付きで最大15秒の同期動画クリップを生成できます。

MetaSoでのMiniMax H3の価格は?

ソース記事によると、テスト期間中、MetaSoは768pで1生成秒あたり¥0.09、2Kで1生成秒あたり¥0.15を請求しています。これらはMetaSoプラットフォームの価格であり、MiniMaxの一般的な公式API料金ではなく、変更される可能性があります。

GPUなしでMiniMax H3を実行できますか?

はい、MiniMax自身のAPI/アプリやMetaSoなどのサードパーティプラットフォームなどのマネージドサービスを使用する場合可能です。プロバイダーが自社のインフラ上でモデルを実行するため、ローカルデバイスはサービスにアクセスするだけで済みます。

MiniMax H3はオープンソースですか?

MiniMaxはコミュニティライセンスの下でH3モデルのウェイトとコードを公開しています。完全なマネージド型H3-Context-IRオーケストレーションシステムはオープンリリースの対象外ですが、MiniMaxはその段階向けにAPIとプロンプトガイドを提供しています。

MiniMax H3はComfyUIで実行できますか?

はい。MiniMax公式のH3リポジトリはComfyUIを推奨ワークフローの一つとして挙げており、H3テンプレートのリンクを提供しています。MetaSoも、マネージドH3アクセスがComfyUI向けワークフローと併用できると述べています。

ワークフロー。

H3をセルフホストするにはどのようなハードウェアが必要ですか?

具体的な要件は、推論フレームワーク、精度、時間、パフォーマンス目標によって異なります。MiniMax公式のSGLangリファレンスコマンドは4つのGPUを使用しているため、一般的なコンシューマー向けノートPCで完全なモデルがスムーズに実行できると想定すべきではありません。

H3は現在Artificial Analysisでランキング1位ですか?

この記事でレビューした2026年8月7日時点のスナップショットでは、H3はArtificial Analysisの音声付き動画編集ランキングで1位でした。ランキングは動的なものであり、H3がすべての動画生成カテゴリーで1位であることを示すものではありません。

直接2K解像度で生成すべきですか?

実験を行う際は、ほとんどのコンセプトが複数回の反復を必要とするため、より低コストな解像度から始めるのが合理的です。モーション、構図、参照コンテンツが安定したら、理想的な結果を高解像度のワークフローに移行します。

関連ツール

  • MiniMax H3:公式オープンソースリポジトリ。H3モデルアーキテクチャ、チェックポイント、プロンプトガイド、デプロイ例、ワークフローリンクを含む。
  • MiniMax APIプラットフォーム:H3およびその他のMiniMaxモデル向けの公式マネージド開発者プラットフォーム。
  • MetaSo:ソース記事で紹介されているAIプロダクト。ブラウザベースの動画生成エントリにMiniMax H3を含む。
  • ComfyUI:オープンソースのノードベース生成AIワークフローシステム。MiniMaxのH3リポジトリで公式にサポートされている。
  • SGLang:MiniMaxがH3のローカルサービスに推奨する推論フレームワークの一つ。
  • Hugging Face:MiniMax公式のH3モデルページ。公開モデルファイルとコミュニティ利用を提供。

関連リンク

まとめ

MiniMax H3はオープンウェイトを採用していますが、ローカルデプロイには依然として相当なハードウェアとエンジニアリングの負担が伴います。MiniMax公式のリファレンスサービング例はマルチGPUのSGLang構成を使用しており、多くの動画クリエイターがマネージドルートを好む理由を説明するのに役立ちます。

ソース記事は、MetaSoがH3をどのように

ブラウザベースのサービスに変換し、テキストから動画、画像から動画、マルチ参照生成、APIアクセス、ComfyUI向けワークフローを提供しているかを示しています。テスト時点で、MetaSoの表示価格は768pで1秒あたり0.09元、2Kで1秒あたり0.15元でした。

これらの低価格なサードパーティ料金が重要なのは、AI動画が本質的に反復的なプロセスだからです。より安価な試行により、クリエイターは高解像度の最終結果を確定する前に、より多くのショットの方向性、プロンプト、シーン、カットをテストできます。

本当の転換点は、H3がオープンソースであることだけでなく、オープンウェイトの動画モデルが一般のウェブサービスと同じくらい使いやすくなりつつあることです。