DeepSeek V4 Pro 対 Grok 4.6:初の実世界テストで両モデルがトップクラスに躍り出る

2つのAIモデルがほぼ同時に発表され、DeepSeek V4 ProとGrok 4.6が直接注目を集めています。DeepSeek V4 Proはエージェントおよび

发布于 2026年8月14日generalGEO 评分: 08 次阅读
DeepSeek V4 Pro 対 Grok 4.6:初の実世界テストで両モデルがトップクラスに躍り出る

DeepSeek V4 Pro vs Grok 4.6:初の実世界テストで両モデルがトップクラス入り

はじめに

2つの重量級AIモデルがほぼ同時にリリースされ、DeepSeek V4 ProとGrok 4.6が一躍注目の的となった。

DeepSeek V4 Proはエージェントおよびソフトウェアエンジニアリング性能において大幅な飛躍を遂げ、一方Grok 4.6はコーディング、ナレッジワーク、総合能力で強力な力を発揮している。元記事では、この2つのリリースをOpenAIとAnthropicの現在の最先端モデルへの直接的な挑戦と位置づけている。

今回の比較が特に興味深いのは、両モデルが単にベンチマーク表で評価されているだけではない点だ。初期の実世界テストでは、同じプロンプトを使用してウェブサイトの構築、ゲーム制作、ビジュアルデザインの再現、3D体験の生成が求められた。

結果は、勝者総取りの単純な競争というよりも、互角の対決となった——各モデルがそれぞれ秀でる分野を持っている。

DeepSeek V4 Pro登場、Grok 4.6も同時参戦

元記事では、DeepSeek V4 Proの複数のベンチマーク結果が重点的に列挙されている。

サイバーセキュリティエージェント評価のCyberGymでは、DeepSeek V4 Proは83.3を記録し、Fable 5の83.1とOpus 4.8の78.3を僅差で上回った。

AutomationBenchでは31.8に達し、Fable 5の29.1とOpus 4.8の27.2をリードした。

最も接戦だったのはTerminal-Bench 2.1。DeepSeek V4 Proは87.9を獲得し、Opus 4.8は85.0、Fable 5は88.0だった。

元記事では、ツールを有効化したHLE(Humanity's Last Exam)設定でも60.0のスコアを報告しており、Opus 4.8は57.9、Fable 5は63.0だった。

DeepSWEも報告書におけるもう一つの大きな改善点だ。DeepSeek V4 Proは62.7に達し、プレビュー版の12.8から大幅に向上、Opus 4.8の報告値58.0を上回るが、Fable 5の70.0には依然及ばない。

Grok 4.6は複数の分野でGPT-5.6およびFable 5と比較テストされた。

元記事では、総合知能指数スコア61を報告しており、Fable 5の62に1点差で及ばなかった。

CursorBenchでは、Grok 4.6は**69.9%**を記録し、GPT-5.6の67.2%をリード、Fable 5の70.5%に迫った。

FrontierCodeでは**61.3%**に達し、こちらもGPT-5.6の60.6%を僅かに上回り、Fable 5の63.6%には及ばなかった。

元記事によると、ナレッジワーク分野ではさらに強力なパフォーマンスを見せた。Grok 4.6は重点評価3項目すべてで首位を獲得したと報告されている:GDPval-AA v2で1,753 Elo、AA-Briefcaseで1,577 Elo、専門法律ベンチマークのHarvey LABで15.8%

元記事がこれらのデータから導き出す主な結論は明確だ:両モデルとも、主要な最先端システムと肩を並べる議論の俎上に載ったということだ。

価格差もストーリーの一部

性能は今回の比較の半分に過ぎない。

元記事は推論コストにも焦点を当てている。リリース時点での出力100万トークンあたりの価格を以下のように報告している:

モデル 出力100万トークンあたりの価格(報告値)
DeepSeek V4 Pro $0.87
Grok 4.6 $6
GPT-5.6 Sol $30
Claude Opus 5 $25
Fable 5 $50

現在の米ドル建て価格表示では、キャッシュミス時の入力100万トークンあたり0.435ドル、キャッシュヒット時は0.003625ドル。

DeepSeekのドキュメントはまた、V4モデルが100万トークンのコンテキストウィンドウ、ツール呼び出し、OpenAI形式およびAnthropic形式のAPIアクセスをサポートしていると述べている。

他のモデルの具体的な価格は時間とともに変化するため、元記事のモデル間価格比較は発売日時点のスナップショットとして捉えるべきであり、長期的に有効な価格表ではない。

初の実機テスト:DeepSeek V4 Proが3D地球を構築

記事で説明されている最初の実地テストは、DeepSeek V4 Proにかなり高いハードルを課した。

プロンプト1つだけで、このモデルはブラウザ上で完全なインタラクティブ3D地球体験を生成した。

結果は、ドラッグ、回転、ズームなどの基本的なインタラクションに対応し、グローバルデータフロー、動的ルート、世界中に散らばった地理的マーカーも含まれていたと報告されている。

ビジュアルディテールはさらに一歩進んでいる。大気散乱、雲、昼夜の照明、周囲のインターフェースがすべて生成された体験に含まれていた。

このテストのポイントは、モデルが単にウェブページを生成したということではなく、AIプログラミングモデルが単一のタスクでビジュアルデザイン、3Dレンダリング、インタラクション、アプリケーション構造を調整するよう求められたときに、どこまで到達できるかを示したことにある。

DeepSeek V4 ProとGrok 4.6、3つのアプリケーションタスクで対決

続いて、元記事では同一または極めて類似したプロンプトを使用して両モデルを比較した。

AIクリエイターの向阳乔木氏は、まずDeepSeek V4 Proで3つの小さなタスクを実行し、その後そのうち2つの同一プロンプトをGrok 4.6にも渡した。

3つのスキルを使用してウェブサイトを構築・デプロイ

最初のタスクでは、モデルに3つのスキルを使用してウェブサイトを開発・デプロイすることが求められた。

DeepSeek V4 Proはワークフロー全体を成功裏に完了したと報告されている。元記事によると、ページデザインと全体的な完成度は安定していた。

この種のテストはエージェントプログラミングにとって特に重要である。なぜなら、モデルは単にコードを生成するだけでなく、複数のツールや能力を調整する必要があるからだ。

Bentoカードで60のデザインスタイルを再現

2つ目のタスクでは、モデルが60の異なるデザインスタイルを再現し、Bentoカードのセットとして表示することが求められた。

DeepSeek V4 Proは、異なるデザイン間でタイポグラフィ、配色、レイアウトを区別したと報告されている。

同じプロンプトがGrok 4.6に渡されると、こちらが優勢となった。元記事によると、Grokのページの一部はレイアウト、色彩、視覚的階層がより洗練されており、最終的な仕上がりはより精緻だった。

3Dブロック崩しゲームの構築

3つ目のタスクは、ゼロから3Dブロック崩しゲームを作成することだった。

DeepSeek V4 Proは、3D環境、背景音楽、動的サウンドエフェクト、インタラクティブフィードバックを備えたプレイ可能なゲームを生成した。

Grok 4.6もこのラウンドでは互角のパフォーマンスを見せた。元記事では、両者の結果は視覚品質、シーン完成度、プレイアビリティにおいてほぼ互角だったと述べている。

Flappy Birdテストがもう一つのトレードオフを明らかに

より詳細なテストは開発者Jun Song氏によるもので、彼はDeepSeek V4 ProとGrok 4.6に完全に同一のプロンプトを与え、ゼロからFlappy Birdスタイルのゲームを構築するよう求めた。

両モデルはまったく異なるアプローチを取った。

DeepSeek V4 Proは20,000トークン以上を使用したが、APIコストは報告上0ドルだった——なぜなら、このモデルのAPI価格設定(DeepSeekの期間限定オファー期間中)により、入力トークンと出力トークンの両方が完全に無料だったからだ。

Grok 4.6は約5,000トークンを使用し、コストは0.03ドルと報告されている。

したがって、この特定の実行ではGrokの方がトークン効率が高かったが、元記事によればDeepSeekの方がより優れた最終結果を生み出した。

DeepSeek版には、層状の山脈の背景、雲、グラデーション、立体感のあるパイプ、そしてキャラクターがパイプを通過する際に浮かび上がる**「+1」**アニメーションが含まれていたと報告されている。

元記事の結論は示唆に富む:トークン消費量が少ないことが自動的に優れたアプリケーション結果を意味するわけではなく、トークン消費量が多いことが必ずしも高コストを意味するわけでもない。

もう一つのフロントエンドテストもDeepSeekを支持

開発者Hamza氏は別のフロントエンド生成テストを実行し、元記事ではDeepSeek V4 Proが再び勝利したと報告されている。

生成されたページは、全体的な完成度と視覚品質の点で優れていると評された。

Grok 4.6 の結果。

これは、これまでのタスクで観察されてきたパターンをさらに強化するものである:この2つのモデルは非常に接近しているが、その優位性は具体的な用途やプロンプトによって異なる。

V4 Pro には依然として弱点がある

DeepSeek V4 Pro は、すべてのビジュアル生成テストで勝利したわけではない。

ペリカンに関する比較では、V4 Pro バージョンは Flash バージョンよりも全体的なビジュアルの完成度が高く、より魅力的なゾウのイラストを生成したとされているが、ペリカンの移動方向が間違っていた。

これは小さな例だが、生成型コーディングとビジュアルシステムに共通する限界を浮き彫りにしている:結果は洗練されて見えるかもしれないが、それでも基本的な意味論的または運動学的なエラーを含むことがある。

Three.js の桜の木:差はより顕著に

元の記事はその後、難易度を上げ、DeepSeek V4 Pro、GPT-5.6 Sol、Claude Opus 5 に Three.js を使って同じ桜の木を生成するよう要求した。

今回は、その差はより顕著だった。

記事によると、DeepSeek V4 Pro は、幹や枝のディテール、葉、ライティング、被写界深度、そして全体的な雰囲気などにおいて、他の2つのモデルに遅れをとったという。

この結果は重要である。なぜなら、この比較が単純な勝利の物語になるのを防いだからだ。DeepSeek V4 Pro はエンドツーエンドのコーディングタスクでは非常に強力かもしれないが、他の最先端モデルがより精巧な結果を生み出す、専門的なビジュアル生成シナリオが依然として存在する。

全体的に見て:DeepSeek V4 Pro は Grok 4.6 と同等のレベルにある

複数回のテストを経て、元の記事の全体的な判断は、DeepSeek V4 Pro と Grok 4.6 が同等の競争レベルに達しているというものだ。

どちらのモデルも、すべてのタスクで勝利できるわけではない。

DeepSeek V4 Pro は、特定のエンドツーエンドのコーディングおよびアプリ構築タスクにおいて特に強力に見える一方、Grok 4.6 はトークンをより節約できる可能性があり、いくつかのビジュアルデザインおよびナレッジワークの比較で優位性を示した。

これにより、この比較は単一のリーダーボードスコアよりも有用なものとなっている。開発者にとって、より良いモデルは、コーディング品質、エージェントの信頼性、ビジュアルの精巧さ、トークン効率、APIコストのいずれを優先するかによって変わる可能性がある。

2つのAIモデルが最前線との差を縮めている

元の記事は、DeepSeek V4 Pro と Grok 4.6 の同時リリースを、AI市場における異例の瞬間として説明している。

リック・デ・オリベイラ氏の反応は、記事に引用されている。

元の記事の核心的な見解は、これらのモデルはどちらも強力でありながら手頃な価格であるということだ。

この組み合わせこそが、それらのリリースに大きな注目が集まった理由である。

DeepSeek の公式ドキュメントは、V4 Pro がツール呼び出し、長いコンテキストのワークロード、および思考モードと非思考モードのために設計されていることを確認している。

xAI の公式 Grok 関連資料も同様に、最新世代の Grok をコーディング、エージェントタスク、ナレッジワークに位置付けている。例えば、公式の Grok 4.5 発表では、このモデルがコーディング、エージェントタスク、ナレッジワーク用に構築されていると説明し、実際のエンジニアリング評価結果を報告している。

個々のベンチマーク数値が変動しても、より広範なトレンドは明確である:フロンティアレベルのAIはますます開発者が利用しやすくなっており、価格性能比はモデル競争においてますます重要な部分になりつつある。

次に何が起こるのか?

元の記事は最後に、次の競争ラウンドの方向性を示している。

xAI が Grok 4.7 を予告しており、OpenAI と Anthropic はそれぞれのモデルアップデートで応答し続けると予想されると述べている。

これは、今日のベンチマークのリーダーが、その地位を長く維持できない可能性があることを意味する。

開発者にとって、より永続的な教訓はこれだ:本当に自分のワークフローに影響を与えるタスクに基づいてモデルを評価すること。ベンチマークで高いスコアを獲得しても、自分のコードベース、デプロイプロセス、UI要件、またはツールチェーンでうまく機能しないモデルは、依然として正しい選択ではない可能性がある。

よくある質問

DeepSeek V4 Pro とは何か?

DeepSeek V4 Pro は、推論、コーディング、ツール使用、長いコンテキストのワークロード向けに設計された DeepSeek の V4 フラッグシップモデルである。DeepSeek 公式ドキュメントには、100万トークンのコンテキストウィンドウが記載され、ツール呼び出しをサポートし、OpenAI 形式と Anthropic 形式の両方の API アクセスを提供する。

DeepSeek V4 Pro と Grok 4.6 の比較は?

元の記事によると、これら2つのモデルは、複数のエージェントおよびコーディングテストで互角の結果を示し、勝敗が分かれた。DeepSeek V4 Pro は複数のエンドツーエンドのアプリ構築テストで特に優れたパフォーマンスを示し、Grok 4.6 はコーディング、ナレッジワーク、およびいくつかのビジュアルデザインタスクで強力な結果を示した。

DeepSeek V4 Pro は Grok よりも安いのか?

元の記事の2026年8月14日付の比較によると、DeepSeek V4 Pro の報告された出力価格は100万トークンあたり0.87ドルであるのに対し、Grok 4.6 は6ドルである。DeepSeek 公式価格ページは現在、V4 Pro の出力100万トークンあたり0.87ドルを確認しているが、API価格は変動する可能性がある。

DeepSeek V4 Pro はウェブサイトやゲームを構築できるか?

元の記事は、DeepSeek V4 Pro が3D地球体験、ウェブサイト、Bento スタイルのデザインコレクション、3Dブロック崩しゲーム、Flappy Bird スタイルのゲームを生成した成功したテストケースを報告している。これらは報告された実際のテスト結果であり、毎回のプロンプトで同等の品質が保証されるという約束ではない。

DeepSeek V4 Pro は AI コーディングエージェントに適しているか?

これはツール呼び出しとエージェントワークロード用に設計されており、元の記事は複数のエージェントおよびソフトウェアエンジニアリング評価で強力なパフォーマンスを報告している。DeepSeek 公式ドキュメントも V4 Pro のツール呼び出しサポートを記載している。

DeepSeek V4 Pro は常に他のフロンティアモデルを打ち負かすのか?

いいえ。元の記事には、GPT-5.6 Sol と Claude Opus 5 がより良い結果を示したテストが含まれている。

特に Three.js の桜の木の生成比較において顕著である。結果はタスクによって大きく異なる。

開発者はベンチマークスコア以外に何を比較すべきか?

開発者はまた、APIコスト、レイテンシ、コンテキスト長、ツール呼び出し、コーディングの信頼性、出力品質、そしてモデルが既存のエージェントワークフローにどの程度適合するかを比較すべきである。本番システムにとっては、一貫性と総コストは、ベンチマークのわずかな差よりも重要である可能性がある。

関連ツール

  • DeepSeek API:DeepSeek モデルにアクセスするための公式 API エンドポイント。
  • DeepSeek API ドキュメント:モデル、価格、ツール呼び出し、API統合に関する公式ドキュメント。
  • xAI API:Grok モデルを使用して構築するための公式開発者リソース。
  • Grok:モデルと対話するための xAI のユーザー向け Grok サービス。
  • Three.js:記事で説明されている Three.js 生成テストに関連する JavaScript 3D ライブラリ。

関連リンク

  • DeepSeek モデルと価格:公式 DeepSeek API モデル仕様と現在のトークン価格。
  • DeepSeek V4 ドキュメント:公式 DeepSeek API ドキュメントと統合ガイド。
  • xAI Grok 4.5 発表:現在の Grok 世代のコーディングおよびエージェント機能を扱う xAI 公式発表。
  • xAI API ドキュメント:xAI 開発者プラットフォームを通じて Grok を使用するための公式ドキュメント。
  • Three.js:公式 Three.js プロジェクトウェブサイトおよびドキュメント。
  • [DeepSeek API

GitHub](https://github.com/deepseek-ai):公式のDeepSeek GitHub組織です。

まとめ

DeepSeek V4 ProとGrok 4.6は、現在、2つの方向からフロンティアAIを同時に前進させています。より強力な実世界向けエージェントとコーディング性能、そしてより攻撃的なコストパフォーマンスです。

初期テストでは、万能の勝者は生まれませんでした。DeepSeek V4 Proは複数のエンドツーエンドのアプリケーション構築タスクで強力なパフォーマンスを示し、Grok 4.6は競争力のあるコーディング、ナレッジワーク、ビジュアルデザインの能力を披露しました。

より大きな変化は、開発者が現在、フロンティア級の価格を自動的に支払うことなく、より多くの高性能モデルから選択できるようになったことです。