DeepSeek V4 Pro、SuperCLUE端末プログラミングベンチマークで2位を獲得、コストはKimi K3のわずか一部

DeepSeek-V4-Pro-0813は、最新のSuperCLUE-Terminal中国語スマート端末プログラミングベンチマークで2位となり、スコア51.52点を獲得、Kimi K3に次ぐ結果となりました。

发布于 2026年8月14日generalGEO 评分: 08 次阅读
DeepSeek V4 Pro、SuperCLUE端末プログラミングベンチマークで2位を獲得、コストはKimi K3のわずか一部

DeepSeek V4 Pro、SuperCLUEターミナルプログラミングベンチマークでKimi K3のわずかなコストで2位を獲得

はじめに

DeepSeek-V4-Pro-0813は、最新のSuperCLUE-Terminal中国語エージェントターミナルプログラミングベンチマークで2位を獲得し、51.52点を記録しました。60.61点でランキング首位のKimi K3に次ぐ結果です。

この結果が特に注目に値するのは、そのコスト優位性にあります。ベンチマーク実行において、DeepSeek-V4-Pro-0813は平均して1タスクあたり約1.42元のコストで、高得点モデルの中でも優れたコストパフォーマンスを示しました。

SuperCLUE-Terminalは、中国の開発者向けの実際のプログラミングタスクを想定して設計されています。モデルはClaude Codeベースの汎用エージェントフレームワークを通じて評価され、このベンチマークにより、中国語の要件理解、多段階作業の計画、ツールの使用、問題のデバッグ、エンドツーエンドのワークフローによるコード修正などの能力をモデル間で比較できます。

DeepSeek V4 Pro、最新のプログラミング評価で2位に

このベンチマークは、短く断片的なプログラミング問題ではなく、実際の開発作業を反映することを目的としています。公開された結果によると、単一のタスクには約50〜110ラウンドのインタラクションが必要で、1タスクの完全な実行には約30〜90分かかる可能性があります。

現在のランキングでは、Kimi K3が60.61点で首位を維持しています。DeepSeek-V4-Pro-0813は51.52点で続き、GLM-5.2の48.48点や、以前のバージョンであるDeepSeek-V4-Flash-0731の46.46点を上回っています。

モデル SuperCLUE-Terminalスコア 報告された平均タスク単価
Kimi K3(最大値) 60.61 19.63元
DeepSeek-V4-Pro-0813(最大値) 51.52 1.42元
GLM-5.2(最大値) 48.48 23.30元
DeepSeek-V4-Flash-0731(最大値) 46.46 0.64元

上記のデータはSuperCLUE-Terminalベンチマーク環境からのものであり、ベンチマーク実行コストとして理解すべきであり、モデルプロバイダーの固定タスク単価ではありません。

DeepSeekは別途、本番環境のAPIモデルdeepseek-v4-proが現在DeepSeek-V4-Pro-0813を指していることを確認しています。このモデルは、DeepSeekウェブアプリ、モバイルアプリ、およびAPIを通じて利用可能です。

タスクあたりわずか1.42元:突出したコスト優位性

この結果の最も注目すべき点は、DeepSeek-V4-Pro-0813の報告コストです。

ベンチマークでは、平均コストはタスクあたり約1.42元で、同じSuperCLUE比較において、Kimi K3(19.63元)の約14分の1、GLM-5.2(23.30元)の約16分の1です。

この差が重要なのは、高性能プログラミングモデル間のスコア差は比較的小さい可能性がある一方で、長時間のエージェントタスクを実行するコストは大きく異なる可能性があるためです。小規模企業、独立開発者、およびプログラミングエージェントを繰り返し実行する必要があるチームにとって、実行コストはベンチマークのトップスコアと同様に重要となる可能性があります。

この評価は、フロントエンドページ、3Dゲーム、エンジニアリングスクリプトの修正など、実際の開発シナリオをカバーしています。報告されたテストでは、DeepSeek-V4-Pro-0813は、衝突処理、スコアリング、終了状態を含むゲーム開発ロジックを完了することができました。

動作面では、生成されるインターフェーススタイルとインタラクションフィードバックも、基本的なテンプレート効果を超えています。

一部の創造的な描画タスクではわずかな構造的問題が依然として見られますが、全体的な完成品質はトップグループと同等レベルです。

予算に敏感な開発チームにとって、この結果はDeepSeek-V4-Pro-0813に明確な位置づけを与えています:最先端のプログラミングエージェント性能に近く、ベンチマーク実行コストは価格の高い複数の競合他社を大幅に下回ります

よくある質問

DeepSeek-V4-Pro-0813とは何ですか?

DeepSeek-V4-Pro-0813は、deepseek-v4-pro APIモデル名の背後にある現在の本番バージョンです。DeepSeekは2026年8月13日にGAバージョンを正式にリリースし、エージェント機能を強化し、ウェブアプリ、モバイルアプリ、APIでサポートしています。

SuperCLUE-Terminalとは何ですか?

SuperCLUE-Terminalは、エージェントターミナルタスク向けのベンチマークであり、実際のシナリオでの中国語プログラミングおよびエンジニアリングワークフローに焦点を当てています。要件理解、計画、コマンド実行、ファイル修正、デバッグ、最終的なタスク完了などのエンドツーエンドのパフォーマンスを評価します。

なぜベンチマークはClaude Codeを使用するのですか?

このベンチマークは汎用エージェントフレームワークを採用しており、評価に参加するモデルがより比較可能な実行環境でテストされるようにしています。Claude Codeはタスク実行用のターミナル型エージェント環境を提供し、基盤となるモデルは各評価で交換されます。

1.42元はDeepSeek V4 Proの公式タスク単価ですか?

いいえ。1.42元は、今回のSuperCLUE-Terminalベンチマーク実行における観測されたタスクあたりの平均コストであり、ベンチマークのトークン使用量と価格設定方法に基づいて計算されています。実際のAPIコストは、入力トークン、出力トークン、キャッシュ使用状況、推論設定、およびサービスプロバイダーの現在の価格によって異なります。

このベンチマークでは、DeepSeek V4 ProはKimi K3と比較してどうですか?

Kimi K3は60.61点と高いスコアを獲得し、DeepSeek-V4-Pro-0813は51.52点でした。ただし、ベンチマークレポートによると、Kimi K3の平均タスクコストは19.63元であるのに対し、DeepSeek-V4-Pro-0813はわずか1.42元であり、この特定の評価においてDeepSeekは顕著なコスト優位性を持っています。

DeepSeek V4 Proは長いコンテキストとエージェントワークフローをサポートしていますか?

はい。DeepSeek公式APIドキュメントには、DeepSeek V4 Proのコンテキスト長が100万トークンと記載されており、ツール呼び出し、Responses API、Anthropic互換API、および複数の推論強度設定をサポートしています。DeepSeekはGAバージョンをエージェントワークロード向けのアップグレードとして明確に位置づけています。

DeepSeek V4 Proはプログラミングにおいて常にGLM-5.2より優れていますか?

必ずしもそうとは限りません。今回のSuperCLUE-Terminal結果では、DeepSeek-V4-Pro-0813は51.52点、GLM-5.2は48.48点でしたが、単一のベンチマークがすべてのプログラミングワークロードでのパフォーマンスを決定するわけではありません。リポジトリ規模、言語、ツール環境、長いコンテキストの動作、レイテンシ、コストはすべてモデル選択に影響します。

関連ツール

  • DeepSeek API:DeepSeekモデル(deepseek-v4-proを含む)にアクセスするための公式APIプラットフォーム。
  • SuperCLUE-Terminal:正式な

この記事で論じるエージェント端末プログラミング比較に使用されたベンチマークについて。

  • Claude Code:Anthropic のエージェントコーディングツールであり、ベンチマークでは汎用実行フレームワークとして使用。
  • Kimi API:月の暗面科技有限公司による Kimi K3 および他の Kimi モデル向け公式開発者プラットフォーム。
  • Z.AI GLM-5.2:GLM-5.2 の公式概要であり、このモデルもベンチマークで高いスコアを獲得。

関連リンク

まとめ

DeepSeek-V4-Pro-0813 は SuperCLUE-Terminal で 51.52 を獲得し、このベンチマークで Kimi K3 に次いで第2位となり、GLM-5.2 および DeepSeek-V4-Flash-0731 を上回りました。

その主な強みはコストにあります:SuperCLUE が報告する平均コストはおよそ タスクあたり人民元 1.42 元 であり、同じ評価における Kimi K3 および GLM-5.2 の記録コストを大幅に下回ります。

この結果は、DeepSeek V4 Pro が一般的に最良のコーディングモデルであることを意味するものではありませんが、長時間のツール集約型プログラミングタスクにおいて、このモデルがエージェントコーディング性能と実行コストのバランスを良好に実現していることを示しています。

コーディングエージェントの能力と運用コストの両方を重視するチームにとって、DeepSeek-V4-Pro-0813 は今回の SuperCLUE-Terminal 比較において最も競争力のある選択肢の一つです。