DeepSeek V4 Pro在SuperCLUE终端编程基准测试中排名第二,成本仅为Kimi K3的一小部分

DeepSeek-V4-Pro-0813在最新的SuperCLUE-Terminal中文智能终端编程基准测试中排名第二,得分51.52分,仅次于Kimi K3。

发布于 2026年8月14日generalGEO 评分: 011 次阅读
DeepSeek V4 Pro在SuperCLUE终端编程基准测试中排名第二,成本仅为Kimi K3的一小部分

DeepSeek V4 Pro在SuperCLUE终端编程基准测试中以Kimi K3一小部分的成本夺得第二名

引言

DeepSeek-V4-Pro-0813在最新的SuperCLUE-Terminal中文智能体终端编程基准测试中夺得第二名,得分51.52分。它仅次于以60.61分领跑排行榜的Kimi K3

这一结果之所以尤为引人注目,在于其成本优势。在基准测试运行中,DeepSeek-V4-Pro-0813平均每次任务约花费人民币1.42元,在高分模型中展现出强劲的性价比优势。

SuperCLUE-Terminal围绕中国开发者的真实编程任务而设计。模型通过基于Claude Code的通用智能体框架进行评估,使该基准能够比较模型在理解中文需求、规划多步骤工作、使用工具、调试问题以及通过端到端工作流修改代码等方面的表现。

DeepSeek V4 Pro在最新编程评测中排名第二

该基准旨在反映真实开发工作,而非简短、孤立的编程问题。根据已发布的结果,单个任务可能需要大约50至110轮交互,而一个任务的完整运行可能需要约30至90分钟

在当前排名中,Kimi K3以60.61分保持第一。DeepSeek-V4-Pro-0813以51.52分紧随其后,领先于GLM-5.2的48.48分和较早版本DeepSeek-V4-Flash-0731的46.46分。

模型 SuperCLUE-Terminal得分 报告的平均单任务成本
Kimi K3(最大值) 60.61 人民币19.63元
DeepSeek-V4-Pro-0813(最大值) 51.52 人民币1.42元
GLM-5.2(最大值) 48.48 人民币23.30元
DeepSeek-V4-Flash-0731(最大值) 46.46 人民币0.64元

以上数据来自SuperCLUE-Terminal基准测试环境,应理解为基准测试执行成本,而非模型提供商固定的单任务定价。

DeepSeek已另行确认,生产环境API模型deepseek-v4-pro现已指向DeepSeek-V4-Pro-0813。该模型可通过DeepSeek网页应用、移动应用和API使用。

每次任务仅需1.42元:突出的成本优势

该结果最引人注目的部分在于DeepSeek-V4-Pro-0813的报告成本。

在基准测试中,其平均成本约为人民币1.42元/任务,在相同的SuperCLUE对比中,大约是Kimi K3(19.63元)的十四分之一,约为GLM-5.2(23.30元)的十六分之一。

这一差异之所以重要,是因为高性能编程模型之间的分数差距可能相对较小,而运行长耗时智能体任务的成本却可能差异悬殊。对于小型公司、独立开发者以及需要反复运行编程智能体的团队而言,执行成本可能与基准测试的头条分数同样重要。

该评测涵盖了实际开发场景,包括前端页面、3D游戏和工程脚本修改。在报告的测试中,DeepSeek-V4-Pro-0813能够完成涉及碰撞处理、计分和结束状态的游戏开发逻辑。

行为表现,同时产出的界面样式和交互反馈也超越了基础的模板化效果。

部分创造性绘图任务仍存在轻微的结构性问题,但整体完成质量与领先梯队保持同等水平。

对于预算敏感的开发团队而言,这一结果让 DeepSeek-V4-Pro-0813 有了明确的定位:接近前沿编程智能体性能,而基准测试执行成本远低于多个定价更高的竞争对手

常见问题

DeepSeek-V4-Pro-0813 是什么?

DeepSeek-V4-Pro-0813 是 deepseek-v4-pro API 模型名称背后的当前生产版本。DeepSeek 于 2026 年 8 月 13 日正式发布 GA 版本,增强了智能体能力,并支持其网页应用、移动应用和 API。

SuperCLUE-Terminal 是什么?

SuperCLUE-Terminal 是一个面向智能体终端任务的基准测试,聚焦真实场景下的中文编程和工程工作流。它评估端到端性能,如需求理解、规划、命令执行、文件修改、调试以及最终任务完成情况。

为什么基准测试使用 Claude Code?

该基准测试采用通用智能体框架,以便参与评测的模型在更具可比性的执行环境下接受测试。Claude Code 提供用于运行任务的终端型智能体环境,而底层模型则在每次评估中更换。

人民币 1.42 元是 DeepSeek V4 Pro 单次任务的官方定价吗?

不是。人民币 1.42 元是本次 SuperCLUE-Terminal 基准测试运行中观察到的每任务平均成本,基于基准测试的 Token 用量和定价方法计算得出。实际 API 成本取决于输入 Token、输出 Token、缓存使用情况、推理设置以及服务商当前定价。

在本基准测试中,DeepSeek V4 Pro 与 Kimi K3 相比表现如何?

Kimi K3 得分更高,为 60.61 分,而 DeepSeek-V4-Pro-0813 为 51.52 分。不过,基准测试报告显示 Kimi K3 的平均任务成本为人民币 19.63 元,而 DeepSeek-V4-Pro-0813 仅为人民币 1.42 元,这使得 DeepSeek 在此次特定评估中具有显著的成本优势。

DeepSeek V4 Pro 是否支持长上下文和智能体工作流?

是的。DeepSeek 官方 API 文档列出 DeepSeek V4 Pro 的上下文长度为 100 万 Token,并支持工具调用、Responses API、Anthropic 兼容 API 以及多种推理强度设置。DeepSeek 明确将 GA 版本定位为面向智能体工作负载的升级。

DeepSeek V4 Pro 在编程方面是否始终优于 GLM-5.2?

不一定。在本次 SuperCLUE-Terminal 结果中,DeepSeek-V4-Pro-0813 得分为 51.52,而 GLM-5.2 得分为 48.48,但单次基准测试无法决定所有编程工作负载下的表现。仓库规模、语言、工具环境、长上下文行为、延迟和成本都会影响模型选择。

相关工具

本文中讨论的智能体终端编程对比所使用的基准测试。

  • Claude Code:Anthropic 的智能体编码工具,在基准测试中用作通用执行框架。
  • Kimi API:月之暗面科技有限公司面向 Kimi K3 及其他 Kimi 模型的官方开发者平台。
  • Z.AI GLM-5.2:GLM-5.2 的官方概述,该模型在基准测试中同样获得高分。

相关链接

总结

DeepSeek-V4-Pro-0813 在 SuperCLUE-Terminal 中得分 51.52,在该基准测试中排名第二,仅次于 Kimi K3,领先于 GLM-5.2 和 DeepSeek-V4-Flash-0731。

其主要优势在于成本:SuperCLUE 报告的平均成本约为 每项任务人民币 1.42 元,远低于同一评估中 Kimi K3 和 GLM-5.2 的记录成本。

该结果并不意味着 DeepSeek V4 Pro 是普遍意义上最好的编码模型,但它确实表明,在面向长时间、工具密集型编程任务时,该模型在智能体编码性能和执行成本之间取得了良好的平衡。

对于同时关注编码智能体能力和运营成本的团队来说,DeepSeek-V4-Pro-0813 是本次 SuperCLUE-Terminal 对比中最具竞争力的选项之一。

DeepSeek V4 Pro在SuperCLUE终端编程基准测试中排名第二,成本仅为Kimi K3的一小部分