DeepSeek V4 Pro 对比 Grok 4.6:首次真实世界测试将两款模型双双推入顶尖行列
两大 AI 模型几乎同时发布,让 DeepSeek V4 Pro 和 Grok 4.6 直接成为焦点。DeepSeek V4 Pro 在智能体及

DeepSeek V4 Pro 对比 Grok 4.6:首次真实世界测试将两款模型双双推入顶级行列
引言
两款重量级 AI 模型几乎同时发布,让 DeepSeek V4 Pro 和 Grok 4.6 直接成为焦点。
DeepSeek V4 Pro 在智能体与软件工程性能上实现大幅跃升,而 Grok 4.6 则在编码、知识工作和综合能力上强势发力。源文章将这两次发布描述为对 OpenAI 和 Anthropic 当前前沿模型的直接挑战。
这次对比尤其有趣的地方在于,两款模型不仅是在基准测试表上接受衡量。早期的真实世界测试还要求它们用相同的提示词去搭建网站、制作游戏、还原视觉设计以及生成 3D 体验。
结果与其说是一场赢家通吃的简单竞赛,不如说是一场势均力敌的对决——每款模型都有自己脱颖而出的领域。
DeepSeek V4 Pro 登场,Grok 4.6 同时入局
源文章重点列出了 DeepSeek V4 Pro 的多项基准测试结果。
在网络安全智能体评估 CyberGym 中,DeepSeek V4 Pro 据报得分 83.3,以微弱优势超过 Fable 5 的 83.1 和 Opus 4.8 的 78.3。
在 AutomationBench 上,它达到 31.8,领先于 Fable 5 的 29.1 和 Opus 4.8 的 27.2。
结果最接近的是 Terminal-Bench 2.1。DeepSeek V4 Pro 得分 87.9,而 Opus 4.8 为 85.0,Fable 5 为 88.0。
源文章还报告了在启用工具的人类最后考试(Humanity's Last Exam)设置中取得 60.0 的成绩,而 Opus 4.8 为 57.9,Fable 5 为 63.0。
DeepSWE 也是报告中另一项重大改进。DeepSeek V4 Pro 达到 62.7,相比预览版的 12.8 大幅提升,高于 Opus 4.8 报告的 58.0,但仍低于 Fable 5 的 70.0。
Grok 4.6 则在多个领域与 GPT-5.6 和 Fable 5 进行了对比测试。
源文章报告其综合智能指数得分为 61,落后 Fable 5 的 62 一分。
在 CursorBench 上,Grok 4.6 据报得分 69.9%,领先于 GPT-5.6 的 67.2%,接近 Fable 5 的 70.5%。
在 FrontierCode 上,它达到 61.3%,同样略微领先于 GPT-5.6 的 60.6%,落后于 Fable 5 的 63.6%。
源文章显示,知识工作方面的表现更为强劲。据报 Grok 4.6 在全部三项重点评估中均位列第一:GDPval-AA v2 上 1,753 Elo,AA-Briefcase 上 1,577 Elo,以及专业法律基准 Harvey LAB 上 15.8%。
源文章从这些数据得出的主要结论直截了当:两款模型都已进入与领先前沿系统同台竞技的对话中。
价格差异也是故事的一部分
性能只是这次对比的一半。
源文章还强调了推理成本。它报告了发布时每百万输出 token 的价格:
| 模型 | 每百万 token 输出价格(据报) |
|---|---|
| DeepSeek V4 Pro | $0.87 |
| Grok 4.6 | $6 |
| GPT-5.6 Sol | $30 |
| Claude Opus 5 | $25 |
| Fable 5 | $50 |
在其当前的美元定价视图中,缓存未命中时每百万输入 token 为 0.435 美元,缓存命中时为 0.003625 美元。
DeepSeek 的文档还
指出其V4模型支持100万token上下文窗口、工具调用,以及OpenAI格式和Anthropic格式的API访问。
其他模型的具体价格会随时间变化,因此原文中的跨模型价格对比应视作其发布日期的快照,而非长期有效的价格表。
首次实测:DeepSeek V4 Pro构建3D地球
文章中描述的第一个实际测试给DeepSeek V4 Pro提出了一个相当高的要求。
仅凭一条提示词,该模型便在浏览器中生成了一个完整的交互式3D地球体验。
据报道,结果支持拖拽、旋转和缩放等基本交互,还包含了全球数据流、动态路线和遍布全球的地理标记。
视觉细节更进一步。大气散射、云层、昼夜光照以及周围界面都包含在生成的体验中。
这次测试的重点不仅仅在于模型生成了一个网页,更在于它展示了AI编程模型在被要求于单一任务中协调视觉设计、3D渲染、交互和应用结构时能走多远。
DeepSeek V4 Pro与Grok 4.6在三个应用任务中的对决
随后,原文使用相同或高度接近的提示词对两个模型进行了比较。
AI创作者向阳乔木先用DeepSeek V4 Pro运行了三个小任务,然后将其中两个相同的提示词交给Grok 4.6。
使用三项技能构建并部署网站
第一个任务要求模型使用三项技能来开发和部署一个网站。
据报道,DeepSeek V4 Pro成功完成了整个工作流程。原文称页面设计和整体完整性表现稳定。
这类测试对智能体编程尤为重要,因为模型需要协调多个工具或能力,而非仅仅生成一段代码。
在Bento卡片中复现60种设计风格
第二个任务要求模型复现60种不同的设计风格,并以一组Bento卡片的形式呈现。
据报道,DeepSeek V4 Pro在不同设计中区分了字体排版、色彩搭配和布局。
当相同的提示词交给Grok 4.6时,后者占据了优势。原文称Grok的部分页面在布局、色彩和视觉层级上更为成熟,最终呈现更加精致。
构建3D打砖块游戏
第三个任务是从零开始创建一个3D打砖块游戏。
DeepSeek V4 Pro生成了一个可玩的游戏,包含3D环境、背景音乐、动态音效和交互反馈。
Grok 4.6在这一轮表现相当。原文将两者的结果描述为在视觉质量、场景完整性和可玩性上几乎持平。
Flappy Bird测试揭示了另一种取舍
一个更细致的测试来自开发者Jun Song,他给了DeepSeek V4 Pro和Grok 4.6完全相同的提示词,要求从零构建一个Flappy Bird风格的游戏。
两个模型采取了截然不同的方法。
DeepSeek V4 Pro使用了超过20,000个token,但据报道API成本仅为0美元——因为该模型的API定价(在DeepSeek的限时优惠期间)让输入和输出token都完全免费。
019**。
Grok 4.6 使用了约 5,000 个 token,而报告显示成本为 0.03 美元。
因此,在这次特定运行中,Grok 的 token 效率更高,但根据来源文章所述,DeepSeek 产出了更强的最终结果。
据报道,DeepSeek 版本包含分层的山脉背景、云朵、渐变和立体感管道,以及角色通过管道时漂浮的 “+1” 动画。
来源文章的结论很有价值:更低的 token 消耗并不自动意味着更好的应用结果,而更高的 token 消耗也不一定意味着更高的成本。
另一项前端测试也同样青睐 DeepSeek
开发者 Hamza 运行了另一项前端生成测试,来源文章报道 DeepSeek V4 Pro 再次获胜。
生成的页面被描述为在整体完整性和视觉质量方面优于 Grok 4.6 的结果。
这强化了之前在任务中观察到的模式:这两个模型非常接近,但它们的优势会根据具体应用和提示词而有所不同。
V4 Pro 仍有弱点
DeepSeek V4 Pro 并非在每项视觉生成测试中都获胜。
在一次涉及鹈鹕的对比中,V4 Pro 版本据称在整体视觉完成度上强于 Flash 版本,并生成了更吸引人的大象插图,但鹈鹕的移动方向是错误的。
这是一个小例子,但它突显了生成式编码和视觉系统的一个常见局限:结果可能看起来很精致,却仍然包含基本的语义或运动错误。
Three.js 樱花树:差距更加明显
来源文章随后增加了难度,要求 DeepSeek V4 Pro、GPT-5.6 Sol 和 Claude Opus 5 使用 Three.js 生成同一棵樱花树。
这一次,差异更加明显。
文章报道称,DeepSeek V4 Pro 在树干和树枝细节、树叶、光照、景深以及整体氛围等方面落后于其他两个模型。
这一结果很重要,因为它防止了对比变成一种简单的胜利叙事。DeepSeek V4 Pro 在端到端编码任务中可能非常强大,但仍然存在一些专门的视觉生成场景,其他前沿模型能产生更精细的结果。
总体而言:DeepSeek V4 Pro 与 Grok 4.6 水平接近
经过多轮测试,来源文章的总体判断是,DeepSeek V4 Pro 和 Grok 4.6 已经达到了相似的竞争水平。
两个模型都无法赢得每项任务。
DeepSeek V4 Pro 在某些端到端编码和应用构建任务中看起来特别强大,而 Grok 4.6 则可能更节省 token,并在一些视觉设计和知识工作对比中表现出优势。
这使得这种对比比单一的排行榜分数更有用。对于开发者来说,更好的模型可能取决于优先级是编码质量、代理可靠性、视觉精致度、token 效率还是 API 成本。
两款 AI 模型正在缩小与前沿的差距
来源文章将 DeepSeek V4 Pro 和 Grok 4.6 的同时发布描述为 AI 市场的一个不寻常时刻。
Rick De Oliveira 的反应,文中引用道,
原文章的核心观点是,这两款模型都既强大又价格实惠。
正是这一组合让它们的发布备受关注。
DeepSeek 的官方文档确认,V4 Pro 专为工具调用、长上下文工作负载以及思考与非思考模式而设计。
xAI 的官方 Grok 相关资料同样将其最新一代 Grok 定位在编码、智能体任务和知识工作方面。例如,官方 Grok 4.5 公告将该模型描述为专为编码、智能体任务和知识工作而构建,并报告了实际工程评测结果。
即使个别基准测试数据有所变化,更广泛的趋势依然清晰:前沿级 AI 正变得越来越易于开发者获取,性价比正在成为模型竞争中日益重要的部分。
接下来会发生什么?
源文章最后指出了下一轮竞争的方向。
它提到,xAI 已经预告了 Grok 4.7,而 OpenAI 和 Anthropic 预计将继续通过各自的模型更新来回应。
这意味着今天的基准测试领先者可能不会长久保持领先地位。
对于开发者而言,更持久的教训是:要根据真正影响自己工作流程的任务来评估模型。一个在基准测试上得分很高,但在你的代码库、部署流程、UI 要求或工具链上表现不佳的模型,可能仍然不是正确的选择。
常见问题
DeepSeek V4 Pro 是什么?
DeepSeek V4 Pro 是 DeepSeek 的 V4 旗舰模型,面向推理、编码、工具使用和长上下文工作负载。DeepSeek 官方文档列出了 100 万 token 的上下文窗口,并支持工具调用,同时提供 OpenAI 格式和 Anthropic 格式的 API 访问。
DeepSeek V4 Pro 与 Grok 4.6 相比如何?
源文章报道,这两款模型在多项智能体和编码测试中表现接近,各有胜负。DeepSeek V4 Pro 在多个端到端应用构建测试中表现尤为出色,而 Grok 4.6 在编码、知识工作以及一些视觉设计任务中展现出强劲结果。
DeepSeek V4 Pro 比 Grok 便宜吗?
根据源文章中 2026 年 8 月 14 日的对比,DeepSeek V4 Pro 报告的输出价格为每百万 token 0.87 美元,而 Grok 4.6 为 6 美元。DeepSeek 官方定价页面目前确认 V4 Pro 每百万输出 token 为 0.87 美元,不过 API 价格可能会变动。
DeepSeek V4 Pro 能构建网站和游戏吗?
源文章报道了成功的测试案例,其中 DeepSeek V4 Pro 生成了 3D 地球体验、网站、Bento 风格设计合集、3D 打砖块游戏和 Flappy Bird 风格游戏。这些是已报道的实际测试结果,而非保证每次提示都能产生同等质量的承诺。
DeepSeek V4 Pro 适合 AI 编码智能体吗?
它专为工具调用和智能体工作负载而设计,源文章报道其在多项智能体和软件工程评测中表现强劲。DeepSeek 官方文档也列出了 V4 Pro 对工具调用的支持。
DeepSeek V4 Pro 总是能击败其他前沿模型吗?
不是。源文章中包含了一些测试,其中 GPT-5.6 Sol 和 Claude Opus 5 在这些测试中表现
更好的结果,尤其是在 Three.js 樱桃树生成对比中。不同任务的结果差异很大。
除了基准分数,开发者还应该比较什么?
开发者还应该比较 API 成本、延迟、上下文长度、工具调用、编码可靠性、输出质量,以及模型与其现有智能体工作流的契合程度。对于生产系统而言,一致性和总成本可能比基准上的微小差异更重要。
相关工具
- DeepSeek API:访问 DeepSeek 模型的官方 API 端点。
- DeepSeek API 文档:关于模型、定价、工具调用和 API 集成的官方文档。
- xAI API:使用 Grok 模型进行构建的官方开发者资源。
- Grok:xAI 面向用户的 Grok 服务,用于与其模型交互。
- Three.js:与文章中描述的 Three.js 生成测试相关的 JavaScript 3D 库。
相关链接
- DeepSeek 模型与定价:官方 DeepSeek API 模型规格和当前令牌定价。
- DeepSeek V4 文档:官方 DeepSeek API 文档和集成指南。
- xAI Grok 4.5 公告:涵盖当前 Grok 代编码和智能体能力的 xAI 官方公告。
- xAI API 文档:通过 xAI 开发者平台使用 Grok 的官方文档。
- Three.js:官方 Three.js 项目网站和文档。
- DeepSeek API GitHub:官方 DeepSeek GitHub 组织。
总结
DeepSeek V4 Pro 和 Grok 4.6 正同时从两个方向推动前沿 AI:更强大的现实世界智能体和编码性能,加上更具攻击性的性价比。
早期测试并未产生一个全能赢家。DeepSeek V4 Pro 在多项端到端应用构建任务中表现强劲,而 Grok 4.6 则展示了具有竞争力的编码、知识工作和视觉设计能力。
更大的转变在于,开发者现在有了更多能力更强的模型可供选择,而无需自动支付前沿级价格。