DeepSeek V4 Flash 0731:0.07美元游戏演示、API定价、架构与编码基准测试

DeepSeek V4 Flash 0731 以低 API 价格、百万 Token 上下文和较低激活参数引发价格竞争。本文从 0.07 元原型、缓存计费、第三方补贴和完整应用成本区分真实经济性。

发布于 2026年8月6日generalGEO 评分: 011 次阅读
这张图片是DeepSeek V4 Flash 0731的指南封面,整体为暗调科技风格,以黑色为底色,搭配深浅不一的蓝色发光元素。封面主体文字为“DeepSeek V4 Flash 0731 Guide”,下方标明核心内容方向为定价、基准测试、API及本地部署。底部还有四个代表相关内容的科技感图标,分别是对应定价的美元统计图表、对应基准测试的性能折线图、对应API的代码界面标识,以及对应本地部署的服务器设备与芯片图案。图片背景还有模糊的DeepSeek品牌标识,契合文章介绍DeepSeek V4 Flash 0731的核心主题。

DeepSeek V4 Flash 0731:一次重新后训练如何引发全球价格战

引言

DeepSeek V4 Flash 0731引发了一系列不同寻常的反应。

开发者对其编程智能体得分印象深刻。

基础设施团队对其100万token上下文和低激活参数数量感兴趣。

AI平台正在提供免费使用和激进折扣。

社交媒体上充斥着原型产品的截图,据报道其推理账单以美分而非美元计算。

源文章中最广泛分享的示例包括:

  • 据报道,一个小型3D太空射击游戏原型的生成成本约为人民币0.07元。
  • 据报道,一个反恐精英风格原型的生成成本约为人民币0.50元。
  • 一个个人使用仪表盘显示8700万token仅花费人民币31.57元。
  • OpenCode报告称8月1日处理了8万亿个DeepSeek Flash token。
  • Cline在发现该模型的补贴成本低于预期后增加了免费额度。
  • Nous Portal暂时对V4 Flash 0731提供90%折扣。

这些示例激发了热情,但也可能模糊了几个不同方面:

  1. DeepSeek官方API价格。
  2. 缓存命中与缓存未命中定价。
  3. 免费或受补贴的第三方访问。
  4. 智能体进行的工具调用次数。
  5. 生成的输出和隐藏推理量。
  6. 仅模型成本与完整产品成本之间的区别。

该模型确实非常便宜。

但这并不意味着每个应用都只需七分钱。

有意义的问题不在于某个爆款演示能否被精确复现,而在于DeepSeek如何在不改变基础架构的情况下实现了如此巨大的能力飞跃——以及新的经济模式对开发者意味着什么。

全球折扣循环

在第三方促销活动之前,官方API价格已经很低。

DeepSeek目前公布的每百万token价格如下:

使用类型 DeepSeek V4 Flash价格
输入,缓存命中 $0.0028
输入,缓存未命中 $0.14
输出 $0.28

该API支持:

  • 100万token上下文窗口。
  • 最多384K输出token。
  • 思考和非思考模式。
  • 0731模型卡中三个推理努力级别:lowhighmax
  • 工具调用。
  • JSON输出。
  • 测试版聊天前缀补全。
  • 非思考模式下的FIM补全。
  • 兼容OpenAI的Chat Completions。
  • Responses API。
  • 兼容Anthropic的接口。
  • V4 Flash每个账户公布的并发限制为2,500。

这些官方价格是基准线。

平台随后可以选择:

  • 原价转售。
  • 加价。
  • 补贴使用量。
  • 提供有限免费模型。
  • 将模型捆绑到订阅中。
  • 提供促销积分。
  • 通过其他推理提供商路由流量。

这就是为什么一位开发者可能支付DeepSeek的标价,而另一位开发者可在限期内免费使用。

OpenCode报告单日处理8万亿token

OpenCode公开表示,8月1日通过其平台处理了8万亿个DeepSeek Flash token

该帖子将数据分解为:

5万亿token免费使用
+
3万亿token通过OpenCode Go

OpenCode在8月3日的推文中显示

DeepSeek Flash 于 8 月 1 日处理了 8 万亿个令牌——其中 5 万亿为免费,3 万亿通过 OpenCode Go 完成。该推文是对这些数字的官方声明,分解了免费与付费使用情况,并提供了有关 DeepSeek Flash 令牌处理量的支持背景。

OpenCode 当前的 Zen 文档中列出了一个限时提供的 DeepSeek V4 Flash 免费 选项。

这是一个重要的区别。

8 万亿令牌这一数字描述的是通过 OpenCode 的流量,而非 DeepSeek 在各平台直接上报的使用量。

这仍然是一个强烈的信号,表明低成本模型在被置于流行的编码代理工作流中时,能够产生巨大的需求。

Nous Portal 临时降价 90%

Nous Research 宣布了一项为期七天的促销活动,通过 Nous Portal 与 Novita Labs 合作,以 90% 的折扣提供 DeepSeek V4 Flash 0731。

该促销帖将折扣后的成本与 Claude Fable 5 进行了比较,并声称在类似任务上价格差异超过 1000 倍。

该比较取决于几个选择:

  • 使用哪家提供商的价格。
  • 输入或输出哪个占主导。
  • 是否提供缓存。
  • 选择哪种推理设置。
  • 每个模型完成任务需要多少令牌。
  • 哪个基准或工作流定义了“可比较”。

按令牌价格进行比较是有用的,但更有意义的指标是:

每个验收任务的总成本

一个使用更少昂贵令牌的模型,可能比一个反复重试的低价模型更便宜。

相反,当一个低价模型也足够有能力快速完成任务时,成本优势可能会变得巨大。

Cline 免费配额提高两倍

Cline 最初宣布通过其编码代理免费提供 V4 Flash 0731 的使用。

随后的一篇公开帖子表示,免费配额已提高两倍,因为其经济效益似乎是可持续的。

Cline 当前的模型目录和 ClinePass 材料将 DeepSeek V4 Flash 列为面向专注编码任务的快速、高性价比选项。

免费配额和模型可用性可能会发生变化,因此用户应查看提供商的实时页面,而不是依赖旧截图。

更广泛的教训更具持久性。

当推理变得足够便宜时,代理平台可以利用免费访问作为客户获取手段,而无需承担

使用高端前沿模型时会面临的相同成本。

社区成本截图需要背景信息

源文章包含一个仪表盘,显示:

  • 支出 31.57 元人民币。
  • 2,282 次 API 请求。
  • 87,027,995 个令牌。

![图片显示 Claude Code 的支出金额、API 请求次数和令牌数据。支出为 ¥31.57 元人民币,API 请求为 2,282 次,令牌为 87,027,995 个。下方的图表显示了从 7 月 6 日到 8 月 4 日的每日支出,其中 7 月 28 日出现显著峰值。此图片与文档中“社区成本截图需要背景信息”部分相关,展示了在有利使用模式下开发者可能看到的数量级,但由于许多缺失变量,不足以精确重建账单。](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/9546d65a-b139-4275-b6cf-1c92c3aa7f62-87126c8c-bdd9-4ac6-99e9-2ff9847eaaac.

png)

这个截图很有用,因为它展示了开发者在有利的使用模式下可能看到的数量级。

它不足以让我们精确重建账单。

缺失的变量包括:

  • 输入与输出 token 的比例。
  • 缓存命中百分比。
  • 每天使用的模型版本。
  • 推理投入程度。
  • 工具调用次数。
  • 失败的请求。
  • 促销积分。
  • 服务商折扣。
  • 是否所有 token 都按同一费率计费。

重复使用的长系统提示词在命中缓存时会非常便宜。

一次性的长独特提示词按缓存未命中的输入价格计费。

输出也比缓存输入贵得多。

对于智能体系统,这些差异主导了最终账单。

Flash Blitz:7月31日的变化

DeepSeek V4 Preview 于 2026 年 4 月 24 日发布。

该系列包含:

  • DeepSeek V4 Pro。
  • DeepSeek V4 Flash。

Preview 版本确立了主要架构:

  • 稀疏混合专家(Sparse Mixture of Experts)。
  • 100 万 token 上下文。
  • 高效的长上下文注意力机制。
  • 相对于总容量,激活参数数量较低。
  • 思考与非思考模式。
  • 开源权重,采用 MIT 许可证。

V4 Flash Preview 被定位为 V4 Pro 的更小、更快、更便宜的替代品。

7月31日的更新改变了它的竞争地位。

DeepSeek 表示 V4 Flash 0731 使用与 V4 Flash Preview 相同的模型架构和规模

此次更新是通过运行新的后训练流程实现的。

简化形式如下:

相同的预训练基座架构
+
新的后训练和智能体优化
=
更强的编码智能体行为

这一点很重要,因为它展示了一个预训练模型中可以潜藏着多大的能力。

架构和参数量并不是产品的全部。

后训练决定了模型如何有效地:

  • 使用工具。
  • 规划多步骤工作。
  • 处理终端反馈。
  • 从错误中恢复。
  • 编写和编辑文件。
  • 遵循智能体协议。
  • 分配推理投入。
  • 在运行框架内工作。

基础架构与检查点详情

最初的 V4 Flash 模型卡对基础模型的描述如下:

规格 DeepSeek V4 Flash
基础 MoE 总参数 284B
激活参数 13B
上下文长度 1M
许可证 MIT
主要模态 文本
基础精度 FP8 / 混合低精度(视检查点而定)

0731 模型卡显示,新版本与 DSpark 变体结构相同,并附带一个投机解码(speculative-decoding)模块。

这解释了为什么某些模型文件的元数据可能显示

与 284B 基础 MoE 的数字相比,检查点总数现在更大了。

最简洁的说法是:

V4 Flash 底层的 MoE 模型仍然约为 284B 总参数、13B 激活参数,而 0731 版本在发布的检查点中增加了 DSpark 投机解码组件。

DSpark 投机解码

投机解码使用一个快速的草稿模型来提出若干个未来 token。

主模型随后验证这些提议。

当预测被接受时,系统可以用更少的顺序计算生成多个 token。

DeepSeek 的 0731 模型卡声称

为vLLM和SGLang提供了明确的DSpark支持。

对于vLLM,相关配置如下:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

对于SGLang,模型卡片使用:

--speculative-algorithm DSPARK

DSpark本身并不会提升模型的推理能力。

它是一种推理优化手段,旨在降低解码延迟或提高吞吐量,同时保持目标模型在支持的配置下的输出分布。

基准测试跃升

DeepSeek发布了以下V4 Flash 0731的对比数据:

基准测试 V4 Flash 0731 V4 Flash预览版 V4 Pro预览版
Terminal Bench 2.1 82.7 61.8 72.1
NL2Repo 54.2 39.4 38.5
CyberGym 76.7 38.7 52.7
DeepSWE 54.4 7.3 12.8
Toolathlon-Verified 70.3 49.7 55.9
Agents' Last Exam 25.2 15.8 16.5
AutomationBench Public 25.1 10.8 12.8
DSBench-FullStack 68.7 37.0 41.8
DSBench-Hard 59.6 25.8 31.1

增幅最大的是DeepSWE:

7.3 → 54.4

CyberGym几乎翻倍:

38.7 → 76.7

Terminal Bench 2.1提升了二十多个百分点:

61.8 → 82.7

新的Flash模型在DeepSeek发布的数据表中所有基准测试上也均超越了V4 Pro预览版。

对于一个最初主要定位为更便宜、更快的选择的模型来说,这是一个重大变化。

基准测试方法论很重要

该表格不应被理解为原始检查点的纯粹对比。

DeepSeek的模型卡片包含了几项重要说明。

对于公开的代码智能体任务,该公司使用了:

DeepSeek Harness最小模式
推理强度:最大
温度:1.0
Top-p:0.95

在验证时,DeepSeek Harness尚未公开发布。

这意味着外部研究人员可能还无法复现已发布的代码智能体结果所使用的确切软件环境。

其中两项测试也是内部的:

  • DSBench-FullStack。
  • DSBench-Hard。

内部基准测试对产品开发可能有帮助,但独立团队无法检查其隐藏任务或污染控制措施。

正确的解读是:

DeepSeek报告了在其选定的智能体堆栈和评估设置下的大幅改进。当Harness、提示词、日志和完整的评估配置可用时,公开可复现性将得到改善。

Harness质量可能影响得分

编码基准测试通常衡量的是一个完整系统:

模型
+
系统提示词
+
仓库工具
+
终端

执行
+
上下文管理
+
重试策略
+
测试反馈
+
补丁提交逻辑

当任何一个组件发生变化时,同一模型可能会得到不同的分数。

更好的Harness可能能够:

  • 选择更相关的文件。
  • 保留有用的终端输出。
  • 防止上下文溢出。
  • 智能地重试失败的命令。
  • 停止无效循环。
  • 更可靠地应用补丁。
  • 为模型提供更清晰的测试结果。

这并不会使模型变得无关紧要。

这意味着基准测试结果属于模型与Harness的组合。

0731版本的强劲数据表明DeepSeek在两方面都有所提升

模型的主体行为及其周围的评估过程。

Artificial Analysis 评分为 50

Artificial Analysis 报告称,DeepSeek V4 Flash 0731 的智能指数得分约为 50,比之前的 Flash 版本高出约十分。

这家独立的模型分析公司还指出,与其他知名前沿系统相比,V4 Flash 的价格异常低廉。

路透社在总结 Artificial Analysis 的调查结果时称,按照其方法测算,平均基准测试成本约为 3 美分。

这一比较支持了其性价比论点。

但这并不意味着每项生产任务都只需 3 美分。

Artificial Analysis 还报告了若干知识可靠性指标上的较弱表现。

其关于 V4 Flash 0731 的文章指出:

  • “全知准确率”仍维持在 37% 左右。
  • 幻觉率有所下降,但在该评估体系下仍高达约 84%。

这些数据是一个有用的提醒。

一个模型可以:

  • 在编程智能体方面表现极强。
  • 极为廉价。
  • 在综合指数上具有竞争力。
  • 但在某些开放式事实问题上仍然不可靠。

“最佳性价比”并不等于“最适合所有任务”。

官方 API 定价

DeepSeek 直接 API 的价格为:

计费类别 每 1M tokens 价格
缓存命中输入 $0.0028
缓存未命中输入 $0.14
输出 $0.28

缓存命中与缓存未命中之间的价格差距巨大:

$0.14 ÷ $0.0028 = 50

缓存输入比未缓存输入便宜五十倍。

对于长时间运行的智能体而言,提示结构即成本结构。

成本计算示例

假设一次请求使用:

100,000 个未缓存输入 tokens
20,000 个输出 tokens

直接模型成本为:

输入:
100,000 / 1,000,000 × $0.14
= $0.014

输出:
20,000 / 1,000,000 × $0.28
= $0.0056

总计:
$0.0196

这不到两美分。

现在假设同样的 100,000 token 前缀已被缓存:

缓存命中输入:
100,000 / 1,000,000 × $0.0028
= $0.00028

输出:
20,000 / 1,000,000 × $0.28
= $0.0056

总计:
$0.00588

此时输出费用成为账单的主要部分。

这些示例解释了为什么低成本的编码原型是可行的。

它们并不包含:

  • 服务商加价。
  • 工具 API 费用。
  • 浏览器或搜索成本。
  • 沙箱计算资源。
  • 存储。
  • 反复失败的尝试。
  • 人工开发时间。

为什么智能体账单仍可能增长

智能体编码很少只涉及一次请求。

一个典型的工作流程可能包括:

  1. 读取代码仓库。
  2. 搜索相关代码。
  3. 规划变更方案。
  4. 编辑多个文件。
  5. 运行测试。
  6. 检查失败原因。
  7. 再次编辑。
  8. 再次运行测试。
  9. 审查差异。
  10. 生成最终答案。

每一步都可能产生一次新的模型调用。

在以下情况下,看似很小的任务也可能变得昂贵:

  • 仓库上下文反复未命中缓存。
  • 模型生成很长的推理过程。
  • 测试多次失败。
  • 智能体不必要地读取大文件。
  • 多个并行智能体重复工作。
  • 上下文压缩导致重要信息被重新发送。
  • 模型在已达良好解决方案后仍不停止。

V4 Flash 降低了这些失误的成本。

但并未消除它们。

上下文缓存是主要的成本杠杆

DeepSeek 使用基于磁盘的上下文缓存。

当相同的前缀被复用时,匹配的输入令牌可以获得更低的缓存命中价格。

适合作为稳定前缀的候选内容包括:

  • 系统指令。
  • 仓库策略。
  • 工具定义。
  • 长参考文档。
  • 未变更的项目快照。
  • 重复的企业上下文。

一个简化的提示词设计是:

稳定的可复用前缀
+
新的用户请求
+
最新的工具结果

一个不太利于缓存的设计是:

重排的指令
+
重写的仓库摘要
+
变化的时间戳
+
随机请求元数据
+
新的用户请求

细微的前缀变化可能会降低缓存复用率。

开发者应检查令牌使用字段,而不是假设长提示词已被缓存。

DeepSeek 还提供 user_id 隔离功能,用于隐私保护和调度。缓存复用和用户隔离应一起设计,以避免一个客户的上下文被意外混入另一个客户的上下文中。

API 快速入门

官方基础 URL 为:

https://api.deepseek.com

模型 ID 为:

deepseek-v4-flash

DeepSeek 表示,稳定的 API ID 会自动提供最新的官方 Flash 版本。

这很方便,但生产团队应记录返回的模型指纹并测试变更,因为稳定 ID 背后的行为可能会被升级。

Python 示例

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Review this function and propose a safe refactor.",
        }
    ],
)

print(response.choices[0].message.content)

cURL 示例

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "user",
        "content": "Write a small Python CLI that validates JSON files."
      }
    ]
  }'

开发者应查看实时 API 参考文档,以确认其端点和 SDK 版本支持的确切推理强度(reasoning-effort)和思考模式(thinking-mode)字段。

必须保留思维历史

DeepSeek 的思考模式文档指出,当一个轮次包含工具调用时,助手消息中的 reasoning_content 必须在后续请求中传回。

多轮代理应保留:

  • content
  • reasoning_content
  • tool_calls

丢弃推理状态可能会降低连续性或导致请求验证问题。

这在通过通常忽略提供商特定推理字段的 OpenAI 兼容客户端进行集成时尤为重要。

OpenAI、Anthropic 和 Responses 兼容性

DeepSeek 提供多种接口。

OpenAI Chat Completions

使用标准的 DeepSeek 基础 URL 和模型 ID:

deepseek-v4-flash

Anthropic 兼容 API

DeepSeek 还记录了 Anthropic 格式的接口。

这有助于构建在

围绕Claude风格的消息连接到DeepSeek,可以减少应用程序改动。

兼容性并不保证行为完全一致。

提供商特定字段、推理历史、工具架构、安全行为和错误处理仍需要测试。

Responses API

DeepSeek表示,0731版本原生支持Responses API格式,并已适配为Codex风格的使用方式。

这对编码代理产品很重要,因为这些产品越来越依赖有状态的响应对象、工具调用和结构化的代理循环。

采用MIT许可证的开放权重

DeepSeek已在Hugging Face上以MIT许可证发布了V4 Flash 0731权重。

这允许开发者在遵守许可证条款的前提下检查、修改、部署和重新分发该模型。

相比仅提供API的模型,开放权重发布提供了更多控制权。

团队可以:

  • 在私有基础设施上运行模型。
  • 研究其架构。
  • 构建量化变体。
  • 适配推理内核。
  • 微调或定制化模型。
  • 将其集成到内部系统中。
  • 避免将敏感代码发送到第三方API。

实际障碍在于硬件。

“开放权重”并不意味着“可以在普通笔记本电脑上运行”。

vLLM部署

官方0731模型卡提供了单个4×GB300节点的vLLM示例:

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code \
  --kv-cache-dtype fp8 \
  --block-size 256 \
  --data-parallel-size 4 \
  --enable-expert-parallel \
  --moe-backend deep_gemm_mega_moe \
  --attention-config '{"use_fp4_indexer_cache": true}' \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

该示例展示了全质量服务所预期的基础设施级别。

不应将其解读为唯一受支持的配置。

vLLM配方未来可能会增加对其他GPU拓扑的支持。

SGLang部署

官方SGLang示例为:

sglang serve \
  --trust-remote-code \
  --model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
  --tp 4 \
  --moe-runner-backend flashinfer_mxfp4 \
  --speculative-algorithm DSPARK \
  --mem-fraction-static 0.90 \
  --chunked-prefill-size 4096 \
  --swa-full-tokens-ratio 0.1

目标权重和草稿权重来自同一检查点,因此文档说明无需单独设置推测性草稿模型路径。

推理引擎发展迅速。

请使用当前的模型卡和服务引擎配方,而不要从Preview版本复制旧的启动命令。

本地部署仍然是一个基础设施项目

尽管仅约

对于任意给定token,13B参数为激活状态,这意味着完整模型权重在整个服务系统中必须始终保持可用。

部署规划必须考虑:

  • 模型总存储量。
  • GPU内存。
  • 专家并行。
  • 互连带宽。
  • 长上下文KV缓存。
  • 量化支持。
  • DSpark内核。
  • 批处理大小。
  • 并发性。
  • 预填充延迟。
  • 解码吞吐量。

较小的量化可能支持在不同硬件上进行实验,但可能会改变质量、速度或受支持的上下文长度。

对于大多数个人开发者来说,使用直接API或

托管服务提供商会比自托管更简便、更具成本效益。

官方 API 与第三方提供商的比较

使用 V4 Flash 有三种常见方式。

路线 主要优势 主要权衡
DeepSeek API 官方定价和当前官方模型 数据离开你的环境;稳定 ID 可能会更新
第三方平台 免费额度、集成智能体、更简便的计费 促销活动和路由可能会发生变化
自托管权重 最大程度地控制和保护隐私 需要大量硬件和工程资源

最具成本效益的路线取决于你的工作负载。

免费的 Cline 或 OpenCode 额度可能非常适合实验。

直接 API 可能最适合可预测的小规模使用。

只有当使用量足够大且持续稳定,或隐私要求优先时,自托管才可能具有吸引力。

原型开发的最佳时代

源文章将廉价 AI 比作汽车的大规模生产。

这个类比并不完美,但很有用。

当一项技术的成本大幅下降时,市场不会简单地用更少的钱购买相同数量的产品。

新的用例会变得可能。

低成本的智能体模型可以支持那些以前在测试前就会被否决的实验。

例如:

  • 学生构建第一个软件原型。
  • 独立创始人生成并测试多个落地页创意。
  • 小团队对每次拉取请求进行代码审查。
  • 开源项目提供免费的问题分类服务。
  • 研究人员处理大型代码或文档集。
  • 公司为重复性工作创建内部智能体。
  • 游戏开发者测试生成的机制和关卡。

其价值不在于模型取代了所有软件工程。

而在于它降低了提出以下问题的成本:

这个想法值得进一步构建吗?

原型不是产品

廉价的生成可以产出令人信服的首次演示。

但生产级产品仍然需要:

  • 产品设计。
  • 安全性。
  • 测试。
  • 可访问性。
  • 性能。
  • 监控。
  • 部署。
  • 数据保护。
  • 法律审查。
  • 维护。
  • 客户支持。

七美分的模型账单并不意味着七美分的业务。

它意味着第一次计算实验的代价可能足够低,值得尝试。

这改变了谁可以参与,以及可以测试多少想法。

一个社区构建的工作区示例

源文章包含一个轻量级文档工作区,作为开发者使用廉价编码智能体所构建内容的一个示例展示。

![该图片展示了一个文档工作区界面。左侧是带有“所有文档”、“文件”和“任务中心”等选项的导航栏。右上方显示“上下文工作区”,下方设有“任务中心”、“任务列表”和“任务详情”等分区。中间部分显示“硅谷101-GPU”、“RonnieChatterji-AI智能体化”、“RadiArk-

”GPU利用优化”及其他文档标题和部分内容。底部有一个“本地文件账户”选项。该图片与文档中介绍的文档工作台相关,直观地呈现了工作台的界面布局及部分文档内容。

信息。](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/ea723a10-dc29-41c2-9668-b104bd715b44-5355bdda-f7e2-4763-919d-43a90bf112fd.png)

截图无法证明应用程序中有多少部分是由模型生成的,需要多少人工编辑,或者产品是否安全且可维护。

它确实展示了低成本编码模型使原型制作变得更加容易的项目类型。

V4 Flash 最适合的场景

V4 Flash 0731 在以下情况下特别有吸引力:

  • 任务以代码或工具为主。
  • 成本因素非常重要。
  • 大型上下文很有用。
  • 预期请求量很高。
  • 工作流可以验证输出。
  • 偶尔重试是可以接受的。
  • 有更大的备用模型可用于处理困难情况。

在以下情况下可能不太适合:

  • 开放世界的事实准确性至关重要。
  • 精心打磨的首次回答比成本更重要。
  • 任务需要图像理解能力。
  • 组织无法验证生成的代码。
  • 需要托管合规保证。
  • 工作流依赖稳定、版本固定的 API 行为。

模型路由器可以将 Flash 与更强大或更专业的系统结合使用。

例如:

日常仓库编辑
→ V4 Flash

高风险架构或安全决策
→ 更强大的模型 + 人工审核

廉价模型改变智能体架构

当模型调用成本高昂时,开发人员会尽量最小化每个请求。

当调用变得廉价时,智能体可以承担以下任务:

  • 让另一个模型审查补丁。
  • 运行单独的测试分析流程。
  • 生成多个候选解决方案。
  • 比较不同的实现方案。
  • 使用一个模型进行规划,另一个模型执行。
  • 提交前重新检查自己的工作。

这可以提高可靠性。

但也可能浪费令牌。

正确的目标不是最小化令牌使用量。

而是:

达到所需质量的最低总成本

价格故事背后的主要风险

1. 公开测试版可能发生变化

DeepSeek 将官方 Flash API 描述为公开测试版。

定价、行为、限制和模型版本可能会发生变化。

生产团队应维护回归测试。

2. 基准分数取决于 DeepSeek 评估框架

最强的代码智能体结果使用了未发布的评估框架配置。

目前还无法直接进行精确的独立复现。

3. 廉价输入并不能保证廉价的智能体

输出、重试、工具和未缓存的上下文可能主导最终成本。

4. 长上下文并非免费

100 万令牌窗口是容量限制,而非建议在每个请求中发送一百万个令牌。

大型预填充工作负载会增加延迟和成本。

5. 开放世界的可靠性仍需改进

独立评估表明,价值和编码能力可能与事实测试中的高幻觉率并存。

关键事实应对照来源进行核实。

6. 生成的代码需要审核

低成本模型生成的代码可能超出团队安全审查的能力范围。

自动化测试、静态分析、依赖扫描和人工审核仍然是必要的。

7. 促销访问是临时的

第三方免费模型和折扣可能会消失。

不要基于

围绕七天或限时补贴的永久商业模式。

8. 稳定的 API ID 可能隐藏升级

deepseek-v4-flash 模型 ID 指向当前版本。

该 ID 背后的升级可能会在您的应用程序无需修改代码的情况下改变输出结果。

实用成本控制清单

1. 稳定可复用的前缀

保持系统指令和工具定义的一致性,以提高缓存复用率。

2. 单独跟踪缓存命中令牌

不要只依赖总输入令牌数。

3. 限制不必要的输出

为任务设定切合实际的输出预算。

4. 日常工作中使用较低推理强度

max 保留给需要更长时间推理的任务。

5. 限制智能体步骤

停止无法取得进展的循环。

6. 在再次调用模型前执行低成本验证

使用代码检查工具、测试、模式验证器和确定性检查。

7. 对困难案例进行路由

仅在任务未通过测试或超过风险阈值时才进行升级。

8. 衡量每个被接受结果的实际成本

包括失败的尝试和人工审查。

还有一件事:DeepSeek Harness

原文以 DeepSeek 开发者生态系统中可能的下一步发展作为结尾。

Tianyi Cui——在源文中被确认为 DeepSeek Harness 的负责人——发布了一则面向开源智能体框架项目开发者的招聘信息。

该信息邀请有兴趣的开发者分享 GitHub 账号和具有代表性的开源作品,以参与内部测试。

图片是 Tianyi Cui 的 Twitter 帖子,邀请对 Agent Harness 相关开源项目感兴趣的开发者参与 DeepSeek Harness 内部测试。有兴趣者可回复或私信,并需附上 GitHub ID 和具有代表性的开源作品。帖子最后编辑于 2026 年 8 月 1 日晚 7:46,有 1K 条评论、496 次转帖、2.9K 个赞、1.8K 次收藏和 879.7K 次浏览。此帖与文档中提到的 DeepSeek Harness 开发者内部测试邀请相关,是 Tianyi Cui 发布的邀请开发者加入内部测试的招聘信息。

DeepSeek 自己在 7 月 31 日的更新日志中也提到,用于基准评估的 DeepSeek Harness 极简模式“即将发布”。

截至核验时,我未能找到:

  • 公开的官方 DeepSeek Harness 仓库。
  • “DeepSeek Code”的稳定产品页面。
  • 公开的安装说明。
  • 定价信息。
  • 发布日期。
  • 完整的功能规格说明。

现有证据支持以下更窄范围的结论:

DeepSeek 正在测试一个智能体框架,并打算至少发布该框架的一部分,但最终产品名称、公开范围和发布时间仍未确认。

模型、API 和开放权重现已可用。

该框架仍是未来的生态组件。

为什么 DeepSeek Harness 可能很重要

第一方框架可能有助于 DeepSeek 控制完整的编码智能体技术栈。

它可能提供:

  • 原生推理历史处理。
  • 特定模型的提示词格式。
  • 工具调用解析。

上下文管理。

  • 仓库搜索。
  • 终端执行。
  • 基准测试可复现性。
  • Responses API 集成。
  • 兼容 Codex 的工作流。
  • 成本控制。
  • Flash 与 Pro 之间的自动路由。

DeepSeek 已经记录了与外部测试框架和编程代理的集成。

第一方工具可以将针对基准测试的优化转化为普通开发者可以使用的产品。

它还可以揭示 V4 Flash 0731 基准测试提升中有多少来自检查点,多少来自代理运行时。

接下来值得关注的内容

几项进展将决定 V4 Flash 时刻是否会成为持久的生态系统转变。

官方 V4 Pro 发布

DeepSeek 表示,官方 V4 Pro 版本将紧随 Flash 更新之后发布。

Pro 与 Flash 之间的性能和定价差距将影响路由决策。

DeepSeek Harness 的可用性

公开发布将提高基准测试的可复现性,并为开发者提供模型原生的代理框架。

价格稳定性

直接价格已经很低,但第三方促销可能不会持续。

服务商容量

廉价推理会吸引极高的流量。

随着使用规模扩大,延迟、速率限制和可靠性将变得至关重要。

开源推理支持

vLLM、SGLang、硬件供应商和量化项目将决定自托管变得多容易实现。

独立评估

更多公开评估应测试:

  • 编码能力。
  • 安全性。
  • 事实可靠性。
  • 长上下文。
  • 工具使用。
  • 每项成功任务的成本。
  • 在不同测试框架下的表现。

常见问题

什么是 DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 是 V4 Flash 的官方 7 月 31 日版本,目前通过 deepseek-v4-flash API 以公开测试版形式提供服务。DeepSeek 表示,它保留了 Preview 模型的基础架构和规模,同时通过新的后训练显著提升了代理能力。

DeepSeek V4 Flash 的价格是多少?

DeepSeek 官方 API 的定价为:每百万缓存未命中输入 token 0.14 美元,每百万缓存命中输入 token 0.0028 美元,每百万输出 token 0.28 美元。第三方平台可能提供不同的价格、免费配额或临时折扣。

生成一个 3D 游戏真的只需要 0.07 元人民币吗?

来源文章引用了社区示例中报告的模型成本。该示例没有附带完整的提示词、token 日志、缓存数据、重试次数、工具成本或人工工作记录,因此应将其视为轶事而非保证预算。

V4 Flash 0731 的主要基准测试分数是多少?

DeepSeek 报告 Terminal Bench 2.1 得分 82.7,CyberGym 得分 76.7,DeepSWE 得分 54.4,Toolathlon-Verified 得分 70.3,NL2Repo 得分 54.2。公开的代码代理评估使用了未发布的 DeepSeek Harness 极简模式,并采用最大推理努力。

DeepSeek V4 Flash 0731 是开源的吗?

模型权重和仓库根据 MIT 许可证发布,因此“开放权重”和“广泛许可使用”是准确的描述。运行完整检查点仍然需要大量多 GPU 基础设施。

DeepSeek V4 Flash 可以在本地运行吗?

可以,DeepSeek 发布了权重和部署说明。

用于 vLLM 和 SGLang。官方完整示例使用先进的多 GPU 硬件,因此普通笔记本电脑并非完整模型的目标运行环境。

什么是上下文窗口?

官方 API 和模型卡指定的上下文窗口为 100 万 token。API 还列出了最大输出长度为 384K token,但使用最大上下文或最大输出会显著增加延迟和资源消耗。

DeepSeek Code 或 DeepSeek Harness 是否已发布?

DeepSeek 已公开提及 Harness 最小模式,并招募了开源 harness 开发者进行内部测试。验证过程中未找到完整的公共代码仓库、最终产品规格以及确认的发布日期。

相关工具

  • DeepSeek API:官方平台,提供 API 密钥、计费以及直接访问 DeepSeek 模型。
  • DeepSeek V4 Flash 0731(Hugging Face):官方开放权重检查点、模型卡、基准测试表、许可证和部署说明。
  • vLLM:开源高吞吐量服务引擎,支持 DeepSeek V4 和 DSpark。
  • SGLang:开源服务框架,已发布 V4 Flash 0731 部署路径。
  • OpenCode:开源编码代理,其 Zen 服务目前提供限时免费的 V4 Flash 选项。
  • Cline:开源编码代理和模型平台,通过其提供商生态提供 DeepSeek V4 Flash。
  • Nous Portal:多模型推理平台,曾开展限时 DeepSeek V4 Flash 推广活动。
  • Artificial Analysis:独立模型分析平台,涵盖智能水平、速度、价格和基准测试成本。

相关链接

评估](https://artificialanalysis.ai/articles/deepseek-v4-flash-0731-scores-50-on-the-artificial-analysis-intelligence-index-10-points-above-previous-deepseek-v4-flash):独立综合评分、价格、智能体评估与可靠性观察。

摘要

DeepSeek V4 Flash 0731 保留了预览版模型的基础

架构和规模保持不变,但新的后训练技术带来了编码智能体性能的重大飞跃。DeepSeek 报告在 Terminal Bench 2.1 上得分为 82.7,在 CyberGym 上为 76.7,在 DeepSWE 上为 54.4,不过最强劲的公开编码智能体结果依赖于尚未发布的 DeepSeek Harness 配置。

官方 API 定价异常低廉:每百万未缓存输入 token 0.14 美元,每百万缓存输入 token 0.0028 美元,每百万输出 token 0.28 美元。第三方免费额度和折扣可以使访问成本更低,但这些促销是临时性的,不应误认为是永久标价。

MIT 开放权重许可、100 万 token 上下文窗口、Responses 和 Anthropic 兼容 API,以及 vLLM 和 SGLang 的支持,使该模型在托管和自管部署路径上均易于使用。完整本地部署仍然是一项严肃的多 GPU 基础设施工程。

广为流传的七美分和五十美分原型是边际模型成本可以低至何种程度的有力例证,但它们并非完整的产品成本分析。智能体循环、输出长度、缓存未命中、工具、测试和人力成本仍然重要。

DeepSeek V4 Flash 0731 之所以重要,并非因为每项应用现在只需几美分,而是因为强大的智能体编码已变得足够实惠,让更多开发者能够以有意义的规模进行尝试。