DeepSeek V4 Flash 用 0.07 美元打造了一款 3D 射击游戏——这就是该模型如此便宜的原因

DeepSeek V4 Flash 0731 进入公开测试版,并带来一个熟悉的承诺:以极低的 API 价格提供更强大的编码和智能体能力。开发者们很快就把这个说法付诸实践。

发布于 2026年8月5日generalGEO 评分: 0
这张图是DeepSeek V4 Flash 0731的相关展示图,核心突出标注了“$0.07 Game Demo”的内容。图中还明确提及该产品相关的API定价、架构、基准测试三大核心板块,整体采用深蓝色科技风设计,搭配游戏手柄、数据图表、结构示意图等视觉元素,契合产品面向游戏场景的定位,直观呈现了该产品的基础信息框架,与文档介绍DeepSeek V4 Flash 0731的价格、相关内容板块的主题相呼应。

DeepSeek V4 Flash 仅花0.07美元就搭了个3D射击游戏——这模型为何如此便宜

引言

DeepSeek V4 Flash 0731进入公开测试版,带着一个熟悉的承诺:以极低的API价格提供更强的编码和智能体能力。

开发者们迅速将这一说法转化为实际实验。

流传最广的案例之一来自一次Hermes Agent运行,其中DeepSeek V4 Flash仅凭一个初始提示词就生成了一款可游玩的第一人称3D射击游戏。据报道,该项目耗时32分钟,模型使用成本仅为0.07美元

最终成果包括:

  • 第一人称移动。
  • 跳跃。
  • 射击。
  • 与环境的物理碰撞。
  • 掩体物体和目标。
  • 界面中的弹药计数器。

这是DeepSeek V4 Flash 0731生成的3D射击游戏Demo截图,对应文档中提及的用该模型在Hermes Agent中生成的可游玩3D射击游戏案例。截图来自名为Elshayib的账号发布的内容,该内容提及生成这款游戏仅耗时32分钟,花费0.07美元,还说明该模型成本低廉,2美元的使用成本就能支撑一整天的开发实验。游戏画面呈现了该Demo的第一人称视角场景,包含移动、射击等功能对应的游玩界面元素,还显示了弹药计数器相关内容,和文档中列出的游戏功能清单相呼应。

这一病毒式传播的结论很简单:按这个价格,两美元就能支撑一整天的实验。

这一说法不应被理解为普适的每日成本保证。智能体的花费取决于提示词长度、输出量、重试次数、工具调用、缓存命中率、框架开销以及任务的复杂度。

尽管如此,这个演示抓住了V4 Flash的核心吸引力:该模型足够便宜,开发者可以让智能体不断迭代,而不是把每一次尝试都当作昂贵的开销。

该模型官方的API定价有助于解释其中原因。

DeepSeek V4 Flash 0731现已成为官方Flash版本

DeepSeek于2026年7月31日将V4 Flash的生产版本发布至公开API测试版。

API模型名称保持不变:

deepseek-v4-flash

使用该模型的请求现在会访问DeepSeek-V4-Flash-0731

DeepSeek表示,0731版本取代了预览版模型,并大幅提升了智能体能力。

该更新具体适用于:

  • DeepSeek V4 Flash API。
  • 公开的V4 Flash模型权重。
  • Responses API兼容性。
  • 面向Codex的集成。

它并未同时替换:

  • DeepSeek V4 Pro API。
  • DeepSeek网页应用中使用的模型。
  • DeepSeek移动应用中使用的模型。

DeepSeek还表示,官方V4 Pro版本将另行发布。

官方API价格极低

DeepSeek目前列出的常规API价格为每百万tokens:

计费项目 DeepSeek V4 Flash
缓存命中的输入 0.0028美元
缓存未命中的输入 0.14美元
输出 0.28美元
上下文长度 100万tokens
最大输出 384,000 tokens
默认推理模式 Thinking
并发限制 2,500

缓存命中的价格尤为低廉。

以每百万缓存输入tokens 0.0028美元的价格,一个长期运行的智能体可以反复复用稳定的前缀——例如系统指令、工具架构或仓库上下文——而无需每次都以未缓存的完整价格支付。

DeepSeek还宣布了未来的峰谷时段定价。

定价政策。

当该政策生效后,在北京时间以下时段,所有标价将翻倍:

09:00–12:00
14:00–18:00

截至本文审阅定价页面时,DeepSeek尚未明确最终生效日期。

因此,应用方在依赖某个固定长期价格之前,应查看官方定价页面。

一分钱对一美元

原文通过一个小型太空射击项目,将DeepSeek V4 Flash与Claude Opus 5进行了对比。

据报道,两个版本均实现了:

  • 飞船移动。
  • 射击功能。
  • 可摧毁的小行星。
  • 可收集的道具。
  • 可玩的游戏循环。

差异出现在完成路径上。

根据开发者对比:

细节 DeepSeek V4 Flash Claude Opus 5
达到可接受结果前的尝试次数 3 1
大致代码量 900行 近3,000行
报告中的模型成本 $0.01 $1.00

Opus的结果一次通过即完成,而V4 Flash需要额外的迭代。

最终项目被描述为功能上足够相似,因此报告中的100倍成本差异成为讨论的焦点。

这并不是一次受控的模型基准测试。

该对比未发布完整的可复现性包,涵盖:

  • 相同的代理框架。
  • 完全一致的提示词和后续消息。
  • 工具调用日志。
  • 运行时限。
  • 令牌计算规则。
  • 模型算力设置。
  • 人工干预。
  • 是否提供了资源素材或样板代码。

因此,该结果应被视为一个有参考价值的开发者轶事,而非证明V4 Flash在同等工作中始终比Opus 5便宜整整100倍。

DeepSeek V4 Flash对比GPT-5.6 Sol

另一项对比要求DeepSeek V4 Flash和GPT-5.6 Sol构建一个小型3D河道导航游戏。

据报道,两者均产出了:

  • 完整的河道场景。
  • 左右移动功能。
  • 障碍物碰撞。
  • 得分追踪。
  • 树木和远景。
  • 相似的核心交互。

报告的成本为:

模型 报告成本
DeepSeek V4 Flash $0.05
GPT-5.6 Sol $2.47

这在该次具体运行中接近50倍的差异。

图片展示了一条推文,内容为“DeepSeek is ridiculously cheap. GPT-5.6 → $2.47 DeepSeek → $0.05 How DeepSeek pulls off this pricing is wild. 50x cheaper than GPT 5.6 with similar output. DeepSeek 的价格简直便宜得离谱。GPT-5.6 → 2.47 美元 DeepSeek → 0.05 美元 DeepSeek 的定价策略简直令人难以置信。它比 GPT 5.6 便宜 50 倍,输出结果却相差无几。”该推文由用户Dipankar发布,其头像显示为一位戴眼镜的男性。图片与上下文紧密相关,是对DeepSeek V4 Flash与GPT-5.6 Sol在游戏开发成本对比中,DeepSeek价格远低于GPT-5.6的说明,强调其定价策略令人惊讶。

视觉效果被描述为大体相似,尽管DeepSeek版本使用了规模较小的环境。

同样,该对比也属于轶事性质。

GPT-5.6 Sol和DeepSeek V4 Flash具有不同的默认推理行为、定价结构、上下文管理系统、代理框架和令牌计算规则。

一个公平的生产环境对比应衡量:

总任务成本
÷
成功且可接受结果的数量

最便宜的单个请求并不总是最便宜的完整项目。

一个需要大量重试、生成高维护性代码或需要大量人工审核的模型,可能会失去其最初的价格优势。

Token 数量对成本的影响可能大于视觉质量

文章还描述了一项测试,其中 GPT-5.6 Luna 和 DeepSeek V4 Flash 根据相同需求生成了一个 3D 宝可梦风格模型。

报告的视觉效果很难明确区分优劣,但输出 token 总量差异巨大:

模型 报告的输出量
GPT-5.6 Luna 超过 230 万个 token
DeepSeek V4 Flash 约 47.7 万个 token

来源报告的总任务成本差异接近 14 倍。

关键教训不在于某个模型总是恰好使用这么多 token。

而在于智能体经济性取决于的不仅仅是每百万 token 的标价。

总成本由以下因素决定:

  • 输出冗余度。
  • 重复的文件重写。
  • 工具调用记录。
  • 推理 token。
  • 失败尝试。
  • 上下文回放。
  • 缓存复用。
  • 生成的代码量。
  • 智能体框架行为。

一个模型的 token 单价可能相对较低,但如果它产生不必要的输出,仍然可能变得昂贵。

V4 Flash 的价值主张结合了较低的标价和在多个报告示例中相对紧凑的执行表现。

两个小时实验仅花费七美分

另一位开发者表示,他们花了将近两个小时做实验,只花了七美分。

图片是一条推文,发布者为@Samking207,发布日期为8月1日。推文内容为“Yea was playing with it today for almost 2 hrs and I only spent 7 cents, I’m like wtf 😳😂 是啊,今天玩了快两个小时了,才花了7美分,我都懵了 😳😂”。该推文以英文和中文双语形式呈现,表达了作者在使用DeepSeek V4 Flash模型时,花费7美分就玩了近2小时的惊讶之情。此推文与上下文紧密相关,直观展示了文档中提到的“几乎两个小时的实验仅花费7美分”的情况,用实例说明了低边际成本对开发者行为的影响。

这条评论说明了低边际成本如何改变用户行为。

当一次模型调用感觉昂贵时,开发者往往会:

  • 限制迭代次数。
  • 缩短提示词。
  • 避免探索性分支。
  • 在结果“足够好”时就停止。
  • 将智能体保留给高价值工作。

当成本以美分衡量时,开发者可以允许更多:

  • 试错。
  • 并行思路。
  • 自动化测试。
  • 修复尝试。
  • 长时间运行的后台任务。
  • 原本可能被跳过的小实验。

这并不意味着算力是免费的。

在企业规模下,几分之一美分乘以数百万次调用仍然会成为一笔可观的支出。

更有意义的变化在于,实验的门槛变得低得多。

为什么 DeepSeek V4 Flash 如此便宜?

文章将 V4 Flash 的低成本归因于多个架构和系统层面的选择。

主要因素包括:

  1. 稀疏混合专家(MoE)计算。
  2. 压缩的长上下文注意力机制。
  3. 低精度模型权重。
  4. 通过 DSpark 进行推测性解码。
  5. 无需再次完整预训练即可完成的训练后改进。
  6. 高并发 API 服务。

每个部分都降低了不同类别的成本。

一个仅激活 130 亿参数的 2840 亿参数模型

DeepSeek V4 的核心

Flash 模型采用混合专家(MoE)架构。

技术报告列出的信息如下:

架构细节 DeepSeek V4 Flash
核心模型参数 2840亿
每个Token激活的参数 130亿
上下文长度 100万Token
训练数据 超过32万亿Token
核心精度 FP4 + FP8 混合精度

尽管该模型存储了数千亿参数,但每个Token并不会全部经过这些参数。

路由机制会选取一小部分专家。

这减少了每个Token所需的活跃计算量,同时保留了对更大参数池的访问能力。

一个简化的对比方式如下:

稠密模型:
每个Token → 大部分或全部模型权重

MoE模型:
每个Token → 仅选定的专家

这就是大型MoE模型在服务成本上远低于参数量相近的稠密模型的原因之一。

为什么有些页面显示304B参数

完整的DeepSeek-V4-Flash-0731仓库的Hugging Face元数据目前显示约304B参数

这与技术报告中284B核心模型的数据并不矛盾。

0731版本附带了一个DSpark投机解码模块。仓库元数据可能将目标模型与附带的草稿组件一起统计。

在架构讨论方面,DeepSeek的技术报告仍是最清晰的来源:

  • 核心V4 Flash模型总参数为284B。
  • 每个Token激活参数为13B。
  • 0731版本中用于投机解码的额外DSpark权重。

图片为DeepSeek V4 Flash 0731的介绍内容。指出其是DeepSeek V4 Flash的正式发布版本,相较于预览版,显著增强了代理能力,结构与DeepSeek V4 Flash - DSpark相同,附带推测性解码模块。尽管激活参数数量远小于DeepSeek V4 Pro(预览版),但在基准测试中表现更优,且在广泛上与现有最强的专有模型竞争。该图片与上下文紧密相关,是对0731版本核心特性和性能优势的概述。

CSA和HCA降低长上下文成本

DeepSeek V4支持100万Token的上下文窗口。

传统的注意力系统在这样的规模下会变得极其昂贵,因为每个新Token可能需要检查大量的先前上下文并维护较大的KV缓存。

DeepSeek的技术报告描述了一种混合注意力设计,结合了:

  • 压缩稀疏注意力(CSA)
  • 重度压缩注意力(HCA)

总体策略是避免在每一步都对整个历史进行完整且昂贵的注意力计算。

系统会对上下文进行压缩和过滤,使模型能够将计算集中在最有用的信息上。

DeepSeek报告称,在100万Token的上下文环境中,V4 Pro需要:

  • DeepSeek V3.2单Token推理FLOPs的27%。
  • KV缓存容量的10%。

这些确切百分比是技术论文中针对V4 Pro报告的,并非Flash的单独审计数据。

V4 Flash使用相同的架构家族,因此受益于相同的长上下文设计原则。

实际效果包括降低了:

  • KV缓存内存。
  • GPU内存压力。
  • 数据移动量。
  • 每Token计算量。
  • 长上下文服务成本。

FP4和FP8减少存储

以及内存流量

发布的 V4 Flash 模型使用了混合低精度权重。

DeepSeek 列出:

FP4 + FP8 混合精度

较低的精度减少了推理过程中必须存储、从内存加载、在设备之间传输以及处理的数据量。

这一点很重要,因为现代语言模型推理往往受限于内存带宽,而不仅仅是原始算术运算能力。

如果硬件和内核设计为高效执行这种格式,较小的数据表示可以提升吞吐量。

低精度并非天然免费。

糟糕的量化会降低模型质量。

DeepSeek 的发布是围绕所选精度方案进行设计和训练的,而不仅仅是依赖事后社区量化。

预览版与 0731 之间的架构未变

DeepSeek 表示,官方 0731 版本保持了与 V4 Flash 预览版相同的模型架构和规模。

该公司没有为本次更新再次进行完整的预训练。

而是重做了后训练流程。

源文章将变化总结为:

  • 新的监督微调。
  • 新的 GRPO 强化学习。
  • DSpark 投机解码。
  • 更好的智能体行为。
  • 更高的服务吞吐量。

DeepSeek 的技术报告将更广泛的 V4 后训练过程描述为:

  1. 独立开发领域专家模块。
  2. 使用 GRPO 进行监督微调和强化学习。
  3. 在线策略蒸馏。
  4. 将专家能力整合到单一模型中。

0731 更新侧重于改善这些能力在实际智能体工作流中的表现。

DSpark 加速 Token 生成

DeepSeek-V4-Flash-0731 附带 DSpark 投机解码模块。

投机解码使用较小或更便宜的草稿路径来提出多个未来 token。

主模型批量验证这些提议。

简化流程如下:

草稿模块提出 token
→ 主模型同时验证
→ 接受的 token 被输出
→ 被拒绝的路径会被纠正

当草稿预测准确时,系统可以通过更少的主模型昂贵顺序推理生成多个被接受的 token。

DeepSeek 为 vLLM 和 SGLang 均提供 DSpark 支持。

对于 vLLM,官方模型卡使用:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

对于 SGLang,对应选项为:

--speculative-algorithm DSPARK

DeepSeek 表示,目标模型和草稿模型的权重存储在同一个检查点中,因此 SGLang 不需要单独的草稿模型路径。

投机解码主要提升服务速度和吞吐量。

它本身并不能解释模型的推理能力提升。

这些提升来自更新后的后训练流程。

官方发布提升了智能体基准测试成绩

DeepSeek 报告了与 V4 Flash 预览版相比,在多项智能体重点测试中的大幅提升。

基准测试 V4 Flash 0731 V4 Flash 预览版 V4 Pro 预览版
Terminal Bench 2.1 82.7 61.8 72.1
NL2Repo 54.2 39.4 38.5
CyberGym 76.7 38.7 52.7
DeepSWE 54.4 7.3

12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

图片展示了DeepSeek V4 Flash在多个基准测试中的表现,对比V4 Flash Preview和V4 Pro Preview。其中,Terminal Bench 2.1为82.7,NL2Repo为54.2,Cybergym为76.7,DeepSWE为54.4,Toolathlon verified为70.3,Agent Last Exam为25.2,Automation Bench (Public)为25.1,DSBench-FullStack为68.7,DSBench-Hard为59.6。该图片与上文提到的DeepSeek在多个测试中取得大进展相呼应,直观呈现了其性能提升情况。

DeepSeek表示,公开的代码智能体基准测试使用了以下配置运行:

DeepSeek Harness最小模式
reasoning_effort = max
top_p = 0.95
temperature = 1.0

截至官方更新时,该测试框架尚未公开发布。

DSBench-FullStack和DSBench-Hard是DeepSeek的内部基准测试。

这意味着它们的分数可以作为公司报告的参考证据,但不像完全公开的基准测试套件那样可以独立核查。

Terminal Bench和Toolathlon衡量什么

Terminal Bench 2.1

Terminal Bench评估智能体在终端环境中完成任务的能力。

模型可能需要检查文件、运行命令、安装依赖、调试故障、修改代码并验证完成情况。

高分反映了模型、智能体框架、工具策略、推理预算和运行时环境的综合表现。

Toolathlon-Verified

Toolathlon评估跨多个软件应用和工具的长周期任务。

该基准包括涉及日历、文件系统、Notion、WooCommerce、Kubernetes和BigQuery的场景。

任务需要多次工具交互,并通过基于执行的评估器进行验证。

DeepSeek报告的70.3分相比预览模型有了大幅提升。

但这不应被解读为对每项真实业务自动化都有70.3%的成功保证。

基准提升并不保证每个游戏都能一次提示成功

消息来源中的游戏示例揭示了基准性能与创意编码之间的重要差异。

V4 Flash在官方智能体评估中表现强劲,但一个游戏对比仍然需要三次迭代。

基准可以衡量在定义明确的任务集和已知评估规则下的成功率。

而创意项目可能包含模糊的视觉要求、浏览器兼容性问题、物理引擎错误、资源缺失、主观质量评判,并且没有单一测试套件可以定义成功。

在这种场景下,低成本模型尤其有用,因为工作流可以承受多次迭代。

它的价值不一定在于首次生成就完美无缺。

它可能是:

可接受的质量
×
大量可负担的尝试次数

V4 Flash支持多种API格式

DeepSeek通过以下方式开放模型:

  • 兼容OpenAI的Chat Completions接口。
  • 兼容OpenAI的Responses API。
  • 兼容Anthropic的API。
  • JSON输出。
  • 工具调用。
  • 聊天前缀补全。
  • 非思考模式下的中间填充补全。

兼容OpenAI的Base URL为:

https://api.deepseek.com

兼容 Anthropic 的基础 URL 为:

```Plaintext
https://api.deepseek.com/anthropic

DeepSeek 表示 V4 Flash 是目前唯一支持 Responses API 的 V4 API 模型。

V4 Pro 的支持将另行规划。

Responses API 的兼容性还允许该模型通过 DeepSeek 的文档化配置在 Codex 中使用。

思考模式默认启用

DeepSeek V4 Flash 支持思考模式和非思考模式。

思考模式为默认模式。

对于本地推理,官方模型卡支持三种推理努力级别:

low
high
max

DeepSeek 推荐:

temperature = 1.0
top_p = 0.95

用于智能体场景。

对于 high 和 max 推理努力级别,该公司建议允许最大输出长度达 384K tokens。

更高的推理设置可以改善困难任务的表现,但也可能增加延迟、输出量、API 成本和智能体循环的耗时。

生产系统应评估能够可靠满足任务需求的最低努力级别。

权重以 MIT 许可证发布

DeepSeek 在 Hugging Face 上以 MIT 许可证发布了 V4 Flash 0731 权重。

这使得该模型与许多大型商业发布相比具有异常宽松的许可。

开发者可以将官方模型仓库与受支持的引擎一起使用,包括:

  • vLLM。
  • SGLang。
  • Transformers。
  • Docker Model Runner。
  • 与 llama.cpp 兼容的量化版本。
  • 与 LM Studio 兼容的社区构建版本。

该模型规模较大。

核心模型拥有 284B 参数,0731 检查点中另有一个 DSpark 组件。

以可用速度运行它需要大量的内存和硬件资源。

权重可下载并不意味着完整模型能在普通的消费级笔记本电脑上流畅运行。

社区量化版本可以降低内存需求,但可能改变准确性、吞吐量、上下文容量、DSpark 行为和工具调用可靠性。

V4 Flash 是否总是最具性价比的选择?

消息来源总结认为,V4 Flash 并非在每次对比中都能产生最佳结果,但在性价比方面很难被击败。

这是对示例的合理总结,但有一个重要前提:

性价比取决于完整的 workflow。

V4 Flash 在以下情况下尤其具有吸引力:

  • 请求量高。
  • 错误容易检测。
  • 任务可以自动重试。
  • 上下文缓存效果好。
  • 人工审核成本低。
  • 紧凑的代码可以接受。
  • 应用可以使用开放权重模型。

而在以下情况下,更昂贵的 frontier 模型总体上可能仍然更经济:

  • 一次失败的结果会造成较大损失。
  • 首次通过的可靠性至关重要。
  • 任务需要更深层的知识。
  • 智能体无法安全重试。
  • 人工审核成本高。
  • 较小的模型会产生难以维护的输出。

正确的对比不是:

每 token 的价格

而是:

每个经过验证的成功任务的成本

如何为实际项目评估 V4 Flash

第 1 步:选择代表性任务

不要只测试精心打磨的演示。

使用与生产 workload 匹配的任务,包括困难和复杂的场景。

第 2 步:固定智能体环境

在不同模型之间保持提示词、工具、时间限制、重试策略、框架、沙箱、测试套件和推理设置的一致性。

第三步:记录完整成本

跟踪未命中缓存的输入、命中缓存的输入、输出令牌、工具调用、重试次数、运行时间、人工审核和失败尝试。

第四步:衡量可接受性,而非仅凭视觉相似度

对于代码,运行测试并检查可维护性。

对于游戏,检查控制、碰撞、性能和浏览器兼容性。

第五步:测试缓存行为

当稳定上下文在多个智能体步骤中被反复复用时,缓存命中价格极低的模型会变得更有价值。

第六步:比较首次通过和最终成功

一个经过三次廉价尝试才成功的模型,可能比一个以高价格一次成功的模型更具性价比。

当重试缓慢或存在风险时,情况也可能相反。

常见问题

什么是DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731是DeepSeek较小规模V4混合专家模型的官方后训练版本。它取代了预览版本,新增了DSpark投机解码模块,并重点聚焦于编码和工具使用型智能体任务。

DeepSeek V4 Flash API费用是多少?

DeepSeek目前公布的常规价格为:每百万个缓存命中输入令牌0.0028美元,每百万个缓存未命中输入令牌0.14美元,每百万个输出令牌0.28美元。该公司已宣布未来政策将在指定高峰时段将价格翻倍。

DeepSeek V4 Flash真的以0.07美元构建了一个3D游戏吗?

一位开发者报告称,Hermes Agent的一次运行在32分钟内以0.07美元的成本生成了一个可玩的第一人称射击游戏。这是一个社交媒体案例研究,而非标准化基准测试,因此其他任务的成本可能更高或更低。

DeepSeek V4 Flash有多少参数?

V4技术报告列出的核心Flash模型总参数为2840亿,每个令牌激活130亿参数。完整的0731版本仓库可能显示约3040亿参数,因为它包含了附带的DSpark投机解码组件。

为什么DeepSeek V4 Flash如此便宜?

其低成本源于稀疏混合专家激活、压缩长上下文注意力、FP4/FP8混合精度、提示缓存、投机解码和高并发服务。每个令牌仅激活总专家中的一小部分。

DeepSeek V4 Flash是否优于Claude Opus 5或GPT-5.6?

在当前的API定价下,它便宜得多,并在多个社区演示中表现出竞争力。Opus 5和GPT-5.6在某些任务上可能仍提供更强的首次通过可靠性或质量,而那些病毒式传播的比较并非受控基准测试。

DeepSeek V4 Flash可以本地运行吗?

可以。DeepSeek以MIT许可证发布权重,并提供vLLM和SGLang的使用指导。完整模型极其庞大,因此实际的本地部署需要大量的加速器内存或激进的社区量化方案。

V4 Flash是否支持Codex和Responses API?

支持。DeepSeek表示,官方Flash版本原生支持Responses API,并已适配用于Codex。当前的V4 Pro API尚不支持Responses API。

相关工具

deepseek.com/):DeepSeek V4 Flash 及其他受支持模型的官方托管端点。

  • DeepSeek V4 Flash 0731:官方模型仓库,包含权重、基准、许可证和部署指南。
  • vLLM:一个高吞吐量推理引擎,为 V4 Flash 和 DSpark 提供官方配方。
  • SGLang:一个 LLM 服务框架,内置 V4 Flash 和 DSpark 的文档化支持。
  • DeepSpec:DeepSeek 的投机解码研究和 DSpark 方法仓库。
  • Codex:一个智能编码环境,可通过 DeepSeek 的 Responses API 兼容接口连接 V4 Flash。

相关链接

摘要

DeepSeek V4 Flash 0731 引起了广泛关注,因为开发者报告称仅需几美分就能构建完整的交互式演示。据报道,一款第一人称射击游戏仅花费 0.07 美元,而其他社交媒体上的对比显示,任务成本比 Claude Opus 5 或 GPT-5.6 低数十倍。

这些示例并非受控基准测试,但官方 API 定价支持了其核心观点。V4 Flash 每百万未缓存输入令牌收费 0.14 美元,每百万输出令牌收费 0.28 美元,缓存命中率仅为 0.0028 美元,低得惊人。

其经济性源于整个系统:一个每次令牌激活 13B 参数的 284B MoE 核心、压缩的长上下文注意力、FP4/FP8 权重、百万令牌上下文窗口、高效的服务能力,以及 DSpark 投机解码。0731 更新保留了预览架构,并通过新的后训练改进了智能体行为。

最有力的官方证据是基准的提升。Terminal Bench 2.1 从 61.8 升至 82.7,Toolathlon-Verified 从 49.7 升至 70.3,同时模型保持了 Flash 定价层级。

V4 Flash 的优势不在于它在所有对比中胜出——而在于其极低的边际成本使得

以许多前沿定价模型难以实现的规模,反复进行代理式实验,这在实践中是可行的。