GPT-5.6 降价解析:Luna 降幅达 80%,Terra 下跌 20%,Sol 推出极速模式

OpenAI 下调 GPT-5.6 Luna 和 Terra 的价格,并为 Sol 增加 Fast mode。本文解释具体变化及其对高并发、日常推理和低延迟生产工作流的模型选择影响。

发布于 2026年8月3日generalGEO 评分: 0
图片为OpenAI GPT-5.6价格更新宣传图,背景为深色,带有云朵图案。图中显示Luna价格下降28%,Terra下降41%,Sol引入Fast模式,成本优化。下方有三条曲线,分别代表高成本低效率、低成本高效率及Luna价格曲线,Luna价格曲线有明显下降趋势。该图与文档中介绍GPT-5.6价格更新、Luna和Terra价格调整、Sol引入Fast模式等内容相契合,直观呈现了价格变化情况。

GPT-5.6 价格下调解读:Luna 降价 80%,Terra 降价 20%,Sol 新增快速模式

引言

OpenAI 在 GPT-5.6 系列正式发布不到一个月后,便调整了其定价体系。

自 2026 年 7 月 30 日起:

  • GPT-5.6 Luna 降价 80%。
  • GPT-5.6 Terra 降价 20%。
  • GPT-5.6 Sol 保持原有 Standard 价格,但新增了更快的 API 处理选项。
  • Priority Processing 已更名为 Fast mode。

此次更新并非仅限于临时折扣。OpenAI 表示,降价反映了模型本身、推理架构、路由系统、上下文管理以及连接模型与工具的智能体软件等多方面的改进。

实际结果是,生产环境中的选择范围更广了。

Luna 现在的定价适合高并发、成本敏感的智能体工作流。Terra 仍然是日常工作中需要更高智能时的均衡之选。Sol 继续服务于要求最高的任务,而 Fast mode 则在对延迟敏感、等待时间比 token 溢价更重要时提供更低延迟的选择。

2026 年 7 月 30 日的变化

GPT-5.6 于 7 月 9 日发布时,OpenAI 公布的 Standard 短上下文 API 价格如下:

模型 原输入价格 原输出价格
GPT-5.6 Sol $5.00 / 百万 token $30.00 / 百万 token
GPT-5.6 Terra $2.50 / 百万 token $15.00 / 百万 token
GPT-5.6 Luna $1.00 / 百万 token $6.00 / 百万 token

7 月 30 日的更新调整了 Terra 和 Luna 的价格:

模型 新输入价格 新输出价格 变化幅度
GPT-5.6 Sol $5.00 / 百万 token $30.00 / 百万 token 不变
GPT-5.6 Terra $2.00 / 百万 token $12.00 / 百万 token 降价 20%
GPT-5.6 Luna $0.20 / 百万 token $1.20 / 百万 token 降价 80%

Luna 的价格现已降至最初发布价格的五分之一。

Terra 的新价格为其原价的五分之四。

Sol 在 Standard 处理下保持不变,但 Fast mode 现在为开发者提供了一个选择:以两倍 Standard token 价格获得最高 2.5 倍的响应速度。

当前 Standard API 定价

表面上的输入和输出价格并未显示完整的计费结构。

GPT-5.6 支持缓存输入折扣和显式缓存写入。使用超过 272,000 个输入 token 的请求还可对整个请求享受长上下文定价。

短上下文 Standard 定价

以下费率按每百万 token 计算:

模型 输入 缓存输入 缓存写入 输出
GPT-5.6 Sol $5.00 $0.50 $6.25 $30.00
GPT-5.6 Terra $2.00 $0.20 $2.50 $12.00
GPT-5.6 Luna $0.20 $0.02 $0.25 $1.20

缓存读取相比普通未缓存输入可享受 90% 的折扣。

缓存写入按未缓存输入价格的 1.25 倍计费。

长上下文 Standard 定价

对于包含超过 272,000 个输入 token 的提示词,OpenAI 目前对完整请求收取以下费用:

模型 输入 缓存输入 缓存写入 输出
GPT-5.6 Sol $10.00 $1.00 $12.50 $45.00
GPT-5.6 Terra $4.00 $0.40 $5.00 $18.00
GPT-5.6 Luna $0.40 $0.04 $0.50 $1.80

长上下文规则意味着

成本估算应同时考虑令牌数量,以及请求是否跨越272,000令牌的门槛。

单个非常大的提示并非通过将前272,000个令牌按短上下文费率计费、其余部分按更高费率计费来处理的。长上下文倍率适用于整个请求。

将智能与结果匹配

OpenAI的主要论点是,高效的AI部署始于结果,而非模型名称。

同一工作流程的不同阶段可能需要不同水平的智能、速度和可靠性。

一项任务的理想模型取决于:

  • 错误的后果。
  • 工作的难度。
  • 可接受的响应时间。
  • 请求量。
  • 人工复核的成本。
  • 自动验证结果的能力。
  • 任务是明确指定的,还是仍然模糊不清。

何时选择Luna

GPT-5.6 Luna专为成本敏感、高量级工作而设计。

其当前API模型页面将其描述为大致对应早期GPT-5系列中使用的nano层级。

Luna是以下场景的实用候选:

  • 分类。
  • 结构化提取。
  • 后台代理步骤。
  • 常规代码变更。
  • 测试生成。
  • 文档分类处理。
  • 重复性工具调用循环。
  • 大规模处理,其中每个单独任务的负面影响有限。

OpenAI估计,Luna能够以约六美分每美元任务成本、近九倍的速度,提供与约一年前被视为前沿类模型相当的性能。

该比较基于OpenAI的评估和成本方法论。团队应针对自身工作负载进行验证。

何时选择Terra

GPT-5.6 Terra是该系列中的平衡型成员。

OpenAI将其定位在早期GPT-5时代mini模型所处的位置,但具有更强的代理性和专业工作能力。

Terra适合以下工作:

  • 工作区问答。
  • 限定范围的研究。
  • 日常编码。
  • 文档分析。
  • 中等复杂度的代理规划。
  • 需要推理的客户支持工作流程。
  • Luna不够可靠但Sol又非必要时的重复性业务任务。

何时选择Sol

GPT-5.6 Sol是面向复杂专业工作的旗舰模型。

当模型必须满足以下条件时,它是最佳选择:

  • 解决歧义。
  • 为困难项目制定计划。
  • 审查高价值决策。
  • 处理复杂编码或调试。
  • 在长时间工作流程中协调工具。
  • 进行深度研究。
  • 生成或验证失败代价高昂的工作。

gpt-5.6 API别名路由至gpt-5.6-sol

一个工作流程可以使用多个模型

此次定价更新使混合模型工作流程更加实用。

编码代理不需要为每个令牌和每次工具调用都使用Sol。

一种可能的架构是:

  1. 使用Sol理解代码库并识别不确定性。
  2. 让Sol创建计划并定义成功标准。
  3. 将明确指定的实现任务发送给Luna。
  4. 使用Luna编写常规测试并执行重复性检查。
  5. 将不确定或失败的步骤路由至Terra或Sol。
  6. 在错误后果严重时,使用Sol进行最终审查。

是很高的。

同样的模式也可以应用于软件工程之外。

一个文档处理系统可能会使用Luna进行提取,使用Terra进行综合,并且仅在材料存在歧义或影响重大时才使用Sol。

正确的路由策略应通过评估来确定,而不是依赖假设。

OpenAI分享的客户成果

OpenAI的公告中包含了来自多个生产用户的早期客户反馈。

这些示例是公司和客户自行报告的,而非独立的基准测试。

公司 报告的使用情况或结果
Replit Luna让以往不切实际的使用场景变得成本可控,足以进行探索
Notion Terra在内部评估中,以一半的任务成本和缩短60%的时间,达到了与GPT-5.5相当的质量
Ramp Terra和Luna在成本效率方面引领了内部编码评估;Luna成为后台自动化任务的默认选择
Blitzy Luna将提示缓存复用率从24%提升至90%,与之前的默认方案相比大幅降低了成本
Cognition Luna在Devin Fusion中作为成本更低的编码伙伴,与更大的模型配合使用
Dust 据报告,在相似的智能体任务中,Luna比该公司之前的默认方案快40%、便宜40%

这些示例表明,按Token计费并非唯一有用的衡量标准。

一个更便宜的模型还可能改变:

  • 工具调用的次数。
  • 缓存复用情况。
  • 上下文长度。
  • 输出冗长度。
  • 重试频率。
  • 人工审核需求。
  • 总完成时间。

更有意义的指标通常是每次成功结果的成本

OpenAI所称的效率提升方式

OpenAI将性能价格比的提升归因于三个相互关联的层面。

1. 模型

GPT-5.6系列模型旨在更直接地完成工作。

一个需要更少输出Token、更少重试或更少推理循环的模型,即使在标价不变的情况下,也能降低总任务成本。

2. 推理系统

生产堆栈决定了模型使用硬件的效率。

OpenAI表示,优化过的服务软件可以更高效地生成Token,并保持计算资源的生产力。

3. 智能体框架

框架是模型周围的软件,提供工具、上下文、路由、状态和工作流控制。

OpenAI表示,更好的上下文管理有助于智能体避免重复已完成的工作。

这可以减少:

  • 重复的工具调用。
  • 对未变化上下文的重复处理。
  • 重复的规划。
  • 不必要的模型往返调用。
  • 用于复述先前结果的Token消耗。

这三个层面相互影响。

更强的模型可能在服务堆栈中找到优化空间。这种优化降低了成本,使更大规模的智能体使用变得经济实惠。更多的使用量又会创造更多改进系统的机会。

GPT-5.6 Sol帮助优化了自身的服务堆栈

公告中最引人注目的声明之一是,GPT-5.6 Sol为OpenAI的内部效率工作做出了贡献。

在人类主导的工程流程中,OpenAI表示Sol:

  • 重写并优化了生产内核。
  • 设计并运行了数百次Token生成实验。
  • 监控训练过程。
  • 在出现问题时进行干预。

OpenAI 报告称,内核方面的优化使模型的端到端服务成本降低了约20%。

该公司还表示,这些实验将令牌生成效率提升了超过15%。

这些是OpenAI的内部结果,尚未通过公开基准测试进行独立复现。

更重要的一个观点是,模型正逐渐成为改进其运行基础设施这一流程中的一部分。

这形成了一个更紧密的工程反馈闭环:

更强的模型
→ 更好的基础设施优化
→ 更低的服务成本
→ 更广泛的应用
→ 更多反馈与投入
→ 更强大的下一代模型

面向规模的算力策略

更低的定价并不意味着OpenAI需要的总算力减少。

该公司认为,实现充足的智能需要同时具备两点:

  • 更多的算力。
  • 更高产出的算力。

前者扩大总容量。

后者提升每单位硬件完成的有效工作量。

OpenAI表示,它正在构建多元化基础设施组合,并将工作负载匹配到最适合运行它们的系统上。

这同时支撑GPT-5.6系列的两端:

  • Luna和Terra让高容量工作负载成本更低。
  • Sol和Fast模式支持困难且对延迟敏感的工作。

可能更容易实现规模化运行的工作负载示例包括:

  • 大型文档分析流水线。
  • 客户交互分类。
  • 常规软件实施。
  • 后台智能体自动化。
  • 重复性数据处理任务。
  • 高缓存复用率的工具调用工作流。

与此同时,当更快得到答案的价值足以覆盖额外费用时,复杂的Sol请求可以使用Fast模式。

Fast模式取代优先处理

Fast模式是OpenAI优先处理服务层的新名称。

使用以下方式的现有API请求:

"service_tier": "priority"

仍然保持兼容。

开发者也可以使用:

"service_tier": "fast"

对于GPT-5.6 Sol,OpenAI表示Fast模式在保持相同模型智能的同时,速度可达标准处理的2.5倍。

代价是价格。

目前,GPT-5.6 Sol的Fast模式费用为标准API令牌价格的2倍。

缓存输入的折扣仍然适用。

Python示例

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-5.6-sol",
    input="Review this migration plan and identify the three highest-risk assumptions.",
    service_tier="fast",
)

print(response.output_text)

Fast模式可通过Responses API和Chat Completions API用于受支持的模型。

对于GPT-5.6及更早的模型,即使请求使用了更新的fast名称,响应对象也可能将服务层报告为priority

何时Fast模式的溢价值得

Fast模式并非对所有Sol请求都自动是最佳设置。

当延迟直接影响结果的价值时,它最为有用。

示例包括:

  • 面向用户、完成高价值工作流的助手。
  • 等待解除开发者阻塞的编程智能体。
  • 交互式研究或分析。
  • 事件响应支持。
  • 决策前的实时审查。
  • 稳定运行的生产系统。

对延迟敏感的业务流量。

对于以下场景,标准处理可能更经济:

  • 后台任务。
  • 隔夜研究。
  • 异步报告生成。
  • 批量分析。
  • 用户无需等待的任务。
  • 瓶颈在于外部工具而非模型的工作流。

只有当下游完成所创造的价值超过其成本时,两倍的代币溢价才有意义。

在长周期代理工作流中,提示缓存更为重要

新的标价使 Luna 和 Terra 更便宜,但提示缓存对长时间运行的代理同样能产生巨大的影响。

代理循环中的每一轮都可能重新发送:

  • 系统指令。
  • 工具定义。
  • 共享文档。
  • 代码库上下文。
  • 对话历史。
  • 稳定的工作流规则。

如果没有缓存,应用程序可能会为相同的前缀重复付费。

GPT-5.6 同时支持自动缓存和显式缓存断点。

OpenAI 目前的计费方式为:

  • 缓存读取按未缓存输入价格的 10% 计费。
  • 缓存写入按未缓存输入价格的 125% 计费。

缓存写入的成本高于普通输入,但后续的读取可获得大幅折扣。

当相同的稳定前缀被重复使用足够多次以收回更高的写入成本时,缓存最为有用。

应用程序应跟踪:

  • 缓存命中率。
  • 前缀稳定性。
  • 请求之间的间隔时间。
  • 缓存上下文的大小。
  • 工作流是否频繁使前缀失效。

整个系列共享的模型规格

当前的 API 模型页面列出了多项共享规格:

规格 Sol Terra Luna
上下文窗口 1,050,000 个 token 1,050,000 个 token 1,050,000 个 token
最大输出 128,000 个 token 128,000 个 token 128,000 个 token
知识截止日期 2026 年 2 月 16 日 2026 年 2 月 16 日 2026 年 2 月 16 日
文本输入/输出 支持 支持 支持
图像输入 支持 支持 支持
推理 token 支持 支持 支持
函数调用 支持 支持 支持
结构化输出 支持 支持 支持
微调 不支持 不支持 不支持

这三个模型均可通过 Responses API 使用。

模型页面还列出了广泛的工具支持,但具体功能可用性可能因端点、账户、产品和发布阶段而异。

在 ChatGPT Work、Codex 和 API 中的可用性

OpenAI 表示 GPT-5.6 Terra 和 Luna 仍可在以下平台使用:

  • ChatGPT Work。
  • Codex。
  • OpenAI API。

价格公告中描述的当前访问权限包括:

套餐组 ChatGPT Work 和 Codex 中的 GPT-5.6 访问权限
免费版和 Go Terra
Plus、Pro、Business、Enterprise Terra 和 Luna

Sol 在 ChatGPT、ChatGPT Work、Codex 和 API 中有自己的访问规则。

7 月 30 日的更新并未降低 ChatGPT 或 Codex 的订阅价格。

也未提高所声明的配额预算。

相反,Luna 和 Terra 现在消耗更少的积分,因为其底层使用成本更低。

OpenAI 还表示,定价更新将在公告发布当天通过 AWS 开始推出。通过第三方平台提供的模型定价可能与 OpenAI API 直接定价有所不同。

如何

选择正确的GPT-5.6模型

一个实用的选择流程可以遵循五个步骤。

第一步:明确预期结果

写下什么算作成功。

避免仅根据“编程”或“研究”等宽泛标签来选择模型。

第二步:识别失败的代价

低风险的分类任务和生产环境数据库迁移不应使用相同的决策规则。

第三步:建立Sol基线

对于困难任务,先测试Sol以了解可用的最高质量水平。

第四步:在同一评估集上测试Terra和Luna

衡量成本更低的模型是否保留了真正重要的质量。

第五步:优化整个工作流

跟踪:

  • 任务成功率。
  • 总Token数。
  • 缓存复用率。
  • 工具调用次数。
  • 重试次数。
  • 延迟。
  • 人工审查时间。
  • 每次成功结果的成本。

不要只优化最便宜的输入Token价格。

常见问题

GPT-5.6 Luna的新价格是多少?

GPT-5.6 Luna现在的标准短上下文输入Token价格为每百万个0.20美元,缓存输入Token价格为每百万个0.02美元,输出Token价格为每百万个1.20美元。缓存写入价格为每百万个Token 0.25美元。

GPT-5.6 Terra的新价格是多少?

GPT-5.6 Terra现在的标准短上下文输入Token价格为每百万个2.00美元,缓存输入Token价格为每百万个0.20美元,输出Token价格为每百万个12.00美元。缓存写入价格为每百万个Token 2.50美元。

GPT-5.6 Sol降价了吗?

其标准Token价格没有变化。Sol仍然是短上下文输入Token每百万个5美元,输出Token每百万个30美元,而Fast模式提供比标准价格高两倍的2.5倍处理速度。

Priority Processing发生了什么变化?

OpenAI于2026年7月30日将Priority Processing更名为Fast模式。使用service_tier: "priority"的现有请求仍然兼容,新请求可以使用service_tier: "fast"

GPT-5.6长上下文定价何时适用?

当前的模型页面说明,包含超过272,000个输入Token的提示将对整个请求使用更高的输入和输出费率。开发人员在估算超大提示的成本时应考虑这一阈值。

哪种GPT-5.6模型最适合高吞吐量工作负载?

OpenAI将Luna定位为面向成本敏感、高吞吐量工作的模型。当Luna无法提供足够质量时,Terra是平衡的选择,而Sol则面向最困难的专业任务。

降价是否会降低ChatGPT和Codex的订阅费用?

不会。OpenAI表示订阅价格和配额预算保持不变。Terra和Luna现在在受支持的付费产品工作流中消耗更少的点数。

所有云提供商是否立即提供降价后的价格?

直接OpenAI API价格于7月30日发生变化。OpenAI表示AWS定价将于当天晚些时候开始推出,但第三方平台的价格和可用性可能有所不同,因此用户应核实提供商的当前费率表。

相关工具

适用于既需要智能又希望降低成本的负载的模型。

  • GPT-5.6 Luna:面向高吞吐量、成本敏感型任务的最快且最经济的 GPT-5.6 模型。
  • Responses API:OpenAI 用于推理、工具、多轮工作流和智能体应用的主要 API。
  • Codex:OpenAI 基于 GPT-5.6 模型系列的智能体软件工程环境。
  • OpenAI API Dashboard:管理 API 密钥、项目、用量、限额和计费的官方工作台。

相关链接

总结

OpenAI 在 7 月 30 日的更新中,将 GPT-5.6 Luna 的标准 API 价格下调了 80%,Terra 下调了 20%。Sol 的标准价格保持不变,而新的快速模式可将 API 响应速度提升至原来的 2.5 倍,token 费率则为原来的两倍。

本次公告围绕更广泛的性价比策略展开。OpenAI 表示,正在改进模型、推理栈、路由、上下文管理和智能体框架,以降低每个成功任务所需的时间、token 数或算力。

对于开发者而言,正确的选择并非简单地挑选最便宜的模型。Luna 面向高吞吐量执行,Terra 在成本与智能之间取得平衡,Sol 则负责最复杂的工作。混合模型路由、缓存、评估和每次成功成本衡量所带来的节省,可能远超单纯更换模型的效果。

核心变化在于,GPT-5.6 现在提供了更宽的工作区间:Luna 和 Terra 层级提供了更经济的日常智能,而在延迟表现值得更高成本时,可通过 Sol 获得更快速的尖端智能。

该 Markdown 文件是对官方文章的独立编辑性改编。它保留了主题、事实顺序和实际含义,但未逐字复制 OpenAI 的措辞或客户引述。

GPT-5.6 降价解析:Luna 降幅达 80%,Terra 下跌 20%,Sol 推出极速模式