2026 年 7 月 30 日,OpenAI 宣布 GPT-5.6 系列 API 调价。
最轻量的 Luna 输入价格从每百万 token 一美元降到零点二美元,输出价格从六美元降到一点二美元,降幅百分之八十。
中档的 Terra 降价百分之二十,旗舰 Sol 价格不动,但新增了更快的推理选项。
距离 GPT-5.6 系列 7 月 9 日上线,只过去了二十一天。
二十一天就降价百分之八十,这在 OpenAI 的定价历史上没有先例。
官方给出的理由是推理效率提升。
但真正值得追问的是,效率提升到底发生在哪里。
这篇把账一笔一笔算开。
第一笔账:三档价格差多少
先把账本摊开看。
| 型号 | 输入价(美元/百万 token) | 输出价(美元/百万 token) | 定位 |
|---|---|---|---|
| Sol | 5.00 | 30.00 | 旗舰推理 |
| Terra | 2.50 → 2.00 | 15.00 → 12.00 | 均衡 |
| Luna | 1.00 → 0.20 | 6.00 → 1.20 | 轻量快速 |
这是 GPT-5.6 系列的三档定价。
Sol 是旗舰,负责复杂推理。
Terra 是均衡档,负责日常业务。
Luna 是轻量档,负责高吞吐低延迟场景。
这次降价之后,Luna 的输入价格已经低于很多国产推理服务的同类模型。
甚至和 GPT-4o mini 当年的定价区间接近了。
一个中等规模的 SaaS 产品,假设每月调用十亿 token,输入输出各一半。
降价前 Luna 的成本大约是三千五百美元一个月。
降价后变成七百美元一个月。
每月省两千八百美元,年化超过三万三千美元。
对用量规律的中型产品来说,这轮降价把 Luna 从跑量时要精打细算的选项,变成了可以放心跑量的默认选项。
但价格表只是结果,不是原因。
第二笔账:客户实测的效率账
OpenAI 在公告里附了一条来自客户的实测数据,这条数据才是整件事的关键。
Blitzy 的 CTO Sid Pardeshi 说,Luna 是他们自 GPT-4o mini 以来看到的 agentic 行为最大的一次跃迁。
他们从单次结构化输出调用,切换到了完整的工具调用 Agent 循环。
prompt cache 的复用率从百分之二十四提升到百分之九十。
在数千次生产调用里,Luna 处理了二点二倍的上下文,却输出了八点五倍更少的 token,成本比 GPT-5.4 mini 低百分之八十七。
这几个数字放在一起,能看出很多门道。
缓存复用率从二十四到九十,意味着同一批前缀 token 被反复计费的次数大幅下降。
输出 token 减少八点五倍,意味着模型学会了更经济的表达。
成本下降百分之八十七,是这两个因素叠加的结果。
OpenAI 敢降价百分之八十,是因为它的单位成本真的降下来了。
这不是市场营销,是成本结构的变化。
模型开始自己优化自己的运行效率,这件事的连锁反应才刚开始。
第三笔账:缓存机制改了什么
要理解这次降价,必须理解 GPT-5.6 的缓存机制变化。
GPT-5.6 引入了更可预测的 prompt caching,包括显式缓存断点和三十分钟最小缓存寿命。
所谓缓存断点,就是开发者在系统提示词里用特殊标记,明确告诉 API 缓存边界在哪里。
以前缓存是黑盒,命不命中看运气。
现在缓存边界由开发者控制,成本变得可预测。
三十分钟最小缓存寿命意味着,一段内容写进缓存后,至少三十分钟内不会失效。
对于高频的 Agent 循环,这是巨大的利好。
缓存写入按模型未命中输入价的 1.25 倍计费。
缓存读取继续享受百分之九十的折扣。
超过 27.2 万输入 token 的请求,整个请求按输入两倍、输出一点五倍计费。
这意味着长上下文请求的成本结构彻底变了。
以前你为了省钱,会尽量缩短系统提示词。
现在你可以把一份很长的系统提示词稳定放在缓存里,每次只付读取费。
对 Agent 场景来说,这是质的改变。
Agent 循环里每一轮都要带同样的系统提示和工具定义,这部分正是缓存命中的黄金区域。
缓存命中率从二十四到九十,背后是显式缓存断点让开发者可以精确控制缓存边界。
边界控制住了,命中率自然就上去了。
第四笔账:一段真实代码的账
空谈机制没有意义,直接看代码。
下面这段是带显式缓存断点的真实调用示例,可以在本地直接跑。
from openai import OpenAI
client = OpenAI(api_key="your-key")
# 显式缓存断点:在这两个标记之间,系统提示会被缓存
system = (
"<|start_cache_write|>"
"你是一个代码审查助手,负责检查 Python 项目的安全漏洞。"
"审查规则:第一,检查 SQL 注入风险;第二,检查不安全的反序列化;"
"第三,检查硬编码密钥;第四,检查权限校验缺失。"
"输出格式:JSON 数组,每个元素包含 severity、location、description 三个字段。"
"<|end_cache_write|>"
)
resp = client.responses.create(
model="gpt-5.6-luna",
input=[
{"role": "system", "content": system},
{"role": "user", "content": "审查这段代码:\n" + code}
],
)
# 同一循环的下一轮:系统提示命中缓存,只付读取费
resp2 = client.responses.create(
model="gpt-5.6-luna",
input=[
{"role": "system", "content": system},
{"role": "user", "content": "继续审查:\n" + code2}
],
)
这段代码的关键在系统提示里的两个标记。
第一轮调用时,标记内的内容写入缓存,按写入价计费。
第二轮及之后的每一轮,标记内的内容从缓存读取,只付百分之十的读取价。
如果 Agent 循环有一百轮,前两轮之后,九十八轮都只付读取费。
这就是缓存命中率从二十四拉到九十的工程实现。
对照 Blitzy 的实测,一轮 Agent 循环的成本可以下降一个数量级。
第五笔账:选型账怎么算
三档模型现在变成了三套成本模型。
Sol 五美元输入、三十美元输出,适合需要最强推理的复杂任务。
Terra 两美元输入、十二美元输出,适合中等推理强度的日常业务。
Luna 零点二美元输入、一点二美元输出,适合高吞吐低延迟的批量场景。
当 Luna 的价格低到 GPT-4o mini 的档位,很多原本不敢用大模型的场景开始变得可行。
分类、抽取、路由、简单的 Agent 循环,这些任务用 Luna 的成本可以忽略不计。
但要注意,Luna 的推理能力有上限。
需要复杂推理的任务,省下的钱会在返工里加倍花出去。
正确的做法不是无脑切 Luna,而是按任务复杂度分层。
高价值低频率的任务走 Sol。
中价值中频率的任务走 Terra。
高频率低价值的任务走 Luna。
再加上缓存策略,一个中等规模产品的 API 成本可以压缩一个数量级。
第六笔账:长上下文定价的账
这次调价还有一个容易被忽略的细节,就是长上下文定价规则。
GPT-5.6 系列全部模型拥有 105 万 token 的上下文窗口。
但超过 27.2 万输入 token 的请求,输入按两倍计费,输出按一点五倍计费。
这个规则对 Agent 场景影响很大。
很多团队喜欢把所有上下文一股脑塞进一次请求。
一次请求塞到五十万 token,账单直接翻倍。
同样的内容拆成两次请求,配合缓存断点,反而更便宜。
这就是长上下文时代的新记账方式。
上下文长度不是免费的午餐,超过阈值就要加钱。
聪明的做法是把稳定的长内容放进缓存区,把变化的内容放在请求尾部。
尾部每轮变化,但长度短,按正常价计费。
头部内容长,但命中缓存,只付百分之十。
一进一出,总成本比单次大请求低得多。
这笔账,很多团队还没有算明白。
第七笔账:对国产模型的压力账
Luna 零点二美元的输入价,对国内模型厂商不是好消息。
之前国产推理服务能打价格战,靠的是比 OpenAI 低得多的定价。
现在 Luna 直接杀到零点二美元,折合人民币不到一块五。
国内很多同类模型的价格优势瞬间消失。
更麻烦的是,Luna 背后是 OpenAI 的整个工程体系。
缓存机制、显式断点、三十分钟最小寿命,这些是成本控制的基础设施。
国产模型要跟进降价,就得先建起同样的成本控制能力。
只靠压缩利润空间打价格战,撑不了多久。
这轮降价的真正压力,不是价格本身,而是价格背后的工程能力。
第八笔账:缓存命中率的账
回到 Blitzy 那个数字,缓存复用率从二十四到九十,单独拿出来算一笔。
假设一个 Agent 任务跑一百轮循环,每轮系统提示加工具定义一共两万 token。
两万 token 里,一万八千是稳定内容,两千是每轮变化的部分。

缓存命中率二十四的时候,稳定内容大部分没有命中缓存,每次都要按输入价重付。
一百轮下来,稳定内容被重复计费约一百八十万 token。
缓存命中率九十的时候,稳定内容几乎全部命中缓存,每次只付百分之十。
同样一百轮,稳定内容的实际计费降到约十八万 token。
一亿 token 规模的月度任务,这笔差距就是几十倍的账。
这才是成本下降百分之八十七的真相。
不是模型变便宜了,是同样的能力用更少的钱跑完了。
单位 token 的价格没有变,单位任务的成本变了。
理解了这一点,就理解了 OpenAI 降价的底气。
第九笔账:开发者改怎么接
对开发者来说,这轮降价带来的不是选择题,而是必答题。
还在用旧模型跑高吞吐业务的团队,应该立刻评估切 Luna。
切的时候注意三件事。
第一,把系统提示和工具定义固化成常量,不要每轮动态拼。
第二,在稳定内容的边界放上缓存断点标记。
第三,单轮输入超过 27.2 万 token 的请求,拆开重写。
这三件事做完,成本基本能降一个数量级。
不做的团队,等于每个月把钱白白扔掉。
另外提醒一句,Luna 适合的是高吞吐场景,不是复杂推理场景。
把 Sol 的活交给 Luna,省下的钱会在返工里还回去。
分层用模型,配合缓存策略,才是这轮降价的最大红利。
第十笔账:从四 mini 到 Luna 的价格轨迹
把 Luna 的价格放进历史坐标里看,会更清楚。
GPT-4o mini 当年发布时,输入价零点一五美元,输出价零点六美元。
那是 OpenAI 第一次把入门档价格打下来。
之后两年,入门档模型的价格一直在缓慢下探,但始终没有突破那个区间。
GPT-5.4 mini 的定价,和四 mini 相比并没有本质变化。
这次 Luna 零点二美元的输入价,已经逼近当年四 mini 的水平。
但 Luna 的能力,比四 mini 高了一个时代。
它有完整的工具调用能力,有原生 Agent 循环支持,有一百零五万上下文窗口。
用当年入门档的价格,买到今天的前沿档能力,这才是这次降价真正惊人的地方。
模型能力的代差在缩小,价格却在向历史低位靠拢。
这两条曲线的交叉,是 Agent 应用爆发的信号。
第十一笔账:Sol 加速的账
这次调价还有一个容易被忽略的细节,就是 Sol 新增的快速推理选项。
Sol 的价格没有变,输入五美元,输出三十美元。
但同样的价格,推理速度更快了。
对延迟敏感的生产环境来说,这是另一种形式的降价。
同样花三十美元,以前能等到的响应,现在更快返回。
单位时间内的吞吐量提升了,单位任务的成本其实也降了。
OpenAI 没有把所有牌都押在 Luna 上。
高端用速度换价值,低端用价格换规模。
两头夹击,中间档的 Terra 降价百分之二十,正好卡住腰部市场。
三档模型,三套竞争策略,这次调价是一次完整的定价体系重构。
第十二笔账:一次真实任务的全成本账
把前面的账合起来,算一次真实任务的完整成本。
假设你做一个代码审查 Agent,每天跑五百个任务。
每个任务平均三十轮循环,每轮系统提示加工具定义两万 token。
每天稳定内容的调用量是三亿 token。
用旧模型,缓存命中率百分之二十四,输入价一美元。
稳定内容里,只有百分之二十四命中缓存,其余百分之七十六按全价计费。
每天稳定内容的成本大约两千二百美元。
换 Luna 之后,输入价零点二美元,缓存命中率百分之九十。
每天稳定内容的成本降到大约四十美元。
这只是输入侧的稳定内容,还没算输出和变化部分。
即使把输出和其他开销全部算上,日成本也能从三千美元级别降到三百美元级别。
一个月下来,一个 Agent 产品的 API 成本从九万美元降到九千美元。
这个量级的成本下降,直接改变产品的商业模型。
以前只能卖给大客户的 Agent 服务,现在中小客户也买得起了。
以前算不过账的自动化场景,现在全部变成可行。
这才是降价百分之八十的真正含义。
第十三笔账:成本结构健康的账
最后算一笔长远的账。
OpenAI 这次降价的底气,来自成本结构的优化,不是补贴。
缓存机制的完善,让相同的算力服务更多请求。
显式断点让缓存命中率可预测,算力利用率大幅提升。
输出 token 减少八点五倍,说明模型本身的效率也在提升。
这些是实打实的工程改进,不是烧钱换市场。
补贴式降价不可持续,工程式降价可以持续很久。
因为每一次工程优化,都在为下一轮降价储备弹药。
对手跟进的是价格,OpenAI 领先的是成本能力。
价格可以随时改,成本能力需要长期积累。
这场价格战的终局,是成本能力的比拼。
谁的成本结构更健康,谁就能在价格上笑到最后。
算总账:价格战打在了工程层
这次降价的真正含义,不是 OpenAI 开始打价格战。
而是模型推理的成本结构被工程手段改写了。
缓存命中率从二十四到九十,输出 token 减少八点五倍,这两件事和模型参数无关,和工程优化有关。
当 OpenAI 能把一个模型的单位成本压到竞争对手难以跟进的位置,价格就成了最锋利的竞争武器。
对开发者来说,这轮降价最实际的价值是:Agent 循环的成本终于降到可以放心跑量的水平。
以前跑一个百轮 Agent 循环,光 token 费就让人心疼。
现在同样的循环,成本只有原来的十分之一。
这意味着很多以前算不过账的自动化场景,现在都能跑起来了。
未来六个月,谁能把缓存策略用明白,谁的 API 账单就能比同行低一个数量级。
这场价格战的终点不是谁更便宜,而是谁的成本结构更健康。
OpenAI 已经出牌了,接下来看别人怎么跟。
第十四笔账:二十七万两千 token 阈值的账
长上下文定价规则里,二十七万两千这个数字值得单独算一笔。
为什么阈值定在这里,官方没有解释。
但从工程角度推测,这个数字和缓存分片的物理布局有关。
超过这个阈值,缓存系统需要跨分片管理,成本结构完全不同。
对开发者来说,重要的是记住这个数字,然后在设计请求时避开它。
一次请求塞进三十万 token,输入价格直接翻倍。
同样的内容拆成两段,每段十五万,就落在正常价区。
配合缓存断点,两段都能命中缓存,成本反而更低。
这就是长上下文时代的请求设计学。
以前上下文越长越省钱,因为省了拼接的麻烦。
现在上下文越长越费钱,因为触碰了阈值。
设计 Agent 循环时,必须把请求长度当作第一优先级的约束。
把稳定的长内容放进缓存区,把变化的内容放在尾部。
这个模式在 GPT-5.6 的定价体系下,是成本最优解。
第十五笔账:缓存写入费的账
缓存写入按未命中输入价的一点二五倍计费,这个规则也要算明白。
很多人看到一点二五倍就皱眉,觉得写入太贵。
但实际算下来,写入费在总成本里的占比很小。
一次写入,之后无数次读取,读取只要百分之十。
写入贵一点二五倍,读取便宜九成,怎么算都划算。
真正要避免的是频繁触发缓存失效。
如果系统提示每次都在变,缓存永远写不进去,等于白交写入费。
把系统提示和工具定义做成常量,是使用缓存的第一原则。
动态内容放在缓存区之外,保持缓存区的稳定。
缓存区越稳定,写入费的摊薄效果越好。
一个设计良好的 Agent,缓存写入费可以摊薄到总成本的百分之二以下。
第十六笔账:对 MCP 生态的账
这轮降价对 MCP 生态的影响,值得单独说。
MCP 协议下的 Agent 循环,每一轮都要携带工具定义。
工具定义越长,缓存命中的收益越大。
以前工具定义三万字,每轮都按全价重付,成本感人。
现在工具定义放进缓存区,每轮只付百分之十。
MCP Server 数量越多,工具定义越长,省的钱越多。
这等于给 MCP 生态发了一张补贴券。
多工具、长定义的 Agent 场景,在这轮降价里收益最大。
那些因为工具调用成本太高而被砍掉的设计,现在可以重新捡起来。
Agent 的架构自由度变大了。
这也解释了为什么 OpenAI 在公告里特意强调 agentic 能力。
降价不是目的,让 Agent 场景跑起来才是目的。
第十七笔账:AWS 同步降价的账
OpenAI 的公告里还有一句话,价格调整将开始滚动到 AWS。
这句话的含金量被很多人低估了。
AWS 上的企业客户,是 OpenAI 最稳定的一批收入来源。
这些客户走 Bedrock 或 SageMaker 调用模型,价格跟着降。
企业级 Agent 部署的成本基准,一夜之间被改写。
以前企业内部评估 Agent 项目,算账算不过去。
现在 Luna 的价格,让内部项目的 ROI 模型全部重算。
这轮降价会直接推动企业 Agent 项目的立项潮。
成本下来了,试点项目就能转正。
转正的项目越多,OpenAI 的调用量越大。
降价换规模,规模再摊薄成本,这是正循环。
AWS 的渠道能力,把这个正循环的半径扩大了数倍。
第十八笔账:算账的姿势本身
最后提醒一句,算账的姿势比数字本身更重要。
模型价格会持续下降,缓存机制会继续演进,今天的最优解明天可能就过时。
与其死记价格表,不如掌握成本模型的分析方法。
拿到任何一个新模型,先拆解它的计费维度。
再算清自己的调用结构,哪些内容稳定、哪些变化、请求有多长。
把这两个变量放到一起,成本最优解自然浮现。
这次降价是一个很好的练习样本。
看懂它,就掌握了未来所有模型调价的读法。