GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本

GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本

TL;DR

  • 场景:OpenAI 2026-07-30 公告 Luna Standard 短上下文四项费率同步降到旧价 20%(即降价 80%);同构 Luna Token 账单精确下降 80%。
  • 结论 :模型 Token 便宜不等于单次成功任务便宜。Agent 任务总成本还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核;真正决定迁移价值的是 cost_per_success
  • 产出:完整费率等式(4 项 × 0.2)+ 工具成本拐点(Web Search 0.01 > 示例 Token 0.0064)+ 272K 长上下文阶跃(2× 输入 / 1.5× 输出)+ 缓存命中顺序建议 + cost_per_success 公式与对照表 + 100-500 个真实任务 A/B 矩阵 + Luna-first 三档条件升级方案 + 30 天迁移节奏。

版本矩阵

维度 状态 说明
Luna Standard 短上下文四项费率同步降到旧价 20% ✅ 已验证 输入 1.00 → 0.20 / 缓存读 0.10 → 0.02 / 缓存写 1.25 → 0.25 / 输出 6.00 → 1.20(美元 / 百万 Token)
等式 new = 0.20 × old ✅ 已验证 同 Luna 模型 / 同服务层级 / 同上下文区间 / 同 Token 向量
Luna 上下文容量 ✅ 已验证 1,050,000 token 上下文 / 128,000 最大输出
272K 长上下文阶跃 ✅ 已验证 输入 > 272K 后完整请求按 2× 输入 + 1.5× 输出费率计费(Standard 对应:输入 0.40 / 缓存读 0.04 / 缓存写 0.50 / 输出 1.80)
OpenAI 公告日期 ✅ 已验证 自 2026-07-30 起 API 定价生效;Sol 同时新增 Fast mode
Terra 同步降价 ✅ 已验证 Terra 同步降价 20%:输入 2/M、输出2/M、输出 2/M、输出12/M
Web Search 固定调用费 ✅ 已验证 10.00/1kcalls(reasoning与non−reasoning模型存在价差;non−reasoningpreview10.00 / 1k calls(reasoning 与 non-reasoning 模型存在价差;non-reasoning preview 10.00/1kcalls(reasoning与non−reasoning模型存在价差;non−reasoningpreview25.00/1k)
Web Search 内容 Token ✅ 已验证 搜索内容 Token 另计
Container / Code Interpreter ✅ 已验证 每 20 分钟会话计费
File search ✅ 已验证 Storage 0.10/GB−day;Toolcall0.10/GB-day;Tool call 0.10/GB−day;Toolcall2.50/1k calls
Agent Kit ✅ 已验证 ChatKit file/image upload storage $0.10/GB-day
缓存读取 = 输入的 10% ✅ 已验证 Luna Standard:缓存读 0.02 / 输入 0.20 = 10%
缓存写入 > 普通输入 ✅ 已验证 Luna Standard:缓存写 0.25 / 输入 0.20 = 1.25×
Luna-first 升级条件 ✅ 已验证 失败 / 低置信 / 复杂任务升级;高风险保留人工责任
"模型 Token 便宜 = 任务总成本便宜" ❌ 不成立 工具、循环、人工摊销、272K 阶跃都独立计费
"用 Benchmark 决定迁移" ❌ 不成立 必须用 100-500 个真实任务的 cost_per_success
"Luna-only 替换全部任务" ❌ 不成立 高错误代价 / 难自动验证任务仍需 Terra/Sol 终审 + 人工
"平均上下文 200K ≠ 成本稳定" ❌ 不成立 P50/P90/P95/P99 + 272K 阶跃 + 跨线前最后工具调用都要看
"缓存写越多越好" ❌ 不成立 写后未读是浪费;写在前缀会被复用时才有收益
"新价 = 任意上下文任意 Token 统一" ❌ 不成立 272K 阶跃 + 缓存读 / 写 / 输入分别计价
"Web Search 与模型 Token 一起降" ❌ 不成立 工具费单独计费,固定调用费与 Token 价格不联动
"Luna 自动验证 = 可去掉人工复核" ❌ 不成立 高风险决策保留人工责任

文章正文

GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本

事实边界:本文按 2026-07-31 可访问的 OpenAI 公告、Luna 模型卡与 API 价格页核验。降价不代表模型权重改变,也不能推导 OpenAI 的单位推理成本或毛利率。

摘要

Luna Standard 短上下文输入、缓存读取、缓存写入和输出价格都降到了旧价的 20%。所以在模型、服务层级、上下文区间和 Token 构成不变时,模型 Token 账单精确下降 80%。但 Agent 任务还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核。真正决定迁移价值的指标应是 cost_per_success。本文给出完整费率等式、工具成本拐点、272K 阈值、100--500 个真实任务 A/B 和 Luna-first 条件升级方案。

关键词

GPT-5.6 Luna、cost_per_success、272K 阈值、Web Search、Luna-first

目录

  • [一、80% 是严格等式,但有四个前提](#一、80% 是严格等式,但有四个前提 "#%E4%B8%8080-%E6%98%AF%E4%B8%A5%E6%A0%BC%E7%AD%89%E5%BC%8F%E4%BD%86%E6%9C%89%E5%9B%9B%E4%B8%AA%E5%89%8D%E6%8F%90")
  • [二、模型费降 80%,任务总成本为什么未必](#二、模型费降 80%,任务总成本为什么未必 "#%E4%BA%8C%E6%A8%A1%E5%9E%8B%E8%B4%B9%E9%99%8D-80%E4%BB%BB%E5%8A%A1%E6%80%BB%E6%88%90%E6%9C%AC%E4%B8%BA%E4%BB%80%E4%B9%88%E6%9C%AA%E5%BF%85")
  • [三、Token 便宜后,工具更早成为成本中心](#三、Token 便宜后,工具更早成为成本中心 "#%E4%B8%89token-%E4%BE%BF%E5%AE%9C%E5%90%8E%E5%B7%A5%E5%85%B7%E6%9B%B4%E6%97%A9%E6%88%90%E4%B8%BA%E6%88%90%E6%9C%AC%E4%B8%AD%E5%BF%83")
  • [四、272K 是完整请求的离散价格阶跃](#四、272K 是完整请求的离散价格阶跃 "#%E5%9B%9B272k-%E6%98%AF%E5%AE%8C%E6%95%B4%E8%AF%B7%E6%B1%82%E7%9A%84%E7%A6%BB%E6%95%A3%E4%BB%B7%E6%A0%BC%E9%98%B6%E8%B7%83")
  • 五、缓存命中属于计费架构
  • 六、迁移主指标:cost_per_success
  • [七、用 100--500 个真实任务做 A/B](#七、用 100–500 个真实任务做 A/B "#%E4%B8%83%E7%94%A8-100500-%E4%B8%AA%E7%9C%9F%E5%AE%9E%E4%BB%BB%E5%8A%A1%E5%81%9A-ab")
  • [八、Luna-first,不是 Luna-only](#八、Luna-first,不是 Luna-only "#%E5%85%ABluna-first%E4%B8%8D%E6%98%AF-luna-only")
  • [九、30 天迁移节奏](#九、30 天迁移节奏 "#%E4%B9%9D30-%E5%A4%A9%E8%BF%81%E7%A7%BB%E8%8A%82%E5%A5%8F")
  • 结论
  • 参考资料

一、80% 是严格等式,但有四个前提

OpenAI 当前列示的 Luna Standard 短上下文费率为:

计费项 旧价 新价 单位
未缓存输入 1.00 0.20 美元/百万 Token
缓存读取 0.10 0.02 美元/百万 Token
缓存写入 1.25 0.25 美元/百万 Token
输出 6.00 1.20 美元/百万 Token

设四类 Token 分别为 I、R、W、O

text 复制代码
old = 1.00I + 0.10R + 1.25W + 6.00O
new = 0.20I + 0.02R + 0.25W + 1.20O
    = 0.20 × old

这条等式只在四个条件同时成立时有效:同一个 Luna 模型、同一服务层级、同一上下文费率区间、同一 Token 向量。工具、区域与第三方费用不包含在等式中。

二、模型费降 80%,任务总成本为什么未必

Agent 任务成本至少包含:

text 复制代码
模型 Token
+ 工具调用
+ 外部服务
+ 重试与循环
+ 人工复核

假设旧模型 Token 成本 0.10 美元,工具 0.03 美元,人工复核摊销 0.07 美元,总成本是 0.20 美元。模型部分降 80% 后,总成本变成:

text 复制代码
0.02 + 0.03 + 0.07 = 0.12 美元

业务总成本只下降 40%。如果 Luna 需要更多轮次、搜索或人工介入,单次调用更便宜,单次成功任务甚至可能没有更便宜。

三、Token 便宜后,工具更早成为成本中心

OpenAI 当前 Web Search 固定调用费为每 1,000 次 10 美元,即每次 0.01 美元,搜索内容 Token 另计。

一次 20K 未缓存输入、2K 输出的 Luna Standard 请求:

text 复制代码
20K × $0.20/M + 2K × $1.20/M = $0.0064

一次 Web Search 的固定费已经高于模型 Token 成本。这不是让 Agent 停止搜索,而是要求团队记录 tool_calls_per_success、重复搜索、无结果搜索和搜索后的成功率提升。该搜的证据仍要搜,失控的循环必须被 Harness 截止。

四、272K 是完整请求的离散价格阶跃

Luna 支持 1,050,000 上下文,最大输出 128,000;但输入超过 272K 后,完整请求按 2 倍输入、1.5 倍输出费率计费。Standard 对应变为输入 0.40、缓存读 0.04、缓存写 0.50、输出 1.80 美元/百万 Token。

平均上下文 200K 不能证明成本稳定。团队需要看 P50/P90/P95/P99、跨线比例以及跨线前最后一次工具调用。可以在 240K--260K 预警并压缩已确认状态,但高风险任务如果必须保留完整证据,就应接受长上下文费率。

五、缓存命中属于计费架构

缓存读取价格是普通输入的十分之一,但命中依赖稳定前缀。把时间戳、用户状态或最新工具结果放在 Prompt 前部,会让后续稳定 instructions 无法复用。

更合理的顺序是:

text 复制代码
稳定 instructions
稳定工具定义
稳定任务规则
动态用户状态
最新工具结果
当前请求

缓存写入价格高于普通输入。只有前缀会被复用时,写入才可能有收益。因此需要同时观察读取率、写入率、前缀复用次数和写后未读比例。

六、迁移主指标:cost_per_success

先为任务定义可验收的"成功":代码任务可要求测试、静态检查和补丁审计;检索任务可要求关键结论带可访问来源;结构化提取可要求 schema 与抽样共同通过。

然后计算:

text 复制代码
cost_per_success
= 所有尝试的模型费
+ 所有工具费
+ 外部服务费
+ 人工复核摊销
--------------------------------
成功任务数

对照表至少包含:

  • 首次成功率与严重错误数;
  • 单次成功成本;
  • P50/P95 端到端延迟;
  • 每次成功的重试、模型轮次、工具调用与输出 Token;
  • 缓存读取率、人工复核分钟数和升级模型分布。

七、用 100--500 个真实任务做 A/B

样本应覆盖低风险可验证、中等不确定性、高错误代价、长上下文、重工具调用和历史尾部失败任务。在相同 Harness、工具预算和验证器下比较:

text 复制代码
A:当前生产路由
B:Luna-first + 相同验证器 + 条件升级

通过条件不是"平均分不错",而是成功率在容差内、P95 未超预算、cost_per_success 稳定下降、严重错误为 0,且工具循环、人工复核和升级率没有异常上升。

八、Luna-first,不是 Luna-only

text 复制代码
低不确定性 + 可自动验证 + 高调用量
    -> Luna first

中等不确定性 + 用户可见 + 验收标准明确
    -> Luna / Terra A/B,失败时升级

高不确定性 + 高错误代价 + 难自动验证
    -> Terra / Sol 规划终审,Luna 执行可验证子任务

升级条件应能被系统观察:schema 或测试失败、来源冲突、置信不足、工具循环超限、长上下文接近阈值且不可安全压缩,以及不可逆、财务、法律或安全风险。

九、30 天迁移节奏

  1. 第 1--3 天:导出模型、工具、重试和人工复核基线,统一成功定义。
  2. 第 4--10 天:低风险小流量对照,每日核对本地估算和真实账单。
  3. 第 11--20 天:纳入中等不确定性和长上下文,观察 P95 与尾部失败。
  4. 第 21--30 天:固化升级与回滚阈值,高风险任务保留 Terra/Sol。

任务量很小时,维护多模型路由的工程成本可能高于节省金额;继续使用单一强模型是合理的更简单方案。自动验证器也不能替代高风险任务中的人工责任。

结论

可以精确说:同构 Luna Token 账单下降 80%。

必须通过实验回答:你的单次成功任务成本下降了多少。

Luna 的新价格让大量可验证任务具备 Luna-first 的经济性,但真正可持续的收益来自成功定义、工具预算、上下文治理、真实任务 A/B、条件升级和可回滚的运行合同。

参考资料

  1. OpenAI:GPT-5.6 价格性能公告
  2. OpenAI Developers:GPT-5.6 Luna 模型卡
  3. OpenAI Developers:API Pricing
  4. OpenAI:GPT-5.6 效率说明

错误速查卡

症状 根因 定位 修复
把"模型 Token 账单降 80%"当任务总成本降 80% 工具 / 外部服务 / 重试 / 人工摊销独立计费 检查 cost_per_success 公式各分量 用 cost_per_success 替换单一模型费对比
Web Search 突然成为成本中心 工具固定调用费 > 模型 Token 费 检查 tool_calls_per_success / 重复搜索 / 无结果搜索 记录重复搜索与成功率提升;用 Harness 截止失控循环
长上下文任务超出预算 输入 > 272K 后完整请求按 2× 输入 / 1.5× 输出费率 检查 P50/P90/P95/P99 + 跨线比例 在 240K-260K 预警并压缩;高风险任务接受长上下文费率
缓存命中仍偏低 时间戳 / 用户状态 / 工具结果被放在稳定前缀前部 检查 prompt 顺序 稳定 instructions / 工具定义 / 任务规则 → 动态用户状态 → 最新工具结果 → 当前请求
缓存写入后未读 缓存写 > 普通输入;只在前缀会被复用时才有收益 检查写后未读比例 观察读取率 / 写入率 / 前缀复用次数;写后未读即浪费
跑分高就宣布迁移 Benchmark ≠ 真实任务;Benchmark 不能覆盖工具循环 / 长上下文 / 错误代价 缺少真实任务 A/B 用 100-500 个真实任务做 A/B;固定任务集、工具、重试规则与质量门槛
"Luna-only" 替换全部任务 高错误代价 / 难自动验证任务仍需 Terra/Sol 终审 任务分类表 Luna-first 三档:低不确 → Luna / 中等 → A/B 升级 / 高 → Terra/Sol + 人工
平均上下文 200K 证明成本稳定 平均掩盖 P99 跨线 + 跨线前最后工具调用 检查 P99 + 跨线前最后工具调用 用 P50/P90/P95/P99 + 跨线比例 + 跨线前最后工具调用替换平均
把"升级率"当成优化信号 升级率高可能说明路由条件太严或任务分类错 升级率与成功率 / cost_per_success 联动 升级率必须作为必记录指标与首次成功率 / 严重错误数联动
工具循环失控 Harness 没设截止条件;Harness 仍相信"模型更努力就好" 检查工具循环次数 / 无结果搜索 Harness 必须设最大循环次数 / 无结果搜索上限 / 失败回退
任务量小时仍维护多模型路由 路由工程成本 > 节省金额 任务量 / 路由代码维护成本 任务量小时继续用单一强模型;路由是规模收益
Luna 任务把平均成本"打"下来 平均价被短上下文低费率主导 拆分 272K 上下的成本分布 报告必须按 272K 阶跃分段展示,不能合并
人工复核被自动验证器替代 自动验证器不能处理高风险决策 任务分级 高风险决策保留人工责任;自动验证器只替代可验证部分
"Luna 自动成功"被当总成功 Luna 不通过的尾部仍由升级模型兜底 检查升级强模型比例 报告必须区分 Luna 首轮成功 / 升级后成功 / 最终失败的拆分
把 1.05M 上下文当默认能力 272K 阶跃;缓存写 / 缓存读 / 工具固定费都独立计费 检查跨线比例与缓存命中分布 272K 是费率阶跃;超过即按长上下文费率;1.05M 不是"随便用"
把新价推广到任意上下文区间 272K 长上下文费率高于短上下文 检查 272K 跨线比例 Standard 长上下文:输入 0.40 / 缓存读 0.04 / 缓存写 0.50 / 输出 1.80
"Luna 输入 0.20 = 整个请求 0.20" 四项费率独立;输出 / 缓存写 / 工具不在输入里 拆分四项 Token 报告必须按 I / R / W / O 四项分别展示

作者:武子康的个人博客

相关推荐
Gu Gu Study1 小时前
ScoutLoop开放域深度研究引擎(agent的初步设计想法)
人工智能·python
HyperAI超神经1 小时前
15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge
人工智能·深度学习·机器人·多模态·图像生成·具身智能·智能体
搞科研的小刘选手2 小时前
【国际生态学协会主办】2026年生态环境与人工智能国际学术会议(ICAIEE 2026)
人工智能·生态环境·学术会议·会议推荐
笨鸟先飞,勤能补拙2 小时前
AI 赋能网络安全领域深度剖析
网络·人工智能·windows·安全·web安全·网络安全·github
小鸟你好啊2 小时前
搭建基于 Solon AI 的 Streamable MCP 服务并部署至阿里云百炼
人工智能·阿里云·云计算
Summer-Bright2 小时前
深度 | Agent框架大洗牌:AutoGen退场后的新秩序
人工智能·ai·语言模型·ai软件
ThsPool2 小时前
【遥感学习整理 02】ENVI遥感图像处理基础:从数据读取到遥感信息产品
图像处理·人工智能·学习
非凸科技2 小时前
非凸智能APP
人工智能
土星云SaturnCloud2 小时前
抽水蓄能设备智慧运营:基于土星云边缘计算实现机组全生命周期预测性维护
服务器·人工智能·ai·边缘计算