GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本

GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本

TL;DR

  • 场景:OpenAI 2026-07-30 公告 Luna Standard 短上下文四项费率同步降到旧价 20%(即降价 80%);同构 Luna Token 账单精确下降 80%。
  • 结论 :模型 Token 便宜不等于单次成功任务便宜。Agent 任务总成本还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核;真正决定迁移价值的是 cost_per_success
  • 产出:完整费率等式(4 项 × 0.2)+ 工具成本拐点(Web Search 0.01 > 示例 Token 0.0064)+ 272K 长上下文阶跃(2× 输入 / 1.5× 输出)+ 缓存命中顺序建议 + cost_per_success 公式与对照表 + 100-500 个真实任务 A/B 矩阵 + Luna-first 三档条件升级方案 + 30 天迁移节奏。

版本矩阵

维度 状态 说明
Luna Standard 短上下文四项费率同步降到旧价 20% ✅ 已验证 输入 1.00 → 0.20 / 缓存读 0.10 → 0.02 / 缓存写 1.25 → 0.25 / 输出 6.00 → 1.20(美元 / 百万 Token)
等式 new = 0.20 × old ✅ 已验证 同 Luna 模型 / 同服务层级 / 同上下文区间 / 同 Token 向量
Luna 上下文容量 ✅ 已验证 1,050,000 token 上下文 / 128,000 最大输出
272K 长上下文阶跃 ✅ 已验证 输入 > 272K 后完整请求按 2× 输入 + 1.5× 输出费率计费(Standard 对应:输入 0.40 / 缓存读 0.04 / 缓存写 0.50 / 输出 1.80)
OpenAI 公告日期 ✅ 已验证 自 2026-07-30 起 API 定价生效;Sol 同时新增 Fast mode
Terra 同步降价 ✅ 已验证 Terra 同步降价 20%:输入 2/M、输出2/M、输出 2/M、输出12/M
Web Search 固定调用费 ✅ 已验证 10.00/1kcalls(reasoning与non−reasoning模型存在价差;non−reasoningpreview10.00 / 1k calls(reasoning 与 non-reasoning 模型存在价差;non-reasoning preview 10.00/1kcalls(reasoning与non−reasoning模型存在价差;non−reasoningpreview25.00/1k)
Web Search 内容 Token ✅ 已验证 搜索内容 Token 另计
Container / Code Interpreter ✅ 已验证 每 20 分钟会话计费
File search ✅ 已验证 Storage 0.10/GB−day;Toolcall0.10/GB-day;Tool call 0.10/GB−day;Toolcall2.50/1k calls
Agent Kit ✅ 已验证 ChatKit file/image upload storage $0.10/GB-day
缓存读取 = 输入的 10% ✅ 已验证 Luna Standard:缓存读 0.02 / 输入 0.20 = 10%
缓存写入 > 普通输入 ✅ 已验证 Luna Standard:缓存写 0.25 / 输入 0.20 = 1.25×
Luna-first 升级条件 ✅ 已验证 失败 / 低置信 / 复杂任务升级;高风险保留人工责任
"模型 Token 便宜 = 任务总成本便宜" ❌ 不成立 工具、循环、人工摊销、272K 阶跃都独立计费
"用 Benchmark 决定迁移" ❌ 不成立 必须用 100-500 个真实任务的 cost_per_success
"Luna-only 替换全部任务" ❌ 不成立 高错误代价 / 难自动验证任务仍需 Terra/Sol 终审 + 人工
"平均上下文 200K ≠ 成本稳定" ❌ 不成立 P50/P90/P95/P99 + 272K 阶跃 + 跨线前最后工具调用都要看
"缓存写越多越好" ❌ 不成立 写后未读是浪费;写在前缀会被复用时才有收益
"新价 = 任意上下文任意 Token 统一" ❌ 不成立 272K 阶跃 + 缓存读 / 写 / 输入分别计价
"Web Search 与模型 Token 一起降" ❌ 不成立 工具费单独计费,固定调用费与 Token 价格不联动
"Luna 自动验证 = 可去掉人工复核" ❌ 不成立 高风险决策保留人工责任

文章正文

GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本

事实边界:本文按 2026-07-31 可访问的 OpenAI 公告、Luna 模型卡与 API 价格页核验。降价不代表模型权重改变,也不能推导 OpenAI 的单位推理成本或毛利率。

摘要

Luna Standard 短上下文输入、缓存读取、缓存写入和输出价格都降到了旧价的 20%。所以在模型、服务层级、上下文区间和 Token 构成不变时,模型 Token 账单精确下降 80%。但 Agent 任务还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核。真正决定迁移价值的指标应是 cost_per_success。本文给出完整费率等式、工具成本拐点、272K 阈值、100--500 个真实任务 A/B 和 Luna-first 条件升级方案。

关键词

GPT-5.6 Luna、cost_per_success、272K 阈值、Web Search、Luna-first

目录

  • [一、80% 是严格等式,但有四个前提](#一、80% 是严格等式,但有四个前提 "#%E4%B8%8080-%E6%98%AF%E4%B8%A5%E6%A0%BC%E7%AD%89%E5%BC%8F%E4%BD%86%E6%9C%89%E5%9B%9B%E4%B8%AA%E5%89%8D%E6%8F%90")
  • [二、模型费降 80%,任务总成本为什么未必](#二、模型费降 80%,任务总成本为什么未必 "#%E4%BA%8C%E6%A8%A1%E5%9E%8B%E8%B4%B9%E9%99%8D-80%E4%BB%BB%E5%8A%A1%E6%80%BB%E6%88%90%E6%9C%AC%E4%B8%BA%E4%BB%80%E4%B9%88%E6%9C%AA%E5%BF%85")
  • [三、Token 便宜后,工具更早成为成本中心](#三、Token 便宜后,工具更早成为成本中心 "#%E4%B8%89token-%E4%BE%BF%E5%AE%9C%E5%90%8E%E5%B7%A5%E5%85%B7%E6%9B%B4%E6%97%A9%E6%88%90%E4%B8%BA%E6%88%90%E6%9C%AC%E4%B8%AD%E5%BF%83")
  • [四、272K 是完整请求的离散价格阶跃](#四、272K 是完整请求的离散价格阶跃 "#%E5%9B%9B272k-%E6%98%AF%E5%AE%8C%E6%95%B4%E8%AF%B7%E6%B1%82%E7%9A%84%E7%A6%BB%E6%95%A3%E4%BB%B7%E6%A0%BC%E9%98%B6%E8%B7%83")
  • 五、缓存命中属于计费架构
  • 六、迁移主指标:cost_per_success
  • [七、用 100--500 个真实任务做 A/B](#七、用 100–500 个真实任务做 A/B "#%E4%B8%83%E7%94%A8-100500-%E4%B8%AA%E7%9C%9F%E5%AE%9E%E4%BB%BB%E5%8A%A1%E5%81%9A-ab")
  • [八、Luna-first,不是 Luna-only](#八、Luna-first,不是 Luna-only "#%E5%85%ABluna-first%E4%B8%8D%E6%98%AF-luna-only")
  • [九、30 天迁移节奏](#九、30 天迁移节奏 "#%E4%B9%9D30-%E5%A4%A9%E8%BF%81%E7%A7%BB%E8%8A%82%E5%A5%8F")
  • 结论
  • 参考资料

一、80% 是严格等式,但有四个前提

OpenAI 当前列示的 Luna Standard 短上下文费率为:

计费项 旧价 新价 单位
未缓存输入 1.00 0.20 美元/百万 Token
缓存读取 0.10 0.02 美元/百万 Token
缓存写入 1.25 0.25 美元/百万 Token
输出 6.00 1.20 美元/百万 Token

设四类 Token 分别为 I、R、W、O

text 复制代码
old = 1.00I + 0.10R + 1.25W + 6.00O
new = 0.20I + 0.02R + 0.25W + 1.20O
    = 0.20 × old

这条等式只在四个条件同时成立时有效:同一个 Luna 模型、同一服务层级、同一上下文费率区间、同一 Token 向量。工具、区域与第三方费用不包含在等式中。

二、模型费降 80%,任务总成本为什么未必

Agent 任务成本至少包含:

text 复制代码
模型 Token
+ 工具调用
+ 外部服务
+ 重试与循环
+ 人工复核

假设旧模型 Token 成本 0.10 美元,工具 0.03 美元,人工复核摊销 0.07 美元,总成本是 0.20 美元。模型部分降 80% 后,总成本变成:

text 复制代码
0.02 + 0.03 + 0.07 = 0.12 美元

业务总成本只下降 40%。如果 Luna 需要更多轮次、搜索或人工介入,单次调用更便宜,单次成功任务甚至可能没有更便宜。

三、Token 便宜后,工具更早成为成本中心

OpenAI 当前 Web Search 固定调用费为每 1,000 次 10 美元,即每次 0.01 美元,搜索内容 Token 另计。

一次 20K 未缓存输入、2K 输出的 Luna Standard 请求:

text 复制代码
20K × $0.20/M + 2K × $1.20/M = $0.0064

一次 Web Search 的固定费已经高于模型 Token 成本。这不是让 Agent 停止搜索,而是要求团队记录 tool_calls_per_success、重复搜索、无结果搜索和搜索后的成功率提升。该搜的证据仍要搜,失控的循环必须被 Harness 截止。

四、272K 是完整请求的离散价格阶跃

Luna 支持 1,050,000 上下文,最大输出 128,000;但输入超过 272K 后,完整请求按 2 倍输入、1.5 倍输出费率计费。Standard 对应变为输入 0.40、缓存读 0.04、缓存写 0.50、输出 1.80 美元/百万 Token。

平均上下文 200K 不能证明成本稳定。团队需要看 P50/P90/P95/P99、跨线比例以及跨线前最后一次工具调用。可以在 240K--260K 预警并压缩已确认状态,但高风险任务如果必须保留完整证据,就应接受长上下文费率。

五、缓存命中属于计费架构

缓存读取价格是普通输入的十分之一,但命中依赖稳定前缀。把时间戳、用户状态或最新工具结果放在 Prompt 前部,会让后续稳定 instructions 无法复用。

更合理的顺序是:

text 复制代码
稳定 instructions
稳定工具定义
稳定任务规则
动态用户状态
最新工具结果
当前请求

缓存写入价格高于普通输入。只有前缀会被复用时,写入才可能有收益。因此需要同时观察读取率、写入率、前缀复用次数和写后未读比例。

六、迁移主指标:cost_per_success

先为任务定义可验收的"成功":代码任务可要求测试、静态检查和补丁审计;检索任务可要求关键结论带可访问来源;结构化提取可要求 schema 与抽样共同通过。

然后计算:

text 复制代码
cost_per_success
= 所有尝试的模型费
+ 所有工具费
+ 外部服务费
+ 人工复核摊销
--------------------------------
成功任务数

对照表至少包含:

  • 首次成功率与严重错误数;
  • 单次成功成本;
  • P50/P95 端到端延迟;
  • 每次成功的重试、模型轮次、工具调用与输出 Token;
  • 缓存读取率、人工复核分钟数和升级模型分布。

七、用 100--500 个真实任务做 A/B

样本应覆盖低风险可验证、中等不确定性、高错误代价、长上下文、重工具调用和历史尾部失败任务。在相同 Harness、工具预算和验证器下比较:

text 复制代码
A:当前生产路由
B:Luna-first + 相同验证器 + 条件升级

通过条件不是"平均分不错",而是成功率在容差内、P95 未超预算、cost_per_success 稳定下降、严重错误为 0,且工具循环、人工复核和升级率没有异常上升。

八、Luna-first,不是 Luna-only

text 复制代码
低不确定性 + 可自动验证 + 高调用量
    -> Luna first

中等不确定性 + 用户可见 + 验收标准明确
    -> Luna / Terra A/B,失败时升级

高不确定性 + 高错误代价 + 难自动验证
    -> Terra / Sol 规划终审,Luna 执行可验证子任务

升级条件应能被系统观察:schema 或测试失败、来源冲突、置信不足、工具循环超限、长上下文接近阈值且不可安全压缩,以及不可逆、财务、法律或安全风险。

九、30 天迁移节奏

  1. 第 1--3 天:导出模型、工具、重试和人工复核基线,统一成功定义。
  2. 第 4--10 天:低风险小流量对照,每日核对本地估算和真实账单。
  3. 第 11--20 天:纳入中等不确定性和长上下文,观察 P95 与尾部失败。
  4. 第 21--30 天:固化升级与回滚阈值,高风险任务保留 Terra/Sol。

任务量很小时,维护多模型路由的工程成本可能高于节省金额;继续使用单一强模型是合理的更简单方案。自动验证器也不能替代高风险任务中的人工责任。

结论

可以精确说:同构 Luna Token 账单下降 80%。

必须通过实验回答:你的单次成功任务成本下降了多少。

Luna 的新价格让大量可验证任务具备 Luna-first 的经济性,但真正可持续的收益来自成功定义、工具预算、上下文治理、真实任务 A/B、条件升级和可回滚的运行合同。

参考资料

  1. OpenAI:GPT-5.6 价格性能公告
  2. OpenAI Developers:GPT-5.6 Luna 模型卡
  3. OpenAI Developers:API Pricing
  4. OpenAI:GPT-5.6 效率说明

错误速查卡

症状 根因 定位 修复
把"模型 Token 账单降 80%"当任务总成本降 80% 工具 / 外部服务 / 重试 / 人工摊销独立计费 检查 cost_per_success 公式各分量 用 cost_per_success 替换单一模型费对比
Web Search 突然成为成本中心 工具固定调用费 > 模型 Token 费 检查 tool_calls_per_success / 重复搜索 / 无结果搜索 记录重复搜索与成功率提升;用 Harness 截止失控循环
长上下文任务超出预算 输入 > 272K 后完整请求按 2× 输入 / 1.5× 输出费率 检查 P50/P90/P95/P99 + 跨线比例 在 240K-260K 预警并压缩;高风险任务接受长上下文费率
缓存命中仍偏低 时间戳 / 用户状态 / 工具结果被放在稳定前缀前部 检查 prompt 顺序 稳定 instructions / 工具定义 / 任务规则 → 动态用户状态 → 最新工具结果 → 当前请求
缓存写入后未读 缓存写 > 普通输入;只在前缀会被复用时才有收益 检查写后未读比例 观察读取率 / 写入率 / 前缀复用次数;写后未读即浪费
跑分高就宣布迁移 Benchmark ≠ 真实任务;Benchmark 不能覆盖工具循环 / 长上下文 / 错误代价 缺少真实任务 A/B 用 100-500 个真实任务做 A/B;固定任务集、工具、重试规则与质量门槛
"Luna-only" 替换全部任务 高错误代价 / 难自动验证任务仍需 Terra/Sol 终审 任务分类表 Luna-first 三档:低不确 → Luna / 中等 → A/B 升级 / 高 → Terra/Sol + 人工
平均上下文 200K 证明成本稳定 平均掩盖 P99 跨线 + 跨线前最后工具调用 检查 P99 + 跨线前最后工具调用 用 P50/P90/P95/P99 + 跨线比例 + 跨线前最后工具调用替换平均
把"升级率"当成优化信号 升级率高可能说明路由条件太严或任务分类错 升级率与成功率 / cost_per_success 联动 升级率必须作为必记录指标与首次成功率 / 严重错误数联动
工具循环失控 Harness 没设截止条件;Harness 仍相信"模型更努力就好" 检查工具循环次数 / 无结果搜索 Harness 必须设最大循环次数 / 无结果搜索上限 / 失败回退
任务量小时仍维护多模型路由 路由工程成本 > 节省金额 任务量 / 路由代码维护成本 任务量小时继续用单一强模型;路由是规模收益
Luna 任务把平均成本"打"下来 平均价被短上下文低费率主导 拆分 272K 上下的成本分布 报告必须按 272K 阶跃分段展示,不能合并
人工复核被自动验证器替代 自动验证器不能处理高风险决策 任务分级 高风险决策保留人工责任;自动验证器只替代可验证部分
"Luna 自动成功"被当总成功 Luna 不通过的尾部仍由升级模型兜底 检查升级强模型比例 报告必须区分 Luna 首轮成功 / 升级后成功 / 最终失败的拆分
把 1.05M 上下文当默认能力 272K 阶跃;缓存写 / 缓存读 / 工具固定费都独立计费 检查跨线比例与缓存命中分布 272K 是费率阶跃;超过即按长上下文费率;1.05M 不是"随便用"
把新价推广到任意上下文区间 272K 长上下文费率高于短上下文 检查 272K 跨线比例 Standard 长上下文:输入 0.40 / 缓存读 0.04 / 缓存写 0.50 / 输出 1.80
"Luna 输入 0.20 = 整个请求 0.20" 四项费率独立;输出 / 缓存写 / 工具不在输入里 拆分四项 Token 报告必须按 I / R / W / O 四项分别展示

作者:武子康的个人博客

相关推荐
亿信华辰软件13 分钟前
边对话、边治理、边学习——数据治理的下一代范式
人工智能·数据治理
Python私教15 分钟前
如意智影:如何让同一个人物在多个镜头里保持身份一致
人工智能·python·架构
两万五千个小时20 分钟前
DeepSeek Harness 从 0 开始:10 Hooks 模块(钩子协议)
人工智能·程序员·架构
rimydu1974art24 分钟前
opencheck解读:拆解 OpenCheck 的歧视性条款识别与澄清问询机制
人工智能·typescript
武子康24 分钟前
33B 音画模型塞进 Apple Silicon,h3.c 重写了哪些 Runtime 职责
人工智能·llm·agent
知几蜗牛27 分钟前
一张图看懂AI、机器学习、深度学习和生成式AI之间的关系
llm
XLYcmy31 分钟前
小红书 算法一面 十一
google·meta·llm·负载均衡·token·moe·glam
SHIPKING39340 分钟前
【WorkBuddy】开发者必备的省积分与Token优化实战指南
人工智能
AI导出鸭1 小时前
Claude的LaTeX生成PDF文件复制后数学公式乱码,怎样修改?专业用户首选“AI导出鸭”
人工智能·pdf·ai导出鸭
染指11101 小时前
95.RAG-RAG应用平台-工作流(Agent)
人工智能·agent