GPT-5.6 降价后, API 账单的三层漏斗该怎么拆

  1. 事件速览:价格变化本身

7 月 30 日,OpenAI 宣布 GPT-5.6 系列调价:

  • Luna:输入 0.20/M,输出 1.20/M,降价 80%
  • Terra:输入 2/M,输出 12/M,降价 20%
  • Sol:价格不变,新增 Fast mode,2.5 倍速度、2 倍价格

同一天,OpenRouter 宣布在其平台 Luna 降至 0.1/M 输入、0.6/M 输出,Terra 降至 1/M 输入、6/M 输出,相当于在 OpenAI 新价基础上再打 5 折。

OpenAI 给出的定位是:Luna 适合高并发、相对标准化的任务;Terra 是日常工作的平衡选择;Sol 负责需要高智能的环节。

2. 企业算账的三层漏斗

2.1 标价层:官方挂牌价

这是最容易被传播的数。Luna $0.1/M 输入确实低到离谱,但它只回答"每百万 token 多少钱",不回答"你的业务需要多少 token"。

2.2 平台层:OpenRouter 折扣与路由

OpenRouter 的 50% 折扣属于平台侧行为。中转/聚合平台的常见做法是:用补贴价吸引开发者,后续根据流量规模、模型谈判能力调整。企业如果把预算直接按 OpenRouter 现价做年度规划,存在折扣缩水或模型下架的风险。

2.3 真实账单层:四个容易被忽略的变量

  1. 输出膨胀:Luna 单价低,但如果它在复杂任务上的错误率更高,修正轮次会拉高输出 token。
  2. 上下文长度:很多应用把历史对话、文档全文一次性塞进上下文,输入 token 占比高,输入降价才更关键。
  3. 缓存命中率:官方对 Luna/Terra 的缓存机制未明确披露与此前模型是否一致;缓存没命中时按全价计费。
  4. 工具调用与 Fast mode:Agent 工作流里,模型调用外部 API 的往返本身不产生模型 token,但等待时间会影响总耗时;对延迟敏感的环节如果开 Fast mode,成本直接翻倍。

3. 可复用的比价检查清单

企业在评估是否迁移时,建议按以下步骤跑一遍:

  • 导出过去 30 天生产日志,按模型、按接口拆分输入/输出 token 数
  • 用新价格重算一遍,分别按官方价和 OpenRouter 价算两个版本
  • 标记错误率/重试率高的任务,单独估算 Luna 替代后的修正成本
  • 列出依赖 Sol 级别能力的任务,确认无法被 Luna 覆盖
  • 评估 prompt 工程、评估集、灰度流量的迁移人天

4. 冷观察

降价潮对企业是利好,但利好不等于无脑迁移。OpenAI 此时大幅降价,背景是 Kimi K3、GLM、开源模型在中低端市场持续施压,同时企业客户对 API 账单越来越敏感。价格战的本质是抢占工作负载入口,不是做慈善。企业最该做的不是追最低价,而是建立一套持续比价的内部机制。

相关推荐
MicrosoftReactor7 分钟前
技术速递|GitHub Copilot App 入门指南:管理你的工作
ai·github·copilot·agent
码士集团小青17 分钟前
细拆DeepSeek Harness设计思路以及未来定位
ai
clorinda25 分钟前
OpenCV图像增强基础——图像金字塔、直方图与特征提取
人工智能·opencv·计算机视觉
这张生成的图像能检测吗35 分钟前
(论文速读)MANTIS:时间序列分类的轻量级基础模型
人工智能·时序模型·分类模型
赵大仁1 小时前
Next.js AI Route Handler 工程化:超时、流式与鉴权
前端·ai·鉴权·next.js·工程化
u0103055271 小时前
AI Agent加速安卓应用快速落地
人工智能·新浪微博
angered1 小时前
「AI 应用 / AI Agent」行业日报 · 2026-08-21
人工智能
李昊哲小课1 小时前
大模型应用开发课程 —— 项目 09~12 完整教程
大数据·人工智能·大模型
xierui1231231 小时前
AI Agent 隐私架构:本地化重点为什么是登录态与执行权限
java·人工智能·网络安全·架构