- 事件速览:价格变化本身
7 月 30 日,OpenAI 宣布 GPT-5.6 系列调价:
- Luna:输入 0.20/M,输出 1.20/M,降价 80%
- Terra:输入 2/M,输出 12/M,降价 20%
- Sol:价格不变,新增 Fast mode,2.5 倍速度、2 倍价格
同一天,OpenRouter 宣布在其平台 Luna 降至 0.1/M 输入、0.6/M 输出,Terra 降至 1/M 输入、6/M 输出,相当于在 OpenAI 新价基础上再打 5 折。
OpenAI 给出的定位是:Luna 适合高并发、相对标准化的任务;Terra 是日常工作的平衡选择;Sol 负责需要高智能的环节。
2. 企业算账的三层漏斗
2.1 标价层:官方挂牌价
这是最容易被传播的数。Luna $0.1/M 输入确实低到离谱,但它只回答"每百万 token 多少钱",不回答"你的业务需要多少 token"。
2.2 平台层:OpenRouter 折扣与路由
OpenRouter 的 50% 折扣属于平台侧行为。中转/聚合平台的常见做法是:用补贴价吸引开发者,后续根据流量规模、模型谈判能力调整。企业如果把预算直接按 OpenRouter 现价做年度规划,存在折扣缩水或模型下架的风险。
2.3 真实账单层:四个容易被忽略的变量
- 输出膨胀:Luna 单价低,但如果它在复杂任务上的错误率更高,修正轮次会拉高输出 token。
- 上下文长度:很多应用把历史对话、文档全文一次性塞进上下文,输入 token 占比高,输入降价才更关键。
- 缓存命中率:官方对 Luna/Terra 的缓存机制未明确披露与此前模型是否一致;缓存没命中时按全价计费。
- 工具调用与 Fast mode:Agent 工作流里,模型调用外部 API 的往返本身不产生模型 token,但等待时间会影响总耗时;对延迟敏感的环节如果开 Fast mode,成本直接翻倍。
3. 可复用的比价检查清单
企业在评估是否迁移时,建议按以下步骤跑一遍:
- 导出过去 30 天生产日志,按模型、按接口拆分输入/输出 token 数
- 用新价格重算一遍,分别按官方价和 OpenRouter 价算两个版本
- 标记错误率/重试率高的任务,单独估算 Luna 替代后的修正成本
- 列出依赖 Sol 级别能力的任务,确认无法被 Luna 覆盖
- 评估 prompt 工程、评估集、灰度流量的迁移人天
4. 冷观察
降价潮对企业是利好,但利好不等于无脑迁移。OpenAI 此时大幅降价,背景是 Kimi K3、GLM、开源模型在中低端市场持续施压,同时企业客户对 API 账单越来越敏感。价格战的本质是抢占工作负载入口,不是做慈善。企业最该做的不是追最低价,而是建立一套持续比价的内部机制。