GPT-5.6 降价后, API 账单的三层漏斗该怎么拆

  1. 事件速览:价格变化本身

7 月 30 日,OpenAI 宣布 GPT-5.6 系列调价:

  • Luna:输入 0.20/M,输出 1.20/M,降价 80%
  • Terra:输入 2/M,输出 12/M,降价 20%
  • Sol:价格不变,新增 Fast mode,2.5 倍速度、2 倍价格

同一天,OpenRouter 宣布在其平台 Luna 降至 0.1/M 输入、0.6/M 输出,Terra 降至 1/M 输入、6/M 输出,相当于在 OpenAI 新价基础上再打 5 折。

OpenAI 给出的定位是:Luna 适合高并发、相对标准化的任务;Terra 是日常工作的平衡选择;Sol 负责需要高智能的环节。

2. 企业算账的三层漏斗

2.1 标价层:官方挂牌价

这是最容易被传播的数。Luna $0.1/M 输入确实低到离谱,但它只回答"每百万 token 多少钱",不回答"你的业务需要多少 token"。

2.2 平台层:OpenRouter 折扣与路由

OpenRouter 的 50% 折扣属于平台侧行为。中转/聚合平台的常见做法是:用补贴价吸引开发者,后续根据流量规模、模型谈判能力调整。企业如果把预算直接按 OpenRouter 现价做年度规划,存在折扣缩水或模型下架的风险。

2.3 真实账单层:四个容易被忽略的变量

  1. 输出膨胀:Luna 单价低,但如果它在复杂任务上的错误率更高,修正轮次会拉高输出 token。
  2. 上下文长度:很多应用把历史对话、文档全文一次性塞进上下文,输入 token 占比高,输入降价才更关键。
  3. 缓存命中率:官方对 Luna/Terra 的缓存机制未明确披露与此前模型是否一致;缓存没命中时按全价计费。
  4. 工具调用与 Fast mode:Agent 工作流里,模型调用外部 API 的往返本身不产生模型 token,但等待时间会影响总耗时;对延迟敏感的环节如果开 Fast mode,成本直接翻倍。

3. 可复用的比价检查清单

企业在评估是否迁移时,建议按以下步骤跑一遍:

  • 导出过去 30 天生产日志,按模型、按接口拆分输入/输出 token 数
  • 用新价格重算一遍,分别按官方价和 OpenRouter 价算两个版本
  • 标记错误率/重试率高的任务,单独估算 Luna 替代后的修正成本
  • 列出依赖 Sol 级别能力的任务,确认无法被 Luna 覆盖
  • 评估 prompt 工程、评估集、灰度流量的迁移人天

4. 冷观察

降价潮对企业是利好,但利好不等于无脑迁移。OpenAI 此时大幅降价,背景是 Kimi K3、GLM、开源模型在中低端市场持续施压,同时企业客户对 API 账单越来越敏感。价格战的本质是抢占工作负载入口,不是做慈善。企业最该做的不是追最低价,而是建立一套持续比价的内部机制。

相关推荐
BEOL贝尔科技1 小时前
样本安全存储中还有哪些重要因素需要考虑?如何设置样本安全?
人工智能·安全·数据分析
thesky1234562 小时前
27届大模型岗面试准备(十四):多模态大模型 VLM——从视觉编码器到多模态推理的完整链路
人工智能·ai·大模型
一根数据线2 小时前
BIM建模效率低?试试和AI工具配合使用
人工智能·ai·3d建模·3d模型·bim·ai建模·造形家
怕浪猫2 小时前
2840亿参数只卖白菜价:DeepSeek V4 Flash 正式版上线,Agent 能力暴涨6倍
人工智能·算法
不爱记笔记2 小时前
多模态AI如何理解视频内容?从视觉、语音到语义的三层技术拆解
人工智能·自然语言处理·nlp·音视频·多模态
让学习成为一种生活方式2 小时前
苄基异喹啉生物碱糖基转移酶UGT74AN1晶体--Journal of Agricultural and Food Chemistry
人工智能·算法
犀利豆2 小时前
Claude code tools 研究系列(二)EnterPlanMode
人工智能·后端
lianboxinwen2 小时前
金融家装AI外呼自定义话术有哪些限制?
ai
sponge'2 小时前
《以场景为中心的无监督视频全景分割》论文框架讲解
人工智能·深度学习