新通知:9 月 10 日 12:00 起,Flash 系列调价。 空闲时段缓存命中 0.02、输入未命中 1、输出 4,高峰时段在这两个数上翻倍(0.04 / 2 / 8)。单位都是 元 / 百万 tokens。
上一次调价是 8 月 17 日,中间隔了不到一个月。
三次价格摞在一起看,结论一句话就说得完:输入那两档退回了原点,输出降了一点,但没降回去。

三档价格
| 计费项 | 8·17 之前 | 8·17 起(空闲 / 高峰) | 9·10 起(空闲 / 高峰) | 相比 8·17 |
|---|---|---|---|---|
| Flash 缓存命中 | 0.02 | 0.05 / 0.10 | 0.02 / 0.04 | −60% |
| Flash 输入未命中 | 1 | 1.5 / 3.0 | 1 / 2 | −33% |
| Flash 输出 | 2 | 4.5 / 9.0 | 4 / 8 | −11% |
先看前两行。缓存命中和输入未命中是精确退回到 8 月 17 日之前的数字------0.02 就是 0.02,1 就是 1,一分不差。这种撤到底的调价不太常见,一般是往中间某个位置靠一下,这次是直接退干净。
输出那行是另一回事。4.5 降到 4、高峰 9 降到 8,账面降了 11%。但参照系换成 8 月 17 日之前的 2 元再看:现在的空闲价是它的 2 倍,高峰价是 4 倍。
所以"降价了,但没完全降"不是玩文字游戏。输入是退回,输出是打折后的涨价。
你能省多少,取决于 token 结构
降幅不是一个固定值,它在 11% 和 60% 之间浮动,全看你的 token 都花在哪儿。
全是缓存命中的输入,降 60%;全是没命中的输入,降 33%;纯输出,只有 11%。真实业务通常落在中间:输入占比越高、命中率越高,这一轮越划算;反过来,输出密集的那类用法,11% 基本可以忽略不计。
账单上更直观。100 万 token 输入(未命中)+ 100 万 token 输出:
| 模型 | 8·17 之前 | 8·17 起(空闲 / 高峰) | 9·10 起(空闲 / 高峰) |
|---|---|---|---|
| Flash | 3 元 | 6 / 12 元 | 5 / 10 元 |
| Pro | 9 元 | 18 / 36 元 | 18 / 36 元 |
Flash 高峰时段从 12 元降到 10 元,比 8 月 17 日之前还是贵 7 元。同样一笔调用,输出砍到 20 万 token 的话,降幅能到 25% 左右;输出拉到 200 万,就只剩 13%。
Pro 那一行两个数字一模一样------这轮调价不涉及 Pro。缓存命中 0.15 / 0.30、输入未命中 4.5 / 9.0、输出 13.5 / 27.0,全部维持 8 月 17 日之后的价格。对 Pro 用户没影响,只是 Flash 降下去之后两边的价差又拉开了:输出高峰 8 元对 27 元,3.4 倍。
几个我比较在意的点
高峰时段的倍数没变,还是空闲的两倍。 8 月那次是 0.05→0.10、1.5→3.0、4.5→9.0,这次是 0.02→0.04、1→2、4→8。基数降了,机制一寸没动。分时段计价看来是要长期做下去的,不是临时拿来调节水位的手段。
缓存命中从高峰 0.10 回到 0.04。 这一档对前缀缓存用得狠的场景是实打实的减负。命中 0.02、未命中 1,50 倍差距,把 system prompt 和能复用的上下文切出来做缓存的收益又回来了。
真正贵的那一项没变:输出。 输入可以低到 0.02,输出稳在 4 / 8。这个价格结构把成本分布写得挺明白------生成那一端的算力是硬开销,输入便宜是在买你的调用量。
两次调价只隔三周,输入全退、输出只退 11%。 我倾向认为这是试探之后的修正:输入那部分涨价把量打出去了,退回来;输出这部分的涨幅扛住了,留下。价格表有时候比官方说明更诚实。
该调什么
批量任务继续往深夜挪。这是目前唯一能让成本确定减半的操作,别的优化都到不了这个幅度。
优化重心从输入端挪到输出端。prompt 的缓存设计还值得做,但别再花大力气抠输入 token 了------已经便宜到不值得算。该动的是让它少写:输出长度限制、结构化返回、别让它复述你已经知道的东西。
9 月 10 日 12:00 是个硬时点,有压批任务的往后压一天能省 17%。不值得为这个熬夜,顺手的事而已。
至于要不要为那 11% 改架构,我觉得不用。省下的是小钱,改动的成本是大钱。