DeepSeek 在 V4-Flash 正式版上线公测后第六天宣布大幅上调 API 定价。消息本身简单,但背后的供给链条值得拆。
一、事件时间线与定价现状
| 时间 | 事件 |
|---|---|
| 7/31 | V4-Flash 正式版 API 上线公测 |
| 8/4 | OpenRouter 周报:V4-Flash 预览版 7.22 万亿 Token/周登顶全球第一 |
| 8/6 | DeepSeek 公告:计划整体上调 API 定价,预计涨幅较大 |
现行定价(涨价前):
| 模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|
| V4-Flash | 0.02 元/M Token | 1 元/M Token | 2 元/M Token |
| V4-Pro | 0.025 元/M Token | 3 元/M Token | 6 元/M Token |
二、三层供给瓶颈
第一层:付费转化率不足四成。 OpenCode 数据显示,8 月 1 日 V4-Flash 单日处理 8 万亿 Token,其中 5 万亿来自免费额度,3 万亿来自付费调用。调用量全球第一的排面下,付费转化率 37.5%。免费额度消耗的算力是真金白银的 GPU 时间,但不产生一分钱收入。
第二层:训推共用同一批卡。 DeepSeek 持有约 2 万张 H 系等效芯片,训练和推理不分池。V4-Flash 上线后推理需求暴涨,V4-Pro 正式版又即将发布,训练和推理开始抢算力。涨价的直接效果是用价格压制推理需求,给训练腾 GPU。
第三层:峰谷定价被替代。 此前预告的峰谷定价(高峰时段价格翻倍)已从 API 文档中消失。推测逻辑:与其在特定时段翻倍引发用户体验波动,不如直接拉高基线价格。整体涨价的收入确定性高于峰谷定价。
三、价格优势的边际成本基础
DeepSeek 的低价不是补贴出来的,是架构选择的结果。V4-Flash 采用 MoE 架构,总参数 2840 亿但激活参数仅 130 亿。每次推理只点亮不到 5% 的参数,算力消耗天然就低。缓存命中价格 0.02 元,是未命中价格的 2%------主流模型这个比例约 10%。
但架构优势有天花板。当调用量从日均数百万 Token 跳到 8 万亿,MoE 的激活稀疏性省下的算力被总量增长吞掉了。2 万张卡扛 8 万亿 Token 日处理量,平均每张卡每天要处理 4 亿 Token。这个负载已经接近 H 系芯片的合理上限。
四、企业调用避坑清单
- 成本预估不能只看单价:缓存命中率对实际成本影响巨大。如果业务场景的 prompt 重复率低(如客服对话),实际成本可能接近未命中价格的 5-50 倍。
- 预留涨价缓冲:API 定价不是合同价。DeepSeek 一周内从"极致低价"转向"大幅涨价",企业应至少预留 50% 的成本缓冲。
- 关注峰谷机制:如果峰谷定价恢复,高峰时段(9-12、14-18)成本翻倍,需要调整批处理任务的调度时间。
- 多供应商对冲:V4-Flash 涨价后,与 Qwen3.8、GLM-5.2 做一次成本对比。价格优势可能从"百分之一"缩到"三分之一"。
- 免费额度不是设计容量:8 万亿日 Token 中 5 万亿是免费额度。如果免费额度被收紧或取消,依赖免费层做开发测试的团队会直接受冲击。
冷观察:DeepSeek 的涨价不丢人,低价撑不住比高价卖不动更健康。但"全球最便宜"的心智锚一旦松动,后续要重新建立价格信任的成本,可能比涨的那点价高得多。