8月13日晚,DeepSeek 官宣 V4-Pro 正式版在网页端、App、API 全线上线,同时公布新定价:从北京时间 8月17日0时起,V4 系列 API 改为峰谷分时计价,高峰时段部分计费项涨幅最高达 12 倍(缓存命中输入),输出价格涨到 27 元/百万 tokens,是原来的 4.5 倍。对天天调 DeepSeek API 的开发者来说,这比模型更新本身更值得关注------账单要变了。
发生了什么
时间线是这样的:8月12日晚,DeepSeek API 文档里出现 DeepSeek-V4-Pro-0813,正式版静默上线;随后社区实测陆续出现异常,本应长思考的请求思考时间经常不足十秒,长流程任务频繁提前收尾(据报道,21世纪经济报道);8月13日白天,官网首页通知和开放平台公告一度撤回,当晚官方才发推官宣正式版全线上线,并同步公布调价方案。官方没有对这 24 小时的波动作出公开说明。
模型本身的参数规模没变:仍是总参数 1.6 万亿的 MoE 架构,激活约 490 亿参数,上下文 100 万 tokens,最大输出 38.4 万 tokens(据报道)。变化集中在后训练和 Agent 能力上。官方自测数据显示,V4-Pro-0813 在 DeepSWE、Terminal-Bench 等 Agent 基准上大幅超过预览版,逼近甚至部分反超 Anthropic 的 Fable 5。注意一个前提:这些跑分目前只有 DeepSeek 官方发布,第三方基准平台上还没有结果,没有独立复现。
价格到底涨了多少
据报道,新价格从 8月17日0时生效,首次引入峰谷定价:每日 9:00-12:00、14:00-18:00(北京时间)为高峰时段,其余为闲时,闲时价格为高峰的一半。以 V4-Pro 为例(元/百万 tokens):
| 计费项 | 原价 | 高峰价 | 闲时价 |
|---|---|---|---|
| 缓存命中输入 | 0.025 | 0.30(12倍) | 0.15 |
| 缓存未命中输入 | 3 | 9(3倍) | 4.5 |
| 输出 | 6 | 27(4.5倍) | 13.5 |
V4-Flash 同步调整:高峰时段缓存命中输入 0.10 元、缓存未命中输入 3 元、输出 9 元,闲时减半。涨幅最夸张的缓存命中输入虽然比例是 12 倍,但绝对价格依然是全表最低。
两个没变也值得注意:API 的模型名没变,还是 deepseek-v4-pro,变的只是版本号(0813);网页端和 App 的免费使用不受影响。官方对涨价的解释是"更合理地调配资源"(据报道)。另外,V4-Pro 的并发限制是 500 路,V4-Flash 是 2500 路------高并发批量场景下,Flash 在价格和并发上反而都更合适。
对普通开发者意味着什么
三个实际动作。
第一,错峰。批量任务(数据清洗、批量生成、日志分析)本来就不在乎几小时延迟,挪到闲时跑,成本直接砍一半。高峰时段留给在线交互。
第二,算清缓存账。缓存命中输入涨了 12 倍,但 0.30 元/百万 tokens 依然是全表最低价。把 system prompt、few-shot 示例这些固定前缀尽量命中缓存,多轮对话和 agent 循环里能省不少。可以用这个脚本按新价格快速估算:
python
# 按 2026-08-17 起的新价格估算单次调用成本(元)
def cost(price_per_million, tokens):
return price_per_million * tokens / 1_000_000
peak = {"cache_hit_in": 0.30, "cache_miss_in": 9.0, "out": 27.0}
off = {"cache_hit_in": 0.15, "cache_miss_in": 4.5, "out": 13.5}
def bill(in_tokens, out_tokens, hit=True, off_peak=False):
p = off if off_peak else peak
in_price = p["cache_hit_in"] if hit else p["cache_miss_in"]
return cost(in_price, in_tokens) + cost(p["out"], out_tokens)
print(bill(2000, 500, hit=True)) # 高峰+缓存命中
print(bill(2000, 500, hit=True, off_peak=True)) # 闲时+缓存命中
第三,别急着信跑分。Agent 基准暴涨的数据目前是孤证,且正式版上线当天就出现过服务波动的前科。接生产环境前,拿自己的任务集做一轮对比,再决定要不要迁移。
第四,重新评估选型。调价后 Flash 高峰输出 9 元/百万 tokens,只有 Pro 的三分之一;如果业务大头是结构化抽取、文本摘要这类任务,Flash 大概率够用。复杂 agent 循环、长链路代码任务再考虑 Pro,但先等第三方复测数据,别只信官方跑分。8月17日新价格生效后,把 API 账单按时段拆开看一遍,确认自己的调用分布落在哪个时段,再决定要不要调整调度策略。
顺带一提,8月13日晚 DeepSeek 还开源了 Agent 框架 DeepSeek Harness(dsh)v0.1 开发者预览版,MIT 协议,装好 Node.js 后运行 npx @deepseek-ai/dsh web 就能在本地启动 Web UI(默认 127.0.0.1:3080)。官方明说后续会有破坏兼容性的改动,适合先当试验品,别急着上生产。
涨价这种事,老板看到的是成本优化空间,我看到的是又得回去改预算表了。不过换个角度想,分时定价本身也是一种信号:算力资源越来越贵,错峰、缓存这些"省着用"的技巧,正在变成 AI 应用的常规技能。你怎么看,评论区聊聊。