DeepSeek V4-Pro 正式版上线,API 8月17日起分时调价

8月13日晚,DeepSeek 官宣 V4-Pro 正式版在网页端、App、API 全线上线,同时公布新定价:从北京时间 8月17日0时起,V4 系列 API 改为峰谷分时计价,高峰时段部分计费项涨幅最高达 12 倍(缓存命中输入),输出价格涨到 27 元/百万 tokens,是原来的 4.5 倍。对天天调 DeepSeek API 的开发者来说,这比模型更新本身更值得关注------账单要变了。

发生了什么

时间线是这样的:8月12日晚,DeepSeek API 文档里出现 DeepSeek-V4-Pro-0813,正式版静默上线;随后社区实测陆续出现异常,本应长思考的请求思考时间经常不足十秒,长流程任务频繁提前收尾(据报道,21世纪经济报道);8月13日白天,官网首页通知和开放平台公告一度撤回,当晚官方才发推官宣正式版全线上线,并同步公布调价方案。官方没有对这 24 小时的波动作出公开说明。

模型本身的参数规模没变:仍是总参数 1.6 万亿的 MoE 架构,激活约 490 亿参数,上下文 100 万 tokens,最大输出 38.4 万 tokens(据报道)。变化集中在后训练和 Agent 能力上。官方自测数据显示,V4-Pro-0813 在 DeepSWE、Terminal-Bench 等 Agent 基准上大幅超过预览版,逼近甚至部分反超 Anthropic 的 Fable 5。注意一个前提:这些跑分目前只有 DeepSeek 官方发布,第三方基准平台上还没有结果,没有独立复现。

价格到底涨了多少

据报道,新价格从 8月17日0时生效,首次引入峰谷定价:每日 9:00-12:00、14:00-18:00(北京时间)为高峰时段,其余为闲时,闲时价格为高峰的一半。以 V4-Pro 为例(元/百万 tokens):

计费项 原价 高峰价 闲时价
缓存命中输入 0.025 0.30(12倍) 0.15
缓存未命中输入 3 9(3倍) 4.5
输出 6 27(4.5倍) 13.5

V4-Flash 同步调整:高峰时段缓存命中输入 0.10 元、缓存未命中输入 3 元、输出 9 元,闲时减半。涨幅最夸张的缓存命中输入虽然比例是 12 倍,但绝对价格依然是全表最低。

两个没变也值得注意:API 的模型名没变,还是 deepseek-v4-pro,变的只是版本号(0813);网页端和 App 的免费使用不受影响。官方对涨价的解释是"更合理地调配资源"(据报道)。另外,V4-Pro 的并发限制是 500 路,V4-Flash 是 2500 路------高并发批量场景下,Flash 在价格和并发上反而都更合适。

对普通开发者意味着什么

三个实际动作。

第一,错峰。批量任务(数据清洗、批量生成、日志分析)本来就不在乎几小时延迟,挪到闲时跑,成本直接砍一半。高峰时段留给在线交互。

第二,算清缓存账。缓存命中输入涨了 12 倍,但 0.30 元/百万 tokens 依然是全表最低价。把 system prompt、few-shot 示例这些固定前缀尽量命中缓存,多轮对话和 agent 循环里能省不少。可以用这个脚本按新价格快速估算:

python 复制代码
# 按 2026-08-17 起的新价格估算单次调用成本(元)
def cost(price_per_million, tokens):
    return price_per_million * tokens / 1_000_000
peak = {"cache_hit_in": 0.30, "cache_miss_in": 9.0, "out": 27.0}
off  = {"cache_hit_in": 0.15, "cache_miss_in": 4.5, "out": 13.5}

def bill(in_tokens, out_tokens, hit=True, off_peak=False):
    p = off if off_peak else peak
        in_price = p["cache_hit_in"] if hit else p["cache_miss_in"]
            return cost(in_price, in_tokens) + cost(p["out"], out_tokens)
print(bill(2000, 500, hit=True))               # 高峰+缓存命中
print(bill(2000, 500, hit=True, off_peak=True))  # 闲时+缓存命中

第三,别急着信跑分。Agent 基准暴涨的数据目前是孤证,且正式版上线当天就出现过服务波动的前科。接生产环境前,拿自己的任务集做一轮对比,再决定要不要迁移。

第四,重新评估选型。调价后 Flash 高峰输出 9 元/百万 tokens,只有 Pro 的三分之一;如果业务大头是结构化抽取、文本摘要这类任务,Flash 大概率够用。复杂 agent 循环、长链路代码任务再考虑 Pro,但先等第三方复测数据,别只信官方跑分。8月17日新价格生效后,把 API 账单按时段拆开看一遍,确认自己的调用分布落在哪个时段,再决定要不要调整调度策略。

顺带一提,8月13日晚 DeepSeek 还开源了 Agent 框架 DeepSeek Harness(dsh)v0.1 开发者预览版,MIT 协议,装好 Node.js 后运行 npx @deepseek-ai/dsh web 就能在本地启动 Web UI(默认 127.0.0.1:3080)。官方明说后续会有破坏兼容性的改动,适合先当试验品,别急着上生产。

涨价这种事,老板看到的是成本优化空间,我看到的是又得回去改预算表了。不过换个角度想,分时定价本身也是一种信号:算力资源越来越贵,错峰、缓存这些"省着用"的技巧,正在变成 AI 应用的常规技能。你怎么看,评论区聊聊。

相关推荐
湘美书院--湘美谈教育2 小时前
湘美书院主理人谈AI文学:提示词与Skill的与时俱进
大数据·人工智能·安全·自动化·生活
hz567892 小时前
视频会议终端对接详解:协议兼容、系统集成与常见问题
安全·实时音视频·信息与通信
安全指北针3 小时前
AI编程工具供应链安全实战:当你的AI编码助手成为跳板
人工智能·安全·ai编程
迪康Defender3 小时前
AI 重构终端安全运营:智能分析中枢 AI Insight 模块架构与落地场景深度解析
运维·网络·人工智能·其他·安全·重构·架构
0x533 小时前
Java网络编程(二)
java·服务器·网络
XR1234567884 小时前
医院网络安全与等保合规选型指南
安全·web安全
LPCK_202606225 小时前
企业智能体可信安全架构:知识硬约束、执行层拦截与人工终审的技术实现
人工智能·安全·安全架构
西安景驰电子5 小时前
《PTP精确时间协议系列》第一篇:从原理到应用,全面解读IEEE 1588
linux·运维·服务器·开发语言·网络·windows·php
Bruce_Liuxiaowei5 小时前
基于微步在线威胁情报的公网 IP 攻击迹象监测:threatbook_query 脚本全解析与 BruceSec 平台整合实践
数据库·tcp/ip·安全·网络安全·智能体