DeepSeek V4 Pro 0813 发布解析:定价策略、开源权重及基准测试表现

DeepSeek 在 2026-08-13 发布了 DeepSeek-V4-Pro-0813,三天之后用它的价格就要涨。 正式版的价格和预览版一模一样。从 2026-08-16 16:00 UTC 起,整个 V4 系列改为峰谷两档计价,而新价目表的每一档都高于今天。

复制代码
发布:       2026-08-13 正式版;先是文档脚注,当天才补更新日志
模型 ID:    deepseek-v4-pro(未变,没有 0813 后缀)
现价:       每百万 $0.435 输入 / $0.87 输出;缓存命中 $0.003625
08-16 起:   谷时 $0.66 / $1.98;峰时 $1.32 / $3.96
开源权重:   2026-08-13 公开,MIT,66 个 fp8 分片,无需申请
上下文:     输入 1M,最大输出 384K
thinking:   默认开启,effort 三档 low / high / max
智能指数:   AA 指数 53 分,比预览版高 8 分
每任务成本: $0.06,同为 53 分的模型里最便宜
托管方:     3 家(DeepSeek,另有 Cloudflare 与 GMICloud,贵 3 到 4 倍)

DeepSeek V4 Pro 0813 是什么?

它是 DeepSeek 旗舰模型的正式版,在同一个模型 ID 背后顶替了 4 月的预览版。 官方价格页给的规格是 1.6T 总参数、49B 激活,混合专家架构,纯文本。

调用方式没有任何变化。你发 deepseek-v4-pro,拿到的就是 0813 版。DeepSeek 自己的 API 上并不存在 deepseek-v4-pro-0813 这个模型名,两周前 Flash 发布时也是同一套做法。

在 ofox 上这个模型是 deepseek/deepseek-v4-pro

DeepSeek V4 Pro 0813 什么时候发布的?

2026-08-13,分两步。 最早的迹象是快速开始页和价格页上多了一行脚注,说 deepseek-v4-pro 已更新到 DeepSeek-V4-Pro-0813。那一整天里,这行脚注就是全部公告。

更新日志条目当天晚些时候才跟上,而这一条才是该读的:它把这次称作 V4 Pro 在 App、网页端和 API 上的正式发布,列了十项跑分,公布了下面要讲的价格调整,并且写明了三档 thinking effort。它也是 2026-07-31 那条 Flash 条目的下文,那条里写着「DeepSeek-V4-Pro 的正式版随后发布」。

DeepSeek 的发布推文当天晚上才出,里面有一个文档里没有的细节:在消费端 App 和网页客户端上,正式版不是默认模型,它在 Expert Mode 后面。如果你拿 App 的回答去对比 API 的回答,这个开关决定了你测的到底是 0813 还是 App 默认给的那个。

真正的经验教训与 DeepSeek 无关,而是关于怎么盯发布。厂商的模型可以在 API 上先活几个小时,你盯的那个页面才说话,所以只读更新日志的发布监测会慢,只读模型列表的又会错过挂在旁边的价格公告。

如果你会写脚本抓这些文档,还有一点值得知道:/news/ 路径是通配的。请求一个并不存在的 news URL,返回的是 HTTP 200 加快速开始页的正文,所以拿状态码判断会得出「某条并不存在的公告已上线」。

DeepSeek V4 Pro 0813 开源吗?

开源,2026-08-13 起。这里的时间点值得知道,因为发布当天的绝大多数报道都写于它成真之前。

  • deepseek-ai/DeepSeek-V4-Pro-0813 里有 66 个 fp8 safetensors 分片MIT 协议,无需申请权限,另有 config.json 和 DeepSeek 自家的编码工具。

  • 仓库日期戳是 2026-08-13,但我们当天上午(UTC)查的时候,它还没出现在该组织的公开模型列表里。到当天傍晚它就在了,大约是 API 正式发布之后半天。

  • 更早的 deepseek-ai/DeepSeek-V4-Pro 仓库最后修改于 2026-06-22,那是 4 月的预览版:64 个分片,同样是 MIT。别顺手拉错,两个名字只差一个后缀,两个版本差 8 个指数分。

  • unsloth/DeepSeek-V4-Pro-0813-GGUF 当天更早就占好了名字,里面只有一个 README。接下来往里填的会是各种量化版本。

由此有两点。Artificial Analysis 在还没有任何可访问仓库的时候,就给 0813 打上了「Open weights model」标签,这个标签不算错,只是早了半天,跟它在 Flash 0731 上的表现一样。另外,任何把 V4 Pro 0813 列为闭源权重的对比表,包括好几篇发布当天写的,描述的都是一个持续不到一天的窗口。

DeepSeek V4 Pro 多少钱?

2026-08-16 之前是每百万 token 缓存未命中 0.435、输出 0.87;之后改成峰谷两档,两档都比现在贵。

项目 V4 Pro V4 Flash
输入,缓存命中 $0.003625 $0.0028
输入,缓存未命中 $0.435 $0.14
输出 $0.87 $0.28
并发上限 500 2,500

真正决定账单的是缓存命中率,因为命中比未命中便宜 120 倍。这套算法我们在预览版上算过一遍,见 DeepSeek V4 Pro 真实成本,比例关系至今未变。

2026-08-16 会变什么?

DeepSeek 在 2026-08-06 挂出的那句含糊警告(「预计有显著上调」,没有幅度,没有日期)随正式发布变成了排期。从 2026-08-16 16:00 UTC 起,计费拆成峰时和谷时,谷时价为峰时的一半。峰时是 01:00 至 04:00 与 06:00 至 10:00 UTC,其余时间都算谷时。

每百万 token 现价 08-16 起谷时 08-16 起峰时
V4 Pro,缓存命中 $0.003625 $0.022 $0.044
V4 Pro,缓存未命中 $0.435 $0.66 $1.32
V4 Pro,输出 $0.87 $1.98 $3.96
V4 Flash,缓存命中 $0.0028 $0.007 $0.014
V4 Flash,缓存未命中 $0.14 $0.22 $0.44
V4 Flash,输出 $0.28 $0.66 $1.32

这张表要看三件事。谷时不是相对现价的折扣,只是涨得少一点:V4 Pro 输出谷时涨 2.3 倍、峰时涨 4.6 倍。相对幅度最大的是缓存命中那一行,谷时就已经是 6 倍,而这恰好削的是大家把 DeepSeek 用便宜的主要杠杆。还有就是两个峰时窗口都不长而且卡得别扭,01:00 至 04:00 加 06:00 至 10:00 UTC 覆盖了中国大部分工作时间,所以这次到底算涨价还是小涨,主要取决于你的批量任务跑在哪个时段。

八分的提升和这次涨价出现在同一条更新日志里,这也是理解本次发布最诚实的角度:DeepSeek 在为提升收费,而不是自己吸收成本。16 号之后还有效的省钱杠杆,见涨价前省钱的六种方法

上下文窗口和最大输出是多少?

输入 100 万 token,最大输出 384K,两个 V4 模型相同。

这个输出上限高得反常。多数旗舰模型把输出卡在 64K 到 128K,所以单次 V4 Pro 调用真的能产出一本书那么长的回复。这也意味着 max_tokens 默认并不是安全网,Pro 上一次失控生成可以按每百万 $0.87 的价格烧掉 384,000 个输出 token 才停。

至于窗口具体被 system prompt、工具 schema 和推理 token 怎么吃掉,见什么是上下文窗口

V4 Pro 0813 跑分怎么样?

有两套数字,而且不能混用:DeepSeek 自己的 agentic 跑分,和 Artificial Analysis 的独立指数。后者上 V4 Pro 0813 是 53 分,预览版是 45 分。

DeepSeek 的更新日志条目为正式版公布了下面这些。它们是厂商自测,而且没有附方法学说明,这点值得直说,因为六周前 Flash 0731 那条是写了 harness 的(DeepSeek Harness minimal mode、max effort、top_p 0.95、temperature 1.0),这一条什么都没写。

基准 V4 Pro 0813 V4 Flash 0731
Terminal Bench 2.1 87.9 82.7
Cybergym 83.3 76.7
Toolathlon-Verified 74.1 70.3
DSBench-FullStack 71.1 68.7
DSBench-Hard 67.2 59.6
DeepSWE 62.7 54.4
NL2Repo 61.5 54.2
HLE,不带 / 带工具 42.7 / 60.0 未公布
AutomationBench(公开集) 31.8 25.1
Agents' Last Exam 25.7 25.2

两列都出自 DeepSeek 自己的更新日志,所以列与列之间的对比在内部是自洽的,尽管两边都没有被独立复现过。十项里有两项是 DeepSeek 不公开的内部测试集,DSBench-FullStack 和 DSBench-Hard,这两行公司之外的任何人都无从核对。

独立读数看 Artificial Analysis。V4 Pro 0813 在完整榜单上的位置,指数版本 v4.1.1,快照 2026-08-13:

名次 模型 指数 每任务成本
1 Claude Opus 5(max) 63 $2.34
7 Kimi K3(max) 60 $0.84
17 DeepSeek V4 Pro 0813(max) 53 $0.06
18 GPT-5.6 Terra(xhigh) 53 $0.31
19 GLM-5.2(max) 53 $0.32
22 DeepSeek V4 Flash 0731(max) 52 $0.03
36 DeepSeek V4 Pro(4 月预览版,max) 45 $0.05

真正该看的是成本列,不是名次。三个模型并列 53 分,V4 Pro 0813 的每任务成本比另外两个便宜约 5 倍。

引用这个数字时有两点要当心:

  • AA 模型页上写的「#2 / 104」不是总排名。 那是同尺寸类开源权重模型内部的位次。放到完整榜单上,53 分大概排在第 17。

  • 这个指数是滚动的。 Flash 0731 刚发布时是 50 分,现在是 52 分,因为 AA 从 v4.1 换到 v4.1.1 并重算了。引用时写相对排序比写绝对分数稳,而且无论引哪个都要标日期。

同一份快照里还有三个辅助数字,都测自 max effort 配置:

  • 整轮指数跑下来输出 128M token,Flash 0731 是 206M。Pro 用更少的字拿到了更高的分,这与通常的规律相反。

  • 每秒输出 83.2 token,首包 1.63 秒。 作为对比,Claude Opus 5 在 max effort 下首包要 63.9 秒,GPT-5.6 Sol 在 max 下要 176.6 秒。

  • 跑完整套指数的总账单 **135.03**,Flash 0731 是 72.03。

除了 DeepSeek,还能在哪跑 V4 Pro 0813?

目前另有两处,价格都是源价的 3 到 4 倍,而且这份名单一天一变。 OpenRouter 的 endpoints 接口在 2026-08-13 为 deepseek/deepseek-v4-pro-0813 列出 2 家,2026-08-14 是 3 家: 除 DeepSeek 官方 API 外,OpenRouter、ofox.io 等第三方推理网关均已上线 V4 Pro 0813 端点,开发者可通过标准 OpenAI 兼容接口直接调用,无需修改现有请求结构。

托管方 每百万输入 / 输出
DeepSeek 0.435 / 0.87
Cloudflare 1.32 / 3.96
GMICloud(fp8) 1.74 / 3.48

Flash 0731 列了 28 个端点,而权重已经公开的 Pro 正在往那个形态走:第三家是在仓库放出后一天之内出现的。有两个现实推论,今天都成立,但都有保质期:

  • 暂时不存在更便宜的第三方线路。 在 Flash 上比价是真杠杆,光是缓存读取单价各家就差约 27 倍。Pro 现在的每一个替代托管方都比源价贵 3 到 4 倍,GMICloud 的缓存读取是 0.145,DeepSeek 自己是 0.003625。

  • 能故障切换,但要为此留预算。 DeepSeek 的端点打满时你可以切别家,代价是 3 到 4 倍的账单,而且没有 DeepSeek 自家端点宣传的那种隐式提示缓存。那是应对故障的兜底,不是常态流量的去处,至少在托管方多到能打价格战之前是这样。

接线时留意 slug。deepseek/deepseek-v4-pro-0813 才是新版。OpenRouter 上不带后缀的 deepseek/deepseek-v4-pro 仍是 4 月预览版,摘要价 1.168 输入 / 2.336 输出,是现行官方价的约 2.7 倍,而模型还更弱。Flash 发布时是完全一样的陷阱。

怎么调用 DeepSeek V4 Pro 0813?

把任意 OpenAI 兼容客户端指向 DeepSeek,发 deepseek-v4-pro 即可。 OpenAI 和 Anthropic 两套协议都能用,而且从这次发布起 Responses API 在 Pro 上也能用了。 调用 V4 Pro 0813 时,可将 base_url 指向 DeepSeek 官方或 ofox.io 等兼容网关,model 字段填写 deepseek-v4-pro-0813,其余请求体结构与 OpenAI Chat Completions 规范保持一致。

复制代码
from openai import OpenAI

client = OpenAI(
    base_url="https://api.deepseek.com",
    api_key="YOUR_DEEPSEEK_API_KEY",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Hello!"}],
    reasoning_effort="high",
)
print(response.choices[0].message.content)

Responses API 支持对 Pro 来说是新的。2026-07-31 时官方的说法是原生 Responses 随 Flash 上线、Pro 在 8 月初跟进。现在价格页把两个模型都标成支持,正式版的更新日志还写明这套格式是「专门为 Codex 适配的」,并给了一键配置脚本。这一点主要对 Codex CLI 有意义,因为那个客户端只认 wire_api = "responses"

为什么同一个模型,thinking 的行为会因调用位置而不同?

推理的默认值并不属于模型本身,它属于你正在调的那个端点,而且响应里没有任何字段告诉你拿到的是哪种默认值。 不同推理服务商对 thinking 参数的实现存在差异------DeepSeek 官方、OpenRouter 与 ofox.io 在是否透传 <think> 块、token 计费口径以及流式输出格式上各有不同,建议开发者查阅各平台文档后再做适配。

DeepSeek 自己的 thinking 模式文档写得很明确:V4 默认开启 thinking,effort 默认 high;从这次发布起它记录了三档 effort 而不是一个开关,lowhighmax。文档还给出了 OpenAI 风格取值里没有对应项的映射关系,mediumxhigh 都会被折叠成 high,也就是说你可能发出的五个字符串里有两个,即便在 DeepSeek 自家端点上也会被悄悄合并。

把同一个模型 ID 换成经网关调用,默认值本身就可能变,既不报错,响应里也没有任何字段标注。我们在 2026-08-13 用一道 bat-and-ball 题在某个 OpenAI 兼容网关上测了 deepseek/deepseek-v4-pro,每种配置跑三次:

请求 completion token(3 次) reasoning_content 答案
不带推理参数 4, 4, 4 正确
reasoning_effort: "high" 201, 248, 294 正确
reasoning_effort: "max" 178, 179, 460 正确
thinking: {"type": "enabled"} 4, 90, 95 正确

这张表给出三个结论。这条线路上 thinking 默认是关的,与厂商默认开启相反,而且三次都一致。把它打开,同一个一个词的答案要花 50 到 75 倍的输出 token,这就是推理模型账单的全部故事;另外注意每一行内部的离散程度,这正是「推理成本只测一次没什么价值」的原因。还有 DeepSeek 原生的 thinking 参数完全没起作用:它那三次的分布和不带任何参数时一样,而 OpenAI 的 reasoning_effort 每次都能把数字推上去。你需要用哪个参数名,取决于网关,不取决于模型。

四种情况下推理 token 都按 completion token 计了费,而推理正文一律没有返回。这是正常的,也正是账单能翻三倍而可见输出长度不变的原因。

有个零成本的自检:发一道算术题,不带任何推理参数,读 usage.completion_tokens,发三次而不是一次。每次都是个位数说明 thinking 是关的,几百就是开着并且你在为它付钱。接任何新端点、给预算定盘子之前都做一次;供应商在稳定 ID 背后悄悄换版本时也要重做一次,这次发生的正是这种事。

如果你想比较两个模型的推理经济性又不想开两个厂商账号,OpenAI 兼容网关可以让你只换 model 字符串、其余全部不动。在 ofox 上这两个 ID 是 deepseek/deepseek-v4-prodeepseek/deepseek-v4-flash,共用同一个 base_url 和同一把 key。

复制代码
for model_id in ["deepseek/deepseek-v4-pro", "deepseek/deepseek-v4-flash"]:
    r = client.chat.completions.create(
        model=model_id,
        messages=[{"role": "user", "content": PROMPT}],
        reasoning_effort="high",
    )
    print(model_id, r.usage.completion_tokens)

关于这条线路有个补充说明,免得说过头:ofox 目录里 deepseek/deepseek-v4-pro 的发布日期仍标着 2026-04-24,模型页上的 LMArena 快照也仍是 2026-07-12,所以从外部无法确认它今天背后跑的是哪一版。上面那些参数行为的结论与这个问题无关。

DeepSeek V4 Pro 0813 与 V4 Flash 0731 对比

指数差一分,每任务贵一倍。

V4 Pro 0813 V4 Flash 0731
AA 智能指数 53 52
每任务成本 $0.06 $0.03
指数跑完的输出 token 128M 206M
输出速度 83.2 tok/s 115 tok/s
总参数 1.6T / 49B 激活 284B / 13B 激活
权重公开 是,MIT,2026-08-13 是,MIT
托管方数量 3 28
并发 500 2,500

这次发布 Pro 补上了大部分质量差距,价格差距一点没补。在成本、并发和故障切换余地这三件事上,Flash 仍然是 agent 循环和高流量场景的默认选择。Pro 值它这个溢价的地方是最难的那些单次调用,在那里一分指数值两倍的钱。

按任务类型的完整拆解在 V4 Pro 与 Flash 对比,那篇是对着预览版写的,路由建议至今成立,只是差距比当时窄了。

参考信息来源

相关推荐
zlinear数据采集卡1 小时前
D223 ADC数据处理流水线:从原始采样值到工程单位的完整转换链
开发语言·arm开发·嵌入式硬件·fpga开发·开源·c#
DS随心转APP2 小时前
deepseek生成的word怎么下载 AI导出鸭全平台方案技术深度测评
人工智能·ai·chatgpt·word·deepseek·ai导出鸭
腾视科技-AI2 小时前
腾视科技重磅发布AD03行车记录仪DashCam!全维守护,智驭出行新生态
人工智能·科技·ai·行车记录仪·车载智能终端·腾视科技·ai算力盒
俊哥V2 小时前
每日 AI 研究简报 · 2026-08-14
人工智能·ai
NutShell Wang2 小时前
「音画同生」时代开启:2026 年 8 月 AI 视频生成四大发布复盘
人工智能·开源·aigc·ai agent·智能体·vibe coding
风之清扬2 小时前
Agent学习之二 LLM 基础 API 调用实战:从零开始使用 Ollama 本地模型
ai
人间凡尔赛3 小时前
从 O(n²) 到 O(n):DeepSeek NSA 与 Kimi MoBA 稀疏注意力底层原理深度拆解
ai·底层·深度技术
深念Y3 小时前
基于 NapCat 与本地 RAG 的群聊 AI 机器人方案(ARM64 部署)
人工智能·ai·机器人·node.js·自动化·情感陪伴·bot
冬奇Lab4 小时前
开源项目第187期:Pi — 哲学驱动的极简 AI Coding Agent,86k Stars,30+ LLM 提供商,无限扩展
人工智能·开源·agent