DeepSeek V4 Pro 正式版深度解析:Agent能力跃升、双生态API与峰谷定价全解读
2026年8月13日,DeepSeek正式推出 DeepSeek V4 Pro 正式版(版本号 DeepSeek-V4-Pro-0813),Agent能力大幅提升,多项指标逼近全球顶级大模型,官方同步宣布8月17日起API实行峰谷调价。本文将从架构原理、Agent能力、API生态、思考模式、成本优化、Harness开源框架等维度进行超过8000字的全面拆解,并附8个实战代码示例。

一、发布始末:一场没有发布会的发布
2026年8月12日深夜,如果你睡前习惯刷一眼DeepSeek的API文档,会发现自己差点错过一场没有请柬的发布。
没有发布会,没有倒计时,没有铺天盖地的预热海报。官网的API文档悄悄刷新了:模型还是那个deepseek-v4-pro,价格页的代号却已经从Preview换成了DeepSeek-V4-Pro-0813,fingerprint更新为fp_v4pro_20260812。等到社区炸开锅,已经是第二天早上的事。
距离4月24日预览版上线,刚好111天。这111天里,Kimi K3高调发布抢走了开源头条,V4 Flash正式版抢先一步在7月31日上线,官方还放出了"近期整体上调API定价、预计涨幅较大"的预告。所有人都在等Pro的正式版------结果它在一个周三的深夜,用最DeepSeek的方式登场:官方一个字没发,API先能调了。
8月13日,DeepSeek官方正式发布确认:DeepSeek V4 Pro正式版已同步在APP、网页端和API更新上线。用户可以通过APP或网页端选择"专家模式"使用全新的V4 Pro正式版模型,API模型名不变,仍为deepseek-v4-pro。
值得注意的是,正式版发布同日,DeepSeek还同步开源了Agent运行框架 DeepSeek Harness(开发者预览版v0.1,MIT协议),这标志着DeepSeek从"模型提供商"向"模型+框架提供商"的战略升级。
二、架构总览:1.6T参数MoE与百万上下文

2.1 硬规格:架构与预览版完全一致
正式版的硬规格与预览版完全一致------1.6万亿总参数、490亿激活参数的MoE(混合专家)结构,1M(100万token)上下文窗口,384K最大输出。变化的全部集中在后训练,而幅度大到像换了一个模型。
| 参数 | 规格 |
|---|---|
| 架构 | MoE(混合专家) |
| 总参数量 | 1.6万亿(1.6T) |
| 激活参数量 | 490亿(49B) |
| 上下文长度 | 1M(100万token) |
| 最大输出长度 | 384K token |
| 模型版本号 | DeepSeek-V4-Pro-0813 |
| Fingerprint | fp_v4pro_20260812 |
| 开源协议 | MIT |
2.2 结构创新:全新混合注意力机制
DeepSeek-V4开创了一种全新的注意力机制,在token维度进行压缩,结合DSA稀疏注意力(DeepSeek Sparse Attention)和重度压缩注意力(HCA),实现了全球领先的长上下文能力。
具体来说,V4-Pro在1M上下文下,单token推理FLOPs仅为V3.2的27% ,KV缓存仅为V3.2的10%。这意味着,尽管上下文窗口扩展到100万token,推理和显存的消耗却没有线性增长,而是通过架构创新实现了大幅压缩。
从现在开始,1M上下文将是DeepSeek所有官方服务的标配。这对于需要处理超长文档、大型代码仓库、长对话历史的Agent场景来说,是基础设施级的提升。
2.3 开源与本地部署
DeepSeek-V4模型权重以MIT协议开源,开发者可在以下平台获取:
- HuggingFace :
https://huggingface.co/collections/deepseek-ai/deepseek-v4 - ModelScope :
https://modelscope.cn/collections/deepseek-ai/DeepSeek-V4 - 技术报告 :
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf
MIT协议意味着模型可以免费用于商业用途,这对于企业级部署来说是一个极大的利好。
三、Agent能力跃升:从"会考试"到"会干活"

3.1 基准测试:全面暴涨
真正夸张的数字来自Agent相关评测。以下是预览版与正式版在关键Agent基准上的跃迁幅度:
| 评测集 | Preview分数 | 正式版分数 | 提升幅度 |
|---|---|---|---|
| DeepSWE(软件工程) | 12.8 | 62.7 | +49.9 |
| DSBench-Hard | 31.1 | 67.2 | +36.1 |
| CyberGym(安全攻防) | 52.7 | 83.3 | +30.6 |
| AutomationBench | 12.8 | 31.8 | +19.0 |
| Terminal Bench | 72.1 | 87.9 | +15.8 |
这些评测没有一道是传统选择题或文本生成题,全是真实环境下的多步骤任务:终端操作、仓库级代码生成、工具调用、安全模拟。它们恰好也是预览版最容易翻车的地方------此前V4-Pro-Preview的Agent能力被普遍认为"鸡肋",跑基准还行,真让它下场干活就露馅。
其中最值得关注的是 DeepSWE ------这个基准专门考察AI编程Agent的长周期软件工程能力,要求模型真正进入一个复杂的开源代码仓库,自主理解代码、修改多个文件、运行测试并不断修正,最终完成一个完整的软件工程任务。得分从12.8直接提升至62.7,暴涨近5倍。
3.2 后训练范式重构
从V4 Flash正式版的更新日志可以推断出这轮升级的思路:面向代码Agent场景的大规模后训练。Flash版已经用同一套方法把Agent能力做到了"基准测试远超V4-Pro-Preview"的程度,Pro正式版只是补上了同一课。
如此幅度的跃迁不太可能来自单一优化,更可能是整套Agent后训练管线换了底层范式:
- 大规模合成工具调用轨迹:让模型在合成数据中学习如何正确规划、调用工具、处理异常
- 强化规划与反思能力:通过强化学习让模型学会在复杂任务中"先想后做"和"做后反思"
- 把1M上下文真正用起来:让模型在长链路任务里"看到全局",而不是只关注当前步骤
一句话总结这个变化:如果说预览版是会考试的学霸,正式版就是能下场干活的实习生。
3.3 与全球顶级模型的横向对比
DeepSeek官方发布了覆盖10项智能体基准测试的横向对比结果。在Claude Fable 5或其他模型占优的8项测试里,DeepSeek-V4-Pro-0813与之相比性能差距都十分微小。
综合所有测试,Fable 5平均领先幅度为5.3% 。如果剔除"无工具版人类终极考试"这一极端样本(DeepSeek得分42.7,Fable 5为53.3,存在10.6%的差距,大幅拉高整体差值),剩余项目平均差距仅2.8%。
更值得关注的是,在专门考察以下能力的基准测试中,DeepSeek-V4-Pro-0813反超 Fable 5:
- CyberGym:AI网络安全攻防能力
- AutomationBench(Public):AI Agent自动化能力
但需要客观看待的是,V4 Pro并非一张"全面碾压"的成绩单------HLE无工具42.7分,落后Claude Opus 4.8的49.8和Fable 5的53.3;NL2Repo 61.5落后Opus 4.8的69.7。纯知识推理和最复杂的软件工程任务还没坐上头把交椅。
四、多模态补课:Agent的"眼睛"到货

另一个被很多人忽略的变化是多模态。预览版是纯文本模型,正式版首次原生支持图像推理------DeepThink引擎现在可以在同一个思考流程里分析图片、解读截图、处理混合文档。
这对普通聊天场景影响不大,但对Agent场景是从无到有的突破:
- 截图分析UI状态:Agent可以"看到"当前屏幕,判断操作是否成功
- 读取图表数据:从图片中提取结构化数据,用于后续分析
- 解析文档扫描件:处理PDF扫描件、发票、合同等图像化文档
这些"看图干活"的需求过去只能靠外挂视觉模型凑合,现在一条链路就能完成。补齐视觉能力之后,Agent栈才第一次凑齐了"眼、脑、手"三件套:
| 能力 | 对应组件 | 状态 |
|---|---|---|
| 视觉感知(图像推理) | "眼" | 正式版新增 |
| 推理思考(思考模式) | "脑" | 预览版已有 |
| 工具调用(Tool Calls) | "手" | 预览版已有 |
五、双生态API兼容:迁移成本归零

开发者体验是这次升级里最容易被忽视、但也最锋利的一刀。正式版同时提供OpenAI与Anthropic两套兼容接口,外加Responses API正式支持:
| 接口类型 | Base URL | 说明 |
|---|---|---|
| OpenAI ChatCompletions | https://api.deepseek.com |
原有base_url不用动,改model即可 |
| Anthropic API | https://api.deepseek.com/anthropic |
Claude代码改个baseURL就能跑 |
| Responses API | https://api.deepseek.com |
原生支持,可对接Codex |
此外还支持以下功能:
- 原生Tool Calls / JSON Output:结构化输出开箱即用
- 对话前缀续写(Beta):面向长对话连续性优化
- FIM补全(Beta):面向IDE补全场景(仅非思考模式支持)
翻译成人话:你之前给Claude写的整套代码,改一个baseURL就能直接喂给v4-pro。不管你此前的技术栈是OpenAI还是Anthropic,迁移成本约等于零。这种"生态兼容"策略比单纯堆参数更能撬动存量开发者------毕竟让工程师换模型的最大阻力从来不是模型好坏,而是改代码的成本。
代码示例1:OpenAI SDK基础调用
python
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro", # 默认思考模式
messages=[
{"role": "system", "content": "你是资深代码审查专家。"},
{"role": "user", "content": "审查下面这段5000行的Django视图代码,指出潜在性能瓶颈。"}
],
max_tokens=8192,
)
print(resp.choices[0].message.content)
如需非思考模式,把model换成deepseek-v4-pro-no-think即可。
代码示例2:Anthropic SDK调用
python
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com/anthropic",
)
msg = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "将这份80万tokens的日志文件压缩为10条关键错误摘要。"}]
)
print(msg.content[0].text)
六、思考模式深度解析

6.1 三档思考强度
DeepSeek模型的思考模式在输出最终回答之前,会先输出一段思维链内容,以提升最终答案的准确性。正式版带来了更灵活的思考强度控制:
V4-Pro和V4-Flash思考模式现支持 low / high / max 三档思考强度:
| 思考强度 | 适用场景 | 说明 |
|---|---|---|
| low | 简单任务 | 快速响应,轻量推理 |
| high | 日常Agent任务 | 默认强度,平衡速度与质量 |
| max | 高度复杂任务 | 最大推理深度,适合最难的问题 |
需要注意的兼容性处理:出于兼容考虑,low、medium会映射为high,xhigh会映射为max。
此外,对一些复杂Agent类请求(如Claude Code、OpenCode),effort会自动设置为max,无需手动干预。
6.2 参数控制方式
| 控制项 | OpenAI格式 | Anthropic格式 |
|---|---|---|
| 思考模式开关 | {"thinking": {"type": "enabled/disabled"}} |
同左 |
| 思考强度控制 | {"reasoning_effort": "high/max"} |
{"output_config": {"effort": "high/max"}} |
默认思考开关为enabled。在使用OpenAI SDK设置thinking参数时,需要将其传入extra_body中。
6.3 输入输出参数说明
思考模式不支持 temperature、top_p、presence_penalty、frequency_penalty参数。设置这些参数不会报错(为了兼容已有软件),但也不会生效。
在思考模式下,思维链内容通过reasoning_content参数返回,与content同级。多轮对话拼接规则如下:
- 如果模型未进行工具调用 ,则中间
assistant的reasoning_content无需参与上下文拼接 - 如果模型进行了工具调用 ,则中间
assistant的reasoning_content需参与上下文拼接,在后续所有轮次中必须回传给API
代码示例3:思考模式调用
python
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "user", "content": "9.11和9.8,哪个更大?请仔细分析。"}
],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}},
)
# 获取思维链内容
reasoning_content = response.choices[0].message.reasoning_content
# 获取最终回答
content = response.choices[0].message.content
print("=== 思维链 ===")
print(reasoning_content)
print("=== 最终回答 ===")
print(content)
代码示例4:思考模式下的工具调用
python
import os
import json
from openai import OpenAI
from datetime import datetime
client = OpenAI(
api_key=os.environ.get('DEEPSEEK_API_KEY'),
base_url="https://api.deepseek.com",
)
# 定义工具
tools = [
{
"type": "function",
"function": {
"name": "get_date",
"description": "获取当前日期",
"parameters": {"type": "object", "properties": {}},
}
},
{
"type": "function",
"function": {
"name": "get_weather",
"description": "获取指定地点和日期的天气",
"parameters": {
"type": "object",
"properties": {
"location": {"type": "string", "description": "城市名称"},
"date": {"type": "string", "description": "日期,格式YYYY-mm-dd"},
},
"required": ["location", "date"]
},
}
},
]
# 模拟工具实现
def get_date_mock():
return datetime.now().strftime("%Y-%m-%d")
def get_weather_mock(location, date):
return "多云 7~13°C"
TOOL_CALL_MAP = {
"get_date": get_date_mock,
"get_weather": get_weather_mock
}
def run_turn(messages):
sub_turn = 1
while True:
response = client.chat.completions.create(
model='deepseek-v4-pro',
messages=messages,
tools=tools,
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}},
)
# 关键:必须将完整message(含reasoning_content)拼接回去
messages.append(response.choices[0].message)
tool_calls = response.choices[0].message.tool_calls
print(f"子轮次 {sub_turn}: reasoning={response.choices[0].message.reasoning_content[:50] if response.choices[0].message.reasoning_content else 'None'}...")
if tool_calls is None:
print(f"最终回答: {response.choices[0].message.content}")
break
for tool in tool_calls:
tool_function = TOOL_CALL_MAP[tool.function.name]
tool_result = tool_function(**json.loads(tool.function.arguments))
print(f"工具 {tool.function.name} 返回: {tool_result}")
messages.append({
"role": "tool",
"tool_call_id": tool.id,
"content": tool_result,
})
sub_turn += 1
# 启动对话
messages = [{"role": "user", "content": "杭州明天的天气怎么样?"}]
run_turn(messages)
关键注意事项 :在思考模式下进行工具调用时,reasoning_content必须在后续所有请求中完整回传给API。如果未正确回传,API会返回400报错。最简单的方式是直接messages.append(response.choices[0].message),这行代码等价于完整拼接role、content、reasoning_content和tool_calls。
6.4 实战避坑:thinking模式的甜蜜陷阱
跑分好看只是门票,真正有意思的是拿真实任务去试。以下是一个真实翻车案例:
寻路算法可视化任务:要求实现BFS、DFS、A*三种算法的逐步动画、可交互网格画墙、迷宫自动生成。开着默认的thinking模式,V4 Pro用满了16384个token的输出配额,其中13394个花在了"思考"上,留给实际代码的不到3000个token------HTML写到一半直接截断。
关掉thinking模式重跑,54秒输出完整的715行代码,寻路动画、迷宫生成、暗色主题一应俱全。
经验教训 :thinking模式在复杂代码生成场景下,推理token可能占到输出的80%以上 ,反而挤压了实际内容的空间。对于需要大段代码输出的任务,要么主动关闭thinking,要么大幅提高max_tokens兜底。
七、Responses API与Codex集成

7.1 原生支持Responses API
DeepSeek API现已原生支持OpenAI Responses API格式,并针对性适配Codex。这意味着开发者可以直接使用Codex CLI、ChatGPT桌面端、VS Code的Codex插件等工具链,通过DeepSeek模型进行AI编程。
Codex的各个客户端形态共用同一份配置文件,按官方文档配置一次,即可在所有形态使用DeepSeek模型。
7.2 Codex一键配置
DeepSeek提供了一键配置脚本,自动完成全部配置:
macOS / Linux:
bash
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)
Windows PowerShell:
powershell
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
脚本会依次完成以下工作:
- 备份现有配置 :将
~/.codex/config.toml备份到~/.codex/backup-deepseek/ - 写入模型目录
~/.codex/models.json:向Codex声明DeepSeek模型的元数据 - 修改
~/.codex/config.toml:新增[model_providers.deepseek]配置段 - 校验:写入前校验语法合法性,校验失败则中止,不修改任何文件
7.3 手动配置config.toml
如果不愿意使用脚本,也可以手动编辑配置文件。核心配置段如下:
toml
[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
env_key = "DEEPSEEK_API_KEY"
wire_api = "responses"
[profiles.deepseek-v4-pro]
model = "deepseek-v4-pro"
model_provider = "deepseek"
配置完成后,在Codex CLI中通过codex --profile deepseek-v4-pro即可使用DeepSeek模型进行编程。
代码示例5:Responses API直接调用
python
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com",
)
# 使用Responses API格式调用
response = client.responses.create(
model="deepseek-v4-pro",
input=[
{
"role": "user",
"content": "用Python实现一个线程安全的LRU缓存,要求支持过期时间和容量限制。"
}
],
reasoning={"effort": "high"},
max_output_tokens=8192,
)
print(response.output_text)
八、缓存策略与成本优化

8.1 缓存命中价:0.025元背后的120倍差距
价格方面,当前每百万token输入3元、输出6元,与预览期持平。但真正值得盯的不是裸价,而是缓存命中价------0.025元/百万token,基本等于白嫖。
把Pro和Flash摆在一起看:
| 模型 | 缓存命中输入 | 缓存未命中输入 | 输出 | 并发上限 |
|---|---|---|---|---|
| DeepSeek-V4-Pro-0813 | 0.025元 | 3元 | 6元 | 500 |
| DeepSeek-V4-Flash-0731 | 0.02元 | 1元 | 2元 | 2500 |
两个关键信息:
- Pro的裸价是Flash的3倍,但缓存命中价几乎持平
- 并发上限从2500砍到500,说明官方用并发配额做算力调度,把Pro定位成高价值、低频次的复杂任务模型
8.2 长文档场景的缓存威力
缓存策略的实际威力在于长文档场景------同一份系统提示+大文档反复提问,输入成本从3元/百万直接降到0.025元/百万,相差120倍。
代码示例6:长文档缓存策略
python
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com",
)
SYSTEM = "你是合同审查助手,按风险等级标注异常条款。"
DOC = open("huge_contract.txt", encoding="utf-8").read() # 约900k tokens
questions = [
"列出所有违约责任条款。",
"找出金额超过500万的支付节点。",
"汇总所有不可抗力的定义。",
"检查是否存在对乙方不利的管辖权条款。",
"提取所有保证与承诺条款。",
]
# 第一次请求:缓存前缀(系统提示+文档)
# 后续请求:命中缓存,输入成本直降120倍
for i, q in enumerate(questions):
resp = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": SYSTEM},
{"role": "user", "content": f"{DOC}\n\n问题:{q}"}
],
max_tokens=4096,
)
print(f"问题{i+1}: {q}")
print(f"回答: {resp.choices[0].message.content[:200]}...")
print(f"Token用量: 输入{resp.usage.prompt_tokens}, 输出{resp.usage.completion_tokens}")
print(f"缓存命中: {resp.usage.prompt_cache_hit_tokens if hasattr(resp.usage, 'prompt_cache_hit_tokens') else 'N/A'}")
print()
首次请求缓存前缀(系统提示+文档),后续命中缓存,输入成本直降。这对于需要反复分析同一份大文档的场景(合同审查、代码审查、日志分析等)来说,是成本优化的杀手锏。
代码示例7:流式输出与思考链处理
python
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "分析这段代码的时间复杂度并给出优化建议:\n" + open("code.py").read()}],
stream=True,
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}},
)
reasoning_content = ""
content = ""
for chunk in response:
delta = chunk.choices[0].delta
# 分别处理思维链和最终回答
if hasattr(delta, 'reasoning_content') and delta.reasoning_content:
reasoning_content += delta.reasoning_content
print(f"[思考] {delta.reasoning_content}", end="", flush=True)
elif delta.content:
content += delta.content
print(f"[回答] {delta.content}", end="", flush=True)
print("\n\n=== 完整思维链 ===")
print(reasoning_content)
print("\n=== 最终回答 ===")
print(content)
九、峰谷定价机制详解

9.1 定价调整公告
随着DeepSeek V4全系列模型正式版上线,官方宣布将对API价格进行更新调整。为了更加合理地调配资源,采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。
新价格将于北京时间2026年8月17日0时开始生效。
9.2 峰谷时段定义
| 时段类型 | 时间范围(北京时间) |
|---|---|
| 高峰时段 | 每日 9:00-12:00、14:00-18:00 |
| 空闲时段 | 其余所有时间(含夜间、午休、周末、节假日) |
9.3 新旧价格对比
当前价格(8月17日前):
| 模型 | 缓存命中输入 | 缓存未命中输入 | 输出 |
|---|---|---|---|
| deepseek-v4-pro | 0.025元 | 3元 | 6元 |
| deepseek-v4-flash | 0.02元 | 1元 | 2元 |
新价格(8月17日起,单位:元/百万tokens):
| 模型 | 时段 | 缓存命中输入 | 缓存未命中输入 | 输出 |
|---|---|---|---|---|
| deepseek-v4-flash | 空闲时段 | 0.05 | 1.5 | 4.5 |
| deepseek-v4-flash | 高峰时段 | 0.10 | 3.0 | 9.0 |
| deepseek-v4-pro | 空闲时段 | 0.15 | 4.5 | 13.5 |
| deepseek-v4-pro | 高峰时段 | 0.30 | 9.0 | 27.0 |
9.4 涨价幅度分析
以V4-Pro高峰时段为例,与当前价格对比:
- 缓存命中输入:0.025元 → 0.30元(涨12倍)
- 缓存未命中输入:3元 → 9元(涨3倍)
- 输出:6元 → 27元(涨4.5倍)
但空闲时段价格相对温和:
- 缓存未命中输入:4.5元(比当前涨50%)
- 输出:13.5元(比当前涨125%)
9.5 成本优化建议
面对涨价,以下策略可以帮助企业有效控制成本:
- 错峰调度:将批量处理任务、长文档分析等非实时任务安排在空闲时段执行,成本直接减半
- 最大化缓存命中:对长文档场景,保持系统提示和文档内容的一致性,让缓存命中率最大化
- Pro/Flash搭配使用:简单任务用Flash(并发上限2500),复杂任务用Pro(并发上限500),按需选择
- 思考强度按需设置:简单任务用low,日常Agent任务用high,只有最复杂的任务才用max
- 提前充值:当充值余额与赠送余额同时存在时,优先扣减赠送余额,建议在涨价前做好预算规划
十、DeepSeek Harness开源框架

10.1 什么是DeepSeek Harness
8月13日,DeepSeek不仅发布了V4 Pro正式版,还同步开源了Agent运行框架 DeepSeek Harness(开发者预览版v0.1,MIT协议)。
DeepSeek Harness(命令行工具名dsh)是一套Agent运行框架,不是新模型。其核心设计理念是**"一切皆插件"**------基于Cordis插件系统构建,模型、工具、技能、会话、沙箱、存储、循环、调度等所有组件都是可替换的插件。
10.2 架构理念
Harness的核心公式是:
ini
Agent = 大脑(模型)+ 手脚(工具)+ 工具箱(框架)+ 循环(Agent Loop)
传统Agent框架通常将模型调用、工具执行、循环控制耦合在一起,而Harness通过"一切皆插件"的架构,让每个环节都可以独立替换和扩展:
| 组件 | 说明 | 可替换性 |
|---|---|---|
| 模型插件 | 支持DeepSeek全系列模型,也可接入其他模型 | 完全可替换 |
| 工具插件 | 文件操作、代码执行、网络请求等 | 完全可扩展 |
| 技能插件 | 代码生成、文档分析、数据处理等 | 完全可扩展 |
| 会话插件 | 对话状态管理、上下文压缩 | 完全可替换 |
| 沙箱插件 | 安全执行环境隔离 | 完全可替换 |
10.3 快速上手
Harness可通过npx快速启动:
bash
npx @deepseek-ai/deepseek-harness
或全局安装后使用:
bash
npm install -g @deepseek-ai/deepseek-harness
dsh # 启动交互式Agent
10.4 评测中的Harness
值得注意的是,在官方发布的Agent基准测试中,DeepSeek-V4-Pro-0813使用了DeepSeek Harness极简模式作为框架进行测试(使用max档位,topp=0.95,temperature=1.0)。这意味着官方的跑分数据是在自家框架下取得的,其他框架下结果可能略有不同。
这也暗示了一个趋势:DeepSeek正在把模型和Agent运行框架打包推出,竞争从"谁的模型更聪明"进入下一阶段------比谁能把大脑、手脚和工具箱组装成一个真正替人干活的系统。
十一、与全球顶级模型的成本对比

11.1 价格对比
如果性能只是接近,那么价格可能才是V4 Pro 0813最值得关注的地方。
| 模型 | 输入(美元/百万token) | 输出(美元/百万token) | 缓存命中输入 |
|---|---|---|---|
| DeepSeek V4 Pro | 0.435 | 0.87 | 0.003625 |
| Anthropic Fable 5 | 10 | 50 | - |
| Grok 4.6 | 2 | 6 | - |
综合折算均价:Fable 5约30美元,V4 Pro约0.65美元,前者成本大约是后者46倍。
11.2 单任务成本对比
据Hugging Face CEO Clem估算,测试的各型号每项任务的成本差异高达800倍:Claude Fable 5在基准测试中领先,但平均每项任务的成本超过31美元,而DeepSeek V4 Flash (max)的成本仅为0.04美元。
11.3 开发者实测对比
在HN讨论区,一位名为jklmnopqrstuvw的网友直接把V4 Pro 0813和Grok 4.6放进Codex CLI,对同一个新功能进行开发测试:
| 模型 | 耗时 | 成本 | 结果 |
|---|---|---|---|
| V4 Pro 0813 | 12分02秒 | 0.12美元 | 出现Bug |
| Grok 4.6 | 3分18秒 | 1.41美元 | 无Bug |
这个结果比"某个Benchmark超过了多少"更有意思------它恰恰说明,真实的软件开发中,模型能力并不是一个简单的分数。V4 Pro虽然便宜了10倍以上,但在速度和一次通过率上仍有提升空间。当然,也有人提醒,不应该拿一次实验就给模型下结论,Agent本身具有很强的随机性。
十二、实战避坑指南
基于社区反馈和实际测试,以下是接入DeepSeek V4 Pro正式版时需要注意的关键问题: 在这里插入图片描述
12.1 thinking模式的token陷阱
如前文所述,thinking模式在复杂代码生成场景下,推理token可能占到输出的80%以上,挤压实际内容空间。解决方案:
- 简单文本任务 :保持thinking模式,设置
reasoning_effort="low" - 代码生成任务 :关闭thinking模式(model改为
deepseek-v4-pro-no-think),或大幅提高max_tokens - Agent多步任务:保持thinking模式max档位,这是Agent场景的最佳配置
12.2 并发限制
V4-Pro的并发上限为500(V4-Flash为2500)。对于高并发场景,建议:
- 使用队列管理请求,避免超出并发限制
- Pro/Flash搭配使用,简单请求路由到Flash
- 考虑在空闲时段集中处理批量任务
12.3 工具调用中的reasoning_content回传
这是最容易踩的坑:在思考模式下进行工具调用时,reasoning_content必须在后续所有轮次中完整回传。如果未正确回传,API会返回400报错。
最简单的处理方式是直接messages.append(response.choices[0].message),让SDK自动处理所有字段的拼接。
12.4 缓存策略设计
缓存命中价(0.025元)与未命中价(3元)相差120倍,缓存策略的设计直接影响成本:
- 将固定的系统提示放在messages最前面
- 长文档内容紧跟系统提示之后
- 变化的问题内容放在最后
- 避免在系统提示和文档之间插入可变内容,否则会破坏缓存
十三、API功能矩阵总览

最后,用一张完整的表格总结DeepSeek V4 Pro正式版的全部API能力:
| 功能 | V4-Pro | V4-Flash | 说明 |
|---|---|---|---|
| 思考模式 | 支持 | 支持 | 默认开启,支持low/high/max三档 |
| JSON Output | 支持 | 支持 | 结构化输出 |
| Tool Calls | 支持 | 支持 | 原生函数调用 |
| Responses API | 支持 | 支持 | OpenAI Responses格式 |
| Anthropic API | 支持 | 支持 | Claude生态兼容 |
| 对话前缀续写 | 支持(Beta) | 支持(Beta) | 长对话连续性优化 |
| FIM补全 | 支持(Beta) | 支持(Beta) | 仅非思考模式 |
| 图像推理 | 支持 | 支持 | 正式版新增 |
| 上下文长度 | 1M | 1M | 百万token标配 |
| 最大输出 | 384K | 384K | 超长输出支持 |
| 开源协议 | MIT | MIT | 可商用 |
十四、总结与展望

DeepSeek-V4-Pro正式版这次升级,核心可以用一句话概括:Agent能力从"几乎不可用"一跃进入第一梯队,同时用双生态兼容把迁移成本压到零。
具体来看,这次发布的关键价值点包括:
- 架构没变,后训练重构:DeepSWE从12.8到62.7,Agent相关基准全面暴涨
- 首次原生图像推理:Agent的"眼睛"到货,补齐多模态短板
- OpenAI + Anthropic双格式 + Responses API:存量代码零成本迁移
- 缓存命中价0.025元:长文档复用场景成本差120倍
- 三档思考强度:按需选择,平衡速度与质量
- Harness开源框架:从模型提供商升级为模型+框架提供商
- 峰谷定价机制:鼓励错峰使用,闲时半价
回看从2025年的R1到今年的V4,DeepSeek一直在做一件很类似的事情:不是简单追求"我要做一个比所有模型都强的AI",而是不断把前沿模型的能力往更低的成本区间里压。
如果DeepSeek自己公布的测试结果最终能够得到第三方验证,那么这一次真正值得关注的,将是一个越来越明显的变化:顶级闭源模型与高性价比开源模型之间的性能差距,可能正在进一步缩小。
正如前Hugging Face研究员Tiezhen Wang所言:
"如果这是真的,而且DS-V4-Pro还是开源模型,那Opus甚至Fable都要GG了。这意味着,DeepSeek有能力以只有Fable API价格1/50的成本,提供与Fable同级别的模型,同时还能获得远高于Anthropic的缓存命中率。最终的总成本甚至可能低100倍,而模型能力基本处于同一水平。"
这场没有发布会的发布,或许才是AI竞争进入"干活时代"的真正发令枪。
代码示例8:完整的Agent工作流模板
python
"""
DeepSeek V4 Pro Agent工作流模板
适用于:代码审查、文档分析、数据处理等多步骤Agent场景
"""
import os
import json
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com",
)
# 1. 定义Agent可用的工具
tools = [
{
"type": "function",
"function": {
"name": "read_file",
"description": "读取指定路径的文件内容",
"parameters": {
"type": "object",
"properties": {
"path": {"type": "string", "description": "文件路径"}
},
"required": ["path"]
}
}
},
{
"type": "function",
"function": {
"name": "write_file",
"description": "将内容写入指定路径的文件",
"parameters": {
"type": "object",
"properties": {
"path": {"type": "string", "description": "文件路径"},
"content": {"type": "string", "description": "文件内容"}
},
"required": ["path", "content"]
}
}
},
{
"type": "function",
"function": {
"name": "run_command",
"description": "执行shell命令并返回输出",
"parameters": {
"type": "object",
"properties": {
"command": {"type": "string", "description": "要执行的命令"}
},
"required": ["command"]
}
}
}
]
# 2. 工具实现
def read_file(path):
with open(path, "r", encoding="utf-8") as f:
return f.read()
def write_file(path, content):
with open(path, "w", encoding="utf-8") as f:
f.write(content)
return f"文件已写入: {path}"
def run_command(command):
import subprocess
result = subprocess.run(command, shell=True, capture_output=True, text=True)
return result.stdout + result.stderr
TOOL_MAP = {"read_file": read_file, "write_file": write_file, "run_command": run_command}
# 3. Agent循环
def agent_loop(task, max_turns=20):
messages = [
{"role": "system", "content": "你是一个专业的开发助手,能够使用工具完成编程任务。请一步步思考并执行。"},
{"role": "user", "content": task}
]
for turn in range(max_turns):
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=messages,
tools=tools,
reasoning_effort="max", # Agent场景使用最大思考强度
extra_body={"thinking": {"type": "enabled"}},
max_tokens=16384, # 留足输出空间,避免被thinking token挤压
)
msg = response.choices[0].message
messages.append(msg)
if msg.tool_calls is None:
print(f"\n=== 任务完成 ===")
print(msg.content)
return msg.content
print(f"\n--- 轮次 {turn+1} ---")
if msg.reasoning_content:
print(f"[思考] {msg.reasoning_content[:100]}...")
for tc in msg.tool_calls:
args = json.loads(tc.function.arguments)
print(f"[调用] {tc.function.name}({args})")
result = TOOL_MAP[tc.function.name](**args)
print(f"[结果] {result[:100]}...")
messages.append({
"role": "tool",
"tool_call_id": tc.id,
"content": str(result)
})
return "达到最大轮次限制"
# 4. 运行Agent
if __name__ == "__main__":
agent_loop("读取当前目录下的main.py文件,分析其中的性能问题,并生成优化建议写入optimization_report.md")
参考资料:
- DeepSeek API官方文档: api-docs.deepseek.com
- DeepSeek V4 Pro正式版发布公告: api-docs.deepseek.com/zh-cn/news/...
- DeepSeek模型与价格: api-docs.deepseek.com/zh-cn/quick...
- DeepSeek思考模式指南: api-docs.deepseek.com/zh-cn/guide...
- DeepSeek Codex集成指南: api-docs.deepseek.com/zh-cn/quick...
- DeepSeek Harness GitHub: github.com/deepseek-ai...
- HuggingFace模型集合: huggingface.co/collections...