DeepSeek V4 Pro 正式版深度解析:Agent能力跃升、双生态API与峰谷定价全解读

DeepSeek V4 Pro 正式版深度解析:Agent能力跃升、双生态API与峰谷定价全解读

2026年8月13日,DeepSeek正式推出 DeepSeek V4 Pro 正式版(版本号 DeepSeek-V4-Pro-0813),Agent能力大幅提升,多项指标逼近全球顶级大模型,官方同步宣布8月17日起API实行峰谷调价。本文将从架构原理、Agent能力、API生态、思考模式、成本优化、Harness开源框架等维度进行超过8000字的全面拆解,并附8个实战代码示例。


一、发布始末:一场没有发布会的发布

2026年8月12日深夜,如果你睡前习惯刷一眼DeepSeek的API文档,会发现自己差点错过一场没有请柬的发布。

没有发布会,没有倒计时,没有铺天盖地的预热海报。官网的API文档悄悄刷新了:模型还是那个deepseek-v4-pro,价格页的代号却已经从Preview换成了DeepSeek-V4-Pro-0813,fingerprint更新为fp_v4pro_20260812。等到社区炸开锅,已经是第二天早上的事。

距离4月24日预览版上线,刚好111天。这111天里,Kimi K3高调发布抢走了开源头条,V4 Flash正式版抢先一步在7月31日上线,官方还放出了"近期整体上调API定价、预计涨幅较大"的预告。所有人都在等Pro的正式版------结果它在一个周三的深夜,用最DeepSeek的方式登场:官方一个字没发,API先能调了。

8月13日,DeepSeek官方正式发布确认:DeepSeek V4 Pro正式版已同步在APP、网页端和API更新上线。用户可以通过APP或网页端选择"专家模式"使用全新的V4 Pro正式版模型,API模型名不变,仍为deepseek-v4-pro

值得注意的是,正式版发布同日,DeepSeek还同步开源了Agent运行框架 DeepSeek Harness(开发者预览版v0.1,MIT协议),这标志着DeepSeek从"模型提供商"向"模型+框架提供商"的战略升级。


二、架构总览:1.6T参数MoE与百万上下文

2.1 硬规格:架构与预览版完全一致

正式版的硬规格与预览版完全一致------1.6万亿总参数、490亿激活参数的MoE(混合专家)结构,1M(100万token)上下文窗口,384K最大输出。变化的全部集中在后训练,而幅度大到像换了一个模型。

参数 规格
架构 MoE(混合专家)
总参数量 1.6万亿(1.6T)
激活参数量 490亿(49B)
上下文长度 1M(100万token)
最大输出长度 384K token
模型版本号 DeepSeek-V4-Pro-0813
Fingerprint fp_v4pro_20260812
开源协议 MIT

2.2 结构创新:全新混合注意力机制

DeepSeek-V4开创了一种全新的注意力机制,在token维度进行压缩,结合DSA稀疏注意力(DeepSeek Sparse Attention)和重度压缩注意力(HCA),实现了全球领先的长上下文能力。

具体来说,V4-Pro在1M上下文下,单token推理FLOPs仅为V3.2的27% ,KV缓存仅为V3.2的10%。这意味着,尽管上下文窗口扩展到100万token,推理和显存的消耗却没有线性增长,而是通过架构创新实现了大幅压缩。

从现在开始,1M上下文将是DeepSeek所有官方服务的标配。这对于需要处理超长文档、大型代码仓库、长对话历史的Agent场景来说,是基础设施级的提升。

2.3 开源与本地部署

DeepSeek-V4模型权重以MIT协议开源,开发者可在以下平台获取:

  • HuggingFace : https://huggingface.co/collections/deepseek-ai/deepseek-v4
  • ModelScope : https://modelscope.cn/collections/deepseek-ai/DeepSeek-V4
  • 技术报告 : https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf

MIT协议意味着模型可以免费用于商业用途,这对于企业级部署来说是一个极大的利好。


三、Agent能力跃升:从"会考试"到"会干活"

3.1 基准测试:全面暴涨

真正夸张的数字来自Agent相关评测。以下是预览版与正式版在关键Agent基准上的跃迁幅度:

评测集 Preview分数 正式版分数 提升幅度
DeepSWE(软件工程) 12.8 62.7 +49.9
DSBench-Hard 31.1 67.2 +36.1
CyberGym(安全攻防) 52.7 83.3 +30.6
AutomationBench 12.8 31.8 +19.0
Terminal Bench 72.1 87.9 +15.8

这些评测没有一道是传统选择题或文本生成题,全是真实环境下的多步骤任务:终端操作、仓库级代码生成、工具调用、安全模拟。它们恰好也是预览版最容易翻车的地方------此前V4-Pro-Preview的Agent能力被普遍认为"鸡肋",跑基准还行,真让它下场干活就露馅。

其中最值得关注的是 DeepSWE ------这个基准专门考察AI编程Agent的长周期软件工程能力,要求模型真正进入一个复杂的开源代码仓库,自主理解代码、修改多个文件、运行测试并不断修正,最终完成一个完整的软件工程任务。得分从12.8直接提升至62.7,暴涨近5倍

3.2 后训练范式重构

从V4 Flash正式版的更新日志可以推断出这轮升级的思路:面向代码Agent场景的大规模后训练。Flash版已经用同一套方法把Agent能力做到了"基准测试远超V4-Pro-Preview"的程度,Pro正式版只是补上了同一课。

如此幅度的跃迁不太可能来自单一优化,更可能是整套Agent后训练管线换了底层范式:

  1. 大规模合成工具调用轨迹:让模型在合成数据中学习如何正确规划、调用工具、处理异常
  2. 强化规划与反思能力:通过强化学习让模型学会在复杂任务中"先想后做"和"做后反思"
  3. 把1M上下文真正用起来:让模型在长链路任务里"看到全局",而不是只关注当前步骤

一句话总结这个变化:如果说预览版是会考试的学霸,正式版就是能下场干活的实习生。

3.3 与全球顶级模型的横向对比

DeepSeek官方发布了覆盖10项智能体基准测试的横向对比结果。在Claude Fable 5或其他模型占优的8项测试里,DeepSeek-V4-Pro-0813与之相比性能差距都十分微小。

综合所有测试,Fable 5平均领先幅度为5.3% 。如果剔除"无工具版人类终极考试"这一极端样本(DeepSeek得分42.7,Fable 5为53.3,存在10.6%的差距,大幅拉高整体差值),剩余项目平均差距仅2.8%

更值得关注的是,在专门考察以下能力的基准测试中,DeepSeek-V4-Pro-0813反超 Fable 5:

  • CyberGym:AI网络安全攻防能力
  • AutomationBench(Public):AI Agent自动化能力

但需要客观看待的是,V4 Pro并非一张"全面碾压"的成绩单------HLE无工具42.7分,落后Claude Opus 4.8的49.8和Fable 5的53.3;NL2Repo 61.5落后Opus 4.8的69.7。纯知识推理和最复杂的软件工程任务还没坐上头把交椅。


四、多模态补课:Agent的"眼睛"到货

另一个被很多人忽略的变化是多模态。预览版是纯文本模型,正式版首次原生支持图像推理------DeepThink引擎现在可以在同一个思考流程里分析图片、解读截图、处理混合文档。

这对普通聊天场景影响不大,但对Agent场景是从无到有的突破

  • 截图分析UI状态:Agent可以"看到"当前屏幕,判断操作是否成功
  • 读取图表数据:从图片中提取结构化数据,用于后续分析
  • 解析文档扫描件:处理PDF扫描件、发票、合同等图像化文档

这些"看图干活"的需求过去只能靠外挂视觉模型凑合,现在一条链路就能完成。补齐视觉能力之后,Agent栈才第一次凑齐了"眼、脑、手"三件套:

能力 对应组件 状态
视觉感知(图像推理) "眼" 正式版新增
推理思考(思考模式) "脑" 预览版已有
工具调用(Tool Calls) "手" 预览版已有

五、双生态API兼容:迁移成本归零

开发者体验是这次升级里最容易被忽视、但也最锋利的一刀。正式版同时提供OpenAI与Anthropic两套兼容接口,外加Responses API正式支持:

接口类型 Base URL 说明
OpenAI ChatCompletions https://api.deepseek.com 原有base_url不用动,改model即可
Anthropic API https://api.deepseek.com/anthropic Claude代码改个baseURL就能跑
Responses API https://api.deepseek.com 原生支持,可对接Codex

此外还支持以下功能:

  • 原生Tool Calls / JSON Output:结构化输出开箱即用
  • 对话前缀续写(Beta):面向长对话连续性优化
  • FIM补全(Beta):面向IDE补全场景(仅非思考模式支持)

翻译成人话:你之前给Claude写的整套代码,改一个baseURL就能直接喂给v4-pro。不管你此前的技术栈是OpenAI还是Anthropic,迁移成本约等于零。这种"生态兼容"策略比单纯堆参数更能撬动存量开发者------毕竟让工程师换模型的最大阻力从来不是模型好坏,而是改代码的成本。

代码示例1:OpenAI SDK基础调用

python 复制代码
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com",
)

resp = client.chat.completions.create(
    model="deepseek-v4-pro",  # 默认思考模式
    messages=[
        {"role": "system", "content": "你是资深代码审查专家。"},
        {"role": "user", "content": "审查下面这段5000行的Django视图代码,指出潜在性能瓶颈。"}
    ],
    max_tokens=8192,
)
print(resp.choices[0].message.content)

如需非思考模式,把model换成deepseek-v4-pro-no-think即可。

代码示例2:Anthropic SDK调用

python 复制代码
from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com/anthropic",
)

msg = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "将这份80万tokens的日志文件压缩为10条关键错误摘要。"}]
)
print(msg.content[0].text)

六、思考模式深度解析

6.1 三档思考强度

DeepSeek模型的思考模式在输出最终回答之前,会先输出一段思维链内容,以提升最终答案的准确性。正式版带来了更灵活的思考强度控制:

V4-Pro和V4-Flash思考模式现支持 low / high / max 三档思考强度:

思考强度 适用场景 说明
low 简单任务 快速响应,轻量推理
high 日常Agent任务 默认强度,平衡速度与质量
max 高度复杂任务 最大推理深度,适合最难的问题

需要注意的兼容性处理:出于兼容考虑,lowmedium会映射为highxhigh会映射为max

此外,对一些复杂Agent类请求(如Claude Code、OpenCode),effort会自动设置为max,无需手动干预。

6.2 参数控制方式

控制项 OpenAI格式 Anthropic格式
思考模式开关 {"thinking": {"type": "enabled/disabled"}} 同左
思考强度控制 {"reasoning_effort": "high/max"} {"output_config": {"effort": "high/max"}}

默认思考开关为enabled。在使用OpenAI SDK设置thinking参数时,需要将其传入extra_body中。

6.3 输入输出参数说明

思考模式不支持 temperaturetop_ppresence_penaltyfrequency_penalty参数。设置这些参数不会报错(为了兼容已有软件),但也不会生效。

在思考模式下,思维链内容通过reasoning_content参数返回,与content同级。多轮对话拼接规则如下:

  • 如果模型未进行工具调用 ,则中间assistantreasoning_content无需参与上下文拼接
  • 如果模型进行了工具调用 ,则中间assistantreasoning_content需参与上下文拼接,在后续所有轮次中必须回传给API

代码示例3:思考模式调用

python 复制代码
from openai import OpenAI

client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "user", "content": "9.11和9.8,哪个更大?请仔细分析。"}
    ],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}},
)

# 获取思维链内容
reasoning_content = response.choices[0].message.reasoning_content
# 获取最终回答
content = response.choices[0].message.content

print("=== 思维链 ===")
print(reasoning_content)
print("=== 最终回答 ===")
print(content)

代码示例4:思考模式下的工具调用

python 复制代码
import os
import json
from openai import OpenAI
from datetime import datetime

client = OpenAI(
    api_key=os.environ.get('DEEPSEEK_API_KEY'),
    base_url="https://api.deepseek.com",
)

# 定义工具
tools = [
    {
        "type": "function",
        "function": {
            "name": "get_date",
            "description": "获取当前日期",
            "parameters": {"type": "object", "properties": {}},
        }
    },
    {
        "type": "function",
        "function": {
            "name": "get_weather",
            "description": "获取指定地点和日期的天气",
            "parameters": {
                "type": "object",
                "properties": {
                    "location": {"type": "string", "description": "城市名称"},
                    "date": {"type": "string", "description": "日期,格式YYYY-mm-dd"},
                },
                "required": ["location", "date"]
            },
        }
    },
]

# 模拟工具实现
def get_date_mock():
    return datetime.now().strftime("%Y-%m-%d")

def get_weather_mock(location, date):
    return "多云 7~13°C"

TOOL_CALL_MAP = {
    "get_date": get_date_mock,
    "get_weather": get_weather_mock
}

def run_turn(messages):
    sub_turn = 1
    while True:
        response = client.chat.completions.create(
            model='deepseek-v4-pro',
            messages=messages,
            tools=tools,
            reasoning_effort="high",
            extra_body={"thinking": {"type": "enabled"}},
        )
        # 关键:必须将完整message(含reasoning_content)拼接回去
        messages.append(response.choices[0].message)

        tool_calls = response.choices[0].message.tool_calls
        print(f"子轮次 {sub_turn}: reasoning={response.choices[0].message.reasoning_content[:50] if response.choices[0].message.reasoning_content else 'None'}...")

        if tool_calls is None:
            print(f"最终回答: {response.choices[0].message.content}")
            break

        for tool in tool_calls:
            tool_function = TOOL_CALL_MAP[tool.function.name]
            tool_result = tool_function(**json.loads(tool.function.arguments))
            print(f"工具 {tool.function.name} 返回: {tool_result}")
            messages.append({
                "role": "tool",
                "tool_call_id": tool.id,
                "content": tool_result,
            })
        sub_turn += 1

# 启动对话
messages = [{"role": "user", "content": "杭州明天的天气怎么样?"}]
run_turn(messages)

关键注意事项 :在思考模式下进行工具调用时,reasoning_content必须在后续所有请求中完整回传给API。如果未正确回传,API会返回400报错。最简单的方式是直接messages.append(response.choices[0].message),这行代码等价于完整拼接rolecontentreasoning_contenttool_calls

6.4 实战避坑:thinking模式的甜蜜陷阱

跑分好看只是门票,真正有意思的是拿真实任务去试。以下是一个真实翻车案例:

寻路算法可视化任务:要求实现BFS、DFS、A*三种算法的逐步动画、可交互网格画墙、迷宫自动生成。开着默认的thinking模式,V4 Pro用满了16384个token的输出配额,其中13394个花在了"思考"上,留给实际代码的不到3000个token------HTML写到一半直接截断。

关掉thinking模式重跑,54秒输出完整的715行代码,寻路动画、迷宫生成、暗色主题一应俱全。

经验教训 :thinking模式在复杂代码生成场景下,推理token可能占到输出的80%以上 ,反而挤压了实际内容的空间。对于需要大段代码输出的任务,要么主动关闭thinking,要么大幅提高max_tokens兜底。


七、Responses API与Codex集成

7.1 原生支持Responses API

DeepSeek API现已原生支持OpenAI Responses API格式,并针对性适配Codex。这意味着开发者可以直接使用Codex CLI、ChatGPT桌面端、VS Code的Codex插件等工具链,通过DeepSeek模型进行AI编程。

Codex的各个客户端形态共用同一份配置文件,按官方文档配置一次,即可在所有形态使用DeepSeek模型。

7.2 Codex一键配置

DeepSeek提供了一键配置脚本,自动完成全部配置:

macOS / Linux:

bash 复制代码
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)

Windows PowerShell:

powershell 复制代码
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

脚本会依次完成以下工作:

  1. 备份现有配置 :将~/.codex/config.toml备份到~/.codex/backup-deepseek/
  2. 写入模型目录 ~/.codex/models.json:向Codex声明DeepSeek模型的元数据
  3. 修改 ~/.codex/config.toml:新增[model_providers.deepseek]配置段
  4. 校验:写入前校验语法合法性,校验失败则中止,不修改任何文件

7.3 手动配置config.toml

如果不愿意使用脚本,也可以手动编辑配置文件。核心配置段如下:

toml 复制代码
[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
env_key = "DEEPSEEK_API_KEY"
wire_api = "responses"

[profiles.deepseek-v4-pro]
model = "deepseek-v4-pro"
model_provider = "deepseek"

配置完成后,在Codex CLI中通过codex --profile deepseek-v4-pro即可使用DeepSeek模型进行编程。

代码示例5:Responses API直接调用

python 复制代码
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com",
)

# 使用Responses API格式调用
response = client.responses.create(
    model="deepseek-v4-pro",
    input=[
        {
            "role": "user",
            "content": "用Python实现一个线程安全的LRU缓存,要求支持过期时间和容量限制。"
        }
    ],
    reasoning={"effort": "high"},
    max_output_tokens=8192,
)

print(response.output_text)

八、缓存策略与成本优化

8.1 缓存命中价:0.025元背后的120倍差距

价格方面,当前每百万token输入3元、输出6元,与预览期持平。但真正值得盯的不是裸价,而是缓存命中价------0.025元/百万token,基本等于白嫖。

把Pro和Flash摆在一起看:

模型 缓存命中输入 缓存未命中输入 输出 并发上限
DeepSeek-V4-Pro-0813 0.025元 3元 6元 500
DeepSeek-V4-Flash-0731 0.02元 1元 2元 2500

两个关键信息:

  1. Pro的裸价是Flash的3倍,但缓存命中价几乎持平
  2. 并发上限从2500砍到500,说明官方用并发配额做算力调度,把Pro定位成高价值、低频次的复杂任务模型

8.2 长文档场景的缓存威力

缓存策略的实际威力在于长文档场景------同一份系统提示+大文档反复提问,输入成本从3元/百万直接降到0.025元/百万,相差120倍

代码示例6:长文档缓存策略

python 复制代码
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com",
)

SYSTEM = "你是合同审查助手,按风险等级标注异常条款。"
DOC = open("huge_contract.txt", encoding="utf-8").read()  # 约900k tokens

questions = [
    "列出所有违约责任条款。",
    "找出金额超过500万的支付节点。",
    "汇总所有不可抗力的定义。",
    "检查是否存在对乙方不利的管辖权条款。",
    "提取所有保证与承诺条款。",
]

# 第一次请求:缓存前缀(系统提示+文档)
# 后续请求:命中缓存,输入成本直降120倍
for i, q in enumerate(questions):
    resp = client.chat.completions.create(
        model="deepseek-v4-pro",
        messages=[
            {"role": "system", "content": SYSTEM},
            {"role": "user", "content": f"{DOC}\n\n问题:{q}"}
        ],
        max_tokens=4096,
    )
    print(f"问题{i+1}: {q}")
    print(f"回答: {resp.choices[0].message.content[:200]}...")
    print(f"Token用量: 输入{resp.usage.prompt_tokens}, 输出{resp.usage.completion_tokens}")
    print(f"缓存命中: {resp.usage.prompt_cache_hit_tokens if hasattr(resp.usage, 'prompt_cache_hit_tokens') else 'N/A'}")
    print()

首次请求缓存前缀(系统提示+文档),后续命中缓存,输入成本直降。这对于需要反复分析同一份大文档的场景(合同审查、代码审查、日志分析等)来说,是成本优化的杀手锏。

代码示例7:流式输出与思考链处理

python 复制代码
from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "分析这段代码的时间复杂度并给出优化建议:\n" + open("code.py").read()}],
    stream=True,
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}},
)

reasoning_content = ""
content = ""

for chunk in response:
    delta = chunk.choices[0].delta
    # 分别处理思维链和最终回答
    if hasattr(delta, 'reasoning_content') and delta.reasoning_content:
        reasoning_content += delta.reasoning_content
        print(f"[思考] {delta.reasoning_content}", end="", flush=True)
    elif delta.content:
        content += delta.content
        print(f"[回答] {delta.content}", end="", flush=True)

print("\n\n=== 完整思维链 ===")
print(reasoning_content)
print("\n=== 最终回答 ===")
print(content)

九、峰谷定价机制详解

9.1 定价调整公告

随着DeepSeek V4全系列模型正式版上线,官方宣布将对API价格进行更新调整。为了更加合理地调配资源,采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。

新价格将于北京时间2026年8月17日0时开始生效。

9.2 峰谷时段定义

时段类型 时间范围(北京时间)
高峰时段 每日 9:00-12:00、14:00-18:00
空闲时段 其余所有时间(含夜间、午休、周末、节假日)

9.3 新旧价格对比

当前价格(8月17日前)

模型 缓存命中输入 缓存未命中输入 输出
deepseek-v4-pro 0.025元 3元 6元
deepseek-v4-flash 0.02元 1元 2元

新价格(8月17日起,单位:元/百万tokens)

模型 时段 缓存命中输入 缓存未命中输入 输出
deepseek-v4-flash 空闲时段 0.05 1.5 4.5
deepseek-v4-flash 高峰时段 0.10 3.0 9.0
deepseek-v4-pro 空闲时段 0.15 4.5 13.5
deepseek-v4-pro 高峰时段 0.30 9.0 27.0

9.4 涨价幅度分析

以V4-Pro高峰时段为例,与当前价格对比:

  • 缓存命中输入:0.025元 → 0.30元(涨12倍
  • 缓存未命中输入:3元 → 9元(涨3倍
  • 输出:6元 → 27元(涨4.5倍

但空闲时段价格相对温和:

  • 缓存未命中输入:4.5元(比当前涨50%)
  • 输出:13.5元(比当前涨125%)

9.5 成本优化建议

面对涨价,以下策略可以帮助企业有效控制成本:

  1. 错峰调度:将批量处理任务、长文档分析等非实时任务安排在空闲时段执行,成本直接减半
  2. 最大化缓存命中:对长文档场景,保持系统提示和文档内容的一致性,让缓存命中率最大化
  3. Pro/Flash搭配使用:简单任务用Flash(并发上限2500),复杂任务用Pro(并发上限500),按需选择
  4. 思考强度按需设置:简单任务用low,日常Agent任务用high,只有最复杂的任务才用max
  5. 提前充值:当充值余额与赠送余额同时存在时,优先扣减赠送余额,建议在涨价前做好预算规划

十、DeepSeek Harness开源框架

10.1 什么是DeepSeek Harness

8月13日,DeepSeek不仅发布了V4 Pro正式版,还同步开源了Agent运行框架 DeepSeek Harness(开发者预览版v0.1,MIT协议)。

DeepSeek Harness(命令行工具名dsh)是一套Agent运行框架,不是新模型。其核心设计理念是**"一切皆插件"**------基于Cordis插件系统构建,模型、工具、技能、会话、沙箱、存储、循环、调度等所有组件都是可替换的插件。

10.2 架构理念

Harness的核心公式是:

ini 复制代码
Agent = 大脑(模型)+ 手脚(工具)+ 工具箱(框架)+ 循环(Agent Loop)

传统Agent框架通常将模型调用、工具执行、循环控制耦合在一起,而Harness通过"一切皆插件"的架构,让每个环节都可以独立替换和扩展:

组件 说明 可替换性
模型插件 支持DeepSeek全系列模型,也可接入其他模型 完全可替换
工具插件 文件操作、代码执行、网络请求等 完全可扩展
技能插件 代码生成、文档分析、数据处理等 完全可扩展
会话插件 对话状态管理、上下文压缩 完全可替换
沙箱插件 安全执行环境隔离 完全可替换

10.3 快速上手

Harness可通过npx快速启动:

bash 复制代码
npx @deepseek-ai/deepseek-harness

或全局安装后使用:

bash 复制代码
npm install -g @deepseek-ai/deepseek-harness
dsh  # 启动交互式Agent

10.4 评测中的Harness

值得注意的是,在官方发布的Agent基准测试中,DeepSeek-V4-Pro-0813使用了DeepSeek Harness极简模式作为框架进行测试(使用max档位,topp=0.95,temperature=1.0)。这意味着官方的跑分数据是在自家框架下取得的,其他框架下结果可能略有不同。

这也暗示了一个趋势:DeepSeek正在把模型和Agent运行框架打包推出,竞争从"谁的模型更聪明"进入下一阶段------比谁能把大脑、手脚和工具箱组装成一个真正替人干活的系统


十一、与全球顶级模型的成本对比

11.1 价格对比

如果性能只是接近,那么价格可能才是V4 Pro 0813最值得关注的地方。

模型 输入(美元/百万token) 输出(美元/百万token) 缓存命中输入
DeepSeek V4 Pro 0.435 0.87 0.003625
Anthropic Fable 5 10 50 -
Grok 4.6 2 6 -

综合折算均价:Fable 5约30美元,V4 Pro约0.65美元,前者成本大约是后者46倍

11.2 单任务成本对比

据Hugging Face CEO Clem估算,测试的各型号每项任务的成本差异高达800倍:Claude Fable 5在基准测试中领先,但平均每项任务的成本超过31美元,而DeepSeek V4 Flash (max)的成本仅为0.04美元。

11.3 开发者实测对比

在HN讨论区,一位名为jklmnopqrstuvw的网友直接把V4 Pro 0813和Grok 4.6放进Codex CLI,对同一个新功能进行开发测试:

模型 耗时 成本 结果
V4 Pro 0813 12分02秒 0.12美元 出现Bug
Grok 4.6 3分18秒 1.41美元 无Bug

这个结果比"某个Benchmark超过了多少"更有意思------它恰恰说明,真实的软件开发中,模型能力并不是一个简单的分数。V4 Pro虽然便宜了10倍以上,但在速度和一次通过率上仍有提升空间。当然,也有人提醒,不应该拿一次实验就给模型下结论,Agent本身具有很强的随机性。


十二、实战避坑指南

基于社区反馈和实际测试,以下是接入DeepSeek V4 Pro正式版时需要注意的关键问题: 在这里插入图片描述

12.1 thinking模式的token陷阱

如前文所述,thinking模式在复杂代码生成场景下,推理token可能占到输出的80%以上,挤压实际内容空间。解决方案:

  • 简单文本任务 :保持thinking模式,设置reasoning_effort="low"
  • 代码生成任务 :关闭thinking模式(model改为deepseek-v4-pro-no-think),或大幅提高max_tokens
  • Agent多步任务:保持thinking模式max档位,这是Agent场景的最佳配置

12.2 并发限制

V4-Pro的并发上限为500(V4-Flash为2500)。对于高并发场景,建议:

  • 使用队列管理请求,避免超出并发限制
  • Pro/Flash搭配使用,简单请求路由到Flash
  • 考虑在空闲时段集中处理批量任务

12.3 工具调用中的reasoning_content回传

这是最容易踩的坑:在思考模式下进行工具调用时,reasoning_content必须在后续所有轮次中完整回传。如果未正确回传,API会返回400报错。

最简单的处理方式是直接messages.append(response.choices[0].message),让SDK自动处理所有字段的拼接。

12.4 缓存策略设计

缓存命中价(0.025元)与未命中价(3元)相差120倍,缓存策略的设计直接影响成本:

  • 将固定的系统提示放在messages最前面
  • 长文档内容紧跟系统提示之后
  • 变化的问题内容放在最后
  • 避免在系统提示和文档之间插入可变内容,否则会破坏缓存

十三、API功能矩阵总览

最后,用一张完整的表格总结DeepSeek V4 Pro正式版的全部API能力:

功能 V4-Pro V4-Flash 说明
思考模式 支持 支持 默认开启,支持low/high/max三档
JSON Output 支持 支持 结构化输出
Tool Calls 支持 支持 原生函数调用
Responses API 支持 支持 OpenAI Responses格式
Anthropic API 支持 支持 Claude生态兼容
对话前缀续写 支持(Beta) 支持(Beta) 长对话连续性优化
FIM补全 支持(Beta) 支持(Beta) 仅非思考模式
图像推理 支持 支持 正式版新增
上下文长度 1M 1M 百万token标配
最大输出 384K 384K 超长输出支持
开源协议 MIT MIT 可商用

十四、总结与展望

DeepSeek-V4-Pro正式版这次升级,核心可以用一句话概括:Agent能力从"几乎不可用"一跃进入第一梯队,同时用双生态兼容把迁移成本压到零。

具体来看,这次发布的关键价值点包括:

  1. 架构没变,后训练重构:DeepSWE从12.8到62.7,Agent相关基准全面暴涨
  2. 首次原生图像推理:Agent的"眼睛"到货,补齐多模态短板
  3. OpenAI + Anthropic双格式 + Responses API:存量代码零成本迁移
  4. 缓存命中价0.025元:长文档复用场景成本差120倍
  5. 三档思考强度:按需选择,平衡速度与质量
  6. Harness开源框架:从模型提供商升级为模型+框架提供商
  7. 峰谷定价机制:鼓励错峰使用,闲时半价

回看从2025年的R1到今年的V4,DeepSeek一直在做一件很类似的事情:不是简单追求"我要做一个比所有模型都强的AI",而是不断把前沿模型的能力往更低的成本区间里压。

如果DeepSeek自己公布的测试结果最终能够得到第三方验证,那么这一次真正值得关注的,将是一个越来越明显的变化:顶级闭源模型与高性价比开源模型之间的性能差距,可能正在进一步缩小。

正如前Hugging Face研究员Tiezhen Wang所言:

"如果这是真的,而且DS-V4-Pro还是开源模型,那Opus甚至Fable都要GG了。这意味着,DeepSeek有能力以只有Fable API价格1/50的成本,提供与Fable同级别的模型,同时还能获得远高于Anthropic的缓存命中率。最终的总成本甚至可能低100倍,而模型能力基本处于同一水平。"

这场没有发布会的发布,或许才是AI竞争进入"干活时代"的真正发令枪。


代码示例8:完整的Agent工作流模板

python 复制代码
"""
DeepSeek V4 Pro Agent工作流模板
适用于:代码审查、文档分析、数据处理等多步骤Agent场景
"""
import os
import json
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com",
)

# 1. 定义Agent可用的工具
tools = [
    {
        "type": "function",
        "function": {
            "name": "read_file",
            "description": "读取指定路径的文件内容",
            "parameters": {
                "type": "object",
                "properties": {
                    "path": {"type": "string", "description": "文件路径"}
                },
                "required": ["path"]
            }
        }
    },
    {
        "type": "function",
        "function": {
            "name": "write_file",
            "description": "将内容写入指定路径的文件",
            "parameters": {
                "type": "object",
                "properties": {
                    "path": {"type": "string", "description": "文件路径"},
                    "content": {"type": "string", "description": "文件内容"}
                },
                "required": ["path", "content"]
            }
        }
    },
    {
        "type": "function",
        "function": {
            "name": "run_command",
            "description": "执行shell命令并返回输出",
            "parameters": {
                "type": "object",
                "properties": {
                    "command": {"type": "string", "description": "要执行的命令"}
                },
                "required": ["command"]
            }
        }
    }
]

# 2. 工具实现
def read_file(path):
    with open(path, "r", encoding="utf-8") as f:
        return f.read()

def write_file(path, content):
    with open(path, "w", encoding="utf-8") as f:
        f.write(content)
    return f"文件已写入: {path}"

def run_command(command):
    import subprocess
    result = subprocess.run(command, shell=True, capture_output=True, text=True)
    return result.stdout + result.stderr

TOOL_MAP = {"read_file": read_file, "write_file": write_file, "run_command": run_command}

# 3. Agent循环
def agent_loop(task, max_turns=20):
    messages = [
        {"role": "system", "content": "你是一个专业的开发助手,能够使用工具完成编程任务。请一步步思考并执行。"},
        {"role": "user", "content": task}
    ]

    for turn in range(max_turns):
        response = client.chat.completions.create(
            model="deepseek-v4-pro",
            messages=messages,
            tools=tools,
            reasoning_effort="max",  # Agent场景使用最大思考强度
            extra_body={"thinking": {"type": "enabled"}},
            max_tokens=16384,  # 留足输出空间,避免被thinking token挤压
        )

        msg = response.choices[0].message
        messages.append(msg)

        if msg.tool_calls is None:
            print(f"\n=== 任务完成 ===")
            print(msg.content)
            return msg.content

        print(f"\n--- 轮次 {turn+1} ---")
        if msg.reasoning_content:
            print(f"[思考] {msg.reasoning_content[:100]}...")

        for tc in msg.tool_calls:
            args = json.loads(tc.function.arguments)
            print(f"[调用] {tc.function.name}({args})")
            result = TOOL_MAP[tc.function.name](**args)
            print(f"[结果] {result[:100]}...")
            messages.append({
                "role": "tool",
                "tool_call_id": tc.id,
                "content": str(result)
            })

    return "达到最大轮次限制"

# 4. 运行Agent
if __name__ == "__main__":
    agent_loop("读取当前目录下的main.py文件,分析其中的性能问题,并生成优化建议写入optimization_report.md")

参考资料

相关推荐
geneculture2 小时前
序位逻辑化解数据要素市场三元悖论(确权难、估值难、流通难)
人工智能·融智学应用场景·人机协同·序位逻辑·联动函数·人机互助
Harvey20212 小时前
Bamtone ICT系列离子污染测试仪,助力PCB质量管理与MES集成
人工智能·bamtone·离子污染测试仪
workflower2 小时前
案例 :某交通厅基于AI技术的智能安全运营实践
网络·人工智能·安全·设计模式·机器人
RoboWizard2 小时前
金士顿Canvas系列存储卡有什么特别的技术优势?
人工智能·性能优化
hhb_6182 小时前
AI智能体调度微服务:高效任务分配方案
人工智能·微服务·架构
bytemaster2 小时前
GPT-5.6 三模之争:Sol、Terra、Luna 加六档推理,到底该怎么选
人工智能·程序员
HelloDong2 小时前
AI 说「修好了」,凭什么信
人工智能·ai编程·claude
QCodingDev2 小时前
Spring AI Alibaba ReAct Agent实战:从Tool Calling到Agent,企业AI复杂业务该如何设计?
java·人工智能·agent·ai编程·spring ai
秦先生在广东2 小时前
GitHub Spec Kit:用「先写规格后写代码」重新定义 AI 辅助开发
人工智能