DeepSeek V4 Pro 千呼万唤始出来。这是V4系列中定位更高的模型,采用 MoE(Mixture-of-Experts)混合专家架构,总参数量达1.6T,激活参数49B,支持 1M(百万 Token)上下文长度,最大输出长度达到 384K Token。
与 DeepSeek V4 Flash(284B 总参数 / 13B 激活参数)相比,V4 Pro 在参数规模、知识密度和复杂任务处理能力上均有明显提升。至此,V4 系列的产品结构正式清晰:Flash 主打更低成本和更高并发,Pro 则提供更高规格的模型服务,面向 Agent 和 Coding 等对模型能力要求更高的场景。

架构层面的三项关键升级

混合注意力机制(CSA + HCA)
V4 系列设计了一套混合注意力架构,结合压缩稀疏注意力(Compressed Sparse Attention)和高度压缩注意力(Heavily Compressed Attention)。在 1M Token 上下文场景下,V4 Pro 的单 Token 推理 FLOPs 仅为 V3.2 的 27%,KV Cache 占用仅为 10%。
这组数据表明,在处理超长上下文时,每生成一个 Token 所需的计算量大幅下降,同时降低了显存占用和部署成本。对于需要在百万级上下文中工作的 Agent 任务和长文档处理场景,这种效率提升能够让百万上下文从理论指标转化为实际的生产力。
Manifold-Constrained Hyper-Connections(mHC)
mHC 用于替代传统残差连接,在保持模型表达能力的同时增强信号在各层之间的传播稳定性。1.6T 参数规模的模型在训练过程中面临的梯度传播和稳定性挑战更为严峻,mHC 从结构层面为大规模 MoE 模型的训练稳定性提供了保障。
Muon 优化器
V4 系列采用 Muon 优化器替代了传统优化器,该优化器在收敛速度和训练稳定性上均有提升。在 32T+ Token 的预训练数据量下,优化器层面的改进对训练效率产生显著的正面影响。
训练与后训练流程
预训练阶段使用了超过 32T 的多样化高质量 Token。后训练采用两阶段范式:
-
领域专家独立培养:通过 SFT 和 RL(GRPO)分别在不同领域训练专家能力。
-
统一模型整合:通过 On-Policy 蒸馏,将各领域的专家能力整合到一个统一模型中。
这种后训练策略,让模型在各专业领域都能获得针对性优化,同时避免了多任务联合训练中常见的能力冲突问题。
三种推理模式
DeepSeek V4 Pro 和 V4 Flash 均支持三种推理模式,开发人员可根据任务复杂度选择。
| 模式 | 特点 | 适用场景 | 响应格式 |
|---|---|---|---|
| Non-Think | 快速直觉式响应,不进行显式推理 | 日常对话、低风险决策、常规任务 | </think> summary |
| Think High | 逻辑分析式推理,较慢但更准确 | 复杂问题求解、规划任务 | <think> thinking </think> summary |
| Think Max | 将推理推到极限 | 竞赛级数学、极限编程、探索模型能力边界 | 特殊 system prompt + <think> thinking </think> summary |
在 Think Max 模式下,建议将上下文窗口设置为至少 384K Token,以确保模型有足够的空间进行深度推理。
测试评估数据:V4-Pro Max 与一线模型的对比
知识与推理
| 评测基准 | Opus-4.6 Max | GPT-5.4 xHigh | Gemini-3.1-Pro High | DS-V4-Pro Max |
|---|---|---|---|---|
| MMLU-Pro | 89.1 | 87.5 | 91.0 | 87.5 |
| SimpleQA-Verified | 46.2 | 45.3 | 75.6 | 57.9 |
| Chinese-SimpleQA | 76.4 | 76.8 | 85.9 | 84.4 |
| GPQA Diamond | 91.3 | 93.0 | 94.3 | 90.1 |
| HLE | 40.0 | 39.8 | 44.4 | 37.7 |
在知识类任务上,V4-Pro Max 在 SimpleQA-Verified(57.9)和 Chinese-SimpleQA(84.4)的表现较好。前者超过了 Opus-4.6 Max(46.2)和 GPT-5.4 xHigh(45.3),中文知识问答的成绩也表明 V4 Pro 在中文语料上的训练质量较为扎实。
编程与数学
| 评测基准 | Opus-4.6 Max | GPT-5.4 xHigh | Gemini-3.1-Pro High | DS-V4-Pro Max |
|---|---|---|---|---|
| LiveCodeBench | 88.8 | - | 91.7 | 93.5 |
| Codeforces Rating | - | 3168 | 3052 | 3206 |
| HMMT 2026 Feb | 96.2 | 97.7 | 94.7 | 95.2 |
| IMOAnswerBench | 75.3 | 91.4 | 81.0 | 89.8 |
| Apex Shortlist | 85.9 | 78.1 | 89.1 | 90.2 |
编程是 V4-Pro Max 表现较优的领域,LiveCodeBench 93.5 和 Codeforces Rating 3206 均表现良好。在数学方面,HMMT 和 IMO 的成绩与 GPT-5.4 xHigh 互有胜负,但也处于较高水平。
Agent 任务
| 评测基准 | Opus-4.6 Max | GPT-5.4 xHigh | Gemini-3.1-Pro High | DS-V4-Pro Max |
|---|---|---|---|---|
| SWE Verified | 80.8 | - | 80.6 | 80.6 |
| SWE Pro | 57.3 | 57.7 | 54.2 | 55.4 |
| BrowseComp | 83.7 | 82.7 | 85.9 | 83.4 |
| MCPAtlas Public | 73.8 | 67.2 | 69.2 | 73.6 |
| Toolathlon | 47.2 | 54.6 | 48.8 | 51.8 |
在 Agent 任务上,V4-Pro Max 处于主流梯队。SWE Verified 80.6% 的解决率和 MCPAtlas 73.6 的成绩,说明 V4 Pro 在实际软件工程和工具调用场景中具备实用性。
API 功能覆盖
DeepSeek V4 Pro 提供的 API 功能支持主流的 Agent 开发需求:
-
JSON Output:结构化输出,方便与下游系统对接。
-
Tool Calls / Function Calling:工具调用能力。
-
Responses API:标准响应接口。
-
Anthropic API 兼容:可使用 Anthropic 格式直接调用。
-
对话前缀续写(Beta):支持从指定前缀继续生成。
-
FIM 补全(Beta,仅 Non-Think 模式):Fill-in-the-Middle 代码补全。
接入方式兼容 OpenAI 和 Anthropic 两套协议格式。对于已有相关集成接口的项目,可以直接替换 Base URL 和 API Key 完成迁移。
定价与成本分析
| 计费项 | DeepSeek V4 Flash | DeepSeek V4 Pro | Pro / Flash 倍数 |
|---|---|---|---|
| 缓存命中输入 | 0.02 元 / 百万 Token | 0.025 元 / 百万 Token | 1.25x |
| 缓存未命中输入 | 1 元 / 百万 Token | 3 元 / 百万 Token | 3x |
| 输出 | 2 元 / 百万 Token | 6 元 / 百万 Token | 3x |
| 并发限制 | 2500 | 500 | - |
以下是需要关注的细节:
-
缓存命中价格较低:V4 Pro 缓存命中输入仅 0.025 元 / 百万 Token。对于存在大量重复前缀的 Agent 任务(如固定的 system prompt + 工具描述),合理利用缓存可控制输入成本。
-
输出成本是主要开支:V4 Pro 输出 6 元 / 百万 Token。在 Think Max 模式下,推理过程本身会消耗较多输出 Token。
-
并发限制差异明显:V4 Flash 的并发限制是 V4 Pro 的 5 倍,适合高频调用场景。
Flash 与 Pro 的选型建议
-
日常对话、轻量级任务:推荐 V4 Flash(Non-Think / Think High),响应快且成本低。
-
复杂代码生成、代码审查:推荐 V4 Pro(Think High),适合要求高代码理解能力的场景。
-
多步骤 Agent 任务、软件工程:推荐 V4 Pro(Think High / Think Max),支持长流程任务。
-
批量数据处理与提取:推荐 V4 Flash(Non-Think),利用其高并发与低成本优势。
多模型环境下的 API 工程管理
随着 DeepSeek V4 Pro 的加入,开发团队接入的高质量 AI 模型数量增加。在同时使用 OpenAI、Anthropic、Gemini 以及自建中转站等多个 API 时,不同协议格式的适配、渠道切换、流量分配和多项目虚拟 Key 管理会带来额外的工程量。
ServBay 提供的 AI 网关(AI Gateway)提供了本地化的统一入口管理方案:
- 多渠道接入与分配:支持添加各官方 API、订阅账号及中转站,实现自动分配流量与渠道优先级配置。

- 热切换与自动切换:支持在不中断服务的情况下手动或在渠道故障时自动切换。
- 模型映射 :允许将代码中的模型名称(如
claude-opus-5)映射为实际调用的模型(如glm-5.2),无需修改下游应用代码。 - 协议转换:屏蔽 OpenAI、Anthropic、Gemini 等协议差异,应用只需对接网关的统一接口,网关负责将请求自动转换为目标服务商格式。

- 虚拟 Key:为不同开发项目创建独立的本地虚拟 Key,统计各自的 Token 消耗和调用量,便于团队内部的成本核算。
通过此类本地管理工具,开发者能够更方便地在 DeepSeek V4 Pro 与其他模型之间进行路由,减少由于协议和渠道变化带来的重复适配工作。