DeepSeek R1 与 DeepSeek V4 Pro 在参数量上属于不同量级的模型。
V4 Pro总参数量是 R1 的约 2.4 倍,但其激活参数量仅比 R1 多出约 32%,
这得益于其更极致的稀疏化 MoE 架构。
1 核心参数对比
| 对比维度 | DeepSeek R1 | DeepSeek V4 Pro |
|---|---|---|
| 总参数量 | 671B(约 6710 亿) | 1.6T(约 1.6 万亿) |
| 激活参数量 | 37B(约 370 亿) | 49B(约 490 亿) |
| 架构类型 | 混合专家(MoE) | 混合专家(MoE) |
| 上下文长度 | 131K | 1M(100 万 Token) |
| 发布时间 | 2025 年 1 月 | 2026 年 4 月 |
2 参数差异解读
1)总参数量翻倍不止
V4 Pro 的 1.6T 总参数使其成为当时规模最大的开源权重模型之一。
相比之下,R1 的 671B 总参数量约为其42%**。
2)激活参数控制得当
尽管总参数量激增,V4 Pro 通过更先进的混合注意力架构(如压缩稀疏注意力),
将单次推理激活的参数控制在 49B,仅比 R1 的 37B 多出约 32%。
这意味着其推理成本的增长远低于总参数的增长幅度。
3)能力定位不同
R1 主要专注于推理能力,对标 OpenAI o1;
而 V4 Pro 定位为全能旗舰,在 Agent 能力、世界知识和推理性能上均追求领先。
reference
DeepSeek-R1 Release
https://api-docs.deepseek.com/news/news250120/?datasets-category=nlp#1
DeepSeek-R1 发布,性能对标 OpenAI o1 正式版
https://api-docs.deepseek.com/zh-cn/news/news250120/#1
DeepSeek R1 Distill Llama 8B vs DeepSeek-V4-Pro-0813
https://llm-stats.com/models/compare/deepseek-r1-distill-llama-8b-vs-deepseek-v4-pro-0813#1
DeepSeek kymaapi