摘要
本文解读 arXiv 2024 论文《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》。该论文提出DeepSeek-V2 大语言模型 ,通过融合MLA(多头潜在注意力) 、DeepSeekMoE(细粒度专家稀疏) 与GRPO 两阶段对齐 ,在 236B 总参数、每 token 仅激活 21B 的条件下支持 128K 上下文,其特别之处在于用低秩 KV 联合压缩把推理显存瓶颈转化为一次可被矩阵吸收的等价变换。实验表明KV 缓存减少 93.3%、训练成本节省 42.5%、最大生成吞吐提升 5.76 倍,MMLU 达 78.5,以最低的激活参数取得开源顶级性能,为后续 DeepSeek-V3、DeepSeek-R1 奠定了架构基础。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [DeepSeek-V2 的 MLA 与 MHA、GQA 有什么区别?](#DeepSeek-V2 的 MLA 与 MHA、GQA 有什么区别?)
- [为什么 KV 缓存是推理效率的瓶颈?](#为什么 KV 缓存是推理效率的瓶颈?)
- [GRPO 与 PPO 有什么不同?](#GRPO 与 PPO 有什么不同?)
- [DeepSeek-V2 与 DeepSeek-V3、R1 是什么关系?](#DeepSeek-V2 与 DeepSeek-V3、R1 是什么关系?)
- [如何复现或使用 DeepSeek-V2?](#如何复现或使用 DeepSeek-V2?)
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model |
| 标题(中文) | DeepSeek-V2:经济训练与高效推理的 MoE 大语言模型 |
| 作者 | DeepSeek-AI(高华佐、曾旺鼎 等 100+ 贡献者) |
| 机构 | 深度求索 DeepSeek-AI |
| 会议 | arXiv 2024 |
| arXiv | https://arxiv.org/abs/2405.04434 |
| 项目网站 | https://github.com/deepseek-ai/DeepSeek-V2 |
背景与动机
大语言模型的能力通常随参数规模提升而增强,但训练算力需求与推理吞吐瓶颈也随之放大,限制了模型的普及与部署。DeepSeek-V2 瞄准的正是这一对矛盾:如何在保持强性能的同时,把训练成本与推理显存同时压下来。
论文的答案是"双管齐下的稀疏化":在注意力侧,MHA 的 KV 缓存是推理效率的最大障碍------每 token 需要缓存 2n_h d_h l 个元素(n_h 为头数、d_h 为头维度、l 为层数)。此前的 MQA 与 GQA 通过共享 KV 头压缩缓存,但论文的 7B 稠密消融显示,GQA 的 MMLU 41.2、MQA 37.9,都明显低于 MHA 的 45.2,"压缩头数"路线存在无法忽视的性能代价。在 FFN 侧,GShard、Switch Transformer 与 Mixtral 采用粗粒度路由专家,稀疏化收益有限。
从历史脉络看,MLA 并非凭空出现:2019 年 MQA、2023 年 GQA 持续探索缓存压缩,2024 年 DeepSeek-V2 首次提出 MLA 做到"不牺牲性能的压缩",随后 DeepSeek-V3、DeepSeek-R1 全系标配 MLA,FlashMLA 内核开源并被社区生态广泛跟进。MLA 把 KV 缓存从与头数线性相关降到与潜在维度相关,让 128K 长上下文与大批次部署从显存上变得可行,完成了从缓存压缩技术到推理架构标配的迁移。
研究主线:从问题到结论

图 1:(Mermaid 流程图)DeepSeek-V2 论文从问题到结论的研究主线。
基准/方法设计
DeepSeek-V2 总参数 236B、每 token 激活 21B,60 层 Transformer,隐藏维度 5120,128 个注意力头、每头 128 维。架构上有两大支柱:
- MLA(Multi-head Latent Attention):把 Key 与 Value 联合压缩进低维潜在向量 \\mathbf{c}_t\^{KV},推理时只需缓存潜在向量,缓存量从 2n_h d_h l 降至 (d_c+d_h\^R)l \\approx \\frac{9}{2}d_h l,等价于只有 2.25 组的 GQA,性能却强于 MHA。
- DeepSeekMoE:每层 2 个共享专家 + 160 个路由专家、激活 6 个,细粒度专家提升专业化,共享专家隔离冗余;配合设备受限路由(每个 token 最多发往 M=3 个设备)、专家级/设备级/通信级三类平衡损失与 token 丢弃策略,保证稀疏训练稳定高效。

图 2:MMLU 精度随激活参数的增长对比,以及 DeepSeek 67B(Dense)与 DeepSeek-V2 的训练成本与推理效率(arXiv 2024)。
分类全景

图 3:(Mermaid 流程图)注意力机制 KV 缓存压缩的四种路线分类。
方法细节
MLA 的三步设计。 第一步,低秩 KV 联合压缩:\\mathbf{c}_t\^{KV} = W\^{DKV}\\mathbf{h}_t,其中 d_c=512 为 KV 压缩维度,查询侧同样压缩到 d_c'=1536 以省训练激活内存。第二步,解耦 RoPE:由于 RoPE 是位置敏感的,直接作用于压缩键会阻止权重吸收,MLA 用额外的解耦查询 \\mathbf{q}_t\^R 与共享键 \\mathbf{k}_t\^R(每头 d_h\^R=64)单独承载位置编码。第三步,权重吸收:推理时 W\^{UK} 并入 W\^{Q}、W\^{UV} 并入 W\^{O},压缩后的注意力与标准注意力代数等价,不产生任何额外计算。

图 4:DeepSeek-V2 整体架构:MLA 显著压缩生成期 KV 缓存,DeepSeekMoE 通过稀疏计算降低训练成本。

图 5:MHA / GQA / MQA / MLA 对比:MLA 将 K、V 联合压缩为潜在向量,显著削减推理 KV 缓存。
各注意力机制每 token 的 KV 缓存(元素数)对比如下:MHA 为 2n_h d_h l、GQA 为 2n_g d_h l、MQA 为 2d_h l,而 MLA 仅为 (d_c+d_h\^R)l;在 DeepSeek-V2 的配置(d_c=4d_h、d_h\^R=\\frac{1}{2}d_h)下相当于 GQA 2.25 组,性能却更强。
对齐阶段。 预训练后收集 1.5M 指令实例(1.2M helpfulness + 0.3M safety)做 SFT,再用 **GRPO(Group Relative Policy Optimization)**做两阶段 RL:第一阶段用代码/数学推理奖励模型做推理对齐,第二阶段用 helpful、safety、rule 三个奖励模型做人类偏好对齐。GRPO 的优势在于无需与策略同规模的 critic 模型,用组内奖励的均值与标准差归一化优势 A_i = (r_i - \\mathrm{mean})/\\mathrm{std},显著节省 RL 训练成本;工程上采用混合引擎(训练/推理不同并行策略)+ vLLM 大批次推理 + CPU 卸载调度。
实验设计与结果
预训练。 语料 8.1T tokens,中文比英文多约 12%,经质量过滤与争议内容去除;AdamW 优化器、最大学习率 2.4\\times10\^{-4}、批大小从 2304 逐步升至 9216;训练基于 HAI-LLM 框架,16 路 zero-bubble 流水并行 + 8 路专家并行 + ZeRO-1,在 H800 集群上每万亿 token 仅 172.8K GPU 小时(DeepSeek 67B 需 300.6K,节省 42.5%)。长上下文用 YaRN 只作用于解耦共享键,32K 序列续训 1000 步即扩展到 128K。

图 6:Needle In A Haystack 评测:DeepSeek-V2 在 4K 至 128K 全区间上下文窗口表现稳定。
主结果。 在统一内部评测框架下对比 DeepSeek 67B、Qwen1.5 72B、Mixtral 8x22B、LLaMA3 70B:
| 基准 | DeepSeek 67B | Mixtral 8x22B | LLaMA3 70B | DeepSeek-V2 |
|---|---|---|---|---|
| MMLU (Acc.) | 71.3 | 77.6 | 78.9 | 78.5 |
| BBH (EM) | 68.7 | 78.9 | 81.0 | 78.9 |
| MATH (EM) | 18.7 | 42.5 | 42.2 | 43.6 |
| HumanEval (Pass@1) | 45.1 | 53.1 | 48.2 | 48.8 |
| C-Eval (Acc.) | 66.1 | 59.6 | 67.5 | 81.7 |
| CMMLU (Acc.) | 70.8 | 60.0 | 69.3 | 84.0 |
| 激活/总参数 | 67B/67B | 39B/141B | 70B/70B | 21B/236B |
仅 21B 激活参数,DeepSeek-V2 在 MMLU、数学与中文基准上达到开源顶级水平,成为当时最强开源 MoE 模型;中文能力(C-Eval 81.7、CMMLU 84.0)全面超越 LLaMA3 70B 与 Mixtral 8x22B。

图 7:训练与推理效率:DeepSeek-V2 相比 DeepSeek 67B 节省 42.5% 训练成本并大幅提升推理吞吐。
效率数字。 部署采用 FP8 权重 + 平均 6-bit KV 量化,单节点 8×H800 上生成吞吐超过 50K tokens/s(67B 的 5.76 倍),提示词输入吞吐超过 100K tokens/s。

图 8:HumanEval 与 LiveCodeBench(2023.09--2024.04)评测:DeepSeek-V2 Chat 的代码能力超越部分超大模型。
对齐与对话评测。 GRPO 两阶段 RL 后,AlpacaEval 2.0 长度控制胜率 38.9、MT-Bench 8.97、AlignBench 7.91;中文开放对话全面超越开源模型,甚至超过部分闭源模型;LiveCodeBench(2023.09--2024.04)上 Pass@1 超过部分超大模型。
消融实验。 7B 稠密模型上 MHA 的 MMLU 45.2 显著高于 GQA 41.2 与 MQA 37.9,证明压缩头数有性能代价;换成 MLA 后,16B 规模 MMLU 50.0、250B 规模 59.0,均反超同规模 MHA,且 KV 缓存仅为 MHA 的 14% 与 4%。
小模型验证。 DeepSeek-V2-Lite(15.7B 总参数/2.4B 激活,27 层,2 共享 + 64 路由专家)在 5.7T tokens 上从头训练,MMLU 58.3(基座)/55.7(Chat),全面超越同规模的 DeepSeekMoE 16B,证明 MLA + DeepSeekMoE 从小模型到大模型均可迁移复现。SFT 侧还发现:指令数据少于 10K 条时 IFEval 显著下降,说明大模型也需要足量数据培养技能。
结果对比总结

图 9:(Mermaid 流程图)DeepSeek-V2 与三个代表基线在激活参数与关键基准上的对比总结。
关键发现
- MLA 是注意力新范式:低秩 KV 联合压缩 + 解耦 RoPE + 权重吸收三者配合,缓存仅相当于 GQA 2.25 组(d_c=4d_h、d_h\^R=\\frac{1}{2}d_h),性能却反超 MHA;250B 规模下缓存只有 MHA 的 4%,MMLU 59.0 对 57.5。
- 经济训练兑现:每万亿 token 训练成本 172.8K GPU 小时,比 Dense 的 300.6K 节省 42.5%。
- 推理效率兑现:FP8 + 6-bit KV 量化,8×H800 单节点生成吞吐超 50K tokens/s,是 DeepSeek 67B 的 5.76 倍。
- 稀疏即强:21B 激活参数拿下 MMLU 78.5、MATH 43.6、CMMLU 84.0,成为最强开源 MoE 模型。
- 长上下文可靠:YaRN 只改解耦共享键,4K→128K 扩展后 NIAH 全区间表现稳定。
- 创新模式清晰:P9 证明等价性以统一(权重吸收的代数等价)、P14 刻画极限然后超越(先指出 MHA 缓存瓶颈再超越)、P6 重新表述为可解对象(显存瓶颈重构为低秩压缩),均有双规模消融与工程效率数字支撑,执行质量完整。
局限性
- 知识滞后:预训练后没有持续知识更新,可能产生幻觉与未经证实的信息。
- 语言覆盖有限:语料以中英为主,其他语言能力有限,使用需注意场景。
- 纯文本模态:当前仅支持文本,多模态能力列入未来计划。
- 对齐税:RL 偏好对齐会带来 BBH 等标准基准上的"对齐税",论文通过数据与训练策略缓解但未完全消除。
常见问题(FAQ)
DeepSeek-V2 的 MLA 与 MHA、GQA 有什么区别?
MLA 把 Key 与 Value 联合压缩进一个低维潜在向量,推理只缓存潜在向量,缓存量相当于 GQA 2.25 组,但性能反超 MHA------这是它与"压缩头数"路线的本质区别。
为什么 KV 缓存是推理效率的瓶颈?
KV 缓存随序列长度线性增长,直接决定可服务的最大批大小与序列长度;MLA 把每 token 缓存从 2n_h d_h l 降到 (d_c+d_h\^R)l,让大批次与 128K 长上下文在显存上变得可行。
GRPO 与 PPO 有什么不同?
GRPO 不需要与策略模型同规模的 critic 模型,用组内采样输出的奖励均值与标准差归一化优势,显著节省 RL 训练成本;DeepSeekMath 首次提出,DeepSeek-V2 用它做两阶段对齐。
DeepSeek-V2 与 DeepSeek-V3、R1 是什么关系?
DeepSeek-V2 首次提出 MLA 与 DeepSeekMoE 的组合,V3 与 R1 全系沿用 MLA 作为标配注意力架构,FlashMLA 内核进一步发挥其推理潜力,V2 是这条技术路线的起点。
如何复现或使用 DeepSeek-V2?
模型权重与代码在 GitHub 仓库 开源,另有 15.7B 的 DeepSeek-V2-Lite 便于小规模复现;论文附录给出了完整的超参数与训练细节。
参考链接
- DeepSeek-V2 arXiv 摘要页
- DeepSeek-V2 GitHub 项目(权重开源)
- DeepSeek-V3 技术报告(MLA 成为标配)
- DeepSeek-R1 推理模型
- DeepSeekMoE:极致专家专业化
- FlashMLA 高效内核
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)