【arXiv 2024】DeepSeek-V2 论文解读:经济训练与高效推理的 MoE 大语言模型|从稀疏架构降本增效视角本文解读 arXiv 2024 论文《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》。该论文提出DeepSeek-V2 大语言模型,通过融合MLA(多头潜在注意力)、DeepSeekMoE(细粒度专家稀疏)与GRPO 两阶段对齐,在 236B 总参数、每 token 仅激活 21B 的条件下支持 128K 上下文,其特别之处在于用低秩 KV 联合压缩把推理显存瓶颈转化为一次可被矩阵吸收的