Deepseek MLA CP通信AlltoAll

长文本CP 切分,共2次All2All

第一次AlltoAll,输入按Seq维度汇总,按Head维度切。(切输入,非TP维度的切参数)

s/c, b, n/t, h\] -AlltoAll-\> \[s, b, n/(t\*c), h

第二次AlltoAll,恢复按Seq维度切,按Head维度汇总。

s, b, n/(t\*c), h\] -AlltoAll-\> \[s/c, b, n/t, h

其中t 为TP, c 为CP, n = nHead数

举例: CP = 2, TP =4 , H = 8192, nHead = 16

阶段 形状 说明
输入 [s/2, b, 8192] CP 切分后,每 rank 持有半个序列
MLA 解压后 Q/K/V [s/2, b, 16, 192] 16 heads/rank(64 heads ÷ TP=4),经过了TP的降维
A2A 后(scatter head,gather seq) [s, b, 8, 192] 全序列,head 减半
Flash Attention 输出 [s, b, 8, 128] 全序列本地计算
A2A 后(scatter seq,gather head) [s/2, b, 16, 128] 还原序列分片
o_proj 后 [s/2, b, 8192] 还原 hidden_states, 经过TP升维
python 复制代码
compressed_kv [s, b, 576]          ← kv_a_proj 压缩后的 latent,是 _preprocess 的输入
    │
    ├── split → ct_kv [s, b, 512]   ← kv_lora_rank 部分
    │           k_pe  [s, b, 64]    ← rope 部分
    │
    ├── kv_a_layernorm(ct_kv)
    │
    └── kv_b_proj (Up-projection, 解压)
              [s, b, 512] → [s, b, 16heads, 128+128]
              k_nope [s, b, 16, 128]
              v      [s, b, 16, 128]

q_b_input (经过 q_b_proj 解压)
    q_nope [s, b, 16, 128]
    q_pe   [s, b, 16, 64]

最终拼接:
    query_states [s, b, 16, 192]  = q_nope + q_pe
    key_states   [s, b, 16, 192]  = k_nope + k_pe
    value_states [s, b, 16, 128]

MLA attention:

python 复制代码
DeepseekV2Attention
    └── self.core_attention_flash = FlashAttention(...)      # 基础 flash attn
              ↓ (当 CP + alltoall 时自动包装)
    └── self.core_attention_flash = DistributedAttention(FlashAttention, cp_group)
相关推荐
萌新小码农‍12 分钟前
Logistic回归为什么不用均方误差 MSE(square error)
人工智能·数据挖掘·回归
m0_749492221 小时前
GEO公司哪家好:行以致用科技服务流程从诊断到落地的全流程解析
人工智能·科技
lpfasd1231 小时前
2026年第36周GitHub趋势周报:Agent技能化、MCP工具化与AI工程化加速
人工智能·github
外域速览3 小时前
OpenAI 智能体「越狱」风波未平,苹果折叠屏 iPhone Ultra 下周三登场
人工智能·ios·iphone
william_yangshun7 小时前
【AI Agent 实战】agent-vision-toolkit 中文版:给纯文本模型(DeepSeek)装上视觉能力
人工智能·多模态
智能体与具身智能7 小时前
TVA具身智能的概念、架构与应用(19)
人工智能·python·具身智能
AI智能体工作室7 小时前
生产级 RAG 检索增强架构实战:向量数据库、混合检索(Hybrid Search)、RRF 融合与重排(Rerank)全链路
人工智能
geinvse_seg8 小时前
我做了个 AI 架构审查员,把整个微服务项目通读了一遍,还顺手做成了 Skill
人工智能
李帅朋8 小时前
微分基本定义笔记
人工智能·笔记·深度学习·神经网络
醍醐实验室8 小时前
下一代端到端全模态(Omni)模型解密:离散音频 Token 化与极速双工流式交互架构
人工智能