技术栈

ipc交换

久久学姐
1 天前
实现原理·sglang·customallreduce·nvlinkp2p·ipc交换
SGLang Custom AllReduce v1 与 v2 实现原理详解0x0. 前言在TP并行的情况下, 每一个层, 至少会有两次all-, 一次是在之后, 另一次是在MLP/MoE之后, 那些有着几十上百层的模型中一步就会出现几百次all-的情况, 并且每次传输的数据量都很小, 比如bs为1, 8192的bf16模型的数据量是16KB。此负载特征将瓶颈判定为延时而非带宽, NCCL这类针对大消息以及任意拓扑予以设计的通用库在此区间的开销颇为偏大, 因而其中存在两代自定义all - 实现, 从vLLM移植而来的(以下简称为v1, 在 =0时启用)以及当下默认的v2。
我是有底线的