第06章-超节点

第 06 章:超节点

一句话定位:多设备协作的完整方法论------六种并行方式、集合通信代价、scale-up 物理组织(NVLink/TPU/昇腾 UB)与内存池;"放大超节点得到的是容量和总吞吐,不是单个会话的速度"。上一页:第05章-算子与运行时,下一页:第07章-数据中心网络。

小白入门:为什么一张卡不够用?

生活类比:一个人搬不动一台冰箱------需要两个人抬。但两个人抬不是"一个人搬两倍快",而是"两个人一起搬一台"。同样,多张 GPU 卡协作不是"一张卡跑两倍快",而是"多张卡一起跑一个模型"。

核心问题 :70B 模型权重 141GB,一张 H100 只有 80GB------连装都装不下。必须把模型拆开放到多张卡上。

"放大超节点得到的是容量和总吞吐,不是单个会话的速度。"


一、六种并行方式

类比:把一个蛋糕分给多人吃------可以按人数分(数据并行)、按层数分(流水线并行)、按每层的块分(张量并行)......

并行方式 切分维度 类比 适用场景
DP(数据并行) 样本 B 每人分一块蛋糕 每卡跑完整模型,处理不同请求
TP(张量并行) 特征 H 把蛋糕竖着切,每人拿一部分 每卡跑模型的一部分,同一请求
SP(序列并行) 序列位置 S 把蛋糕横着切 长序列按位置分到不同卡
CP(上下文并行) 上下文块 把蛋糕按层分 超长上下文分块处理
PP(流水线并行) 层 L 流水线------每人负责一道工序 模型按层切分,轮流处理
EP(专家并行) 专家 E 每人负责不同科室 MoE 模型的专家分到不同卡

套娃组合结构:DP 复制完整 TP×PP×EP 实例------大并行里套小并行。


二、集合通信的代价

类比:多人协作需要沟通------沟通本身也要花时间。如果沟通时间比干活时间还长,多人协作就不划算。

关键判据:TP 卡数翻倍的条件------通信增量须小于本地时间节省。

"并行收益随规模递减:串行处理的耗时仍然存在。"

通信-计算竞争:"单独加快通信不一定能加快整体执行"------64 MiB 通信与矩阵乘并发仅省 2.7ms 而非全部 11ms。

大小消息的分界

"数据量小时看延迟,数据量大时看持续带宽。"


三、超节点的物理组织

类比:办公室布局------小团队面对面坐(直连),中等团队用共享白板(交换机),大公司分层管理(分层互联)。

方案 类比 代表 特点
直连 面对面坐 早期 8 卡 NVLink 每卡连每卡,端口数爆炸
交换 共享白板 NVSwitch 集中交换,端口数可控
分层 分层管理 DGX → NVL72 scale-up 内紧密,scale-out 走网络

三大平台对比

平台 互联 规模上限 特色
NVIDIA NVL72 NVSwitch + NVLink 72 GPU 缓存一致,端口分配决定割集带宽
TPU v4 ICI 环面 + OCS 4096 芯片 光路交换毫秒级切换
华为 UB 事务层+传输层分离 384×910C 256KiB 缓存容纳四千多台主机

华为 UB 的关键优势:连接状态按端点数相加而非按端点对相乘------逐对连接只容 8 台主机,UB 方案容 4000+ 台。


四、内存池

类比:同事的桌子空着,你把文件放他桌上------用的时候取回来。

  • 借用与访问边界:在途事务窗口 uq/L
  • 重复读取约 10 次时取回本地更省------超过这个阈值,不如搬回本地

五、关键量化数据

项目 数值
HGX H100 基线 8×H100,每卡每方向 NVLink 450GB/s
NVLink 单向延迟 0.822μs vs IB 3.76μs
Qwen3-235B-A22B BF16 权重 470.2GB(单卡 6 倍),8 卡 TP 每卡 61.5GB
V4.1 Flash 算例(256 H100) 超节点 8→64 卡每卡吞吐 ×7.4;64→256 无收益
昇腾 950 UB 双向 2016GB/s
64B 远程读取 UB 0.42μs vs PCIe 网卡 2.2μs

"单个 token 调用的 MFU 不会超过 0.3%......各种并行方式,都是在这一约束下重新组织权重的读取与复用。"


相关推荐
用户794572239541342 分钟前
当卖 token 的遇上修高速公路的:AI 周期的真空期在哪
人工智能·agent
Raas10042 分钟前
AI网关能做语义缓存吗?MAI Gateway(魔芋企业级AI网关)实战能力深度解读
java·后端·spring
2601_9689007744 分钟前
意图召回与相关性过滤实战:把出价放在排序之后
人工智能
知几蜗牛44 分钟前
Java 17标准HTTP调用语音转写API的超时与错误处理
人工智能
静水深码1 小时前
AI 能翻好谐音梗吗
人工智能·后端
9i编程1 小时前
8. 教 AI 上班:带出我的数字同事 —— 亲测第一轮:7 个问题逐条改,打包运行再回看
人工智能·openai·ai编程
柏修1 小时前
Java工程师转型Agent Engineer - 24周详细学习计划
后端
牛气冲天的星球1 小时前
服务器资源监控之grafana+Prometheus配置
后端
用户360055579001 小时前
【FHE 同态加密】我们如何实现同态加密推理(九):逐层尺度自适应——同态加密里为什么每层都要单独定标(scale 管理)
人工智能