第 07 章:数据中心网络
一句话定位:跨服务器协作------割集下界、并行方式与通信放置、在网归约、并发三重约束、拥塞控制分工与背压;"有网卡不等于用上了网卡"。上一页:第06章-超节点,下一页:第08章-推理优化。
小白入门:为什么 1024 张卡不能当 1 张卡用?
生活类比:1024 个人一起做一道菜------光协调谁干什么、食材怎么传,就要花大量时间。人越多,协调成本越高,到某个点后加人反而更慢。
核心问题 :超节点(机内)解决了 8-72 张卡的协作,但千亿参数模型训练需要上千张卡------必须跨服务器。跨服务器的网络比机内互联慢得多(NVLink 900GB/s vs 网卡 50GB/s),网络成为瓶颈。
"有网卡不等于用上了网卡,通信算法决定每张网卡分到多少字节。"
一、割集与下界
类比:一条公路的通行能力由最窄的那段决定------不管其他段多宽。
T_C = V_C/B_C------传输时间下界 = 数据量 / 割集带宽
"链路每秒传的字节数都不会超过它的带宽。"
二、算法决定量、放置决定路径
类比:搬家时------搬多少东西由你决定(算法),走哪条路、经过哪些路口由房子位置决定(放置)。
| 算法 | 跨服务器传输量 | 说明 |
|---|---|---|
| 连续环 | 720 MiB | 环绕所有服务器 |
| 分层 | 384 MiB | 先机内归约再跨服务器 |
"算法决定总发送量,参与者在服务器上的分布则决定其中多少需要跨服务器传输、经过哪些网卡。"
通信放置原则:把频繁的张量并行归约留在较快的互联内,把数据并行的梯度同步放到服务器之间。
三、在网归约(SHARP)
类比:传统归约像每个人把数字写在纸上交给汇总人------汇总人加一遍。在网归约像快递员边送包裹边帮你加数字------到了目的地已经加好了。
S 台服务器时:环发送 2(S-1)/S 分片,在网归约恒一次。
四、并发三重约束
类比:高速公路通行量受三个因素限制------车道数(链路带宽)、收费站窗口数(槽位)、车辆进入速率(发起速率)。
B_eff ≤ min(B_path, Nm/T, m/δ)
五、拥塞控制分工
类比:交通管制------红绿灯管局部路口(链路流控 PFC),导航软件管全局路线(端到端 ECN/DCQCN)。
| 层级 | 机制 | 响应时间 | 作用 |
|---|---|---|---|
| 链路流控(PFC) | 一跳 0.33μs | 极快 | 挡局部溢出 |
| 端到端(ECN/DCQCN) | 20μs 往返 | 较慢 | 降源头速率 |
背压:"请求槽位用满后,端点就暂停或放慢提交,防止未完成的工作无限增长。"
六、关键量化数据
| 项目 | 数值 |
|---|---|
| NVLink H100 双向 / NIC / PCIe | 900 / 50 / 32-64 GB/s |
| 192 MiB 梯度归约 | 连续环 7.6ms → 分层 1.3ms |
| 超售 3:1 | 1024 卡每卡份额 50→17.2 GB/s |
| 64B 远程读取 | PCIe 网卡 2222ns / UB Load 419ns |
| 状态量(N=M=1024) | 逐对连接 512 MiB vs 端点+通道 108 KiB(差 4855 倍) |
| 1024 卡扩展 | 8→64 卡吞吐 +36%;128→256 卡仅 +1.3% |
| 故障统计 | 1024 卡作业平均 7.9 小时中断一次 |
"平均利用率只有 40%",但高峰重叠仍积压------"缓冲保存的是一段时间内的差额"。