千卡训练的隐形账单:通信不是瓶颈上一篇 GPU 为什么会挨饿 把视角从单点分析推到全链路优化。今天进入 Datawhale mlsysim 学习活动的第五阶段,问题换了一句话:从一台机器走到一千张卡,成本会怎么变? 对应教程:06 Scaling to 1000 GPUs、07 Geography is a Systems Variable、08 The $9M Question。今天跑下来有两个意外:规模扫描那张表里,通信开销不是随规模上升,而是从 1336.8ms 掉到 319.1ms;而可靠性部分的结论,交叉点位置比教程说的远得多