AI集群交换网络可以按端点、Leaf、Spine和验收四层计算。第一步不是选400G还是800G,而是列出服务器数量、每台网络端口数、每个端口的协议与目标速率,并区分训练、存储和管理平面。
接入总带宽的规划式为:服务器端口数量乘以单端口目标速率。Leaf上行总带宽则是上行端口数量乘以上行速率。接入总带宽与上行总带宽的比值可描述收敛程度。例如接入侧合计容量大于上行侧,多个端点同时跨Leaf时就可能竞争带宽。但公式只用于容量预算,实际结果还受协议开销、PCIe、NUMA、网卡、流量分布和故障状态影响。
第二步核对端口密度。规格表中的物理连接器不一定等于逻辑端口数。Breakout可把一个高速连接器拆成多个较低速率接口,但需要确认交换端口支持的拆分模式、每条Lane速率、对端网卡、光模块或铜缆、光纤芯数与固件组合。建议在BOM中同时记录"物理口、逻辑口、目标速率、拆分物料",不要只记录连接器数量。
第三步建立Leaf-Spine端口预算。每台Leaf要保留足够的服务器接入口和上行口;每台Spine则要容纳所有Leaf的连接。扩容不是简单再放一台Leaf,因为Spine剩余端口、跨机柜布线和上行比例都会变化。若采用多Rail,还要分别检查每个Rail的端点分布,避免某一Rail先形成热点。
第四步计算故障态。分别假设一条上行失效、一个Spine不可用或一个Leaf下线,重新计算剩余上行带宽和可达路径。高可用设计经常能保证连通,但不能自动保证原有性能目标。验收标准应写清故障后允许的带宽下降、作业影响和恢复时间。
第五步做分层测试。先用链路与主机工具验证单端口、PCIe和NUMA,再运行同Leaf与跨Leaf的NCCL测试;随后增加节点和并发作业,并注入可控故障。固定节点清单、消息大小、软件版本和运行时长,记录algbw、busbw、P95/P99、离散程度以及交换机端口利用率、错误、丢弃与队列指标。
测试时还要注意流量放置。若所有进程恰好落在同一Leaf,可能绕开了上行瓶颈;一次跨Leaf结果也可能因路径分布偶然较好而失真。应轮换节点组合,覆盖不同Leaf和Spine路径,并保留拓扑快照。
最终交付物应包含端点矩阵、端口预算、BOM、正常态与故障态容量表,以及可重复的测试记录。单端口速率说明设备上限,拓扑和端到端路径决定集群能否稳定把能力交付给GPU。