dcqcn

gwf21611 天前
rdma·nccl·硬件加速·rocev2·dcqcn·gpudirect·ai集群网络
RDMA在联邦学习与跨DC训练中的应用:从协议栈到芯片微架构的深度解析摘要:本文从芯片微架构到跨DC联邦学习,深度剖析RDMA在AI集群中的硬件实现。涵盖RNIC RTL数据流、GPUDirect零拷贝通路、NCCL集合通信硬件加速及DCQCN拥塞控制状态机。提供寄存器级配置、ns级时序量化与故障排查指南,为资深网络芯片工程师提供AI Infra底层优化参考。
gwf21621 天前
ai训练·rdma·nccl·rocev2·pfc·dcqcn·gpudrirect
PFC风暴与RDMA死锁:AI训练典型故障深度分析——从芯片RTL到集群架构的全栈解构摘要:本文从芯片RTL与集群架构视角,深度解构AI训练中PFC风暴与RDMA死锁的根因。涵盖RoCEv2协议状态机、RNIC寄存器定义、拥塞控制硬件流水线及GPUDirect数据通路,提供从故障排查到NCCL调优的全栈实战指南。
gwf2161 个月前
ai训练·rdma·网络架构·拥塞控制·dcqcn·gpudirect·hpcc
AI训练RDMA拥塞控制:DCQCN/TIMELY/HPCC/Swift —— 芯片级深度剖析与硬件实现📑 目录 一、前言/AI场景背景 二、核心原理与硬件架构 三、硬件实现深度剖析 四、AI通信的RTL与寄存器级实现 五、实战部署与配置 六、性能分析与尾延迟评测 七、常见问题排查 八、总结与最佳实践 参考资料
haimin03712 个月前
roce·dcqcn
DCQCN 拥塞控制算法原理和参数配置在现代数据中心网络中,RDMA over Converged Ethernet (RoCEv2) 已成为高性能分布式存储和 AI 训练集群的主流通信协议。RDMA 要求网络提供 无损传输能力,这对拥塞控制提出了严苛挑战。
我是有底线的