技术栈

dcqcn

gwf216
8 天前
ai训练·rdma·网络架构·拥塞控制·dcqcn·gpudirect·hpcc
AI训练RDMA拥塞控制:DCQCN/TIMELY/HPCC/Swift —— 芯片级深度剖析与硬件实现📑 目录 一、前言/AI场景背景 二、核心原理与硬件架构 三、硬件实现深度剖析 四、AI通信的RTL与寄存器级实现 五、实战部署与配置 六、性能分析与尾延迟评测 七、常见问题排查 八、总结与最佳实践 参考资料
haimin0371
1 个月前
roce·dcqcn
DCQCN 拥塞控制算法原理和参数配置在现代数据中心网络中,RDMA over Converged Ethernet (RoCEv2) 已成为高性能分布式存储和 AI 训练集群的主流通信协议。RDMA 要求网络提供 无损传输能力,这对拥塞控制提出了严苛挑战。
我是有底线的