技术栈
dcqcn
gwf216
8 天前
ai训练
·
rdma
·
网络架构
·
拥塞控制
·
dcqcn
·
gpudirect
·
hpcc
AI训练RDMA拥塞控制:DCQCN/TIMELY/HPCC/Swift —— 芯片级深度剖析与硬件实现
📑 目录 一、前言/AI场景背景 二、核心原理与硬件架构 三、硬件实现深度剖析 四、AI通信的RTL与寄存器级实现 五、实战部署与配置 六、性能分析与尾延迟评测 七、常见问题排查 八、总结与最佳实践 参考资料
haimin0371
1 个月前
roce
·
dcqcn
DCQCN 拥塞控制算法原理和参数配置
在现代数据中心网络中,RDMA over Converged Ethernet (RoCEv2) 已成为高性能分布式存储和 AI 训练集群的主流通信协议。RDMA 要求网络提供 无损传输能力,这对拥塞控制提出了严苛挑战。
我是有底线的