rnic

gwf21615 天前
芯片设计·rdma·nccl·拥塞控制·ai集群·rnic·gpudirect
AI训练RDMA性能Profiling:瓶颈定位与调优方法论摘要:本文聚焦AI集群RDMA性能Profiling,从芯片RTL与寄存器级深度剖析RNIC数据流、拥塞控制与GPUDirect通路。结合NCCL硬件加速与多平面拓扑,提供万卡集群尾延迟瓶颈定位、硬件级调优及故障排查的实战方法论,为资深网络芯片与架构工程师提供硅片级的性能优化指南。
gwf21623 天前
芯片设计·rdma·rnic·gpudirect·pciegen6·dma引擎·mrc协议
800G RNIC芯片设计挑战:PCIe Gen6与DMA引擎架构 —— 面向AI超大规模集群的硬件实现深度解析📑 目录摘要:本文深度剖析800G RNIC芯片架构,从RTL数据流、PCIe Gen6 DMA引擎到MRC协议硬件卸载,量化解析AI集群中的纳秒级延迟与拥塞控制,为RDMA芯片工程师提供设计验证级参考。
gwf2161 个月前
rdma·infiniband·nccl·ai集群·rnic·gpudirect·railoptimized
Rail-Optimized拓扑:AI训练集群的RDMA拥塞消除与硬件实现深度解析摘要:本文从芯片RTL与协议栈底层视角,深度剖析Rail-Optimized拓扑在AI集群中消除RDMA拥塞的机制。涵盖RNIC硬件架构、流水线时序、NCCL硬件加速及实战调优。
gwf2161 个月前
rdma·nccl·scaleout·rocev2·ai集群·rnic·gpudirect
AI集群RDMA网络架构总览:从Scale-Out到多平面摘要:本文深度剖析AI集群RDMA网络架构,从Scale-Out拓扑演进至多平面组网。结合芯片级硬件实现,探讨RNIC寄存器、RTL数据流及GPUDirect RDMA通路,为万卡集群的高吞吐、低尾延迟网络建设提供实战指南。
我是有底线的