rocev2

gwf2162 小时前
rdma·nvlink·nccl·dpu·rocev2·aiinfra·gpudirect
NVLink与RDMA融合:Scale-Up/Scale-Out统一互联架构深度解析摘要:本文深度解构NVLink与RDMA在AI集群中的融合架构。从芯片RTL级剖析Scale-Up/Out统一互联的数据通路、寄存器定义与流水线时序,探讨MoE/LLM场景下的集合通信硬件加速、拥塞控制状态机及GPUDirect零拷贝路径,为资深网络芯片工程师提供设计验证与部署调优的硬核指南。
cyf312 天前
ai训练·rocev2·pfc·ecn·无损网络
RoCEv2无损网络实战:PFC反压与ECN拥塞控制深度解析在 RoCEv2 智算网络中,PFC 通过 XOFF/XON 做链路级反压,ECN 通过 IP 头 CE 标记触发 DCQCN 源端降速。本文用 CLOS 组网和 All2All incast 场景,拆清楚 PFC 与 ECN 的分工。
gwf2163 天前
ai训练·rdma·nccl·rocev2·pfc·dcqcn·gpudrirect
PFC风暴与RDMA死锁:AI训练典型故障深度分析——从芯片RTL到集群架构的全栈解构摘要:本文从芯片RTL与集群架构视角,深度解构AI训练中PFC风暴与RDMA死锁的根因。涵盖RoCEv2协议状态机、RNIC寄存器定义、拥塞控制硬件流水线及GPUDirect数据通路,提供从故障排查到NCCL调优的全栈实战指南。
gwf21617 天前
rdma·nccl·scaleout·rocev2·ai集群·rnic·gpudirect
AI集群RDMA网络架构总览:从Scale-Out到多平面摘要:本文深度剖析AI集群RDMA网络架构,从Scale-Out拓扑演进至多平面组网。结合芯片级硬件实现,探讨RNIC寄存器、RTL数据流及GPUDirect RDMA通路,为万卡集群的高吞吐、低尾延迟网络建设提供实战指南。
Eloudy2 个月前
网络·fpga开发·rocev2
QSFP28、RoCEv2、RFSoC-4x2 数据传输与器件链路1MB 数据通过 RoCEv2 协议,从 RFSoC-4x2 传输到另一台 RFSoC-4x2 的完整数据流过程。 重点展示串并转换、并串转换的每个细节,以及跨器件时的协议封装/解封装。
mounter6252 个月前
linux·网络·人工智能·linux kernel·kernel·rdma·rocev2
探索未来 AI 算力网络的基石:从传统 RoCE 走向 SRv6 驱动的弹性弹性网络(解析 Netdev 0x1A 创新实践)随着大语言模型和万亿参数 AI 训练的爆发,传统的网络架构正面临前所未有的挑战。在 Netdev 0x1A 会议上,来自 OpenAI、微软、AMD 和博通等技术巨头展示了一项跨越行业合作的突破性成果:如何利用极简的 SRv6(Segment Routing IPv6)与创新的多平面 RoCE 数据包喷洒(Packet Spraying)技术,构建一个具备极高弹性的超大规模 AI 超级计算机网络。
tiantianuser1 年前
fpga开发·verilog·fpga·rdma·高速传输·rocev2
RDMA简介5之RoCE v2队列在RoCE v2协议中,RoCE v2队列是数据传输的最底层控制机制,其由工作队列(WQ)和完成队列(CQ)共同组成。其中工作队列采用双向通道设计,包含用于存储即将发送数据的发送队列(SQ)和用于存储已接收到的数据的接收队列(RQ),二者共同组成了端到端的数据传输管道(Pipeline)每一个SQ与RQ绑定起来称为队列对(QP),每个队列对中包含有若干个工作队列元素(WQE)和一些其他元素如本地接收队列指针、本地发送队列指针、远程接收队列指针、远程发送队列指针等。同样的,每一个CQ中也存在着若干完成队列元
星融元asterfusion2 年前
网络·交换机·roce·rocev2·easy roce
Easy RoCE:在SONiC交换机上一键启用无损以太网RDMA(远程直接内存访问)技术是一种绕过 CPU 或操作系统,在计算机之间直接传输内存数据的技术。它释放了内存带宽和 CPU,使节点之间的通信具有更低的延迟和更高的吞吐量。目前,RDMA 技术已广泛应用于高性能计算、人工智能工作负载、存储和许多其他场景。
我是有底线的