rdma

gwf2161 天前
ai训练·rdma·网络架构·拥塞控制·dcqcn·gpudirect·hpcc
AI训练RDMA拥塞控制:DCQCN/TIMELY/HPCC/Swift —— 芯片级深度剖析与硬件实现📑 目录 一、前言/AI场景背景 二、核心原理与硬件架构 三、硬件实现深度剖析 四、AI通信的RTL与寄存器级实现 五、实战部署与配置 六、性能分析与尾延迟评测 七、常见问题排查 八、总结与最佳实践 参考资料
gwf2165 天前
rdma·nccl·scaleout·rocev2·ai集群·rnic·gpudirect
AI集群RDMA网络架构总览:从Scale-Out到多平面摘要:本文深度剖析AI集群RDMA网络架构,从Scale-Out拓扑演进至多平面组网。结合芯片级硬件实现,探讨RNIC寄存器、RTL数据流及GPUDirect RDMA通路,为万卡集群的高吞吐、低尾延迟网络建设提供实战指南。
gwf2166 天前
网络·rdma·dpu·高性能网络·800g·智能网卡·rtl验证
RDMA迈向400G/800G:超宽带网络的技术挑战与突破 —— 从芯片架构到RTL实现的深度解析📑 目录摘要:本文从芯片设计验证视角,深度剖析RDMA迈向400G/800G超宽带网络的技术挑战与突破。探讨PAM4调制、512-bit MAC并行通路、SerDes信号完整性与散热设计,详解RTL数据流、寄存器映射、PCIe Gen5 x16带宽瓶颈与WQE/CQE时序优化,并提供超宽带AI网络底座的实战部署与调优指南。
mounter6257 天前
linux·linux kernel·kernel·rdma·net namespace
将 RDMA 引入容器:Soft-RoCE (RXE) 网络命名空间支持深度解析摘要在云原生与容器化技术普及的背景下,Linux 网络命名空间(Network Namespace, netns)构成了 Docker、Kubernetes 等容器隔离的核心基础。然而,Linux 内核中的 Soft-RoCE (RXE)(基于软件实现的 RoCEv2 协议栈驱动)在以往版本中存在严重的“命名空间盲(Namespace-Blind)”缺陷,导致其无法直接运行于隔离的容器环境中。
tiantianuser12 天前
网络协议·rdma·高速传输·cmac·roce v2
NVME-oF IP 设计15 : 适于高速网络存储系统的IP设计1目前,短时高速传输需求呈爆发式发展,这类数据具有瞬时带宽高、数据量集中、写入时延敏感等典型特征。相关技术要求如下: 1)在数据写入性能方面,数据吞吐可达到数十Gbps量级,若存储系统无法提供足够的持续写入带宽,将直接导致缓存溢出或数据丢失。因此,存储系统必须具备高吞吐、低抖动、可持续写入能力,能够在短时间内吸收大量突发数据流。目前大部分设备在连续读写下传输带宽需要满足大于40 Gbps要求。 2)在容量与扩展性方面,由于数据体量巨大,单次任务可能产生数百GB至数TB级数据。系统需支持多块固态存储设备协同工
tiantianuser12 天前
网络协议·rdma·高速传输·roce v2·nvme of
NVME-oF IP 设计16 : 适于高速网络存储系统的IP设计2IP使用离不开应用需求,本博客以某项目为例,介绍本IP应用。续上文: 表1 网络传输系统的具体性能指标 为满足以上需求,该系用采用一种基于 NVMe over Fabrics(NVMe-oF)的网络化高性能存储系统。系统整体架构如图1所示,按照功能划分可分为网络接口层、网络协议层、存储层及内存管理层四个部分。其中,核心功能由RDMA IP模块、NVMe-oF模块以及NVMe Host Controller(NVMe HC)模块协同完成。
mounter62521 天前
网络·网络协议·tcp/ip·rdma·devmem
绕过主机:通过 Devmem TCP 运行 RDMA 应用标准的 Linux 网络协议栈使用由 sk_buff 结构包裹的包缓冲区,这些结构指向系统的主机内存页。多年来,这种以主机为中心的抽象已经足够使用。然而,大规模分布式计算和机器学习的兴起,使主机 CPU 内存复制成为了严重的架构瓶颈。
Eloudy21 天前
gpu·rdma·roce
ubuntu 22.04 -cuda12.8.2- holoscan-sdk-4.5-doca-ofed先安装 build-essential 再安装 gcc-12,因为 cuda12.8.2需要gcc-12 才能安装成功。
Eloudy1 个月前
docker·gpu·rdma
国内加速 docker pull 下载 docker images,特别是 nvidia 的cuda image添加如下文件内容 $ cat /etc/docker/daemon.json重启生效:一次性快捷方式:
tiantianuser1 个月前
rdma·高速传输·roce v2·nvme of
NVME-oF IP 设计12 : Capsule是胶囊?Capsule字面意思是胶囊,它在是 NVMe-oF扮演什么角色呢?实际上它从协议层与传输层解耦,就是NVMe oF标准消息容器,并且它是 NVMe-oF 跨网络通信的最小逻辑单元,其用于在网络上传输NVMe命令。它的架构定位如图1所示: 图1 Capsule 的架构定位
tiantianuser1 个月前
网络存储·rdma·高速存储·高速传输·nvme of
NVME-oF IP 设计14 : 简介NVMe oF IP特点本NVMe-oF IP(Non-Volatile Memory Express over Fabrics)是一种将NVMe协议性能延伸至网络的技术,实现存储资源的灵活共享和扩展。
Eloudy1 个月前
gpu·rdma
全文笔记 - GPU-Initiated Networking for NCCL现代 AI 工作负载——尤其是混合专家(Mixture-of-Experts,MoE)架构——日益需要低延迟、细粒度且由设备端控制的 GPU 到 GPU 通信。传统 GPU 通信遵循主机发起(host-initiated)模型,由 CPU 编排所有通信操作——这是 CUDA 运行时模型的固有特征。尽管该模型对集合通信操作而言足够稳健,但对于需要计算与通信紧密集成的应用,采用设备发起(device-initiated)的通信以消除 CPU 协调开销将带来显著收益。
liuyunshengsir1 个月前
网络·rdma
perftest 工具集ib_write_bw中的 RDMA Write 带宽测试工具手册ib_write_bw 是 perftest 工具集中的 RDMA Write 带宽测试工具,主要用于测试:
Eloudy1 个月前
gpu·fpga·rdma
Holoscan Sensor Bridge 入门指南(Getting Started)Holoscan Sensor Bridge 提供了一个基于 FPGA 的接口,用于利用 GPU 进行低延迟的传感器数据处理。外设数据由 Holoscan Sensor Bridge 设备的 FPGA 采集,并通过以太网以 UDP 方式发送至主机系统。在 IGX Devkit 或 DGX Spark 等系统中,ConnectX SmartNIC 接口可以将 UDP 数据直接写入 GPU 显存,从而大幅降低延迟。Holoscan Sensor Bridge 的主机端软件支持将接收到的传感器数据集成到 Hol
tiantianuser1 个月前
rdma·高速传输·cmac·roce v2·nvme of
NVME-oF IP 设计10:设计目标是什么?NVMe-oF协议的设计目标是使远程NVMe设备能够以接近本地NVMe的性能被访问。在传统网络存储系统中,例如iSCSI或NFS,数据传输需要经过复杂的网络协议栈处理,并且存在较多的数据复制和上下文切换操作,从而导致较高的访问延迟。相比之下,NVMe-oF通过保持NVMe命令结构不变,并在高速网络上传输NVMe命令,使远程访问能够保持较低的协议开销。 NVMe-oF的第一个设计目标是降低远程访问延迟。NVMe协议本身具有较低的命令处理开销,而NVMe-oF通过轻量级协议封装和高性能网络传输机制,使远程NV
tiantianuser1 个月前
网络协议·rdma·高速传输·roce v2·nvme of
NVME-oF IP 设计11 : 控制面与数据面干什么用?NVMe-oF协议在结构上可以分为控制面(Control Plane)和数据面(Data Plane)两个部分。控制面主要负责连接建立、队列创建以及设备管理等操作,而数据面则负责实际的数据读写传输。 控制面主要通过管理命令实现。例如,在NVMe-oF建立连接时,Initiator需要首先发送Discover命令获取可用Target信息,然后通过Connect命令建立NVMe-oF会话,如图1所示。在连接建立过程中,双方需要协商队列数量、队列深度以及其他协议参数。在这之后可能会进入认证阶段。完成这些操作后,
Eloudy1 个月前
rdma
ubuntu 22.04安装 Mellanox 的 MFT 工具包Mellanox/NVIDIA 网卡 MFT(Mellanox Firmware Tools) 在 Ubuntu 上的完整安装指南。
mounter6251 个月前
linux·ebpf·linux kernel·kernel·rdma·xdp
高性能网络技术演进与创新探索:RDMA、eBPF/XDP 深度解析及 LSF/MM/BPF 2023 专题演讲RDMA (Remote Direct Memory Access,远程直接内存访问) 是一种专为突破传统 TCP/IP 网络协议栈性能瓶颈而设计的高性能网络通信技术。
tiantianuser1 个月前
网络协议·rdma·高速传输·nvme-of
NVME-oF IP 设计8 :设计扫盲6RoCEv2 协议封装与数据流 RoCE(RDMA over Converged Ethernet)是RDMA在以太网上的实现方式。RoCE协议通过在以太网帧中封装RDMA数据,使RDMA能够运行在标准以太网环境中。RoCE最初版本(RoCEv1)仅支持二层网络,而RoCEv2采用UDP/IP封装方式,使RDMA数据能够在三层网络中进行路由,从而适用于大规模数据中心环境。 在RoCEv2协议中,RDMA数据包的基本封装结构包括以太网头部、IP头部、UDP头部以及Infiniband传输头(IB Trans
tiantianuser1 个月前
网络协议·rdma·roce v2·nvme of
NVME-oF IP 设计7 :设计扫盲5# QP、WR、CQ、MR 等核心概念RDMA 通信模型中涉及多个核心组件,其中包括队列对(QP)、工作请求(WR)、完成队列(CQ)以及内存区域(Memory Region,MR)等概念,这些组件共同构成了RDMA数据传输机制的基础。