rdma

mounter62518 小时前
网络·网络协议·tcp/ip·rdma·devmem
绕过主机:通过 Devmem TCP 运行 RDMA 应用标准的 Linux 网络协议栈使用由 sk_buff 结构包裹的包缓冲区,这些结构指向系统的主机内存页。多年来,这种以主机为中心的抽象已经足够使用。然而,大规模分布式计算和机器学习的兴起,使主机 CPU 内存复制成为了严重的架构瓶颈。
Eloudy1 天前
gpu·rdma·roce
ubuntu 22.04 -cuda12.8.2- holoscan-sdk-4.5-doca-ofed先安装 build-essential 再安装 gcc-12,因为 cuda12.8.2需要gcc-12 才能安装成功。
Eloudy6 天前
docker·gpu·rdma
国内加速 docker pull 下载 docker images,特别是 nvidia 的cuda image添加如下文件内容 $ cat /etc/docker/daemon.json重启生效:一次性快捷方式:
tiantianuser10 天前
rdma·高速传输·roce v2·nvme of
NVME-oF IP 设计12 : Capsule是胶囊?Capsule字面意思是胶囊,它在是 NVMe-oF扮演什么角色呢?实际上它从协议层与传输层解耦,就是NVMe oF标准消息容器,并且它是 NVMe-oF 跨网络通信的最小逻辑单元,其用于在网络上传输NVMe命令。它的架构定位如图1所示: 图1 Capsule 的架构定位
tiantianuser10 天前
网络存储·rdma·高速存储·高速传输·nvme of
NVME-oF IP 设计14 : 简介NVMe oF IP特点本NVMe-oF IP(Non-Volatile Memory Express over Fabrics)是一种将NVMe协议性能延伸至网络的技术,实现存储资源的灵活共享和扩展。
Eloudy10 天前
gpu·rdma
全文笔记 - GPU-Initiated Networking for NCCL现代 AI 工作负载——尤其是混合专家(Mixture-of-Experts,MoE)架构——日益需要低延迟、细粒度且由设备端控制的 GPU 到 GPU 通信。传统 GPU 通信遵循主机发起(host-initiated)模型,由 CPU 编排所有通信操作——这是 CUDA 运行时模型的固有特征。尽管该模型对集合通信操作而言足够稳健,但对于需要计算与通信紧密集成的应用,采用设备发起(device-initiated)的通信以消除 CPU 协调开销将带来显著收益。
liuyunshengsir11 天前
网络·rdma
perftest 工具集ib_write_bw中的 RDMA Write 带宽测试工具手册ib_write_bw 是 perftest 工具集中的 RDMA Write 带宽测试工具,主要用于测试:
Eloudy11 天前
gpu·fpga·rdma
Holoscan Sensor Bridge 入门指南(Getting Started)Holoscan Sensor Bridge 提供了一个基于 FPGA 的接口,用于利用 GPU 进行低延迟的传感器数据处理。外设数据由 Holoscan Sensor Bridge 设备的 FPGA 采集,并通过以太网以 UDP 方式发送至主机系统。在 IGX Devkit 或 DGX Spark 等系统中,ConnectX SmartNIC 接口可以将 UDP 数据直接写入 GPU 显存,从而大幅降低延迟。Holoscan Sensor Bridge 的主机端软件支持将接收到的传感器数据集成到 Hol
tiantianuser13 天前
rdma·高速传输·cmac·roce v2·nvme of
NVME-oF IP 设计10:设计目标是什么?NVMe-oF协议的设计目标是使远程NVMe设备能够以接近本地NVMe的性能被访问。在传统网络存储系统中,例如iSCSI或NFS,数据传输需要经过复杂的网络协议栈处理,并且存在较多的数据复制和上下文切换操作,从而导致较高的访问延迟。相比之下,NVMe-oF通过保持NVMe命令结构不变,并在高速网络上传输NVMe命令,使远程访问能够保持较低的协议开销。 NVMe-oF的第一个设计目标是降低远程访问延迟。NVMe协议本身具有较低的命令处理开销,而NVMe-oF通过轻量级协议封装和高性能网络传输机制,使远程NV
tiantianuser13 天前
网络协议·rdma·高速传输·roce v2·nvme of
NVME-oF IP 设计11 : 控制面与数据面干什么用?NVMe-oF协议在结构上可以分为控制面(Control Plane)和数据面(Data Plane)两个部分。控制面主要负责连接建立、队列创建以及设备管理等操作,而数据面则负责实际的数据读写传输。 控制面主要通过管理命令实现。例如,在NVMe-oF建立连接时,Initiator需要首先发送Discover命令获取可用Target信息,然后通过Connect命令建立NVMe-oF会话,如图1所示。在连接建立过程中,双方需要协商队列数量、队列深度以及其他协议参数。在这之后可能会进入认证阶段。完成这些操作后,
Eloudy13 天前
rdma
ubuntu 22.04安装 Mellanox 的 MFT 工具包Mellanox/NVIDIA 网卡 MFT(Mellanox Firmware Tools) 在 Ubuntu 上的完整安装指南。
mounter62514 天前
linux·ebpf·linux kernel·kernel·rdma·xdp
高性能网络技术演进与创新探索:RDMA、eBPF/XDP 深度解析及 LSF/MM/BPF 2023 专题演讲RDMA (Remote Direct Memory Access,远程直接内存访问) 是一种专为突破传统 TCP/IP 网络协议栈性能瓶颈而设计的高性能网络通信技术。
tiantianuser16 天前
网络协议·rdma·高速传输·nvme-of
NVME-oF IP 设计8 :设计扫盲6RoCEv2 协议封装与数据流 RoCE(RDMA over Converged Ethernet)是RDMA在以太网上的实现方式。RoCE协议通过在以太网帧中封装RDMA数据,使RDMA能够运行在标准以太网环境中。RoCE最初版本(RoCEv1)仅支持二层网络,而RoCEv2采用UDP/IP封装方式,使RDMA数据能够在三层网络中进行路由,从而适用于大规模数据中心环境。 在RoCEv2协议中,RDMA数据包的基本封装结构包括以太网头部、IP头部、UDP头部以及Infiniband传输头(IB Trans
tiantianuser22 天前
网络协议·rdma·roce v2·nvme of
NVME-oF IP 设计7 :设计扫盲5# QP、WR、CQ、MR 等核心概念RDMA 通信模型中涉及多个核心组件,其中包括队列对(QP)、工作请求(WR)、完成队列(CQ)以及内存区域(Memory Region,MR)等概念,这些组件共同构成了RDMA数据传输机制的基础。
mounter62523 天前
linux·网络·人工智能·linux kernel·kernel·rdma·rocev2
探索未来 AI 算力网络的基石:从传统 RoCE 走向 SRv6 驱动的弹性弹性网络(解析 Netdev 0x1A 创新实践)随着大语言模型和万亿参数 AI 训练的爆发,传统的网络架构正面临前所未有的挑战。在 Netdev 0x1A 会议上,来自 OpenAI、微软、AMD 和博通等技术巨头展示了一项跨越行业合作的突破性成果:如何利用极简的 SRv6(Segment Routing IPv6)与创新的多平面 RoCE 数据包喷洒(Packet Spraying)技术,构建一个具备极高弹性的超大规模 AI 超级计算机网络。
tiantianuser24 天前
rdma·高速传输·cmac·roce v2·nvme of
NVME-oF IP 设计5 :设计扫盲3# RDMA 与 RoCEv2 技术远程直接内存访问(Remote Direct Memory Access,RDMA)是一种高性能网络通信技术,其核心思想是在网络通信过程中绕过操作系统内核,使数据能够直接在应用程序内存之间进行传输,从而显著降低CPU参与度和系统调用开销。传统的TCP/IP网络通信需要经过内核协议栈处理、缓冲区复制以及中断机制等多个阶段,这些操作在高并发和高带宽场景下会产生较大的延迟和CPU开销。相比之下,RDMA技术通过硬件网络接口卡(RNIC)直接完成数据搬运,使远程节点能够直接访问
tiantianuser1 个月前
网络·网络协议·rdma·roce v2·nvme of
NVME-oF IP 设计1 :为什么要设计它?近年来,以NAND Flash为核心的固态硬盘(Solid State Drive,SSD)凭借其高带宽、低延迟和高可靠性的特点,逐渐成为主流存储设备。其中,NVMe(Non-Volatile Memory Express)协议针对闪存存储特性进行了优化设计[3],通过多队列并行访问机制和高效的命令处理方式,大幅提升了存储系统的I/O性能,使SSD的性能能够充分发挥。随着数据中心规模的不断扩大,单节点本地存储已经难以满足大规模数据处理的需求,存储资源逐渐向网络化和集中化方向发展。 NVMe over Fa
tiantianuser1 个月前
网络·网络协议·rdma·roce v2·nvme of
NVME-oF IP 设计2 :设计之前的调研!随着NVMe协议逐渐成为高性能固态存储设备的主流接口标准,基于NVMe SSD的本地存储系统在带宽和延迟方面已能够满足现代数据中心与高性能计算应用的需求。在此基础上,研究重点逐渐从本地存储性能优化转向如何通过高速网络实现远程NVMe设备访问,从而构建高性能网络存储系统。NVMe-over-Fabrics(NVMe-oF)通过在高速网络上传输NVMe命令,使远程NVMe设备能够以接近本地NVMe的性能被访问,因此成为当前高性能网络存储的重要技术路线。
mounter6251 个月前
linux·kernel·rdma·hashtable·hash table·address handle
深入解析 RDMA 中的 Address Handler (AH) 缓存:AWS EFA 驱动的硬件演进与软件复用艺术在高性能计算(HPC)和大规模 AI 分布式训练(如多机多卡训练)的底层网络中,RDMA(远程直接内存访问)技术扮演着至关重要的角色。而在 RDMA 的不可靠数据报(UD)或类似的数据报通信模式中,Address Handler(地址句柄,简称 AH) 是一个绕不开的核心概念。
caodongwang2 个月前
gpu·rdma·gdr
GPU Direct RDMA调研GPUDirect RDMA是GPU direct技术体系的一部分,用于跨机或者跨机柜级别的GPU互联通信的加速。GPUDirect RDMA主要是利用PCIe p2p的技术将GPU的内存暴露给RDMA网络设备进行data transfer,将传统通过系统内存的RDMA操作bypass掉,避免GPU mem和host mem之间的mem copy。