技术栈
rdma
gwf216
1 天前
ai训练
·
rdma
·
网络架构
·
拥塞控制
·
dcqcn
·
gpudirect
·
hpcc
AI训练RDMA拥塞控制:DCQCN/TIMELY/HPCC/Swift —— 芯片级深度剖析与硬件实现
📑 目录 一、前言/AI场景背景 二、核心原理与硬件架构 三、硬件实现深度剖析 四、AI通信的RTL与寄存器级实现 五、实战部署与配置 六、性能分析与尾延迟评测 七、常见问题排查 八、总结与最佳实践 参考资料
gwf216
5 天前
rdma
·
nccl
·
scaleout
·
rocev2
·
ai集群
·
rnic
·
gpudirect
AI集群RDMA网络架构总览:从Scale-Out到多平面
摘要:本文深度剖析AI集群RDMA网络架构,从Scale-Out拓扑演进至多平面组网。结合芯片级硬件实现,探讨RNIC寄存器、RTL数据流及GPUDirect RDMA通路,为万卡集群的高吞吐、低尾延迟网络建设提供实战指南。
gwf216
6 天前
网络
·
rdma
·
dpu
·
高性能网络
·
800g
·
智能网卡
·
rtl验证
RDMA迈向400G/800G:超宽带网络的技术挑战与突破 —— 从芯片架构到RTL实现的深度解析
📑 目录摘要:本文从芯片设计验证视角,深度剖析RDMA迈向400G/800G超宽带网络的技术挑战与突破。探讨PAM4调制、512-bit MAC并行通路、SerDes信号完整性与散热设计,详解RTL数据流、寄存器映射、PCIe Gen5 x16带宽瓶颈与WQE/CQE时序优化,并提供超宽带AI网络底座的实战部署与调优指南。
mounter625
7 天前
linux
·
linux kernel
·
kernel
·
rdma
·
net namespace
将 RDMA 引入容器:Soft-RoCE (RXE) 网络命名空间支持深度解析
摘要在云原生与容器化技术普及的背景下,Linux 网络命名空间(Network Namespace, netns)构成了 Docker、Kubernetes 等容器隔离的核心基础。然而,Linux 内核中的 Soft-RoCE (RXE)(基于软件实现的 RoCEv2 协议栈驱动)在以往版本中存在严重的“命名空间盲(Namespace-Blind)”缺陷,导致其无法直接运行于隔离的容器环境中。
tiantianuser
12 天前
网络协议
·
rdma
·
高速传输
·
cmac
·
roce v2
NVME-oF IP 设计15 : 适于高速网络存储系统的IP设计1
目前,短时高速传输需求呈爆发式发展,这类数据具有瞬时带宽高、数据量集中、写入时延敏感等典型特征。相关技术要求如下: 1)在数据写入性能方面,数据吞吐可达到数十Gbps量级,若存储系统无法提供足够的持续写入带宽,将直接导致缓存溢出或数据丢失。因此,存储系统必须具备高吞吐、低抖动、可持续写入能力,能够在短时间内吸收大量突发数据流。目前大部分设备在连续读写下传输带宽需要满足大于40 Gbps要求。 2)在容量与扩展性方面,由于数据体量巨大,单次任务可能产生数百GB至数TB级数据。系统需支持多块固态存储设备协同工
tiantianuser
12 天前
网络协议
·
rdma
·
高速传输
·
roce v2
·
nvme of
NVME-oF IP 设计16 : 适于高速网络存储系统的IP设计2
IP使用离不开应用需求,本博客以某项目为例,介绍本IP应用。续上文: 表1 网络传输系统的具体性能指标 为满足以上需求,该系用采用一种基于 NVMe over Fabrics(NVMe-oF)的网络化高性能存储系统。系统整体架构如图1所示,按照功能划分可分为网络接口层、网络协议层、存储层及内存管理层四个部分。其中,核心功能由RDMA IP模块、NVMe-oF模块以及NVMe Host Controller(NVMe HC)模块协同完成。
mounter625
21 天前
网络
·
网络协议
·
tcp/ip
·
rdma
·
devmem
绕过主机:通过 Devmem TCP 运行 RDMA 应用
标准的 Linux 网络协议栈使用由 sk_buff 结构包裹的包缓冲区,这些结构指向系统的主机内存页。多年来,这种以主机为中心的抽象已经足够使用。然而,大规模分布式计算和机器学习的兴起,使主机 CPU 内存复制成为了严重的架构瓶颈。
Eloudy
21 天前
gpu
·
rdma
·
roce
ubuntu 22.04 -cuda12.8.2- holoscan-sdk-4.5-doca-ofed
先安装 build-essential 再安装 gcc-12,因为 cuda12.8.2需要gcc-12 才能安装成功。
Eloudy
1 个月前
docker
·
gpu
·
rdma
国内加速 docker pull 下载 docker images,特别是 nvidia 的cuda image
添加如下文件内容 $ cat /etc/docker/daemon.json重启生效:一次性快捷方式:
tiantianuser
1 个月前
rdma
·
高速传输
·
roce v2
·
nvme of
NVME-oF IP 设计12 : Capsule是胶囊?
Capsule字面意思是胶囊,它在是 NVMe-oF扮演什么角色呢?实际上它从协议层与传输层解耦,就是NVMe oF标准消息容器,并且它是 NVMe-oF 跨网络通信的最小逻辑单元,其用于在网络上传输NVMe命令。它的架构定位如图1所示: 图1 Capsule 的架构定位
tiantianuser
1 个月前
网络存储
·
rdma
·
高速存储
·
高速传输
·
nvme of
NVME-oF IP 设计14 : 简介NVMe oF IP特点
本NVMe-oF IP(Non-Volatile Memory Express over Fabrics)是一种将NVMe协议性能延伸至网络的技术,实现存储资源的灵活共享和扩展。
Eloudy
1 个月前
gpu
·
rdma
全文笔记 - GPU-Initiated Networking for NCCL
现代 AI 工作负载——尤其是混合专家(Mixture-of-Experts,MoE)架构——日益需要低延迟、细粒度且由设备端控制的 GPU 到 GPU 通信。传统 GPU 通信遵循主机发起(host-initiated)模型,由 CPU 编排所有通信操作——这是 CUDA 运行时模型的固有特征。尽管该模型对集合通信操作而言足够稳健,但对于需要计算与通信紧密集成的应用,采用设备发起(device-initiated)的通信以消除 CPU 协调开销将带来显著收益。
liuyunshengsir
1 个月前
网络
·
rdma
perftest 工具集ib_write_bw中的 RDMA Write 带宽测试工具手册
ib_write_bw 是 perftest 工具集中的 RDMA Write 带宽测试工具,主要用于测试:
Eloudy
1 个月前
gpu
·
fpga
·
rdma
Holoscan Sensor Bridge 入门指南(Getting Started)
Holoscan Sensor Bridge 提供了一个基于 FPGA 的接口,用于利用 GPU 进行低延迟的传感器数据处理。外设数据由 Holoscan Sensor Bridge 设备的 FPGA 采集,并通过以太网以 UDP 方式发送至主机系统。在 IGX Devkit 或 DGX Spark 等系统中,ConnectX SmartNIC 接口可以将 UDP 数据直接写入 GPU 显存,从而大幅降低延迟。Holoscan Sensor Bridge 的主机端软件支持将接收到的传感器数据集成到 Hol
tiantianuser
1 个月前
rdma
·
高速传输
·
cmac
·
roce v2
·
nvme of
NVME-oF IP 设计10:设计目标是什么?
NVMe-oF协议的设计目标是使远程NVMe设备能够以接近本地NVMe的性能被访问。在传统网络存储系统中,例如iSCSI或NFS,数据传输需要经过复杂的网络协议栈处理,并且存在较多的数据复制和上下文切换操作,从而导致较高的访问延迟。相比之下,NVMe-oF通过保持NVMe命令结构不变,并在高速网络上传输NVMe命令,使远程访问能够保持较低的协议开销。 NVMe-oF的第一个设计目标是降低远程访问延迟。NVMe协议本身具有较低的命令处理开销,而NVMe-oF通过轻量级协议封装和高性能网络传输机制,使远程NV
tiantianuser
1 个月前
网络协议
·
rdma
·
高速传输
·
roce v2
·
nvme of
NVME-oF IP 设计11 : 控制面与数据面干什么用?
NVMe-oF协议在结构上可以分为控制面(Control Plane)和数据面(Data Plane)两个部分。控制面主要负责连接建立、队列创建以及设备管理等操作,而数据面则负责实际的数据读写传输。 控制面主要通过管理命令实现。例如,在NVMe-oF建立连接时,Initiator需要首先发送Discover命令获取可用Target信息,然后通过Connect命令建立NVMe-oF会话,如图1所示。在连接建立过程中,双方需要协商队列数量、队列深度以及其他协议参数。在这之后可能会进入认证阶段。完成这些操作后,
Eloudy
1 个月前
rdma
ubuntu 22.04安装 Mellanox 的 MFT 工具包
Mellanox/NVIDIA 网卡 MFT(Mellanox Firmware Tools) 在 Ubuntu 上的完整安装指南。
mounter625
1 个月前
linux
·
ebpf
·
linux kernel
·
kernel
·
rdma
·
xdp
高性能网络技术演进与创新探索:RDMA、eBPF/XDP 深度解析及 LSF/MM/BPF 2023 专题演讲
RDMA (Remote Direct Memory Access,远程直接内存访问) 是一种专为突破传统 TCP/IP 网络协议栈性能瓶颈而设计的高性能网络通信技术。
tiantianuser
1 个月前
网络协议
·
rdma
·
高速传输
·
nvme-of
NVME-oF IP 设计8 :设计扫盲6
RoCEv2 协议封装与数据流 RoCE(RDMA over Converged Ethernet)是RDMA在以太网上的实现方式。RoCE协议通过在以太网帧中封装RDMA数据,使RDMA能够运行在标准以太网环境中。RoCE最初版本(RoCEv1)仅支持二层网络,而RoCEv2采用UDP/IP封装方式,使RDMA数据能够在三层网络中进行路由,从而适用于大规模数据中心环境。 在RoCEv2协议中,RDMA数据包的基本封装结构包括以太网头部、IP头部、UDP头部以及Infiniband传输头(IB Trans
tiantianuser
1 个月前
网络协议
·
rdma
·
roce v2
·
nvme of
NVME-oF IP 设计7 :设计扫盲5
# QP、WR、CQ、MR 等核心概念RDMA 通信模型中涉及多个核心组件,其中包括队列对(QP)、工作请求(WR)、完成队列(CQ)以及内存区域(Memory Region,MR)等概念,这些组件共同构成了RDMA数据传输机制的基础。