rdma

gwf2166 小时前
驱动开发·linux内核·rdma·rdma_cm·异构计算·异步事件·cve分析
RDMA事件与异步通知机制:CMA事件与设备事件深度解析📑 目录 一、前言/背景 二、核心概念与设计原理 三、驱动架构与代码实现 四、数据通路与性能关键点 五、实战配置与调优 六、调试方法与工具 七、最佳实践与常见问题 八、总结与展望
cyf311 天前
性能优化·rdma·rocev2
RDMA 写操作带宽性能建模与参数敏感性分析提到 RDMA 性能测试,大多数人第一反应是:需要 100G 交换机、ConnectX-5 网卡、物理服务器集群,动辄几十万投入。但本文要展示的是:一台普通笔记本电脑、两个 Ubuntu 虚拟机、零硬件成本,同样能完成一套完整的 RDMA 参数调优实验,并且得出与硬件环境截然不同的反直觉结论。
gwf2162 天前
性能调优·rdma·qp状态机·linux内核驱动·ib_modify_qp·cm建链·irdma
QP状态机详解:Reset→Init→RTR→RTS与建链握手过程一、前言/背景 二、核心概念与设计原理 三、驱动架构与代码实现 四、数据通路与性能关键点 五、实战配置与调优 六、调试方法与工具 七、最佳实践与常见问题 八、总结与展望
cyf312 天前
udp·rdma·rocev2·bth·pertest
RDMA数据传输原理深入解读没有真实RDMA网卡也能学!本文手把手教你用两台VMware Ubuntu虚拟机搭建Soft-RoCE模拟RoCEv2环境,完整运行ib_send_bw带宽测试,并基于Wireshark抓包深入拆解RDMA报文交互全过程。从ARP广播、TCP控制面建连,到RC Send大消息拆包(First→Middle→Last)、ACK确认机制,再到AETH流控信用值、PSN序列号、QP状态机——一文讲透RDMA可靠连接(RC)的数据面与控制面交互原理。适合网络工程师、存储开发、AI基础设施从业者入门RDMA技术栈。
gwf2164 天前
驱动开发·性能调优·pcie·rdma·ai集群·中断聚合·cq
Completion Queue(CQ)与中断处理:轮询、中断聚合与错误码 —— 面向AI集群的驱动级深度剖析摘要:本文深度剖析RDMA Completion Queue(CQ)与中断处理机制。从IB协议CQE位域到Linux内核驱动实现,对比mlx5/irdma/bnxt_re架构差异。详解轮询与中断聚合策略、PCIe数据通路瓶颈及错误码状态机,提供万卡AI集群下的驱动级调优与排障指南。
gwf2165 天前
linux内核·rdma·网卡驱动·mlx5·gpudirect·ib_core·内核架构
内核RDMA子系统(ib_core)架构与核心数据结构:从驱动视角解构数据通路摘要:本文深度解析Linux内核RDMA子系统(ib_core)架构,聚焦ib_device/ib_pd/ib_cq等核心数据结构的生命周期与内存布局。结合mlx5/irdma/bnxt_re驱动实现,剖析数据通路Fast/Slow Path设计、多厂商差异化处理及GPUDirect RDMA内存注册瓶颈。提供从内核源码级调试到生产环境调优的实战指南,旨在为资深RDMA工程师提供内核态排障与性能优化的系统性参考。
gwf2168 天前
rdma·numa·io_uring·内核驱动·mlx5·verbs·hugepage
Verbs性能优化实战:Inline/Signaled/批处理/NUMA亲和全攻略一、前言/背景 二、核心概念与设计原理 三、驱动架构与代码实现 四、数据通路与性能关键点 五、实战配置与调优 六、调试方法与工具 七、最佳实践与常见问题 八、总结与展望
业余程序员plus8 天前
rdma·mellanox·wqe·mmio·doorbell·uar·blueflame
RDMA-HCA-Mellanox网卡UAR与门铃 (二)UAR(User Access Region)是 CPU 直接访问 HCA 的寄存器空间。发送方将 WQE 放进 Host Memory,再通过 Doorbell Record 发布工作,通过 UAR Doorbell 通知设备;BlueFlame 进一步通过 MMIO 将 WQE 内容直接写入设备。
业余程序员plus9 天前
pcie·rdma·hca·icm·mellanox·mlx5·command queue
RDMA-HCA-Mellanox网卡架构与初始化 (一)HCA 将连接状态、队列配置、地址转换和事件路由组织为硬件对象。设备通过命令接口建立这些对象,再根据内存中的描述符和 UAR 门铃执行工作。本篇从对象与内存关系出发,解释设备如何启动、取得运行所需的内存、执行管理命令,以及满足什么条件后可以关闭和回收资源。
Eloudy17 天前
gpu·fpga·rdma·roce·doca
开源 gpunetio examples 01 解析 gpunetio_verbs_put_bw针对 https://github.com/NVIDIA-DOCA/gpunetio/tree/main/examples/gpunetio_verbs_put_bw/ 把服务器端和客户端,两端的核心逻辑分别提炼如下。
Eloudy18 天前
gpu·fpga·rdma·roce·doca
GPUNetIO开源实现与FPGA的 RoCEv2 通信延迟实验对象:arXiv:2510.25213《Platform Architecture for Tight Coupling of High-Performance Computing with Quantum Processors》第 2.4 节 “Network proof of concept”。 本文先回答"这个实验在物理上和工程上证明了什么、为什么这样设计", 再把每条原理映射到本项目(nvqlink_echo_poc/)的具体实现。
gwf21619 天前
芯片设计·rdma·nccl·拥塞控制·ai集群·rnic·gpudirect
AI训练RDMA性能Profiling:瓶颈定位与调优方法论摘要:本文聚焦AI集群RDMA性能Profiling,从芯片RTL与寄存器级深度剖析RNIC数据流、拥塞控制与GPUDirect通路。结合NCCL硬件加速与多平面拓扑,提供万卡集群尾延迟瓶颈定位、硬件级调优及故障排查的实战方法论,为资深网络芯片与架构工程师提供硅片级的性能优化指南。
Eloudy19 天前
rdma·roce·doca
RDMA 乒乓示例:CX5 <-> CX6 DX(QSFP28 直连)两台服务器,一台插 ConnectX-5,一台插 ConnectX-6 DX,两块网卡用一根 QSFP28 线缆直连(不经过交换机)。两端通过 RDMA RC(RoCE v2) 互相收发数据:
Eloudy19 天前
gpu·rdma·roce·doca
cpu rdma 与 gpunetio 的关系gpunetio, 是类似cpu app doca sender,receiver 过程的 gpu化,现在探究两者的联系。
HHFQ20 天前
rdma
Linux RDMA命令行工具使用手册rdma 是 Linux 系统中用于管理 RDMA(Remote Direct Memory Access,远程直接内存访问) 子系统的命令行工具。RDMA 是一种高性能网络通信技术,允许应用程序直接在远程系统的内存中进行读写操作,绕过操作系统内核和 CPU,从而实现极低延迟、高吞吐量、低 CPU 占用的网络通信。
gwf21620 天前
rdma·dpu·cpo·ibgda·ai集群网络·硅光子·光互联
AI RDMA网络的光互联:CPO与硅光子技术前瞻——基于芯片设计验证与系统级协同的深度剖析摘要:本文深度剖析AI RDMA网络向CPO与硅光子演进的技术路径。从芯片设计验证视角,拆解光电融合架构下的RNIC/DPU硬件实现、RTL数据通路、IBGDA直通机制及拥塞控制状态机,为超节点集群网络提供系统级协同与底层优化指南。
gwf21622 天前
rdma·nccl·硬件加速·rocev2·dcqcn·gpudirect·ai集群网络
RDMA在联邦学习与跨DC训练中的应用:从协议栈到芯片微架构的深度解析摘要:本文从芯片微架构到跨DC联邦学习,深度剖析RDMA在AI集群中的硬件实现。涵盖RNIC RTL数据流、GPUDirect零拷贝通路、NCCL集合通信硬件加速及DCQCN拥塞控制状态机。提供寄存器级配置、ns级时序量化与故障排查指南,为资深网络芯片工程师提供AI Infra底层优化参考。
gwf21623 天前
rdma·拥塞控制·dpu·ai集群·gpudirect·rail-optimized·自适应路由
AI RDMA流量工程:自适应路由与动态负载均衡 —— 架构篇:从芯片RTL到集群拓扑的算网协同设计📑 目录摘要:本文从芯片RTL与协议栈底层视角,深度剖析AI集群RDMA流量工程。涵盖Rail-Optimized拓扑、自适应路由硬件实现、RNIC流水线时序及拥塞控制状态机,为资深工程师提供算网协同的芯片级实战指南。
gwf2161 个月前
linux内核·ssd·nvme·性能调优·rdma·存储协议·nvme/rdma
NVMe/RDMA传输层协议深度解析:RDMA原理、Queue Pair映射、内核实现与性能全栈剖析摘要:深度解析NVMe/RDMA传输层协议,涵盖RDMA语义、NVMe-oF绑定规范、QP队列映射、Capsule封装、FRMR快速注册、内核驱动架构、SPDK零拷贝路径、100GbE RoCEv2性能实测,以及与TCP/FC量化对比与生产调优实践。
gwf2161 个月前
芯片设计·rdma·rnic·gpudirect·pciegen6·dma引擎·mrc协议
800G RNIC芯片设计挑战:PCIe Gen6与DMA引擎架构 —— 面向AI超大规模集群的硬件实现深度解析📑 目录摘要:本文深度剖析800G RNIC芯片架构,从RTL数据流、PCIe Gen6 DMA引擎到MRC协议硬件卸载,量化解析AI集群中的纳秒级延迟与拥塞控制,为RDMA芯片工程师提供设计验证级参考。