rdma

gwf2168 小时前
rdma·dpu·cpo·ibgda·ai集群网络·硅光子·光互联
AI RDMA网络的光互联:CPO与硅光子技术前瞻——基于芯片设计验证与系统级协同的深度剖析摘要:本文深度剖析AI RDMA网络向CPO与硅光子演进的技术路径。从芯片设计验证视角,拆解光电融合架构下的RNIC/DPU硬件实现、RTL数据通路、IBGDA直通机制及拥塞控制状态机,为超节点集群网络提供系统级协同与底层优化指南。
gwf2161 天前
rdma·nccl·硬件加速·rocev2·dcqcn·gpudirect·ai集群网络
RDMA在联邦学习与跨DC训练中的应用:从协议栈到芯片微架构的深度解析摘要:本文从芯片微架构到跨DC联邦学习,深度剖析RDMA在AI集群中的硬件实现。涵盖RNIC RTL数据流、GPUDirect零拷贝通路、NCCL集合通信硬件加速及DCQCN拥塞控制状态机。提供寄存器级配置、ns级时序量化与故障排查指南,为资深网络芯片工程师提供AI Infra底层优化参考。
gwf2163 天前
rdma·拥塞控制·dpu·ai集群·gpudirect·rail-optimized·自适应路由
AI RDMA流量工程:自适应路由与动态负载均衡 —— 架构篇:从芯片RTL到集群拓扑的算网协同设计📑 目录摘要:本文从芯片RTL与协议栈底层视角,深度剖析AI集群RDMA流量工程。涵盖Rail-Optimized拓扑、自适应路由硬件实现、RNIC流水线时序及拥塞控制状态机,为资深工程师提供算网协同的芯片级实战指南。
gwf2165 天前
linux内核·ssd·nvme·性能调优·rdma·存储协议·nvme/rdma
NVMe/RDMA传输层协议深度解析:RDMA原理、Queue Pair映射、内核实现与性能全栈剖析摘要:深度解析NVMe/RDMA传输层协议,涵盖RDMA语义、NVMe-oF绑定规范、QP队列映射、Capsule封装、FRMR快速注册、内核驱动架构、SPDK零拷贝路径、100GbE RoCEv2性能实测,以及与TCP/FC量化对比与生产调优实践。
gwf2166 天前
芯片设计·rdma·rnic·gpudirect·pciegen6·dma引擎·mrc协议
800G RNIC芯片设计挑战:PCIe Gen6与DMA引擎架构 —— 面向AI超大规模集群的硬件实现深度解析📑 目录摘要:本文深度剖析800G RNIC芯片架构,从RTL数据流、PCIe Gen6 DMA引擎到MRC协议硬件卸载,量化解析AI集群中的纳秒级延迟与拥塞控制,为RDMA芯片工程师提供设计验证级参考。
gwf2168 天前
芯片设计·rdma·nccl·ai集群·gpudirect·多租户隔离·sr-iov
AI多租户集群的RDMA隔离:PD/MR/ACL硬件实现 —— 面向大模型训练/推理的硅级安全架构一、前言/AI场景背景 二、核心原理与协议深度 三、硬件架构深度剖析 四、AI通信的硬件加速实现 五、实战部署与深度配置 六、性能深度分析与基准测试 七、典型故障深度排查 八、总结与设计trade-off 参考资料
gwf2168 天前
rdma·nvlink·nccl·dpu·rocev2·aiinfra·gpudirect
NVLink与RDMA融合:Scale-Up/Scale-Out统一互联架构深度解析摘要:本文深度解构NVLink与RDMA在AI集群中的融合架构。从芯片RTL级剖析Scale-Up/Out统一互联的数据通路、寄存器定义与流水线时序,探讨MoE/LLM场景下的集合通信硬件加速、拥塞控制状态机及GPUDirect零拷贝路径,为资深网络芯片工程师提供设计验证与部署调优的硬核指南。
gwf21611 天前
ai训练·rdma·nccl·rocev2·pfc·dcqcn·gpudrirect
PFC风暴与RDMA死锁:AI训练典型故障深度分析——从芯片RTL到集群架构的全栈解构摘要:本文从芯片RTL与集群架构视角,深度解构AI训练中PFC风暴与RDMA死锁的根因。涵盖RoCEv2协议状态机、RNIC寄存器定义、拥塞控制硬件流水线及GPUDirect数据通路,提供从故障排查到NCCL调优的全栈实战指南。
gwf21612 天前
rdma·infiniband·nccl·ai集群·rnic·gpudirect·railoptimized
Rail-Optimized拓扑:AI训练集群的RDMA拥塞消除与硬件实现深度解析摘要:本文从芯片RTL与协议栈底层视角,深度剖析Rail-Optimized拓扑在AI集群中消除RDMA拥塞的机制。涵盖RNIC硬件架构、流水线时序、NCCL硬件加速及实战调优。
gwf21614 天前
rdma·mrc·ai网络·gpudirect·thorultra·eroce·broadcom
Broadcom Thor Ultra Ethernet NIC:AI专用网络芯片架构深度解析摘要:本文深度剖析Broadcom Thor Ultra 800G NIC的芯片架构与eRoCE/MRC硬件实现。从RTL数据流、寄存器配置到GPUDirect RDMA与拥塞控制状态机,全面拆解其在超大规模AI集群中的低延迟、多路径与乱序重组机制,为RDMA芯片工程师提供设计验证级的参考。
gwf21615 天前
rdma·硬件加速·dpu·kvcache·ai集群·gpudirect·bluefield4
NVIDIA BlueField-3/4 DPU在AI集群的RDMA卸载与增强:芯片设计验证级深度剖析摘要:本文深度剖析NVIDIA BlueField-3/4 DPU在AI集群中的RDMA卸载与硬件加速机制。从RTL级数据通路、寄存器定义到KV Cache卸载与NCCL集合通信的硬件映射,全面拆解DPU如何突破内存墙与通信墙,为资深芯片与网络架构工程师提供芯片设计验证级的实战指南。
tiantianuser16 天前
网络·nvme·rdma·高速传输·nvme-of
NVME-oF IP 设计18 :如何进行多模块并行协同设计2续上一篇,在RDMA连接建立完成后,Initiator可发起NVMe-oF命令请求。本文系统采用基于RDMA Send + RDMA Read的命令执行机制,其具体流程如图3所示。 图3 NVMe-oF建链流程
SLD_Allen16 天前
ceph·rdma·gpudirect
Ceph配置RDMA和GPUDirect支持的具体技术方案RDMA 在 Ceph 中的核心价值是让数据绕开 CPU 和内核协议栈,直接从网卡 DMA 到内存。但要真正跑起来,需要从硬件、驱动、系统到 Ceph 配置层层打通。
gwf21621 天前
ai训练·rdma·网络架构·拥塞控制·dcqcn·gpudirect·hpcc
AI训练RDMA拥塞控制:DCQCN/TIMELY/HPCC/Swift —— 芯片级深度剖析与硬件实现📑 目录 一、前言/AI场景背景 二、核心原理与硬件架构 三、硬件实现深度剖析 四、AI通信的RTL与寄存器级实现 五、实战部署与配置 六、性能分析与尾延迟评测 七、常见问题排查 八、总结与最佳实践 参考资料
gwf21625 天前
rdma·nccl·scaleout·rocev2·ai集群·rnic·gpudirect
AI集群RDMA网络架构总览:从Scale-Out到多平面摘要:本文深度剖析AI集群RDMA网络架构,从Scale-Out拓扑演进至多平面组网。结合芯片级硬件实现,探讨RNIC寄存器、RTL数据流及GPUDirect RDMA通路,为万卡集群的高吞吐、低尾延迟网络建设提供实战指南。
gwf2161 个月前
网络·rdma·dpu·高性能网络·800g·智能网卡·rtl验证
RDMA迈向400G/800G:超宽带网络的技术挑战与突破 —— 从芯片架构到RTL实现的深度解析📑 目录摘要:本文从芯片设计验证视角,深度剖析RDMA迈向400G/800G超宽带网络的技术挑战与突破。探讨PAM4调制、512-bit MAC并行通路、SerDes信号完整性与散热设计,详解RTL数据流、寄存器映射、PCIe Gen5 x16带宽瓶颈与WQE/CQE时序优化,并提供超宽带AI网络底座的实战部署与调优指南。
mounter6251 个月前
linux·linux kernel·kernel·rdma·net namespace
将 RDMA 引入容器:Soft-RoCE (RXE) 网络命名空间支持深度解析摘要在云原生与容器化技术普及的背景下,Linux 网络命名空间(Network Namespace, netns)构成了 Docker、Kubernetes 等容器隔离的核心基础。然而,Linux 内核中的 Soft-RoCE (RXE)(基于软件实现的 RoCEv2 协议栈驱动)在以往版本中存在严重的“命名空间盲(Namespace-Blind)”缺陷,导致其无法直接运行于隔离的容器环境中。
tiantianuser1 个月前
网络协议·rdma·高速传输·cmac·roce v2
NVME-oF IP 设计15 : 适于高速网络存储系统的IP设计1目前,短时高速传输需求呈爆发式发展,这类数据具有瞬时带宽高、数据量集中、写入时延敏感等典型特征。相关技术要求如下: 1)在数据写入性能方面,数据吞吐可达到数十Gbps量级,若存储系统无法提供足够的持续写入带宽,将直接导致缓存溢出或数据丢失。因此,存储系统必须具备高吞吐、低抖动、可持续写入能力,能够在短时间内吸收大量突发数据流。目前大部分设备在连续读写下传输带宽需要满足大于40 Gbps要求。 2)在容量与扩展性方面,由于数据体量巨大,单次任务可能产生数百GB至数TB级数据。系统需支持多块固态存储设备协同工
tiantianuser1 个月前
网络协议·rdma·高速传输·roce v2·nvme of
NVME-oF IP 设计16 : 适于高速网络存储系统的IP设计2IP使用离不开应用需求,本博客以某项目为例,介绍本IP应用。续上文: 表1 网络传输系统的具体性能指标 为满足以上需求,该系用采用一种基于 NVMe over Fabrics(NVMe-oF)的网络化高性能存储系统。系统整体架构如图1所示,按照功能划分可分为网络接口层、网络协议层、存储层及内存管理层四个部分。其中,核心功能由RDMA IP模块、NVMe-oF模块以及NVMe Host Controller(NVMe HC)模块协同完成。
mounter6251 个月前
网络·网络协议·tcp/ip·rdma·devmem
绕过主机:通过 Devmem TCP 运行 RDMA 应用标准的 Linux 网络协议栈使用由 sk_buff 结构包裹的包缓冲区,这些结构指向系统的主机内存页。多年来,这种以主机为中心的抽象已经足够使用。然而,大规模分布式计算和机器学习的兴起,使主机 CPU 内存复制成为了严重的架构瓶颈。