RDMA最新进展

到 2026 年,RDMA 的主线已经从"能不能在以太网上跑"变成"大规模 AI/HPC 集合通信下,怎么摆脱 PFC、ECMP、Go-Back-N 的老问题"。可以分成 4 条进展线来看。

一、RoCEv2:仍是生产主力,但重点在"调优 + 增强"

RoCEv2 是当前大部分云厂和 AI 集群的实际部署标准,但痛点很清楚:

  • 单流走一条 ECMP 路径 → 大流碰撞、incast、尾延迟炸裂
  • 依赖 PFC + ECN + DCQCN 做无损和拥塞控制,PFC 容易引发 head-of-line blocking / PFC storm
  • 丢包恢复偏老:常按窗口重传,不如选择性重传友好

最新做法是:

  • 用 HPCC / DCQCN 增强 / 交换机 Telemetry 做更细的拥塞反馈
  • 交换机侧加 dynamic load balancing、VOQ、deep buffer、adaptive routing
  • NVIDIA Spectrum-X 这类方案把"网卡+交换机+CCL"打包,把普通 RoCE 做成"类 IB 体验"
  • Meta / Microsoft 级集群已经把 RoCEv2 跑到 400G/800G 生产级,但调参成本很高

结论:RoCEv2 没被淘汰,反而在被"工程增强"续命。


二、Ultra Ethernet / UET:以太网阵营的"下一代 RDMA 传输"

UEC 在 2025-06 发 1.0,2026-07 到 1.0.3,核心不是换物理层,而是重写传输层:

  • Packet spraying:一条消息按包喷到多条路径,不再被 ECMP 绑死
  • Out-of-order delivery + NIC 重排:允许网络乱序,端点重组
  • Selective retransmission:只重传丢包,不回退整个窗口
  • 不强制 PFC:用 credit-based、link-level retry、ECN/拥塞信号做主控制
  • 发送端 + 接收端双向拥塞控制(NSCC + RCCC)
  • Packet trimming:拥塞时交换机截掉载荷留头,比"丢包等超时"快得多
  • 面向 百万级主机 / 十万级 GPU 作业,libfabric 2.0 风格接口
  • 后续在做:PCM 可编程拥塞管理、CSIG 拥塞信令、小包头压缩、In-Network Collectives(AllReduce 下沉到交换机)

意义:UET 想用"开放多厂商以太网"复刻 InfiniBand 的 AI 网络能力。


三、MRC(Multipath Reliable Connection):RoCEv2 的务实补丁

OCP 上 OpenAI / Microsoft / AMD / Intel / Broadcom 推的 MRC:

  • 不推翻 RoCEv2,只保留 AI 训练真正用的 RDMA Write / Write-with-imm
  • 借鉴 UET:packet spray、selective ack、packet trimming、多路径
  • 可配合 SRv6 源路由
  • 目标:比 UET 更快落地,因为复用现有 RDMA Verbs / NIC 生态

MRC = "先把 RoCEv2 修到能跑十万卡",UET = "从头做以太版 IB"。


四、InfiniBand:仍在高端训练守盘,速率继续冲

  • XDR 800G:Quantum-X800 + ConnectX-8 已部署
  • GDR 1.6T 在路上
  • 原生 credit-based 无损、自适应路由、SHARP 在网聚合、超低延迟
  • 缺点还是贵、NVIDIA 锁定、运维人才少

同时 NVIDIA 自己也不只押 IB:

  • ConnectX-8 同时支持 RoCEv2 / MRC
  • Spectrum-X 把以太网 RDMA 做成"带 NVIDIA 优化的 AI fabric"

五、相邻层也在动:Scale-up / 安全 / 光互连

  • UALink 1.0(2025):机柜内加速器互连,对标 NVLink/NVSwitch,和 UEC scale-out 互补
  • In-Network Collectives:以太网补 SHARP 能力
  • RDMA 安全:rkey/QPN 枚举、未授权内存访问、缺乏原生 ACL 是现实风险,JANUS/ReDMArk 类研究在推动 transport-level 安全
  • 800G → 1.6T:Tomahawk 5/6、CPO 硅光、Quantum-X 800G CPO 都在把"网卡+交换+光"一起卷

六、一句话判断(2026 视角)

  • 现在买/部署:RoCEv2 + 精心调 DCQCN/PFC/ECN ,或 InfiniBand(前沿训练)
  • 1--2 年观察:MRC RoCE 增强会在超大以太网集群先落地
  • 3 年主线:UEC/UET 是以太网 RDMA 的下一个标准战场
  • 技术趋势不是"RDMA 没了",而是
    RDMA 从"内核旁路零拷贝"进化成"AI fabric 的传输底座"
相关推荐
我命由我123452 小时前
金融租赁极简理解
经验分享·学习·职场和发展·金融·求职招聘·职场发展·学习方法
辣知2 小时前
辣知·化智75 道德经带给现代人的智慧
学习
小黄人软件2 小时前
aipy 智能体学习2:源码运行执行轨径主干
学习
JWASX2 小时前
Java 转 go 学习 - dubbo-go(1)
学习·golang
磁场转动100万匹3 小时前
Hive 学习第三天:HQL 查询精讲与内置函数实战
hive·hadoop·学习
JWASX3 小时前
go 学习 - prometheus 指标学习
学习·golang·prometheus
小弥儿3 小时前
GitHub今日热榜 | 2026-10-08:逆向工程 MCP 登顶
学习·开源·github
代码山河3 小时前
JDK、JRE、JVM的区别:一文讲清楚Java运行环境
java·学习·架构·教程·面向对象·项目
fj800j3 小时前
首助记账本新增「标签管理」功能:跨分类归集项目账目,一个账本管完所有事
数据结构·经验分享·笔记·学习·分布式账本