AI时代数据中心互联:PCIe重定时器、重驱动器与交换机全解析

摘要:本文基于PCI SIG网络研讨会"Enhancing Data Center Architectures with PCIe Retimers, Redrivers and Switches"的演讲内容整理。来自Tera Signal、Broadcom和Marvell的三位专家,围绕AI时代数据中心架构演进,系统讲解了PCIe技术路线图、交换机发展历史与AI应用、重定时器的信号完整性与扩展能力,以及下一代重驱动器的低功耗低延迟优势。文章重点对比了三类器件的差异与选型逻辑,帮助读者理解PCIe 5.0至7.0时代高速互联方案的设计权衡。

关键词:PCIe、重定时器、重驱动器、交换机、数据中心、AI基础设施、信号完整性、链路训练、铜缆、光缆

在线视频-中英字幕

【PCIe在AI数据中心中的演进:交换机、重定时器与重驱动器的协同应用 -2025.12】 https://www.bilibili.com/video/BV1qBei6QEfv/?share_source=copy_web\&vd_source=9ae7e526ba716c2ec3ccef9258f14b79

目录

  1. PCIe技术路线图与AI时代架构演进
  2. PCIe交换机:历史演进与AI基础设施应用
  3. PCIe重定时器:信号完整性、距离扩展与诊断
  4. [重驱动器与重定时器对比:下一代IR Redriver](#重驱动器与重定时器对比:下一代IR Redriver)
  5. 三类器件选型总结
  6. 问答环节

1. PCIe技术路线图与AI时代架构演进

1.1 PCIe路线图现状

演讲者Majid Fudi(Tera Signal标准顾问)介绍了PCIe技术路线图。绿色代表I/O带宽每三年翻一番,紫色代表PCI SIG标准已最终确定。当前时间点处于2025年底:

  • PCIe 5.0技术正在成熟;
  • PCIe 6.0技术正在上量,大量复杂端点与测试设备不断演进;
  • PCIe 7.0规范刚刚完成,芯片vendor侧与测试设备侧开发正在爬坡;
  • PCIe 8.0前期工作已经启动。

PCIe协议始于1992年的初始PCI,PCIe本身已存在20多年,整个计算机行业使用这一技术已近二三十年。

1.2 PCIe三大核心优势

  1. 普遍且成熟的生态:标准存在20多年,是业界采用最广泛的协议,PCIe工具、IP、设备成熟度极高。
  2. 前后向兼容性:PCI SIG运行严格的合规测试,确保所有设备处于合规模式,保证与现有设备及新设备的互操作性。
  3. 高速与低延迟:在AI高需求推动下,PCIe加速采用;除高速低延迟外,带宽还可通过速率选择和分叉配置实现扩展。

1.3 AI基础设施架构演进

AI系统已从单机箱CPU/GPU,转向机架级和行级、以XPU为中心、以I/O芯片为核心的架构。PCIe覆盖内部连接与外部连接:

  • 内部:CPU、XPU、内存、网卡之间的连接;
  • 外部:机架到机架、解耦AI基础设施;
  • 增长引擎:AI scale-up与解耦,机架内与跨机架连接,以及数据中心级连接。

1.4 速率提升带来的两大改进方向

通道改进

  • PCIe速率从2.5 GT/s(PCIe 1.0)提升到128 GT/s(PCIe 7.0),提升50倍;
  • 需要改善插入损耗、回波损耗、高频串扰;
  • 采用更高等级PCB、新连接器设计、先进材料;
  • PCIe 6到7的reach extension中,每链路最大重定时器数量从2个增加到4个,重驱动器也被重新考虑;
  • PCIe规范现已覆盖内部和外部线缆;
  • 光学友好的CN已合并到PCIe 6和7规范中,支持光缆;直接驱动ECN工作正在进行,用于无重定时器的重驱动器距离扩展。

硅片改进

  • 迁移到PAM4,采用基于ADC的DSP架构;
  • 发送和接收均衡块在更高速率下使用更复杂的均衡;
  • 更高PLL带宽、抖动管理等;
  • 采用flip模式结合强CRC、低延迟FEC和重试机制,确保1E-6 first bit error rate和FIT目标,满足AI规模可靠性要求。

2. PCIe交换机:历史演进与AI基础设施应用

Rick Kutzpau(Broadcom产品规划师)将PCIe交换机内容分为历史演进和现代AI应用两部分。

2.1 PCIe交换机历史演进

早期(2.0时代)

  • 功能主要由服务器OEM驱动,节奏由CPU vendor驱动;
  • 器件非常基础:有限lane数、更有限端口数、有限或无分叉;
  • 典型为x16进x16出,其他功能非常有限。

HPC时代

  • 性能成为更大驱动力;
  • 功能仍由企业服务器OEM驱动,节奏仍由CPU vendor驱动;
  • lane数增加,分叉变得更重要(如x16分叉到x8);
  • 引入非透明桥接;
  • 引入更高效编码方案,从8b/10b转向128b/130b。

存储时代(NVMe出现)

  • 功能由服务器和存储OEM共同驱动,存储OEM扮演更大角色;
  • 节奏仍由CPU vendor驱动;
  • 需要更大fabric,支持16、24、32、48个驱动器;
  • 分叉变得绝对关键,可低至x2甚至x1;
  • 引入热插拔与稳健的surprise add/remove;
  • lane数继续上升。

AI时代(当前)

  • 功能主要由CSP驱动,节奏也由CSP驱动,这是生态互动方式的明确变化;
  • 从早期合规活动到量产,节奏极其快速;
  • lane数继续增加;
  • 多主机、peer-to-peer等功能成为普遍配置;
  • 物理层更复杂:引入PAM4和前向纠错。

2.2 PCIe交换机在现代AI基础设施中的应用

基础AI互连(scale-in)

  • 交换机提供CPU、GPU、scale-out网络设备甚至存储之间的连接;
  • 交换机是架构枢纽;
  • 使用peer-to-peer等复杂功能让GPU之间通信;
  • 更适合推理工作负载,以延迟为中心,计算密集度低于深度学习或大训练算法;
  • 但限制了GPU规模。

专用scale-up网络

  • 当GPU规模扩大4、8、16倍时,需要极低延迟的GPU间通信方式;
  • 在普通拓扑中,GPU需上行到交换机、跨网络到另一交换机、再下行到GPU;
  • 专用scale-up网络是必需的;
  • PCIe对于中等规模是高效、低延迟、相对低成本、生态成熟的方案;
  • 面向训练工作负载,计算能力是关键,连接GPU是核心。

Storage Next

  • 面向生成式神经网络、检索增强生成等超大模型;
  • 模型太大,无法放入DDR或HBM;
  • GPU需要信息时,必须经过CPU到存储再返回,导致GPU核心闲置;
  • 思路是利用GPU的海量线程数:CPU可能有数百到数千线程,GPU可能有数十万线程;
  • 每个线程可发起小block I/O;
  • 实验室中此类架构已实现超过200万IOPS;
  • 目前这类模型相对有限,但数量增长迅速,需要解决这一问题。

3. PCIe重定时器:信号完整性、距离扩展与诊断

Annie Leow(Marvell产品管理总监)讲解了PCIe重定时器。

3.1 重定时器解决的核心挑战

  1. 信号完整性:PCIe代际推进,速率翻倍,PAM4调制使PCB和线缆上的信号挑战大幅增加;重定时器接收噪声信号,重新调理并重新发送干净的数据和时钟。
  2. 距离扩展:与现代AI服务器、机架级/行级设计、解耦系统所需的长距离传输相结合。
  3. 遥测:获取误码率、监控接收端眼图、监控电压和温度并告警。
  4. 诊断:原生支持loopback、生成和检查pattern、检查LTSSM(不仅自身,还包括同一通道上的链路伙伴)、支持link margin。

3.2 铜缆距离扩展

PCB走线

  • 建模范围:PCIe 5.0到7.0,低损耗材料(接近Megtron 2)和超低损耗材料(接近Megtron 8);
  • 无重定时器:低损耗和超低损耗PCB从PCIe 5.0到7.0,走线长度已被压缩到20英寸以内,PCIe 7甚至短于10英寸;
  • 有单个重定时器:PCIe 7下,低损耗材料可扩展到接近20英寸,超低损耗材料可达到35英寸左右;
  • 重定时器在更高速率下不可避免,PCIe 7.0时代更加重要。

外部PCIe铜缆(AEC)

  • 重定时器集成到线缆连接器中;
  • 合作伙伴的PCIe AEC paddle card已集成PCI重定时器;
  • 线缆两端都有PCI重定时器时,距离大幅扩展;
  • PCIe 5.0和6.0:线缆长度约6到8米,取决于线缆损耗和集成优化;
  • PCIe 7.0(128 GT/s):线缆长度约3到4.5米。

3.3 光学PCIe应用

  • Marvell在OFC上展示了业界首个PCIe 6.0协议级光互连演示;
  • 设置:主板前端root complex经过重定时器(Terra hub),经过电气IC到光子IC,电信号转为光信号,通过10米光缆到背板,再经过光子到电气转换,到达端点;
  • 链路中仅使用一个重定时器;
  • 在OSFP-XC form factor中实现,完整16 lane PCIe支持,运行在64 GT/s;
  • 早期演示使用Black Jacket光缆(工程样品),合作伙伴现在有Yellow Jacket生产候选,同样10米;
  • PCIe可用于系统机箱外、机架内、跨机架,通过PCIe AEC和光互连应用。

3.4 重定时器实际用例

  • GPU基板:每个GPU一个重定时器,调理来自系统另一侧CPU的信号;
  • 主板:重定时器靠近CEM插槽,调理root complex或端点信号;
  • 系统模块化:重定时器靠近连接器,如背板连接器、CEM到MCIO线缆插槽;
  • 存储背板:主机侧信号不够强时,可放置重定时器;
  • Rack-scale与AI scale-up:PCIe线缆可带板载重定时器驱动无源铜缆,或集成到线缆连接器成为PCIe AEC或光PCIe。

3.5 诊断与遥测功能

  • 收集链路状态及root complex、端点、重定时器侧信息;
  • 理解通道中所有组件的LTSSM状态,判断是否达到最高速率或卡在某个状态;
  • 逐lane信息:上游侧和下游侧独立状态;
  • 接收端眼图信息:通过GUI绘制,PAM4 64 GT/s下可看到三个眼图。

4. 重驱动器与重定时器对比:下一代IR Redriver

Majid Fudi继续讲解重驱动器与重定时器的演进和对比。

4.1 历史演进

  • 25年以上PCI历史中,从2.5 GT/s到8 GT/s,重驱动器和调谐重驱动器足以管理信号完整性;
  • 从PCIe 4.0开始,行业明显转向重定时器;
  • PCIe 5.0和6.0(32和64 GT/s)由于通道预算紧、信号完整性裕度严格,仅使用重定时器;
  • PCIe 7.0及更高速率(128 GT/s),重定时器继续在距离扩展中发挥关键作用;
  • 特定AI/ML用例推动更先进重驱动器的发展,以补充重定时器,其中低功耗和延迟是首要考虑。

4.2 下一代重驱动器(IR Redriver)特点

  • 数据路径完全模拟,扩展经典CTL滤波器,增加模拟FFE用于post和precursor均衡;
  • 提升100G及PCIe 7.0以上链路的信号完整性;
  • 协议无关,不感知协议;
  • 经典重驱动器需要静态手动调谐;
  • IR重驱动器增加自动优化链路训练:通过片上子采样器,由片外MCU访问,12位高分辨率ADC;
  • 支持按需诊断,仅在需要时启用,保持低功耗和延迟;
  • 训练和诊断使用带外主机控制,采用OIF CMS、CMS LT等规范。

4.3 IR Redriver用例

PCB连接器

  • 芯片到芯片:系统或PCB长度超过PCIe 7最大4到7英寸时,重驱动器增加50%链路裕度,功耗sub-watt,延迟sub-nanosecond,对比重定时器10+瓦和10纳秒;
  • 基板、riser卡、add-in卡、多连接器:一个或多个重驱动器改善链路预算裕度;
  • 铜背板。

铜缆

  • scale-up架构中,IR重驱动器为XPU到XPU连接、I/O和背板线缆增加链路裕度,使用DAC;
  • 芯片到模块:PCIe 7可有源铜缆替代拓扑,可能包含多个IR重驱动器和重定时器。

光缆

  • scale-out使用光缆,包括线性可插拔光学(LPO)或近封装光学;
  • 下一代Umtia也具有类似高级功能。

4.4 带外管理与链路训练

  • 支持OIF CMS、CMS LT、OpenBMC等规范;
  • CMS LT规范正在开发,将扩展CMS覆盖电气和光学段的链路训练;
  • PCIe到PCIe链路包括光缆,涉及PCIe重定时器less direct drive ECR,也在开发中;
  • IR驱动器和ITIA是电气子段A和C的一部分,通过CMS LT流程进行链路训练;
  • 两线连接(图中红色)连接PCIe设备固件和IR驱动器MCU固件,使用CMS LT内存映射;
  • IR驱动器基于脉冲响应的链路训练和均衡自动进行,与PCIe设备协调;
  • IR驱动器本地CTL和FFE以及主机FFE均可优化;
  • 实时诊断、数字眼图监控、误码率功能通过CMS LT支持。

4.5 三类器件对比

特性 经典重驱动器 下一代IR重驱动器 PCIe重定时器
协议参与 协议不感知,仅放大信号 协议不感知,通过带外启用链路训练 协议感知,参与链路训练,有LTSSM状态机
抖动处理 衰减确定性抖动,放大随机抖动和群延迟失真 平衡:衰减确定性抖动,FFE改善群延迟失真,量化噪声低于重定时器 重置整个抖动预算,引入ADC噪声
均衡能力 手动调谐CTL 模拟CTL + 分数UI模拟FFE,自动适配 复杂DSP FFE/DFE,自适应通道
开放系统放置 不推荐,仅限高度约束的封闭系统 可行,放置灵活 遵循PCIe基础规范,可放任何位置,最通用
功耗/延迟 高(10+瓦,10+纳秒)
距离 中等 最长

5. 三类器件选型总结

Majid Fudi给出最终结论:

  • 选择下一代重驱动器还是重定时器,取决于系统设计;
  • IR重驱动器在低功耗、低延迟、低成本、小尺寸、协议无关灵活性方面表现优异;
  • 重定时器在更长距离和PCIe协议感知方面领先;
  • 雷达图直观比较:重定时器子图显示距离和协议感知优势,重驱动器子图显示低功耗、延迟、尺寸和成本优势;
  • 重驱动器补充重定时器在更高速率下的距离扩展角色,特别是PCIe 7.0及以上的电气和光链路;
  • 重驱动器以极低功耗和延迟改善链路裕度,适合scale-up/scale-out AI基础设施部署,其中功耗和成本是主要关注点;
  • 两种技术各有其位置,选择取决于具体系统在距离、功耗、延迟和成本上的预算。

6. 问答环节

问题:下一代重驱动器的链路训练与重定时器有何不同?

回答(Majid Fudi):

  • 重定时器参与root complex、端点或交换机的带内协议,在物理层和均衡滤波器参数调整等方面进行交互;
  • 重驱动器在PCIe root complex或端点控制下,使用慢时钟,由某个PCIe组件发送,片外采样,估计脉冲响应,优化自身CTL和FFE,并可选择建议主机FFE参数;
  • 之后端到端PCIe链路训练接管,进入其流程。

本文内容整理自PCI SIG网络研讨会"Enhancing Data Center Architectures with PCIe Retimers, Redrivers and Switches",演讲者包括Majid Fudi(Tera Signal)、Rick Kutzpau(Broadcom)和Annie Leow(Marvell)。

相关推荐
正经教主1 小时前
【FDE系列】阶段2:Day 35:Python + SQL — 工单接入 MySQL + 本周收官
人工智能·python·fde
I Am a robert girl1 小时前
谷歌迈出RSI一大步:从Gemini模型迭代看AI工程化的新风向
人工智能·大模型·gemini·ai工程化·上下文工程·rsi·工具链集成
leoZ2311 小时前
第 16 篇 转型路线图与求职实战
人工智能·大模型·agent
雪隐1 小时前
16GB 显卡跑 Qwen3.8-27B,只要 7 GB:三进制模型 Bonsai 2 部署手记与双格式实测
人工智能·后端
心易行者1 小时前
Python在线运行+SQLite数据库实战:0成本搭个人数据后台,5个场景直接套用
前端·网络·人工智能·python
蒲公英eric1 小时前
数学建模全流程:从一道题到一篇论文
人工智能·数学建模·数学建模竞赛·论文写作·建模流程
AI_AGENT_DEV_AI1 小时前
AI 智能体的开发流程
人工智能
俊哥V1 小时前
每日 AI 研究简报 · 2026-09-20
人工智能·ai
zhiyouTech1 小时前
GEO实战:把生成式引擎优化当成检索工程来做(含五断点诊断与50题Benchmark)
前端·人工智能