PCIe 是什么?为什么这么快?从差分线到 Gen6 的硬核解析与场景全览

如果你看过座舱控制器或 SoC 的引脚定义,大概率会碰到这样的信号:

复制代码
PCIE0_TX7_M -- AO PCIe 0 Gen 3 transmit 7 -- minus
PCIE0_TX7_P -- AO PCIe 0 Gen 3 transmit 7 -- plus
PCIE1_REFCLK_M -- AO PCIe 1 Gen 3 reference clock -- minus
PCIE1_REFCLK_P -- AO PCIe 1 Gen 3 reference clock -- plus
PCIE1_RX10_M -- AI PCIe 1 Gen 3 receive 10 -- minus
PCIE1_RX10_P -- AI PCIe 1 Gen 3 receive 10 -- plus

这些引脚背后,就是现代计算系统里最重要的高速总线之一:PCIe

但很多人对它的印象停留在"插显卡的插槽"或"M.2 SSD 用的接口"。实际上,PCIe 远不止于此。它既是设备内部的高速数据主干道,也是一套把物理层、编码、均衡和协议全部压榨到极致的技术体系。

这篇文章分两部分讲清楚:

  1. PCIe 到底干什么用?它出现在哪些场景?
  2. PCIe 为什么能这么快?从差分线到 Gen6 的硬核解析。

一、PCIe 是什么?

PCIe(Peripheral Component Interconnect Express)是一种高速串行、点对点、全双工的通用 I/O 总线。

你可以把它理解成:

芯片与高速外设之间、芯片与芯片之间的"内部高速公路"。

它不直接驱动屏幕,也不直接接摄像头。它负责的是搬数据:把 CPU/SoC 和 SSD、网卡、Wi-Fi、5G、AI 加速器、FPGA 等高速设备连起来。

PCIe 拓扑里的三个核心角色

角色 说明 典型设备
RC(Root Complex) 根复合体,PCIe 树的根 CPU、SoC
EP(Endpoint) 端点,实际干活的设备 NVMe SSD、网卡、GPU、Wi-Fi 模块
Switch 交换机,扩展更多 PCIe 端口 PCIe Switch 芯片

典型结构:

复制代码
CPU / SoC (RC)
    │
    ├── PCIe x4 ── NVMe SSD
    ├── PCIe x1 ── Wi-Fi / 蓝牙模块
    └── PCIe Switch
            ├── PCIe x4 ── 5G 模块
            ├── PCIe x4 ── AI 加速芯片
            └── PCIe x1 ── 以太网控制器

每个设备独享链路,不像老式 PCI 是共享总线。Lane 数可以按需配置:x1、x2、x4、x8、x16。


二、PCIe 主要用来干什么?

1. 连接高速存储

  • NVMe SSD:这是 PCIe 最广为人知的用途。
  • U.2 / M.2 / E1.S / E3.S:各种 SSD 形态,背后都是 PCIe。
  • 车载地图、娱乐内容、日志存储:座舱控制器常用 PCIe 接 NVMe。

2. 连接网络与通信模块

  • Wi-Fi / 蓝牙模块
  • 5G / LTE / V2X 模块
  • 车载以太网控制器 / 交换机
  • 数据中心智能网卡(SmartNIC)

3. 连接加速器与计算芯片

  • GPU / AI 加速卡
  • FPGA
  • DPU
  • 视频编解码卡
  • AI 推理芯片

4. 连接采集与扩展芯片

  • 视频采集卡
  • USB 控制器
  • SATA / SAS 控制器
  • Thunderbolt / USB4 控制器

5. 芯片间互连

在大芯片、Chiplet、FPGA、AI 加速卡之间,PCIe 也常被用来做高带宽芯片间通信。比如两颗 AI 芯片通过 PCIe 交换数据。


三、PCIe 为什么能这么快?

PCIe 的 Lane 速率从 Gen1 的 2.5 GT/s 一路涨到 Gen6 的 64 GT/s,远超 DP、CSI 这些同样用差分线的接口。都是差分信号,凭什么 PCIe 能快这么多?

答案不是单一技术,而是一整套从物理层到协议层的组合拳。

1. 先看速率演进:每代翻倍

版本 原始速率 编码 有效带宽/lane 常用配置
Gen1 2.5 GT/s 8b/10b ~2 Gbps x1, x4
Gen2 5.0 GT/s 8b/10b ~4 Gbps x4, x8
Gen3 8.0 GT/s 128b/130b ~7.88 Gbps x4, x8, x16
Gen4 16 GT/s 128b/130b ~15.75 Gbps x4, x8, x16
Gen5 32 GT/s 128b/130b ~31.5 Gbps x8, x16
Gen6 64 GT/s PAM4 + FLIT ~63 Gbps x8, x16

一个 Gen3 的 x4 链路,总有效带宽约 31.5 Gbps ,已经能跑满一块高速 NVMe SSD。一个 Gen4 x16 链路,有效带宽约 252 Gbps,足以喂饱高端显卡。

所以 PCIe 的速度,是 高 Lane 速率 × 多 Lane 并行 × 高编码效率 三者叠加的结果。

2. 差分信号:高速的物理基础

PCIe 每个 Lane 的发送和接收都用差分对

  • 一根线传正信号,一根线传负信号。
  • 接收端取两者之差,共模噪声被抵消。
  • 差分阻抗通常控制在 85Ω100Ω

差分信号的好处:

  • 抗共模干扰:电机、电源、无线信号引入的噪声会被差分接收器抑制。
  • EMI 更低:两条线电流方向相反,磁场相互抵消。
  • 可以传输更高频率:单端信号在高速下容易受地弹、串扰影响,差分则稳定得多。

但差分只是基础。真正让 PCIe 跑快的,是下面这些。

3. 关键加速技术

(1)多 Lane 并行

PCIe 不像 DP 主链路那样通常最多 4 Lane,它可以从 x1 扩展到 x16,甚至 x32。

每个 Lane 独立工作,数据被条带化(striping) 分发到各 Lane,接收端再重新组装。Lane 越多,总带宽线性增长。

所以一个 Gen3 x16 的带宽,是 Gen3 x1 的 16 倍。

(2)编码效率提升:从 8b/10b 到 128b/130b

早期 PCIe Gen1/Gen2 用 8b/10b 编码:每 8 位数据要编成 10 位传输,开销 20%。所以 Gen2 的 5 GT/s 原始速率,有效带宽只有 4 Gbps。

Gen3 开始改用 128b/130b 编码:每 128 位数据只加 2 位同步头,开销仅 1.5%。这是 Gen3 有效带宽大幅提升的关键之一。

Gen6 进一步引入 PAM4,一个符号周期传 2 位,加上 FLIT 模式,效率继续提升。

(3)嵌入式时钟与 CDR

PCIe 没有独立的时钟 Lane,而是把时钟嵌入数据流 ,接收端用 CDR(时钟数据恢复) 从数据跳变中提取时钟。

这样省了时钟线,也避免了时钟与数据之间的偏斜问题。但代价是接收端需要更复杂的模拟电路。

(4)链路训练与均衡

高速信号在 PCB 走线上会衰减、失真。PCIe 在链路建立时进行 Link Training,自动协商速率、宽度和均衡参数。

发送端使用 FFE(前馈均衡) 预加重高频分量,接收端使用 CTLE(连续时间线性均衡)DFE(判决反馈均衡) 补偿信道损耗。Gen5/Gen6 还引入 ADC + DSP 架构。

这套自适应均衡机制,让 PCIe 能在不同板材、不同长度、不同连接器上稳定跑高速。

(5)全双工独立收发

每个 Lane 有独立的 TX 和 RX 差分对。发送和接收可以同时满速进行,互不干扰。

这和 DP 主链路的单向传输不同。DP 的 AUX 虽然是双向,但速率只有 1 Mbps,和主链路不在一个量级。

(6)低延迟、高并发的协议设计

PCIe 协议层有几个特点:

  • 基于事务层包(TLP):读写请求、完成、配置、消息都打包传输。
  • 拆分事务:请求和响应分离,链路上可以同时有多个未完成事务。
  • 流量控制:接收端通告可用缓冲,发送端不会溢出。
  • 服务质量(QoS):支持虚拟通道,区分优先级。

这些机制让 PCIe 在高带宽的同时保持低延迟和高并发。


四、和 DP / CSI / 以太网比,PCIe 快在哪?

特性 PCIe Gen3 DP 1.4 CSI-2 D-PHY
每 Lane 原始速率 8 GT/s 8.1 Gbps 2.5 Gbps
编码 128b/130b 8b/10b 8b/10b 或 16b/18b
每 Lane 有效带宽 ~7.88 Gbps ~6.5 Gbps ~2 Gbps
最大 Lane 数 x16(甚至 x32) 4 4
方向 全双工 主链路单向 单向
时钟 嵌入式 + REFCLK 嵌入式 独立时钟 Lane
均衡 强自适应 中等 较弱
典型总带宽 x16:~126 Gbps 4 Lane:~26 Gbps 4 Lane:~8 Gbps

PCIe 的优势来自:

  1. Lane 数可以堆到 16 甚至 32,DP/CSI 通常最多 4。
  2. 每 Lane 速率更高,Gen3 就到了 8 GT/s,Gen5 到 32 GT/s。
  3. 编码效率更高,128b/130b 只损失 1.5%。
  4. 全双工,TX 和 RX 独立,总吞吐翻倍。
  5. 均衡和训练机制更强,能补偿更差的信道。
  6. 协议为高并发优化,适合存储、网络、加速器。

DP 和 CSI 的设计目标不同:

  • DP 要驱动长线缆、支持音频和 HDCP,物理层不能太激进。
  • CSI 要在低功耗、低 EMI 下传图像,速率够用即可。
  • PCIe 是机箱内或板级高速总线,追求极致带宽和低延迟。

和车载以太网、CAN 的简单对比

接口 主要用途 典型距离 方向 场景
PCIe 芯片与外设、芯片间高速数据 板级/机箱内 全双工 SSD、网卡、GPU、AI
DP / eDP 视频显示 米级 / 板级 主链路单向 显示器、车内屏幕
MIPI CSI-2 摄像头图像输入 板级,很短 单向 摄像头、ADAS
车载以太网 车内网络通信 车内数米到数十米 全双工 域控制器互连
CAN / LIN 低速控制 车内数十米 半双工/主从 车身控制

一句话:

PCIe 管"数据",DP/eDP 管"显示",CSI 管"图像",以太网管"网络"。


五、典型场景

消费电子与 PC

  • 显卡插在主板 PCIe x16 插槽
  • NVMe SSD 插在 M.2 插槽
  • Wi-Fi 网卡插在 M.2 或 PCIe x1
  • 外接显卡坞通过 Thunderbolt/USB4,内部走 PCIe
  • 采集卡、声卡、网卡扩展

数据中心与服务器

  • GPU 服务器:CPU 通过 PCIe 连接多块 GPU
  • NVMe 存储阵列:大量 SSD 通过 PCIe Switch 扩展
  • SmartNIC / DPU:卸载网络、存储、虚拟化
  • AI 训练集群:GPU 间通过 PCIe / NVLink 混合互连

笔记本电脑与平板

  • NVMe SSD
  • Wi-Fi 模块
  • Thunderbolt / USB4 控制器
  • 部分外接扩展坞

车载座舱与 ADAS

座舱控制器里的 PCIe 通常用来连接:

  • NVMe SSD:地图、娱乐、日志
  • Wi-Fi / 蓝牙模块:无线连接
  • 5G / V2X 模块:车联网
  • 车载以太网控制器 / 交换机:车内骨干网络
  • AI 加速芯片 / FPGA:语音、视觉、多模态大模型
  • 视频采集芯片:多路摄像头输入
  • USB Hub 控制器:扩展 USB 接口

ADAS 域控制器里,PCIe 还常用来连接:

  • 激光雷达、毫米波雷达、摄像头采集芯片
  • 高算力 AI 芯片
  • 安全 MCU / 交换芯片

工业与嵌入式

  • FPGA 加速卡
  • 高速数据采集卡
  • NVMe 存储
  • 工业以太网控制器
  • 机器视觉采集

六、PCIe 不干什么?

为了避免混淆,明确一下 PCIe 不负责的事情:

任务 更合适的接口
驱动车内屏幕 eDP / DP
接摄像头图像传感器 MIPI CSI-2
跨车网络通信 车载以太网 / CAN / LIN
低速传感器与控制 I2C / SPI / UART
音频传输 I2S / TDM / SoundWire

所以,座舱控制器里往往是多套接口并存

  • eDP 驱动仪表、中控屏
  • DP 连接外部设备投屏
  • CSI 接摄像头
  • PCIe 连接 SSD、Wi-Fi、5G、AI 加速、以太网
  • 以太网 连接车内其他域控制器

PCIe 是这些高速设备背后的"数据主干道"。


七、代价是什么?

PCIe 这么快,不是没有代价:

  • 功耗高:高速 SerDes 功耗可观,Gen5/Gen6 尤其明显。
  • 设计复杂:PCB 要走阻抗控制、等长、低损耗材料,布线难度大。
  • 成本高:高速连接器、重定时器、PCB 板材都更贵。
  • 距离短:通常板级或机箱内,长距离需要 Retimer/Redriver。
  • 散热要求:高速 PHY 发热大,需要散热设计。

所以 PCIe 适合"短距离、高带宽、高功耗可接受"的场景。DP 和 CSI 则各自在显示和图像领域做了取舍。


八、总结

PCIe 是干什么的?

它是设备内部的高速通用 I/O 总线,用来连接 CPU/SoC 与 SSD、网卡、Wi-Fi、5G、AI 加速器、FPGA、以太网控制器等高速外设,也用于芯片间互连。

它出现在哪些场景?

  • PC、服务器、笔记本:显卡、NVMe、网卡、Thunderbolt
  • 数据中心:GPU、DPU、NVMe、SmartNIC
  • 车载座舱/ADAS:NVMe、Wi-Fi、5G、以太网、AI 加速、视频采集
  • 工业嵌入式:FPGA、采集卡、NVMe、工业网络

PCIe 之所以快,是因为它把高速串行通信的几乎所有手段都用上了:

  • 差分信号:抗干扰、低 EMI。
  • 多 Lane 并行:x1 到 x16,带宽线性扩展。
  • 高编码效率:128b/130b 只损失 1.5%。
  • 嵌入式时钟 + CDR:省时钟线,避免偏斜。
  • 自适应均衡:FFE、CTLE、DFE,补偿信道损耗。
  • 全双工:TX/RX 独立,总吞吐翻倍。
  • 低延迟协议:TLP、拆分事务、流量控制、QoS。

一句话:

PCIe 的快,不是靠某一项黑科技,而是物理层、编码、均衡、协议层同时优化,再加上多 Lane 堆叠的结果。

你看到的 PCIE0_TX7PCIE1_RX10PCIE1_REFCLK 这些引脚,就是这套高速系统在芯片引脚上的体现。每一个 Lane 的 TX/RX 差分对,背后都是这套复杂机制的支撑。

PCIe 不直接点亮屏幕,但它撑起了屏幕背后整个智能座舱的计算、存储和网络。

相关推荐
星创易联1 小时前
Robotaxi远程平行驾驶通信保障:5G车载路由器低时延与网络切片实践
5g·车载系统·智能路由器·车载通信·车载网关
糖糖单片机设计13 小时前
基于 STM32 的公交车定位与报站系统
stm32·单片机·嵌入式硬件
祖力5513 小时前
快速学会51单片机基础
单片机·嵌入式硬件·51单片机
Doraemomo17 小时前
IMX6ULL裸机开发——GPIO的使用
单片机·嵌入式硬件
笨笨饿17 小时前
#138_解决Codex要五次回复的问题
linux·stm32·单片机·嵌入式硬件·mcu·物联网·嵌入式实时数据库
晊晌_h18 小时前
嵌入式从0到精通——51单片机(二)
嵌入式硬件·51单片机
云泽80818 小时前
STM32 USART 详解(七):超时设置、非阻塞发送与 ReadLine 实现
stm32·单片机·嵌入式硬件
一条破秋裤19 小时前
24_MPU6050结构参数与寄存器基础
stm32·嵌入式硬件·学习
ZLG_zhiyuan20 小时前
低空测试“升维”:ZUS系列示波器如何破解复杂信号的“测与析”难点?
单片机·嵌入式硬件