如果你看过座舱控制器或 SoC 的引脚定义,大概率会碰到这样的信号:
PCIE0_TX7_M -- AO PCIe 0 Gen 3 transmit 7 -- minus
PCIE0_TX7_P -- AO PCIe 0 Gen 3 transmit 7 -- plus
PCIE1_REFCLK_M -- AO PCIe 1 Gen 3 reference clock -- minus
PCIE1_REFCLK_P -- AO PCIe 1 Gen 3 reference clock -- plus
PCIE1_RX10_M -- AI PCIe 1 Gen 3 receive 10 -- minus
PCIE1_RX10_P -- AI PCIe 1 Gen 3 receive 10 -- plus
这些引脚背后,就是现代计算系统里最重要的高速总线之一:PCIe。
但很多人对它的印象停留在"插显卡的插槽"或"M.2 SSD 用的接口"。实际上,PCIe 远不止于此。它既是设备内部的高速数据主干道,也是一套把物理层、编码、均衡和协议全部压榨到极致的技术体系。
这篇文章分两部分讲清楚:
- PCIe 到底干什么用?它出现在哪些场景?
- PCIe 为什么能这么快?从差分线到 Gen6 的硬核解析。
一、PCIe 是什么?
PCIe(Peripheral Component Interconnect Express)是一种高速串行、点对点、全双工的通用 I/O 总线。
你可以把它理解成:
芯片与高速外设之间、芯片与芯片之间的"内部高速公路"。
它不直接驱动屏幕,也不直接接摄像头。它负责的是搬数据:把 CPU/SoC 和 SSD、网卡、Wi-Fi、5G、AI 加速器、FPGA 等高速设备连起来。
PCIe 拓扑里的三个核心角色
| 角色 | 说明 | 典型设备 |
|---|---|---|
| RC(Root Complex) | 根复合体,PCIe 树的根 | CPU、SoC |
| EP(Endpoint) | 端点,实际干活的设备 | NVMe SSD、网卡、GPU、Wi-Fi 模块 |
| Switch | 交换机,扩展更多 PCIe 端口 | PCIe Switch 芯片 |
典型结构:
CPU / SoC (RC)
│
├── PCIe x4 ── NVMe SSD
├── PCIe x1 ── Wi-Fi / 蓝牙模块
└── PCIe Switch
├── PCIe x4 ── 5G 模块
├── PCIe x4 ── AI 加速芯片
└── PCIe x1 ── 以太网控制器
每个设备独享链路,不像老式 PCI 是共享总线。Lane 数可以按需配置:x1、x2、x4、x8、x16。
二、PCIe 主要用来干什么?
1. 连接高速存储
- NVMe SSD:这是 PCIe 最广为人知的用途。
- U.2 / M.2 / E1.S / E3.S:各种 SSD 形态,背后都是 PCIe。
- 车载地图、娱乐内容、日志存储:座舱控制器常用 PCIe 接 NVMe。
2. 连接网络与通信模块
- Wi-Fi / 蓝牙模块
- 5G / LTE / V2X 模块
- 车载以太网控制器 / 交换机
- 数据中心智能网卡(SmartNIC)
3. 连接加速器与计算芯片
- GPU / AI 加速卡
- FPGA
- DPU
- 视频编解码卡
- AI 推理芯片
4. 连接采集与扩展芯片
- 视频采集卡
- USB 控制器
- SATA / SAS 控制器
- Thunderbolt / USB4 控制器
5. 芯片间互连
在大芯片、Chiplet、FPGA、AI 加速卡之间,PCIe 也常被用来做高带宽芯片间通信。比如两颗 AI 芯片通过 PCIe 交换数据。
三、PCIe 为什么能这么快?
PCIe 的 Lane 速率从 Gen1 的 2.5 GT/s 一路涨到 Gen6 的 64 GT/s,远超 DP、CSI 这些同样用差分线的接口。都是差分信号,凭什么 PCIe 能快这么多?
答案不是单一技术,而是一整套从物理层到协议层的组合拳。
1. 先看速率演进:每代翻倍
| 版本 | 原始速率 | 编码 | 有效带宽/lane | 常用配置 |
|---|---|---|---|---|
| Gen1 | 2.5 GT/s | 8b/10b | ~2 Gbps | x1, x4 |
| Gen2 | 5.0 GT/s | 8b/10b | ~4 Gbps | x4, x8 |
| Gen3 | 8.0 GT/s | 128b/130b | ~7.88 Gbps | x4, x8, x16 |
| Gen4 | 16 GT/s | 128b/130b | ~15.75 Gbps | x4, x8, x16 |
| Gen5 | 32 GT/s | 128b/130b | ~31.5 Gbps | x8, x16 |
| Gen6 | 64 GT/s | PAM4 + FLIT | ~63 Gbps | x8, x16 |
一个 Gen3 的 x4 链路,总有效带宽约 31.5 Gbps ,已经能跑满一块高速 NVMe SSD。一个 Gen4 x16 链路,有效带宽约 252 Gbps,足以喂饱高端显卡。
所以 PCIe 的速度,是 高 Lane 速率 × 多 Lane 并行 × 高编码效率 三者叠加的结果。
2. 差分信号:高速的物理基础
PCIe 每个 Lane 的发送和接收都用差分对:
- 一根线传正信号,一根线传负信号。
- 接收端取两者之差,共模噪声被抵消。
- 差分阻抗通常控制在 85Ω 或 100Ω。
差分信号的好处:
- 抗共模干扰:电机、电源、无线信号引入的噪声会被差分接收器抑制。
- EMI 更低:两条线电流方向相反,磁场相互抵消。
- 可以传输更高频率:单端信号在高速下容易受地弹、串扰影响,差分则稳定得多。
但差分只是基础。真正让 PCIe 跑快的,是下面这些。
3. 关键加速技术
(1)多 Lane 并行
PCIe 不像 DP 主链路那样通常最多 4 Lane,它可以从 x1 扩展到 x16,甚至 x32。
每个 Lane 独立工作,数据被条带化(striping) 分发到各 Lane,接收端再重新组装。Lane 越多,总带宽线性增长。
所以一个 Gen3 x16 的带宽,是 Gen3 x1 的 16 倍。
(2)编码效率提升:从 8b/10b 到 128b/130b
早期 PCIe Gen1/Gen2 用 8b/10b 编码:每 8 位数据要编成 10 位传输,开销 20%。所以 Gen2 的 5 GT/s 原始速率,有效带宽只有 4 Gbps。
Gen3 开始改用 128b/130b 编码:每 128 位数据只加 2 位同步头,开销仅 1.5%。这是 Gen3 有效带宽大幅提升的关键之一。
Gen6 进一步引入 PAM4,一个符号周期传 2 位,加上 FLIT 模式,效率继续提升。
(3)嵌入式时钟与 CDR
PCIe 没有独立的时钟 Lane,而是把时钟嵌入数据流 ,接收端用 CDR(时钟数据恢复) 从数据跳变中提取时钟。
这样省了时钟线,也避免了时钟与数据之间的偏斜问题。但代价是接收端需要更复杂的模拟电路。
(4)链路训练与均衡
高速信号在 PCB 走线上会衰减、失真。PCIe 在链路建立时进行 Link Training,自动协商速率、宽度和均衡参数。
发送端使用 FFE(前馈均衡) 预加重高频分量,接收端使用 CTLE(连续时间线性均衡) 和 DFE(判决反馈均衡) 补偿信道损耗。Gen5/Gen6 还引入 ADC + DSP 架构。
这套自适应均衡机制,让 PCIe 能在不同板材、不同长度、不同连接器上稳定跑高速。
(5)全双工独立收发
每个 Lane 有独立的 TX 和 RX 差分对。发送和接收可以同时满速进行,互不干扰。
这和 DP 主链路的单向传输不同。DP 的 AUX 虽然是双向,但速率只有 1 Mbps,和主链路不在一个量级。
(6)低延迟、高并发的协议设计
PCIe 协议层有几个特点:
- 基于事务层包(TLP):读写请求、完成、配置、消息都打包传输。
- 拆分事务:请求和响应分离,链路上可以同时有多个未完成事务。
- 流量控制:接收端通告可用缓冲,发送端不会溢出。
- 服务质量(QoS):支持虚拟通道,区分优先级。
这些机制让 PCIe 在高带宽的同时保持低延迟和高并发。
四、和 DP / CSI / 以太网比,PCIe 快在哪?
| 特性 | PCIe Gen3 | DP 1.4 | CSI-2 D-PHY |
|---|---|---|---|
| 每 Lane 原始速率 | 8 GT/s | 8.1 Gbps | 2.5 Gbps |
| 编码 | 128b/130b | 8b/10b | 8b/10b 或 16b/18b |
| 每 Lane 有效带宽 | ~7.88 Gbps | ~6.5 Gbps | ~2 Gbps |
| 最大 Lane 数 | x16(甚至 x32) | 4 | 4 |
| 方向 | 全双工 | 主链路单向 | 单向 |
| 时钟 | 嵌入式 + REFCLK | 嵌入式 | 独立时钟 Lane |
| 均衡 | 强自适应 | 中等 | 较弱 |
| 典型总带宽 | x16:~126 Gbps | 4 Lane:~26 Gbps | 4 Lane:~8 Gbps |
PCIe 的优势来自:
- Lane 数可以堆到 16 甚至 32,DP/CSI 通常最多 4。
- 每 Lane 速率更高,Gen3 就到了 8 GT/s,Gen5 到 32 GT/s。
- 编码效率更高,128b/130b 只损失 1.5%。
- 全双工,TX 和 RX 独立,总吞吐翻倍。
- 均衡和训练机制更强,能补偿更差的信道。
- 协议为高并发优化,适合存储、网络、加速器。
DP 和 CSI 的设计目标不同:
- DP 要驱动长线缆、支持音频和 HDCP,物理层不能太激进。
- CSI 要在低功耗、低 EMI 下传图像,速率够用即可。
- PCIe 是机箱内或板级高速总线,追求极致带宽和低延迟。
和车载以太网、CAN 的简单对比
| 接口 | 主要用途 | 典型距离 | 方向 | 场景 |
|---|---|---|---|---|
| PCIe | 芯片与外设、芯片间高速数据 | 板级/机箱内 | 全双工 | SSD、网卡、GPU、AI |
| DP / eDP | 视频显示 | 米级 / 板级 | 主链路单向 | 显示器、车内屏幕 |
| MIPI CSI-2 | 摄像头图像输入 | 板级,很短 | 单向 | 摄像头、ADAS |
| 车载以太网 | 车内网络通信 | 车内数米到数十米 | 全双工 | 域控制器互连 |
| CAN / LIN | 低速控制 | 车内数十米 | 半双工/主从 | 车身控制 |
一句话:
PCIe 管"数据",DP/eDP 管"显示",CSI 管"图像",以太网管"网络"。
五、典型场景
消费电子与 PC
- 显卡插在主板 PCIe x16 插槽
- NVMe SSD 插在 M.2 插槽
- Wi-Fi 网卡插在 M.2 或 PCIe x1
- 外接显卡坞通过 Thunderbolt/USB4,内部走 PCIe
- 采集卡、声卡、网卡扩展
数据中心与服务器
- GPU 服务器:CPU 通过 PCIe 连接多块 GPU
- NVMe 存储阵列:大量 SSD 通过 PCIe Switch 扩展
- SmartNIC / DPU:卸载网络、存储、虚拟化
- AI 训练集群:GPU 间通过 PCIe / NVLink 混合互连
笔记本电脑与平板
- NVMe SSD
- Wi-Fi 模块
- Thunderbolt / USB4 控制器
- 部分外接扩展坞
车载座舱与 ADAS
座舱控制器里的 PCIe 通常用来连接:
- NVMe SSD:地图、娱乐、日志
- Wi-Fi / 蓝牙模块:无线连接
- 5G / V2X 模块:车联网
- 车载以太网控制器 / 交换机:车内骨干网络
- AI 加速芯片 / FPGA:语音、视觉、多模态大模型
- 视频采集芯片:多路摄像头输入
- USB Hub 控制器:扩展 USB 接口
ADAS 域控制器里,PCIe 还常用来连接:
- 激光雷达、毫米波雷达、摄像头采集芯片
- 高算力 AI 芯片
- 安全 MCU / 交换芯片
工业与嵌入式
- FPGA 加速卡
- 高速数据采集卡
- NVMe 存储
- 工业以太网控制器
- 机器视觉采集
六、PCIe 不干什么?
为了避免混淆,明确一下 PCIe 不负责的事情:
| 任务 | 更合适的接口 |
|---|---|
| 驱动车内屏幕 | eDP / DP |
| 接摄像头图像传感器 | MIPI CSI-2 |
| 跨车网络通信 | 车载以太网 / CAN / LIN |
| 低速传感器与控制 | I2C / SPI / UART |
| 音频传输 | I2S / TDM / SoundWire |
所以,座舱控制器里往往是多套接口并存:
- eDP 驱动仪表、中控屏
- DP 连接外部设备投屏
- CSI 接摄像头
- PCIe 连接 SSD、Wi-Fi、5G、AI 加速、以太网
- 以太网 连接车内其他域控制器
PCIe 是这些高速设备背后的"数据主干道"。
七、代价是什么?
PCIe 这么快,不是没有代价:
- 功耗高:高速 SerDes 功耗可观,Gen5/Gen6 尤其明显。
- 设计复杂:PCB 要走阻抗控制、等长、低损耗材料,布线难度大。
- 成本高:高速连接器、重定时器、PCB 板材都更贵。
- 距离短:通常板级或机箱内,长距离需要 Retimer/Redriver。
- 散热要求:高速 PHY 发热大,需要散热设计。
所以 PCIe 适合"短距离、高带宽、高功耗可接受"的场景。DP 和 CSI 则各自在显示和图像领域做了取舍。
八、总结
PCIe 是干什么的?
它是设备内部的高速通用 I/O 总线,用来连接 CPU/SoC 与 SSD、网卡、Wi-Fi、5G、AI 加速器、FPGA、以太网控制器等高速外设,也用于芯片间互连。
它出现在哪些场景?
- PC、服务器、笔记本:显卡、NVMe、网卡、Thunderbolt
- 数据中心:GPU、DPU、NVMe、SmartNIC
- 车载座舱/ADAS:NVMe、Wi-Fi、5G、以太网、AI 加速、视频采集
- 工业嵌入式:FPGA、采集卡、NVMe、工业网络
PCIe 之所以快,是因为它把高速串行通信的几乎所有手段都用上了:
- 差分信号:抗干扰、低 EMI。
- 多 Lane 并行:x1 到 x16,带宽线性扩展。
- 高编码效率:128b/130b 只损失 1.5%。
- 嵌入式时钟 + CDR:省时钟线,避免偏斜。
- 自适应均衡:FFE、CTLE、DFE,补偿信道损耗。
- 全双工:TX/RX 独立,总吞吐翻倍。
- 低延迟协议:TLP、拆分事务、流量控制、QoS。
一句话:
PCIe 的快,不是靠某一项黑科技,而是物理层、编码、均衡、协议层同时优化,再加上多 Lane 堆叠的结果。
你看到的 PCIE0_TX7、PCIE1_RX10、PCIE1_REFCLK 这些引脚,就是这套高速系统在芯片引脚上的体现。每一个 Lane 的 TX/RX 差分对,背后都是这套复杂机制的支撑。
PCIe 不直接点亮屏幕,但它撑起了屏幕背后整个智能座舱的计算、存储和网络。