AI 能造出更接近香农极限的译码器吗?
从 Berrou 1993 年那个 0.7 dB 说起,聊聊深度学习在信道译码这件事上
到底做到了什么、没做到什么、以及真正的机会在哪。
目录
- 引子
- [第一章 先划一条硬边界:香农极限是数学墙](#第一章 先划一条硬边界:香农极限是数学墙)
- [第二章 那 0.7 dB 的账本:还剩多少可以抢](#第二章 那 0.7 dB 的账本:还剩多少可以抢)
- [第三章 AI 已经做到什么](#第三章 AI 已经做到什么)
- [第四章 五座大山:为什么 AI 还没赢](#第四章 五座大山:为什么 AI 还没赢)
- [第五章 真正的机会在别处](#第五章 真正的机会在别处)
- [第六章 一个被忽略的关键:译码器不需要标准化](#第六章 一个被忽略的关键:译码器不需要标准化)
- [第七章 补个基础:0.7 dB 是怎么算出来的](#第七章 补个基础:0.7 dB 是怎么算出来的)
- [第八章 3GPP 进度与时间表](#第八章 3GPP 进度与时间表)
- [第九章 判断与展望](#第九章 判断与展望)
- [附录 关键公式速查](#附录 关键公式速查)
引子:一个诱人的问题
2016 年,特拉维夫大学的一篇论文让通信圈兴奋了一阵:把 LDPC 的迭代译码"展开"成神经网络,让权重可学习,短码上比标准算法好了将近 1 dB。
于是很自然的问题来了:
既然深度学习能下围棋、能写文章、能预测蛋白质结构,那它能不能造出一个更逼近香农极限的译码器?
这个问题值得认真回答。答案是能抢回一点,但空间很小 ------ 而且真正的机会,不在大多数人以为的地方。
第一章 先划一条硬边界:香农极限是数学墙
讨论之前,必须先明确一件事。
香农极限不是"目前的工程水平",是一条数学上不可跨越的墙。
香农定理有两个方向,经常被混淆:
正定理(能做到)
只要速率 R < C,就存在某个码,使误码率小于任意给定的 ε。
逆定理(做不到)------ 这个更狠
如果 R > C,那么任何编码、任何复杂度、任何译码算法,误码率都有一个大于 0 的下界。
注意逆定理的措辞:任何译码算法。
它说的是"物理上不可能",不是"我们还没找到好算法"。所以:
不存在任何译码器 ------ AI 的也不行 ------ 能在低于容量的信噪比上做到误码率趋近 0。
那问题只能问成
还能往墙再挤近多少?
第二章 那 0.7 dB 的账本:还剩多少可以抢
香农定理说的是 N → ∞。真实系统码长有限,有个精确的修正项 ------ 有限码长理论(Polyanskiy、Poor、Verdú,2010):
┌──────────────────────┐
R ≈ C − √(V/N) · Q⁻¹(ε)
└───┬────┘
有限码长惩罚
按 1/√N 缩小
其中 V 是信道散度(channel dispersion),衡量信道的"不确定性"。
代入 Berrou 1993 的条件
码率 R = 1/2
码长 N = 65536
目标误码 ε = 10⁻⁵
信道 AWGN
算出来:
√(V/N) · Q⁻¹(10⁻⁵) ≈ 0.0147 bit/符号
换算成 SNR ≈ 0.17 dB
拆开那 0.7 dB
0.7 dB = 0.17 dB + 0.53 dB
└─┬──┘ └─┬──┘
有限码长下限 码与译码算法的
(数学的,谁 次优性
也减不掉) (这是可以抢的)
结论
AI 能抢的理论上限,大约只有半个 dB。
再往下,就不是工程问题,是数学了。
这个数字很重要 ------ 它把"AI 能不能超越"这个模糊问题,变成了一个有边界的工程问题。
而且这半个 dB,还得在下面五座大山下抢。
第三章 AI 已经做到什么
先说真实进展,这些不是吹的。
| 方向 | 代表工作 | 成果 | 状态 |
|---|---|---|---|
| 神经 BP 译码 | Nachmani 等,2016,特拉维夫大学 | 把 BP 迭代展开成网络学权重,短码上相对标准 BP 提升 0.5~1 dB | 论文 |
| 神经 Polar 译码 | 多篇,2017-2020 | 短块上接近 MAP 最优 | 论文 |
| 端到端自编码器 | O'Shea & Hoydis,2017 | 联合学调制+编码,简单信道上打平经典方案 | 论文 |
| AI 设计码字 | 强化学习搜 Tanner 图 / 交织器 | 离线搜索,零运行时成本 | 论文,最务实 |
| CSI 压缩反馈 | 3GPP Rel-18 | AI 压缩信道状态信息 | ⭐ 已进标准 |
所谓"神经 BP",到底做了什么
标准 BP 迭代:
第 1 轮:变量节点 → 校验节点 → 变量节点
第 2 轮:重复
...
第 L 轮:判决
关键观察:每一轮的结构是一样的,只是轮数不同。
神经 BP 的做法是把它"展开":
第 1 轮 ──→ 第 2 轮 ──→ ... ──→ 第 L 轮
↑ ↑ ↑
权重 w₁ 权重 w₂ 权重 w_L
每一轮的边都有自己的可学习权重,然后用大量样本训练。
本质上:不假设标准 BP 的更新规则是最优的,让数据告诉我们每一条边该有多可信。
这个思路很聪明,在短码上确实有效 ------ 因为短码的 Tanner 图有大量短环,标准 BP 的"独立性假设"失效了,而学习的权重能部分补偿这一点。
但要诚实
在 AWGN + 中长码这个主战场上,截至目前还没有一个神经译码器能稳定打败调参到位的经典 LDPC/Polar 译码器。
论文里的增益,大多出现在短码 ------ 也就是经典编码理论本来就弱的地方。
第四章 五座大山:为什么 AI 还没赢
① 组合爆炸
K 个信息位 → 2^K 个合法码字
K = 1000 → 2¹⁰⁰⁰
K = 8448(5G LDPC 最大) → 天文数字
神经网络不可能"记住"这个集合,只能学会结构。
而问题在于:经典译码器已经把结构利用得很好了。 min-sum、BCJR 这些算法,本身就是对码结构的高效近似推理。
AI 要超越,得发现人类没发现的规律 ------ 不是不可能,但很难。
② 过拟合到训练信噪比 ⭐ 最要命
在 Eb/N0 = 2 dB 训练的神经译码器
→ 在 2 dB 表现很好
→ 在 0.5 dB 或 5 dB 可能直接崩掉
而真实系统要在 −10 dB 到 +30 dB 的范围内工作。
选项:
- 每个 SNR 训一个模型 → 几十个模型,存储爆炸
- 把 SNR 作为输入条件 → 增加学习难度,且泛化仍不保证
③ 长码泛化不了
在 N=128 上训好的网络,用到 N=1024 基本失效。
每换一个码长就得重训。 而 5G 标准里有几十种码长/码率组合,每种都要训、要存、要验证。
④ 没有性能保证(工程上很难接受)
经典译码器:可以分析错误平层,给出性能下界
神经译码器:"通常在 10⁻⁵,但偶尔会莫名其妙地炸"
通信系统关心的是 10⁻⁹ 甚至更低的误码率。
"99.9% 的时候很好,但有万分之一概率整块崩掉" ------ 这种东西没法验收。
而且这里有个死结:
要验证 10⁻⁹ 的误码率,蒙特卡洛需要 10¹¹ 比特
→ 仿真根本跑不动
→ 无法验证
→ 不敢用
⑤ 算力与功耗
经典 min-sum: 加法、比较、取最小值 ------ 极便宜
神经网络: 百万次乘累加 ------------ 贵几个数量级
译码器是每秒要处理几亿个 LLR 的模块。 这是它的宿命。
手机里跑神经网络译码器,直接掉电。
第五章 真正的机会在别处
如果只盯着"在 AWGN 上打败经典译码器",那格局小了。
① 非 AWGN / 未知信道 ⭐ 最大机会
这是最重要的一点,值得展开。
经典译码器的"最优性"是建立在假设之上的:
假设:噪声是高斯的、信道估计是完美的、同步是无误的
真实世界:
✗ 邻区干扰 ------ 不是高斯的
✗ 功放非线性失真
✗ 相位噪声
✗ 廉价射频器件的 IQ 失衡
✗ 脉冲噪声
✗ 信道估计本身就有误差
✗ 硬件损伤
在这些情况下,经典译码器已经不再"最优"了 ------ 因为它对信道的假设是错的。
而 AI 有一个经典方法没有的能力:
它可以从数据里学到真实的信道特性,而不需要人类先把模型建对。
这才是 AI 在物理层最大的价值:不是超越已知模型下的最优,而是在模型本身就不准的地方补位。
在毫米波、超低成本 IoT 器件、非授权频段(Wi-Fi/5G 共存、干扰复杂)上,这个价值尤其大。
② 短码块(URLLC、IoT)
经典 LDPC 在短块上:Tanner 图小 → 短环多 → 迭代很快陷入自循环
经典 Polar 在短块上:码长不够,极化根本来不及发生
短块是经典编码理论的软肋。
而 5G 的 URLLC(超可靠低时延通信)、6G 的物联网场景,正好需要短码块。AI 在这里已经证明有真实增益。
③ 联合优化整条接收链
现在的接收机是分块设计的:
信道估计 → 均衡 → 解映射 → 解交织 → 译码
每一块各自最优,但联合起来不一定最优
这是工程上的必然 ------ 联合优化太复杂,没人能解析求解。
AI 可以端到端地把整条链一起学。 这在经典框架下做不到。
④ 离线码设计 ⭐ 最务实
用 AI 搜索更好的:
- LDPC 的 Tanner 图结构 / 度分布
- Polar 的冻结位选择
- Turbo 的交织器
- 打孔图样
这个方向最可能被产业界接受,理由很简单:
搜索在离线做(服务器上跑几天)
跑出来的还是经典码 + 经典译码器
→ 终端芯片一行代码都不用改
→ 功耗不变
→ 风险为零
用 AI 做设计工具,而不是做运行时组件 ------ 这是当下性价比最高的路线。
⑤ 已落地:CSI 压缩(3GPP Rel-18)
AI 压缩信道状态反馈,这是 5G-Advanced 里真正标准化了的 AI 应用。
它不是"译码",但它证明了一件事:
AI 进 3GPP 标准,是可行的。
第六章 一个被忽略的关键:译码器不需要标准化
这一章可能是全文最反直觉、也最重要的一节。
发射端和接收端,地位完全不对称
编码端(发射): 必须标准化
否则基站发的包,手机看不懂
译码端(接收): 不需要标准化
厂商怎么做都行,只要能解出来
这意味着:
AI 译码器不需要等 3GPP 开完会。它可以"悄悄"进你的手机。
实际上这事一直在发生
各家芯片厂商的接收机里,早就塞满了 proprietary 的"秘方":
- 更聪明的迭代调度顺序
- 动态提前终止(省电)
- 混合算法(BP + 排序统计译码兜底)
- 针对特定信道的补偿表
- 针对自家射频前端的联合调参
这些都是"非标准"的接收机增强,从来不需要写进标准。
AI 只是这套军备竞赛的下一步。
所以 AI 译码器会长什么样
不会是: "3GPP 宣布 Rel-20 采用神经网络译码器"
而会是: "某家手机在弱信号下突然好了 1 dB,拆机发现基带里多了个 NPU"
第七章 补个基础:0.7 dB 是怎么算出来的
既然全文围绕这个数字,把它的来历讲清楚。
仿真是纯软件的蒙特卡洛
Berrou 1993 年没有用任何真实硬件。 整个链路用数学模型模拟:
真实: 比特 → 编码 → 调制 → 天线 → 电磁波 → 噪声 → 天线 → 解调 → 译码
↑
仿真: 比特 → 编码 → 调制 → + 人工高斯噪声 → 解调 → 译码
↑
伪随机数发生器造出来
为什么敢这么干? 因为 AWGN 信道的数学模型是精确的。y = s + n 就是信道的全部。
今天 5G/Wi-Fi 标准制定,第一步也全是链路级仿真。标准里每条性能曲线,都是这么跑出来的 ------ 先仿真、后流片。
仿真十步
python
for EbN0_dB in [0.0, 0.3, 0.5, 0.7, 1.0, 1.5, 2.0]:
① 生成随机比特 u = randint(0,2,N) N = 65536
② Turbo 编码 → 3N = 196608 bit(母码 1/3)
③ 打孔到 rate 1/2 → 2N = 131072 bit
④ BPSK 调制 0→+1, 1→−1,幅度 ±1
⑤ 算噪声强度 σ = 1/√(Eb/N0) ← 关键公式
⑥ 加人工噪声 y = s + randn(0,σ)
⑦ 解映射算 LLR LLR = 2y/σ²
⑧ Turbo 译码 两个 BCJR 迭代 18 次
⑨ 逐位比对 数译错的 bit 数 → BER
⑩ 重复足够多次,直到统计可信
关键公式:怎么"造"出指定信噪比的噪声
设定:
信息位 N 个
码率 1/2 → 发出 2N 个符号
符号幅度 ±1 → 每个符号能量 Es = 1
每比特能量 Eb = Es / R = 1/0.5 = 2
噪声 n ~ N(0, σ²)
噪声谱密度 N0 = 2σ² (标准约定)
推导:
Eb 2 1
── = ────── = ─── → σ² = 1/(Eb/N0)
N0 2σ² σ²
σ = 1/√(Eb/N0)
代入 0.7 dB:
Eb/N0 = 10^0.07 = 1.175
σ² = 1/1.175 = 0.851
σ = 0.923
这个数字有多吓人
信号幅度: ±1
噪声标准差:0.923
噪声几乎和信号一样大。 收到的波形肉眼看就是一团噪声。
算一下不编码在这个信道下的误码率:
BER = Q(1/σ) = Q(1.084) = 0.139
原始误码率 14% ------ 每 7 个比特错 1 个。
而 Turbo 码迭代 18 次后,做到 10⁻⁵。
从 14% 到 0.001%,这就是 Turbo 码那年干的事。
三步算出 0.7 dB
第一步:算理论墙
2^(2R) − 1
Eb/N0 = ──────────
2R
R = 1/2: (2¹ − 1)/1 = 1 = 0 dB ← 香农极限
第二步:读仿真曲线
画出 BER vs Eb/N0 曲线,找到穿过 10⁻⁵ 的那一点:
BER
10⁰ │●
│ ●
10⁻²│ ●
│ ●
10⁻⁴│ ●
│ ●●
10⁻⁵│───────●──────── ← Turbo 曲线在这里穿过
│ ●●●
└──┬────┬────┬───▶ Eb/N0 (dB)
0 0.7 1.5
↑ 读出 0.7 dB
第三步:相减
0.7 dB(实测) − 0 dB(香农极限) = 0.7 dB
它值多少
10^(0.7/10) = 1.175
→ Turbo 只比理论最省多花 17.5% 的功率
对比同期方案:
| 方案(rate 1/2,BER=10⁻⁵) | 需要 Eb/N0 | 距香农极限 |
|---|---|---|
| 香农极限 | 0 dB | 0 |
| Turbo 1993 | 0.7 dB | 0.7 dB ⭐ |
| 当时的卷积码(K=7) | 约 4~5 dB | 约 4~5 dB |
| 不编码 BPSK | 9.6 dB | 9.6 dB |
10^(3.8/10) = 2.4 倍
→ Turbo 比老方案省了 2.4 倍功率
但要注意:它是一组参数的产物
0.7 dB 不是 Turbo 码的固有属性:
| 参数 | 值 |
|---|---|
| 码率 | 1/2 |
| 码长 N | 65536(很长) |
| 迭代次数 | 18 |
| 目标 BER | 10⁻⁵ |
| 信道 | AWGN |
改任何一个,数字就变。码长越短、迭代越少,差距越大。
仿真的局限
| 局限 | 说明 |
|---|---|
| 低 BER 跑不动 | 验证 10⁻⁹ 要跑 10¹¹ 比特,不可能。错误平层只能靠理论分析 |
| 只信 AWGN | 真实信道有衰落、多径、干扰 |
| RNG 质量 | 伪随机数不理想,结果会偏 |
| 实现损耗 | 仿真用浮点,芯片用定点量化(LLR 量化 6~8 bit)→ 实际差 0.2~0.5 dB |
| 理想同步 | 仿真假设定时/频偏完美,真实系统还要扣损耗 |
所以仿真 0.7 dB,芯片做出来通常是 1.0~1.5 dB。 这个差值叫实现损耗。
第八章 3GPP 进度与时间表
| 版本 | AI/ML 相关 |
|---|---|
| Rel-18(5G-Advanced) | 立项 "AI/ML for NR Air Interface",落地三项:CSI 压缩、波束管理、定位 |
| Rel-19 | 扩展上述用例,开始讨论 AI 接收机 |
| Rel-20 / 6G | 大概率把"AI 原生空口"作为核心议题 |
AI 译码器目前还在研究阶段,没有进标准。
但因为第六章说的原因(接收端不需要标准化),这不代表它没在被用。
第九章 判断与展望
短期(现在 ~ 2030)
AI 不会在 AWGN + 中长码这个主战场取代 LDPC/Polar。
但会用在:
✓ 短码块(URLLC / IoT)
✓ 非理想信道下的补偿
✓ 接收机里那些"经典理论没建模的脏活"
✓ 离线码设计
中期(6G)
可能发生的是AI 原生的联合设计:
- 编码、调制、波形一起用 AI 设计
- 不再区分"编解码器"和"调制解调器"
- 端到端优化
这对经典范式是颠覆性的,但离落地还很远 ------ 因为标准、互操作性、可验证性这三关都没有答案。
永远不变
香农极限是墙。AI 能让我们贴得更近,但穿不过去。
一个更根本的判断
回顾整个信道编码史,会发现一个规律:
| 怎么来的 | 理论完备吗 | |
|---|---|---|
| LDPC(1960) | 纯数学推导 | ✅ 发表即有证明,但等了 45 年才有算力 |
| Turbo(1993) | 直觉 + 试出来 | ❌ 发表时只有仿真,6 年后才被解释清楚 |
| Polar(2008) | 纯数学推导 | ✅ 严格证明达到容量 |
Turbo 码是"先实验后理论"的罕见案例 ------ Berrou 自己一开始都不敢相信结果,以为仿真有 bug。
而 AI 正在把这种模式重新带回来:
不追求先推导出最优解,而是让数据告诉我们什么有效。
代价是我们不完全理解它为什么有效,也就没法给出保证。
对通信系统这种"错了会掉线"的领域,缺乏保证本身,可能比那 0.5 dB 的增益更贵。
附录 关键公式速查
香农容量(实 AWGN)
C = ½ · log₂(1 + SNR) [bit/信道使用]
香农极限(换算成每比特能量)
2^(2R) − 1
Eb/N0 = ──────────
2R
R = 1/2 → 0 dB
R → 0 → ln2 = −1.59 dB(终极极限)
有限码长修正
R ≈ C − √(V/N) · Q⁻¹(ε)
N = 65536, ε = 10⁻⁵, AWGN, rate 1/2
→ 惩罚约 0.17 dB
仿真中噪声怎么造
σ² = 1/(Eb/N0) (Eb/N0 用线性值)
σ = 1/√(Eb/N0)
Eb/N0 = 0.7 dB = 1.175 → σ = 0.923
未编码 BPSK 误码率
BER = Q(√(2·Eb/N0))
BER = 10⁻⁵ 需要 Eb/N0 = 9.6 dB
dB 换算成功率倍数
倍数 = 10^(ΔdB/10)
0.7 dB → 1.175 倍
3.8 dB → 2.4 倍
8.9 dB → 7.8 倍
全文一句话总结
AI 能做出更接近香农极限的译码器,但空间只有约 0.5 dB ------ 剩下的 0.17 dB 是有限码长的数学下限,谁也拿不走。
在主战场(AWGN + 中长码)上,AI 目前还没打赢经典译码器,面前有五座大山:组合爆炸、SNR 过拟合、长码泛化、缺乏保证、算力功耗。
真正的机会在别处:短码块、非高斯/未知信道、整条接收链的联合优化 ------ 以及最务实的:用 AI 离线设计更好的码,终端一行代码都不用改。
而最关键的一点是:译码器在接收端,不需要标准化。所以 AI 译码器不会等 3GPP 开完会才出现 ------ 它会以"某家手机在弱信号下突然好了 1 dB"的方式,悄悄到来。
至于香农极限 ------ 那是墙。AI 能让我们贴得更近,但穿不过去。