深度学习语音增强(Deep Learning-based Speech Enhancement, DL-SE)从 2012--2013 年左右诞生至今,经历了数次重大的架构与范式演进。
演进的核心驱动力始终围绕着四个核心矛盾与痛点:
- 相位处理机制:从"忽略相位"到"隐式时域建模"再到"显式复数域/相位估计"。
- 时频上下文与感受野:从"单帧/局部窗口"到"长短期序列建模"再到"全局注意力机制"。
- 计算效率与时延:从"高时延/高计算复杂度"到"低时延/超轻量化端侧部署"。
- 损失函数与生成质量:从"均方误差(MSE)导致的声音发闷(Over-smoothing)"到"生成式模型补全高频与真实细节"。
下面按照时间线与技术变革节点,详细剖析每一阶段的具体演进原因、代表架构及解决的关键痛点。
演进全景路线图
1. DNN (全连接) [2012-2015]
└── 痛点:无时序上下文、无相位估计、参数量大
↓
2. CNN / RNN / CRN [2015-2018]
└── 痛点:RNN难以并行、高采样率下计算量大、STFT固定窗口限制时延与相位
↓
3. 时域端到端 (TasNet / Conv-TasNet) [2018-2020]
└── 痛点:缺少频域先验物理解释、高采样率(48kHz)下卷积核开销骤增
↓
4. 复数域建模与双路径网络 (DCCRN / FullSubNet / DP-RNN) [2019-2022]
└── 痛点:CNN/RNN局部感受野有限、长距离依赖捕捉不足
↓
5. Attention / Transformer / Conformer (SepFormer / MossFormer / BS-RoFormer) [2020-至今]
└── 痛点:MSE损失导致低信噪比下语音发闷/音质失真(Over-smoothing)
↓
6. 生成式模型 (GAN / Diffusion / Flow Matching) (MetricGAN+ / SGMSE+ / ResFM) [2021-至今]
第一阶段:DNN(全连接神经网络)时代 (2012 -- 2015)
1. 核心架构与做法
- 做法 :基于短时傅里叶变换(STFT),输入带噪语音的幅度谱(Magnitude Spectrum)或其拼接的邻近帧窗口(如 11 帧),经过多层全连接网络(MLP),预测干净语音的幅度谱(直接映射/Mapping)或时频掩蔽码(Masking,如 IBM、IRM)。
- 代表作 :Xu et al. (2014) A Regression Approach to Speech Enhancement Based on Deep Neural Networks.
2. 为什么演进?(DNN 的致命痛点)
- 完全忽略相位(Phase-Blind) :
- 在合成语音时,直接复用了带噪语音的相位(Noisy Phase)。在低信噪比(SNR)或非平稳噪声下,带噪相位破坏严重,导致合成出的语音存在明显的残余噪声和"相位失真"带来的伪影。
- 缺乏时序依赖建模(No Temporal Modeling) :
- 全连接层将每一帧(或固定小窗口)视为独立样本,无法利用语音信号较长的时间上下文(如上下文音素关联)和动态噪声变化趋势。
- 丢失 2D 局部频域特征(No Spatial-Frequency Locality) :
- 将 2D 的时频图展开为 1D 向量输入 MLP,打碎了频域上的谐波结构(Harmonics)和相邻频带的局部相关性,且参数量巨大。
第二阶段:CNN、RNN 与 CRN 时代 (2015 -- 2018)
1. 核心架构与做法
- RNN / LSTM / GRU:利用循环神经网络建模长距离时间序列上下文。
- CNN / FCN:利用 2D 卷积捕捉时频图上的局部平移不变性与谐波结构。
- CRN (Convolutional Recurrent Network):CNN Encoder + LSTM/GRU Bottleneck + CNN Decoder 的经典编码器-解码器结构(UNet 变体)。
2. 为什么演进?(解决了什么,带来了什么新问题)
- 解决的痛点 :
- 上下文建模:LSTM 引入了显式的记忆机制,极大提升了对非平稳噪声(如突发噪音、人声干扰)的抑能力。
- 参数效率与频域结构:CNN 通过权值共享,大幅减少了参数量,同时有效保留了语音的谐波特征。
- 产生的新痛点 / 瓶颈 :
- RNN 无法并行化训练:RNN 的一步步递归特性导致 GPU 并行训练效率低,且长序列上容易出现梯度消失/爆炸。
- 依然受限于 STFT 与相位问题:此阶段绝大多数网络仍只处理幅度谱,未从根本上解决相位失真问题。
第三阶段:时域端到端(Time-Domain End-to-End)突破 (2018 -- 2020)
1. 核心架构与做法
- 思路 :彻底抛弃 STFT 变换,直接输入 1D 原始波形(Raw Waveform)。
- 代表作 :TasNet, Conv-TasNet (Luo & Mesgarani), DPRNN-TasNet。
- 结构 :
- Encoder:1D 卷积(学习出一套可训练的自适应基函数,取代固定的三角函数基底)。
- Separation Network:TCN(Temporal Convolutional Network,膨胀卷积)或 DPRNN。
- Decoder:1D 转置卷积(将特征向量还原回 1D 波形)。
2. 为什么演进?(时域革命的具体原因)
- 隐式绕过相位问题 :
- 直接在波形域操作,网络学习到的自适应变换包含了幅度与相位的综合信息,重建时无需再手动拼接带噪相位。
- 极低算法时延(Low Latency) :
- STFT 需要较长的窗长(如 20ms--32ms)才能保证足够的频域分辨率。
- 1D 卷积编码器可以将帧长/步长缩短至 2ms(甚至 16 个采样点),这对于实时通信、蓝牙耳机、助听器等对时延极其敏感的场景是决定性的突破。
- 解除正弦基函数的假设限制 :
- 传统 STFT 假设信号在窗内平稳,而数据驱动的自适应基函数在处理瞬态噪声或语音起始段时表现出更好的表征能力。
3. 时域模型的后续局限性
- 缺乏可解释性:学习到的 1D 滤波器组难以分析物理含义。
- 高采样率下计算量暴涨:当语音采样率从 8kHz/16kHz 提升到 48kHz(全频带高清语音)时,1D 卷积的帧长极小导致序列长度指数级增长,计算开销巨大。
第四阶段:复数域建模与双路径网络 (2019 -- 2022)
为了克服时域模型在高采样率下的计算开销,同时解决传统频域模型的相位丢失问题,研究者们重回 STFT 频域,但引入了复数域建模(Complex-Domain Modeling)。
1. 核心架构与做法
- 复数域建模 :
- 代表作 :DCUnet (Deep Complex UNet), DCCRN (Deep Complex Convolution Recurrent Network), DeepFilterNet。
- 机制:显式处理 STFT 的实部(Real)和虚部(Imaginary),或者预测复数掩蔽码(Complex Ratio Mask, CRM)。采用复数卷积(Complex Convolution)和复数 LSTM。
- 双路径/子带建模(Dual-Path / Sub-band) :
- 代表作:DP-RNN, FullSubNet, DPTNet。
- 机制:将 2D 时频图切分为时间轴和频率轴,分别交替进行内层(Intra-chunk,频域)和外层(Inter-chunk,时域)的序列建模,降维打击高复杂度。
2. 为什么演进?(复数域与双路径的原因)
- 理论完备的相位与幅度协同恢复 :
- 证明了复数掩蔽(CRM)可以同时精确纠正幅度谱和相位角,且在频域保留了天然的语音声学先验(如基频、共振峰)。
- 高性能与计算量的完美平衡 :
- 相较于时域模型在 48kHz 下的吃力表现,复数频域模型(如 DeepFilterNet、DCCRN)能够以极低计算量(< 1 GFLOPs / Mflops)在移动端/PC端实现高质量 48kHz 实时降噪。
第五阶段:Attention、Transformer 与 Conformer 时代 (2020 -- 至今)
1. 核心架构与做法
- 引入自注意力机制(Self-Attention):利用 Transformer / Conformer 架构替代或增强 RNN/CNN,显式建模全局上下文。
- 代表作 :SepFormer, SGM-MSE, MossFormer, BS-RoFormer (Band-Split RoFormer)。
- 双路径/分频带 Transformer:针对 2D 时频图应用 Time-Attention 与 Frequency-Attention,配合旋转位置编码(RoPE)。
2. 为什么演进?(取代 RNN/CNN 的驱动力)
- 无损长距离依赖(Infinite Receptive Field) :
- CNN 受限于卷积核感受野,RNN 随着时间推移会出现信息衰减/遗忘。Self-Attention 允许语音中的任意两个时间步或频带直接交互,能够精准捕捉长时段的语境信息与背景噪声模式。
- 高效的并行化训练 :
- 彻底摆脱了 RNN 的串行瓶颈,支持大规模数据集(数万小时)上的高效分布式并行训练。
- Conformer 的局部与全局互补 :
- 结合了 CNN(捕捉局部细微语音结构)与 Transformer(捕捉全局上下文),成为目前 SOTA(State-of-the-Art)模型的基础主干架构。
第六阶段:生成式模型 (GAN / Diffusion / Flow Matching) (2021 -- 至今)
尽管之前的判别式模型(Discriminative Models)指标(如 PESQ, SI-SDR)已经非常高,但人们发现了一个致命现象:模型听起来语音发闷、高频缺失、甚至有"幻影音"或蜂鸣伪影。
1. 核心架构与做法
- GAN-based SE:MetricGAN+, CMGAN(引入判别器指导语音感知质量优化)。
- Diffusion / Score-based SE:SGMSE+, CDiffuSE, AudioSR(利用条件扩散模型,从随机噪声或带噪语音逐步逆扩散去噪)。
- Flow Matching / Optimal Transport:ResFM(利用连续流匹配实现极简迭代步数的超高质量生成)。
2. 为什么演进?(生成式范式演进的深层本质)
- 解决 MSE / L1 / L2 损失的"过度平滑(Over-smoothing)"问题 :
- 传统模型采用 L1/L2 损失,在数学上等价于求解条件期望 EY∣X\mathbb{E}Y\|XEY∣X。
- 在低信噪比(SNR < 0dB)或强遮挡下,由于目标的不确定性高,模型倾向于输出"所有可能干净语音的平均值",导致高频细节被抹平、语音发闷、丢失清音(Fricatives)和清辅音。
- 从"确定性映射"到"条件概率分布采样" :
- 生成式模型学习的是条件概率分布 P(Speech∣Noisy)P(\text{Speech}|\text{Noisy})P(Speech∣Noisy)。
- 即使高频或原声信息被噪声完全淹没,扩散模型/流匹配也能凭空合成/补全出符合声学规律的高频纹理与谐波,使增强后的语音具备媲美原声的清脆度和自然度(Naturalness)。
总结:架构演进对比一览表
| 演进阶段 | 代表模型 | 核心特征 | 解决的主要痛点 | 局限性 / 缺点 |
|---|---|---|---|---|
| 1. DNN (MLP) | Xu et al. (2014) | 幅度谱 1D 映射 | 开启深度学习语音增强先河 | 无相位建模、无时序依赖、参数冗余 |
| 2. CRN / LSTM | CRN, LSTM-SE | 2D 卷积 + RNN 瓶颈 | 引入时频局部特征与时序上下文 | 依然缺乏相位估计;RNN 训练难以并行 |
| 3. 时域端到端 | Conv-TasNet | 1D 自适应卷积波形域 | 隐式解决相位问题;极低算法时延 | 缺乏可解释频域先验;高采样率下开销大 |
| 4. 复数域 / 双路径 | DCCRN, DeepFilterNet | 复数掩蔽 (CRM) / 子带 | 显式建模相位与幅度;高采样率下低计算量 | 感受野仍受限于 RNN/CNN 结构 |
| 5. Transformer | BS-RoFormer | Self-Attention / Conformer | 全局感受野;高并行化;极高指标上限 | 计算复杂度随序列长度呈二次方增加 |
| 6. 生成式模型 | SGMSE+, ResFM | 扩散模型 / 流匹配 / GAN | 解决低信噪比下发闷问题;生成自然高频 | 推理步数多(扩散模型),实时性挑战大 |
总结展望
语音增强的架构演进不是孤立的技术迭代,而是声学物理先验 与深度学习表征能力 不断博弈与融合的过程。目前的工业界与学术界呈现出"判别式轻量模型(复数域/Conformer)负责端侧实时通信,生成式模型(Flow Matching/Diffusion)负责离线修复与超高清重构"的双轨并行格局。