AEC ANS AGC ASR 已部署到AC7016, 其中ANS采用GTCRN 方法
GTCRN(Grouped Temporal Convolutional Recurrent Network)是一种专为边缘计算设计的超轻量级语音增强模型。
简单来说,它是一个能在资源有限的设备(如蓝牙耳机、会议音响)上运行的AI降噪算法,可以实时去除音频中的背景噪声。
🚀 核心优势:极致轻量与高性能
GTCRN最大的特点是在极低的算力消耗下,实现了优秀的降噪效果,使其非常适合嵌入式设备部署。
-
极致轻量 :模型大小仅约 48K 参数,远小于常见的深度学习模型。
-
超低计算量 :每秒仅需 3300万次乘加运算 (33.0 MMACs)。
-
性能出色 :性能显著超越了同量级的经典算法(如RNNoise),并与计算量高得多的模型(如DeepFilterNet)表现相当。
| 模型 | 参数量 (M) | 计算量 (MACs) | 语音质量(PESQ) |
|---|---|---|---|
| GTCRN | 0.02 | 0.04 G/s | 2.87 |
| RNNoise (2018) | 0.06 | 0.04 G/s | 2.29 |
| DeepFilterNet (2022) | 1.80 | 0.35 G/s | 2.81 |
⚙️ 技术原理:三大核心设计
GTCRN通过精巧的架构设计,在保持轻量的同时保证了降噪效果。
-
门控时序卷积 (Gated TCN) :这是模型的基石。它使用膨胀因果卷积 来扩大"视野",并引入门控机制来智能判断并过滤掉噪声。
-
分组策略 (Grouped Strategy) :这是"Grouped"的由来,通过将网络分组处理,进一步降低了计算量和参数数量。
-
轻量级循环网络:采用优化后的轻量级LSTM,有效处理语音中的长时依赖关系,保证语音的自然流畅。
💡 应用场景与资源
-
理想场景 :GTCRN非常适合蓝牙耳机、智能音箱、会议系统、车载语音等对功耗和算力有严格要求的场景。
-
如何获取:你可以从以下渠道获取资源:
-
学术论文 :该成果发表于ICASSP 2024,是语音领域的顶级会议。
-
ONNX部署 :项目已集成到
sherpa-onnx,方便在更多设备上部署