基于杰理AC7016C的GTCRN门控卷积神经网络语音增强方法

AEC ANS AGC ASR 已部署到AC7016, 其中ANS采用GTCRN 方法

GTCRN(Grouped Temporal Convolutional Recurrent Network)是一种专为边缘计算设计的超轻量级语音增强模型

简单来说,它是一个能在资源有限的设备(如蓝牙耳机、会议音响)上运行的AI降噪算法,可以实时去除音频中的背景噪声。

🚀 核心优势:极致轻量与高性能

GTCRN最大的特点是在极低的算力消耗下,实现了优秀的降噪效果,使其非常适合嵌入式设备部署。

  • 极致轻量 :模型大小仅约 48K 参数,远小于常见的深度学习模型。

  • 超低计算量 :每秒仅需 3300万次乘加运算 (33.0 MMACs)

  • 性能出色 :性能显著超越了同量级的经典算法(如RNNoise),并与计算量高得多的模型(如DeepFilterNet)表现相当。

模型 参数量 (M) 计算量 (MACs) 语音质量(PESQ)
GTCRN 0.02 0.04 G/s 2.87
RNNoise (2018) 0.06 0.04 G/s 2.29
DeepFilterNet (2022) 1.80 0.35 G/s 2.81

⚙️ 技术原理:三大核心设计

GTCRN通过精巧的架构设计,在保持轻量的同时保证了降噪效果。

  • 门控时序卷积 (Gated TCN) :这是模型的基石。它使用膨胀因果卷积 来扩大"视野",并引入门控机制来智能判断并过滤掉噪声。

  • 分组策略 (Grouped Strategy) :这是"Grouped"的由来,通过将网络分组处理,进一步降低了计算量和参数数量

  • 轻量级循环网络:采用优化后的轻量级LSTM,有效处理语音中的长时依赖关系,保证语音的自然流畅。

💡 应用场景与资源

  • 理想场景 :GTCRN非常适合蓝牙耳机、智能音箱、会议系统、车载语音等对功耗和算力有严格要求的场景。

  • 如何获取:你可以从以下渠道获取资源:

    • 官方代码GitHub - Xiaobin-Rong/gtcrn

    • 学术论文 :该成果发表于ICASSP 2024,是语音领域的顶级会议。

    • ONNX部署 :项目已集成到 sherpa-onnx,方便在更多设备上部署

相关推荐
LaughingZhu3 小时前
Product Hunt 每日热榜 | 2026-08-18
人工智能·经验分享·深度学习·神经网络·产品运营
科技快报3 小时前
CANN全面开源开放 共赢AI技术生态
人工智能
阿里云大数据AI技术3 小时前
阿里云PAI发布通用蒸馏框架EasyDistill2.0,提供主流大模型蒸馏场景最佳实践
人工智能·agent
ZJU_统一阿萨姆3 小时前
【推理优化进阶】图编译与运行时:动态形状、CUDA Graph 与内存规划
开发语言·人工智能·语言模型·架构·开源
乐之者v3 小时前
AI人工智能--DeepSeek Harness 选择哪种模式?
人工智能·ai
大力财经4 小时前
百度Q2财报:AI业务占比过半 GPU云强劲增长283%
人工智能
桃西西呀4 小时前
Cordis 内核到底在管什么?五要素我带你看源码
人工智能
Jackson~Y4 小时前
豆包在抖音场景下的智能创作效果实测
人工智能
iNeuOS工业互联网4 小时前
iNeuOS_Vision_视觉分析,增加SAM3模型对实例分割和目标检测AI自动标注图片样本功能
人工智能·算法·目标检测