基于杰理AC7016C的GTCRN门控卷积神经网络语音增强方法

AEC ANS AGC ASR 已部署到AC7016, 其中ANS采用GTCRN 方法

GTCRN(Grouped Temporal Convolutional Recurrent Network)是一种专为边缘计算设计的超轻量级语音增强模型。

简单来说,它是一个能在资源有限的设备(如蓝牙耳机、会议音响)上运行的AI降噪算法,可以实时去除音频中的背景噪声。

🚀 核心优势:极致轻量与高性能

GTCRN最大的特点是在极低的算力消耗下,实现了优秀的降噪效果,使其非常适合嵌入式设备部署。

  • 极致轻量 :模型大小仅约 48K 参数,远小于常见的深度学习模型。

  • 超低计算量 :每秒仅需 3300万次乘加运算 (33.0 MMACs)。

  • 性能出色 :性能显著超越了同量级的经典算法(如RNNoise),并与计算量高得多的模型(如DeepFilterNet)表现相当。

模型 参数量 (M) 计算量 (MACs) 语音质量(PESQ)
GTCRN 0.02 0.04 G/s 2.87
RNNoise (2018) 0.06 0.04 G/s 2.29
DeepFilterNet (2022) 1.80 0.35 G/s 2.81

⚙️ 技术原理:三大核心设计

GTCRN通过精巧的架构设计,在保持轻量的同时保证了降噪效果。

  • 门控时序卷积 (Gated TCN) :这是模型的基石。它使用膨胀因果卷积 来扩大"视野",并引入门控机制来智能判断并过滤掉噪声。

  • 分组策略 (Grouped Strategy) :这是"Grouped"的由来,通过将网络分组处理,进一步降低了计算量和参数数量。

  • 轻量级循环网络:采用优化后的轻量级LSTM,有效处理语音中的长时依赖关系,保证语音的自然流畅。

💡 应用场景与资源

  • 理想场景 :GTCRN非常适合蓝牙耳机、智能音箱、会议系统、车载语音等对功耗和算力有严格要求的场景。

  • 如何获取:你可以从以下渠道获取资源:

    • 官方代码 :GitHub - Xiaobin-Rong/gtcrn

    • 学术论文 :该成果发表于ICASSP 2024,是语音领域的顶级会议。

    • ONNX部署 :项目已集成到 sherpa-onnx,方便在更多设备上部署

相关推荐
张小姐的猫1 分钟前
【AI大模型接入SDK】 —— 前端页面 & 项目总结与拓展
前端·数据结构·数据库·c++·人工智能·chatgpt
兴通物联科技2 分钟前
对俄出口诚实标识 2026 时间节点与产线赋码采集技术方案
大数据·服务器·单片机·嵌入式硬件·深度学习·计算机视觉
u0111026753 分钟前
网页图片编辑器如何添加文字:字体、换行与导出一致性
图像处理·人工智能·ai作画·编辑器
IvorySQL3 分钟前
去 IOE 的最后一公里:IvorySQL 5.4 × RISC-V 实测
数据库·人工智能·ai·postgresql·risc-v
吴佳浩9 分钟前
走向 Memory OS:企业私有化 Agent 设计与实现
人工智能·agent·ai编程
lingchen190610 分钟前
“pytorch安装时与本地电脑NVIDIA 显卡驱动不匹配导致安装的pytorch无法使用”情况的解决教程
人工智能·pytorch·电脑
我的愿望是成为富婆11 分钟前
HR数字化校招技术栈拆解:SQL、Excel、Power BI和AI工具在2026届JD中的真实权重
人工智能·sql·excel
禹凕12 分钟前
机器学习之数据清洗(Machine Learning about Data Cleaning)
人工智能·爬虫·python·机器学习·数据挖掘
写bug如流水12 分钟前
【LLM】Qwen3.5 35B A3B 单卡 RTX 3090 部署教程
人工智能·llama