【声音场景分类--论文阅读】

1.基于小波时频图特征在声音场景分类

基于小波时频图特征在声音场景分类任务中的表现

2.增强增强高效音频分类网络

https://arxiv.org/pdf/2204.11479v5

https://github.com/Alibaba-MIIL/AudioClassfication

音频分类网络如图4所示。在此阶段,主要重点是建立一个神经网络具有较大的感受野,同时保持较低的复杂性。可以将网络分解为两个主块、1D卷积堆栈和变换器编码器块。前者沿时间轴进行降采样

其中卷积层耦合到固定低通滤波器29,30,然后是间歇残差块18。这个残差块根据31进行修改,由深度卷积和大核操作组成f(x)是跨通道操作的核大小等于1的卷积。此时,信号

使用一系列因子di除以总因子d进行抽取=Qdi例如,5秒的信号下采样序列的持续时间等于4,4,4,4,执行256倍的缩减。这可能是为了在某种程度上与频谱图操作期间进行的下采样有关。以下构建块执行进一步减少,每次减少后都有一堆扩张的残余块32。这种改进能够提高在每帧的感受野中,因此对环境类中的可变持续时间事件更具鲁棒性声音场景。使用变压器编码器块实现了跨帧收集特征图,该块然后是全连接层,将嵌入向量投影到类空间。

3.PANNs:大规模预训练音频神经网络音频模式识别

https://arxiv.org/pdf/1912.10211v5

https://github.com/qiuqiangkong/audioset_tagging_cnn

Wavegram CNN和Wavegram Logmel CNN for AudioSet标签。我们提出的Wavegram CNN是一个时域音频标签系统。Wavegram是我们提出的一个功能这类似于log-mel频谱图,但使用神经网络。波形图被设计用来学习傅里叶变换的时频表示转变。波形图具有时间轴和频率轴。频率模式对于音频模式识别很重要,例如,具有不同音高偏移的声音属于同一个班级。波形图旨在学习频率一维CNN中可能缺少的信息系统。波形图也可能比手工制作的原木更好通过学习一种新的时频来获得mel谱图从数据转换。然后,波形图可以代替log-mel光谱图作为输入特征,形成我们的WavegramCNN系统。我们还结合了Wavegram和log-mel频谱图作为构建Wavegram-LogmelCNN系统的新功能.

相关推荐
嫂子开门我是_我哥1 小时前
青少年抑郁、焦虑、失眠与自杀相关表现的症状联系:一篇网络分析论文所使用的算法深度解读
论文阅读·算法·论文笔记
OCR_1337162127520 小时前
智能交通底层逻辑:国内车牌分类规范与AI识别适配技术解析
大数据·人工智能·分类
专注API从业者1 天前
告别复杂页面解析,OpenClaw 快速搭建电商商品监控与数据分析脚本
大数据·数据库·python·数据挖掘·数据分析
一只专注api接口开发的技术猿1 天前
Open‑Claw 实战|告别页面逆向,快速搭建电商商品监控与数据分析完整方案
大数据·数据库·python·数据挖掘·数据分析
Rocky Ding*1 天前
VideoChat3 深度解析:视频理解的效率,来自时空压缩与主动感知的共同设计
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·视频理解
嫂子开门我是_我哥1 天前
青少年抑郁、焦虑、失眠与自杀相关表现的症状联系:一篇网络分析论文的深度解读
论文阅读·论文笔记
lisw051 天前
大数据对大数据挖掘及其处理框架带来的挑战
大数据·人工智能·数据挖掘
xhy_07071 天前
AI 读了 .env,密钥会原样发给大模型吗?WES Code 的密钥打码(附实测)
人工智能·python·数据挖掘·flask·ai编程·wes code
FPGA信号处理1 天前
【模式识别】第三节课:分类误差的来源与线性分类器
人工智能·分类·数据挖掘
Curious*2 天前
意识障碍研究-论文阅读2
论文阅读