【Audio】Audio encoder相关Benchmark

note

文章目录

  • note
  • [一、Audio encoder相关Benchmark](#一、Audio encoder相关Benchmark)
  • [二、MAEB Benchmark](#二、MAEB Benchmark)

一、Audio encoder相关Benchmark

Benchmark 评估什么 适合你们用来判断什么
HEAR Benchmark 通用音频表征,覆盖 speech、environmental sound、music 等多个领域 判断一个 audio embedding 是否泛化好
AudioSet 大规模音频事件分类,常用 mAP 判断模型对环境声、音乐、事件声的理解能力
ESC-50 环境声音分类 判断对常见环境声是否强
MAEB 新的大规模音频 embedding benchmark,覆盖 speech、music、environmental sound、audio-text reasoning、多语言 更系统地比较音频 embedding 模型
DCASE Audio Retrieval / Audio Captioning tasks 音频-文本检索/音频语义理解 判断 CLAP 这类 audio-text 模型是否适合语义检索

HEAR 的目标就是评估"什么 audio embedding 能泛化到多种下游音频任务",覆盖 speech、environmental sound、music,并且是 NeurIPS 2021 shared challenge 发展出来的 benchmark。

二、MAEB Benchmark

MAEB 是 2026 年提出的 Massive Audio Embedding Benchmark,覆盖 30 个任务、speech/music/environmental sound/audio-text reasoning、100+ 语言,并评估 50+ 模型;它还指出没有单一模型在所有任务上都最强,audio-text 对比模型擅长环境声分类,但在多语言语音任务上可能很弱。

链接:https://huggingface.co/blog/AdnanElAssadi/maeb

leaderboard:https://mteb-leaderboard.hf.space/benchmark/MAEB(beta)

相关推荐
卷心菜的学习路1 小时前
基于多模态向量检索的数学相似题推荐系统:完整设计、算法与实验
java·python·算法·大模型·推荐算法·数学相似题
thesky1234562 小时前
27届大模型面试准备(二十一):MoE 架构全攻略——稀疏激活、路由、负载均衡与专家并行
大模型·负载均衡·moe·deepseek·混合专家·专家并行·稀疏激活
tachibana23 小时前
知识库文档上传接口
数据库·人工智能·大模型·llm
小猴子爱上树3 小时前
跨境图片翻译工具,批量处理商品图视频字幕
python·音视频
2301_805962933 小时前
在昉星光2(RISC-V)上构建每日短视频自动生成器
音视频·risc-v
xyz_CDragon4 小时前
MiniMax H3 vs Seedance 2.5 vs Kling 3.0:2026 AI视频生成模型横评(排行榜+价格+开源实测)
人工智能·开源·音视频·transformer·minmax h3
@Mr_LiuYang4 小时前
《深入理解 AI Agent:设计原理与工程实践 》实验2-2 2-7 大模型注意力权重分布可视化
人工智能·大模型·agent·注意力机制
程序员老陆4 小时前
FFmpeg libswresample 模块的关键函数swr_convert 到底在干嘛?
ffmpeg·音视频·格式转换·音频重采样
csdnfanguyinheng5 小时前
端到端加密音视频通话系统
音视频
show43316 小时前
2026小程序端视频转文字技术对比:识别引擎精度实测
小程序·音视频