【Audio】Audio encoder相关Benchmark

note

文章目录

  • note
  • [一、Audio encoder相关Benchmark](#一、Audio encoder相关Benchmark)
  • [二、MAEB Benchmark](#二、MAEB Benchmark)

一、Audio encoder相关Benchmark

Benchmark 评估什么 适合你们用来判断什么
HEAR Benchmark 通用音频表征,覆盖 speech、environmental sound、music 等多个领域 判断一个 audio embedding 是否泛化好
AudioSet 大规模音频事件分类,常用 mAP 判断模型对环境声、音乐、事件声的理解能力
ESC-50 环境声音分类 判断对常见环境声是否强
MAEB 新的大规模音频 embedding benchmark,覆盖 speech、music、environmental sound、audio-text reasoning、多语言 更系统地比较音频 embedding 模型
DCASE Audio Retrieval / Audio Captioning tasks 音频-文本检索/音频语义理解 判断 CLAP 这类 audio-text 模型是否适合语义检索

HEAR 的目标就是评估"什么 audio embedding 能泛化到多种下游音频任务",覆盖 speech、environmental sound、music,并且是 NeurIPS 2021 shared challenge 发展出来的 benchmark。

二、MAEB Benchmark

MAEB 是 2026 年提出的 Massive Audio Embedding Benchmark,覆盖 30 个任务、speech/music/environmental sound/audio-text reasoning、100+ 语言,并评估 50+ 模型;它还指出没有单一模型在所有任务上都最强,audio-text 对比模型擅长环境声分类,但在多语言语音任务上可能很弱。

链接:https://huggingface.co/blog/AdnanElAssadi/maeb

leaderboard:https://mteb-leaderboard.hf.space/benchmark/MAEB(beta)

相关推荐
Y幽谷客6 小时前
Python加载本地大模型(Qwen3.5 8B)
python·大模型
浅安的邂逅7 小时前
260918-白帽把 OpenAI 论坛“打穿“了:攻防赛漏洞、账户被 Claude 入侵、模型偷偷掩盖不当行为
人工智能·大模型·ai编程·ai模型·行业动态
slacker-kian8 小时前
本地大模型 + 自建 MCP Server + SAP OData:让 LLM 代理 SAP 业务操作
大模型·llm·sap·agent·mcp·odata
leoZ2319 小时前
第 10 篇 数据飞轮与冷启动:AI 产品的数据从哪来
人工智能·大模型·agent
镭封11 小时前
短剧多人对白怎么配?一人完成多角色配音的办法
人工智能·音视频·语音识别·媒体
海带紫菜菠萝汤12 小时前
本周 AI 观察:嘴上喊着降速,手上全踩油门
人工智能·深度学习·ai·开源·大模型
技灵AI13 小时前
Wan 3.0 API怎么做多参考商品视频?从图片、视频、音频分工到30秒交付
人工智能·prompt·aigc·音视频·wan 3.0
赛博仓鼠14 小时前
MiniMax H3 实测:8GB显存跑2K视频+原生音频,开源视频生成的新卷王
开源·aigc·音视频