【Audio】Audio encoder相关Benchmark

note

文章目录

  • note
  • [一、Audio encoder相关Benchmark](#一、Audio encoder相关Benchmark)
  • [二、MAEB Benchmark](#二、MAEB Benchmark)

一、Audio encoder相关Benchmark

Benchmark 评估什么 适合你们用来判断什么
HEAR Benchmark 通用音频表征,覆盖 speech、environmental sound、music 等多个领域 判断一个 audio embedding 是否泛化好
AudioSet 大规模音频事件分类,常用 mAP 判断模型对环境声、音乐、事件声的理解能力
ESC-50 环境声音分类 判断对常见环境声是否强
MAEB 新的大规模音频 embedding benchmark,覆盖 speech、music、environmental sound、audio-text reasoning、多语言 更系统地比较音频 embedding 模型
DCASE Audio Retrieval / Audio Captioning tasks 音频-文本检索/音频语义理解 判断 CLAP 这类 audio-text 模型是否适合语义检索

HEAR 的目标就是评估"什么 audio embedding 能泛化到多种下游音频任务",覆盖 speech、environmental sound、music,并且是 NeurIPS 2021 shared challenge 发展出来的 benchmark。

二、MAEB Benchmark

MAEB 是 2026 年提出的 Massive Audio Embedding Benchmark,覆盖 30 个任务、speech/music/environmental sound/audio-text reasoning、100+ 语言,并评估 50+ 模型;它还指出没有单一模型在所有任务上都最强,audio-text 对比模型擅长环境声分类,但在多语言语音任务上可能很弱。

链接:https://huggingface.co/blog/AdnanElAssadi/maeb

leaderboard:https://mteb-leaderboard.hf.space/benchmark/MAEB(beta)

相关推荐
冷小鱼19 小时前
Agent 大模型的后训练、微调、评估与迭代优化:从理论到工程实践
大模型·微调·优化·迭代·评估
山顶夕景21 小时前
【MAE】音频自监督训练Masked Autoencoders that Listen
音视频·ssl·多模态·自监督·mae
小码哥06821 小时前
短视频后台系统架构设计与行业应用深度分析-源码-技术支持
系统架构·音视频·短视频后台·短剧后台·微剧后台
小猴子爱上树1 天前
TikTok Shop视频自动翻译工具实战教程
人工智能·python·音视频·机器翻译
山顶夕景1 天前
【DWT】计算两不等序列相似度:DWT
算法·动态规划·检索·模式识别·相似度
mzy80001 天前
AI漫剧视频生成项目——kimi自检
音视频
中微极客1 天前
视频Agent:从一次性生成到多轮编排架构
人工智能·架构·音视频
霸道流氓气质1 天前
视频预览链路三件套:ZLMediaKit · MediaMTX · FFmpeg 完全指南
ffmpeg·音视频
程序员-李俞1 天前
向量引擎接入自研 API 中转网关:鉴权、限流、熔断和审计日志复盘
服务器·人工智能·大模型·api·ai编程·ai api
霸道流氓气质1 天前
摄像头视频预览实现教程:从原理到落地(ZLMediaKit+ flv.js+ Spring Boot)
javascript·spring boot·音视频