【Audio】Audio encoder相关Benchmark

note

文章目录

  • note
  • [一、Audio encoder相关Benchmark](#一、Audio encoder相关Benchmark)
  • [二、MAEB Benchmark](#二、MAEB Benchmark)

一、Audio encoder相关Benchmark

Benchmark 评估什么 适合你们用来判断什么
HEAR Benchmark 通用音频表征,覆盖 speech、environmental sound、music 等多个领域 判断一个 audio embedding 是否泛化好
AudioSet 大规模音频事件分类,常用 mAP 判断模型对环境声、音乐、事件声的理解能力
ESC-50 环境声音分类 判断对常见环境声是否强
MAEB 新的大规模音频 embedding benchmark,覆盖 speech、music、environmental sound、audio-text reasoning、多语言 更系统地比较音频 embedding 模型
DCASE Audio Retrieval / Audio Captioning tasks 音频-文本检索/音频语义理解 判断 CLAP 这类 audio-text 模型是否适合语义检索

HEAR 的目标就是评估"什么 audio embedding 能泛化到多种下游音频任务",覆盖 speech、environmental sound、music,并且是 NeurIPS 2021 shared challenge 发展出来的 benchmark。

二、MAEB Benchmark

MAEB 是 2026 年提出的 Massive Audio Embedding Benchmark,覆盖 30 个任务、speech/music/environmental sound/audio-text reasoning、100+ 语言,并评估 50+ 模型;它还指出没有单一模型在所有任务上都最强,audio-text 对比模型擅长环境声分类,但在多语言语音任务上可能很弱。

链接:https://huggingface.co/blog/AdnanElAssadi/maeb

leaderboard:https://mteb-leaderboard.hf.space/benchmark/MAEB(beta)

相关推荐
VidDown3 小时前
自动给视频挑一张能看的封面:帧评分、构图与批量生成
python·ffmpeg·音视频·视频
AliCloudROS4 小时前
MiniMax-H3 视频生成模型 — 一键部署与使用指南
人工智能·音视频
孙启超4 小时前
【AI工程师精讲】04:思维链:CoT 为什么有效,以及它什么时候在骗你
人工智能·ai·大模型
揽秀亭长16 小时前
视频转脚本有哪些方法?5种方案技术拆解
人工智能·音视频
Android系统攻城狮17 小时前
Linux Gstreamer深度解析之gst_audio_sink_get_type调用流程与实战(六十五)
linux·运维·服务器·音视频·gstreamer音视频·音视频进阶·gstreamer音视频进阶
程序猿追18 小时前
HarmonyOS 6 音视频实战:用 AVPlayer 做一个本地音乐播放器
华为·音视频·harmonyos
weixin_6906547421 小时前
龙迅#LT9611EX 现MIPI转HDMI1.4功能主推型号,分辨率高达4K30HZ,IC内置I2C无需外部12C控制。
嵌入式硬件·音视频·信号处理
欣欣之王来了21 小时前
2024主流国产大模型深度对比:文心一言/通义千问/智谱AI/Qwen等选型指南
人工智能·ai·大模型
小草cys1 天前
对比一下hunyuanvideo,wan2.2, minimax h3的性能
大模型·多模态·视频生成