【Audio】Audio encoder相关Benchmark

note

文章目录

  • note
  • [一、Audio encoder相关Benchmark](#一、Audio encoder相关Benchmark)
  • [二、MAEB Benchmark](#二、MAEB Benchmark)

一、Audio encoder相关Benchmark

Benchmark 评估什么 适合你们用来判断什么
HEAR Benchmark 通用音频表征,覆盖 speech、environmental sound、music 等多个领域 判断一个 audio embedding 是否泛化好
AudioSet 大规模音频事件分类,常用 mAP 判断模型对环境声、音乐、事件声的理解能力
ESC-50 环境声音分类 判断对常见环境声是否强
MAEB 新的大规模音频 embedding benchmark,覆盖 speech、music、environmental sound、audio-text reasoning、多语言 更系统地比较音频 embedding 模型
DCASE Audio Retrieval / Audio Captioning tasks 音频-文本检索/音频语义理解 判断 CLAP 这类 audio-text 模型是否适合语义检索

HEAR 的目标就是评估"什么 audio embedding 能泛化到多种下游音频任务",覆盖 speech、environmental sound、music,并且是 NeurIPS 2021 shared challenge 发展出来的 benchmark。

二、MAEB Benchmark

MAEB 是 2026 年提出的 Massive Audio Embedding Benchmark,覆盖 30 个任务、speech/music/environmental sound/audio-text reasoning、100+ 语言,并评估 50+ 模型;它还指出没有单一模型在所有任务上都最强,audio-text 对比模型擅长环境声分类,但在多语言语音任务上可能很弱。

链接:https://huggingface.co/blog/AdnanElAssadi/maeb

leaderboard:https://mteb-leaderboard.hf.space/benchmark/MAEB(beta)

相关推荐
绵满3 小时前
"Mem2Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation" 论文笔记
大模型·智能体记忆
敢敢のwings5 小时前
Wan2.2 模型系统解读:从视频扩散到 WAM 世界模型模块
音视频
Web3&Basketball5 小时前
从0到1落地多模态表格/发票结构化识别:踩坑全记录
深度学习·大模型·ai技术
小猴子爱上树7 小时前
跨境电商AI批量图片翻译工具,视频字幕翻译免费试用
人工智能·python·音视频
AI服务老曹7 小时前
车牌识别算法接入AI视频分析平台的流程和误报优化
人工智能·算法·音视频
thesky1234568 小时前
27届大模型面试准备(六十六):大模型推理调度与弹性扩缩容工程——排队、优先级、抢占与弹性
大模型·抢占·连续批处理·推理调度·请求优先级·弹性扩缩容·chunked prefill
深念Y9 小时前
视频平台架构重构:从微服务到可插拔基础设施
后端·微服务·云原生·架构·rabbitmq·音视频·rocketmq
深念Y10 小时前
06-移动端三技术栈优劣对比-理论推演
服务器·云原生·架构·音视频·短视频
FFZero110 小时前
[mpv架构] (三) mpv 怎么实现 MP4 秒开?
c++·音视频·mpv