大语言模型-文本检索任务基准 BEIR

BEIR

(A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models)

文本检索任务的基准,使用18 个数据集为检索系统的零样本评估提出了一个标准化基准, BEIR 基准上在9个不同领域的检索任务评估 10 种不同的检索方法

九个不同领域的检索任务,如下:

  • 1、事实核查(Fact checking)
  • 2、引文预测(Citation prediction)
  • 3、重复问题检索(Duplicate question retrieval)
  • 4、论据检索(Argument retrieval)
  • 5、新闻检索(News retrieval)
  • 6、问题回答(Question Answering)
  • 7、推文检索(Tweet retrieval)
  • 8、生物医学检索(Bio-Medical IR)
  • 9、实体检索(Entity retrieval)

BEIR来评估来自五大架构的十种不同的检索方法,其中的五大架构如下:

  • 1、词法(lexical)
  • 2、稀疏(sparse)
  • 3、密集(dense)
  • 4、后期交互(late interaction)
  • 5、重排序(re-ranking)

BEIR来评估的十种不同的检索方法,如下:

  1. BM25 (Anserini) https://github.com/castorini/anserini
  2. DeepCT http://boston.lti.cs.cmu.edu/appendices/arXiv2019-DeepCT-Zhuyun-Dai/
  3. SPARTA https://huggingface.co/BeIR/sparta-msmarco-distilbert-base-v1
  4. DocT5query https://huggingface.co/BeIR/query-gen-msmarco-t5-base-v1
  5. DPR (Query) https://huggingface.co/sentence-transformers/facebook-dpr-question_encoder-multiset-base
  6. DPR (Context) https://huggingface.co/sentence-transformers/facebook-dpr-ctx_encoder-multiset-base
  7. ANCE https://huggingface.co/sentence-transformers/msmarco-roberta-base-ance-firstp
  8. TAS-B https://huggingface.co/sentence-transformers/msmarco-distilbert-base-tas-b
  9. ColBERT https://public.ukp.informatik.tu-darmstadt.de/thakur/BEIR/models/ColBERT/msmarco.psg.l2.zip
  10. MiniLM-L6 (CE) https://huggingface.co/cross-encoder/ms-marco-MiniLM-L-6-v2
(1)BEIR基准的十种不同的检索方法在领域上数据集上的表现:
(1)BEIR基准的十种不同的检索方法的性能开销

结论:

1、发现没有任何一种方法在所有的数据集上都能持续胜过其他方法。

2、一个模型的领域内性能与它的泛化能力并不相关:用相同的训练数据进行微调的模型可能会有不同的泛化能力。

3、发现性能和计算成本之间的权衡:计算成本高的模型,如重排模型和后期交互模型表现最好。更有效的方法,如基于密集或稀疏嵌入的方法,可以大大低于传统的词汇模型,如BM25的表现。

4、未来的工作需要更好的无偏见的数据集,允许对所有类型的检索系统进行公平的比较。

参考

BEIR: A Heterogeneous Benchmark for Zero-shot
Evaluation of Information Retrieval Models

相关推荐
张较瘦_1 小时前
[论文阅读] 人工智能 + 软件工程 | 需求获取访谈中LLM生成跟进问题研究:来龙去脉与创新突破
论文阅读·人工智能
一 铭2 小时前
AI领域新趋势:从提示(Prompt)工程到上下文(Context)工程
人工智能·语言模型·大模型·llm·prompt
麻雀无能为力5 小时前
CAU数据挖掘实验 表分析数据插件
人工智能·数据挖掘·中国农业大学
时序之心5 小时前
时空数据挖掘五大革新方向详解篇!
人工智能·数据挖掘·论文·时间序列
.30-06Springfield6 小时前
人工智能概念之七:集成学习思想(Bagging、Boosting、Stacking)
人工智能·算法·机器学习·集成学习
说私域7 小时前
基于开源AI智能名片链动2+1模式S2B2C商城小程序的超级文化符号构建路径研究
人工智能·小程序·开源
永洪科技7 小时前
永洪科技荣获商业智能品牌影响力奖,全力打造”AI+决策”引擎
大数据·人工智能·科技·数据分析·数据可视化·bi
shangyingying_17 小时前
关于小波降噪、小波增强、小波去雾的原理区分
人工智能·深度学习·计算机视觉
书玮嘎8 小时前
【WIP】【VLA&VLM——InternVL系列】
人工智能·深度学习
猫头虎9 小时前
猫头虎 AI工具分享:一个网页抓取、结构化数据提取、网页爬取、浏览器自动化操作工具:Hyperbrowser MCP
运维·人工智能·gpt·开源·自动化·文心一言·ai编程