【LLM 论文】CREA-ICL:利用跨语言检索来增强小语种的 ICL 能力

论文:From Classification to Generation: Insights into Crosslingual Retrieval Augmented ICL

⭐⭐⭐⭐

NeurIPS 2023, arXiv:2311.06595

文章目录

    • 论文速读
    • 总结

论文速读

有很多外国语言因为其语言复杂性、标记数据集的缺乏以及数据重复等问题,LLM 在这些低资源语言上的 instruction-following 的能力会变差,进而限制它们的 In-Context Learning(ICL)的表现。

为了解决低资源语言(如孟加拉语)在大型语言模型(LLMs)的上下文学习(ICL)性能受限的问题,本文提出了跨语言检索增强的上下文学习 (CREA-ICL),其思路是:对于一个低资源语言的 input test q q q,使用 embedding encoder 将其映射到一个 shared embedding space 中,然后利用 cosine similarity 计算它与高资源语言的 corpus 的文档相似度,从中检索出 top-k 个文档,然后利用 prompt 把这些高资源语言作为 ICL 的 exemplars,实现让 LLM 去解决 input test 的问题。

框架图示如下:

上图是一个对孟加拉语的问题做情感分类的示例。Telugu input 是一个孟加拉语表述的文本,首先会通过 Cross-Lingual Retriever 从高资源语言的 corpus 中检索出 k 个最相关的英文 samples,根据 sample 是否存在 label:

  • 如果有 label,那就使用这个 label
  • 如果没有 label,那就使用 self-prediction 让 LLM 生成一个 label

然后把 (English sample, label) 作为 ICL 的 exemplars,通过 prompt 让 LLM 去解决 Telugu input 文本的情感分类问题。

总结

论文提出的方法的思路都在这个图中了,看懂这个图就可以看懂这个方法了。

这篇论文讨论了一个常见问题:低资源语言该如何利用好 LLM 的各项能力。因为中文和英文的语料较多,导致了 LLM 能够表现不错,但对于很多小语种来说,资料的缺乏可能会让 LLM 在某些能力上出现缺失,通过跨语言检索也许能解决其中的一些问题。

相关推荐
饼干哥哥5 小时前
重生之我是导演:爆改成「牛来版」黑客帝国?附3D预演台保姆级教程!
人工智能·后端·深度学习
Bruce_Liuxiaowei5 小时前
自动化渗透测试——用AI构建自动化渗透测试流程
运维·人工智能·自动化
AI导出鸭5 小时前
怎么让Claude做表格?AI导出鸭苹果版将Claude输出的Markdown表格或结构化列表智能解析为二维数据,一键导出Excel/Word标准表格。
人工智能·chatgpt·word·excel·ai导出鸭
ACP广源盛139246256735 小时前
Qwen3.8‑2.4T 开源落地@ACP#国产 MoE 大模型私有化部署中 MST 多屏转换芯片 GSV2231 硬件价值与应用场景
大数据·数据库·人工智能·嵌入式硬件
夏雪coding5 小时前
openpyxl 对账实战:金额浮点、前导零丢失、20 位单号科学计数法
人工智能·后端
网易云信6 小时前
7 天,52 个 AI 员工“上岗”了|帝王蟹 AI 实战训练营首期收官
人工智能·线下活动
满怀冰雪6 小时前
21-图像分类实战:从 MNIST 到 CIFAR-10
人工智能·python·深度学习·分类·数据挖掘·paddlepaddle
RobinDevNotes6 小时前
K8s+DeepSpeed+vLLM打通大模型训练到上线全链路
人工智能
盖伦发发6 小时前
RAG 能跑≠能用:用 EDD 把 Eval 做成基础设施 (附源码)
人工智能·后端·python·功能测试
宋哥转AI6 小时前
深入理解 AI Agent · MEMORY #03:从设计到落地
人工智能·agent·ai编程