What Makes Pre-trained Language Models Better Zero-shot Learners?

本文是LLM系列文章,针对《What Makes Pre-trained Language Models Better Zero-shot Learners?》的翻译。

是什么让经过预训练的语言模型更好地成为零样本学习者?

  • 摘要
  • [1 引言](#1 引言)
  • [2 前言](#2 前言)
  • [3 假设](#3 假设)
  • [4 方法](#4 方法)
  • [5 前导性研究](#5 前导性研究)
  • [6 实验](#6 实验)
  • [7 讨论](#7 讨论)
  • [8 结论](#8 结论)
  • [9 局限性](#9 局限性)

摘要

当前在零样本场景中进行提示学习的方法广泛依赖于具有足够的人工注释数据的开发集,以事后选择性能最佳的提示模板。这并不理想,因为在现实世界中具有实际相关性的零样本场景中,没有标记的数据可用。因此,我们提出了一种简单而有效的方法来筛选零样本文本分类中合理的提示模板:困惑选择(Perption)。我们假设语言差异可以用来衡量提示模板的效果,从而开发出一个基于困惑的方案,可以提前预测提示模板的性能。实验表明,我们的方法在现实的零样本设置中提高了预测性能,消除了对任何标记示例的需要。

1 引言

2 前言

3 假设

4 方法

5 前导性研究

6 实验

7 讨论

8 结论

我们开发了困惑选择提示(Perption),这是一种在不使用任何人工注释数据的情况下实现现实世界零样本文本分类的方法。一项试点研究表明,困惑可以有效地衡量模板的功效。实验结果表明,对于英汉数据集,我们的方法可以在不使用开发集的情况下,在二元情感分析和多类分类中提高完成型风格提示学习的零样本性能。进一步的深入分析支持了Perption可以"预见"提示模板的功效的观察结果。

9 局限性

在本研究中,我们主要使用BERT系列模型进行中文文本分类任务。考虑到转换语言模型和预训练范式的相似性,以及第6.3节中讨论的英语数据集的初步结果,我们可能能够将结果外推到其他架构/任务/语言。

例如,Perption可以无缝地应用于仅解码器的模型(例如,GLM、LLaMA),以查看它是否可以提高那些NLG任务的性能。但还需要进一步的调查来验证这些发现在其他模型体系结构、任务和语言上的实用性。在未来,我们预计Perption将应用于不同的NLG任务,如seq2seq信息提取、问答、算术推理、机器翻译甚至多模态任务。

此外,使用Perption可能会加剧预先训练的语言模型的固有局限性。我们怀疑,在预训练期间,模型没有接触到某些文本或概念的情况下,对模板选择的困惑可能会导致较差的性能。在未来,我们希望探索是否可以通过某些无注释的方法来缓解这个问题,例如使用下游数据进行连续的自我监督训练,或者在有限标签信息的少样本设置中扩展我们的方法。

此外,使用困惑作为衡量标准有利于长文本的缺点,这迫使我们设计相同长度的模板。因此,长度不可知的度量可以被认为是一种替代方法。

相关推荐
东胜物联11 分钟前
探寻5G工业网关市场,5G工业网关品牌解析
人工智能·嵌入式硬件·5g
皓74122 分钟前
服饰电商行业知识管理的创新实践与知识中台的重要性
大数据·人工智能·科技·数据分析·零售
wangyue439 分钟前
c# 深度模型入门
深度学习
川石课堂软件测试1 小时前
性能测试|docker容器下搭建JMeter+Grafana+Influxdb监控可视化平台
运维·javascript·深度学习·jmeter·docker·容器·grafana
985小水博一枚呀1 小时前
【深度学习滑坡制图|论文解读3】基于融合CNN-Transformer网络和深度迁移学习的遥感影像滑坡制图方法
人工智能·深度学习·神经网络·cnn·transformer
AltmanChan1 小时前
大语言模型安全威胁
人工智能·安全·语言模型
985小水博一枚呀1 小时前
【深度学习滑坡制图|论文解读2】基于融合CNN-Transformer网络和深度迁移学习的遥感影像滑坡制图方法
人工智能·深度学习·神经网络·cnn·transformer·迁移学习
数据与后端架构提升之路1 小时前
从神经元到神经网络:深度学习的进化之旅
人工智能·神经网络·学习
爱技术的小伙子1 小时前
【ChatGPT】如何通过逐步提示提高ChatGPT的细节描写
人工智能·chatgpt
深度学习实战训练营3 小时前
基于CNN-RNN的影像报告生成
人工智能·深度学习