《从统计方法到大语言模型:NLP 的问题与方法演进》
导言
今天的语言模型可以续写、翻译、摘要、回答问题,也可以根据少量示例改变输出形式。回看这段历史,容易把各项研究排成一条通向大模型的直线。然而,早期论文通常只解决一个具体困难:离散词串难以泛化,循环网络难以训练,固定向量难以承载长句,或者预训练模型不能稳定遵循指令。后来的研究利用了先前成果,也改变了它们的用途。
本文以问题如何传递为线索,讨论从统计自然语言处理到 2022 年对话式助手形成的过程。重点是五类变化:表示如何从离散符号变成可学习向量,上下文如何从固定窗口扩展到动态状态与直接访问,序列转换如何形成可复用架构,预训练如何利用大规模无标注文本,以及模型如何从任务微调走向上下文学习与后训练。这里的"形成"是技术条件逐渐积累的结果,并不意味着每项研究都以今天的大模型为目标。
文章保留机器翻译、语言模型和序列标注三个任务作为对照。它们在前神经时代采用不同方法,因而能帮助我们看清后来哪些障碍确实被跨越,哪些差异仍然存在。正文中的引用沿用原稿编号;论文的预印本年份与正式发表年份不同时,会在需要处分别说明。
一、从统计方法到神经方法
1.1 三类任务,几种不同的输出
机器翻译把源语言序列变成目标语言序列,长度可以变化;语言模型为一个序列或下一个词赋予概率;序列标注则为输入中的每个位置预测一个标签。三者都处理文本序列,输出结构却不相同。把它们归为"文本输入、文本输出",有助于描述接口,但不足以抹去建模与评测的区别。
| 任务 | 典型输入与输出 | 前神经时代的主要方法 | 持续存在的难题 |
|---|---|---|---|
| 机器翻译 | 源句 → 目标句 | 词对齐、短语表、语言模型与解码器 | 低频组合、长距离重排、系统环节分离 |
| 语言模型 | 历史词串 → 下一个词的概率 | N-gram、平滑与回退 | 组合稀疏、固定窗口、词间缺少共享表示 |
| 序列标注 | 词或字序列 → 对应标签序列 | HMM、CRF 与人工特征 | 上下文特征需设计、标注数据有限 |
1.2 两条相互交织的技术线索
第一条线关心表示与上下文 :相似的词能否共享统计信息,模型能否利用超出固定窗口的历史,生成一个词时能否直接读取相关位置。Hinton 的分布式表示、Bengio 的神经语言模型、Elman 与 Mikolov 的循环网络、注意力和 Transformer,分别触及这条线上的不同问题[[2]](#[2])[[9]](#[9])[[3]](#[3])[[12]](#[12])[[18]](#[18])[[24]](#[24])。
第二条线关心训练与规模 :即便网络在结构上能保留历史信息,梯度也可能传不到远处;即便架构可以复用,标注语料也可能限制训练规模。反向传播、门控记忆、梯度控制、无标注文本预训练、子词切分与计算资源共同改变了方法的可行性[[1]](#[1])[[5]](#[5])[[6]](#[6])[[15]](#[15])[[23]](#[23])。两条线并非先后完成;每个新模型都在当时已有条件下处理其中一部分问题。
因此,本文按"问题---做法---新限制"组织章节。第二章展示统计方法解决了什么以及瓶颈何在;第三章讨论神经表示与可训练序列模型;第四章进入序列转换和 Transformer;第五章说明预训练与迁移如何成为常用路径;第六章讨论模型使用方式与后训练;第七章回看这条链的条件和边界。
二、前神经时代:任务专用的统计 NLP
2.1 机器翻译:从规则到统计估计
早期规则系统依赖人工编写词典和转换规则,迁移到新语言对时维护成本高。统计机器翻译转而从双语语料估计对应关系。Brown 等人的 IBM 模型把词对齐视为隐变量,通过概率估计学习翻译关系[[4]](#[4])。在噪声信道表述中,系统选择使目标语言概率与翻译概率乘积较大的译文:
\\\hat{\\mathbf e}=\\arg\\max_{\\mathbf e}P(\\mathbf e)P(\\mathbf f\\mid\\mathbf e). \\
其中 \(\mathbf f\) 是源句,\(\mathbf e\) 是候选译文,\(P(\mathbf e)\) 来自目标语言模型。后来的短语式系统进一步从对齐语料抽取短语对应关系,再结合语言模型、重排与长度等特征为候选译文打分[[68]](#[68])。它比逐词替换更能处理局部表达,但短语表对低频或未见组合缺少可靠估计。BLEU 为译文比较提供了可重复的自动指标,却不能把一个分数等同于全部翻译质量[[37]](#[37])。
以 "The committee approved the plan yesterday." 为例,系统可能在语料中见过 "the plan → 该计划",却很少见过更长的 "approved the plan" 组合。短语统计可以借回退与特征组合缓解稀疏,却不能自动认出 "plan" 与语境合适的近义词具有共享结构。更大的语料有帮助,组合空间仍增长得更快。
2.2 语言模型:平滑解决零计数,词仍是离散的
语言模型估计一个词序列的概率。链式法则本身不要求截断上下文;N-gram 模型额外假定下一个词主要依赖最近 \(n-1\) 个词:
\P(w_1,\\ldots,w_T)\\approx\\prod_{t=1}\^{T}P(w_t\\mid w_{t-n+1},\\ldots,w_{t-1}). \\
短窗口让概率可以计数估计,也让长距离信息落在模型之外。未见词串的零计数则通过 Katz 回退、Kneser--Ney 平滑等方法处理[[38]](#[38])[[39]](#[39])。这些方法不是简单地"无效":它们长期是强基线,能有效重新分配概率。它们也没有让 "plan" 与 "proposal" 因语义或用法接近而自然共享参数。为不同词串设计同一套平滑规则,仍不同于学习可迁移的词表示。
语言模型在语音识别、输入法和机器翻译中常用于为候选序列打分。这一点后来很重要:神经语言模型首先改变的并不是"让模型聊天",而是候选序列的概率估计方式。
2.3 序列标注:可建模标签依赖,特征仍需人工设计
命名实体识别、词性标注等任务要求输出与输入位置对应的标签。HMM 用隐状态转移和观测发射的联合模型描述序列,结构清楚,但对可纳入的输入特征有较强限制[[40]](#[40])。判别式序列模型允许直接利用丰富的输入特征;其中局部归一化的最大熵马尔可夫模型会出现 label bias 。CRF 在整条标签序列上归一化条件概率,避免了这类局部归一化造成的偏差[[8]](#[8])。因此,不能把 label bias 直接说成 HMM 本身的问题。
以"张三 昨天 在 北京 会见 了 李四"为例,CRF 可以利用相邻标签约束,并结合窗口词、字形、词典等特征识别人名与地名。其代价是特征模板与标注集仍要针对任务准备。统计学习已经减少了手写规则,但还没有摆脱手工决定"哪些输入线索值得看"。
2.4 三种方法留下的共同问题
这三种任务不共享一种输出结构,也不受同一瓶颈以相同方式影响。仍可辨认出三项反复出现的限制:离散符号导致相近词难以共享统计信息;固定窗口或人为特征模板限制上下文的使用;高质量平行语料和标签依赖人工获取。神经方法先从前两项切入,后来预训练才更充分地利用无标注文本。接下来要问的是:网络能否学出有用表示,并在长序列上可靠训练?
三、神经方法:从分布式表示到可训练的序列模型
3.1 离散词之外,表示能否由任务学习?
分布式表示的要点是让一个概念由多个单元的活动模式共同表示,而不是给每个概念分配互不相关的单独位置。Hinton 1986 年以家族关系为实验材料,展示网络隐藏层可以形成共享特征,并利用这些特征处理训练中未直接给出的关系[[2]](#[2])。这提供了表示学习的早期论证,却不是在当时就提出了现代 NLP 的词嵌入训练法。LSA 和词类聚类也曾利用共现统计发现词间关系,说明非神经方法并非完全不能共享信息[[41]](#[41])[[42]](#[42])。
Bengio 等人 2003 年把问题放到概率语言模型中:面对大量从未出现过的词组合,如何使见过的上下文帮助相似的上下文?其神经概率语言模型同时学习每个词的连续表示,以及利用固定长度历史预测下一个词的函数[[9]](#[9])。例如,包含 "plan" 的训练上下文更新共享的网络参数和词表示,可能使含有用法相近词的未见上下文得到更合理的概率。这项工作的关键是联合学习词的分布式表示与基于这些表示的词序列概率函数,以改善对未见词串的概率估计。
这种做法没有消除稀疏问题,也不保证语义相近的词总会得到相近向量。它改变的是参数共享方式:模型不必为每个词串单独保存一份概率。但固定窗口仍在,窗口外的历史无法进入预测函数。下一个问题于是从"词如何表示"转向"历史如何持续进入表示"。

图 1|从离散计数到共享表示。 左侧的空格示意词串组合稀疏;右侧的向量示意相近用法有机会共享统计信息。图中位置和连线只是概念表达,不代表特定模型结构;早期神经语言模型仍受固定窗口限制。
3.2 固定窗口之后:循环状态保存了什么?
Elman 1990 年已用循环网络研究序列中结构的形成:当前输入与上一时刻的隐藏状态共同决定新状态[[3]](#[3])。这一思路早于 Bengio 的前馈语言模型;这里按问题关系而非发表顺序叙述。循环状态使模型在结构上不必预设一个固定的 \(n\) 值:
\\\mathbf h_t=f(\\mathbf x_t,\\mathbf h_{t-1}),\\qquad P(w_{t+1}\\mid w_{\\leq t})=g(\\mathbf h_t). \\
Mikolov 等人的 RNN 语言模型把循环结构用于实际语言建模与语音识别评估,在相应实验中改善了语言模型表现[[12]](#[12])。它回答了前馈固定窗口模型留下的问题:模型可以用同一组参数递归汇总任意长度的前文。这里的"任意长度"指结构不设固定窗口,不等于训练后的状态确实保留了任意久远的信息。
3.3 词表示如何变得易于复用?
神经概率语言模型把词表示嵌在完整的概率模型中一起训练。word2vec 则用较简化的 CBOW 和 Skip-gram 训练目标,高效地从大语料学习词向量;后续工作又处理常见词采样与短语表示[[16]](#[16])。它的重要性在于让静态词向量容易训练和复用,而非首次提出"一个词可以用向量表示"。
静态向量也有明确边界:同一个词在不同句子里通常使用同一份词表表示。它可以编码跨语料的平均用法,却无法单独区分 "river bank" 与 "bank account" 中的 bank。这一限制到第五章的上下文化预训练才会成为核心问题。
3.4 结构上能记住,不等于梯度传得到
循环网络通过时间反向传播训练时,梯度经过许多状态变换。若这些变换的局部导数连乘持续收缩,远处输入得到的训练信号会很弱;若持续放大,则可能使更新不稳定。Bengio、Simard 与 Frasconi 1994 年分析了学习长期依赖的困难,Hochreiter 更早的研究也讨论过相关问题[[5]](#[5])[[43]](#[43])。具体梯度行为取决于权重、激活与当前轨迹,不能只由某个固定阈值在所有网络上判定。
这解释了为什么 RNN"能够递归读取历史"仍不足以保证长距离依赖可学。1997 年的 LSTM 为记忆单元设计了更易保留误差信号的状态通路,并用门控制写入与读出[[6]](#[6])。它并未证明所有长依赖都能学会,但为这类训练提供了可行的结构。原始 LSTM 有输入门和输出门;Gers 等人于 2000 年引入遗忘门,使记忆可按需衰减,尤其针对连续输入流中旧状态难以清除的问题[[7]](#[7])。窥孔连接是后续扩展,而非原始 LSTM 的组成部分[[44]](#[44])。
门控主要缓解长期信息与梯度衰减问题,梯度爆炸仍需单独处理。Pascanu 等人系统讨论了循环网络的训练困难与梯度裁剪:当梯度范数过大时限制更新幅度,以降低不稳定性[[15]](#[15])。裁剪不是对长依赖建模的替代,也不会自动修复梯度消失。
3.5 为什么语音识别提供了早期重要验证?
语音任务天然包含连续帧、长时上下文和声学标注问题。双向 LSTM 在音素分类中展示了利用前后上下文的能力[[45]](#[45])。CTC 为输入帧与较短输出标签之间未知的单调对齐 定义训练目标,对可能的对齐路径求和,因此不要求逐帧给出精确标签[[10]](#[10])。CTC 与后来的注意力都触及"对齐不明确"的难题,但计算假设与机制不同,不能把 CTC 称为软注意力的前身。
与此同时,深层声学模型在语音识别中取得进展[[13]](#[13]);Graves、Mohamed 与 Hinton 的深层循环网络研究又给出了具有竞争力的音素识别结果[[14]](#[14])。这些工作说明神经序列模型在具体设置下可以训练并发挥作用。它们不意味着当时文本任务已拥有同样的语料条件或训练目标,也不意味着"语音已经完全端到端"。原稿中把语音发展归结为单一原因,容易遮蔽数据、任务定义、目标函数和工程实践的共同作用。
3.6 到 2013 年,哪些条件已经具备?
可学习的词表示、能递归编码上下文的网络、门控记忆与梯度控制,已经组成一套可用于序列建模的工具。但机器翻译还有一个新问题:如何从一个变长输入序列生成另一个变长输出序列,并让输出的每一步有效使用输入信息?第三章的成果是第四章的条件,而非已经给出这个问题的答案。
四、序列转换范式的形成:Encoder--Decoder、Attention 与 Transformer(2014--2017)
4.1 变长输入如何对应变长输出?
Cho 等人的 RNN Encoder--Decoder 把源序列编码为状态,再在该状态条件下逐步生成目标序列[[17]](#[17])。这是对序列转换组织方式的一次明确表达:编码器和解码器可采用不同内部单元,输出长度也不必与输入相同。论文同时提出 GRU,用更新门与重置门控制状态;GRU 与 LSTM 是解决相关训练问题的不同门控设计,不能排成简单的取代顺序。
需要区分架构想法与原论文用途。Cho 等人主要把该模型作为统计机器翻译的短语打分特征,而不是独立替换整个翻译系统。后续研究发展了"由网络直接生成译文"的用法。Encoder--Decoder 为翻译、摘要等序列转换任务提供共同形式,却不能据此断言机器翻译与逐位序列标注具有相同输出结构。
4.2 从打分部件到端到端翻译
Sutskever、Vinyals 与 Le 用多层 LSTM 将源句压缩为固定维度向量,再由另一个 LSTM 生成译文,在机器翻译实验中展示了端到端序列转换的可行性[[19]](#[19])。他们将源句词序反转,缩短一些源端与目标端位置之间的依赖路径,并在实验中观察到明显改善。这个技巧说明优化路径会影响效果;它本身并不能证明所有固定向量模型都会在长句上失败,原论文也报告其系统没有明显的长句困难。
2014 年几篇工作是相近时期的探索:Cho 的预印本在 6 月,Bahdanau 的注意力工作在 9 月 1 日,Sutskever 的 Seq2Seq 预印本在 9 月 10 日提交[[17]](#[17])[[18]](#[18])[[19]](#[19])。
4.3 固定向量之后:解码时直接读取源句
固定向量方案要求源句信息经过一个定长状态交给解码器。Bahdanau、Cho 与 Bengio 认为这可能限制基本 Encoder--Decoder 的性能,于是保留源句各位置的编码状态,让解码器在生成每个词时分别计算相关性权重[[18]](#[18]):
\\\mathbf c_t=\\sum_{j=1}\^{n}\\alpha_{tj}\\mathbf h_j, \\qquad \\sum_{j=1}\^{n}\\alpha_{tj}=1. \\
\(\mathbf h_j\) 是源端第 \(j\) 个位置的表示,\(\alpha_{tj}\) 是生成目标端第 \(t\) 个词时分配给该位置的权重。这种软对齐允许不同生成步骤读取不同源端信息;论文还采用双向编码器,因此效果变化不能全归因于注意力一项。权重是模型内部的读取分配,不自动构成人类式语义理解或因果解释。
Luong 等人随后系统比较了若干注意力打分与读取方式,包括点积及 general 形式、global 与 local 范围[[20]](#[20])。这使注意力成为序列转换里可单独研究和替换的部件。问题也随之变化:既然解码器可以直接访问源端各位置,序列内部的位置关系是否仍必须依靠循环逐步传递?

图 2|固定向量与逐步注意力。 上半部分示意解码器从单个源句向量起步;下半部分示意每生成一个目标词,都可重新读取源端各位置。连线粗细只表示读取权重不同,不应当直接解释为词义或因果贡献。
4.4 从循环传播到自注意力
2016---2017 年的相关工作已经探索句内注意力、摘要中的解码端自注意力,以及不依赖循环的序列转换[[48]](#[48])[[49]](#[49])[[50]](#[50])[[51]](#[51])[[46]](#[46])[[47]](#[47])。更早的快权重记忆研究也讨论过网络对动态状态的访问,但本文不把它等同于现代自注意力的直接原型[[64]](#[64])。这些研究的任务与结构并不相同;它们说明"非循环建模"和"位置间直接交互"都已进入研究视野。
Transformer 在机器翻译中保留了编码器---解码器整体形式,也保留目标端读取源端表示的交叉注意力;关键变化是编码器内部及解码器内部使用自注意力建立位置关系,而不再由循环状态逐步传递[[24]](#[24])。对一层表示矩阵 \(X\),先得到查询、键和值,再计算:
\Q=XW_Q,\\quad K=XW_K,\\quad V=XW_V, \\qquad \\operatorname{Attention}(Q,K,V) =\\operatorname{softmax}\\!\\left(\\frac{QK\^{\\top}}{\\sqrt{d_k}}+M\\right)V. \\
\(d_k\) 是查询与键的维度;\(M\) 表示允许读取哪些位置。解码器的因果掩码禁止当前位置读取未来目标词,源端编码器则可在允许范围内双向读取。多头注意力通过不同投影学习多组关系,位置编码提供顺序信息;模型还有逐位置前馈网络、残差连接与归一化,并非只有注意力[[24]](#[24])[[53]](#[53])[[54]](#[54])。
自注意力层在已知整个训练序列时可同时计算许多位置,减少循环网络的顺序依赖;两个远距离位置也可在一层中直接交互。这使大规模矩阵运算更适合加速器,但全局注意力的成对位置计算随序列长度呈二次增长。训练并行与自回归生成仍是两件事:生成未来词时,模型仍须逐步确定新词。更短的信息路径也不保证模型会正确利用任意长上下文。
Transformer 的可用性还依赖优化器、残差、归一化与合适的文本切分等配套条件[[52]](#[52])[[53]](#[53])[[54]](#[54])。BPE 子词方法帮助神经机器翻译处理稀有词和开放词表问题[[23]](#[23])。因此,2017 年的架构改进应放在此前表示、训练与工程积累之中理解。
4.5 旁支:序列标注也改用了神经编码器
BiLSTM-CRF 用双向 LSTM 学习上下文特征,再用 CRF 层建模标签序列的相邻约束[[22]](#[22])。它减少了对人工窗口特征的依赖,说明神经表示也改变了序列标注。但逐位标签预测与生成变长译文仍是不同任务;BiLSTM-CRF 不构成 Encoder--Decoder 可以直接统一所有 NLP 输出形式的证据。
至此,序列模型能更灵活地表示输入、转换序列和访问相关位置。多数具体任务仍要依靠专门标注数据训练或微调。下一阶段的关键问题因此转向:能否先利用大量无标注文本学习可迁移的参数,再用较少任务数据适配?
五、预训练范式的确立:从任务专用训练到预训练与迁移(2015--2020)
5.1 为什么先在无标注文本上学习?
机器翻译需要平行语料,序列标注需要逐位置标签,而自然产生的普通文本规模更大。预训练的基本做法是先从这些文本构造可自动得到的学习信号,使模型形成可迁移的参数,再将参数用于具体任务。它并不是"所有任务只有一个目标函数":语言模型预测下一个词、掩码恢复与去噪重建都可利用无标注文本,但目标不同,适合的输出形式也不同。
这条路线早有探索。Collobert 与 Weston 用共享网络处理多项 NLP 任务,并引入无标注文本信号[[11]](#[11])。Dai 与 Le 在 2015 年研究序列模型先预训练、再在有标注任务上微调的效果[[21]](#[21])。这些工作表明"先学习可复用表示"并非 Transformer 出现后才有的想法,但尚未给出后来大规模预训练的全部条件。
5.2 静态词向量为何不够:上下文化表示
word2vec 的词向量便于复用,却通常让一个词在所有句子中共享同一份基础表示。多义词和随句法位置变化的用法要求表示依赖上下文。CoVe 从机器翻译编码器中提取上下文化词向量,为下游任务提供预训练特征[[55]](#[55]);它使用的双语训练信号与后来主要依赖普通文本的语言模型预训练不同。
ELMo 用双向语言模型中的多层隐藏状态,为同一个词在不同句子中产生不同表示,并让下游任务学习如何组合这些层[[26]](#[26])。例如 bank 在 "river bank" 与 "bank account" 中,基础词身份相同,进入下游模型的上下文表示则可以不同。这个变化把研究问题从"能否得到好词向量"推进为"能否让每个位置依据整句得到合适表示"。ELMo 的常见用法是把预训练网络产出的表示作为特征送入任务模型,任务训练主要更新新增部分。
5.3 预训练参数如何迁移:特征与微调
预训练网络有两种典型用法。基于特征 的方法提取表示,交由任务模型使用;整体微调 则以预训练参数为起点,让任务数据继续更新模型。ELMo 和 CoVe 偏向前者,ULMFiT、GPT-1 和 BERT 展示了后者的可行性[[26]](#[26])[[55]](#[55])[[25]](#[25])[[27]](#[27])[[28]](#[28])。
ULMFiT 将语言模型预训练、目标领域适配和分类任务微调组成连续步骤,并用逐层不同学习率等策略降低微调时遗忘原有能力的风险[[25]](#[25])。它回答的是一个实际问题:预训练获得的知识如何在少量有标注数据下保留下来并用于新任务。两种迁移方式没有脱离任务条件的"胜负";冻结特征便于重复使用,整体微调通常提供更强的任务适配,却需要为任务更新和保存参数。BERT 时代,整体微调成为许多理解任务的常用做法,但特征提取并未失去用途。
5.4 GPT、BERT 与 T5:目标和结构为何分化?
GPT-1 将 Transformer 解码器的因果结构用于生成式预训练:给定前文预测下一个 Token,随后在有标注任务上微调[[27]](#[27])。训练损失可写为
\\\mathcal L_{\\mathrm{AR}}(\\theta) =-\\sum_{t=1}\^{T}\\log P_{\\theta}(x_t\\mid x_{\
目标文本本身提供每个位置的预测标签,因而不需要人工逐词标注;具体任务的微调仍可能需要标注数据。因果条件也使模型自然地按顺序生成文本。
BERT 则主要面向双向上下文表示。它用掩码语言建模,从被遮住的部分位置预测原 Token,并结合句子级预训练设置;下游分类、抽取式问答等任务通过微调适配[[28]](#[28])。掩码词预测与 GPT 的自回归预测都利用文本自身构造监督信号,但可读取的上下文和生成方式不同。BERT 的论文于 2018 年提交预印本,2019 年正式发表。
T5 保留编码器---解码器,采用去噪式预训练,并把多种下游任务写成"输入文本 → 输出文本"的形式[[30]](#[30])。分类可以输出标签词,翻译输出译文,摘要输出摘要。共同的文本接口有利于比较任务和复用模型;它并不表示所有任务拥有相同数据、损失解释或评价标准。T5 的预印本发表于 2019 年,期刊论文发表于 2020 年。

图 3|三种预训练信息流。 从左到右依次示意 GPT 的从左到右预测、BERT 的掩码词恢复,以及 T5 的编码器---解码器去噪重建。箭头表示可利用的信息方向,省略了具体层结构和训练细节。
| 工作 | 主要结构与预训练信号 | 当时典型的任务适配 |
|---|---|---|
| GPT-1 | 仅解码器;从左到右预测 | 有标注任务微调 |
| BERT | 仅编码器;掩码词预测 | 增加任务输出层并微调 |
| T5 | 编码器---解码器;去噪重建 | 文本到文本的任务形式与微调 |
这三种路线都建立在"先从大规模文本学习,再迁移"的共同思路上,但目标函数没有合并为一个。后来的 UL2 继续研究不同语言学习目标的组合,也说明不能把这段历史概括成单一目标的取代过程[[56]](#[56])。后来的大模型发展同样不能从某一年"哪种架构获胜"简单推出。
5.5 当模型与数据一起增大,新的问题是什么?
Transformer、子词切分、加速器与分布式训练,使更大的模型和语料成为可操作的研究变量。Kaplan 等人观察到,在其研究设置内,语言模型测试损失与参数量、数据量、计算量呈相对规律的经验关系[[31]](#[31])。缩放定律使资源规划有了经验依据,却不保证任意任务能力按同一曲线增长,更不直接证明知识可靠或推理稳健。
GPT-3 以远大于此前 GPT 模型的规模进行自回归预训练,并在零样本、单样本和少样本设置下评估[[32]](#[32])。在本章,它代表大规模预训练的一个结果;任务说明和示例放入上下文后为何能改变输出,以及这种用法的边界,留到第六章展开。
随后,Hoffmann 等人重新研究固定训练计算预算下的参数量与训练 Token 数配置。其 Chinchilla 实验显示,在论文比较的预算和设置中,用更多训练数据配合较小模型可以优于此前一些更大而训练数据不足的模型[[36]](#[36])。这修正的是给定算力下如何分配参数与数据 的经验建议,不是否认参数量的重要性,也不保证同一比例适用于所有推理或部署成本。后续研究继续检验这些经验估计的条件[[57]](#[57])。
第五章的关键变化因此是训练方式与数据来源:模型能够先从大量普通文本中获得可迁移表示,任务适配不必从随机参数开始。但在 GPT-1、BERT 和 T5 的典型设置里,许多下游任务仍要单独微调。模型能否在不更新参数的情况下利用当前输入中的任务说明,成为下一阶段的问题。
六、从语言模型到通用助手:上下文学习、指令微调与人类反馈(2019--2022)
6.1 任务可以放进上下文吗?
GPT-1 的主要任务适配仍依赖微调。GPT-2 则尝试在不为任务更新参数的条件下,直接用生成式语言模型完成翻译、问答等任务[[29]](#[29])。这些零样本实验结果参差不齐,不能由"出现任务行为"推论为模型已普遍可用。它提出了一个重要使用问题:如果训练目标是续写,任务的描述能否像普通文本一样进入上下文?
GPT-3 对零样本、单样本和少样本提示进行了系统评估[[32]](#[32])。少样本提示把任务描述、若干输入输出示例和待处理输入依次排入上下文;关于提示方法的后续综述也将这种用法与参数微调明确区分[[63]](#[63])。例如:
text
将英文译为中文:
dog → 狗
apple → 苹果
cat →
模型仍按预训练时的形式预测后续 Token;在这样的评估设置里,任务参数不通过梯度更新。上下文学习描述的是模型根据当前输入中的示例改变输出的现象,不表示它在推理时完成了与微调同样的参数学习,也不保证跨任务表现稳定。任务选择、提示格式、示例顺序与评分方法都会影响观察结果。
6.2 能根据示例作答,为什么仍需指令微调?
大规模续写模型可能延续用户写下的文本,而不是按请求完成任务。指令微调用多个带自然语言任务说明的有标注数据集继续训练,使模型在遇到未见任务时更容易将说明当作执行要求。FLAN 在其零样本评估中报告了跨任务泛化收益,并指出结果与模型规模有关[[34]](#[34]);T0 则在编码器---解码器路线探索多任务提示训练[[60]](#[60])。此后,Super-NaturalInstructions 等研究继续扩展以声明式指令描述的任务集合,用于检验未见任务上的泛化[[66]](#[66])。这些工作使用的数据、模型和评估设置不同,不能把某一个实验阈值当成普遍规律。
这一步改变的是模型参数,和只在推理时添加提示不同。它也没有保证输出符合人的偏好:模型即使理解"请回答"这一任务形式,也可能给出不充分、不准确或不恰当的回答。
6.3 如何利用人的比较反馈?
人类反馈路线早于对话助手。Christiano 等人研究从人类偏好比较中学习奖励信号[[61]](#[61]);Ziegler 等人进一步探索按人类偏好微调语言模型[[62]](#[62])。Stiennon 等人在摘要任务中,让标注者比较候选摘要,训练奖励模型,再用强化学习优化生成策略[[33]](#[33])。这些论文的任务范围不同,不能写成同一个方法在同一时刻"首次完成"。
InstructGPT 将监督示范、回答偏好比较和强化学习结合起来训练指令遵循模型[[35]](#[35])。其流程可以概括为:先用人工示范进行监督微调,再用候选回答的比较训练奖励模型,最后在奖励模型信号下继续优化,同时限制策略偏离过远。论文报告了特定标注者偏好与评估集上的改进;这不等于获得通用的真实性、无害性或跨场景可靠性。奖励模型学习的是已收集比较数据所表达的偏好,其覆盖范围与标注标准直接影响结果。
为避免把几种变化混成"同一次训练",可以按参数是否更新区分:
| 阶段 | 输入与更新 | 直接目的 |
|---|---|---|
| 预训练 | 大规模文本;更新模型参数 | 学习语言分布及可迁移的统计结构 |
| 提示与上下文学习 | 当前任务说明、示例;推理时不更新参数 | 在既有模型能力范围内指定任务与输出形式 |
| 后训练 | 指令示范、偏好比较等;更新模型参数 | 改善指令遵循与符合所收集的人类偏好 |

图 4|文本与反馈在不同阶段的作用。 上方的大规模文本用于预训练并更新参数;中间的任务说明与示例只在当前推理上下文中起作用;下方的人类比较为后训练提供偏好信号。三条路径是作用方式的对照,并非所有模型的固定训练流程。
这种划分描述的是技术作用,不是一条所有模型都必须遵守的固定工序。尤其不能把"遵循偏好"写成已经解决事实核查或安全问题。
6.4 ChatGPT 把哪一步带给了公众?
2022 年 11 月发布的 ChatGPT 把对话形式的模型服务提供给更广泛的用户[[67]](#[67])。理解这段技术史时,InstructGPT 论文是有公开方法细节的关键节点;ChatGPT 则使连续对话和指令式交互成为公众熟悉的产品体验。OpenAI 的发布说明称 ChatGPT 是 InstructGPT 的同源模型,训练方法相近,但数据收集设置存在差异;不能据此推断两者权重或每一项实现细节完全相同。模型在多任务文本接口上的使用方式由此变得直观,但不同任务的正确性、所需外部信息与评估标准仍各不相同。
七、回看:大模型是怎样一步步形成的
7.1 问题如何传递
这段历史可以概括为一组相互衔接、却不完全按年份排成单线的问题:
| 遇到的问题 | 当时的重要做法 | 做法留下的新限制 |
|---|---|---|
| 离散词串难以泛化 | 学习分布式词表示 | 早期语言模型仍依赖固定窗口 |
| 固定窗口看不到更长历史 | 循环状态 | 远距离依赖难训练,计算需逐步进行 |
| 长期依赖的梯度不稳定 | LSTM、遗忘门与梯度裁剪 | 变长序列转换仍缺通用组织方式 |
| 译文只接收定长源句向量 | 解码时对源端各位置做注意力 | 序列内部仍依赖循环传播 |
| 循环限制训练时的位置并行 | 自注意力与 Transformer | 大模型训练仍受数据、算力和目标约束 |
| 每项任务都需大量标注或单独训练 | 预训练与迁移 | 许多任务仍需微调 |
| 任务适配依赖参数更新 | 提示与上下文学习 | 续写行为不保证稳定遵循指令 |
| 指令遵循与人类偏好仍不充分 | 指令微调、偏好学习与 RLHF | 真实性、稳健性等问题仍开放 |
这张表压缩了很多并行研究,只表示主要问题关系,不主张每项成果都是下一项的唯一前提。例如 Elman 早于 Bengio 的神经概率语言模型;卷积网络也曾与 Transformer 并行探索序列转换。
7.2 哪些层面发生了变化?
| 层面 | 主要变化 | 仍需注意的边界 |
|---|---|---|
| 表示 | 离散符号 → 静态词向量 → 上下文化表示 | 向量相近不等于语义完全相同 |
| 上下文 | 固定窗口 → 循环状态 → 位置间直接访问 | 可访问不等于能可靠利用 |
| 架构 | 任务专用部件 → 序列转换架构 → Transformer | 任务输出与目标仍有差异 |
| 训练 | 依赖任务标注 → 大规模文本预训练与迁移 | 数据质量和目标设定持续重要 |
| 使用 | 任务微调 → 提示与上下文学习 → 指令及偏好后训练 | 提示无参数更新,后训练有参数更新 |
这些变化相互作用。Transformer 减少训练中的串行依赖,但没有自动提供大规模文本、子词表示、优化方法或加速器;预训练能改善迁移,也没有自动产生稳定的任务遵循。把某个单一论文或架构写成大模型出现的充分原因,超出了这段证据能支持的范围。
7.3 技术条件与历史视角
数据、算力、优化与软件工程影响了方法何时可用。子词切分缓解罕见词与词表规模问题[[23]](#[23]);Adam、残差连接和归一化支持深网络训练[[52]](#[52])[[53]](#[53])[[54]](#[54]);经验缩放研究使参数、数据和计算预算之间的取舍更可见[[31]](#[31])[[36]](#[36])。这些因素并不保证模型质量,但改变了可验证的假设范围。
历史回看还要区分论文原目标 与后来的用途 。Hinton 的概念分布式表示研究并非为今天的 NLP 嵌入模块设计;Cho 的 Encoder--Decoder 最初用于统计机器翻译中的短语打分;Transformer 原论文验证的是机器翻译,而它后来成为更广泛的预训练骨干;GPT-1 强调预训练后微调,后来的 GPT-3 才系统研究无参数更新的少样本用法[[2]](#[2])[[17]](#[17])[[24]](#[24])[[27]](#[27])[[32]](#[32])。这些转用说明方法具有可迁移性,也提醒我们不要把后来的结论塞回原论文的实验范围。
同样,预测损失随规模改善不能直接推出所有下游能力平滑或突然出现。关于"涌现能力"的讨论依赖任务指标与评估方式;有研究指出,部分看似突变的曲线会随连续指标的采用而改变[[58]](#[58])[[59]](#[59])。思维链提示的效果也应按具体模型、任务和提示设置理解,而不是把一种实验现象写成所有大模型的通则[[65]](#[65])。
7.4 到 2022 年,哪些问题仍然开放?
多任务文本交互已经成为可用的模型使用形式,但"能生成回答"与"回答可核验"之间仍有距离。事实正确性、稳健推理、长上下文的有效利用、人的偏好与不同情境之间的冲突,以及训练和推理成本,都需要独立研究与评估。本文以 2022 年作为叙述终点,是为了观察从统计方法到通用对话式助手的形成过程;它不是对之后技术发展的完成式判断。
回到导言的问题:大模型的出现没有单一转折点。它依赖表示、上下文建模、可训练架构、无标注预训练、规模化计算与后训练方法在不同任务中逐渐积累。沿着每一项研究当时要解决的问题阅读,比事后给历史安上一条整齐的路线,更能看清这些成果何以相接,也更能看清它们各自没有解决什么。
参考文献
1 Rumelhart, D. E., Hinton, G. E., & Williams, R. J. (1986). Learning Representations by Back-Propagating Errors . Nature, 323(6088), 533--536. https://doi.org/10.1038/323533a0
2 Hinton, G. E. (1986). Learning Distributed Representations of Concepts. Proceedings of the 8th Annual Conference of the Cognitive Science Society, 1--12.
3 Elman, J. L. (1990). Finding Structure in Time . Cognitive Science, 14(2), 179--211. https://doi.org/10.1207/S15516709COG1402_1
4 Brown, P. F., Della Pietra, S. A., Della Pietra, V. J., & Mercer, R. L. (1993). The Mathematics of Statistical Machine Translation: Parameter Estimation . Computational Linguistics, 19(2), 263--311. https://aclanthology.org/J93-2003/
5 Bengio, Y., Simard, P., & Frasconi, P. (1994). Learning Long-Term Dependencies with Gradient Descent is Difficult . IEEE Transactions on Neural Networks, 5(2), 157--166. https://doi.org/10.1109/72.279181
6 Hochreiter, S., & Schmidhuber, J. (1997). Long Short-Term Memory . Neural Computation, 9(8), 1735--1780. https://doi.org/10.1162/neco.1997.9.8.1735
7 Gers, F. A., Schmidhuber, J., & Cummins, F. (2000). Learning to Forget: Continual Prediction with LSTM . Neural Computation, 12(10), 2451--2471. http://felixgers.de/papers/FgGates-NC.pdf
8 Lafferty, J., McCallum, A., & Pereira, F. (2001). Conditional Random Fields: Probabilistic Models for Segmenting and Labeling Sequence Data . ICML 2001, 282--289. https://home.cs.colorado.edu/~mozer/Teaching/syllabi/6622/papers/LaffertyMcCallumPereira2001.pdf
9 Bengio, Y., Ducharme, R., Vincent, P., & Jauvin, C. (2003). A Neural Probabilistic Language Model . JMLR, 3, 1137--1155. https://jmlr.org/papers/v3/bengio03a.html
10 Graves, A., Fernández, S., Gomez, F., & Schmidhuber, J. (2006). Connectionist Temporal Classification: Labelling Unsegmented Sequence Data with Recurrent Neural Networks . ICML 2006, 369--376. https://doi.org/10.1145/1143844.1143891
11 Collobert, R., & Weston, J. (2008). A Unified Architecture for Natural Language Processing: Deep Neural Networks with Multitask Learning . ICML 2008, 160--167. https://doi.org/10.1145/1390156.1390177
12 Mikolov, T., Karafiát, M., Burget, L., Černocký, J., & Khudanpur, S. (2010). Recurrent Neural Network Based Language Model . Interspeech 2010, 1045--1048. https://www.isca-archive.org/interspeech_2010/mikolov10_interspeech.html
13 Hinton, G., Deng, L., Yu, D., Dahl, G., Mohamed, A., Jaitly, N., Senior, A., Vanhoucke, V., Nguyen, P., Sainath, T., & Kingsbury, B. (2012). Deep Neural Networks for Acoustic Modeling in Speech Recognition . IEEE Signal Processing Magazine, 29(6), 82--97. https://doi.org/10.1109/MSP.2012.2205597
14 Graves, A., Mohamed, A., & Hinton, G. (2013). Speech Recognition with Deep Recurrent Neural Networks . ICASSP 2013, 6645--6649. https://arxiv.org/abs/1303.5778
15 Pascanu, R., Mikolov, T., & Bengio, Y. (2013). On the Difficulty of Training Recurrent Neural Networks . ICML 2013. https://arxiv.org/abs/1211.5063
16 Mikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient Estimation of Word Representations in Vector Space . arXiv:1301.3781. https://arxiv.org/abs/1301.3781 同一工作的第二篇:Mikolov, T., Sutskever, I., Chen, K., Corrado, G., & Dean, J. (2013). Distributed Representations of Words and Phrases and their Compositionality . NIPS 2013. arXiv:1310.4546. https://arxiv.org/abs/1310.4546
17 Cho, K., van Merriënboer, B., Gulcehre, C., Bahdanau, D., Bougares, F., Schwenk, H., & Bengio, Y. (2014). Learning Phrase Representations using RNN Encoder--Decoder for Statistical Machine Translation . EMNLP 2014, 1724--1734. https://aclanthology.org/D14-1179/
18 Bahdanau, D., Cho, K., & Bengio, Y. (2015). Neural Machine Translation by Jointly Learning to Align and Translate . ICLR 2015. arXiv:1409.0473. https://arxiv.org/abs/1409.0473
19 Sutskever, I., Vinyals, O., & Le, Q. V. (2014). Sequence to Sequence Learning with Neural Networks . NIPS 2014. arXiv:1409.3215. https://arxiv.org/abs/1409.3215
20 Luong, M.-T., Pham, H., & Manning, C. D. (2015). Effective Approaches to Attention-based Neural Machine Translation . EMNLP 2015. arXiv:1508.04025. https://arxiv.org/abs/1508.04025
21 Dai, A. M., & Le, Q. V. (2015). Semi-supervised Sequence Learning . NIPS 2015. arXiv:1511.03677. https://arxiv.org/abs/1511.03677
22 Huang, Z., Xu, W., & Yu, K. (2015). Bidirectional LSTM-CRF Models for Sequence Tagging . arXiv:1508.01991. https://arxiv.org/abs/1508.01991
23 Sennrich, R., Haddow, B., & Birch, A. (2016). Neural Machine Translation of Rare Words with Subword Units . ACL 2016, 1715--1725. https://aclanthology.org/P16-1162/
24 Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention Is All You Need . NIPS 2017. arXiv:1706.03762. https://arxiv.org/abs/1706.03762
25 Howard, J., & Ruder, S. (2018). Universal Language Model Fine-tuning for Text Classification . ACL 2018. arXiv:1801.06146. https://arxiv.org/abs/1801.06146
26 Peters, M. E., Neumann, M., Iyyer, M., Gardner, M., Clark, C., Lee, K., & Zettlemoyer, L. (2018). Deep Contextualized Word Representations . NAACL 2018. arXiv:1802.05365. https://arxiv.org/abs/1802.05365
27 Radford, A., Narasimhan, K., Salimans, T., & Sutskever, I. (2018). Improving Language Understanding by Generative Pre-Training . OpenAI 技术报告. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
28 Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding . NAACL 2019. arXiv:1810.04805. https://arxiv.org/abs/1810.04805
29 Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., & Sutskever, I. (2019). Language Models are Unsupervised Multitask Learners . OpenAI 技术报告. https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf
30 Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W., & Liu, P. J. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer . JMLR, 21(140), 1--67. arXiv:1910.10683. https://arxiv.org/abs/1910.10683
31 Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., & Amodei, D. (2020). Scaling Laws for Neural Language Models . arXiv:2001.08361. https://arxiv.org/abs/2001.08361
32 Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., et al. (2020). Language Models are Few-Shot Learners . NeurIPS 2020. arXiv:2005.14165. https://arxiv.org/abs/2005.14165
33 Stiennon, N., Ouyang, L., Wu, J., Ziegler, D. M., Lowe, R., Voss, C., Radford, A., Amodei, D., & Christiano, P. (2020). Learning to Summarize from Human Feedback . NeurIPS 2020. arXiv:2009.01325. https://arxiv.org/abs/2009.01325
34 Wei, J., Bosma, M., Zhao, V. Y., Guu, K., Yu, A. W., Lester, B., Du, N., Dai, A. M., & Le, Q. V. (2022). Finetuned Language Models Are Zero-Shot Learners . ICLR 2022. arXiv:2109.01652. https://arxiv.org/abs/2109.01652
35 Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C., Mishkin, P., et al. (2022). Training Language Models to Follow Instructions with Human Feedback . NeurIPS 2022. arXiv:2203.02155. https://arxiv.org/abs/2203.02155
36 Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E., et al. (2022). Training Compute-Optimal Large Language Models . NeurIPS 2022. arXiv:2203.15556. https://arxiv.org/abs/2203.15556
37 Papineni, K., Roukos, S., Ward, T., & Zhu, W.-J. (2002). BLEU: a Method for Automatic Evaluation of Machine Translation . ACL 2002, 311--318. https://aclanthology.org/P02-1040/
38 Katz, S. M. (1987). Estimation of Probabilities from Sparse Data for the Language Model Component of a Speech Recognizer . IEEE Transactions on Acoustics, Speech, and Signal Processing, 35(3), 400--401. https://doi.org/10.1109/TASSP.1987.1165125
39 Kneser, R., & Ney, H. (1995). Improved Backing-off for M-gram Language Modeling . ICASSP 1995, 181--184. https://doi.org/10.1109/ICASSP.1995.479394
40 Rabiner, L. R. (1989). A Tutorial on Hidden Markov Models and Selected Applications in Speech Recognition . Proceedings of the IEEE, 77(2), 257--286. https://doi.org/10.1109/5.18626
41 Deerwester, S., Dumais, S. T., Furnas, G. W., Landauer, T. K., & Harshman, R. (1990). Indexing by Latent Semantic Analysis . Journal of the American Society for Information Science, 41(6), 391--407. https://doi.org/10.1002/(SICI)1097-4571(199009)41:6<391::AID-ASI1>3.0.CO;2-9
42 Brown, P. F., deSouza, P. V., Mercer, R. L., Della Pietra, V. J., & Lai, J. C. (1992). Class-Based n-gram Models of Natural Language . Computational Linguistics, 18(4), 467--479. https://aclanthology.org/J92-4003/
43 Hochreiter, S. (1991). Untersuchungen zu dynamischen neuronalen Netzen . Diplomarbeit, Technische Universität München. https://www.bioinf.jku.at/publications/older/3804.pdf
44 Gers, F. A., Schraudolph, N. N., & Schmidhuber, J. (2002). Learning Precise Timing with LSTM Recurrent Networks . JMLR, 3, 115--143. https://jmlr.org/papers/v3/gers02a.html
45 Graves, A., & Schmidhuber, J. (2005). Framewise Phoneme Classification with Bidirectional LSTM and Other Neural Network Architectures . Neural Networks, 18(5--6), 602--610. https://doi.org/10.1016/j.neunet.2005.06.042
46 Gehring, J., Auli, M., Grangier, D., Yarats, D., & Dauphin, Y. N. (2017). Convolutional Sequence to Sequence Learning . ICML 2017. arXiv:1705.03122. https://arxiv.org/abs/1705.03122
47 Kalchbrenner, N., Espeholt, L., Simonyan, K., van den Oord, A., Graves, A., & Kavukcuoglu, K. (2016). Neural Machine Translation in Linear Time . arXiv:1610.10099. https://arxiv.org/abs/1610.10099
48 Cheng, J., Dong, L., & Lapata, M. (2016). Long Short-Term Memory-Networks for Machine Reading . EMNLP 2016. arXiv:1601.06733. https://arxiv.org/abs/1601.06733
49 Parikh, A. P., Täckström, O., Das, D., & Uszkoreit, J. (2016). A Decomposable Attention Model for Natural Language Inference . EMNLP 2016. arXiv:1606.01933. https://arxiv.org/abs/1606.01933
50 Lin, Z., Feng, M., dos Santos, C. N., Yu, M., Xiang, B., Zhou, B., & Bengio, Y. (2017). A Structured Self-attentive Sentence Embedding . ICLR 2017. arXiv:1703.03130. https://arxiv.org/abs/1703.03130
51 Paulus, R., Xiong, C., & Socher, R. (2018). A Deep Reinforced Model for Abstractive Summarization . ICLR 2018. arXiv:1705.04304. https://arxiv.org/abs/1705.04304
52 Kingma, D. P., & Ba, J. (2015). Adam: A Method for Stochastic Optimization . ICLR 2015. arXiv:1412.6980. https://arxiv.org/abs/1412.6980
53 He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep Residual Learning for Image Recognition . CVPR 2016. arXiv:1512.03385. https://arxiv.org/abs/1512.03385
54 Ba, J. L., Kiros, J. R., & Hinton, G. E. (2016). Layer Normalization . arXiv:1607.06450. https://arxiv.org/abs/1607.06450
55 McCann, B., Bradbury, J., Xiong, C., & Socher, R. (2017). Learned in Translation: Contextualized Word Vectors . NIPS 2017. arXiv:1708.00107. https://arxiv.org/abs/1708.00107
56 Tay, Y., Dehghani, M., Tran, V. Q., Garcia, X., Bahri, D., Schuster, T., Zheng, H.-T., Houlsby, N., & Metzler, D. (2022). Unifying Language Learning Paradigms . arXiv:2205.05131. https://arxiv.org/abs/2205.05131
57 Porian, T., Wortsman, M., Jitsev, J., Schmidt, L., & Zaken, E. B. (2024). Resolving Discrepancies in Compute-Optimal Scaling of Language Models . NeurIPS 2024. arXiv:2406.19146. https://arxiv.org/abs/2406.19146
58 Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S., et al. (2022). Emergent Abilities of Large Language Models . TMLR. arXiv:2206.07682. https://arxiv.org/abs/2206.07682
59 Schaeffer, R., Miranda, B., & Koyejo, S. (2023). Are Emergent Abilities of Large Language Models a Mirage? NeurIPS 2023. arXiv:2304.15004. https://arxiv.org/abs/2304.15004
60 Sanh, V., Webson, A., Raffel, C., Bach, S. H., Sutawika, L., Alyafeai, Z., et al. (2022). Multitask Prompted Training Enables Zero-Shot Task Generalization . ICLR 2022. arXiv:2110.08207. https://arxiv.org/abs/2110.08207
61 Christiano, P. F., Leike, J., Brown, T. B., Martic, M., Legg, S., & Amodei, D. (2017). Deep Reinforcement Learning from Human Preferences . NIPS 2017. arXiv:1706.03741. https://arxiv.org/abs/1706.03741
62 Ziegler, D. M., Stiennon, N., Wu, J., Brown, T. B., Radford, A., Amodei, D., Christiano, P., & Irving, G. (2019). Fine-Tuning Language Models from Human Preferences . arXiv:1909.08593. https://arxiv.org/abs/1909.08593
63 Liu, P., Yuan, W., Fu, J., Jiang, Z., Hayashi, H., & Neubig, G. (2023). Pre-train, Prompt, and Predict: A Systematic Survey of Prompting Methods in Natural Language Processing . ACM Computing Surveys, 55(9), 1--35. arXiv:2107.13586. https://arxiv.org/abs/2107.13586
64 Schmidhuber, J. (1992). Learning to Control Fast-Weight Memories: An Alternative to Dynamic Recurrent Networks . Neural Computation, 4(1), 131--139. https://doi.org/10.1162/neco.1992.4.1.131
65 Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E., Le, Q., & Zhou, D. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models . NeurIPS 2022. arXiv:2201.11903. https://arxiv.org/abs/2201.11903
66 Wang, Y., Mishra, S., Alipoormolabashi, P., Kordi, Y., Mirzaei, A., Arunkumar, A., et al. (2022). Super-NaturalInstructions: Generalization via Declarative Instructions on 1600+ NLP Tasks . EMNLP 2022. arXiv:2204.07705. https://arxiv.org/abs/2204.07705
67 OpenAI. (2022-11-30). Introducing ChatGPT . https://openai.com/index/chatgpt/
68 Koehn, P., Och, F. J., & Marcu, D. (2003). Statistical Phrase-Based Translation . NAACL 2003, 127--133. https://aclanthology.org/N03-1017/