【边界层·算法&论文】第1期
Transformer、BERT、GPT-3:大模型时代的三块地基
编者按
AI 这两年变化快到让人疲劳:新模型、新产品、新概念几乎按周刷新。越是在这种时候,回头看几篇打地基的论文反而更有价值,因为它们解释了为什么今天的繁荣能发生、行业为何会沿着某些路线走到现在。
算法研究者和模型产品从业者对这些名字大多耳熟能详,但大量做应用的企业团队未必清楚:它们分别把哪一块硬条件补齐了。这个系列想做的,是用尽量低的门槛把关键拐点讲清楚,让你在面对新名词时能更快判断:哪些是结构性变化,哪些更像短期热闹。
如果你只想记住一句话,那就是:大模型生态今天看起来很热闹,其实建立在三次连续的确定性推进之上------可规模化的结构(Transformer)、可迁移的训练范式(BERT),以及无需为每个任务单独训练的使用方式(GPT-3 的 few-shot 与 prompt)。
一、2017:Transformer 让"把模型做大"在工程上变得合理
Transformer 之所以是拐点,不只是因为它在翻译任务上把指标推高了,更在于它把后续十年最关键的工程前提铺平了:训练要能并行、结构要能扩展,模型能力才可能持续上升。

图1:Transformer 架构图:Transformer 的 Encoder-Decoder 结构。对大多数读者来说,重要的不是每个方框的含义,而是整体的对称感------这种结构天然适合并行处理
《Attention Is All You Need》来自 Google Brain 与 Google Research 团队,作者包括 Ashish Vaswani、Noam Shazeer、Llion Jones、Aidan Gomez 等人。论文的核心动作很直接:把当时主流的循环与卷积序列结构拿掉,改用完全基于注意力机制的 Transformer,并在 WMT 2014 英德、英法机器翻译基准上刷新了 BLEU 成绩。但比刷分更值得关注的,是它大幅缩短了训练时间------并行化的结构让你不再被顺序计算卡住,这才是持续投入算力换能力的真正前提。
这一优势很快在生产环境中得到验证。Google 在 2019 年公开表示,Transformer 结构的引入是其翻译服务质量显著提升的关键原因之一。这和后来 BERT 进入 Search、Codex 驱动 Copilot 的落地,形成了一条清晰的论文到产品的主线。
对企业应用团队来说,这背后的含义很直接:从这一刻起,行业拥有了一条更可预期的路线------用更多数据与算力换取更强的通用能力,而不再被结构本身卡住。后来你看到的大模型军备竞赛,表面是算力与参数规模的竞赛,底层前提是结构先允许你这样扩展。
顺带一提,这篇论文还有一条更故事化的后续:它的影响大到改变了很多作者的人生轨迹。后来不少人陆续离开 Google,投身新公司或创业。Aidan Gomez 是其中之一,他后来参与创办了 Cohere,专注面向企业交付大模型能力------他也是论文发表时八位作者中最年轻的,彼时是多伦多大学的实习生。这些人物线索不影响你理解论文本身,但会让你更容易记住:这不是象牙塔里的推导,而是一条真实改变产业的主线。
二、2018/2019:BERT 把预训练→迁移变成默认流程,也更快走进产品
Transformer 解决的是结构能否扩展,BERT 推动的是能力能否复用。
在说 BERT 做了什么之前,有必要交代它的起点。2018 年初,AllenAI 的 ELMo(Peters et al.)和 fast.ai 的 ULMFiT(Howard & Ruder)已经在探索先预训练通用表征、再迁移到下游任务的路径,并取得了有说服力的结果。BERT 并没有凭空提出这条路线,但它是让这条路线变成行业默认选项的那个节点------用双向 Transformer 结构把效果做得足够强、足够通用,加上 Google 的体量背书与主动开源,将这套范式扩散成了行业共识。
BERT 的作者是来自 Google AI Language 团队的 Jacob Devlin 及其合作者。论文的核心套路是:先在大规模无标注文本上做预训练,得到通用表征,再在下游任务上做轻量微调,系统性地提升多个任务表现。

图2:BERT 预训练与微调流程图
时间节点上值得分开说:论文在 2018 年 10 月挂上 arXiv,同年 11 月 Google 宣布开源模型与代码,并在研究博客里强调这套方法能显著降低训练门槛;正式在 NAACL 发表是 2019 年,同年也进入了生产环境。
工业落点很典型。Google 在 2019 年公开写到,BERT 被用于 Search 的 ranking 与 featured snippets,并表示它能帮助 Search 更好理解美国英语环境下大约十分之一的查询。对企业团队来说,这件事的价值在于把论文和产品连起来看:BERT 改变了交付组织方式,从每个任务一套模型,走向底座加适配,让模型能力更像一种可以平台化的生产要素。
三、2020:GPT-3 把怎么用模型往前推了一步,prompt 变成现实接口
GPT-3 的变化发生在使用方式层面。但要理解这次变化为什么是质变,需要先交代它的来路。

图3:规模与能力的关系曲线
GPT-1(2018)已经在用语言模型做预训练;GPT-2(2019)展示了更强的文本生成能力,并因为 OpenAI 以危险性为由延迟发布这件事本身,在行业里引发了广泛讨论。GPT-3 的跨越,不只是参数从 15 亿涨到 1750 亿------它触及了一个规模阈值,在这个阈值上,模型开始展现出在小模型上完全看不到的行为,研究者后来把这类现象称为涌现能力(emergent abilities)。这层背景解释了为什么 GPT-3 之后,整个行业开始认真对待规模这件事。
《Language Models are Few-Shot Learners》训练了 175B 参数的 GPT-3,并在论文里强调:在 few-shot 设置下,模型可以在不做梯度更新、不微调的情况下完成多类任务。 这并不意味着模型从此可靠推理,但它让一种产品化路径开始成立:能力从研究资产变成了可以更广泛调用的接口。

图4:Few-shot / In-context Learning 示意图
这条路径很快对应到两个具体落点。
**第一是 API 化。**OpenAI 在 2020 年 6 月宣布 OpenAI API,当时运行的是 GPT-3 家族权重并做了吞吐等改进。到 2021 年,OpenAI 在《GPT-3 Powers the Next Generation of Apps》博客中提到已有 300 多个应用通过其 API 提供 GPT-3 能力。
**第二是把模型嵌入工作流。**Codex 论文里明确写到,一个生产版本的 Codex 驱动了 GitHub Copilot。这件事的意义在于,它把能力供给从 API 调用进一步推进到嵌入式交付:用户不需要理解模型,只需要在 IDE 里直接用。
四、把三块地基放在一起:它们分别改变了哪类确定性
这三篇论文之所以适合作为第一期,是因为它们分别补齐了三种不同的确定性条件,而且每一块都是下一块的前提。
Transformer 补的是工程前提。结构可以并行、可以规模化,训练时间大幅缩短,行业才有意愿持续投入数据与算力。没有这块地基,后面的一切都撑不住。
BERT 补的是复用前提。预训练加迁移成为默认流程之后,交付方式从每个任务单独训练,走向了底座加适配。开源这个动作同样关键------它让这套范式快速扩散,成为整个行业的共同起点,而不是停留在 Google 内部。
GPT-3 补的是接口前提。few-shot 与 prompt 达到可用阈值之后,能力开始以 API 的形式对外供给,并进一步嵌入到具体工具里。用户不再需要懂模型,模型开始进入普通人的工作流。
地基补得越稳,行业讨论的重心就越会从能力有没有,转移到成本、可靠性、治理和评估上。这也是后续几期的方向。
接下来会沿着同一条主线继续往下走:规模化为什么有效、边际在哪里;从能生成到可交付要补哪些机制;以及为什么检索、工具与多步任务会把系统边界不断外扩。
边界层笔记
-
Transformer 的核心贡献更接近工程前提:结构可规模化,行业才会愿意持续投入数据与算力。
-
BERT 让底座加适配成为默认交付范式,开源则把这条路线快速扩散成了行业共识。
-
GPT-3 把 few-shot 与 prompt 推到可用阈值,API 化与嵌入式交付随之加速。BERT 选择开源、GPT-3 选择以 API 供给,两条截然不同的扩散路径,已经预示了后来开源与闭源这条行业断层线的雏形。
参考资料
-
Vaswani et al., Attention Is All You Need, NeurIPS 2017.
-
Devlin et al., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding, arXiv 2018; NAACL 2019.
-
Google AI Blog: Open Sourcing BERT: State-of-the-Art Pre-training for Natural Language Processing, 2018.
-
Google Blog: Understanding searches better than ever before (BERT in Search), 2019.
-
Peters et al., Deep contextualized word representations (ELMo), NAACL 2018.
-
Howard & Ruder, Universal Language Model Fine-tuning for Text Classification (ULMFiT), ACL 2018.
-
Brown et al., Language Models are Few-Shot Learners (GPT-3), NeurIPS 2020.
-
OpenAI: Introducing the OpenAI API, 2020.
-
OpenAI: GPT-3 Powers the Next Generation of Apps, 2021.
-
Chen et al., Evaluating Large Language Models Trained on Code (Codex), 2021.
✍️ 科里笔记 Coralyx Notes,Written by 科里 Coralyx