一个真实的困惑
你有没有想过这样一件事:同一个AI模型,你让它写一首情诗,它能写;你让它帮你debug一段Python代码,它也能;你让它扮演一个刻薄的产品经理来审你的方案,它照样能演。
但如果你去查这个模型的训练目标,你会发现一件很朴素、甚至有点"寒酸"的事实------它被训练的任务只有一个:看到前面一段文字,猜下一个词是什么。
这就很奇怪了。猜词游戏,怎么就猜出了写诗、写代码、角色扮演这些看起来完全不同的能力?
这一章我们就把这件事拆开看。

图1-1:模型逐词预测的自回归生成过程
"猜词"到底是怎么猜的
先做一个简单的思想实验。假设你看到这样一句话的开头:
"北京烤鸭最正宗的做法是先..."
你的大脑会自动预测接下来大概率出现的词------"片皮""上桌""片皮鸭"之类。你不需要有人告诉你烤鸭的做法规则,你只是见过足够多类似的句子,所以能猜出大概率的延续。
大模型做的事情,本质上就是这个,只不过它"见过的句子"是互联网规模的文本------书籍、网页、代码、对话记录、论文,几万亿个词。它在训练过程中反复做一件事:给定前面的内容,预测下一个词最可能是什么,猜错了就调整一点参数,猜对了就强化这个倾向。这个过程重复万亿次。
关键的问题来了:为什么这么简单粗暴的一个任务,能训练出这么复杂的能力?
猜词猜到极致,就是理解
答案是:要把"猜下一个词"这件事做到极致,模型必须隐式地学会很多更深层的东西。
举个例子。如果训练数据里有这样的句子:
"小明比小红高,小红比小刚高,所以三个人中最高的是..."
模型要准确猜出下一个词是"小明",就不能只靠"哪个词出现频率高"这种表面统计。它必须在内部某种程度上建立起"比较关系"和"传递性"的表示------哪怕它从未被显式教过"传递性"这个逻辑概念。
同样的道理放大到写代码、写诗、角色扮演上:
要准确续写代码,模型必须内部编码了变量作用域、语法结构、常见bug模式的规律
要写出押韵又贴题的诗句,模型必须编码了音韵规律和意象的搭配习惯
要扮演一个刻薄的产品经理,模型必须编码了"刻薄"这种语气在词汇选择、句式上的统计特征
这些能力不是被"教"出来的,而是为了在海量数据上把"猜下一个词"这件事做对,模型被迫涌现出来的副产品。这也是为什么这个现象在学术圈被叫做"涌现能力"(emergent abilities)------训练目标很单一,但规模够大之后,复杂能力自己长出来了。
规模效应:为什么"越大越聪明"
这里有个直觉上的问题:既然原理这么简单,为什么早年的小模型做不到这些事,非要等到参数规模、数据规模都上去之后才行?
一个不严谨但好用的类比是:一个只读过几百本书的人,可能记得住一些具体的句子和套路,但很难总结出跨领域的抽象规律;而一个读过几百万本书、见过各种表达方式的人,大脑里会自然沉淀出更抽象、更通用的模式------不是记住了某句话,而是理解了某类结构。
大模型的"规模效应"(scaling law)说的就是类似的事:当参数量和训练数据量同时跨过某个量级,模型内部就不再只是记住具体的词语搭配,而是开始编码更抽象的结构性规律------语法、逻辑关系、甚至某种程度的常识推理。这也是为什么GPT-3到GPT-4、以及后续各代模型的能力跃升,很大程度上是"堆规模"堆出来的,而不是算法发生了根本性的改变。
破除一个常见误解:AI是在"理解"吗
说到这里要泼一盆冷水。上面的解释容易让人产生一个误解:"哦,那模型内部其实是理解语言、理解世界的。"
严谨地说,这个说法部分成立,但很容易被过度解读。模型确实编码了大量结构性规律,这些规律在很多任务上表现得跟"理解"没有可观测的区别。但模型的底层机制,始终是概率预测------它没有一个独立于文本之外的"世界模型"在验证事实,它输出的是"统计上最可能接在这句话后面的词",而不是"经过事实核查后确认为真的词"。
这一点非常关键,因为它直接决定了下一章要讲的内容------为什么AI会一本正经地编造不存在的事实。你现在应该已经能猜到一部分原因了:因为对模型来说,一句话"读起来通顺、符合统计规律"和"内容是真的",本来就是两件不完全相关的事。
亲手验证一下
打开任意一个AI对话工具(ChatGPT、Claude都可以),输入一句话的开头,不要写完,比如:
"如果人类明天集体消失,地球上最先发生变化的是"
观察AI怎么续写这句话,然后换一种完全不同领域的开头再试一次,比如一句诗的开头、一段代码注释的开头。你会发现,AI在每种语境下都能"接得上茬",而这正是"猜词猜到极致"这件事最直观的体现------它不是在"查找答案",而是在续写最符合这段上下文统计规律的内容。
如果你有API访问权限,还可以进一步观察每一步生成时候选词的概率分布(很多平台的开发者选项里能看到"logprobs"),你会看到模型在每个位置其实都是在一堆候选词里做加权选择,而不是唯一确定地"知道"该写什么。
今天你能带走的一个判断
下次看到AI给出一个让你惊艳或者让你困惑的回答时,先问自己一句:这更像是"它经过深思熟虑得出的结论",还是"这段上下文,统计上最可能接出来的内容"?
这个判断习惯,会在后面几章------尤其是讲幻觉、讲评测报告可信度的时候------变得非常有用。