第1章 大模型的本质:为什么"预测下一个词"能做出这么多事

一个真实的困惑

你有没有想过这样一件事:同一个AI模型,你让它写一首情诗,它能写;你让它帮你debug一段Python代码,它也能;你让它扮演一个刻薄的产品经理来审你的方案,它照样能演。

但如果你去查这个模型的训练目标,你会发现一件很朴素、甚至有点"寒酸"的事实------它被训练的任务只有一个:看到前面一段文字,猜下一个词是什么。

这就很奇怪了。猜词游戏,怎么就猜出了写诗、写代码、角色扮演这些看起来完全不同的能力?

这一章我们就把这件事拆开看。

图1-1:模型逐词预测的自回归生成过程

"猜词"到底是怎么猜的

先做一个简单的思想实验。假设你看到这样一句话的开头:

"北京烤鸭最正宗的做法是先..."

你的大脑会自动预测接下来大概率出现的词------"片皮""上桌""片皮鸭"之类。你不需要有人告诉你烤鸭的做法规则,你只是见过足够多类似的句子,所以能猜出大概率的延续。

大模型做的事情,本质上就是这个,只不过它"见过的句子"是互联网规模的文本------书籍、网页、代码、对话记录、论文,几万亿个词。它在训练过程中反复做一件事:给定前面的内容,预测下一个词最可能是什么,猜错了就调整一点参数,猜对了就强化这个倾向。这个过程重复万亿次。

关键的问题来了:为什么这么简单粗暴的一个任务,能训练出这么复杂的能力?

猜词猜到极致,就是理解

答案是:要把"猜下一个词"这件事做到极致,模型必须隐式地学会很多更深层的东西。

举个例子。如果训练数据里有这样的句子:

"小明比小红高,小红比小刚高,所以三个人中最高的是..."

模型要准确猜出下一个词是"小明",就不能只靠"哪个词出现频率高"这种表面统计。它必须在内部某种程度上建立起"比较关系"和"传递性"的表示------哪怕它从未被显式教过"传递性"这个逻辑概念。

同样的道理放大到写代码、写诗、角色扮演上:

要准确续写代码,模型必须内部编码了变量作用域、语法结构、常见bug模式的规律

要写出押韵又贴题的诗句,模型必须编码了音韵规律和意象的搭配习惯

要扮演一个刻薄的产品经理,模型必须编码了"刻薄"这种语气在词汇选择、句式上的统计特征

这些能力不是被"教"出来的,而是为了在海量数据上把"猜下一个词"这件事做对,模型被迫涌现出来的副产品。这也是为什么这个现象在学术圈被叫做"涌现能力"(emergent abilities)------训练目标很单一,但规模够大之后,复杂能力自己长出来了。

规模效应:为什么"越大越聪明"

这里有个直觉上的问题:既然原理这么简单,为什么早年的小模型做不到这些事,非要等到参数规模、数据规模都上去之后才行?

一个不严谨但好用的类比是:一个只读过几百本书的人,可能记得住一些具体的句子和套路,但很难总结出跨领域的抽象规律;而一个读过几百万本书、见过各种表达方式的人,大脑里会自然沉淀出更抽象、更通用的模式------不是记住了某句话,而是理解了某类结构

大模型的"规模效应"(scaling law)说的就是类似的事:当参数量和训练数据量同时跨过某个量级,模型内部就不再只是记住具体的词语搭配,而是开始编码更抽象的结构性规律------语法、逻辑关系、甚至某种程度的常识推理。这也是为什么GPT-3到GPT-4、以及后续各代模型的能力跃升,很大程度上是"堆规模"堆出来的,而不是算法发生了根本性的改变。

破除一个常见误解:AI是在"理解"吗

说到这里要泼一盆冷水。上面的解释容易让人产生一个误解:"哦,那模型内部其实是理解语言、理解世界的。"

严谨地说,这个说法部分成立,但很容易被过度解读。模型确实编码了大量结构性规律,这些规律在很多任务上表现得跟"理解"没有可观测的区别。但模型的底层机制,始终是概率预测------它没有一个独立于文本之外的"世界模型"在验证事实,它输出的是"统计上最可能接在这句话后面的词",而不是"经过事实核查后确认为真的词"。

这一点非常关键,因为它直接决定了下一章要讲的内容------为什么AI会一本正经地编造不存在的事实。你现在应该已经能猜到一部分原因了:因为对模型来说,一句话"读起来通顺、符合统计规律"和"内容是真的",本来就是两件不完全相关的事。

亲手验证一下

打开任意一个AI对话工具(ChatGPT、Claude都可以),输入一句话的开头,不要写完,比如:

"如果人类明天集体消失,地球上最先发生变化的是"

观察AI怎么续写这句话,然后换一种完全不同领域的开头再试一次,比如一句诗的开头、一段代码注释的开头。你会发现,AI在每种语境下都能"接得上茬",而这正是"猜词猜到极致"这件事最直观的体现------它不是在"查找答案",而是在续写最符合这段上下文统计规律的内容

如果你有API访问权限,还可以进一步观察每一步生成时候选词的概率分布(很多平台的开发者选项里能看到"logprobs"),你会看到模型在每个位置其实都是在一堆候选词里做加权选择,而不是唯一确定地"知道"该写什么。

今天你能带走的一个判断

下次看到AI给出一个让你惊艳或者让你困惑的回答时,先问自己一句:这更像是"它经过深思熟虑得出的结论",还是"这段上下文,统计上最可能接出来的内容"?

这个判断习惯,会在后面几章------尤其是讲幻觉、讲评测报告可信度的时候------变得非常有用。

相关推荐
敲代码的玉米C1 小时前
让两个模型一写一审
前端·人工智能·架构
程序员cxuan1 小时前
Claude Opus 5 的系统提示词被扒出来了
人工智能·后端·程序员
董员外1 小时前
RAG 系统进化论(十):可运营 RAG,从原型到长期运行的知识系统
人工智能·后端·设计模式
二川bro1 小时前
从零跑通大模型全流程:基于Qwen3‑0.6B微调中医模型并Docker部署
人工智能
网易云信1 小时前
权威认可!网易智企帝王蟹入选信通院《2026 智能体创新实践汇编》
人工智能·agent
吾鳴1 小时前
用一句话需求,做完一张 9:16 的 Skill 发布海报:我把设计生图交给 Agent 试了一次
人工智能·aigc·agent
yuluo_YX1 小时前
什么是 OpenAI Responses API?
人工智能·chatgpt
云浪1 小时前
从 0 到实战:掌握向量数据库 Milvus,构建 AI 应用的核心能力
javascript·数据库·人工智能
tachibana22 小时前
知识库文档上传接口
数据库·人工智能·大模型·llm