大模型预训练:模型到底在学习什么

目录

  • [1. 引言:从"记住"到"理解"的错觉](#1. 引言:从“记住”到“理解”的错觉)
  • [2. 预训练的根本目标:概率分布的逼近](#2. 预训练的根本目标:概率分布的逼近)
    • [2.1 语言建模任务](#2.1 语言建模任务)
    • [2.2 最大似然估计](#2.2 最大似然估计)
    • [2.3 从损失函数到梯度更新:模型如何"进步"](#2.3 从损失函数到梯度更新:模型如何“进步”)
  • [3. 模型在学习什么:三个层次的能力](#3. 模型在学习什么:三个层次的能力)
    • [3.1 表层:统计共现与搭配](#3.1 表层:统计共现与搭配)
    • [3.2 中层:上下文模式与语义框架](#3.2 中层:上下文模式与语义框架)
    • [3.3 深层:世界知识与推理捷径](#3.3 深层:世界知识与推理捷径)
  • [4. 学习过程的本质:从嵌入到注意力](#4. 学习过程的本质:从嵌入到注意力)
    • [4.1 词嵌入空间的几何结构](#4.1 词嵌入空间的几何结构)
    • [4.2 注意力头的专业化分工](#4.2 注意力头的专业化分工)
    • [4.3 多层堆叠与抽象层次](#4.3 多层堆叠与抽象层次)
  • [5. 案例分析:从下一个 token 预测看学习内容](#5. 案例分析:从下一个 token 预测看学习内容)
  • [6. 局限与反思:模型不会"真正理解"](#6. 局限与反思:模型不会“真正理解”)
  • [7. 总结](#7. 总结)
  • [8. 延伸思考](#8. 延伸思考)

1. 引言:从"记住"到"理解"的错觉

大模型的表现往往让人产生一种错觉:它似乎"记住"了海量文本,然后像人类一样"理解"并回答。比如,ChatGPT 能写诗、GPT-4 能解数学题,甚至在某些专业考试中超越人类平均水平。但预训练阶段,模型究竟在学习什么?它真的在存储知识,还是仅仅学会了统计规律?

事实上,预训练过程并没有让模型"理解"世界,而是让模型学会了语言序列的概率分布。模型之所以能回答"法国的首都是巴黎",不是因为它翻过地理课本,而是因为在数以亿计的训练文本中,"法国"和"巴黎"经常以特定模式共现。本文将从预训练的目标、学习机制和内部表征三个层面,揭开大模型在黑箱中的学习本质,帮助读者建立对模型能力的正确认知。

2. 预训练的根本目标:概率分布的逼近

2.1 语言建模任务

几乎所有大模型预训练的核心任务都是自回归语言建模 (Autoregressive Language Modeling)。给定一个文本序列 x = ( x 1 , x 2 , ... , x T ) x = (x_1, x_2, \dots, x_T) x=(x1,x2,...,xT),模型要学习的是条件概率分布:

P ( x t ∣ x < t ; θ ) P(x_t | x_{<t}; \theta) P(xt∣x<t;θ)

其中 x < t x_{<t} x<t 表示 t t t 时刻之前的所有 token, θ \theta θ 是模型参数。这个公式的含义是:模型在看到前面的 token 后,要预测下一个 token 是什么。例如,给定"今天天气很",模型可能预测"好"的概率为 0.6,"热"的概率为 0.3,等等。

训练数据通常来自互联网文本、书籍、代码等,总 token 数可达数万亿。模型通过一遍又一遍地"猜下一个词",逐渐学会语言的规律。

2.2 最大似然估计

预训练的过程就是最大化训练数据中所有序列的似然概率,相当于最小化交叉熵损失:

L ( θ ) = − ∑ x ∈ D ∑ t = 1 T log ⁡ P ( x t ∣ x < t ; θ ) \mathcal{L}(\theta) = -\sum_{x \in \mathcal{D}} \sum_{t=1}^{T} \log P(x_t | x_{<t}; \theta) L(θ)=−x∈D∑t=1∑TlogP(xt∣x<t;θ)

换句话说,模型在学习训练数据中 token 序列的联合概率分布。它不是在学习"事实",而是在学习"下一个 token 有多大概率是什么"。这种目标函数决定了模型的核心能力:生成与训练数据风格一致的文本,而不是保证事实正确。

2.3 从损失函数到梯度更新:模型如何"进步"

实际训练中,每一步都包含以下过程:

  1. 前向传播:输入一批文本,模型计算每个位置的预测概率分布。
  2. 计算损失:将预测概率与真实的下一个 token 对比,得到交叉熵损失。
  3. 反向传播:计算损失对每个参数的梯度。
  4. 参数更新:用优化器(如 AdamW)沿梯度方向微调参数,使损失降低。

随着训练步数增加,模型对训练数据的"困惑度"(Perplexity)逐渐下降,生成的文本越来越接近真实文本的统计特征。这个过程中,模型只是不断地压缩训练数据的统计规律,并没有被显式地教导任何事实。

3. 模型在学习什么:三个层次的能力

3.1 表层:统计共现与搭配

模型学到的第一层是词与词之间的统计共现关系。例如,"北京"后面经常跟着"是"、"的"、"市"等。这类似于 n-gram 统计,但 Transformer 的自注意力机制能捕捉更长距离的依赖,远远超越传统的 5-gram 或 7-gram 模型。

  • 语法约束:模型隐式学会了主谓宾、时态、语序等语法规则。它不会写出"我饭吃"这样的句子,因为这种排列在训练数据中极少出现。
  • 习惯搭配:固定短语、成语、术语搭配等。例如"人工智能"很少被拆开,模型会倾向于将它们作为一个整体预测。
  • 局部流畅性:模型能生成流畅的句子,因为它在预测每个词时都充分考虑了上下文,避免了不通顺的表达。

3.2 中层:上下文模式与语义框架

超越表层搭配后,模型在注意力头中构建了上下文相关的语义表征。此时模型学到的不是孤立的词义,而是"词在特定上下文中的含义"。例如,"苹果"在"吃苹果"和"苹果手机"中是完全不同的语义,模型通过上下文能区分这两种含义。

  • 语义角色:一个词是施事、受事还是工具。例如"我用锤子砸钉子",模型知道"我"是施事,"锤子"是工具,"钉子"是受事。
  • 指代消解:"他"、"它"、"这个"等在文本中指向哪个实体。模型能够跨越多句话追踪同一个实体,这是长文本理解的基础。
  • 文本结构:段落逻辑、因果关系、转折对比等篇章模式。模型能识别出"首先......然后......最后"的叙述顺序,或者"虽然......但是"的转折关系。

3.3 深层:世界知识与推理捷径

预训练模型在一定程度上"压缩"了训练数据中的事实知识:

  • 实体关联:巴黎 - 法国 - 埃菲尔铁塔之间的关联强度。模型在大量旅游、历史文本中看到这些实体反复共现,形成了高维空间中的邻近关系。
  • 常识推理:下雨会打伞、饿了会吃饭等日常常识。这些知识来自故事、对话、百科等文本,模型通过统计学会了这些常识性关联。
  • 推理模式:数学推导、逻辑三段论、代码执行流程等。有趣的是,模型并非真正执行逻辑推理,而是学到了推理的"模板"。例如,当它看到"如果A>B且B>C"时,会预测"A>C",因为这种模式在训练数据中很常见。

但需要注意,这些"知识"本质上是概率分布下的涌现行为,而非显式存储。模型通过拟合海量文本中的共现模式,形成了可以泛化的推理"捷径"。一旦问题的分布与训练数据偏差较大,模型就可能给出错误答案,这也是大模型"幻觉"的根源之一。

4. 学习过程的本质:从嵌入到注意力

4.1 词嵌入空间的几何结构

预训练过程中,词嵌入(Token Embedding)会逐渐形成有意义的几何结构。例如,"国王 - 男人 + 女人 ≈ 女王"的类比关系,本质上是因为模型在优化过程中,将语义上相似的词映射到了相邻的高维向量空间区域。这种性质并非人为设计,而是优化语言建模目标的副产品------模型发现,将语义相关的词放在向量空间的相近位置,可以更高效地预测下一个 token。

4.2 注意力头的专业化分工

Transformer 的多个注意力头会自发分化出不同的功能:

  • 位置注意力:关注相邻词或固定距离的词。这种注意力头类似于卷积核,负责捕捉局部短语。
  • 句法注意力:关注同一短语或从句中的词。例如,模型会关注"the"和其修饰的名词,或者主语和谓语动词。
  • 语义注意力:关注有语义关联的词,即使距离很远。例如,在长文本中,模型会关注"它"所指代的实体,即使该实体出现在前一段。

这种分化不是在训练前人为指定的,而是梯度下降在优化语言建模目标时自然涌现的结果。不同的头在训练初期随机初始化,经过大量迭代后,逐渐"分工"以更好地完成预测任务。这种自发分化是 Transformer 强大表征能力的关键。

4.3 多层堆叠与抽象层次

Transformer 通常堆叠几十层甚至上百层,不同层关注的信息层次也不同。浅层倾向于捕捉词法和局部语法,中层关注句法结构,深层则编码更抽象的语义和知识。这种分层结构类似于人类从具象到抽象的认知过程,使得模型能够处理复杂的语言现象。

5. 案例分析:从下一个 token 预测看学习内容

假设输入序列为"法国的首都是",模型需要预测下一个 token。我们可以从三个层次观察模型的行为:

  1. 表层统计:模型知道"是"后面常跟地点名词,它会在所有可能的地点名词中分配概率,比如"巴黎"、"伦敦"、"东京"等。
  2. 语义框架:模型识别出"法国"是一个国家,"首都"是一种属性,因此它缩小了范围,重点关注与"法国"相关的城市名。
  3. 知识检索:模型在"参数化知识"中检索到"法国 - 首都 - 巴黎"的强关联,最终输出"巴黎"的概率最高。

整个过程中,模型并没有访问外部数据库,而是通过前向传播一次计算,从训练时学到的参数中"读取"了知识。这个"读取"本质上是神经网络中一系列矩阵乘法和非线性激活的复合结果,它将输入 token 序列映射到输出 token 的概率分布,整个过程完全基于统计规律。

6. 局限与反思:模型不会"真正理解"

尽管大模型的表现令人惊叹,但预训练阶段的学习依然存在本质局限:

  • 缺乏因果推理:模型学到的只是相关性,而不是因果链。天气热导致冰激凌销量上升,但模型可能反过来预测天气,因为它在训练数据中看到了"冰激凌销量高"和"天气热"的共现,却无法区分因果方向。
  • 幻觉问题:因为模型优化的目标是生成"像训练数据"的文本,而不是"符合事实"的文本,所以会自信地编造不存在的事实。当模型被问到它不知道的知识时,它不会说"我不知道",而是会生成一个统计上最合理的答案,尽管这个答案可能是错误的。
  • 知识截止:模型的知识被冻结在训练数据的时间点,无法实时更新。例如,GPT-4 的知识截止于 2023 年 4 月,之后发生的事件它一无所知(除非通过外部插件)。
  • 缺乏真实的意图理解:模型不理解人类交流中的隐含意图、幽默、讽刺等,它只是生成符合上下文模式的回复。因此,它可能被诱导产生有害或不当的内容。

7. 总结

大模型预训练的本质是在海量文本上最大化条件概率,从而学习到一个高度压缩的、可泛化的语言分布表征。这个表征包含了表层搭配、语义框架乃至世界知识,但它的底层仍然是统计规律,而非人类意义上的"理解"。理解这一点,有助于我们更合理地使用大模型,并看清其能力的边界:它擅长生成连贯、符合语法的文本,但在需要严谨推理、实时知识和真实意图理解的场景中,仍需谨慎对待。

8. 延伸思考

  • 如果预训练只学统计规律,那强化学习对齐(RLHF)又改变了什么?RLHF 本质上是在预训练模型的基础上,用人类偏好数据微调模型,使其输出更符合人类期望,这并不改变底层的统计本质,只是调整了输出分布。
  • 模型规模扩大时,会涌现出哪些新的学习能力?规模定律(Scaling Law)表明,随着参数量、数据量和计算量的增加,模型的能力会平滑提升,并在某些任务上突然出现"涌现",如代码生成、多语言翻译等。
  • 多模态预训练能否让模型获得更接近真实世界的"理解"?将文本与图像、视频等多模态数据对齐,或许能让模型学习到更丰富的语义关联,从而减少幻觉,增强对物理世界的常识推理。

这些问题将在后续的博客中继续探讨。

相关推荐
今天测什么4 分钟前
零基础教程:用豆包快速生成动漫视频
人工智能·科技·ai·动漫
MartinYeung511 分钟前
[论文学习]大语言模型越狱的机械可解释性:基于内部归因图的分析
人工智能·学习·语言模型
曾响铃13 分钟前
跻身世界人形机器人运动会工业场景赛全国前三,ROSS Harness 以全自主模式突破工业具身智能落地瓶颈
人工智能
学习星球22 分钟前
Dify深度剖析:可视化AI应用开发平台,从源码到实战
人工智能
AI大咖25 分钟前
降重侠AI怎么样?2026实测降AIGC率+论文降重真实效果
人工智能
XiHongShi201627 分钟前
51基础学习视频分享(2),三极管,点亮LED灯
单片机·学习
2401_8322981032 分钟前
AI安全治理:构建可控可信的智能时代新秩序
人工智能
本原财经36 分钟前
卖游戏、筹H股,昆仑万维临IPO磨AI含金量
人工智能·游戏
新新学长搞科研43 分钟前
【上海交通大学主办】第七届医学人工智能国际学术会议(ISAIMS 2026)
人工智能·医学
桃西西呀44 分钟前
GPT-5.6 的 ultra 模式凭什么开 4 个 Agent 并行跑?——多智能体协作,是把"一个聪明人"换成"一个团队"
人工智能·llm·agent