上篇https://www.cnblogs.com/webor2006/p/22389647学了语言模型是什么------就是对"下一个词出现的概率"进行数学建模。但这事说起来简单,做起来一点都不简单。怎么建这个模?计算机怎么"记住"前面说过的话?
这篇看看语言模型是怎么一步一步从"只能记住 3 个词"进化到"能理解整本书"的。
一、第一代:N-gram 模型(1990年代-2000年代)
最早的语言模型非常朴实,叫 N-gram 模型(1990年代-2000年代的主流)。
它的思路简单到粗暴:预测下一个词,只看前面 N-1 个词。
公式也很直接:

大白话解释一下:
P(下一个词 | 前一个词) = 前一个词和下一个词一起出现的次数 / 前一个词出现的次数
比如一个 2-gram 模型(只看前 1 个词):
如果训练数据里:
"猫会" 后面是 "爬树" ------ 出现了 500 次
"猫会" 后面是 "抓老鼠" ------ 出现了 300 次
"猫会" 后面是 "飞" ------ 出现了 2 次
那模型就记住了:P(爬树|猫会) > P(抓老鼠|猫会) > P(飞|猫会)
听起来挺合理的对吧?但问题很快就来了。
想象这个句子:"昨天下午我去超市买了一堆东西,结账的时候发现忘带钱包了,尴尬得不行。回到家才发现,其实口袋里一直有______"
要填这个空,你得知道前面说的是"忘带钱包"不是"没带钱"------钱可能在口袋。但 N-gram 只看前面 2~3 个词,它只能看到"一直有",根本不知道前面在说忘带钱包的事。
就像一个记忆只有 3 秒的人,你跟他说了 10 句话,他只记得最后半句。 理解不了复杂的对话,说两句就跑偏。
二、第二代:RNN/LSTM(2010年代早期)
为了解决"记不住"的问题,研究者搞出了 RNN(循环神经网络)。
RNN 的核心创新是加了一个"隐藏状态"------可以理解为模型边读边做笔记。每读一个词,就更新一下笔记。理论上只要笔记记得好,它就能记住整个历史。
但实际上呢?信息在传递过程中会衰减。每经过一层,信息都要乘以一个小于 1 的系数(比如 0.9):
传 1 层后:0.9^1 = 0.9 → 还剩 90%
传 10 层后:0.9^10 ≈ 0.35 → 只剩 35%
传 100 层后:0.9^100 ≈ 0.00003 → 几乎没了
就像传话游戏------十个人排成一排传一句话:
第 1 个人:"今晚去万达吃火锅,记得带充电宝和优惠券"
第 2 个人:"今晚去万达吃火锅,记得带充电宝" ← "优惠券"丢了
第 3 个人:"今晚去万达吃火锅" ← "充电宝"也丢了
第 5 个人:"今晚去吃火锅" ← "万达"没了
第 10 个人:"今晚吃饭" ← 只剩俩字
传着传着,信息就消失殆尽了。
为了解决这个问题,又搞出了 LSTM(长短期记忆网络)。它加了三个"门":
-
遗忘门:哪些旧信息可以忘了?
-
输入门:哪些新信息值得记住?
-
输出门:当前应该关注什么?
就像你听课做笔记------你不会把老师说的每个字都记下来。你会判断哪个是重点(输入门),哪个可以划掉(遗忘门),哪些要画星号(输出门)。
这一搞,把记忆从 10~20 个词提升到了 100~200 个词。就像一个记忆从 3 秒变成 20 分钟的人------能看懂一集动漫了,但一部两小时的电影还是不行。
三、第三代:Transformer(2017年至今)
2017 年,Transformer 横空出世。它用一种叫 Self-Attention(自注意力) 的机制,彻底解决了"记不住"的问题。
这里先建个框架,Transformer 和 Self-Attention 后面会单独拆开细学,现在有个整体印象就行。
以前的模型是"传话模式"------信息一个接一个往后传,传着传着就丢了。Transformer 把模式改了:不传话了,所有人围着一张圆桌坐下,你想跟谁说话直接说,每个人都听得到每个人。
就像一个圆桌会议。A 说"昨天我在公园遇到了老张",B 说"他看起来很开心",C 说"他在上海工作"------不管谁说、说什么、离你多远,你全能直接听到。不需要中间人转述。
Transformer 更厉害的地方在于,它不仅让所有词互相"听到",还能让每个词智能地关注重点。
比如要预测"老张**__**"------模型会自动把注意力分配给"开心"(情绪线索)、"上海"(地点线索)、"公园"(场景线索)、"老张"(指代对象)。它能同时抓住多个维度的信息,综合判断。
具体来说,当模型处理"老张"这个词时,它对前面各个词的注意力分配大概是这样的:
"老张"对各个词的注意力权重:
──────────────────────────
昨天: 2% ← 不太相关
公园: 5% ← 场景线索
遇到了: 3%
老朋友: 8%
老张: 65% ← 指代对象,高度相关!
上海: 5% ← 地点线索
工作: 7%
很开心: 5% ← 情绪线索
──────────────────────────
它不会只盯着一个词,而是从多个维度同时抓取信息,综合起来做出判断。
这就是为什么 ChatGPT 能记住几万字的上下文------因为它站在 Transformer 的肩膀上,从"传话游戏"变成了"圆桌会议"。GPT-4 支持 128,000 个 token 的上下文,靠的就是这层能力。
Self-Attention 有四个核心优势:
-
无损传递:任意两个词之间直接连接,不需要中间人转述
-
智能筛选:自动计算哪些词重要,把注意力放在关键位置
-
并行计算:所有词可以同时处理,不像 RNN 必须一个一个来
-
无限长度(理论上):不管句子多长,每个词都能直接"看到"所有其他词
ChatGPT 就是基于 Transformer 的语言模型。从传话到群聊,这不只是技术升级,是范式的革命。

四、"大"语言模型:为什么非得这么大?
经常听到"大语言模型"(LLM,Large Language Model)这个词。这个"大"到底是什么意思?
"大"就是参数多。
来看一组数字:
GPT-1 (2018): 1.17 亿参数
GPT-2 (2019): 15 亿参数
GPT-3 (2020): 1750 亿参数
GPT-4 (2023): 约 1.8 万亿参数
GPT-4o (2024): 约 1.8 万亿参数
GPT-5 (2025): 约 2 万亿参数
从 GPT-1 到 GPT-5,参数增长了约 17000 倍。光是从 GPT-1 到 GPT-3,仅仅两年时间参数就涨了约 1500 倍。这还不算训练数据------GPT-2 "读"过约 40GB 文本(相当于 80 本百万字小说),GPT-3 读了 570GB(1140 本),GPT-4/5 的具体数据没有公开,但只会更大。
除了 OpenAI,这两年大家比较熟悉的还有这些:
DeepSeek-V3 (2024): 6710 亿参数(MoE 架构,激活 370 亿)
DeepSeek-V4-Flash: 未公开参数,速度更快
Qwen2.5 (2024): 720 亿参数(阿里通义千问)
Google Gemini 3 (2025): 1 万亿参数
Claude 4 (Anthropic, 2025): 约 1.5 万亿参数
DeepSeek 可能大家印象最深------2025 年初那波热度,让很多人都知道了国产大模型也能做到世界一流水平。
为什么要这么大?因为上篇学的那个"大力出奇迹"效应:规模达到某个临界点后,能力会突然跃升。 不是"大一点好一点"的线性增长,而是过了某个坎,模型突然就会了------这种现象叫"涌现能力"。后面会专门学到,这里先有个印象。

所以"大"不是虚荣,是必需。没有这个"大",就没有 ChatGPT 的智能。
那多大算大?行业里有个约定俗成的分界线:
-
小语言模型(SLM,小于 100 亿参数):如 ChatGLM-6B、Mistral-7B、LLaMA-2-7B,轻量级,能在个人电脑或手机上跑
-
中型(100 亿~1000 亿) :如 LLaMA-2-70B、Qwen-72B,需要多块 GPU,但仍能本地部署
-
大语言模型(LLM,大于 1000 亿):如 GPT-3/4/5,需要巨型计算集群,通常只能通过云服务访问
这个区分决定了能力边界,也决定了用在哪儿:

对于 ChatGPT 来说,它确实是一个"大"语言模型。
不过有个有意思的趋势:"小而精"正在崛起。
以前觉得模型越大越好,但最近发现小模型也可以很强。比如 Qwen2.5-7B 在很多任务上表现不输大模型,手机就能跑;Llama-3.2-3B 只有 30 亿参数,日常问答也够用了。
这说明"大"不是唯一的路。更好的训练方法、数据质量、模型架构同样重要。未来大概率是"大小共存":大模型做通用智能助手,小模型做手机端、隐私敏感场景的专用任务。

五、GPT 和 ChatGPT,不是一个东西
最后学一个容易搞混的点。
GPT 是模型,ChatGPT 是产品。
GPT-1、GPT-2、GPT-3、GPT-3.5、GPT-4、GPT-4o、GPT-5------这些是技术名称,指的是基础语言模型。它们只经过预训练,核心能力就是"预测下一个词",只会"接龙"。参数规模从 1.17 亿一路涨到 2 万亿,数据量从 40GB 涨到不敢公开,但本质没变------都是"下一个词预测器"。
如果你直接问 GPT-3:"怎么做红烧肉?"它可能这样接------
"怎么做红烧肉?这个问题很多人问过。首先你需要准备五花肉......"
或者:
"怎么做红烧肉?我也不知道,我从来没做过饭......"
它只是在接龙,不知道你在提问,不知道要给出答案。
为什么会这样?因为纯语言模型的训练目标只有一个------"预测下一个词"。它在海量互联网文本里见过各种开头:
-
有文章以"怎么做红烧肉?这个问题......"开头
-
有论坛帖子是"怎么做红烧肉?我也不知道......"
-
有网页列举"怎么做红烧肉?怎么......"
它把输入当成一篇文章的开头,顺着往下写。它不知道你在问问题,也不知道要给出答案。
而 ChatGPT(对话模型)会这样回应:
"做红烧肉可以参考以下步骤:
准备食材:五花肉 500g、冰糖、八角、桂皮、生抽、老抽、料酒
焯水:五花肉切块,冷水下锅,加姜片和料酒,煮开后撇去浮沫,捞出备用
炒糖色:锅里放少许油,加冰糖小火慢炒,炒到琥珀色时下肉块翻炒上色
炖煮:加生抽、老抽、八角、桂皮,倒入热水没过肉,大火烧开转小火炖 40 分钟
收汁:开大火收汁,汤汁浓稠后出锅
你是第一次做吗?要不要我讲得再细一点?"
它理解了你在提问,知道要给出结构化的步骤,甚至还会反问,引导对话继续。
ChatGPT 不一样。ChatGPT 不是模型名,是产品名。它的公式是:
ChatGPT = 基础模型 + 对话训练
举个具体的例子就清楚了:
-
早期 ChatGPT = GPT-3.5 + 对话训练
-
后来 ChatGPT = GPT-4 + 对话训练
-
现在 ChatGPT = GPT-4o/GPT-5 + 对话训练
同一个公式,换不同的基础模型,就是不同时期的 ChatGPT。
但这个"对话训练"到底包含什么?拆开来看是两个步骤:
-
SFT(监督微调):拿人工标注的"问题-标准答案"数据来训练,让模型学会"问答模式"
-
RLHF(人类反馈强化学习):让人给模型的多个回答打分排序,再用强化学习优化,让输出更符合人类偏好
后面会细学这两个步骤,现在知道它们的存在就行。
简单说:GPT 只会接龙,ChatGPT 学会了聊天。 产品化的最后一公里,比技术突破更重要。
这篇学了语言模型的三代进化。N-gram 只能看前面几个词,RNN/LSTM 能记 100~200 个词但信息会衰减,Transformer 用 Self-Attention 彻底解决了记忆问题。模型做大之后,参数从 1 亿到 2 万亿,新的能力自己冒出来。最后容易搞混的一点:GPT 只会接龙,ChatGPT 是加了对话训练之后才会聊天的。
下一篇见,加油~