<七>从3秒记忆到过目不忘——语言模型的三代进化

上篇https://www.cnblogs.com/webor2006/p/22389647学了语言模型是什么------就是对"下一个词出现的概率"进行数学建模。但这事说起来简单,做起来一点都不简单。怎么建这个模?计算机怎么"记住"前面说过的话?

这篇看看语言模型是怎么一步一步从"只能记住 3 个词"进化到"能理解整本书"的。

一、第一代:N-gram 模型(1990年代-2000年代)

最早的语言模型非常朴实,叫 N-gram 模型(1990年代-2000年代的主流)。

它的思路简单到粗暴:预测下一个词,只看前面 N-1 个词。

公式也很直接:

大白话解释一下:

复制代码
P(下一个词 | 前一个词) = 前一个词和下一个词一起出现的次数 / 前一个词出现的次数

比如一个 2-gram 模型(只看前 1 个词):

复制代码
如果训练数据里:
  "猫会" 后面是 "爬树" ------ 出现了 500 次
  "猫会" 后面是 "抓老鼠" ------ 出现了 300 次
  "猫会" 后面是 "飞" ------ 出现了 2 次
​
那模型就记住了:P(爬树|猫会) > P(抓老鼠|猫会) > P(飞|猫会)

听起来挺合理的对吧?但问题很快就来了。

想象这个句子:"昨天下午我去超市买了一堆东西,结账的时候发现忘带钱包了,尴尬得不行。回到家才发现,其实口袋里一直有______"

要填这个空,你得知道前面说的是"忘带钱包"不是"没带钱"------钱可能在口袋。但 N-gram 只看前面 2~3 个词,它只能看到"一直有",根本不知道前面在说忘带钱包的事。

就像一个记忆只有 3 秒的人,你跟他说了 10 句话,他只记得最后半句。 理解不了复杂的对话,说两句就跑偏。

二、第二代:RNN/LSTM(2010年代早期)

为了解决"记不住"的问题,研究者搞出了 RNN(循环神经网络)

RNN 的核心创新是加了一个"隐藏状态"------可以理解为模型边读边做笔记。每读一个词,就更新一下笔记。理论上只要笔记记得好,它就能记住整个历史。

但实际上呢?信息在传递过程中会衰减。每经过一层,信息都要乘以一个小于 1 的系数(比如 0.9):

复制代码
传 1 层后:0.9^1 = 0.9   → 还剩 90%
传 10 层后:0.9^10 ≈ 0.35 → 只剩 35%
传 100 层后:0.9^100 ≈ 0.00003 → 几乎没了

就像传话游戏------十个人排成一排传一句话:

复制代码
第 1 个人:"今晚去万达吃火锅,记得带充电宝和优惠券"
第 2 个人:"今晚去万达吃火锅,记得带充电宝" ← "优惠券"丢了
第 3 个人:"今晚去万达吃火锅" ← "充电宝"也丢了
第 5 个人:"今晚去吃火锅" ← "万达"没了
第 10 个人:"今晚吃饭" ← 只剩俩字

传着传着,信息就消失殆尽了。

为了解决这个问题,又搞出了 LSTM(长短期记忆网络)。它加了三个"门":

  • 遗忘门:哪些旧信息可以忘了?

  • 输入门:哪些新信息值得记住?

  • 输出门:当前应该关注什么?

就像你听课做笔记------你不会把老师说的每个字都记下来。你会判断哪个是重点(输入门),哪个可以划掉(遗忘门),哪些要画星号(输出门)。

这一搞,把记忆从 10~20 个词提升到了 100~200 个词。就像一个记忆从 3 秒变成 20 分钟的人------能看懂一集动漫了,但一部两小时的电影还是不行。

三、第三代:Transformer(2017年至今)

2017 年,Transformer 横空出世。它用一种叫 Self-Attention(自注意力) 的机制,彻底解决了"记不住"的问题。

这里先建个框架,Transformer 和 Self-Attention 后面会单独拆开细学,现在有个整体印象就行。

以前的模型是"传话模式"------信息一个接一个往后传,传着传着就丢了。Transformer 把模式改了:不传话了,所有人围着一张圆桌坐下,你想跟谁说话直接说,每个人都听得到每个人。

就像一个圆桌会议。A 说"昨天我在公园遇到了老张",B 说"他看起来很开心",C 说"他在上海工作"------不管谁说、说什么、离你多远,你全能直接听到。不需要中间人转述。

Transformer 更厉害的地方在于,它不仅让所有词互相"听到",还能让每个词智能地关注重点。

比如要预测"老张**__**"------模型会自动把注意力分配给"开心"(情绪线索)、"上海"(地点线索)、"公园"(场景线索)、"老张"(指代对象)。它能同时抓住多个维度的信息,综合判断。

具体来说,当模型处理"老张"这个词时,它对前面各个词的注意力分配大概是这样的:

复制代码
"老张"对各个词的注意力权重:
──────────────────────────
昨天:      2%  ← 不太相关
公园:      5%  ← 场景线索
遇到了:    3%
老朋友:    8%
老张:     65%  ← 指代对象,高度相关!
上海:      5%  ← 地点线索
工作:      7%
很开心:    5%  ← 情绪线索
──────────────────────────

它不会只盯着一个词,而是从多个维度同时抓取信息,综合起来做出判断。

这就是为什么 ChatGPT 能记住几万字的上下文------因为它站在 Transformer 的肩膀上,从"传话游戏"变成了"圆桌会议"。GPT-4 支持 128,000 个 token 的上下文,靠的就是这层能力。

Self-Attention 有四个核心优势:

  • 无损传递:任意两个词之间直接连接,不需要中间人转述

  • 智能筛选:自动计算哪些词重要,把注意力放在关键位置

  • 并行计算:所有词可以同时处理,不像 RNN 必须一个一个来

  • 无限长度(理论上):不管句子多长,每个词都能直接"看到"所有其他词

ChatGPT 就是基于 Transformer 的语言模型。从传话到群聊,这不只是技术升级,是范式的革命。

四、"大"语言模型:为什么非得这么大?

经常听到"大语言模型"(LLM,Large Language Model)这个词。这个"大"到底是什么意思?

"大"就是参数多。

来看一组数字:

复制代码
GPT-1 (2018):         1.17 亿参数
GPT-2 (2019):         15 亿参数
GPT-3 (2020):         1750 亿参数
GPT-4 (2023):         约 1.8 万亿参数
GPT-4o (2024):        约 1.8 万亿参数
GPT-5 (2025):         约 2 万亿参数

从 GPT-1 到 GPT-5,参数增长了约 17000 倍。光是从 GPT-1 到 GPT-3,仅仅两年时间参数就涨了约 1500 倍。这还不算训练数据------GPT-2 "读"过约 40GB 文本(相当于 80 本百万字小说),GPT-3 读了 570GB(1140 本),GPT-4/5 的具体数据没有公开,但只会更大。

除了 OpenAI,这两年大家比较熟悉的还有这些:

复制代码
DeepSeek-V3 (2024):    6710 亿参数(MoE 架构,激活 370 亿)
DeepSeek-V4-Flash:     未公开参数,速度更快
Qwen2.5 (2024):        720 亿参数(阿里通义千问)
Google Gemini 3 (2025):     1 万亿参数
Claude 4 (Anthropic, 2025): 约 1.5 万亿参数

DeepSeek 可能大家印象最深------2025 年初那波热度,让很多人都知道了国产大模型也能做到世界一流水平。

为什么要这么大?因为上篇学的那个"大力出奇迹"效应:规模达到某个临界点后,能力会突然跃升。 不是"大一点好一点"的线性增长,而是过了某个坎,模型突然就会了------这种现象叫"涌现能力"。后面会专门学到,这里先有个印象。

所以"大"不是虚荣,是必需。没有这个"大",就没有 ChatGPT 的智能。

那多大算大?行业里有个约定俗成的分界线:

  • 小语言模型(SLM,小于 100 亿参数):如 ChatGLM-6B、Mistral-7B、LLaMA-2-7B,轻量级,能在个人电脑或手机上跑

  • 中型(100 亿~1000 亿) :如 LLaMA-2-70B、Qwen-72B,需要多块 GPU,但仍能本地部署

  • 大语言模型(LLM,大于 1000 亿):如 GPT-3/4/5,需要巨型计算集群,通常只能通过云服务访问

这个区分决定了能力边界,也决定了用在哪儿:

对于 ChatGPT 来说,它确实是一个"大"语言模型。

不过有个有意思的趋势:"小而精"正在崛起。

以前觉得模型越大越好,但最近发现小模型也可以很强。比如 Qwen2.5-7B 在很多任务上表现不输大模型,手机就能跑;Llama-3.2-3B 只有 30 亿参数,日常问答也够用了。

这说明"大"不是唯一的路。更好的训练方法、数据质量、模型架构同样重要。未来大概率是"大小共存":大模型做通用智能助手,小模型做手机端、隐私敏感场景的专用任务。

五、GPT 和 ChatGPT,不是一个东西

最后学一个容易搞混的点。

GPT 是模型,ChatGPT 是产品。

GPT-1、GPT-2、GPT-3、GPT-3.5、GPT-4、GPT-4o、GPT-5------这些是技术名称,指的是基础语言模型。它们只经过预训练,核心能力就是"预测下一个词",只会"接龙"。参数规模从 1.17 亿一路涨到 2 万亿,数据量从 40GB 涨到不敢公开,但本质没变------都是"下一个词预测器"。

如果你直接问 GPT-3:"怎么做红烧肉?"它可能这样接------

"怎么做红烧肉?这个问题很多人问过。首先你需要准备五花肉......"

或者:

"怎么做红烧肉?我也不知道,我从来没做过饭......"

它只是在接龙,不知道你在提问,不知道要给出答案。

为什么会这样?因为纯语言模型的训练目标只有一个------"预测下一个词"。它在海量互联网文本里见过各种开头:

  • 有文章以"怎么做红烧肉?这个问题......"开头

  • 有论坛帖子是"怎么做红烧肉?我也不知道......"

  • 有网页列举"怎么做红烧肉?怎么......"

它把输入当成一篇文章的开头,顺着往下写。它不知道你在问问题,也不知道要给出答案。

而 ChatGPT(对话模型)会这样回应:

"做红烧肉可以参考以下步骤:

  1. 准备食材:五花肉 500g、冰糖、八角、桂皮、生抽、老抽、料酒

  2. 焯水:五花肉切块,冷水下锅,加姜片和料酒,煮开后撇去浮沫,捞出备用

  3. 炒糖色:锅里放少许油,加冰糖小火慢炒,炒到琥珀色时下肉块翻炒上色

  4. 炖煮:加生抽、老抽、八角、桂皮,倒入热水没过肉,大火烧开转小火炖 40 分钟

  5. 收汁:开大火收汁,汤汁浓稠后出锅

你是第一次做吗?要不要我讲得再细一点?"

它理解了你在提问,知道要给出结构化的步骤,甚至还会反问,引导对话继续。

ChatGPT 不一样。ChatGPT 不是模型名,是产品名。它的公式是:

复制代码
ChatGPT = 基础模型 + 对话训练

举个具体的例子就清楚了:

  • 早期 ChatGPT = GPT-3.5 + 对话训练

  • 后来 ChatGPT = GPT-4 + 对话训练

  • 现在 ChatGPT = GPT-4o/GPT-5 + 对话训练

同一个公式,换不同的基础模型,就是不同时期的 ChatGPT。

但这个"对话训练"到底包含什么?拆开来看是两个步骤:

  • SFT(监督微调):拿人工标注的"问题-标准答案"数据来训练,让模型学会"问答模式"

  • RLHF(人类反馈强化学习):让人给模型的多个回答打分排序,再用强化学习优化,让输出更符合人类偏好

后面会细学这两个步骤,现在知道它们的存在就行。

简单说:GPT 只会接龙,ChatGPT 学会了聊天。 产品化的最后一公里,比技术突破更重要。

这篇学了语言模型的三代进化。N-gram 只能看前面几个词,RNN/LSTM 能记 100~200 个词但信息会衰减,Transformer 用 Self-Attention 彻底解决了记忆问题。模型做大之后,参数从 1 亿到 2 万亿,新的能力自己冒出来。最后容易搞混的一点:GPT 只会接龙,ChatGPT 是加了对话训练之后才会聊天的。

下一篇见,加油~

相关推荐
TechEdu2026061 小时前
[人工智能]SciPy在工程计算中的作用与实践
人工智能·ai·scipy
七牛云行业应用1 小时前
DeepSeek Harness vs Codex vs Claude Code:三款 AI 编程 Harness 深度对比
人工智能·agent·ai编程
无凭1 小时前
拆解 DeerFlow Memory:Agent 的长期记忆到底怎么做?
人工智能·设计模式
格尔曼Noah2 小时前
文本转音频技术选型指南:2026年主流TTS与端到端语音大模型深度对比
人工智能·语音识别
hans汉斯2 小时前
采煤工作面隐患目标检测中YOLO11与Faster R-CNN的对比研究
人工智能·目标检测·计算机视觉·cnn·信息与通信·信号处理
神奇小汤圆2 小时前
从 0 用 AgentTeams 搭一个多 Agent 模拟面试系统
人工智能
潘正翔2 小时前
DeepSeek Harness从0到1部署
人工智能·开发·codex·deepseek·harness·deepseekharness·cludecode
bulingg2 小时前
bert输入长度有限,如何处理超长文本?
人工智能·深度学习·bert
神奇小汤圆2 小时前
DeepSeek Harness 这波,搞得全世界都在安装 Node.js
人工智能