<六>ChatGPT到底叫什么?——语言模型

接着上篇<五>Token与幻觉------为什么ChatGPT聊着聊着就飘了继续,前几篇一直在说 ChatGPT 是"函数"、是"文字接龙"。说实话,这些说法虽然好理解,但总感觉不太正式------它到底有没有个正经的学名?

还真有,叫语言模型。这篇就来把这个名字掰开看看。

一、"模型"到底是什么意思?

先别急着看"语言",咱们先搞懂"模型"这个词。

生活里处处是模型。你手机上那个天气预报 App,它就是用一个数学模型算出来的------大气温度、气压、湿度、风速,几千个方程搅在一起,最后给你一个数:明天降雨概率 65%。

它完美吗?不完美。有用吗?太有用了------你知道明天出门要不要带伞。

再比如导航软件。它脑子里的"路网模型" 把真实世界简化成了点和线------路口是点,道路是线。真实的马路上有坑、有树、有突然窜出来的小狗,导航全不管,它只管哪条线最短。简化了,但够用。

所以"模型"的核心思路就一句话:把复杂到没法全搞懂的东西,抓几个关键点,用数学表达出来。

那"语言模型"呢?就是把"语言"这个复杂到离谱的东西,用数学来描述。

二、语言怎么用数学描述?

想想看,"说一句话"这件事有多复杂。

你发条朋友圈"今天 emo 了"------这四个字背后,有你的成长经历(学会了中文和网络文化),有你当下的情绪(低落、不想说太直白),有语言的演化(emo 从 emotional 缩略而来,在中文网络里变成了一个动词),还有你和你朋友之间的文化默契(他们知道这不是真抑郁,是一种轻松的自嘲)。

这事怎么用数学描述?好像完全不可能。

但语言模型给了一个极其聪明的角度:把语言看成一个概率问题。

什么意思?想象你正在写一句话,写到"今天天气"这四个字之后,下一个字可能是什么?

  • "真"------可能性挺大("今天天气真不错")

  • "很"------也常见("今天天气很好")

  • "糟"------有可能("今天天气糟糕")

  • "紫"------几乎不可能("今天天气紫色"?什么鬼)

下一个字不是确定的,是多种可能性各有一个概率。语言模型做的事,就是把这种概率分布算出来。用数学符号写就是:

复制代码
P(下一个词 | 前面说了什么)

翻译成人话:给定前面的话,下一个词出现的概率是多少。

比如:

复制代码
P(好 | 今天天气) = 0.35   →  "好"有35%的概率
P(很 | 今天天气) = 0.25   →  "很"有25%的概率
P(糟 | 今天天气) = 0.08   →  "糟"有8%的概率
P(紫 | 今天天气) = 0.0001 →  几乎不会选

这个概率分布不是随便给的,它编码了三种语言规律。

规律一:语法约束

为什么"紫"的概率那么低?因为中文语法不允许"天气"后面直接接颜色词。模型从海量文本里学到了"今天天气"后面通常接形容词,不接颜色,所以"紫"的概率被压到几乎为零。

规律二:语义连贯

"猫会()"------填什么?"爬树"、"抓老鼠"概率高,"飞"概率极低。不是语法不对("猫会飞"语法没毛病),是现实世界里猫不会飞。模型从数据里学到了这个常识。

规律三:上下文相关

同样都是"它的()",前面说的是"我买了一部新手机"还是"我做了一道菜",下一个词的概率分布完全不同------手机后面"屏幕"、"摄像头"概率高;菜后面"味道"、"卖相"概率高。模型会根据上下文自动切换。

所以语言模型的定义其实很简单:就是算"在某个上下文里,下一个词出现的概率"。

换个角度理解:语言模型做的事情就是把语法规则、常识逻辑、上下文关系------这些语言里看不见摸不着的规律------全部"浓缩"进了那一个个概率数字里。P(好|今天天气)=0.35,这一个数字背后,是模型从几千亿字的文本里学到的关于"今天天气"后面该接什么的所有知识。

三、75 年前就有人想到了

你可能以为语言模型是近几年才有的概念。其实它的思想早在 1948 年就被人提出来了------比 ChatGPT 早了整整 75 年。

这个人叫克劳德·香农,信息论之父。他在 1948 年发表了一篇划时代的论文《通信的数学理论》,里面藏了一个有趣的实验。

他让志愿者玩一个游戏:

给你一段英文文本的开头,比如 "THE ROOM WAS NOT VERY LIGHT A SMALL OBLONG READI___" 请你猜下一个字母是什么。猜对了继续猜下一个,猜错了就告诉你正确答案,然后接着猜。

结果呢?人类能相当准确地预测下一个字母------大部分人会猜 N、G,补全出 "READING"。

香农的核心洞察是:语言不是随机的,是有规律的,这个规律可以用概率来描述。 他甚至还给出了一个数学公式,来衡量语言的"不确定性"------也就是信息论里著名的"熵":

复制代码
H = -∑ P(x) × log P(x)

不用被公式吓到。它的意思其实很朴素:如果一个事件各种可能性越平均(比如抛硬币,正反各 50%),不确定性就越高,熵越大;如果某种可能性占绝对优势(比如"今天天气"后面接"好"的概率远高于"紫"),不确定性就低,熵越小。语言之所以能被预测,正是因为它的熵比完全随机要低得多------有规律可循。

这个公式,就是现代语言模型的数学基础。

更有意思的是,香农在 1948 年就预言了:

"如果我们能精确计算语言的概率分布,就能制造出一台'写作机器',生成像人类一样的文本。"

75 年后,ChatGPT 做到了。所以每次用 ChatGPT 的时候,不妨想一想------一个天才数学家,在计算机都还跟房间一样大的年代,已经在纸上画出了这一切的蓝图。

四、规律是"学"出来的,不是"编"出来的

学完定义,一个问题自然冒出来:这些语法规律、语义规律、上下文规律,是程序员一条一条写进去的吗?

完全不是。

没人告诉 ChatGPT"猫不会飞",没人告诉它"'的'不能跟在'喜欢'后面",没人告诉它"'它'要指代前面的名词"。

这些规律,全是模型自己从数据里"看"出来的。

怎么看的?统计。训练数据里有几千亿个词。"猫会爬树"出现了成百上千次,"猫会飞"几乎没出现过(除非童话故事)。"我喜欢吃"出现了几百万次,"我喜欢的吃"几乎没出现。

模型在训练过程中不断调整那 1750 亿个参数,逐渐"发现"了这些统计模式,然后把它们编码进参数里。最终你跟它说"猫会__",它给"爬树"高概率、给"飞"低概率------不是因为它理解猫不会飞,是因为数据里就是这么分布的。

这是一种思路上的彻底翻转。

传统的做法叫"演绎法":语言学家总结规则 → 程序员写成代码 → 计算机执行规则。问题是语言太复杂了------语法规则成千上万条,每条都有例外,而且"YYDS"、"绝绝子"这种新词天天在冒,规则永远追不上。

语言模型走的是"归纳法":给你海量文本 → 自己从里面找规律 → 规律自动"浮现"在参数里。

不需要任何人告诉它语法。它只需要做一件事:看足够多,然后统计。

这就是"大力出奇迹"的第一次体现------不是靠精巧的规则设计,而是靠海量数据加巨大算力。 当数据量足够大时,规律会自然浮现。这个思路看着"笨",但异常有效。这也是为什么大模型必须"大":不够大的话,规律就浮现不出来。

五、为什么归纳法更有效?

上面说了"归纳法"和"演绎法"两个路子。它们到底差在哪?说个具体例子就清楚了。

中文里"我吃饭"这三个字,排列组合有几种可能:

  • "我吃饭" ------ 正常,训练数据里出现了 500 万次

  • "我饭吃" ------ 别扭,只出现了 100 次(多半是打字错误)

  • "饭我吃完了" ------ 也正常,出现了 50 万次(话题前置,语法上叫"宾语提前")

如果用演绎法,语言学家得写一条规则说"'我'后面接'吃'再接'饭'概率高",再写一条例外规则说"但如果后面有'完了',那'饭'可以提前"。光这三个字就要写两条规则加例外。中文有多少个三字组合?规则写不完。

语言模型不需要任何人写规则。它就是把几千亿字的文本扫一遍,统计每种组合出现了多少次,概率自然就出来了。它不是在"学语法",是在"做统计"。做完了统计,语法就在里面了。

这就是归纳法的威力:不需要理解"为什么",只需要看"出现过多少次"。够多,就够准。

学到这,回头一看挺有意思------天气预报是模型,导航地图是模型,语言模型也是模型。本质上都是在干一件事:把复杂得没法全搞懂的东西,抓几个关键规律用数学表达出来。天气预报抓的是温度和气压,语言模型抓的是 P(下一个词|前文)。一个数字 0.35,背后是几千亿字文本里沉淀下来的语法、常识和上下文。更神奇的是,这些规律不是谁一条条写的------是模型自己从数据里"看"出来的。75 年前香农在纸上画出的蓝图,今天变成了真的。

下一篇见,加油~

相关推荐
dunge20261 小时前
ChatGPT Plus / Pro + Codex 技术深度解析:从 API 集成到性能优化与实战案例
人工智能·chatgpt
ʜᴇɴʀʏ1 小时前
ICCV 2025 | STEP-DETR:基于超级教师与伪标签引导文本查询的半监督目标检测
人工智能·目标检测·计算机视觉·transformer
必须会一定会1 小时前
用纯 HTML/JS 做一个 AI 需求澄清器:把模糊想法转换成可执行任务书
开发语言·前端·javascript·人工智能·html·ai编程
HyperAI超神经1 小时前
基于 Strassen 与 LCMA 低复杂度矩阵乘,腾讯 FalconGEMM 探索超越硬件峰值的矩阵乘优化
人工智能·线性代数·矩阵·智能体·推理·ai编译器
DeepIntelli1 小时前
品牌百科词条建设:从词条命名到提交的完整技术指南
人工智能
MindUp1 小时前
企业网盘选型的技术评估维度与主流产品架构简析
人工智能·安全·架构
狂师1 小时前
用AI做自动化测试,哪些是真不行,哪些是你不会用?
人工智能·面试·测试
小鹿软件办公2 小时前
微软 MAI-Image-2.6 正式发布,文字渲染与 3D 能力显著增强
人工智能·microsoft
zhangfeng11332 小时前
Windows AMD显卡跑PyTorch
人工智能·pytorch·windows