📚前言
📒FDE系列内容总纲:
🚄前置课程列表:
【FDE系列】阶段1Day 1:AI 层级关系 --- 四个嵌套的圈-CSDN博客
【FDE系列】阶段1Day 2:AI 三阶段发展史 --- 会认 → 会判断 → 会创造-CSDN博客
【FDE系列】阶段1Day 3:符号 AI vs 机器学习 --- 两条路线的本质区别-CSDN博客
【FDE系列】阶段1Day 4:Transformer 的历史意义 --- 2017 年的分水岭-CSDN博客
【FDE系列】阶段1Day 5:本周复习与自测 --- 检验你的 AI 认知地基-CSDN博客
【FDE系列】阶段1Day 6:Transformer 架构 --- 一张图纸盖出千千万万栋楼-CSDN博客
🚀阶段1Day 7:LLM 本质 --- 文字接龙机器
FDE 学习系列教程 · 第一阶段 · 第 2 周 · Day 2 预计时长:2 小时 | 难度:★★☆☆☆ | 前置知识:Day 6(Transformer 架构)
🧑🤝🧑 老哥开场白
兄弟,今天这节课可能会颠覆你对 AI 的认知。
你用 ChatGPT、DeepSeek 的时候,是不是觉得它像个人?有思维、有知识、有判断?
真相是:它干的事情,本质上就是------文字接龙。
你给一段话,它接着往下写。就这么简单。
不信?今天我给你掰开揉碎了讲。讲完你就明白,为什么 AI 会"一本正经胡说八道",为什么它"知道"的东西不一定对。
🎯 核心概念:大语言模型 = 文字接龙机器
📝 什么是"文字接龙"?
大语言模型(LLM)做的事情,用最朴素的话说就是:
给你一段文字,我接着往下写。
举几个例子:
你输入:"今天天气很好,我想"
模型接: "去公园散步,顺便买杯咖啡。"
你输入:"客户提交了工单,系统自动将工单"
模型接: "分配给对应的技术支持组,并根据问题类型设置优先级。"
你输入:"def hello():"
模型接: " print('Hello, World!')"
它在做什么?每次都在做"选择题"------在所有可能的下一个字里,根据上下文挑出最合理的那个。
🔁 逐字生成的过程
模型不是"想好整段话再输出",而是一个字一个字地往外吐:
第 1 步:你输入 "今天天气很好,我想"
↓
模型预测下一个字 → "去"(概率最高)
第 2 步:现在有 "今天天气很好,我想去"
↓
模型预测下一个字 → "公"(概率最高)
第 3 步:现在有 "今天天气很好,我想去公"
↓
模型预测下一个字 → "园"(概率最高)
......一直到模型认为该停了
亲眼看看 :打开 DeepSeek 或豆包,问它"讲一个关于猫的故事",盯着屏幕看它一个字一个字往外吐------那就是"接龙"在实时发生。
🎓 模型是怎么学会接龙的?
📚 训练阶段:读了整个互联网
模型怎么学会"接龙"的?靠海量阅读 + 完形填空。
┌──────────────────────────────────────────────────┐
│ 训练过程(简化版) │
│ │
│ 第 1 步:收集海量文本 │
│ 📖 维基百科 📚 书籍 🌐 网页 💻 代码 │
│ 📰 新闻 📝 论文 ......总计数万亿字 │
│ │
│ 第 2 步:做"完形填空" │
│ │
│ 原文: "秦始皇统一六国,建立了中国历史上 │
│ 第一个中央集权的王朝" │
│ │
│ 遮住:"秦始皇统一六国,建立了中国历史上 │
│ 第一个中央集权的___" │
│ │
│ 模型猜:"王朝"?→ 对了 ✅ → 奖励,加强这个连接 │
│ 模型猜:"国家"?→ 错了 ❌ → 惩罚,弱化这个连接 │
│ │
│ 第 3 步:重复几十亿次 │
│ 🔄🔄🔄🔄🔄🔄🔄🔄🔄🔄🔄🔄 │
│ │
│ 最终:模型学会了"什么字接什么字最通顺" │
└──────────────────────────────────────────────────┘
类比:就像你小时候做语文试卷的完形填空------给一句话挖空,让你填。做了一亿道题之后,你闭着眼都能填对大部分。但你不一定真的"理解"了文章的意思------你只是"做多了题,有语感"。
🎮 使用阶段:你给开头,模型续写
训练完之后,模型就上线了。你每次用 ChatGPT/DeepSeek:
你的输入:"请帮我写一份关于设备维护的周报"
↓
模型看到了这段文字,开始"接龙":
"本周设备维护工作总结如下:\n\n一、维护概况\n..."
↓
一个字一个字往外吐
注意:模型不知道你在"写周报"。它只知道------"请帮我写一份关于设备维护的周报"这段文字后面,最通顺的接续是什么。
⚠️ "通顺" ≠ "正确"
这是今天最重要的一句话:
模型学到的是"什么字接什么字最通顺",而不是"什么是真的"。
这就是幻觉的根源。明天 Day 9 会专门讲幻觉,今天先埋个种子。
🌡️ 举个例子
你问模型:"李白是哪年去世的?"
模型学过的文本里可能有"李白"和"762 年"经常一起出现,所以它接出"李白于 762 年去世"------这个碰巧是对的。
但如果你问一个训练数据里没覆盖的问题,比如"我们公司去年 Q3 的营收是多少"------模型不知道。但它不会说"不知道",它会"接"出一段通顺的、看起来合理的话。
类比:你问一个读了很多书但没读过你公司财报的人"你们公司 Q3 营收多少"。他不会说"我不知道"------他会猜一个看起来合理的数字,说得还挺有底气。
🌡️ 温度:控制模型的"创意"
🎯 什么是温度?
模型每次生成下一个字时,会给出多个候选字和它们的概率。温度(Temperature) 决定模型是"保守"还是"放飞"。
你输入:"秋天来了,树叶"
┌──────────────────────────────────────────────┐
│ 候选下一个字 │ 概率 │
├──────────────────┼───────────────────────────┤
│ "黄了" │ 85% ← 概率最高 │
│ "红了" │ 10% │
│ "落了" │ 3% │
│ "开始跳舞" │ 1% │
│ "飞起来了" │ 0.5% │
└──────────────────────────────────────────────┘
温度 = 0:永远选概率最高的 → "黄了"
📌 结果稳定、确定,但没创意
温度 = 0.7:大概率选"黄了",偶尔选别的 → 有变化
📌 写作、聊天最常用
温度 = 1.0:更随机,可能选"落了"甚至"开始跳舞"
📌 更有创意,但可能跑偏
温度 = 2.0:完全放飞,什么都可能出来
🔥 乱来了
🌡️ 温度选择指南
| 温度 | 效果 | 适用场景 | 比喻 |
|---|---|---|---|
| 0 | 确定性,每次结果一样 | 事实问答、代码生成 | 🤖 严肃的会计 |
| 0.3 | 基本稳定,略有变化 | 客服回复、摘要 | 🧑💼 稳重的秘书 |
| 0.7 | 有创意但不离谱 | 写作、聊天、头脑风暴 | 🎨 有分寸的创意总监 |
| 1.0+ | 随机性强 | 诗意创作、发散思考 | 🎭 随性的艺术家 |
FDE 提示:做业务系统时,温度一般设 0-0.3------你要的是稳定靠谱,不是天马行空。
🚫 大模型不是什么
这三个认知对 FDE 极其重要:
❌ 大模型不是数据库
你以为的: 问模型 → 模型从数据库查答案 → 返回
实际上的: 问模型 → 模型根据训练数据"接龙" → 返回
模型没有数据库。它的"知识"来自训练数据------训练完就固定了。
你公司的内部数据、最新报表、实时库存------模型统统不知道。
类比:模型像一个"读了很多书但没见过你公司内部资料的人"。你问他通用知识他能答,但你问"我们部门的报销流程"------他不知道。
❌ 大模型不是搜索引擎
你以为的: 问模型 → 模型上网搜 → 返回搜索结果
实际上的: 问模型 → 模型根据记忆"接龙" → 返回
模型不会自动上网搜索。它的知识有截止时间。
除非你给它工具(这就是后面要学的 Tool Use 和 RAG)。
❌ 大模型不是计算器
你输入:"123 × 456 = ?"
模型接: "55488"
模型不是真的算的------它是"接龙"接出来的。
碰巧接对了,但复杂计算经常接错。
所以大模型做数学计算不靠谱。
类比:你问一个人"123 乘 456 等于多少"。他没算,是凭记忆猜的------猜对猜错全看运气。
🛠️ 动手实践
任务 1:观察逐字输出 🔍
打开 DeepSeek(https://chat.deepseek.com)或豆包(https://www.doubao.com),输入:
请给我讲一个关于一只猫和一条鱼的故事
盯着屏幕看。你会看到文字一个字一个字往外吐------那就是"接龙"在实时发生。
想象一下:模型每次只预测下一个字,然后把它加到输入里,再预测下一个字......如此循环。
任务 2:完形填空体验 📝
给模型一段话,中间挖空,让它填:
请补全以下句子,在空格处填入合适的词:
1. 客户提交了工单,系统自动将工单______给对应的______组
2. 本周设备运行______,共发生______次故障
3. 财务部门已完成Q3报表______,预计本周______提交
观察模型怎么根据上下文"接龙"填空。注意:不同次问,答案可能不同------因为温度参数引入了随机性。
任务 3:连续接龙实验 🔄
给模型一个开头,让它自己续写 5 次:
请用"会议室里突然安静了下来"开头,写一段话。
-
连续发 3 次同一个 Prompt
-
观察 3 次结果是否一样
-
如果不一样------为什么?(提示:温度)
📝 今天学到了什么
| 知识点 | 一句话总结 |
|---|---|
| LLM 本质 | 文字接龙机器------给一段话,接着往下写 |
| 训练过程 | 海量文本 + 完形填空,重复几十亿次 |
| 通顺 ≠ 正确 | 模型追求"通顺",不追求"正确" |
| 温度 | 控制随机性:0=确定,高=有创意但可能跑偏 |
| 不是数据库 | 知识来自训练数据,不知道你的内部数据 |
| 不是搜索引擎 | 不会自动上网,知识有截止时间 |
| 不是计算器 | "接龙"接出来的数字,不是真算的 |
📚 推荐学习资源
| 资源 | 类型 | 时长 | 链接 |
|---|---|---|---|
| Andrej Karpathy "Let's build the GPT Tokenizer" | 视频 | ~2h | B站/YouTube(深入但精彩) |
| 腾讯云 ADP FDE 课程 Ch01 L1.2 | 视频 | ~15min | 腾讯云教育平台 |
| Karpathy "Intro to Large Language Models" | 视频 | ~1h | YouTube(经典入门演讲) |
💭 今日反思
如果大语言模型的本质是"文字接龙",那它"知道"的东西是真的知道吗?
"通顺不等于正确"这一点,对你设计 AI 应用有什么警示?
客户问你"AI 到底会不会出错",你怎么回答?
明天预告:今天你知道了模型是"文字接龙机器"。明天咱聊一个更具体的问题------模型是怎么"读"你的话的?它不认字,它认的是"Token"。一个中文字可能要花 2 个 Token,一个 emoji 可能花 4 个 Token。Token = 钱。你得知道怎么数。
FDE 学习系列教程 · 第一阶段 · 第 2 周 Day 2 · 完