【FDE系列】阶段1Day 7:LLM 本质 — 文字接龙机器

📚前言

📒FDE系列内容总纲:

【大纲】FDE 前沿部署工程师学习系列教程-CSDN博客

🚄前置课程列表:

【FDE系列】阶段1Day 1:AI 层级关系 --- 四个嵌套的圈-CSDN博客

【FDE系列】阶段1Day 2:AI 三阶段发展史 --- 会认 → 会判断 → 会创造-CSDN博客

【FDE系列】阶段1Day 3:符号 AI vs 机器学习 --- 两条路线的本质区别-CSDN博客

【FDE系列】阶段1Day 4:Transformer 的历史意义 --- 2017 年的分水岭-CSDN博客

【FDE系列】阶段1Day 5:本周复习与自测 --- 检验你的 AI 认知地基-CSDN博客

【FDE系列】阶段1Day 6:Transformer 架构 --- 一张图纸盖出千千万万栋楼-CSDN博客

🚀阶段1Day 7:LLM 本质 --- 文字接龙机器

FDE 学习系列教程 · 第一阶段 · 第 2 周 · Day 2 预计时长:2 小时 | 难度:★★☆☆☆ | 前置知识:Day 6(Transformer 架构)


🧑‍🤝‍🧑 老哥开场白

兄弟,今天这节课可能会颠覆你对 AI 的认知。

你用 ChatGPT、DeepSeek 的时候,是不是觉得它像个人?有思维、有知识、有判断?

真相是:它干的事情,本质上就是------文字接龙。

你给一段话,它接着往下写。就这么简单。

不信?今天我给你掰开揉碎了讲。讲完你就明白,为什么 AI 会"一本正经胡说八道",为什么它"知道"的东西不一定对。


🎯 核心概念:大语言模型 = 文字接龙机器

📝 什么是"文字接龙"?

大语言模型(LLM)做的事情,用最朴素的话说就是:

给你一段文字,我接着往下写。

举几个例子:

复制代码
你输入:"今天天气很好,我想"
模型接:  "去公园散步,顺便买杯咖啡。"

你输入:"客户提交了工单,系统自动将工单"
模型接:  "分配给对应的技术支持组,并根据问题类型设置优先级。"

你输入:"def hello():"
模型接:  "    print('Hello, World!')"

它在做什么?每次都在做"选择题"------在所有可能的下一个字里,根据上下文挑出最合理的那个。

🔁 逐字生成的过程

模型不是"想好整段话再输出",而是一个字一个字地往外吐

复制代码
第 1 步:你输入 "今天天气很好,我想"
            ↓
         模型预测下一个字 → "去"(概率最高)
            
第 2 步:现在有 "今天天气很好,我想去"
            ↓
         模型预测下一个字 → "公"(概率最高)
            
第 3 步:现在有 "今天天气很好,我想去公"
            ↓
         模型预测下一个字 → "园"(概率最高)

         ......一直到模型认为该停了

亲眼看看 :打开 DeepSeek 或豆包,问它"讲一个关于猫的故事",盯着屏幕看它一个字一个字往外吐------那就是"接龙"在实时发生。


🎓 模型是怎么学会接龙的?

📚 训练阶段:读了整个互联网

模型怎么学会"接龙"的?靠海量阅读 + 完形填空

复制代码
┌──────────────────────────────────────────────────┐
│              训练过程(简化版)                    │
│                                                  │
│  第 1 步:收集海量文本                            │
│  📖 维基百科  📚 书籍  🌐 网页  💻 代码            │
│  📰 新闻  📝 论文  ......总计数万亿字                  │
│                                                  │
│  第 2 步:做"完形填空"                            │
│                                                  │
│  原文: "秦始皇统一六国,建立了中国历史上          │
│         第一个中央集权的王朝"                      │
│                                                  │
│  遮住:"秦始皇统一六国,建立了中国历史上            │
│         第一个中央集权的___"                       │
│                                                  │
│  模型猜:"王朝"?→ 对了 ✅ → 奖励,加强这个连接    │
│  模型猜:"国家"?→ 错了 ❌ → 惩罚,弱化这个连接    │
│                                                  │
│  第 3 步:重复几十亿次                             │
│  🔄🔄🔄🔄🔄🔄🔄🔄🔄🔄🔄🔄                          │
│                                                  │
│  最终:模型学会了"什么字接什么字最通顺"             │
└──────────────────────────────────────────────────┘

类比:就像你小时候做语文试卷的完形填空------给一句话挖空,让你填。做了一亿道题之后,你闭着眼都能填对大部分。但你不一定真的"理解"了文章的意思------你只是"做多了题,有语感"。

🎮 使用阶段:你给开头,模型续写

训练完之后,模型就上线了。你每次用 ChatGPT/DeepSeek:

复制代码
你的输入:"请帮我写一份关于设备维护的周报"
    ↓
模型看到了这段文字,开始"接龙":
    "本周设备维护工作总结如下:\n\n一、维护概况\n..."
    ↓
一个字一个字往外吐

注意:模型不知道你在"写周报"。它只知道------"请帮我写一份关于设备维护的周报"这段文字后面,最通顺的接续是什么。


⚠️ "通顺" ≠ "正确"

这是今天最重要的一句话:

模型学到的是"什么字接什么字最通顺",而不是"什么是真的"。

这就是幻觉的根源。明天 Day 9 会专门讲幻觉,今天先埋个种子。

🌡️ 举个例子

你问模型:"李白是哪年去世的?"

模型学过的文本里可能有"李白"和"762 年"经常一起出现,所以它接出"李白于 762 年去世"------这个碰巧是对的。

但如果你问一个训练数据里没覆盖的问题,比如"我们公司去年 Q3 的营收是多少"------模型不知道。但它不会说"不知道",它会"接"出一段通顺的、看起来合理的话。

类比:你问一个读了很多书但没读过你公司财报的人"你们公司 Q3 营收多少"。他不会说"我不知道"------他会猜一个看起来合理的数字,说得还挺有底气。


🌡️ 温度:控制模型的"创意"

🎯 什么是温度?

模型每次生成下一个字时,会给出多个候选字和它们的概率。温度(Temperature) 决定模型是"保守"还是"放飞"。

复制代码
你输入:"秋天来了,树叶"

┌──────────────────────────────────────────────┐
│  候选下一个字    │  概率                     │
├──────────────────┼───────────────────────────┤
│  "黄了"          │  85%  ← 概率最高          │
│  "红了"          │  10%                      │
│  "落了"          │  3%                       │
│  "开始跳舞"      │  1%                       │
│  "飞起来了"      │  0.5%                     │
└──────────────────────────────────────────────┘

温度 = 0:永远选概率最高的 → "黄了"
    📌 结果稳定、确定,但没创意

温度 = 0.7:大概率选"黄了",偶尔选别的 → 有变化
    📌 写作、聊天最常用

温度 = 1.0:更随机,可能选"落了"甚至"开始跳舞"
    📌 更有创意,但可能跑偏

温度 = 2.0:完全放飞,什么都可能出来
    🔥 乱来了

🌡️ 温度选择指南

温度 效果 适用场景 比喻
0 确定性,每次结果一样 事实问答、代码生成 🤖 严肃的会计
0.3 基本稳定,略有变化 客服回复、摘要 🧑‍💼 稳重的秘书
0.7 有创意但不离谱 写作、聊天、头脑风暴 🎨 有分寸的创意总监
1.0+ 随机性强 诗意创作、发散思考 🎭 随性的艺术家

FDE 提示:做业务系统时,温度一般设 0-0.3------你要的是稳定靠谱,不是天马行空。


🚫 大模型不是什么

这三个认知对 FDE 极其重要:

❌ 大模型不是数据库

复制代码
你以为的:  问模型 → 模型从数据库查答案 → 返回
实际上的:  问模型 → 模型根据训练数据"接龙" → 返回

模型没有数据库。它的"知识"来自训练数据------训练完就固定了。
你公司的内部数据、最新报表、实时库存------模型统统不知道。

类比:模型像一个"读了很多书但没见过你公司内部资料的人"。你问他通用知识他能答,但你问"我们部门的报销流程"------他不知道。

❌ 大模型不是搜索引擎

复制代码
你以为的:  问模型 → 模型上网搜 → 返回搜索结果
实际上的:  问模型 → 模型根据记忆"接龙" → 返回

模型不会自动上网搜索。它的知识有截止时间。
除非你给它工具(这就是后面要学的 Tool Use 和 RAG)。

❌ 大模型不是计算器

复制代码
你输入:"123 × 456 = ?"
模型接:  "55488"

模型不是真的算的------它是"接龙"接出来的。
碰巧接对了,但复杂计算经常接错。
所以大模型做数学计算不靠谱。

类比:你问一个人"123 乘 456 等于多少"。他没算,是凭记忆猜的------猜对猜错全看运气。


🛠️ 动手实践

任务 1:观察逐字输出 🔍

打开 DeepSeek(https://chat.deepseek.com)或豆包(https://www.doubao.com),输入:

复制代码
请给我讲一个关于一只猫和一条鱼的故事

盯着屏幕看。你会看到文字一个字一个字往外吐------那就是"接龙"在实时发生。

想象一下:模型每次只预测下一个字,然后把它加到输入里,再预测下一个字......如此循环。

任务 2:完形填空体验 📝

给模型一段话,中间挖空,让它填:

复制代码
请补全以下句子,在空格处填入合适的词:

1. 客户提交了工单,系统自动将工单______给对应的______组
2. 本周设备运行______,共发生______次故障
3. 财务部门已完成Q3报表______,预计本周______提交

观察模型怎么根据上下文"接龙"填空。注意:不同次问,答案可能不同------因为温度参数引入了随机性。

任务 3:连续接龙实验 🔄

给模型一个开头,让它自己续写 5 次:

复制代码
请用"会议室里突然安静了下来"开头,写一段话。
  • 连续发 3 次同一个 Prompt

  • 观察 3 次结果是否一样

  • 如果不一样------为什么?(提示:温度)


📝 今天学到了什么

知识点 一句话总结
LLM 本质 文字接龙机器------给一段话,接着往下写
训练过程 海量文本 + 完形填空,重复几十亿次
通顺 ≠ 正确 模型追求"通顺",不追求"正确"
温度 控制随机性:0=确定,高=有创意但可能跑偏
不是数据库 知识来自训练数据,不知道你的内部数据
不是搜索引擎 不会自动上网,知识有截止时间
不是计算器 "接龙"接出来的数字,不是真算的

📚 推荐学习资源

资源 类型 时长 链接
Andrej Karpathy "Let's build the GPT Tokenizer" 视频 ~2h B站/YouTube(深入但精彩)
腾讯云 ADP FDE 课程 Ch01 L1.2 视频 ~15min 腾讯云教育平台
Karpathy "Intro to Large Language Models" 视频 ~1h YouTube(经典入门演讲)

💭 今日反思

  1. 如果大语言模型的本质是"文字接龙",那它"知道"的东西是真的知道吗?

  2. "通顺不等于正确"这一点,对你设计 AI 应用有什么警示?

  3. 客户问你"AI 到底会不会出错",你怎么回答?


明天预告:今天你知道了模型是"文字接龙机器"。明天咱聊一个更具体的问题------模型是怎么"读"你的话的?它不认字,它认的是"Token"。一个中文字可能要花 2 个 Token,一个 emoji 可能花 4 个 Token。Token = 钱。你得知道怎么数。


FDE 学习系列教程 · 第一阶段 · 第 2 周 Day 2 · 完

相关推荐
iNeuOS工业互联网1 小时前
大模型(DeepSeek)辅助 3D 实时建模 + 拖拽配置:业务可视化应用快速构建实践(标注、巡检与视角控制等)
人工智能·物联网·3d·语言模型·工业互联网
7177771 小时前
Git自建用什么工具比较好?2025主流方案对比与选型指南
人工智能·gitee
whaosoft-1431 小时前
51c自动驾驶~合集67
人工智能
资讯综合1 小时前
国内AI原生公司观察:联想集团业务重构与MiniMax模型研发
人工智能
江畔柳前堤1 小时前
On-Policy Distillation 全景深潜
人工智能·网络协议·目标检测·http·机器学习·chatgpt·重构
计算机编程-吉哥1 小时前
深度学习:我用YOLO11-L做了一个水下垃圾检测系统 对比YOLOv8-L/Faster R-CNN【计算机毕业设计选题推荐】
人工智能·深度学习·yolo·课程设计·计算机毕业设计选题
小刘快学习1 小时前
批量推理的吞吐优化:聚合平台怎么做
人工智能
IvorySQL1 小时前
PostgreSQL 日报|8 字节 TOAST 值支持(9 月 16 日)
数据库·人工智能·postgresql
ai小陈2 小时前
LTX2.5音视频生成任务验收实战:批量记录与音画质量检查
人工智能·python·深度学习·ai·音视频·gpu算力