📌 本课学习目标
学完这节课,你能搞明白以下问题:
- 大语言模型(LLM)到底是什么?它和我们平时用的输入法联想功能有什么区别?
- AI写文章是一口气写完的,还是一个字一个字"蹦"出来的?
- Token、上下文窗口、Temperature这些词是什么意思?
- ChatGPT、DeepSeek、文心一言、Kimi这些模型各有什么特点?怎么选?
🤔 课前思考
你打开ChatGPT或豆包,输入"帮我写一段产品介绍",几秒钟后,一段通顺流畅的文案就出来了。
但你有没有想过:
- AI是怎么知道该写什么内容的?它是不是从网上抄的?
- 它写出来的文字为什么读起来这么自然?像人写的?
- 同样的问题问两遍,为什么两次的回答不一样?
这节课,我们就来揭开大语言模型的"写作之谜"。
一、大语言模型(LLM)是什么?
LLM = Large Language Model = 大语言模型
拆开来看:
- 大:参数特别多(几十亿到上万亿个),训练数据特别大,几乎读了互联网上所有的文字
- 语言:专门处理文字内容,不处理图片、声音,那是其他模型的活
- 模型:经过训练的、能完成特定任务的AI系统
用一个类比来理解
大语言模型就像一个读过全世界所有书、看过所有文章的"超级语文老师"。
你问它任何问题,写文案、改论文、翻译语言、解释概念、甚至写代码,它都能应对。不是因为它"死记硬背"了所有内容,而是因为它已经从海量文字中学会了语言规律,能根据你的需求现场"创作"。
LLM的两大核心能力
| 能力 | 白话解释 | 生活例子 |
|---|---|---|
| 语言理解 | 能读懂你说什么、你的意思是什么 | 你说"帮我写个请假条,理由是感冒",它知道不是真的要请假,而是要生成一份请假条文本 |
| 语言生成 | 能根据理解的意思,组织出通顺的文字 | 输入"请假条"的要素,它输出格式规范的请假条全文 |
理解是前提,生成是结果,先听懂你说的,再给你写出你想要的。
二、LLM是怎么写文章的?------"逐字预测"的秘密
这是大语言模型最核心、也最反直觉的机制。
你以为的:AI"一口气"写出整篇文章
输入 → AI思考 → 完整文章输出
实际上的:AI每次只是在猜"下一个字"
输入:"今天天气真" → AI猜下一个字 → "好"
输入:"今天天气真好," → AI猜下一个字 → "适合"
输入:"今天天气真好,适合" → AI猜下一个字 → "出去"
输入:"今天天气真好,适合出去" → AI猜下一个字 → "走走"
... 一直猜到结束标记
没错,大语言模型生成文字的本质其实就是:根据前面的内容,预测下一个最可能出现的词,本质上是在进行概率预测!
为什么听起来这么自然?
因为AI读过海量的文字数据,它"知道"什么词后面通常应该跟什么词。
就像你说话的时候,也不是先想好整句话再说出来,而是一个词一个词地往外蹦。但因为你积累了多年的语言经验,说出来的话自然是通顺的。
AI也一样,它积累了几乎所有人类的文字经验,所以它"蹦"出来的词也是通顺的、有逻辑的。
一个关键参数:Temperature(温度值)
你问AI同一个问题,它为什么每次回答都不一样?这就跟Temperature有关。
| Temperature值 | 效果 | 类比 |
|---|---|---|
| 0 | 每次都选概率最高的词,结果最稳定、最保守 | 一个人做选择题永远选最确定的答案 |
| 0.7(常用) | 有一定随机性,既有创造性又不离谱 | 一个人说话偶尔换种说法 |
| 1.5 | 随机性很大,很有创造力但可能"胡说八道" | 一个人喝醉了说话天马行空 |
日常使用建议:写正式文档用0-0.3,写创意内容用0.7-1.0,不要超过1.5。
AI为什么不会"一直写下去"?
因为训练时,AI学会了识别"什么时候该停",当它预测到下一个词是特殊的"结束标记"时,就会停止生成,这就像你说话说到该停的地方自然就会停了一样。
三、三个核心技术概念(通俗版)
这三个概念你会在各种AI工具里反复遇到,搞懂了就不再迷糊。
概念一:Token------AI眼中的"词语单位"
你输入一段话给AI,AI不会按"字"来处理,而是按"Token"来处理。
Token是什么? 简单说,就是AI切分文本的基本单位。
"今天天气真好" → Token切割 → ["今天", "天气", "真", "好"]
"ChatGPT" → Token切割 → ["Chat", "G", "PT"]
"人工智能" → Token切割 → ["人工", "智能"]
- 常见的中文词通常是1个Token
- 英文单词通常是1个Token
- 很长的词或生僻词可能被拆成多个Token
- 标点符号也是Token
为什么要了解Token? 因为AI工具的收费和限制都是按Token计算的。比如"上下文窗口128K tokens",并不是说能输入128K个汉字(中文大约1个字≈1-2个Token),所以128K tokens大约能处理6-8万汉字。
概念二:上下文窗口------AI的"短期记忆"
AI每次对话时,能"记住"的最大的内容量就是上下文窗口。
你的问题 + AI的回答 + 之前所有的对话内容 ≤ 上下文窗口
类比:你参加一场考试,考试时间有限,你能在有限时间内读完、处理的内容量就是你的"上下文窗口"。
不同模型的上下文窗口大小:
| 模型 | 上下文窗口 | 大约能处理多少汉字 |
|---|---|---|
| GPT-4o | 128K | 6-8万字 |
| Claude 3.5 | 200K | 10-13万字 |
| Kimi | 200K | 10-13万字 |
| DeepSeek | 64K | 3-4万字 |
实用建议:
- 聊天时不超出当前上下文窗口,AI就不会"忘了前面说了什么"
- 处理长文档时可以选上下文窗口大的模型,比如如Kimi、Claude
- 超出窗口的旧对话会被"挤出"记忆,AI就看不到了,会忘了之前的话题和内容
概念三:预训练 + 微调------先"通识教育"再"专业培训"
这是大模型训练的两个阶段:
预训练(通识教育)
│ 读互联网上几乎所有文字 → 学会语言规律 → 成为"什么都知道一点的通才"
│
▼
微调(专业培训)
│ 用特定领域的数据继续训练 → 成为"某个领域的专家"
│
▼
最终模型 = 通识基础 + 专业特长
类比:
- 预训练 = 一个人从小学到高中,学语文、数学、英语、物理、化学......什么都有基础
- 微调 = 大学选了个专业,比如医学,深入学习某一领域的知识
ChatGPT是"预训练"出来的通才。如果你想让它变成"法律专家",就给它大量的法律文书做"微调",这就是为什么不同的企业可以定制属于自己的AI助手。
四、主流大语言模型怎么选?
目前市面上主流的大语言模型有很多,不需要全用过,但要知道各自的特点。
国内模型(免费或低成本,中文能力强)
| 模型 | 开发方 | 核心特点 | 最适合场景 |
|---|---|---|---|
| DeepSeek | 深度求索 | 开源先锋,性价比极高,推理能力突出 | 技术问题、编程辅助、日常使用 |
| Kimi | 月之暗面 | 超长上下文(200K),擅长处理长文档 | 读长论文、分析长报告、处理长对话 |
| 通义千问 | 阿里巴巴 | 开源生态好,多模态能力强 | 代码生成、企业应用开发 |
| 文心一言 | 百度 | 中文理解能力强,百度生态集成 | 中文写作、中文理解任务 |
| 豆包 | 字节跳动 | 免费好用,响应快 | 日常问答、快速文案生成 |
国外模型(功能更强,部分需付费)
| 模型 | 开发方 | 核心特点 | 最适合场景 |
|---|---|---|---|
| GPT-4o | OpenAI | 全球最知名,综合能力最强 | 通用场景、复杂推理、多模态 |
| Claude 3.5 | Anthropic | 超长上下文,擅长长文本分析和写作 | 长文档分析、高质量写作、代码 |
怎么选?按场景来
| 你的需求 | 推荐模型 | 理由 |
|---|---|---|
| 日常问答、写文案 | 豆包 / DeepSeek | 免费好用,中文能力强 |
| 分析长文档/论文 | Kimi / Claude | 上下文窗口大,不会"忘了前面" |
| 写代码/技术问题 | DeepSeek / GPT-4o | 代码理解和生成能力强 |
| 企业定制AI助手 | 通义千问(开源) | 可以私有化部署,数据不出企业 |
| 预算充足要最强效果 | GPT-4o / Claude 3.5 | 综合能力天花板 |
五、极简API调用示例
如果你想在自己的程序中调用大模型,其实非常简单,主流模型都兼容OpenAI的API格式。
// 调用DeepSeek API的请求示例
POST https://api.deepseek.com/v1/chat/completions
{
"model": "deepseek-chat",
"messages": [
{
"role": "system",
"content": "你是一个专业的产品文案写手"
},
{
"role": "user",
"content": "用一句话介绍什么是AI"
}
],
"temperature": 0.7
}
// 返回结果
{
"choices": [
{
"message": {
"role": "assistant",
"content": "AI(人工智能)就是让计算机模拟人类的思考和行为,从识别图片到写文章,帮你把复杂问题变简单的技术。"
}
}
]
}
核心就三步:
- 准备API密钥,各大模型平台注册就能拿到
- 按格式发送请,指定模型 + 对话内容
- 接收返回的文字结果
不需要懂深度学习的原理,会发HTTP请求就能调用。
🏢 业务场景实战
场景一:程序员用LLM辅助写代码
比如现在有一个Java程序员遇到了某个问题:不会用某个库。
以前:Google搜索 → 翻Stack Overflow → 试了几个方案 → 半小时解决
现在:现在把问题直接扔给DeepSeek/Claude → 给出完整代码 + 解释 → 5分钟解决
输入:"Java中怎么用Stream把一个List<User>按年龄分组?"
输出:
Map<Integer, List<User>> result = users.stream()
.collect(Collectors.groupingBy(User::getAge));
// 按年龄分组,年龄相同的用户会被放到同一个List中
LLM不是替代程序员写代码,而是充当一个"随时都在的、什么语言都懂的编程搭档"。
场景二:新媒体运营用LLM批量生成内容
一个小红书运营每天要发5条笔记,每条需要标题+正文+标签。
工作流:
1. 把产品信息整理成模板
2. 输入给LLM:"帮我写5条小红书笔记,产品是保湿面膜,卖点是玻尿酸成分、敏感肌可用、平价,风格活泼有感染力"
3. LLM生成5版初稿
4. 运营挑选修改,配上图片发布
效率提升:从每天花3小时写内容,变成30分钟审核修改。
场景三:企业用API打造专属AI客服
通过调用大模型API,企业可以快速搭建一个"懂自己业务"的AI客服系统:
用户提问 → API调用(附带企业知识库作为上下文) → LLM生成专业回答
比如用户问"你们的退换货政策是什么?",系统会把企业的退换货规则作为上下文传给LLM,LLM就会基于企业自己的政策来回答,而不是给出通用的回复。
✅ 本课知识卡片
┌─────────────────────────────────────────────────┐
│ 第07课 · 大语言模型核心概念速查 │
├─────────────────────────────────────────────────┤
│ LLM = 专门处理文字的大模型 │
│ 两大能力:语言理解 + 语言生成 │
│ │
│ 生成原理:逐字预测下一个最可能的词 │
│ Temperature:控制创造性(0=保守,1=发散) │
│ │
│ 三大核心概念: │
│ Token = AI切分文本的单位(收费和限制都按它算) │
│ 上下文窗口 = AI的"短期记忆"容量 │
│ 预训练+微调 = 先通识教育再专业培训 │
│ │
│ 选模型:日常用豆包/DeepSeek,长文档用Kimi/Claude │
│ 写代码用DeepSeek/GPT-4o │
└─────────────────────────────────────────────────┘
🔗 下一课预告
前面所有课程讲的大模型,主要处理的是文字。但现在的AI不仅能写文章,还能看图片、听语音、生成视频------这种"全能型"AI叫什么?它是怎么同时处理这么多类型信息的?
下一课:多模态大模型------让AI"看、听、说"样样精通
好途工坊 · 好途相伴,前程无忧