第07课:大语言模型与文本生成——让AI成为你的“全能写手“

📌 本课学习目标

学完这节课,你能搞明白以下问题:

  1. 大语言模型(LLM)到底是什么?它和我们平时用的输入法联想功能有什么区别?
  2. AI写文章是一口气写完的,还是一个字一个字"蹦"出来的?
  3. Token、上下文窗口、Temperature这些词是什么意思?
  4. ChatGPT、DeepSeek、文心一言、Kimi这些模型各有什么特点?怎么选?

🤔 课前思考

你打开ChatGPT或豆包,输入"帮我写一段产品介绍",几秒钟后,一段通顺流畅的文案就出来了。

但你有没有想过:

  • AI是怎么知道该写什么内容的?它是不是从网上抄的?
  • 它写出来的文字为什么读起来这么自然?像人写的?
  • 同样的问题问两遍,为什么两次的回答不一样?

这节课,我们就来揭开大语言模型的"写作之谜"。


一、大语言模型(LLM)是什么?

LLM = Large Language Model = 大语言模型

拆开来看:

  • :参数特别多(几十亿到上万亿个),训练数据特别大,几乎读了互联网上所有的文字
  • 语言:专门处理文字内容,不处理图片、声音,那是其他模型的活
  • 模型:经过训练的、能完成特定任务的AI系统

用一个类比来理解

大语言模型就像一个读过全世界所有书、看过所有文章的"超级语文老师"

你问它任何问题,写文案、改论文、翻译语言、解释概念、甚至写代码,它都能应对。不是因为它"死记硬背"了所有内容,而是因为它已经从海量文字中学会了语言规律,能根据你的需求现场"创作"。

LLM的两大核心能力

能力 白话解释 生活例子
语言理解 能读懂你说什么、你的意思是什么 你说"帮我写个请假条,理由是感冒",它知道不是真的要请假,而是要生成一份请假条文本
语言生成 能根据理解的意思,组织出通顺的文字 输入"请假条"的要素,它输出格式规范的请假条全文

理解是前提,生成是结果,先听懂你说的,再给你写出你想要的。


二、LLM是怎么写文章的?------"逐字预测"的秘密

这是大语言模型最核心、也最反直觉的机制。

你以为的:AI"一口气"写出整篇文章

复制代码
输入 → AI思考 → 完整文章输出

实际上的:AI每次只是在猜"下一个字"

复制代码
输入:"今天天气真" → AI猜下一个字 → "好"
  输入:"今天天气真好," → AI猜下一个字 → "适合"
    输入:"今天天气真好,适合" → AI猜下一个字 → "出去"
      输入:"今天天气真好,适合出去" → AI猜下一个字 → "走走"
        ... 一直猜到结束标记

没错,大语言模型生成文字的本质其实就是:根据前面的内容,预测下一个最可能出现的词,本质上是在进行概率预测!

为什么听起来这么自然?

因为AI读过海量的文字数据,它"知道"什么词后面通常应该跟什么词。

就像你说话的时候,也不是先想好整句话再说出来,而是一个词一个词地往外蹦。但因为你积累了多年的语言经验,说出来的话自然是通顺的。

AI也一样,它积累了几乎所有人类的文字经验,所以它"蹦"出来的词也是通顺的、有逻辑的。

一个关键参数:Temperature(温度值)

你问AI同一个问题,它为什么每次回答都不一样?这就跟Temperature有关。

Temperature值 效果 类比
0 每次都选概率最高的词,结果最稳定、最保守 一个人做选择题永远选最确定的答案
0.7(常用) 有一定随机性,既有创造性又不离谱 一个人说话偶尔换种说法
1.5 随机性很大,很有创造力但可能"胡说八道" 一个人喝醉了说话天马行空

日常使用建议:写正式文档用0-0.3,写创意内容用0.7-1.0,不要超过1.5。

AI为什么不会"一直写下去"?

因为训练时,AI学会了识别"什么时候该停",当它预测到下一个词是特殊的"结束标记"时,就会停止生成,这就像你说话说到该停的地方自然就会停了一样。


三、三个核心技术概念(通俗版)

这三个概念你会在各种AI工具里反复遇到,搞懂了就不再迷糊。

概念一:Token------AI眼中的"词语单位"

你输入一段话给AI,AI不会按"字"来处理,而是按"Token"来处理。

Token是什么? 简单说,就是AI切分文本的基本单位。

复制代码
"今天天气真好" → Token切割 → ["今天", "天气", "真", "好"]
"ChatGPT" → Token切割 → ["Chat", "G", "PT"]
"人工智能" → Token切割 → ["人工", "智能"]
  • 常见的中文词通常是1个Token
  • 英文单词通常是1个Token
  • 很长的词或生僻词可能被拆成多个Token
  • 标点符号也是Token

为什么要了解Token? 因为AI工具的收费和限制都是按Token计算的。比如"上下文窗口128K tokens",并不是说能输入128K个汉字(中文大约1个字≈1-2个Token),所以128K tokens大约能处理6-8万汉字。

概念二:上下文窗口------AI的"短期记忆"

AI每次对话时,能"记住"的最大的内容量就是上下文窗口。

复制代码
你的问题 + AI的回答 + 之前所有的对话内容  ≤  上下文窗口

类比:你参加一场考试,考试时间有限,你能在有限时间内读完、处理的内容量就是你的"上下文窗口"。

不同模型的上下文窗口大小:

模型 上下文窗口 大约能处理多少汉字
GPT-4o 128K 6-8万字
Claude 3.5 200K 10-13万字
Kimi 200K 10-13万字
DeepSeek 64K 3-4万字

实用建议

  • 聊天时不超出当前上下文窗口,AI就不会"忘了前面说了什么"
  • 处理长文档时可以选上下文窗口大的模型,比如如Kimi、Claude
  • 超出窗口的旧对话会被"挤出"记忆,AI就看不到了,会忘了之前的话题和内容

概念三:预训练 + 微调------先"通识教育"再"专业培训"

这是大模型训练的两个阶段:

复制代码
预训练(通识教育)
│  读互联网上几乎所有文字 → 学会语言规律 → 成为"什么都知道一点的通才"
│
▼
微调(专业培训)
│  用特定领域的数据继续训练 → 成为"某个领域的专家"
│
▼
最终模型 = 通识基础 + 专业特长

类比

  • 预训练 = 一个人从小学到高中,学语文、数学、英语、物理、化学......什么都有基础
  • 微调 = 大学选了个专业,比如医学,深入学习某一领域的知识

ChatGPT是"预训练"出来的通才。如果你想让它变成"法律专家",就给它大量的法律文书做"微调",这就是为什么不同的企业可以定制属于自己的AI助手。


四、主流大语言模型怎么选?

目前市面上主流的大语言模型有很多,不需要全用过,但要知道各自的特点。

国内模型(免费或低成本,中文能力强)

模型 开发方 核心特点 最适合场景
DeepSeek 深度求索 开源先锋,性价比极高,推理能力突出 技术问题、编程辅助、日常使用
Kimi 月之暗面 超长上下文(200K),擅长处理长文档 读长论文、分析长报告、处理长对话
通义千问 阿里巴巴 开源生态好,多模态能力强 代码生成、企业应用开发
文心一言 百度 中文理解能力强,百度生态集成 中文写作、中文理解任务
豆包 字节跳动 免费好用,响应快 日常问答、快速文案生成

国外模型(功能更强,部分需付费)

模型 开发方 核心特点 最适合场景
GPT-4o OpenAI 全球最知名,综合能力最强 通用场景、复杂推理、多模态
Claude 3.5 Anthropic 超长上下文,擅长长文本分析和写作 长文档分析、高质量写作、代码

怎么选?按场景来

你的需求 推荐模型 理由
日常问答、写文案 豆包 / DeepSeek 免费好用,中文能力强
分析长文档/论文 Kimi / Claude 上下文窗口大,不会"忘了前面"
写代码/技术问题 DeepSeek / GPT-4o 代码理解和生成能力强
企业定制AI助手 通义千问(开源) 可以私有化部署,数据不出企业
预算充足要最强效果 GPT-4o / Claude 3.5 综合能力天花板

五、极简API调用示例

如果你想在自己的程序中调用大模型,其实非常简单,主流模型都兼容OpenAI的API格式。

复制代码
// 调用DeepSeek API的请求示例
POST https://api.deepseek.com/v1/chat/completions
{
  "model": "deepseek-chat",
  "messages": [
    {
      "role": "system",
      "content": "你是一个专业的产品文案写手"
    },
    {
      "role": "user",
      "content": "用一句话介绍什么是AI"
    }
  ],
  "temperature": 0.7
}

// 返回结果
{
  "choices": [
    {
      "message": {
        "role": "assistant",
        "content": "AI(人工智能)就是让计算机模拟人类的思考和行为,从识别图片到写文章,帮你把复杂问题变简单的技术。"
      }
    }
  ]
}

核心就三步

  1. 准备API密钥,各大模型平台注册就能拿到
  2. 按格式发送请,指定模型 + 对话内容
  3. 接收返回的文字结果

不需要懂深度学习的原理,会发HTTP请求就能调用。


🏢 业务场景实战

场景一:程序员用LLM辅助写代码

比如现在有一个Java程序员遇到了某个问题:不会用某个库。

以前:Google搜索 → 翻Stack Overflow → 试了几个方案 → 半小时解决

现在:现在把问题直接扔给DeepSeek/Claude → 给出完整代码 + 解释 → 5分钟解决

复制代码
输入:"Java中怎么用Stream把一个List<User>按年龄分组?"
输出:
Map<Integer, List<User>> result = users.stream()
    .collect(Collectors.groupingBy(User::getAge));
// 按年龄分组,年龄相同的用户会被放到同一个List中

LLM不是替代程序员写代码,而是充当一个"随时都在的、什么语言都懂的编程搭档"。

场景二:新媒体运营用LLM批量生成内容

一个小红书运营每天要发5条笔记,每条需要标题+正文+标签。

工作流

复制代码
1. 把产品信息整理成模板
2. 输入给LLM:"帮我写5条小红书笔记,产品是保湿面膜,卖点是玻尿酸成分、敏感肌可用、平价,风格活泼有感染力"
3. LLM生成5版初稿
4. 运营挑选修改,配上图片发布

效率提升:从每天花3小时写内容,变成30分钟审核修改。

场景三:企业用API打造专属AI客服

通过调用大模型API,企业可以快速搭建一个"懂自己业务"的AI客服系统:

复制代码
用户提问 → API调用(附带企业知识库作为上下文) → LLM生成专业回答

比如用户问"你们的退换货政策是什么?",系统会把企业的退换货规则作为上下文传给LLM,LLM就会基于企业自己的政策来回答,而不是给出通用的回复。


✅ 本课知识卡片

复制代码
┌─────────────────────────────────────────────────┐
│      第07课 · 大语言模型核心概念速查                 │
├─────────────────────────────────────────────────┤
│ LLM = 专门处理文字的大模型                          │
│   两大能力:语言理解 + 语言生成                     │
│                                                   │
│ 生成原理:逐字预测下一个最可能的词                   │
│   Temperature:控制创造性(0=保守,1=发散)         │
│                                                   │
│ 三大核心概念:                                      │
│   Token = AI切分文本的单位(收费和限制都按它算)      │
│   上下文窗口 = AI的"短期记忆"容量                   │
│   预训练+微调 = 先通识教育再专业培训                 │
│                                                   │
│ 选模型:日常用豆包/DeepSeek,长文档用Kimi/Claude    │
│   写代码用DeepSeek/GPT-4o                         │
└─────────────────────────────────────────────────┘

🔗 下一课预告

前面所有课程讲的大模型,主要处理的是文字。但现在的AI不仅能写文章,还能看图片、听语音、生成视频------这种"全能型"AI叫什么?它是怎么同时处理这么多类型信息的?

下一课:多模态大模型------让AI"看、听、说"样样精通


好途工坊 · 好途相伴,前程无忧