欢迎拜访 :雾里看山-CSDN博客
本篇主题 :大模型是什么:从 GPT 到开源大模型的演进脉络
发布时间 :2026.8.25
隶属专栏 :AI进化之路

目录
- 先把"大模型"这个词拆开
- 大模型的官方定义
- 演进时间线:先把骨架看清楚
- [第一阶段:Transformer 奠基(2017)](#第一阶段:Transformer 奠基(2017))
- 第二阶段:预训练范式确立(2018)
-
- [BERT 路线:Encoder-only](#BERT 路线:Encoder-only)
- [GPT 路线:Decoder-only](#GPT 路线:Decoder-only)
- 第三阶段:规模放大与涌现(2019-2020)
-
- GPT-2:通用生成的萌芽
- [GPT-3:In-Context Learning 改变玩法](#GPT-3:In-Context Learning 改变玩法)
- [第四阶段:RLHF 与 ChatGPT 时刻(2022)](#第四阶段:RLHF 与 ChatGPT 时刻(2022))
-
- [为什么 GPT-3 还不够好用](#为什么 GPT-3 还不够好用)
- [RLHF 的核心思想](#RLHF 的核心思想)
- [ChatGPT 的意义](#ChatGPT 的意义)
- 第五阶段:开源大模型与多模态(2023)
- [第六阶段:推理能力与 Agent 化(2024)](#第六阶段:推理能力与 Agent 化(2024))
- 第七阶段:开源追上闭源(2025)
- 演进背后的三条主线
-
- [主线 1:规模与架构](#主线 1:规模与架构)
- [主线 2:范式与对齐](#主线 2:范式与对齐)
- [主线 3:能力边界](#主线 3:能力边界)
- 易错点与常见误区
-
- [误区 1:把 GPT 当成唯一路线](#误区 1:把 GPT 当成唯一路线)
- [误区 2:认为开源 = 免费商用](#误区 2:认为开源 = 免费商用)
- [误区 3:把参数规模当成能力上限](#误区 3:把参数规模当成能力上限)
- [误区 4:忽略时间线,只追榜单](#误区 4:忽略时间线,只追榜单)
- 这一篇到底要记住什么
- 给后续几篇打个底
先把"大模型"这个词拆开
这一篇开始,会反复出现 大模型、LLM、GPT、LLaMA、Qwen、DeepSeek 这些名词。如果一开始就陷入"谁比谁强"的对比,很容易迷失。
更稳的姿势是沿着时间线看演进:每一代模型到底解决了上一代什么痛点,又留下什么新问题。把这条线串起来,再去看今天眼花缭乱的模型榜单,就会清晰很多。
大模型的官方定义
先给一个足够通用的定义,避免后面每篇都要重新解释:
大模型(Large Model,通常指LLM,Large Language Model)是一类基于Transformer架构、在海量文本(以及越来越多模态数据)上预训练得到、参数规模达到数十亿至数千亿级别的深度学习模型。
可以拆成四个关键词记忆:
- 基于 Transformer:这是目前几乎所有大模型的共同骨架。
- 预训练:用"下一个词预测"这种自监督任务在大规模语料上先学一通。
- 参数规模大 :几十亿(
10B)起步,几千亿(>1T)也不罕见。 - 通用任务能力:一个模型可以同时处理问答、写作、翻译、代码等任务。
题外话:严格意义上
大模型不止包含LLM,还有视觉大模型、多模态大模型。但本篇重点讲LLM的演进脉络,其他模态后续单独拆。
演进时间线:先把骨架看清楚
下面这张表是把过去十年最重要的几个节点压成一条线,便于记忆:
| 时间 | 代表模型 | 关键突破 | 类型 |
|---|---|---|---|
| 2017 | Transformer |
提出自注意力机制,奠定后续几乎所有大模型的基础 | 架构 |
| 2018 | BERT / GPT-1 |
预训练 + 微调范式确立(Encoder-only vs Decoder-only) |
闭源 |
| 2019 | GPT-2 / T5 |
规模放大到 1.5B,通用生成能力初现 |
闭源 |
| 2020 | GPT-3 |
把规模拉到 175B,出现 In-Context Learning(上下文学习) |
闭源 |
| 2022 | ChatGPT / InstructGPT |
RLHF 对齐,让模型变得"会聊天" |
闭源 |
| 2023 | GPT-4 / LLaMA-1 / Qwen / ChatGLM |
多模态起步,开源大模型生态全面铺开 | 闭源 + 开源 |
| 2024 | GPT-4o / Claude 3.5 / LLaMA-3 / Qwen-2 / DeepSeek-V2 |
长上下文、推理能力、Agent 能力全面提升 | 闭源 + 开源 |
| 2025 | DeepSeek-V3 / GPT-5 / Claude 4 / Gemini 2 |
推理模型与多模态深度融合,开源追上闭源 | 闭源 + 开源 |
下面分阶段拆开讲。
第一阶段:Transformer 奠基(2017)
2017 年 Google 发表的论文《Attention Is All You Need》提出了 Transformer 架构。它抛弃了之前 RNN 的顺序计算方式,改用 Self-Attention 让模型能一次性看到整个序列。
这一阶段的核心意义是:
- 训练可以高度并行,跑在
GPU上效率高。 - 长距离依赖问题被显著缓解。
- 给后面所有大模型一个共同的骨架。
对学习者来说:
如果只挑一篇论文读,就先读
Transformer。后面所有BERT/GPT/LLaMA都是它的变体。
第二阶段:预训练范式确立(2018)
2018 年是"预训练 + 微调"范式确立的关键一年。两条路线几乎同时出现:
BERT 路线:Encoder-only
BERT 用的是 Transformer 的 Encoder 部分。它的训练任务是"掩码语言模型(Masked Language Model)",即把一句话里的某些词遮住,让模型猜。
BERT 系列的强项是理解类任务 :分类、检索、问答中的"找答案"。它更像是一个理解大师,不擅长长文本生成。
GPT 路线:Decoder-only
GPT-1 用的是 Transformer 的 Decoder 部分。它的训练任务是"下一个词预测(Next Token Prediction)",把文章一个 token 一个 token 续写出来。
GPT 系列的强项是生成类任务 :写作、对话、续写。后续所有对话大模型,骨子里都是 Decoder-only。
这一阶段最重要的认知是:
Encoder-only和Decoder-only不是简单的技术差异,而是代表了两种不同的能力方向。后面所有模型都要先回答一个问题------你到底要做"理解"还是"生成"。
第三阶段:规模放大与涌现(2019-2020)
GPT-2:通用生成的萌芽
GPT-2 把参数量推到 1.5B,训练数据也大幅增加。它展示了同一个模型不做任务级微调,也能写出看起来像样的文章。
但当时社区更多把它当成"写作辅助",而不是通用助手。
GPT-3:In-Context Learning 改变玩法
GPT-3 把规模拉到 175B 参数,最重要的不是规模本身,而是它展示了一种新能力------In-Context Learning:
不更新模型参数,只在 Prompt 里给几个示例,模型就能照着做。
这意味着:
- 大量任务不再需要微调,只需要写好 Prompt。
- 同一个模型可以作为通用 API 服务,按 token 计费。
- "大模型即服务"这种商业模式有了技术基础。
题外话:
GPT-3本身没有对外完全开放,但它催生了OpenAI的API商业化和后来ChatGPT的诞生。
第四阶段:RLHF 与 ChatGPT 时刻(2022)
为什么 GPT-3 还不够好用
GPT-3 虽然能写,但有两个明显问题:
- 不会"听话":你让它总结,它可能给你继续编故事。
- 不够安全:容易输出有害、有偏见的内容。
RLHF 的核心思想
RLHF(Reinforcement Learning from Human Feedback)三步走:
- 先在大量数据上做普通预训练(这一步和
GPT-3一样)。 - 再用人工写的"问题 + 好答案"做
SFT(监督微调)。 - 最后让人类对模型的不同回答打分,训练一个"奖励模型",再用强化学习优化大模型。
ChatGPT 的意义
ChatGPT 把 RLHF 落地为产品形态,效果立竿见影:
- 模型不再"自由发挥",而是按人类偏好回答。
- 多轮对话变得稳定。
- 普通人也能直接用。
从这一年开始,大模型 走出了学术圈,进入大众视野。
第五阶段:开源大模型与多模态(2023)
2023 年是"开源大模型元年"。几个标志性事件:
LLaMA-1:开源社区的起点
Meta 发布的 LLaMA-1(7B / 13B / 65B)虽然一开始限制商用,但很快被社区泄露并衍生出一整套生态:
Alpaca、Vicuna:用对话数据微调得到的开源聊天模型。Hugging Face:成为开源模型的事实标准仓库。- 各种量化、推理框架(如
text-generation-inference、vLLM)开始爆发。
国内开源三剑客
国内厂商也几乎同时布局:
Qwen(通义千问):阿里开源,覆盖0.5B到72B多个尺寸。ChatGLM/GLM:智谱开源,中文表现突出。Baichuan(百川):早期中文开源代表之一。
多模态起步
同一年,GPT-4 把视觉理解能力带进大模型,LLaVA、MiniGPT-4 等开源多模态模型迅速跟进。多模态不再是独立的小赛道,而是和大模型深度融合。
第六阶段:推理能力与 Agent 化(2024)
2024 年关注的不再是"能不能聊",而是三件更具体的事:
长上下文
Claude 3.5支持200Ktoken。Gemini 1.5 Pro支持1M甚至2Mtoken。- 上下文长度从"卖点"变成"基础能力"。
推理模型
OpenAI o1系列把"思考过程"显式化,用更多算力换推理质量。DeepSeek-R1开源了同等思路的推理模型。- "思考型模型"和"快答型模型"开始分化。
Agent 与工具调用
Function Calling成为标配。- 主流模型原生支持
Tool Use。 MCP(Model Context Protocol)等统一工具协议开始出现。- 大模型从"聊天"走向"干活"。
第七阶段:开源追上闭源(2025)
2025 年最显著的趋势是:头部开源模型的能力已经接近闭源旗舰。
代表事件:
DeepSeek-V3:以开源姿态发布,能力逼近头部闭源模型,价格却低一个数量级,引发行业震动。Qwen-2.5/Qwen-3:阿里持续在开源榜单上保持领先。LLaMA-3.1/LLaMA-3.2:Meta把405B级别的模型完全开源。
这个阶段给学习者的提示是:
今天再学大模型,只盯着闭源 API 已经远远不够。开源模型 + 本地推理 + 私有部署,是后续工程实战的主线。
演进背后的三条主线
如果把时间线压成三条主线,会更容易记住:
主线 1:规模与架构
- 从
RNN/LSTM→Transformer→Decoder-only Transformer。 - 参数量从
100M→1B→100B→>1T。 - 训练数据从百万级网页 → 万亿 token。
主线 2:范式与对齐
- 从监督学习 → 自监督预训练 → 预训练 + SFT → RLHF → DPO 等偏好对齐。
- 重点从"模型会不会做",转向"模型愿不愿意按人类期望做"。
主线 3:能力边界
- 从单任务模型 → 通用模型 → 多模态 → 工具调用 / Agent。
- 模型的角色从"答题器"变成"数字员工"。
易错点与常见误区
误区 1:把 GPT 当成唯一路线
今天闭源生态里 GPT 系列最有影响力,但开源生态里 Qwen、DeepSeek、GLM 等中国系模型同样关键。只看 OpenAI 一家会显著低估国内开源的进展。
误区 2:认为开源 = 免费商用
不同模型的许可证差别很大:
LLaMA系列有特殊社区许可。Qwen、DeepSeek部分模型允许商用,部分需要遵守额外条款。- 部分模型允许研究使用但不允许商用。
工程落地前一定要看 LICENSE,不要想当然。
误区 3:把参数规模当成能力上限
参数规模是必要条件,但不是充分条件。今天 7B 模型经过高质量数据微调后,在很多垂直任务上能超过未微调的 70B 模型。数据质量、训练方法、对齐手段往往比参数更重要。
误区 4:忽略时间线,只追榜单
每过几天就有新榜单发布。只看榜单容易陷入"谁更强"的焦虑,忽略"谁解决了什么问题"。更稳的学习姿势是:
每学一个新模型,先问它比上一代多解决了一个具体问题。
这一篇到底要记住什么
- 大模型是基于
Transformer、在大规模数据上预训练得到的超大规模深度学习模型。 - 演进主线:
Transformer(2017)→ 预训练范式(2018)→ 规模涌现(2019-2020)→RLHF与ChatGPT(2022)→ 开源生态爆发(2023)→ 多模态与 Agent(2024)→ 开源追上闭源(2025)。 - 三条隐藏主线:规模与架构 、范式与对齐 、能力边界。
- 学习大模型要从"模型在解决什么问题"的角度看,而不是"哪个模型最强"。
给后续几篇打个底
- 第 03 篇会讲大模型能做什么、不能做什么,把第 02 篇的能力演进落到具体任务边界上。
- 第 04 篇开始进入工程侧,讲
Token这个最容易被忽视但又最重要的概念。
⚠️ 写在最后:以上内容是我整理大模型演进脉络时的一份学习笔记,更像是一张"地图",不是一份"谁更强"的榜单。如果你想进一步了解某个具体模型,可以评论或者私信我,我会在后续的实战篇里拆开讲。