大模型是什么:从 GPT 到开源大模型的演进脉络

欢迎拜访雾里看山-CSDN博客

本篇主题 :大模型是什么:从 GPT 到开源大模型的演进脉络

发布时间 :2026.8.25

隶属专栏AI进化之路

目录

先把"大模型"这个词拆开

这一篇开始,会反复出现 大模型LLMGPTLLaMAQwenDeepSeek 这些名词。如果一开始就陷入"谁比谁强"的对比,很容易迷失。

更稳的姿势是沿着时间线看演进:每一代模型到底解决了上一代什么痛点,又留下什么新问题。把这条线串起来,再去看今天眼花缭乱的模型榜单,就会清晰很多。

大模型的官方定义

先给一个足够通用的定义,避免后面每篇都要重新解释:

大模型(Large Model,通常指 LLM,Large Language Model)是一类基于 Transformer 架构、在海量文本(以及越来越多模态数据)上预训练得到、参数规模达到数十亿至数千亿级别的深度学习模型。

可以拆成四个关键词记忆:

  1. 基于 Transformer:这是目前几乎所有大模型的共同骨架。
  2. 预训练:用"下一个词预测"这种自监督任务在大规模语料上先学一通。
  3. 参数规模大 :几十亿(10B)起步,几千亿(>1T)也不罕见。
  4. 通用任务能力:一个模型可以同时处理问答、写作、翻译、代码等任务。

题外话:严格意义上 大模型 不止包含 LLM,还有视觉大模型、多模态大模型。但本篇重点讲 LLM 的演进脉络,其他模态后续单独拆。

演进时间线:先把骨架看清楚

下面这张表是把过去十年最重要的几个节点压成一条线,便于记忆:

时间 代表模型 关键突破 类型
2017 Transformer 提出自注意力机制,奠定后续几乎所有大模型的基础 架构
2018 BERT / GPT-1 预训练 + 微调范式确立(Encoder-only vs Decoder-only 闭源
2019 GPT-2 / T5 规模放大到 1.5B,通用生成能力初现 闭源
2020 GPT-3 把规模拉到 175B,出现 In-Context Learning(上下文学习) 闭源
2022 ChatGPT / InstructGPT RLHF 对齐,让模型变得"会聊天" 闭源
2023 GPT-4 / LLaMA-1 / Qwen / ChatGLM 多模态起步,开源大模型生态全面铺开 闭源 + 开源
2024 GPT-4o / Claude 3.5 / LLaMA-3 / Qwen-2 / DeepSeek-V2 长上下文、推理能力、Agent 能力全面提升 闭源 + 开源
2025 DeepSeek-V3 / GPT-5 / Claude 4 / Gemini 2 推理模型与多模态深度融合,开源追上闭源 闭源 + 开源

下面分阶段拆开讲。

第一阶段:Transformer 奠基(2017)

2017 年 Google 发表的论文《Attention Is All You Need》提出了 Transformer 架构。它抛弃了之前 RNN 的顺序计算方式,改用 Self-Attention 让模型能一次性看到整个序列。

这一阶段的核心意义是:

  • 训练可以高度并行,跑在 GPU 上效率高。
  • 长距离依赖问题被显著缓解。
  • 给后面所有大模型一个共同的骨架。

对学习者来说:

如果只挑一篇论文读,就先读 Transformer。后面所有 BERT / GPT / LLaMA 都是它的变体。

第二阶段:预训练范式确立(2018)

2018 年是"预训练 + 微调"范式确立的关键一年。两条路线几乎同时出现:

BERT 路线:Encoder-only

BERT 用的是 TransformerEncoder 部分。它的训练任务是"掩码语言模型(Masked Language Model)",即把一句话里的某些词遮住,让模型猜。

BERT 系列的强项是理解类任务 :分类、检索、问答中的"找答案"。它更像是一个理解大师,不擅长长文本生成。

GPT 路线:Decoder-only

GPT-1 用的是 TransformerDecoder 部分。它的训练任务是"下一个词预测(Next Token Prediction)",把文章一个 token 一个 token 续写出来。

GPT 系列的强项是生成类任务 :写作、对话、续写。后续所有对话大模型,骨子里都是 Decoder-only

这一阶段最重要的认知是:Encoder-onlyDecoder-only 不是简单的技术差异,而是代表了两种不同的能力方向。后面所有模型都要先回答一个问题------你到底要做"理解"还是"生成"。

第三阶段:规模放大与涌现(2019-2020)

GPT-2:通用生成的萌芽

GPT-2 把参数量推到 1.5B,训练数据也大幅增加。它展示了同一个模型不做任务级微调,也能写出看起来像样的文章。

但当时社区更多把它当成"写作辅助",而不是通用助手。

GPT-3:In-Context Learning 改变玩法

GPT-3 把规模拉到 175B 参数,最重要的不是规模本身,而是它展示了一种新能力------In-Context Learning

不更新模型参数,只在 Prompt 里给几个示例,模型就能照着做。

这意味着:

  • 大量任务不再需要微调,只需要写好 Prompt。
  • 同一个模型可以作为通用 API 服务,按 token 计费。
  • "大模型即服务"这种商业模式有了技术基础。

题外话:GPT-3 本身没有对外完全开放,但它催生了 OpenAIAPI 商业化和后来 ChatGPT 的诞生。

第四阶段:RLHF 与 ChatGPT 时刻(2022)

为什么 GPT-3 还不够好用

GPT-3 虽然能写,但有两个明显问题:

  1. 不会"听话":你让它总结,它可能给你继续编故事。
  2. 不够安全:容易输出有害、有偏见的内容。

RLHF 的核心思想

RLHF(Reinforcement Learning from Human Feedback)三步走:

  1. 先在大量数据上做普通预训练(这一步和 GPT-3 一样)。
  2. 再用人工写的"问题 + 好答案"做 SFT(监督微调)。
  3. 最后让人类对模型的不同回答打分,训练一个"奖励模型",再用强化学习优化大模型。

ChatGPT 的意义

ChatGPTRLHF 落地为产品形态,效果立竿见影:

  • 模型不再"自由发挥",而是按人类偏好回答。
  • 多轮对话变得稳定。
  • 普通人也能直接用。

从这一年开始,大模型 走出了学术圈,进入大众视野。

第五阶段:开源大模型与多模态(2023)

2023 年是"开源大模型元年"。几个标志性事件:

LLaMA-1:开源社区的起点

Meta 发布的 LLaMA-17B / 13B / 65B)虽然一开始限制商用,但很快被社区泄露并衍生出一整套生态:

  • AlpacaVicuna:用对话数据微调得到的开源聊天模型。
  • Hugging Face:成为开源模型的事实标准仓库。
  • 各种量化、推理框架(如 text-generation-inferencevLLM)开始爆发。

国内开源三剑客

国内厂商也几乎同时布局:

  • Qwen(通义千问):阿里开源,覆盖 0.5B72B 多个尺寸。
  • ChatGLM / GLM:智谱开源,中文表现突出。
  • Baichuan(百川):早期中文开源代表之一。

多模态起步

同一年,GPT-4 把视觉理解能力带进大模型,LLaVAMiniGPT-4 等开源多模态模型迅速跟进。多模态不再是独立的小赛道,而是和大模型深度融合。

第六阶段:推理能力与 Agent 化(2024)

2024 年关注的不再是"能不能聊",而是三件更具体的事:

长上下文

  • Claude 3.5 支持 200K token。
  • Gemini 1.5 Pro 支持 1M 甚至 2M token。
  • 上下文长度从"卖点"变成"基础能力"。

推理模型

  • OpenAI o1 系列把"思考过程"显式化,用更多算力换推理质量。
  • DeepSeek-R1 开源了同等思路的推理模型。
  • "思考型模型"和"快答型模型"开始分化。

Agent 与工具调用

  • Function Calling 成为标配。
  • 主流模型原生支持 Tool Use
  • MCP(Model Context Protocol)等统一工具协议开始出现。
  • 大模型从"聊天"走向"干活"。

第七阶段:开源追上闭源(2025)

2025 年最显著的趋势是:头部开源模型的能力已经接近闭源旗舰

代表事件:

  • DeepSeek-V3:以开源姿态发布,能力逼近头部闭源模型,价格却低一个数量级,引发行业震动。
  • Qwen-2.5 / Qwen-3:阿里持续在开源榜单上保持领先。
  • LLaMA-3.1 / LLaMA-3.2Meta405B 级别的模型完全开源。

这个阶段给学习者的提示是:

今天再学大模型,只盯着闭源 API 已经远远不够。开源模型 + 本地推理 + 私有部署,是后续工程实战的主线。

演进背后的三条主线

如果把时间线压成三条主线,会更容易记住:

主线 1:规模与架构

  • RNN/LSTMTransformerDecoder-only Transformer
  • 参数量从 100M1B100B>1T
  • 训练数据从百万级网页 → 万亿 token。

主线 2:范式与对齐

  • 从监督学习 → 自监督预训练 → 预训练 + SFT → RLHF → DPO 等偏好对齐。
  • 重点从"模型会不会做",转向"模型愿不愿意按人类期望做"。

主线 3:能力边界

  • 从单任务模型 → 通用模型 → 多模态 → 工具调用 / Agent。
  • 模型的角色从"答题器"变成"数字员工"。

易错点与常见误区

误区 1:把 GPT 当成唯一路线

今天闭源生态里 GPT 系列最有影响力,但开源生态里 QwenDeepSeekGLM 等中国系模型同样关键。只看 OpenAI 一家会显著低估国内开源的进展。

误区 2:认为开源 = 免费商用

不同模型的许可证差别很大:

  • LLaMA 系列有特殊社区许可。
  • QwenDeepSeek 部分模型允许商用,部分需要遵守额外条款。
  • 部分模型允许研究使用但不允许商用。

工程落地前一定要看 LICENSE,不要想当然。

误区 3:把参数规模当成能力上限

参数规模是必要条件,但不是充分条件。今天 7B 模型经过高质量数据微调后,在很多垂直任务上能超过未微调的 70B 模型。数据质量、训练方法、对齐手段往往比参数更重要。

误区 4:忽略时间线,只追榜单

每过几天就有新榜单发布。只看榜单容易陷入"谁更强"的焦虑,忽略"谁解决了什么问题"。更稳的学习姿势是:

每学一个新模型,先问它比上一代多解决了一个具体问题。

这一篇到底要记住什么

  • 大模型是基于 Transformer、在大规模数据上预训练得到的超大规模深度学习模型。
  • 演进主线:Transformer(2017)→ 预训练范式(2018)→ 规模涌现(2019-2020)→ RLHFChatGPT(2022)→ 开源生态爆发(2023)→ 多模态与 Agent(2024)→ 开源追上闭源(2025)。
  • 三条隐藏主线:规模与架构范式与对齐能力边界
  • 学习大模型要从"模型在解决什么问题"的角度看,而不是"哪个模型最强"。

给后续几篇打个底

  • 第 03 篇会讲大模型能做什么、不能做什么,把第 02 篇的能力演进落到具体任务边界上。
  • 第 04 篇开始进入工程侧,讲 Token 这个最容易被忽视但又最重要的概念。

⚠️ 写在最后:以上内容是我整理大模型演进脉络时的一份学习笔记,更像是一张"地图",不是一份"谁更强"的榜单。如果你想进一步了解某个具体模型,可以评论或者私信我,我会在后续的实战篇里拆开讲。

相关推荐
程序员老赵1 小时前
Docker 部署 Calibre-Web:轻松搭建网页版电子书管理平台
docker·开源·电子书
亥时科技1 小时前
大疆无人机上云,难的从来不是“飞起来”
开源·无人机·ai巡检
自律懒人1 小时前
匿名模型 OX Alpha 横评:DeepSWE 80% 反超 Fable 5 与 GPT-5.6 Sol,免费窗口最后 2 天
gpt·ai编程
kyokasanagi1 小时前
从零写一个跨 Android/iOS/鸿蒙 的设备标识符 UTS 插件
开源·vuex
tedcloud1232 小时前
diagram-design 怎么安装?用 AI 自动生成更专业的架构图、流程图
linux·运维·前端·人工智能·开源·流程图
心仪久了会沦陷2 小时前
数据结构入门系列——顺序表详解:概念、分类与动态实现
c语言·数据结构·经验分享·笔记·开源
狂师3 小时前
AI 测试丨一句指令生成测试报告,带失败截图、操作录屏、Trace、日志,这套 Skill 思路可以直接抄...
人工智能·开源·测试
sibylyue3 小时前
# Web端流媒体JS播放器开源库
前端·javascript·开源
chunmiao30323 小时前
达摩院肝癌AI模型登上《自然·医学》:可识别1厘米微小肿瘤
开源