文章目录
-
- [1. 引言:聊大模型之前,先理清三个被混用的词](#1. 引言:聊大模型之前,先理清三个被混用的词)
- [2. 人工智能(AI):一个持续了七十年的宏大目标](#2. 人工智能(AI):一个持续了七十年的宏大目标)
-
- [2.1 一句话定义](#2.1 一句话定义)
- [2.2 实现 AI 的路线不止一条](#2.2 实现 AI 的路线不止一条)
- [3. 机器学习(ML):把「写规则」变成「找规律」](#3. 机器学习(ML):把「写规则」变成「找规律」)
-
- [3.1 传统编程和机器学习的本质区别](#3.1 传统编程和机器学习的本质区别)
- [3.2 一个简单的例子](#3.2 一个简单的例子)
- [3.3 机器学习的常见子类](#3.3 机器学习的常见子类)
- [4. 深度学习(DL):机器学习的「暴力进化」](#4. 深度学习(DL):机器学习的「暴力进化」)
-
- [4.1 从「人工设计特征」到「自动学特征」](#4.1 从「人工设计特征」到「自动学特征」)
- [4.2 为什么「深」如此重要](#4.2 为什么「深」如此重要)
- [4.3 深度学习崛起的三个条件](#4.3 深度学习崛起的三个条件)
- [5. 一张图看清三者关系](#5. 一张图看清三者关系)
- [6. 大模型在这张图里的位置](#6. 大模型在这张图里的位置)
- [7. 总结](#7. 总结)
- [8. 延伸阅读与思考](#8. 延伸阅读与思考)
1. 引言:聊大模型之前,先理清三个被混用的词
最近两年,「大模型」几乎成了技术圈的高频词。但在深入 ChatGPT、文心一言、通义千问这类大模型之前,有一个绕不开的基础问题:人工智能(AI)、机器学习(Machine Learning)、深度学习(Deep Learning)到底是什么关系?
有人把它们当成同义词,在文章里随意替换;也有人能说出「深度学习是机器学习的分支」,但被追问「那机器学习又是什么」时就卡住了。更现实的问题是:如果你连这三者的边界都说不清,后面理解大模型的训练、微调、推理会非常吃力。
本文是「大模型技术全景」系列的第一篇,我们不写公式、不堆术语,先用最直白的方式把三者的关系讲透,再顺带说明:大模型在这张图里到底站在哪。
读完本文你会收获:
- 一张图看懂 AI、机器学习、深度学习、大模型的包含关系
- 用「传统编程 vs 机器学习」的对比理解本质差异
- 为什么说深度学习是机器学习的一次「暴力进化」
- 大模型属于深度学习,但它凭什么值得单独拎出来说
2. 人工智能(AI):一个持续了七十年的宏大目标
2.1 一句话定义
人工智能(Artificial Intelligence,AI)是一个「目标」,而不是一种具体技术。 它的目标是让机器具备类似人类的智能,能够完成那些通常需要人类智力才能完成的任务------比如理解语言、识别图像、下棋、开车、做决策。
这个目标可以追溯到 1956 年的达特茅斯会议,当时一群科学家第一次正式提出「人工智能」这个词,并畅想机器能够模拟人类的学习和推理能力。
2.2 实现 AI 的路线不止一条
重点来了:AI 是目标,但达成目标的路有很多条。历史上主要出现过两大类路线:
- 规则驱动 / 专家系统:程序员把人类专家的知识手动写成一条条规则(if-else),让机器按规则推理。这条路在 20 世纪 80 年代曾经很流行,但很快暴露出问题------现实世界太复杂,规则永远写不完。
- 数据驱动 / 机器学习:不靠人工写规则,而是让机器从大量数据中自己「学」出规律。这条路后来成为主流,也就是我们接下来要讲的机器学习。
所以结论是:AI 是大圈,机器学习是 AI 这个大圈里的一种实现路径。
有一个很形象的比喻:AI 就像「造一台会思考的机器」这个梦想,而机器学习是众多追梦路线中最成功的一条。
3. 机器学习(ML):把「写规则」变成「找规律」
3.1 传统编程和机器学习的本质区别
要理解机器学习,最有效的方式是对比它和传统编程的差异。
传统编程的思路是:
text
输入数据 + 人工编写的规则 → 输出结果
比如做垃圾邮件分类,传统做法是程序员先定义一堆规则:含「中奖」「免费领取」就判为垃圾邮件。麻烦在于,垃圾邮件的话术天天在变,规则永远跟不上。
机器学习的思路正好反过来:
text
输入数据 + 正确答案(标签) → 机器自己学出规则
我们不再告诉机器「遇到什么词就怎么判」,而是喂给它几十万封已经标注好「是/不是垃圾邮件」的邮件,让算法自己去发现「哪些特征组合起来更可能是垃圾邮件」。学到之后,面对一封新邮件,它就能给出判断。
3.2 一个简单的例子
假设你想让程序学会区分苹果和橘子,两种做法分别是:
- 传统编程:写规则------「红色且圆的算苹果,橙色且圆的算橘子」。但当出现青苹果、丑橘、图片光线不好的情况时,规则就崩了。
- 机器学习:收集几千张标注好的苹果和橘子图片,丢给算法训练。算法自己会总结出「颜色、纹理、形状」等特征的一般规律,即便遇到没见过的青苹果,也能大概率判对。
3.3 机器学习的常见子类
机器学习内部又分为几大流派,这里只列最核心的两类:
- 监督学习:训练数据带正确答案(标签),比如「这封是垃圾邮件」「这张图是猫」。
- 无监督学习:数据没有标签,让机器自己发现结构,比如把用户按行为自动聚类。
理解这些概念,后面讲大模型的预训练时会非常有用------ 大模型的预训练本质上就是一种「无监督」或「自监督」的机器学习,它从海量文本里自己找规律。
4. 深度学习(DL):机器学习的「暴力进化」
4.1 从「人工设计特征」到「自动学特征」
机器学习虽然强大,但早期有一个瓶颈:特征工程。
比如图像识别,传统机器学习需要人类专家事先设计出「颜色直方图」「边缘特征」等指标喂给算法。一个特征没设计好,整个模型效果就大打折扣。
深度学习(Deep Learning) 解决的就是这个问题:它用多层神经网络,让模型自动从原始数据中逐层提取特征,从低级的「边缘、颜色」到高级的「鼻子、眼睛、整体轮廓」,整个过程几乎不需要人工干预。
4.2 为什么「深」如此重要
深度学习中的「深度」,指神经网络有很多层。层数越多,模型能表达的函数越复杂,学习能力越强,但同时需要的计算量和数据量也越大。
可以这样理解:
- 浅层机器学习:相当于一个手工作坊,工艺需要老师傅(专家)把关。
- 深度学习:相当于一座自动化工厂,流水线自动完成从原料到成品的全过程,但建厂成本(算力)和原料需求(数据)也高得多。
4.3 深度学习崛起的三个条件
深度学习其实在 20 世纪 80、90 年代就有人研究,但直到 2012 年前后才真正爆发,原因有三个:
- 数据量爆炸:互联网产生了海量的图片、文本、语音数据。
- 算力大幅提升:GPU 的出现让训练大规模神经网络成为可能。
- 算法持续改进:反向传播、ReLU 激活函数、批归一化等一系列技术让深层网络能被有效训练。
这三点放在一起,为后来的大模型埋下了伏笔。
5. 一张图看清三者关系
三者的关系可以用经典的「同心圆」表示:
#mermaid-svg-nlwSAtBuId8Jbnca{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-nlwSAtBuId8Jbnca .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-nlwSAtBuId8Jbnca .error-icon{fill:#552222;}#mermaid-svg-nlwSAtBuId8Jbnca .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-nlwSAtBuId8Jbnca .marker{fill:#333333;stroke:#333333;}#mermaid-svg-nlwSAtBuId8Jbnca .marker.cross{stroke:#333333;}#mermaid-svg-nlwSAtBuId8Jbnca svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-nlwSAtBuId8Jbnca p{margin:0;}#mermaid-svg-nlwSAtBuId8Jbnca .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-nlwSAtBuId8Jbnca .cluster-label text{fill:#333;}#mermaid-svg-nlwSAtBuId8Jbnca .cluster-label span{color:#333;}#mermaid-svg-nlwSAtBuId8Jbnca .cluster-label span p{background-color:transparent;}#mermaid-svg-nlwSAtBuId8Jbnca .label text,#mermaid-svg-nlwSAtBuId8Jbnca span{fill:#333;color:#333;}#mermaid-svg-nlwSAtBuId8Jbnca .node rect,#mermaid-svg-nlwSAtBuId8Jbnca .node circle,#mermaid-svg-nlwSAtBuId8Jbnca .node ellipse,#mermaid-svg-nlwSAtBuId8Jbnca .node polygon,#mermaid-svg-nlwSAtBuId8Jbnca .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-nlwSAtBuId8Jbnca .rough-node .label text,#mermaid-svg-nlwSAtBuId8Jbnca .node .label text,#mermaid-svg-nlwSAtBuId8Jbnca .image-shape .label,#mermaid-svg-nlwSAtBuId8Jbnca .icon-shape .label{text-anchor:middle;}#mermaid-svg-nlwSAtBuId8Jbnca .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-nlwSAtBuId8Jbnca .rough-node .label,#mermaid-svg-nlwSAtBuId8Jbnca .node .label,#mermaid-svg-nlwSAtBuId8Jbnca .image-shape .label,#mermaid-svg-nlwSAtBuId8Jbnca .icon-shape .label{text-align:center;}#mermaid-svg-nlwSAtBuId8Jbnca .node.clickable{cursor:pointer;}#mermaid-svg-nlwSAtBuId8Jbnca .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-nlwSAtBuId8Jbnca .arrowheadPath{fill:#333333;}#mermaid-svg-nlwSAtBuId8Jbnca .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-nlwSAtBuId8Jbnca .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-nlwSAtBuId8Jbnca .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-nlwSAtBuId8Jbnca .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-nlwSAtBuId8Jbnca .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-nlwSAtBuId8Jbnca .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-nlwSAtBuId8Jbnca .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-nlwSAtBuId8Jbnca .cluster text{fill:#333;}#mermaid-svg-nlwSAtBuId8Jbnca .cluster span{color:#333;}#mermaid-svg-nlwSAtBuId8Jbnca div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-nlwSAtBuId8Jbnca .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-nlwSAtBuId8Jbnca rect.text{fill:none;stroke-width:0;}#mermaid-svg-nlwSAtBuId8Jbnca .icon-shape,#mermaid-svg-nlwSAtBuId8Jbnca .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-nlwSAtBuId8Jbnca .icon-shape p,#mermaid-svg-nlwSAtBuId8Jbnca .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-nlwSAtBuId8Jbnca .icon-shape .label rect,#mermaid-svg-nlwSAtBuId8Jbnca .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-nlwSAtBuId8Jbnca .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-nlwSAtBuId8Jbnca .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-nlwSAtBuId8Jbnca :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 人工智能 AI
机器学习 ML
其他 AI 路线(如专家系统)
深度学习 DL
传统机器学习(SVM、决策树等)
大模型(GPT、BERT 等)
其他深度神经网络(CNN、RNN 等)
更直观地理解这个包含链:
text
AI(人工智能,目标)
└── 机器学习(实现 AI 的主流方法)
└── 深度学习(机器学习中基于神经网络的分支)
└── 大模型(深度学习在大规模数据 + 算力下的产物)
需要强调两点:
- 不是所有 AI 都是机器学习,专家系统、基于搜索的算法也属于 AI。
- 不是所有机器学习都是深度学习,决策树、支持向量机(SVM)、随机森林等都是机器学习的经典方法,但它们不属于深度学习。
所以下次再听到「我们这个 AI 产品用了机器学习」这种说法,你就能判断:它说的是「我们用 AI 的一种主流实现方式」,而具体是不是深度学习、是不是大模型,还要继续往下问。
6. 大模型在这张图里的位置
理清前面的关系后,大模型的定位就非常清晰了:
大模型属于深度学习,是深度学习在「超大规模数据 + 超大规模参数 + 超强算力」条件下的一种具体实现。
它凭什么值得单独拎出来说?因为量变引起了质变:
| 维度 | 传统深度学习模型 | 大模型 |
|---|---|---|
| 参数规模 | 百万级、千万级 | 十亿级起步,甚至万亿级 |
| 训练数据 | 特定领域、特定任务 | 海量互联网文本,覆盖多领域 |
| 训练方式 | 多为监督学习、单任务 | 大规模预训练 + 指令微调 |
| 泛化能力 | 换任务通常要重新训练 | 一个模型能应对多种任务 |
这也是为什么大模型能「涌现」出上下文学习、思维链等能力------当模型规模和数据规模跨过某个临界点后,它表现出了一些小模型完全不具备的行为。
7. 总结
回到文章标题的问题:AI、机器学习、深度学习,三者的关系到底是什么?
用一句话概括:
人工智能是实现智能的目标,机器学习是实现这一目标的主流方法,深度学习是机器学习中基于多层神经网络的一种技术分支,而大模型则是深度学习在超大规模条件下的最新产物。
理解这层包含关系,是进入大模型世界的第一块基石。下一篇我们将顺着这条线往下讲:大模型内部到底在做什么?「参数」「训练」「推理」这些词分别是什么意思? 欢迎持续关注「大模型技术全景」系列。
8. 延伸阅读与思考
如果你想进一步巩固今天的概念,可以带着下面几个问题去搜索和思考:
- 一个基于「人脸识别打卡系统」的产品,分别用到了 AI、机器学习、深度学习中的哪几层?
- 传统机器学习中的「决策树」为什么不属于深度学习?
- 大模型和传统深度学习模型最本质的分界线是什么------是模型结构不同,还是规模、训练方式的不同?
带着这些问题去读后续文章,你会对技术脉络有更立体的理解。