大模型技术全景(一):AI、机器学习、深度学习,三者的关系到底是什么?一文搞懂

文章目录

    • [1. 引言:聊大模型之前,先理清三个被混用的词](#1. 引言:聊大模型之前,先理清三个被混用的词)
    • [2. 人工智能(AI):一个持续了七十年的宏大目标](#2. 人工智能(AI):一个持续了七十年的宏大目标)
      • [2.1 一句话定义](#2.1 一句话定义)
      • [2.2 实现 AI 的路线不止一条](#2.2 实现 AI 的路线不止一条)
    • [3. 机器学习(ML):把「写规则」变成「找规律」](#3. 机器学习(ML):把「写规则」变成「找规律」)
      • [3.1 传统编程和机器学习的本质区别](#3.1 传统编程和机器学习的本质区别)
      • [3.2 一个简单的例子](#3.2 一个简单的例子)
      • [3.3 机器学习的常见子类](#3.3 机器学习的常见子类)
    • [4. 深度学习(DL):机器学习的「暴力进化」](#4. 深度学习(DL):机器学习的「暴力进化」)
      • [4.1 从「人工设计特征」到「自动学特征」](#4.1 从「人工设计特征」到「自动学特征」)
      • [4.2 为什么「深」如此重要](#4.2 为什么「深」如此重要)
      • [4.3 深度学习崛起的三个条件](#4.3 深度学习崛起的三个条件)
    • [5. 一张图看清三者关系](#5. 一张图看清三者关系)
    • [6. 大模型在这张图里的位置](#6. 大模型在这张图里的位置)
    • [7. 总结](#7. 总结)
    • [8. 延伸阅读与思考](#8. 延伸阅读与思考)

1. 引言:聊大模型之前,先理清三个被混用的词

最近两年,「大模型」几乎成了技术圈的高频词。但在深入 ChatGPT、文心一言、通义千问这类大模型之前,有一个绕不开的基础问题:人工智能(AI)、机器学习(Machine Learning)、深度学习(Deep Learning)到底是什么关系?

有人把它们当成同义词,在文章里随意替换;也有人能说出「深度学习是机器学习的分支」,但被追问「那机器学习又是什么」时就卡住了。更现实的问题是:如果你连这三者的边界都说不清,后面理解大模型的训练、微调、推理会非常吃力

本文是「大模型技术全景」系列的第一篇,我们不写公式、不堆术语,先用最直白的方式把三者的关系讲透,再顺带说明:大模型在这张图里到底站在哪。

读完本文你会收获:

  • 一张图看懂 AI、机器学习、深度学习、大模型的包含关系
  • 用「传统编程 vs 机器学习」的对比理解本质差异
  • 为什么说深度学习是机器学习的一次「暴力进化」
  • 大模型属于深度学习,但它凭什么值得单独拎出来说

2. 人工智能(AI):一个持续了七十年的宏大目标

2.1 一句话定义

人工智能(Artificial Intelligence,AI)是一个「目标」,而不是一种具体技术。 它的目标是让机器具备类似人类的智能,能够完成那些通常需要人类智力才能完成的任务------比如理解语言、识别图像、下棋、开车、做决策。

这个目标可以追溯到 1956 年的达特茅斯会议,当时一群科学家第一次正式提出「人工智能」这个词,并畅想机器能够模拟人类的学习和推理能力。

2.2 实现 AI 的路线不止一条

重点来了:AI 是目标,但达成目标的路有很多条。历史上主要出现过两大类路线:

  • 规则驱动 / 专家系统:程序员把人类专家的知识手动写成一条条规则(if-else),让机器按规则推理。这条路在 20 世纪 80 年代曾经很流行,但很快暴露出问题------现实世界太复杂,规则永远写不完。
  • 数据驱动 / 机器学习:不靠人工写规则,而是让机器从大量数据中自己「学」出规律。这条路后来成为主流,也就是我们接下来要讲的机器学习。

所以结论是:AI 是大圈,机器学习是 AI 这个大圈里的一种实现路径。

有一个很形象的比喻:AI 就像「造一台会思考的机器」这个梦想,而机器学习是众多追梦路线中最成功的一条。

3. 机器学习(ML):把「写规则」变成「找规律」

3.1 传统编程和机器学习的本质区别

要理解机器学习,最有效的方式是对比它和传统编程的差异。

传统编程的思路是:

text 复制代码
输入数据 + 人工编写的规则  →  输出结果

比如做垃圾邮件分类,传统做法是程序员先定义一堆规则:含「中奖」「免费领取」就判为垃圾邮件。麻烦在于,垃圾邮件的话术天天在变,规则永远跟不上。

机器学习的思路正好反过来:

text 复制代码
输入数据 + 正确答案(标签)  →  机器自己学出规则

我们不再告诉机器「遇到什么词就怎么判」,而是喂给它几十万封已经标注好「是/不是垃圾邮件」的邮件,让算法自己去发现「哪些特征组合起来更可能是垃圾邮件」。学到之后,面对一封新邮件,它就能给出判断。

3.2 一个简单的例子

假设你想让程序学会区分苹果和橘子,两种做法分别是:

  • 传统编程:写规则------「红色且圆的算苹果,橙色且圆的算橘子」。但当出现青苹果、丑橘、图片光线不好的情况时,规则就崩了。
  • 机器学习:收集几千张标注好的苹果和橘子图片,丢给算法训练。算法自己会总结出「颜色、纹理、形状」等特征的一般规律,即便遇到没见过的青苹果,也能大概率判对。

3.3 机器学习的常见子类

机器学习内部又分为几大流派,这里只列最核心的两类:

  • 监督学习:训练数据带正确答案(标签),比如「这封是垃圾邮件」「这张图是猫」。
  • 无监督学习:数据没有标签,让机器自己发现结构,比如把用户按行为自动聚类。

理解这些概念,后面讲大模型的预训练时会非常有用------ 大模型的预训练本质上就是一种「无监督」或「自监督」的机器学习,它从海量文本里自己找规律。

4. 深度学习(DL):机器学习的「暴力进化」

4.1 从「人工设计特征」到「自动学特征」

机器学习虽然强大,但早期有一个瓶颈:特征工程

比如图像识别,传统机器学习需要人类专家事先设计出「颜色直方图」「边缘特征」等指标喂给算法。一个特征没设计好,整个模型效果就大打折扣。

深度学习(Deep Learning) 解决的就是这个问题:它用多层神经网络,让模型自动从原始数据中逐层提取特征,从低级的「边缘、颜色」到高级的「鼻子、眼睛、整体轮廓」,整个过程几乎不需要人工干预。

4.2 为什么「深」如此重要

深度学习中的「深度」,指神经网络有很多层。层数越多,模型能表达的函数越复杂,学习能力越强,但同时需要的计算量和数据量也越大。

可以这样理解:

  • 浅层机器学习:相当于一个手工作坊,工艺需要老师傅(专家)把关。
  • 深度学习:相当于一座自动化工厂,流水线自动完成从原料到成品的全过程,但建厂成本(算力)和原料需求(数据)也高得多。

4.3 深度学习崛起的三个条件

深度学习其实在 20 世纪 80、90 年代就有人研究,但直到 2012 年前后才真正爆发,原因有三个:

  1. 数据量爆炸:互联网产生了海量的图片、文本、语音数据。
  2. 算力大幅提升:GPU 的出现让训练大规模神经网络成为可能。
  3. 算法持续改进:反向传播、ReLU 激活函数、批归一化等一系列技术让深层网络能被有效训练。

这三点放在一起,为后来的大模型埋下了伏笔。

5. 一张图看清三者关系

三者的关系可以用经典的「同心圆」表示:
#mermaid-svg-nlwSAtBuId8Jbnca{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-nlwSAtBuId8Jbnca .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-nlwSAtBuId8Jbnca .error-icon{fill:#552222;}#mermaid-svg-nlwSAtBuId8Jbnca .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-nlwSAtBuId8Jbnca .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-nlwSAtBuId8Jbnca .marker{fill:#333333;stroke:#333333;}#mermaid-svg-nlwSAtBuId8Jbnca .marker.cross{stroke:#333333;}#mermaid-svg-nlwSAtBuId8Jbnca svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-nlwSAtBuId8Jbnca p{margin:0;}#mermaid-svg-nlwSAtBuId8Jbnca .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-nlwSAtBuId8Jbnca .cluster-label text{fill:#333;}#mermaid-svg-nlwSAtBuId8Jbnca .cluster-label span{color:#333;}#mermaid-svg-nlwSAtBuId8Jbnca .cluster-label span p{background-color:transparent;}#mermaid-svg-nlwSAtBuId8Jbnca .label text,#mermaid-svg-nlwSAtBuId8Jbnca span{fill:#333;color:#333;}#mermaid-svg-nlwSAtBuId8Jbnca .node rect,#mermaid-svg-nlwSAtBuId8Jbnca .node circle,#mermaid-svg-nlwSAtBuId8Jbnca .node ellipse,#mermaid-svg-nlwSAtBuId8Jbnca .node polygon,#mermaid-svg-nlwSAtBuId8Jbnca .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-nlwSAtBuId8Jbnca .rough-node .label text,#mermaid-svg-nlwSAtBuId8Jbnca .node .label text,#mermaid-svg-nlwSAtBuId8Jbnca .image-shape .label,#mermaid-svg-nlwSAtBuId8Jbnca .icon-shape .label{text-anchor:middle;}#mermaid-svg-nlwSAtBuId8Jbnca .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-nlwSAtBuId8Jbnca .rough-node .label,#mermaid-svg-nlwSAtBuId8Jbnca .node .label,#mermaid-svg-nlwSAtBuId8Jbnca .image-shape .label,#mermaid-svg-nlwSAtBuId8Jbnca .icon-shape .label{text-align:center;}#mermaid-svg-nlwSAtBuId8Jbnca .node.clickable{cursor:pointer;}#mermaid-svg-nlwSAtBuId8Jbnca .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-nlwSAtBuId8Jbnca .arrowheadPath{fill:#333333;}#mermaid-svg-nlwSAtBuId8Jbnca .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-nlwSAtBuId8Jbnca .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-nlwSAtBuId8Jbnca .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-nlwSAtBuId8Jbnca .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-nlwSAtBuId8Jbnca .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-nlwSAtBuId8Jbnca .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-nlwSAtBuId8Jbnca .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-nlwSAtBuId8Jbnca .cluster text{fill:#333;}#mermaid-svg-nlwSAtBuId8Jbnca .cluster span{color:#333;}#mermaid-svg-nlwSAtBuId8Jbnca div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-nlwSAtBuId8Jbnca .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-nlwSAtBuId8Jbnca rect.text{fill:none;stroke-width:0;}#mermaid-svg-nlwSAtBuId8Jbnca .icon-shape,#mermaid-svg-nlwSAtBuId8Jbnca .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-nlwSAtBuId8Jbnca .icon-shape p,#mermaid-svg-nlwSAtBuId8Jbnca .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-nlwSAtBuId8Jbnca .icon-shape .label rect,#mermaid-svg-nlwSAtBuId8Jbnca .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-nlwSAtBuId8Jbnca .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-nlwSAtBuId8Jbnca .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-nlwSAtBuId8Jbnca :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 人工智能 AI
机器学习 ML
其他 AI 路线(如专家系统)
深度学习 DL
传统机器学习(SVM、决策树等)
大模型(GPT、BERT 等)
其他深度神经网络(CNN、RNN 等)

更直观地理解这个包含链:

text 复制代码
AI(人工智能,目标)
 └── 机器学习(实现 AI 的主流方法)
      └── 深度学习(机器学习中基于神经网络的分支)
           └── 大模型(深度学习在大规模数据 + 算力下的产物)

需要强调两点:

  • 不是所有 AI 都是机器学习,专家系统、基于搜索的算法也属于 AI。
  • 不是所有机器学习都是深度学习,决策树、支持向量机(SVM)、随机森林等都是机器学习的经典方法,但它们不属于深度学习。

所以下次再听到「我们这个 AI 产品用了机器学习」这种说法,你就能判断:它说的是「我们用 AI 的一种主流实现方式」,而具体是不是深度学习、是不是大模型,还要继续往下问。

6. 大模型在这张图里的位置

理清前面的关系后,大模型的定位就非常清晰了:

大模型属于深度学习,是深度学习在「超大规模数据 + 超大规模参数 + 超强算力」条件下的一种具体实现。

它凭什么值得单独拎出来说?因为量变引起了质变:

维度 传统深度学习模型 大模型
参数规模 百万级、千万级 十亿级起步,甚至万亿级
训练数据 特定领域、特定任务 海量互联网文本,覆盖多领域
训练方式 多为监督学习、单任务 大规模预训练 + 指令微调
泛化能力 换任务通常要重新训练 一个模型能应对多种任务

这也是为什么大模型能「涌现」出上下文学习、思维链等能力------当模型规模和数据规模跨过某个临界点后,它表现出了一些小模型完全不具备的行为。

7. 总结

回到文章标题的问题:AI、机器学习、深度学习,三者的关系到底是什么?

用一句话概括:

人工智能是实现智能的目标,机器学习是实现这一目标的主流方法,深度学习是机器学习中基于多层神经网络的一种技术分支,而大模型则是深度学习在超大规模条件下的最新产物。

理解这层包含关系,是进入大模型世界的第一块基石。下一篇我们将顺着这条线往下讲:大模型内部到底在做什么?「参数」「训练」「推理」这些词分别是什么意思? 欢迎持续关注「大模型技术全景」系列。

8. 延伸阅读与思考

如果你想进一步巩固今天的概念,可以带着下面几个问题去搜索和思考:

  1. 一个基于「人脸识别打卡系统」的产品,分别用到了 AI、机器学习、深度学习中的哪几层?
  2. 传统机器学习中的「决策树」为什么不属于深度学习?
  3. 大模型和传统深度学习模型最本质的分界线是什么------是模型结构不同,还是规模、训练方式的不同?

带着这些问题去读后续文章,你会对技术脉络有更立体的理解。

相关推荐
长江后浪博客14 分钟前
农业无人机管理平台:构建“无人机巡检 + AI识虫 + GIS地块 + 精准作业”的智慧农业系统
人工智能·无人机·智慧农业·无人机巡检·农业无人机管理平台·ai识虫·gis地块
故七月16 分钟前
GEO服务不是一锤子买卖:万域智瞰售后保障体系如何为企业AI认知资产“保驾护航”
大数据·人工智能
这个DBA有点耶19 分钟前
RANGE/LIST/HASH/二级分区怎么选?分区表适用边界与隐藏代价
数据库·mysql·dba
luckystar513~22 分钟前
Hermes实战 :skill编写 + skill治理
人工智能·agent·智能体·hermes·实战专栏
IT古董26 分钟前
AI资讯日报 | 2026年8月31日:政策持续加码,大模型密集更新,开源生态快速扩张,AI智能体加速从实验室走向真实业务场景
人工智能
仙女修炼史29 分钟前
gradcam在yolo中的应用
人工智能·python·yolo
离陌在学C#41 分钟前
C# 异步编程:从 async/await 到 Task 实战指南
开发语言·数据库·c#
亚川楼宇自控系统数据中心厂家42 分钟前
金融数据中心:能碳一体化管理的技术逻辑
人工智能·金融
代码方舟1 小时前
零信任架构实战:基于天远车辆过户详版查询构建自动化车辆估值网关
运维·人工智能·架构·自动化