第 1 章 AI 究竟包含哪些技术
文章目录
- [第 1 章 AI 究竟包含哪些技术](#第 1 章 AI 究竟包含哪些技术)
-
- [🌈 关于《AI 零基础 36 讲》](#🌈 关于《AI 零基础 36 讲》)
- [先把 AI 当成一个大范围](#先把 AI 当成一个大范围)
- 机器学习让程序从数据里找规律
- 深度学习用多层神经网络处理复杂模式
- [生成式 AI 负责产生新的内容](#生成式 AI 负责产生新的内容)
- 大语言模型专门处理语言
- 一张图看清五个概念
- 三种工作方式怎样区分
- 六个生活案例放到哪里
- 两个常见卡点
- [后面的 35 章会走到哪里](#后面的 35 章会走到哪里)
- 参考资料
打开短视频,首页很快排出一批你可能愿意看的内容。拿起手机,镜头认出人脸以后解锁。再打开一个对话工具,输入几句话,它能接着写邮件、提纲或代码。

这些功能都常被叫作 AI,背后的做法却不完全相同。有人把 AI、机器学习、大模型混着用,听起来似乎都对,等到真正读技术文章时,很快就会迷路。
AI 是一片很大的技术范围,机器学习属于其中一类方法,深度学习又属于机器学习。生成式 AI 按输出能力来命名,大语言模型则专门处理语言。
本章读完,你应该能用自己的话解释人工智能、机器学习、深度学习、生成式 AI 和大语言模型,也能判断一个日常功能大致落在哪个位置。学习本章不需要数学和编程基础,只要用过手机或电脑就够了。
🌈 关于《AI 零基础 36 讲》
🧠 零基础也能开始学 AI
《AI 零基础 36 讲》是一套面向初学者的 AI 入门教程。课程从认识和使用 AI 开始,逐步学习
Python、数据处理、机器学习与深度学习,再进入大模型应用开发,最后完成个人知识库助手的综合实践。
📖 本篇是正式讲解文章
通过具体例子、原创图示和操作结果讲清概念。涉及编程的章节提供可运行代码,方便你边读边试。
🎯 读完以后,动手检验
建议按专栏顺序学习,并完成对应的课后训练,检查自己能否独立运用本章知识。
先把 AI 当成一个大范围
人工智能的英文是 Artificial Intelligence,常写成 AI。它研究怎样让机器完成一些通常需要人来判断、识别、预测或生成的任务。
机器接收输入,经过推断,产生预测、内容、推荐或决定,这些输出会影响现实或虚拟环境。这个描述把我们每天遇到的许多功能放到了一起。导航软件推荐路线,风控系统判断交易风险,图像系统识别物体,对话工具生成文字,都可以放进 AI 的范围。
AI 这个词很宽。宽到什么程度呢。早期程序可以靠人工写下大量知识和规则来表现出智能,今天的系统更多会从数据中学习。有些 AI 只负责判断,有些负责生成内容。单看 AI 两个字,还不知道它具体用了哪条技术路线。
这里也要给普通自动化留一条边界。程序按照固定时间发送报表,或者把所有大于 60 分的成绩标成及格,通常只是在执行人写好的步骤。它可以很好用,也可以很复杂,是否属于 AI 还要看系统有没有进行识别、推断、预测等工作。现实产品经常把规则、机器学习和人工审核放在一起,没必要强迫整套产品只能属于一个类别。
机器学习让程序从数据里找规律
机器学习的英文是 Machine Learning,常写成 ML。它是实现 AI 的一类方法。
传统规则程序由人直接写下判断办法。垃圾邮件筛选可以写成一组规则,邮件里出现某些词就加分,发件地址可疑再加分,超过阈值便移进垃圾箱。规则的好处是清楚,哪条触发了通常能查到。邮件写法一变,维护人员就要继续补规则。
机器学习换了一种做法。开发者准备许多历史邮件,并标出哪些是垃圾邮件,模型从这些样本里寻找有用的规律。训练完成后,它再判断没有见过的新邮件。人依然要确定任务、准备数据和检查结果,只是没有亲手写下所有组合规则。
这类方法很适合处理规律很多、很难逐条写完的任务。商品推荐可以从浏览、点击和购买记录中学习,信用风险模型可以从历史样本中寻找风险信号,图片分类模型可以从带标签的图片中学习怎样区分类别。
机器学习不会凭空长出常识。它能学到什么,受训练数据、目标和模型能力限制。历史数据有偏差,模型也可能把偏差学进去。数据里从未出现过的新情况,模型也可能判断失误。专栏第 2 章会把数据、特征、标签、训练和推理拆开讲清楚。
深度学习用多层神经网络处理复杂模式
深度学习的英文是 Deep Learning,常写成 DL。它属于机器学习,主要使用具有多层结构的神经网络。
这里的"深"说的是网络里有多层计算。图片进入网络后,前面的层可能对边缘、方向等局部信息产生响应,后面的层继续组合这些信息,最后给出类别或其他结果。文字和声音也可以经过多层计算,逐步变成模型能够处理的表示。
深度学习推动了图像识别、语音识别和自然语言处理的发展。它可以从大量数据中学习复杂特征,省去一部分手工设计特征的工作。代价也很实际。训练常常需要更多数据和算力,内部计算不容易用几条规则完整解释,部署和维护也更复杂。
深度学习只是机器学习的一部分。线性回归、逻辑回归、决策树等方法也属于机器学习,它们在数据量较小、需要较强可解释性或问题比较简单时仍然常用。以后学到机器学习,不必一上来就找最深的神经网络。
生成式 AI 负责产生新的内容
生成式 AI 的英文是 Generative AI。它根据输入产生文字、图片、音频、视频或代码等内容。
一个识猫模型接收图片,输出"猫"的概率,它做的是识别。一个图片生成模型接收文字描述,输出一张新图片,它做的是生成。两者都可能使用深度学习,任务目标和输出形式不同。
今天常见的生成式 AI 多由深度神经网络实现。它们从大量样本中学习数据里的模式,再根据提示和上下文生成结果。生成不等于从资料里原样复制一段。模型会依据学到的参数逐步构造输出,结果也可能带来新的组合。
这种能力很强,也带来一个直接问题。生成结果读起来顺畅,内容仍可能出错。模型生成的是符合其计算规律的结果,流畅程度不能替代事实核验。涉及数字、引用、医疗、法律和财务决定时,使用者还要检查来源与依据。
大语言模型专门处理语言
大语言模型的英文是 Large Language Model,常写成 LLM。它属于语言模型,通常拥有大量参数,并在大量文本数据上训练。当前常见的大语言模型多采用 Transformer 架构,这个架构会在后面的专栏中单独展开。
语言模型最基本的工作可以先理解成估计后续文字。它接收已经出现的 Token,计算接下来可能出现什么,再一步步生成内容。Token 是模型处理文字时使用的基本单位,可能对应一个字、词的一部分或标点。第 25 章会专门解释文本怎样变成数字。
大语言模型擅长处理文字,可以回答问题、改写、摘要、翻译和生成代码。它也是生成式 AI 的一个重要分支。生成图片的模型同样属于生成式 AI,却不能因此叫作大语言模型。一个判断情感正负的传统文本分类器会处理语言,也未必是大语言模型。
产品和模型很容易混淆。一个聊天产品可能在大语言模型外面接入搜索、数据库、计算器、文件解析和安全规则。用户看到的是完整系统,大语言模型只是其中一个重要组件。以后做 AI 应用,我们会把这些组件逐个接起来。
一张图看清五个概念

这张图按当前常见技术路线做了简化。人工智能覆盖范围最大,其中既有规则与知识方法,也有机器学习。机器学习包含传统机器学习和深度学习。当前主流生成式 AI 多由深度学习实现,大语言模型又是生成式 AI 中处理语言的一类模型。
这张图不能当成一条永远不变的数学边界。生成方法早于今天的大模型,现实系统也经常混合多种技术。它的用途是帮你建立第一张地图。以后遇到具体产品,再看它用了哪些模型、规则和外部工具。
把五个概念压成五句话,可以这样记。
| 概念 | 适合零基础读者的解释 |
|---|---|
| 人工智能 | 让机器完成识别、预测、推荐、决策或生成等任务的广泛技术领域 |
| 机器学习 | 让模型从数据样本中学习规律的一类 AI 方法 |
| 深度学习 | 使用多层神经网络学习复杂模式的一类机器学习方法 |
| 生成式 AI | 根据输入产生文字、图片、音频、视频或代码等内容的模型与系统 |
| 大语言模型 | 在大量文本上训练、以语言处理和生成为主要能力的大型语言模型 |
三种工作方式怎样区分
拿"处理一封邮件"举例,三种系统的工作方式会很不一样。
| 工作方式 | 人主要提供什么 | 系统怎样得到结果 | 典型输出 |
|---|---|---|---|
| 规则程序 | 明确条件和处理步骤 | 逐条执行条件 | 是否移动到垃圾箱 |
| 传统机器学习 | 历史邮件、标签和训练目标 | 从样本中学习分类规律 | 垃圾邮件概率 |
| 生成式模型 | 训练数据、提示和上下文 | 根据学到的模式逐步生成 | 邮件摘要或回复草稿 |
规则程序不低级,生成式模型也不会自动胜出。银行利率计算需要准确执行公式,规则程序更合适。识别垃圾邮件的变化规律,机器学习可能更省维护。起草一封不同措辞的回复,生成式模型有明显优势。一个成熟产品往往把三种方式组合起来,让每种方法做自己更擅长的部分。
判断某项功能时,可以依次问三个问题。它是在执行固定条件,还是从样本中学到了规律。它输出的是类别、分数和预测,还是新生成的内容。如果生成的是语言,背后是否使用了大语言模型。问到这里,大多数生活案例已经能找到大致位置。
六个生活案例放到哪里
现在试着判断下面六个案例。先写自己的答案,再打开课后练习与答案核对。
- 表格把迟到次数大于 3 的单元格标成红色,条件由老师提前写好。
- 邮箱根据大量已标注邮件,判断一封新邮件是否为垃圾邮件。
- 视频平台根据观看、点赞和跳过记录调整推荐顺序。
- 手机识别人脸后完成解锁。
- 用户输入一段要求,工具生成一封请假邮件。
- 用户输入画面描述,工具生成一张插画。
归类时尽量写出你有把握的最具体类别。案例只说"识别人脸",可以确定它属于 AI 和计算机视觉。现代实现常用深度学习,题目没有给出技术细节时,不必把猜测写成确定事实。技术判断也需要证据。
两个常见卡点
第一个卡点是看到系统很聪明,就认定它用了大模型。导航选路、商品推荐、欺诈检测都可能很强,它们的核心模型未必是大语言模型。LLM 的限定词是"语言",先看任务是否围绕语言建模和生成。
第二个卡点是看到程序自动运行,就叫它 AI。定时备份、批量改文件名和固定公式计算都属于自动化,它们通常按照预先写好的步骤运行。自动化可以包含 AI,也可以完全不含 AI。
还有一种情况会让初学者犹豫。一个产品同时提供文字生成、联网搜索和图片识别,到底属于哪类。最稳妥的做法是按功能和组件拆开。文字生成可能由大语言模型完成,图片识别可能由视觉模型完成,搜索由检索系统完成,最后再由程序把结果组合给用户。

后面的 35 章会走到哪里
前四章继续补全这张 AI 地图,接着学习怎样使用 AI 工具并检查回答。第 9 章开始进入 Python,随后处理数据、学习必要的数学直觉,再完成传统机器学习和深度学习项目。
第 25 章以后,我们会回到大语言模型,拆解 Token、注意力机制和 Transformer。最后八章把模型接入程序,完成 API 调用、结构化输出、RAG、工具调用和个人知识库助手。
做完六道练习,再试着向身边的人解释其中两个案例。能够说清系统接收了什么、输出了什么,以及为什么把它归到这个类别,就可以进入下一章。下一章会把模型怎样从数据里学会一个任务完整走一遍。