【零基础学AI】第 1 章——AI 究竟包含哪些技术?

第 1 章 AI 究竟包含哪些技术

文章目录

打开短视频,首页很快排出一批你可能愿意看的内容。拿起手机,镜头认出人脸以后解锁。再打开一个对话工具,输入几句话,它能接着写邮件、提纲或代码。

这些功能都常被叫作 AI,背后的做法却不完全相同。有人把 AI、机器学习、大模型混着用,听起来似乎都对,等到真正读技术文章时,很快就会迷路。

AI 是一片很大的技术范围,机器学习属于其中一类方法,深度学习又属于机器学习。生成式 AI 按输出能力来命名,大语言模型则专门处理语言。

本章读完,你应该能用自己的话解释人工智能、机器学习、深度学习、生成式 AI 和大语言模型,也能判断一个日常功能大致落在哪个位置。学习本章不需要数学和编程基础,只要用过手机或电脑就够了。

🌈 关于《AI 零基础 36 讲》

🧠 零基础也能开始学 AI

《AI 零基础 36 讲》是一套面向初学者的 AI 入门教程。课程从认识和使用 AI 开始,逐步学习

Python、数据处理、机器学习与深度学习,再进入大模型应用开发,最后完成个人知识库助手的综合实践。

📖 本篇是正式讲解文章

通过具体例子、原创图示和操作结果讲清概念。涉及编程的章节提供可运行代码,方便你边读边试。

🎯 读完以后,动手检验

建议按专栏顺序学习,并完成对应的课后训练,检查自己能否独立运用本章知识。

先把 AI 当成一个大范围

人工智能的英文是 Artificial Intelligence,常写成 AI。它研究怎样让机器完成一些通常需要人来判断、识别、预测或生成的任务。

机器接收输入,经过推断,产生预测、内容、推荐或决定,这些输出会影响现实或虚拟环境。这个描述把我们每天遇到的许多功能放到了一起。导航软件推荐路线,风控系统判断交易风险,图像系统识别物体,对话工具生成文字,都可以放进 AI 的范围。

AI 这个词很宽。宽到什么程度呢。早期程序可以靠人工写下大量知识和规则来表现出智能,今天的系统更多会从数据中学习。有些 AI 只负责判断,有些负责生成内容。单看 AI 两个字,还不知道它具体用了哪条技术路线。

这里也要给普通自动化留一条边界。程序按照固定时间发送报表,或者把所有大于 60 分的成绩标成及格,通常只是在执行人写好的步骤。它可以很好用,也可以很复杂,是否属于 AI 还要看系统有没有进行识别、推断、预测等工作。现实产品经常把规则、机器学习和人工审核放在一起,没必要强迫整套产品只能属于一个类别。

机器学习让程序从数据里找规律

机器学习的英文是 Machine Learning,常写成 ML。它是实现 AI 的一类方法。

传统规则程序由人直接写下判断办法。垃圾邮件筛选可以写成一组规则,邮件里出现某些词就加分,发件地址可疑再加分,超过阈值便移进垃圾箱。规则的好处是清楚,哪条触发了通常能查到。邮件写法一变,维护人员就要继续补规则。

机器学习换了一种做法。开发者准备许多历史邮件,并标出哪些是垃圾邮件,模型从这些样本里寻找有用的规律。训练完成后,它再判断没有见过的新邮件。人依然要确定任务、准备数据和检查结果,只是没有亲手写下所有组合规则。

这类方法很适合处理规律很多、很难逐条写完的任务。商品推荐可以从浏览、点击和购买记录中学习,信用风险模型可以从历史样本中寻找风险信号,图片分类模型可以从带标签的图片中学习怎样区分类别。

机器学习不会凭空长出常识。它能学到什么,受训练数据、目标和模型能力限制。历史数据有偏差,模型也可能把偏差学进去。数据里从未出现过的新情况,模型也可能判断失误。专栏第 2 章会把数据、特征、标签、训练和推理拆开讲清楚。

深度学习用多层神经网络处理复杂模式

深度学习的英文是 Deep Learning,常写成 DL。它属于机器学习,主要使用具有多层结构的神经网络。

这里的"深"说的是网络里有多层计算。图片进入网络后,前面的层可能对边缘、方向等局部信息产生响应,后面的层继续组合这些信息,最后给出类别或其他结果。文字和声音也可以经过多层计算,逐步变成模型能够处理的表示。

深度学习推动了图像识别、语音识别和自然语言处理的发展。它可以从大量数据中学习复杂特征,省去一部分手工设计特征的工作。代价也很实际。训练常常需要更多数据和算力,内部计算不容易用几条规则完整解释,部署和维护也更复杂。

深度学习只是机器学习的一部分。线性回归、逻辑回归、决策树等方法也属于机器学习,它们在数据量较小、需要较强可解释性或问题比较简单时仍然常用。以后学到机器学习,不必一上来就找最深的神经网络。

生成式 AI 负责产生新的内容

生成式 AI 的英文是 Generative AI。它根据输入产生文字、图片、音频、视频或代码等内容。

一个识猫模型接收图片,输出"猫"的概率,它做的是识别。一个图片生成模型接收文字描述,输出一张新图片,它做的是生成。两者都可能使用深度学习,任务目标和输出形式不同。

今天常见的生成式 AI 多由深度神经网络实现。它们从大量样本中学习数据里的模式,再根据提示和上下文生成结果。生成不等于从资料里原样复制一段。模型会依据学到的参数逐步构造输出,结果也可能带来新的组合。

这种能力很强,也带来一个直接问题。生成结果读起来顺畅,内容仍可能出错。模型生成的是符合其计算规律的结果,流畅程度不能替代事实核验。涉及数字、引用、医疗、法律和财务决定时,使用者还要检查来源与依据。

大语言模型专门处理语言

大语言模型的英文是 Large Language Model,常写成 LLM。它属于语言模型,通常拥有大量参数,并在大量文本数据上训练。当前常见的大语言模型多采用 Transformer 架构,这个架构会在后面的专栏中单独展开。

语言模型最基本的工作可以先理解成估计后续文字。它接收已经出现的 Token,计算接下来可能出现什么,再一步步生成内容。Token 是模型处理文字时使用的基本单位,可能对应一个字、词的一部分或标点。第 25 章会专门解释文本怎样变成数字。

大语言模型擅长处理文字,可以回答问题、改写、摘要、翻译和生成代码。它也是生成式 AI 的一个重要分支。生成图片的模型同样属于生成式 AI,却不能因此叫作大语言模型。一个判断情感正负的传统文本分类器会处理语言,也未必是大语言模型。

产品和模型很容易混淆。一个聊天产品可能在大语言模型外面接入搜索、数据库、计算器、文件解析和安全规则。用户看到的是完整系统,大语言模型只是其中一个重要组件。以后做 AI 应用,我们会把这些组件逐个接起来。

一张图看清五个概念

这张图按当前常见技术路线做了简化。人工智能覆盖范围最大,其中既有规则与知识方法,也有机器学习。机器学习包含传统机器学习和深度学习。当前主流生成式 AI 多由深度学习实现,大语言模型又是生成式 AI 中处理语言的一类模型。

这张图不能当成一条永远不变的数学边界。生成方法早于今天的大模型,现实系统也经常混合多种技术。它的用途是帮你建立第一张地图。以后遇到具体产品,再看它用了哪些模型、规则和外部工具。

把五个概念压成五句话,可以这样记。

概念 适合零基础读者的解释
人工智能 让机器完成识别、预测、推荐、决策或生成等任务的广泛技术领域
机器学习 让模型从数据样本中学习规律的一类 AI 方法
深度学习 使用多层神经网络学习复杂模式的一类机器学习方法
生成式 AI 根据输入产生文字、图片、音频、视频或代码等内容的模型与系统
大语言模型 在大量文本上训练、以语言处理和生成为主要能力的大型语言模型

三种工作方式怎样区分

拿"处理一封邮件"举例,三种系统的工作方式会很不一样。

工作方式 人主要提供什么 系统怎样得到结果 典型输出
规则程序 明确条件和处理步骤 逐条执行条件 是否移动到垃圾箱
传统机器学习 历史邮件、标签和训练目标 从样本中学习分类规律 垃圾邮件概率
生成式模型 训练数据、提示和上下文 根据学到的模式逐步生成 邮件摘要或回复草稿

规则程序不低级,生成式模型也不会自动胜出。银行利率计算需要准确执行公式,规则程序更合适。识别垃圾邮件的变化规律,机器学习可能更省维护。起草一封不同措辞的回复,生成式模型有明显优势。一个成熟产品往往把三种方式组合起来,让每种方法做自己更擅长的部分。

判断某项功能时,可以依次问三个问题。它是在执行固定条件,还是从样本中学到了规律。它输出的是类别、分数和预测,还是新生成的内容。如果生成的是语言,背后是否使用了大语言模型。问到这里,大多数生活案例已经能找到大致位置。

六个生活案例放到哪里

现在试着判断下面六个案例。先写自己的答案,再打开课后练习与答案核对。

  1. 表格把迟到次数大于 3 的单元格标成红色,条件由老师提前写好。
  2. 邮箱根据大量已标注邮件,判断一封新邮件是否为垃圾邮件。
  3. 视频平台根据观看、点赞和跳过记录调整推荐顺序。
  4. 手机识别人脸后完成解锁。
  5. 用户输入一段要求,工具生成一封请假邮件。
  6. 用户输入画面描述,工具生成一张插画。

归类时尽量写出你有把握的最具体类别。案例只说"识别人脸",可以确定它属于 AI 和计算机视觉。现代实现常用深度学习,题目没有给出技术细节时,不必把猜测写成确定事实。技术判断也需要证据。

两个常见卡点

第一个卡点是看到系统很聪明,就认定它用了大模型。导航选路、商品推荐、欺诈检测都可能很强,它们的核心模型未必是大语言模型。LLM 的限定词是"语言",先看任务是否围绕语言建模和生成。

第二个卡点是看到程序自动运行,就叫它 AI。定时备份、批量改文件名和固定公式计算都属于自动化,它们通常按照预先写好的步骤运行。自动化可以包含 AI,也可以完全不含 AI。

还有一种情况会让初学者犹豫。一个产品同时提供文字生成、联网搜索和图片识别,到底属于哪类。最稳妥的做法是按功能和组件拆开。文字生成可能由大语言模型完成,图片识别可能由视觉模型完成,搜索由检索系统完成,最后再由程序把结果组合给用户。

后面的 35 章会走到哪里

前四章继续补全这张 AI 地图,接着学习怎样使用 AI 工具并检查回答。第 9 章开始进入 Python,随后处理数据、学习必要的数学直觉,再完成传统机器学习和深度学习项目。

第 25 章以后,我们会回到大语言模型,拆解 Token、注意力机制和 Transformer。最后八章把模型接入程序,完成 API 调用、结构化输出、RAG、工具调用和个人知识库助手。

做完六道练习,再试着向身边的人解释其中两个案例。能够说清系统接收了什么、输出了什么,以及为什么把它归到这个类别,就可以进入下一章。下一章会把模型怎样从数据里学会一个任务完整走一遍。

参考资料

相关推荐
Alphapeople39 分钟前
VLM实战
人工智能
二川bro40 分钟前
Python pytest极简入门,从零学会专业自动化测试
人工智能
VIP_CQCRE1 小时前
Coze 接入大模型太麻烦?用 Ace Data Cloud 统一 OpenAI Responses API
ai·大模型·agent·coze·acedatacloud
YOLO数据集集合1 小时前
螺栓目标检测数据集 | 螺栓检测 工业质检 智能制造 部件识别9149期
人工智能·目标检测·制造
johnsong1 小时前
AI前沿日报 2026-10-03:幽灵协议 — 当AI推荐死去的SaaS,编码Agent控制层崛起
人工智能
鬓戈2 小时前
tmux 跑 omp / pi 等 AI coding agent:无人值守后台执行 + 随时回看操作
人工智能
Darren&Joe2 小时前
多媒体与代码:AI Prompting 入门到高阶
人工智能
zhangfeng11332 小时前
Ag / Cu / Au / Ru / Ir / Rh银 铜 金 钌铱 铑 纳米尺度下的 导电性 + 扩散/迁移缺点
人工智能·华为·ai编程·npu