什么是 AI?从人工智能、机器学习到大语言模型和 Agent

AI 并不是某一种具体技术,而是一个很大的技术领域。机器学习、深度学习、大语言模型和 Agent,都可以看作这个领域中的不同层次或应用方式。

过去几年,我们经常听到 AI、机器学习、深度学习、大模型和 Agent 等名词。它们看起来很相似,有时甚至会被混用,但实际上并不处于同一个层级。

这篇文章不讨论复杂的数学公式,而是从最基本的问题开始:AI 到底是什么?计算机又是怎样从数据中"学习"的?


1. 什么是人工智能

人工智能(Artificial Intelligence,简称 AI)是一个研究和工程领域,目标是让计算机完成一些通常需要人类智能才能完成的任务,例如:

  • 识别图片中的物体;
  • 理解和生成语言;
  • 根据路况控制汽车;
  • 推荐商品、广告或视频;
  • 制订计划并调用工具完成任务。

需要注意的是,AI 的"智能"并不一定和人脑的工作方式相同。很多 AI 系统只是针对特定目标,从大量数据中找出规律,再根据这些规律进行预测或生成结果。

1.1 弱人工智能:ANI

ANI 是 Artificial Narrow Intelligence 的缩写,通常译为狭义人工智能弱人工智能

这类 AI 擅长解决一个特定领域的问题。例如:

  • 搜索引擎对网页进行排序;
  • 自动驾驶系统识别车辆、行人和道路;
  • 农业系统识别病虫害;
  • 工厂视觉系统检测产品缺陷;
  • 语音识别系统把声音转换成文字;
  • 大语言模型回答问题或生成文章。

这些系统可能在某项任务上超过人类,但它们的能力通常有明确边界。一个能够识别农作物病害的模型,并不会因此自动学会驾驶汽车。

目前我们实际使用的 AI,基本都属于 ANI。即使大语言模型看起来可以完成很多不同任务,它仍可能产生错误、缺乏稳定的现实理解,也不能像人一样在所有环境中自主学习和行动。

1.2 通用人工智能:AGI

AGI 是 Artificial General Intelligence 的缩写,通常译为通用人工智能

它指的是一种能够像人类一样,在不同领域理解问题、学习新知识、迁移经验并完成多种任务的智能系统。理想中的 AGI 不只是执行训练过的任务,还能面对陌生问题,自主学习并灵活解决。

AGI 目前仍然没有获得公认的实现,其准确标准也存在争议。至于"全面超过人类、甚至完成所有人类无法完成的智力任务",通常更接近超级人工智能(ASI,Artificial Superintelligence) 的概念,而不是 AGI 本身。

类型 核心特点 当前状态
ANI(狭义人工智能) 在一个或若干特定任务上表现出智能 已广泛应用
AGI(通用人工智能) 能跨领域学习、理解和解决一般性问题 尚无公认实现
ASI(超级人工智能) 在大多数重要智力任务上全面超过人类 假设性概念

2. AI、机器学习和深度学习是什么关系

AI 是最大的概念。机器学习是实现 AI 的一种重要方法,而深度学习又是机器学习的一个分支。

flowchart TB AI[&#34;人工智能 AI<br/>让机器表现出智能&#34;] ML[&#34;机器学习 ML<br/>让机器从数据中学习规律&#34;] DL[&#34;深度学习 DL<br/>使用多层神经网络学习&#34;] LLM[&#34;大语言模型 LLM<br/>深度学习的重要应用&#34;] AI --> ML ML --> DL DL --> LLM

这个关系可以简单理解为:

大语言模型属于深度学习,深度学习属于机器学习,而机器学习是实现人工智能的一种方式。

但 AI 并不等于机器学习。早期的专家系统、搜索算法和基于规则的程序,也属于人工智能领域,只是它们不一定通过数据进行学习。


3. 什么是机器学习

传统编程通常是人先写出明确规则,再让计算机按照规则处理数据:

text 复制代码
数据 + 人编写的规则 → 结果

机器学习则是把大量示例交给计算机,让算法从示例中找出规律,形成一个模型:

text 复制代码
数据 + 已知结果 → 学习得到模型
新数据 + 模型 → 预测结果

因此,可以用一句话概括机器学习:

机器学习是让计算机从数据中寻找规律,并利用这些规律进行预测或决策的研究领域,而不是为每一种情况手工编写完整规则。

机器学习并不是完全"没有编程"。工程师仍然需要设计数据处理流程、选择算法、定义目标并评估结果。计算机学习的是数据中的模式,而不是凭空获得知识。

3.1 模型、训练与推理

我们经常说"训练模型"或"调用模型",但模型到底是什么?

可以把算法 理解为一种学习方法,把数据 理解为教材。算法读取大量数据并不断调整内部参数,最终得到的结果就是模型

这个学习过程称为训练(Training) 。训练通常需要大量数据、计算资源和时间。模型训练完成后,我们可以向它提供新的输入,让它生成答案或预测结果,这个过程称为推理(Inference)

flowchart LR A[&#34;训练数据&#34;] --> B[&#34;学习算法&#34;] B --> C[&#34;训练完成的模型&#34;] D[&#34;新的输入&#34;] --> C C --> E[&#34;预测或生成结果&#34;]

简单来说:训练是在学习规律,推理是在使用规律。

3.2 监督学习

监督学习的数据中同时包含输入 和对应的正确输出(标签)。模型通过大量示例,学习如何把输入映射为输出。

flowchart LR A[&#34;训练数据<br/>输入 + 正确答案&#34;] --> B[&#34;学习算法&#34;] B --> C[&#34;训练完成的模型&#34;] D[&#34;新的输入&#34;] --> C C --> E[&#34;预测结果&#34;]

常见例子包括:

  • 输入音频,输出对应文字;
  • 输入邮件内容,输出"垃圾邮件"或"正常邮件";
  • 输入房屋信息,输出预测价格;
  • 输入用户与广告特征,输出用户点击广告的概率。

监督学习通常可以分为两类:

  • 分类:预测一个类别,例如图片中是猫还是狗;
  • 回归:预测一个连续数值,例如房价或销量。

3.3 无监督学习

无监督学习只有输入数据,没有人工提供的标准答案。算法需要自己发现数据中的结构或相似性。

例如,一家电商平台可能根据用户的购买行为,把用户自动划分成不同群体;系统事先并不知道应该有哪些群体,而是从数据中寻找相似模式。

常见任务包括聚类、降维和异常检测。

3.4 强化学习

强化学习不是直接告诉模型每一步的正确答案,而是让一个"智能体"在环境中采取行动,再通过奖励或惩罚判断行动效果。

flowchart LR A[&#34;智能体&#34;] -->|采取行动| B[&#34;环境&#34;] B -->|新状态| A B -->|奖励或惩罚| A

例如,训练一个游戏 AI 时,系统不必告诉它每一步应该怎样走,而可以在获胜时给予正向奖励,在失败时给予负向奖励。经过大量尝试后,它会逐渐学会更有效的策略。

监督学习、无监督学习和强化学习并不是互相排斥的。一个复杂 AI 系统可能同时使用多种学习方法。


4. 数据:计算机理解世界的基础

4.1 什么是数据

数据可以理解为:现实世界中的事物,在计算机中的可记录表示。

计算机底层使用二进制,也就是 0 和 1。但文字、图片、声音和视频都可以按照特定规则被编码为数字,再以二进制形式存储。

现实中的内容 在计算机中的表示方式
文字 字符编码,例如 Unicode、UTF-8
图片 由像素组成,每个像素记录颜色数值
音频 按时间采样得到的一系列数值
视频 连续图像帧与音频数据

例如,在 ASCII 编码中,大写英文字母 AZ 对应十进制数值 65 到 90,小写字母 az 对应 97 到 122,数字字符 09 对应 48 到 57。

不过,ASCII 只能表示有限的字符。现代系统通常使用 Unicode 字符集,并通过 UTF-8 等编码方式存储中文、英文和其他语言。

4.2 什么是数据集

大量具有相同结构的数据放在一起,就形成了数据集。

例如,一份房屋价格数据集可能包含以下字段:

面积 房间数 地段 房龄 成交价格
80 ㎡ 2 市中心 8 年 320 万元
120 ㎡ 3 近郊 3 年 280 万元
65 ㎡ 1 市中心 15 年 240 万元

其中,面积、房间数、地段和房龄可以作为输入特征,成交价格可以作为模型需要学习的目标。

数据量很重要,但数据质量同样重要。如果数据存在错误、偏差、重复或缺失,即使模型非常复杂,也可能得到不可靠的结果。这就是常说的"垃圾进,垃圾出"。


5. 神经网络如何学习

神经网络是一类受生物神经系统启发的数学模型。它由许多相互连接的计算单元组成,通过调整内部参数,学习输入和输出之间的关系。

假设我们想建立一个预测房价的 AI 系统。最简单的情况是:输入房屋面积,输出预测价格。

但现实中的房价不会只由面积决定。房间数、地段、房龄和交通条件等因素都可能产生影响。因此,我们可以让模型同时接收多个输入特征。

flowchart LR A1[&#34;房屋面积&#34;] --> H[&#34;神经网络<br/>学习不同因素的影响&#34;] A2[&#34;房间数量&#34;] --> H A3[&#34;所在区域&#34;] --> H A4[&#34;房屋年龄&#34;] --> H H --> B[&#34;预测房价&#34;]

训练开始时,模型内部参数通常还不能给出准确结果。它会先进行预测,再把预测结果与真实成交价格进行比较,计算误差,并调整参数。这个过程反复进行,模型的预测通常会逐渐改善。

flowchart TB A[&#34;输入房屋数据&#34;] --> B[&#34;模型预测价格&#34;] B --> C[&#34;与真实价格比较&#34;] C --> D[&#34;计算误差&#34;] D --> E[&#34;调整模型参数&#34;] E --> B

这里所说的"学习",本质上就是:通过数据和误差反馈,不断调整模型参数。


6. 什么是深度学习

深度学习是机器学习的一个分支,核心是使用包含多个处理层的神经网络,因此也被称为"深度神经网络"。

传统机器学习往往需要工程师先人工设计特征。例如,为了识别照片中的猫,工程师可能需要先提取边缘、轮廓或纹理。深度学习则可以从大量数据中逐层学习更复杂的特征。

以图像识别为例,模型的不同层可能逐渐学到:

flowchart LR A[&#34;原始像素&#34;] --> B[&#34;边缘与颜色&#34;] B --> C[&#34;纹理和局部形状&#34;] C --> D[&#34;耳朵、眼睛等部位&#34;] D --> E[&#34;完整物体:猫&#34;]

"深度"并不意味着模型真的像人一样深入思考,而是指神经网络具有较多层级。深度学习推动了计算机视觉、语音识别、自然语言处理和生成式 AI 的快速发展。


7. 生成式 AI、大语言模型和 Agent

7.1 生成式 AI

传统预测模型往往输出类别、概率或数值;生成式 AI 则能够根据输入生成新的内容,例如文字、图片、声音、视频或代码。

需要注意的是,"生成"并不等于从数据库中原样取出答案。模型通常根据训练中学到的统计规律,一步步生成符合上下文的新结果。因此,它也可能生成看似合理但实际错误的内容。

7.2 大语言模型

大语言模型(Large Language Model,LLM)是一类通过大量文本和其他数据训练的深度学习模型。它的核心任务可以简化为:根据已有上下文,预测接下来最可能出现的内容。

通过大规模训练和进一步优化,LLM 可以表现出问答、总结、翻译、写作、编程和一定程度的推理能力。

不过,大语言模型并不是"存有所有正确答案的知识库"。它生成的是概率上合适的内容,所以仍然需要事实核查,尤其是在医疗、法律、金融和最新资讯等场景中。

7.3 Agent

Agent 通常译为"智能体"。它不是简单的另一个大模型,而是一种围绕模型搭建的系统形态。

一个典型 Agent 可能包含:

  • 一个负责理解和决策的大语言模型;
  • 可调用的工具,例如搜索、数据库、代码执行或邮件;
  • 保存上下文的记忆;
  • 将复杂目标拆解为步骤的规划机制;
  • 检查结果并继续执行的反馈循环。
flowchart TB U[&#34;用户目标&#34;] --> P[&#34;Agent 规划与决策&#34;] P --> M[&#34;大语言模型&#34;] P --> T[&#34;外部工具&#34;] P --> R[&#34;记忆与上下文&#34;] M --> P T --> P R --> P P --> O[&#34;执行结果&#34;]

因此,机器学习是一类技术方法,而 Agent 是一种应用架构。当前大多数 Agent 仍然建立在狭义人工智能之上,并不等于 AGI。


8. 机器学习和数据科学有什么区别

机器学习和数据科学都会使用数据,但关注点不同。

对比维度 机器学习 数据科学
核心目标 让系统从数据中学习,并进行预测或决策 从数据中获得洞察,支持业务判断
常见产出 推荐模型、识别模型、预测服务 分析报告、指标体系、实验结论
常用方法 训练、验证、部署和监控模型 数据清洗、统计分析、可视化和实验
典型问题 "这个用户最可能购买什么?" "上个月销量下降的原因是什么?"

两者有很大的交集。数据科学项目可能使用机器学习,机器学习项目也离不开数据分析,但它们并不完全相同。


9. 总结

理解 AI,不需要一开始就钻进复杂的算法和公式。先记住下面几层关系:

  1. 人工智能是让机器表现出智能的整个领域;
  2. 机器学习让计算机从数据中寻找规律,是实现 AI 的重要方法;
  3. 深度学习是机器学习的分支,主要使用多层神经网络;
  4. 大语言模型是深度学习在语言和多模态任务中的重要应用;
  5. Agent把模型、工具、记忆和执行流程组织在一起,使 AI 能够完成多步骤任务;
  6. 我们目前使用的系统基本仍属于 ANI,AGI 尚无公认实现。

AI 看起来像是在"思考",但从技术角度看,它的基础仍然是数据、算法、计算资源和反馈机制。理解这些基本概念,才能更准确地判断 AI 能做什么、不能做什么,以及应该怎样把它应用到真实产品中。

相关推荐
lbb 小魔仙1 小时前
谁替 AI Agent 记住时间?——从航海钟到智能数据库,三百年时延坍缩史
数据库·人工智能·db
满怀冰雪1 小时前
22-使用 PaddleClas 快速训练图像分类模型
人工智能·python·机器学习·分类·数据挖掘·paddlepaddle
明月沟渠照不进2 小时前
我让 TRAE Work 给自己造了个"填表技能",工时日报从此只说一句人话
程序员
我是慎独2 小时前
人工智能:现代方法读书笔记(三)
人工智能·机器学习
疯狂的金桔2 小时前
从零理解 Milvus:从向量数据库到 RAG、Hybrid Search 与 Reranker
人工智能
番茄不是西红柿kk2 小时前
什么是Token?
人工智能·ai·chatgpt·agent·token·codex·deepseek
代码简单说2 小时前
Codex 常见错误排查指南:Stream disconnected、400、401、403、429、502、503 解决方法
人工智能
Databuff2 小时前
workbuddy 企业版与 openocta 企业版 功能对比
人工智能
xqqxqxxq2 小时前
AI Agent学习:MCP与工具生态:工具选择的挑战(李博杰《深入理解 AI Agent》4.3观后总结)
人工智能·学习