AI 并不是某一种具体技术,而是一个很大的技术领域。机器学习、深度学习、大语言模型和 Agent,都可以看作这个领域中的不同层次或应用方式。
过去几年,我们经常听到 AI、机器学习、深度学习、大模型和 Agent 等名词。它们看起来很相似,有时甚至会被混用,但实际上并不处于同一个层级。
这篇文章不讨论复杂的数学公式,而是从最基本的问题开始:AI 到底是什么?计算机又是怎样从数据中"学习"的?
1. 什么是人工智能
人工智能(Artificial Intelligence,简称 AI)是一个研究和工程领域,目标是让计算机完成一些通常需要人类智能才能完成的任务,例如:
- 识别图片中的物体;
- 理解和生成语言;
- 根据路况控制汽车;
- 推荐商品、广告或视频;
- 制订计划并调用工具完成任务。
需要注意的是,AI 的"智能"并不一定和人脑的工作方式相同。很多 AI 系统只是针对特定目标,从大量数据中找出规律,再根据这些规律进行预测或生成结果。
1.1 弱人工智能:ANI
ANI 是 Artificial Narrow Intelligence 的缩写,通常译为狭义人工智能 或弱人工智能。
这类 AI 擅长解决一个特定领域的问题。例如:
- 搜索引擎对网页进行排序;
- 自动驾驶系统识别车辆、行人和道路;
- 农业系统识别病虫害;
- 工厂视觉系统检测产品缺陷;
- 语音识别系统把声音转换成文字;
- 大语言模型回答问题或生成文章。
这些系统可能在某项任务上超过人类,但它们的能力通常有明确边界。一个能够识别农作物病害的模型,并不会因此自动学会驾驶汽车。
目前我们实际使用的 AI,基本都属于 ANI。即使大语言模型看起来可以完成很多不同任务,它仍可能产生错误、缺乏稳定的现实理解,也不能像人一样在所有环境中自主学习和行动。
1.2 通用人工智能:AGI
AGI 是 Artificial General Intelligence 的缩写,通常译为通用人工智能。
它指的是一种能够像人类一样,在不同领域理解问题、学习新知识、迁移经验并完成多种任务的智能系统。理想中的 AGI 不只是执行训练过的任务,还能面对陌生问题,自主学习并灵活解决。
AGI 目前仍然没有获得公认的实现,其准确标准也存在争议。至于"全面超过人类、甚至完成所有人类无法完成的智力任务",通常更接近超级人工智能(ASI,Artificial Superintelligence) 的概念,而不是 AGI 本身。
| 类型 | 核心特点 | 当前状态 |
|---|---|---|
| ANI(狭义人工智能) | 在一个或若干特定任务上表现出智能 | 已广泛应用 |
| AGI(通用人工智能) | 能跨领域学习、理解和解决一般性问题 | 尚无公认实现 |
| ASI(超级人工智能) | 在大多数重要智力任务上全面超过人类 | 假设性概念 |
2. AI、机器学习和深度学习是什么关系
AI 是最大的概念。机器学习是实现 AI 的一种重要方法,而深度学习又是机器学习的一个分支。
这个关系可以简单理解为:
大语言模型属于深度学习,深度学习属于机器学习,而机器学习是实现人工智能的一种方式。
但 AI 并不等于机器学习。早期的专家系统、搜索算法和基于规则的程序,也属于人工智能领域,只是它们不一定通过数据进行学习。
3. 什么是机器学习
传统编程通常是人先写出明确规则,再让计算机按照规则处理数据:
text
数据 + 人编写的规则 → 结果
机器学习则是把大量示例交给计算机,让算法从示例中找出规律,形成一个模型:
text
数据 + 已知结果 → 学习得到模型
新数据 + 模型 → 预测结果
因此,可以用一句话概括机器学习:
机器学习是让计算机从数据中寻找规律,并利用这些规律进行预测或决策的研究领域,而不是为每一种情况手工编写完整规则。
机器学习并不是完全"没有编程"。工程师仍然需要设计数据处理流程、选择算法、定义目标并评估结果。计算机学习的是数据中的模式,而不是凭空获得知识。
3.1 模型、训练与推理
我们经常说"训练模型"或"调用模型",但模型到底是什么?
可以把算法 理解为一种学习方法,把数据 理解为教材。算法读取大量数据并不断调整内部参数,最终得到的结果就是模型。
这个学习过程称为训练(Training) 。训练通常需要大量数据、计算资源和时间。模型训练完成后,我们可以向它提供新的输入,让它生成答案或预测结果,这个过程称为推理(Inference)。
简单来说:训练是在学习规律,推理是在使用规律。
3.2 监督学习
监督学习的数据中同时包含输入 和对应的正确输出(标签)。模型通过大量示例,学习如何把输入映射为输出。
常见例子包括:
- 输入音频,输出对应文字;
- 输入邮件内容,输出"垃圾邮件"或"正常邮件";
- 输入房屋信息,输出预测价格;
- 输入用户与广告特征,输出用户点击广告的概率。
监督学习通常可以分为两类:
- 分类:预测一个类别,例如图片中是猫还是狗;
- 回归:预测一个连续数值,例如房价或销量。
3.3 无监督学习
无监督学习只有输入数据,没有人工提供的标准答案。算法需要自己发现数据中的结构或相似性。
例如,一家电商平台可能根据用户的购买行为,把用户自动划分成不同群体;系统事先并不知道应该有哪些群体,而是从数据中寻找相似模式。
常见任务包括聚类、降维和异常检测。
3.4 强化学习
强化学习不是直接告诉模型每一步的正确答案,而是让一个"智能体"在环境中采取行动,再通过奖励或惩罚判断行动效果。
例如,训练一个游戏 AI 时,系统不必告诉它每一步应该怎样走,而可以在获胜时给予正向奖励,在失败时给予负向奖励。经过大量尝试后,它会逐渐学会更有效的策略。
监督学习、无监督学习和强化学习并不是互相排斥的。一个复杂 AI 系统可能同时使用多种学习方法。
4. 数据:计算机理解世界的基础
4.1 什么是数据
数据可以理解为:现实世界中的事物,在计算机中的可记录表示。
计算机底层使用二进制,也就是 0 和 1。但文字、图片、声音和视频都可以按照特定规则被编码为数字,再以二进制形式存储。
| 现实中的内容 | 在计算机中的表示方式 |
|---|---|
| 文字 | 字符编码,例如 Unicode、UTF-8 |
| 图片 | 由像素组成,每个像素记录颜色数值 |
| 音频 | 按时间采样得到的一系列数值 |
| 视频 | 连续图像帧与音频数据 |
例如,在 ASCII 编码中,大写英文字母 A 到 Z 对应十进制数值 65 到 90,小写字母 a 到 z 对应 97 到 122,数字字符 0 到 9 对应 48 到 57。
不过,ASCII 只能表示有限的字符。现代系统通常使用 Unicode 字符集,并通过 UTF-8 等编码方式存储中文、英文和其他语言。
4.2 什么是数据集
大量具有相同结构的数据放在一起,就形成了数据集。
例如,一份房屋价格数据集可能包含以下字段:
| 面积 | 房间数 | 地段 | 房龄 | 成交价格 |
|---|---|---|---|---|
| 80 ㎡ | 2 | 市中心 | 8 年 | 320 万元 |
| 120 ㎡ | 3 | 近郊 | 3 年 | 280 万元 |
| 65 ㎡ | 1 | 市中心 | 15 年 | 240 万元 |
其中,面积、房间数、地段和房龄可以作为输入特征,成交价格可以作为模型需要学习的目标。
数据量很重要,但数据质量同样重要。如果数据存在错误、偏差、重复或缺失,即使模型非常复杂,也可能得到不可靠的结果。这就是常说的"垃圾进,垃圾出"。
5. 神经网络如何学习
神经网络是一类受生物神经系统启发的数学模型。它由许多相互连接的计算单元组成,通过调整内部参数,学习输入和输出之间的关系。
假设我们想建立一个预测房价的 AI 系统。最简单的情况是:输入房屋面积,输出预测价格。
但现实中的房价不会只由面积决定。房间数、地段、房龄和交通条件等因素都可能产生影响。因此,我们可以让模型同时接收多个输入特征。
训练开始时,模型内部参数通常还不能给出准确结果。它会先进行预测,再把预测结果与真实成交价格进行比较,计算误差,并调整参数。这个过程反复进行,模型的预测通常会逐渐改善。
这里所说的"学习",本质上就是:通过数据和误差反馈,不断调整模型参数。
6. 什么是深度学习
深度学习是机器学习的一个分支,核心是使用包含多个处理层的神经网络,因此也被称为"深度神经网络"。
传统机器学习往往需要工程师先人工设计特征。例如,为了识别照片中的猫,工程师可能需要先提取边缘、轮廓或纹理。深度学习则可以从大量数据中逐层学习更复杂的特征。
以图像识别为例,模型的不同层可能逐渐学到:
"深度"并不意味着模型真的像人一样深入思考,而是指神经网络具有较多层级。深度学习推动了计算机视觉、语音识别、自然语言处理和生成式 AI 的快速发展。
7. 生成式 AI、大语言模型和 Agent
7.1 生成式 AI
传统预测模型往往输出类别、概率或数值;生成式 AI 则能够根据输入生成新的内容,例如文字、图片、声音、视频或代码。
需要注意的是,"生成"并不等于从数据库中原样取出答案。模型通常根据训练中学到的统计规律,一步步生成符合上下文的新结果。因此,它也可能生成看似合理但实际错误的内容。
7.2 大语言模型
大语言模型(Large Language Model,LLM)是一类通过大量文本和其他数据训练的深度学习模型。它的核心任务可以简化为:根据已有上下文,预测接下来最可能出现的内容。
通过大规模训练和进一步优化,LLM 可以表现出问答、总结、翻译、写作、编程和一定程度的推理能力。
不过,大语言模型并不是"存有所有正确答案的知识库"。它生成的是概率上合适的内容,所以仍然需要事实核查,尤其是在医疗、法律、金融和最新资讯等场景中。
7.3 Agent
Agent 通常译为"智能体"。它不是简单的另一个大模型,而是一种围绕模型搭建的系统形态。
一个典型 Agent 可能包含:
- 一个负责理解和决策的大语言模型;
- 可调用的工具,例如搜索、数据库、代码执行或邮件;
- 保存上下文的记忆;
- 将复杂目标拆解为步骤的规划机制;
- 检查结果并继续执行的反馈循环。
因此,机器学习是一类技术方法,而 Agent 是一种应用架构。当前大多数 Agent 仍然建立在狭义人工智能之上,并不等于 AGI。
8. 机器学习和数据科学有什么区别
机器学习和数据科学都会使用数据,但关注点不同。
| 对比维度 | 机器学习 | 数据科学 |
|---|---|---|
| 核心目标 | 让系统从数据中学习,并进行预测或决策 | 从数据中获得洞察,支持业务判断 |
| 常见产出 | 推荐模型、识别模型、预测服务 | 分析报告、指标体系、实验结论 |
| 常用方法 | 训练、验证、部署和监控模型 | 数据清洗、统计分析、可视化和实验 |
| 典型问题 | "这个用户最可能购买什么?" | "上个月销量下降的原因是什么?" |
两者有很大的交集。数据科学项目可能使用机器学习,机器学习项目也离不开数据分析,但它们并不完全相同。
9. 总结
理解 AI,不需要一开始就钻进复杂的算法和公式。先记住下面几层关系:
- 人工智能是让机器表现出智能的整个领域;
- 机器学习让计算机从数据中寻找规律,是实现 AI 的重要方法;
- 深度学习是机器学习的分支,主要使用多层神经网络;
- 大语言模型是深度学习在语言和多模态任务中的重要应用;
- Agent把模型、工具、记忆和执行流程组织在一起,使 AI 能够完成多步骤任务;
- 我们目前使用的系统基本仍属于 ANI,AGI 尚无公认实现。
AI 看起来像是在"思考",但从技术角度看,它的基础仍然是数据、算法、计算资源和反馈机制。理解这些基本概念,才能更准确地判断 AI 能做什么、不能做什么,以及应该怎样把它应用到真实产品中。