近两年,大语言模型的爆发让「智能体」从一个学术概念迅速走向工程实践。从能够自主规划任务的 AutoGPT,到可以协作完成开发的 MetaGPT,再到深度嵌入日常开发流程的各类 AI 编程助手,智能体正在重新定义人与系统协作的方式。
不过,智能体并不是大模型时代的全新发明。早在经典人工智能研究中,它就已经形成了一条从简单反射、基于模型、基于目标到基于效用与学习的清晰演进路线。理解这条路线,才能看透大语言模型究竟为智能体带来了哪些本质改变。
本文将从智能体的基本概念出发,先回顾传统视角下的演进脉络,再分析大语言模型驱动的新范式;随后拆解智能体的类型划分、Agent Loop 核心循环、感知与行动机制,以及当下主流的协作模式,帮助你建立一张完整的智能体认知地图。
1.什么是智能体
在人工智能领域,智能体(Agent) 是指可以通过传感器感知外部环境,自主利用执行器采取行动,最终完成特定目标的实体。
智能体包含 4 个核心基础要素:
- 环境:智能体所处的外部世界。例如自动驾驶面对的道路交通、量化交易算法面对的金融市场。
- 传感器:用于感知环境状态。可以是摄像头、雷达这类硬件,也可以是 API 接口、数据流这类虚拟感知手段。
- 执行器:作用于环境、改变环境状态。既可以是机械臂、方向盘等物理设备,也可以是调用接口、执行代码这类虚拟工具。
- 自主性:智能的核心。不是简单被动执行预设指令,而是结合感知信息与自身内部状态独立做决策,形成「感知 → 决策 → 行动」的闭环。
简单理解:智能体不断感知环境,自主做出决策,再通过行动去影响环境,循环闭环来完成目标。
2. 传统视角下智能体的演进
在大模型 Agent 兴起之前,传统人工智能已经走过了一条由简到繁、从被动响应到自主学习的智能体演进路线。
(1)简单反射智能体(Simple Reflex Agent)
依靠人工编写的条件‑动作规则做决策,只看当前时刻的环境感知,没有记忆、无法理解上下文。
例子:恒温器,检测室温>25℃就开启制冷。 优点:简单高效;缺点:只能处理简单场景,复杂环境无法适配。
(2)基于模型的反射智能体(Model‑Based Reflex Agent)
引入内部世界模型,相当于给智能体增加 "记忆",用来保存那些无法直接感知到的环境信息,不再只依赖瞬时感知做判断。
例子:隧道里行驶的自动驾驶车,摄像头看不到前车,但内部模型依旧维护前车的位置、速度信息。
(3)基于目标的智能体(Goal‑Based Agent)
不再被动响应环境,而是以目标为导向主动规划行动。会思考:我要做什么,才能抵达目标状态。
例子:GPS 导航,以到达目的地为目标,借助地图模型,使用 A * 等算法搜索、规划出行路径。核心能力是对未来进行预判和路径规划。
(4)基于效用的智能体(Utility‑Based Agent)
现实场景往往存在多个互相冲突的目标,不能只满足单一目标。 这类智能体为不同环境状态设置效用值(代表满意程度),决策目标是最大化期望效用,在多个冲突目标之间做权衡取舍,模拟人类理性决策。
例子:导航同时兼顾时间最短、路程最短、避开拥堵,综合选出最优方案。
(5)学习型智能体(Learning Agent)
前面几类智能体的决策逻辑都高度依赖人类预设规则、模型、效用函数。 学习型智能体希望摆脱大量人工预设,通过和环境交互自主学习优化策略。典型实现方案是强化学习。 架构分为两部分:性能元件(负责执行行动)、学习元件(根据行动的反馈结果不断修正决策策略)。
经典案例:AlphaGo Zero,通过大量自我对弈、奖励反馈,学习出超越人类经验的围棋策略。
3.大语言模型驱动的新范式
以**GPT(Generative Pre-trained Transformer)**为代表的大语言模型的出现,正在显著改变智能体的构建方法与能力边界。由大语言模型驱动的 LLM 智能体,其核心决策机制与传统智能体存在本质区别,从而赋予了其一系列全新的特性。
3.1传统智能体与 LLM 驱动智能体的核心对比
| 对比维度 | 传统智能体 | LLM 驱动的智能体 |
|---|---|---|
| 核心引擎 | 基于显式编程的逻辑系统 | 基于预训练模型的推理引擎 |
| 知识来源 | 工程师预定义的规则、算法、知识库 | 从海量非结构化数据中间接学习、内化 |
| 处理指令 | 需结构化、精确的命令 | 可理解高层级、模糊的自然语言 |
| 工作模式 | 确定性的、可预测的 | 概率性的、生成式的 |
| 泛化 / 适应性 | 弱,局限于预设框架 | 强,具备强大的涌现能力和泛化能力 |
| 开发范式 | 规则设计、算法编程、知识工程 | 模型训练、提示工程、微调 |
4.智能体的类型
4.1基于内部决策架构的分类(《人工智能:一种现代方法》)
按照智能体内部决策逻辑复杂度递进:
- 反应式智能体(简单反射型):仅根据当前感知直接输出动作,没有内部状态记忆
- 基于模型的反应式智能体:维护环境内部状态,能感知不可直接观测的信息
- 基于目标的智能体:以目标为导向,主动规划动作序列来达成目标
- 基于效用的智能体:在多个可行方案里权衡,最大化收益 / 满意度
补充:学习能力属于元能力,可以附加在上面任意一类智能体上,使其能依靠经验自我迭代优化。
4.2基于时间与反应性的分类(决策速度 vs 决策质量的权衡)
核心区分:收到信息后是立刻响应,还是先深度规划再行动
- 反应式智能体(Reactive Agents)
- 特点:感知→直接响应,决策延迟极低,几乎不做长远规划
- 优点:速度快、计算开销小;缺点:短视,容易陷入局部最优,难以处理多步骤复杂任务
- 例子:汽车安全气囊、高频交易机器人;上面的简单反射 / 基于模型的智能体都属于这类
- 规划式智能体(Deliberative Agents,审议式智能体)
- 特点:行动前利用内部世界模型推演多种可能性,评估不同行动路径,寻找最优方案
- 优点:具备长远战略能力,适合复杂长流程任务;缺点:计算成本高、耗时久,容易错过时机
- 例子:旅行规划、商业方案制定;基于目标、基于效用的智能体属于这类
- 混合式智能体(Hybrid Agents)
- 特点:融合反应式和规划式两者优势,兼顾即时响应与长期规划
- 经典分层架构:底层快速反应模块处理紧急事件;高层规划模块负责长期目标
- 现代 LLM 智能体本质就是混合式 :ReAct "思考 - 行动 - 观察" 循环
- 规划(Reasoning):思考阶段,LLM 分析现状、规划下一步动作(审议)
- 反应(Acting & Observing):调用工具交互、获取环境反馈(即时响应)
- 将复杂大任务拆解成一连串「规划 - 反应」微循环
5.基于知识表示的分类(智能体存储、使用知识的底层形式)
-
亚符号主义 AI(Sub-symbolic AI / 连接主义)
- 核心:知识不是显式规则,而是隐含在神经网络海量参数里的统计模式
- 优势:擅长图像、语音这类非结构化数据,抗噪声;
- 缺陷:黑盒不可解释,纯逻辑推理容易产生幻觉
- 代表:深度学习、大模型底层神经网络
-
符号主义 AI(Symbolic AI,传统 AI)
- 核心:智能来自对可读符号(概念、词语)的严格逻辑运算,依靠规则库、知识图谱
- 优势:推理过程透明、可追溯,高风险场景可靠;
- 缺陷:知识获取瓶颈,无法处理规则之外的未知新场景
- 代表:专家系统、知识图谱推理
-
神经符号主义 AI(Neuro-Symbolic AI,混合主义)
- 定位:融合亚符号 + 符号主义的 "大和解" 方案
- 核心目标:同时拥有神经网络的模式学习能力 + 符号系统严谨的逻辑推理能力
- LLM 智能体是典型落地案例:底层神经网络做模式识别、文本生成;运行时输出结构化计划 / 工具调用(符号化步骤),实现两种能力结合
- 理论类比:对应《思考,快与慢》双系统理论
6.智能体核心运行机制:智能体循环(Agent Loop)
智能体不会一次性完成全部任务,而是不断循环往复和外部环境交互,这套基础运行机制叫做智能体循环 Agent Loop,是智能体实现自主行为的底层基础。
循环四个核心阶段
6.1 感知 Perception(循环起点)
智能体依靠传感器接收环境的信息输入,得到观察 Observation。
- LLM 智能体的传感器:用户输入、API 监听、工具返回结果
- 观察内容:用户原始提问、上一步工具执行之后环境返回的反馈信息。
6.2思考 Thought(核心决策环节,大模型承担)
拿到观察之后进入内部推理,又拆分为两个子步骤:
- 规划 Planning 结合当前观察 + 内部记忆,更新对任务、环境的理解;把复杂大目标拆解成若干子任务,生成或者调整执行计划。
- 工具选择 Tool Selection 对照已有的工具库,根据计划挑选下一步要调用的工具,确定调用需要的参数。
ReAct 范式的
Thought阶段就对应这里的「规划 + 工具选择」。
3. 行动 Action
决策完成后,通过执行器 Actuators 对外执行动作。 在 LLM 智能体中最典型就是调用工具:调用搜索 API、调用模拟天气 / 酒店接口、执行代码,以此改变外部环境。
4. 环境反馈,形成闭环
智能体执行Action之后,会让环境 Environment 发生状态改变 State Change 。 环境输出新的Observation(观察),再次交给智能体的感知模块,开启新一轮循环。
智能体就是不断跑这个闭环,一步步从初始状态逼近最终目标;设置最大循环轮次,用来防止无限死循环。
7.智能体的感知与行动
在工程落地场景下,如果想要大语言模型稳定驱动智能体循环,就需要一套交互协议(Interaction Protocol),用来规范智能体和外部环境之间的信息交换规则。
当下主流智能体框架里,这套交互协议主要体现为结构化输出规范:智能体不再直接返回自由的自然语言答案,而是输出固定格式的文本,显式承载内部推理逻辑与可执行决策。 结构化输出包含两大核心组成部分:
- Thought(思考) 智能体内部决策的快照,以自然语言描述智能体对当前场景的分析、对上一轮观察结果的复盘、任务拆解反思,同时规划下一步要执行的动作。
- Action(行动) 智能体完成推理之后,确定要作用于外部环境的具体操作,一般采用函数调用的形式表达。
示例(旅行规划智能体输出)
Thought: 用户想知道北京的天气。我需要调用天气查询工具。
Action: get_weather("北京")
其中Action就是下发给外部系统的指令,配套的解析器(Parser) 会识别该指令,自动执行对应的get_weather函数。
工具执行完毕后,环境会返回原始数据(比如 JSON 格式天气数据)。但这类机器可读数据往往携带大量冗余内容,并不适合大模型直接处理。 感知系统 在这里承担传感器的职责:清洗、提炼原始返回数据,封装成简洁易懂的自然语言,也就是Observation(观察)。
示例
Observation: 北京当前天气为晴,气温25摄氏度,微风。
封装完成的Observation会作为新一轮循环的输入送入大模型,驱动下一轮Thought和Action流程。
综上,这套Thought-Action-Observation闭环(经典 ReAct 范式),成功将大模型原生的语言推理能力,和外部环境真实信息、工具操作能力打通,是 LLM 智能体最基础通用的工程实现方案。
8.智能体应用的协作模式
按照智能体在任务里承担的角色、自主程度,可以将协作模式分为两大类:一类是作为开发者工具 ,嵌入现有工作流辅助人;另一类是作为自主协作者,多个智能体相互配合完成复杂任务。
8.1作为开发者工具的智能体
该模式下,智能体深度集成进开发者工作流,定位是能力增强型辅助工具,不会替代开发者。它自动处理重复、繁琐的工作,让开发者聚焦核心创造性任务,以此提升软件开发的整体效率与质量。
目前主流 AI 编程工具各有侧重:
- GitHub Copilot:GitHub 与 OpenAI 联合推出,深度嵌入 VS Code 等编辑器,核心能力是代码实时补全(单行 / 完整函数块);配套 Copilot Chat 支持在编辑器内对话排查代码问题。
- Claude Code:Anthropic 开发,面向终端场景,可理解完整代码仓库,支持代码编辑、测试、调试全流程;支持无交互 headless 模式,适配 CI、预提交钩子、自动化脚本等场景。
- Trae:轻量化新兴 AI 编程工具,擅长代码智能生成、自动重构,响应速度快,适合快速原型、高频迭代的开发场景。
- Cursor:原生 AI 代码编辑器,并非传统编辑器加装 AI 插件。核心优势是理解全仓库上下文,能够完成代码问答、深度重构与调试。
这类工具共同的发展趋势:AI 正在渗透软件研发全生命周期,通过人机协同重塑传统开发范式。
8.2作为自主协作者的智能体
和工具模式最大区别:不再需要人类一步步下达指令,只需要交付高层级目标。智能体能够像团队成员一样自主规划、推理、执行、复盘迭代,直到产出结果。 人机关系从传统的命令 - 执行 ,升级为目标 - 委托,智能体从被动工具转变为主动完成目标的独立主体。
当下自主智能体的主流架构范式:
- 单智能体自主循环 早期经典范式,代表如 AgentGPT。单个通用智能体依靠「思考 - 规划 - 执行 - 反思」闭环,自我迭代、自主提示,完成开放性高层任务。
- 多智能体协作(当前主流方向) 模拟人类团队分工协作解决复杂问题,细分两类实现:
- 角色扮演式对话:以 CAMEL 为代表,给智能体分配固定角色(产品经理、程序员等),约定通信协议,通过结构化对话协同完成任务。
- 组织化工作流:MetaGPT、CrewAI 为典型,搭建标准化虚拟团队,每个智能体有明确岗位职责与 SOP,按顺序 / 层级协作输出完整成果(整套项目代码、行业报告等);AutoGen、AgentScope 支持自定义智能体交互网络,灵活性更强。
- 高级控制流架构 LangGraph 是典型代表,把智能体任务抽象为状态图(State Graph),原生支持循环、分支、失败回溯、人工介入等复杂流程,为智能体提供稳定可靠的底层工程能力。
多种架构共同推动自主智能体落地,具备处理真实世界复杂任务的能力,后续章节会对比不同框架的特性与适用场景。
9.Workflow 和 Agent 的差异
在理解智能体 "开发者工具" 与 "自主协作者" 两种模式后,需要区分 Workflow(工作流) 和 Agent(智能体)。二者都可以实现自动化任务,但底层逻辑、核心特性、适用场景有本质区别:
9.1 Workflow(传统工作流)
核心:预先结构化编排、静态固定流程,提前写死所有步骤、分支判断条件,运行时不会自主新增逻辑、调整路径。 ✅ 特点:确定性强、可控、适合标准化固定任务 ❌ 缺点:无法应对未知情况,新增分支就要改代码 / 配置 📌 示例:企业费用报销审批流程 员工提交报销单 → 判断金额
- 金额<500 元 → 部门经理审批 → 通过后财务打款
- 金额>500 元 → 部门经理审批 → 财务总监审批 → 通过后财务打款
9.2 LLM Agent(大模型智能体)
核心:目标驱动、具备自主推理能力,LLM 作为 "大脑",感知环境、自主拆解任务、选择工具、动态决策,没有硬编码分支规则。 ✅ 特点:灵活性强,可处理开放式、不确定的任务 ❌ 缺点:结果不可完全确定,存在幻觉,可控性弱于工作流 📌 示例:智能旅行助手,需求:查询北京今日天气,并根据天气推荐景点
- 任务拆解 & 工具调用:自动拆分为【查天气】→【根据天气推荐景点】,主动调用天气 API
- 推理决策:根据返回的天气动态判断适合室内 / 户外场景
- 输出结果:生成人性化回答
关键:不存在硬编码
if 晴天 then 推荐颐和园,雨天会自主切换推荐室内场馆
9.3核心对比汇总表
| 维度 | Workflow 工作流 | LLM Agent 智能体 |
|---|---|---|
| 驱动方式 | 流程驱动(预定义步骤) | 目标驱动(自主规划) |
| 决策逻辑 | 分支规则硬编码,静态不变 | LLM 实时推理,动态生成方案 |
| 自主性 | 无自主决策能力,机械执行 | 可自主拆解任务、选择工具、调整方案 |
| 适用场景 | 标准化、固定流程任务(审批、表单流转) | 开放式、多变、需要灵活判断的任务 |
| 可控性 | 高,结果稳定可预期 | 偏低,存在不确定性 |

Workflow 报销工作流

LLM Agent 旅行助手运行流程
一句话总结:Workflow 是预定义流程,AI 按固定步骤执行;Agent 是目标驱动,AI 自主推理、动态规划完成任务。
结语
把整篇文章放在一起看,智能体的演进其实一直沿着两条线索展开:一条是决策能力 的增强,从简单反射、基于模型、基于目标,到基于效用与学习,智能体从「被动响应」逐步走向「主动规划」;另一条是知识表达方式的变化,从显式符号规则走向神经网络参数,再到神经符号融合。大语言模型出现后,这两条线索在工程层面真正交汇,形成了今天所说的 LLM 智能体。
LLM 智能体并不是对传统智能体的简单替代,而是一次能力升级。它把大模型的语言理解、泛化与推理能力,接入到「感知 → 思考 → 行动 → 反馈」的 Agent Loop 中,再通过结构化输出、工具调用和多智能体协作,把模型能力稳定地落地到真实任务里。与此同时,我们也要清楚它和 Workflow 的边界:确定性强、流程固定的任务优先选 Workflow;开放、多变、需要自主判断的任务更适合交给 Agent。现实工程中,绝大多数系统不会二选一,而是在关键节点做确定性控制,在需要灵活推理的地方引入智能体,用混合架构平衡可控性与智能化。
最后回到一个更实用的判断标准:不要为了「智能体」而智能体,而要看任务是否需要自主规划、动态决策和反复试错。理解智能体背后的循环机制、交互协议和协作模式,比记住一堆框架名称更重要。未来,随着多智能体协作、状态图控制流和可解释性技术继续发展,智能体会更接近一个可信赖的「自主协作者」;而对开发者来说,真正稀缺的能力,是知道何时让它自主行动,何时把它放进确定性的轨道。
本文为个人学习整理笔记,知识素材来自 datawhalechina hello‑agents 开源教程,仅用于学习交流,禁止商用。