AI Agent_4 Agent工作原理详解:从“会聊天“到“会办事“

引言:先分清三个容易混淆的概念

概念 是什么 类比 例子
Chatbot(聊天机器人) 只负责"对话":你问它答,一轮一轮,不主动做事 一位博学但只能动嘴的顾问 早期 ChatGPT 网页版
Workflow(工作流) 按人写死的固定流程执行 一条流水线,每个工位干什么早就规定好了 "收到邮件→提取关键词→存数据库",规则是程序员写的
Agent(智能体) 大模型自己决定下一步做什么:观察环境→思考→调用工具→再根据结果调整 一位被雇来干活的实习生:你给目标,它自己规划步骤、查资料、用软件、发现走不通就换方案 "帮我规划一次三天两夜的杭州旅行,预算 2000,把机票酒店都订好"

一句话定义 :AI Agent = 以大语言模型为"大脑",具备**感知(Perception)、规划(Planning)、记忆(Memory)、工具使用(Tool Use)、行动(Action)**五种能力,能在循环中自主朝着目标推进的系统。

判断标准很简单:目标是给定的,路径是模型自己找的。 这就是 Agent 与 Chatbot/Workflow 的分界线。


第一部分:Agent 的解剖------五大模块,逐个拆

一个 Agent 内部长这样:

复制代码
            ┌─────────────────────────────┐
 用户目标 → │           规 划              │ ← 大脑:LLM
            └──────┬──────────────────────┘
                   │
        ┌──────────┼──────────┐
        ▼          ▼          ▼
     感知       记忆        工具/行动
  (眼睛耳朵)(笔记本)  (手和脚)
        │          │          │
        └──────────┼──────────┘
                   ▼
              环境反馈(观察)
                   │
                   └────→ 回到规划,继续循环

下面逐个模块讲透。

1.1 大脑:大语言模型(LLM)

Agent 的大脑就是一个 LLM(GPT-5、Claude、Kimi 等)。注意它在这个角色里干的核心活不是聊天,而是做决策:

  • 把用户的模糊目标拆解成步骤(规划);

  • 判断当前该调用哪个工具、传什么参数(决策);

  • 读工具返回的结果,判断任务是否完成、下一步怎么走(反思)。

新手需要理解的一个关键机制:大模型本身其实没有"循环"能力。 它本质是一个函数:输入一段文字(提示词+对话历史+工具结果),输出一段文字。所谓"循环",是外面的程序在驱动:

复制代码
while 任务未完成:
    输出 = LLM(提示词 + 历史)
    if 输出要求调用工具:
        结果 = 执行工具(输出.参数)
        历史.append(结果)   # 把工具结果追加进历史
    else:
        返回最终答案

机理讲解 :就像一位只能"说一句、等一句"的远程顾问。你(外围程序)负责:把它的每句话翻译成实际行动(调工具),把行动结果反馈给它,再问"接下来呢?"------循环往复,直到它说"搞定了"或达到轮次上限。这就是为什么 Agent 的能力上限 = 模型智力 × 外围框架质量。有一项 2026 年的对照研究结论非常震撼:脚手架(框架/提示/重试逻辑)不同,同一模型得分最多相差 22%;而换不同模型,得分只差约 1% 。 翻译成人话:怎么搭这个循环,比用哪个模型更重要。

1.2 感知(Perception):眼睛和耳朵

感知 = 把环境信息变成模型能"读"的文本或 token。三种典型形式:

① 用户直接输入:文字、图片、语音、文件。

② 工具回传的环境状态:网页内容、数据库查询结果、程序报错信息。

③ 截图/界面感知(Computer Use 类 Agent):把屏幕截图喂给多模态模型,让它"看"到按钮在哪。2026 年 GPT-5.4 和 Gemini 3.1 Pro 在 OSWorld 计算机操作评测中都达到 75.0%,已超过人类专家基线 72.4%------意味着模型"看屏幕点按钮"这件事,已经追平了人。

举例 + 机理(图文问答):

你上传一张冰箱内部照片,问:"我能做什么菜?"

  • 感知阶段:图像编码器(上一章讲过的 ViT)把照片变成一串视觉 token,"黄瓜、鸡蛋、剩米饭、半瓶老干妈"这些视觉概念被激活;

  • 语言模型把视觉 token 和你的文字问题一起理解------这一步就是多模态感知,模型"看"到了食材;

  • 然后进入规划:缺什么信息?是否需要查菜谱工具?是否需要确认你忌口?

  • 行动:可能直接给出"黄瓜炒蛋 + 老干妈炒饭"的方案,也可能先反问"你有几个人的量?"

价值讲解 :纯 Chatbot 也会说"黄瓜炒蛋",但它看不到你的冰箱里其实只剩一根黄瓜------感知让 Agent 的回答锚定在真实环境上,而不是凭常识泛泛而谈。

1.3 规划(Planning):把目标变成步骤

规划的复杂度从低到高,新手按这个顺序理解:

层级 1:单步反应------用户问什么答什么(Chatbot 模式)。

层级 2:思维链(Chain-of-Thought, CoT)------让模型"先想后说"。

举例 :你问"我 3 点有个会,现在 2:40,从这里到会议室要 25 分钟,来得及吗?"纯回答模型可能脱口而出"来不及";CoT 的机理是提示模型显式写出中间推理 :"3:00 - 2:40 = 20 分钟 < 25 分钟,所以来不及,需要推迟 5 分钟或请人代开。"写出推理过程后,答案的错误率大幅下降。这不是模型变聪明了,而是它被迫把计算过程展开,而不是一步跳答案。

层级 3:ReAct(Reasoning + Acting,推理+行动交替)------Agent 的主流工作模式,也是你必须记住的核心范式:

复制代码
思考(Thought):我现在缺什么信息?→ 行动(Action):调用搜索工具
观察(Observation):搜索返回了结果 → 思考:够了吗?→ ...

举例(完整轨迹演示):你说"帮我查一下明天北京飞上海最早的高铁,然后把车次发给我"

复制代码
🧠 思考:用户要"明天最早的高铁"。我需要:①明天的日期 ②高铁时刻表数据
🔧 行动:call_tool("get_current_date") → 返回 "2026-09-11"
🧠 思考:好,明天是 9 月 11 日。现在查高铁
🔧 行动:call_tool("search_train", {from:"北京", to:"上海", date:"2026-09-11"})
📥 观察:G1(06:43), G3(07:00), G5(07:40)...
🧠 思考:最早的是 G1。任务完成,整理输出
✅ 最终答案:明天最早的高铁是 G1 次,06:43 从北京南出发...

机理讲解 :注意每一轮"思考"的输出并不是给你看的答案,而是给下一行动的内部决策(调什么工具、传什么参数)。观察结果回填进对话历史后,模型基于新信息重新决策。这就是"边想边做"------人类解决问题的真实方式(查一下→想想→再查一下),被压缩进了一个循环。

层级 4:复杂规划------面对大任务,先出完整计划再执行;或并行探索多条路径(如 Tree-of-Thoughts 树状思考,像下棋一样评估多个分支)。2026 年主流模型大多在 RL 训练中内化了长程规划,不再需要显式 prompting。

1.4 记忆(Memory):上下文窗口是"工作记忆",不是全部记忆

① 短期记忆 = 对话上下文(Context Window)

模型能"记住"对话,本质是把历史对话塞进输入。这像人的工作记忆------容量有限(窗口 32K~100 万 token 不等,但越塞越贵、注意力越稀释)。

② 长期记忆 = 向量数据库 + RAG(检索增强生成)

机理:当用户说"我喜欢喝拿铁",Agent 不把它留在对话里(对话一关就没了),而是:

  • 用 Embedding 模型把"用户喜欢喝拿铁"转成高维向量,存进向量数据库;

  • 以后用户问"推荐一款咖啡"时,把这个问题也转成向量,在库里做相似度搜索,捞出相关记忆,一起喂给模型。

举例 + 机理讲解:

三个月后你再次打开应用:"老样子,来一杯。"

Agent 的检索:把"老样子,来一杯"向量化 → 在记忆库中检索 → 命中"拿铁"相关记忆 → 拼进提示词 → 模型据此回答:"好的,一杯拿铁,还是和往常一样吗?"

关键机理 :模型本身三个月前的对话一个字都不记得 ------每次对话都是从零开始的状态机。所谓"记住你",是外围系统每次开场前偷偷把相关记忆检索出来塞进了提示词。模型看到"此用户喜欢拿铁",就自然接住了话。记忆系统 = 一个会预判"这次对话需要哪些背景"的图书管理员。

③ 情景记忆 / 程序性记忆:更高阶的形态------记住"上次订机票失败是因为没有登录"这类经验,下次自动先登录。这是 2026 年研究热点。

1.5 工具使用(Tool Use):从"动嘴"到"动手"

这是 Agent 从"顾问"变成"员工"的关键能力,技术上叫 Function Calling(函数调用)。

工作机制(四步):

  1. 注册:开发者把工具写成"说明书"提供给模型,包括函数名、功能描述、参数格式。例如:

    {
    "name": "search_flights",
    "description": "查询航班信息",
    "parameters": {
    "type": "object",
    "properties": {
    "origin": {"type": "string", "description": "出发城市"},
    "destination": {"type": "string", "description": "到达城市"},
    "date": {"type": "string", "description": "日期,格式YYYY-MM-DD"}
    },
    "required": ["origin", "destination", "date"]
    }
    }

  2. 选择:模型阅读说明书后,输出一段结构化 JSON:"我决定调用 search_flights,参数是北京/上海/2026-09-11"。

  3. 执行 :模型自己并不执行------是外围程序解析这段 JSON、真正去调航班 API,把结果拿回来。(重要机理:模型是"指挥官",不是"士兵";所有真实世界的副作用(发邮件、下单、转账)都由程序层执行,这也给安全控制留了卡口。)

  4. 回填:工具结果作为新消息追加进历史,模型继续思考。

举例 + 机理讲解(图像描述生成,调用外部工具版):

任务:"给这张照片生成一段适合发小红书的文案,并按爆款风格配图"

模型规划的完整轨迹可能是:

plain

复制代码
🧠 思考:先理解图片内容 → 需要视觉理解能力(模型自带,直接看图)
   观察:图里是一个人在洱海边骑车,日落
🧠 思考:内容有了。用户要"配图"------我生成不了图片,但有 image_gen 工具
🔧 行动:call_tool("image_gen", {prompt: "洱海日落骑行,日系胶片风"})
📥 观察:返回图片 URL
🧠 思考:图片生成成功。现在写文案,结合图片内容和平台风格
✅ 输出:文案 + 配图

价值讲解 :注意这个任务里模型既有内置能力(看图、写文案),又调了外部工具(生图)------Agent 的厉害之处在于它能自己权衡"哪部分我来做,哪部分交给工具"。这和纯多模态模型"一条龙包办"不同:工具是即插即用的专业外包,模型是调度它们的项目经理。

1.6 MCP:工具生态的"USB-C 接口"

2024 年底 Anthropic 提出 MCP(Model Context Protocol),到 2026 年 7 月累计下载 9700 万次,被 OpenAI、Google、Microsoft 采纳。

解决什么问题:MCP 之前,每个 Agent 框架各搞一套工具接口(OpenAI 有 Function Calling、LangChain 有自己的 Tool 抽象),互不兼容------一个天气工具要给十家框架各写一遍适配,如同 2000 年代的手机充电器,一家一个口。

MCP 的机理 :统一成"USB-C"。工具开发者只写一个 MCP Server(暴露工具、资源、提示词),任何支持 MCP 的 Agent(Claude Desktop、各类 IDE、ChatGPT 等)插上就能用,传输层走标准 JSON-RPC 协议。 进一步,A2A 协议(Agent-to-Agent,Google 提出,已捐给 Linux 基金会)解决Agent 与 Agent 之间的通信------MCP 是 Agent 的"工具插头",A2A 是 Agent 的"外交语言",两者分层互补。


第二部分:一个完整的多模态 Agent 案例全程解剖

选语音方向(用户点名"语音与文本转换"),演示一个语音客服 Agent 的完整链路:

场景:你对着手机说:"我要退上周三买的那件蓝色外套,太薄了。"

第 1 步 · 语音感知(耳朵)

声音波形 → ASR(语音识别)或原生音频编码器 → 文本:"我要退上周三买的那件蓝色外套"。

机理讲解 :早期做法是级联------先调专门的 ASR 模型转文字,再交给语言模型。问题前面提过:语气、情绪、说话人身份在转文字时被丢掉,ASR 听错("太薄了"→"太破了")下游无法纠正。2024 年后主流转向原生语音输入:音频 token 直接进统一模型,一步到位。

第 2 步 · 意图理解 + 规划(大脑)

模型解析出:意图=退货;实体=商品(蓝色外套)、时间(上周三)、原因(太薄)。规划出步骤:①查到那笔订单 ②确认是否符合退货政策 ③发起退货 ④告知结果。

第 3 步 · 工具调用循环(手脚)

复制代码
🔧 call_tool("query_orders", {keyword:"外套", date_range:"上周"})
📥 观察:订单 #88231,蓝色防风外套,¥299,签收 4 天
🧠 思考:签收 7 天内,符合"7天无理由"。发起退货
🔧 call_tool("create_return", {order_id:"88231", reason:"太薄"})
📥 观察:退货单已创建,上门取件时间可选
🧠 思考:还需要确认用户方便的时间
✅ 输出(转为语音):"已为您申请退货,快递明早 9-11 点上门取件,可以吗?"

第 4 步 · 语音输出(嘴)

文本 → TTS(语音合成)→ 声波。2026 年的语音合成已能控制音色、语速、情绪------"太薄了"这种轻微抱怨的场景,回应的语气会相应柔和。

机理讲解 :这个案例串起了全链条------感知(语音→文本)→ 规划(拆步骤)→ 记忆(需要查订单历史=长期记忆+工具)→ 工具调用(订单系统、退货系统)→ 生成(语音合成) 。单看每一环都是"老技术"(ASR、TTS、RAG 都二十年了),Agent 的质变在于:LLM 成了总调度,把各环节串成了能自主闭环的完整系统。


第三部分:多 Agent 协作------从"一个人干活"到"一个团队"

复杂任务(写一份行业研究报告)一个 Agent 既当研究员又当写手又当审核,容易顾此失彼。多 Agent 的思路:角色分工 + 互相讨论。

经典架构举例(研究报告团队):

复制代码
        ┌─────────────┐
        │  主管 Agent  │ ← 拆解任务、分派、汇总
        └──┬─────┬────┘
     ┌─────┘     └─────┐
     ▼                 ▼
 研究员 Agent      写手 Agent
(搜索+阅读工具)  (写作,无工具权限)
     │                 │
     └────────┬────────┘
              ▼
         审核 Agent(事实核查,可驳回返工)

机理讲解 :每个 Agent 是独立的"进程":有自己的系统提示词(人设/职责)、自己的工具权限、自己的记忆。它们通过消息传递协作(研究员把资料发给写手,审核把修改意见发回写手)。微软 AutoGen 的实验表明,多 Agent 对话在复杂推理基准上一致优于单 Agent 系统。 原因类似人类社会:写作时你很难同时保持"创造力"和"自我批判",拆给两个角色,各自专注。

工程现实 :2026 年的共识是------能用一个 Agent 解决的不要上多 Agent。多 Agent 引入的通信开销、错误传播(一个 Agent 理解偏了,全队跑偏)、成本翻倍,常常得不偿失。多 Agent 适合"职责天然分离且单角色上下文会爆炸"的场景(如软件团队:架构师/编码/测试)。


第四部分:为什么 Agent 在 2026 年"突然"爆发?三个条件刚好凑齐

  1. 工具调用终于可靠了 。2024 年初 GPT-3.5 时代的工具调用准确率只有 70-80%------20 步的任务每 5 步卡壳一次,根本没法用;到 2025-2026 年,前沿模型在 BFCL 基准上达到 95%+,且学会了自己从报错中恢复(API 限流了会重试、页面结构变了会换选择器),而不是假装成功或直接放弃。

  2. 成本降到了可用线。2024 年跑一个 Agent 任务要 0.50-2.00(一次订餐厅可能调 6-8 次模型),纯玩具;2026 年降到 0.05 以下------和单位任务的人类注意力成本相比已有竞争力。

  3. 基础设施标准化。MCP 统一工具接口、LangGraph 提供带状态检查点的工作流编排(崩溃可恢复、关键节点可人工审批)、协议层(MCP/A2A/AP2)让 Agent 能跨厂商协作。 2023 年六周才能上线的 Agent,2026 年 8-12 天就能交付。


第五部分:清醒认识------Agent 现在做不到什么

① 错误的复利效应。单步工具调用准确率 95% 听起来很美,但 20 步的任务全程不出错的概率是 0.95²⁰ ≈ 36%。这是 Agent 可靠性的根本敌人,工程上的对策是:关键步骤加人工审批(human-in-the-loop)、自动重试、多路径验证。

② 幻觉会"行动化" 。Chatbot 幻觉只是说错话;Agent 幻觉是做错事------它可能自信地给一个并不存在的航班"下单"。所以生产环境的 Agent 必须做到:工具执行层有权限校验、支付类操作必须人工确认、所有动作可审计。

③ 长程任务会"迷路"。任务步数越长,性能衰减越陡------模型在长历史中丢失最初目标的"目的漂移"问题尚未根治。GAIA 基准(考察多步工具使用+网页浏览+文件处理+多模态推理的综合任务)上,人类得分 92%,2026 年初最好的 Agent 约 75%。


第六部分:新手学习路线

  1. 第一周:用起来。在支持工具调用的模型里(各类带"深度研究/智能体模式"的应用)完成 3 个真实任务:订行程、整理文献、分析数据表------注意观察和截屏它的"思考轨迹",这是最好的教材。

  2. 第二周:读懂循环。把本章的 ReAct 轨迹自己手写一遍;看懂一篇极简 Agent 代码(约 40-120 行,Hugging Face Smolagents 是最简入门,LangGraph 是生产级标准)。

  3. 第三周:动手造一个。给一个 LLM 接上 2 个工具(如搜索+计算器),用"循环+工具结果回填"的最简框架跑通;再尝试接入一个现成 MCP Server。

  4. 之后:按兴趣深入------想走工程路线学 LangGraph 状态机与检查点;想走研究路线读 ReAct、Toolformer、Voyager(自动学工具)三篇论文;想走应用路线研究你所在行业的工具生态。

相关推荐
镜象科技1 小时前
AI临床心理大模型:离临床最近的AI长什么样?
人工智能
DeepAgent2 小时前
AI Agent 工程实践(49):一次真实优化——从 Agent v1 到 v2
开发语言·人工智能·agent
小蒋观天下2 小时前
两轮车检测AI摄像头——2026-2030年未来市场规模、增长逻辑与行业天花板
大数据·人工智能·安全·计算机视觉·ai大模型
美狐美颜sdk2 小时前
直播APP接入美颜SDK后出现卡顿怎么办?从性能瓶颈寻找解决方案
android·人工智能·音视频·美颜sdk·直播美颜sdk
m0_587383002 小时前
深圳24小时自助健身房解决方案实战:从系统架构到部署指南
java·人工智能·spring boot·spring·系统架构·需求分析
罗西的思考2 小时前
[Agent Memory / 强化学习] MemPO源码学习笔记 ---(5)--- GRPO
人工智能·算法·机器学习
美狐美颜SDK开放平台2 小时前
直播APP开发实战:从摄像头调用到视频美颜sdk集成
android·人工智能·计算机视觉·音视频·直播美颜sdk
镜象科技2 小时前
抑郁情绪数字化干预:从“隐蔽的信号“到“看得见的路径“
人工智能
素男2 小时前
对上的,和没对上的——两篇之间那条链
人工智能·agent·self-becoming·ai长期记忆·ai自我介绍