深入理解agent学习笔记(一)——现代agent介绍

1. 现代 Agent = LLM + 上下文 + 工具

现代智能 Agent 可通过核心公式定义:Agent = LLM + 上下文 + 工具,三者分别对应大脑、眼睛、手脚,构成 Agent 完整运行体系,同时对应强化学习三大基础要素。

  • LLM 为 Agent 决策核心,承担思考、理解、规划、判断的能力,能力由预训练通用知识与后训练固化的决策策略共同构成,对应强化学习策略空间,负责输出行动决策。
  • 上下文是 Agent 的全量感知来源,不局限于对话文本,涵盖环境信息、用户记忆、领域知识、任务进度与系统状态,对应强化学习观察空间,决定 Agent 决策的信息边界。
  • 工具是 Agent 的落地执行能力,不限于基础 API 调用,包含文件操作、代码执行、网页检索、设备操控、子 Agent 协作、对外交互等全部行为能力,对应强化学习动作空间,负责将决策转化为实际行为。

不同类型 Agent 在感知、行动、执行策略上各有特点:Coding Agent 以代码库、终端环境作为感知源,完成增量开发;搜索 Agent 依托网络与文献资源迭代检索生成报告;电脑操控 Agent 通过屏幕视觉感知,完成界面交互;手机助手 Agent 读取移动端屏幕与应用,实现 App 自动化操作;个人办事 Agent 读取账户账单信息,完成多步对外协商事务。 各类 Agent 具备统一共性:拥有开放式动作空间、支持内部思考规划、可基于环境反馈持续迭代调整策略。

1.1 工具:Agent 的手脚

工具是 Agent 与外部世界交互的核心桥梁 ,是 Agent 从「文本推理」走向主动执行 的关键,无工具则 Agent 仅能被动输出内容,无法改变真实环境。

广义工具体系按交互逻辑分为五类核心工具,覆盖所有 Agent 交互形态:

  1. 感知工具(信息获取):负责读取外部信息,包含搜索、本地文件、数据库、业务 API,为 Agent 提供外部数据输入。
  2. 执行工具(状态修改):负责改变外部环境,包含代码执行、文件操作、系统命令、外部 API 调用,是 Agent 落地决策的核心能力。
  3. 协作工具(多智能体协同):支持任务分工,可委派子 Agent、请求人工确认、完成多 Agent 系统协作。
  4. 事件触发工具(被动驱动) :区别于主动调用,由外部事件唤醒Agent,如定时任务、新邮件、Webhook 回调,是 Agent 异步执行的入口。
  5. 用户沟通工具(人机交互) :专门面向用户,通过消息、语音、邮件传递进度与信息,专注人机交互而非环境修改。
    工具设计质量直接决定 Agent 上限 :接口模糊会导致工具滥用、异常处理缺失易造成死锁、权限过宽会引发安全风险。MCP 模型上下文协议 实现工具插件化快速接入,标准化工具生态。
    工具调用(Function Calling)是现代 Agent 核心能力 ,彻底将 LLM 从纯文本生成器升级为可实操的智能决策系统。 标准调用四步流程(ReAct 范式底层基础):
  6. 上下文注入:向 LLM 声明可用工具、用途、参数规范
  7. 模型自主决策:自主判断是否调用、调用哪个、传入参数
  8. 工具执行回写:执行结果追加至上下文
  9. 迭代决策:LLM 基于返回结果继续推理、执行下一步动作。

核心设计原则 :优先使用通用工具而非专用工具,依托沙盒、虚拟环境保障安全,让 Agent 通过自由组合基础能力,自适应解决复杂场景问题。

1.2 LLM:Agent 的大脑

LLM是Agent的决策核心 ,负责完成意图解析、复杂任务拆解,在执行全程持续判断下一步动作、工具选择与参数,理解-规划-执行整套能力依托预训练积累的知识,是工作流与自主Agent的共同底层基础。

LLM Agent具备内部思考 能力:正式行动前先完成规划推演,不改动外部环境,但显著提升行动质量。该推演能力源自预训练 阶段习得的语言规律、世界知识、因果逻辑与问题分解策略,Agent的推演不是随机探索,依托结构化知识体系展开。 由此衍生两大泛化能力:零样本泛化 ,无需任何示例,仅凭已有知识处理从未见过的全新任务;少样本适应,仅依靠少量示范样例,快速掌握新任务模式。零样本=无示例直接完成任务,少样本=少量示例快速习得模式。

模型即Agent(Model as Agent)是Agent前沿范式:依托后训练(强化学习) ,把工具调用能力内置为模型原生能力,自主判断工具调用时机、对象、参数,不再依赖人工编排。 模型能力越强,配套Harness工程外壳 越关键。Harness不限制模型,而是引导模型能力可靠落地,包含上下文管理、工具接口、安全约束、校验纠错等基础设施。模型自主决策范围扩大,风险随之提升,需要约束、验证、纠错机制保障稳定。厂商核心优势是模型与Harness协同迭代优化。 结合Rich Sutton《苦涩的教训》:长期看通用学习方法终将超越人工预置先验知识。本书立场方向认同,节奏务实:长期模型会逐步内化Harness中的能力;但落地节奏缓慢,Harness承担兜底作用,模型内化一层,Harness就向下迁移一层,该主线贯穿全书。

Agent存在三类互补学习范式

  1. 后训练:通过强化学习将经验固化进模型参数,跨任务通用性最强,但更新成本高昂;
  2. 上下文学习 :依靠注意力机制,在当前提示内借助样例快速适配任务,本质是模式匹配而非真正学习,仅能复用已有模式,无法发现新规律,能力随会话结束消失;
  3. 外部化学习 :知识、流程外置到知识库与工具代码,持久性强、便于审计解释。

三者在不同时间尺度互补:后训练打底基础能力,上下文学习实现临场快速适配,外部化学习保障系统可靠与执行效率。类比理解:后训练如同系统研读教科书,能力永久提升;上下文学习如同临场翻看参考材料,会话结束失效;外部化学习如同个人笔记,信息持久留存。

1.3 上下文: Agent的眼睛

上下文是 Agent 的视野(眼睛),代表 Agent 在每一次决策时刻能够获取的全部信息。LLM 调用时的上下文由五大模块共同组成:

  1. 系统提示词(System Prompt) :开发者预设,对话全程基本不变,相当于 Agent岗位说明书 ,定义身份、权限、行为准则;内置用户记忆与动态环境状态,通过提示工程塑造 Agent 行为模式。
  2. 工具定义(Tool Definitions) :声明可用工具名称、功能、参数结构,缺少该部分 Agent 无法识别、调用工具。系统提示词 + 工具定义构成上下文静态前缀;生产框架支持动态按需加载工具 schema。
  3. 用户消息(User Messages) :用户输入内容,可通过RAG 检索增强生成动态引入外部私有知识、实时信息。
  4. 模型回复(Assistant Messages) :模型历史输出,包含三块可选内容:reasoning内部思考链、content文本回复、tool_calls工具调用请求;不同场景组合不同,保障决策连贯可解释。
  5. 工具执行结果(Tool Results) :工具运行返回的数据,作为 Agent 下一步推理依据,帮助 Agent 从反馈中规避重复错误。
    划分:系统提示词、工具定义属于静态前缀 ;用户消息、模型回复、工具执行结果属于随交互持续增长的动态消息历史

消融实验(Ablation Study)用来验证各组件必要性,逐个移除组件观测系统变化:移除工具定义→Agent 丧失调用工具能力;缺失工具返回结果→无限重复调用同一工具;删除思考链→决策前后矛盾;缺少历史消息→Agent 失忆,重复执行任务。上下文各组件的价值具备实验验证支撑,不只是理论假设。

1.4 ReAct 循环

ReAct 循环是串联 LLM、上下文、工具三大组件的核心协同机制 ,全称 Reasoning + Acting,完整循环包含思考→行动→观察 ,持续迭代 "想→做→看",直至任务结束。

轨迹(trajectory) :Agent 执行任务过程持续积累的消息历史,包含用户消息、模型回复(思考链、工具调用)、工具返回结果。Agent 上下文 = 静态前缀 + 轨迹 。静态前缀为系统提示词 + 工具定义;轨迹为动态消息历史,每一轮模型输出、工具返回结果都会追加进轨迹,作为下一轮推理输入。

多币种收入汇总案例展示完整 ReAct 迭代流程:第一轮分析需求,并行调用货币转换工具;第二轮基于汇率转换结果,调用代码解释器做汇总运算;第三轮确认计算完成,输出最终答案。

ReAct 设计核心优势在于上下文累积性 :每轮 LLM 推理都读取完整轨迹,维持任务全局状态,知晓历史操作与结果;结构化轨迹具备强可解释性、可调试性 ,各类角色消息做清晰区分。

轨迹价值不止任务执行记录:可用于分析 Agent 行为模式、优化决策链路、迭代工具设计;轨迹数据可沉淀至知识库,或送入强化学习训练模型,形成经验学习闭环

相关推荐
渡我白衣1 小时前
HttpRequest与HttpResponse的实现
服务器·数据结构·c++·人工智能·tcp/ip·机器学习·caffe
AAIshangyanxiu1 小时前
智能气候前沿:AI Agent结合机器学习与深度学习在全球气候变化驱动因素预测中的应用
人工智能·agent·气候变化·智能气候前沿
User_芊芊君子1 小时前
让 Claude Code 换上国产大脑:蓝耘元生代上 GLM-5.2 / DeepSeek / Qwen 模型横评实测
人工智能·ai·大模型
东坡肘子1 小时前
一场关于 SwiftUI 动画的“原生”之争 -- 肘子的 Swift 周报 #154
人工智能·swiftui·swift
编程一生1 小时前
DevOps从持续开发到持续部署
人工智能
byte轻骑兵1 小时前
【LE Audio】PBP精讲[5]: 广播音频的身份标识与元数据交互法则
人工智能·音视频·le audio·低功耗蓝牙音频
智慧物业老杨3 小时前
物业日常巡查的数智化重构:从“打卡式巡检“到“闭环式风控“
android·java·人工智能·系统架构·rxjava
晴天的雨.9924 小时前
【C++算法】和为s的两个数
开发语言·数据结构·c++·算法
吴佳浩6 小时前
Skill 为什么不同于 Tool?Agent 技能库的自演进与动态加载机制
人工智能·agent·ai编程