Agent思维模式 | 评估

Agent思维模式:ReAct、Plan and Execute、Reflection

Agent 处理任务时的不同推理与执行策略

概念 全称 特点
ReAct R easoning A nd Act 边规划、边执行
Plan and Execute - 先规划、后执行
Reflection - 反思机制

ReAct(Reasoning and Act)

ReAct 是 Reasoning and Act 的缩写,本质上是一种**边规划边执行**的混合模式

  • 交替进行 :推理(Reasoning)与行动(Acting)交替执行
  • 即时调整 :根据当前执行结果动态调整后续计划
  • 适合复杂任务 :能够处理需要综合分析和多步骤执行的问题

处理流程

复制代码
用户输入 → LLM分析问题 
    ↓
推理 (Reasoning) → 行动 (Act) → 推理 → 行动 → ...
    ↓
返回结果

Plan and Execute(先规划后执行)

与 ReAct 不同,Plan and Execute 采用**两阶段分离**的策略

  • 阶段一:先完整规划整个任务流程

  • 阶段二:再按计划顺序执行

  • 更适合:任务边界清晰、步骤可预见的场景

    用户输入 → 完整规划 (Plan)

    按顺序执行 (Execute)

    返回结果


Reflection(反思)

Reflection 即反思,是 Agent 的一种自我修正机制

  • 对执行结果进行评估
  • 识别错误或不足
  • 调整策略后重新执行

维度 ReAct Plan and Execute Reflection
执行顺序 边想边做 先想后做 做完后想
灵活性 需要其他模式配合
计算成本 视情况而定
适用场景 动态、复杂任务 明确、线性任务 错误修正、自我优化

Agent Evaluation

Evaluation-评估,是对Agent进行系统性评价的过程

由于Agent基于LLM生成答案,其评估标准并非放之四海而皆准,而是需要根据不同的应用场景和落地方向进行针对性设计。

为什么要评估

评估的目的不仅仅是区分"能用"和"不能用"(这通常是暂时性判断),更核心的目的是通过评估进行调优。具体来说:

  1. 发现问题所在
  2. 指导进一步优化方向
  3. 建立更细致、更深入的评估流程

这一思维方式适用于所有软件工程类和科研类项目。例如:一个可运行的游戏,虽然功能正常,但仍可优化代码降低CPU/内存占用、减少网络流量消耗。

评估的两种类型

端对端评估

从用户视角出发,评估Agent从输入到输出是否合格。这是基础层面的判断,如果连基本匹配都做不到,Agent本身就不可用。

非端对端评估(步骤级评估)

针对工作流中的具体步骤进行分析和调优。典型工作流包括:

阶段 描述
分析 LLM分析用户输入,理解用户目的/企图
Planner 规划执行步骤(1、2、3、4、5...)
执行 逐个执行每个步骤(如RAG查询、搜索网页、调用工具、写本地文件等)

注:如果是ReAct等推理模式,可能会有更多的循环,由LLM自主决策下一步。

如何做评估

最简单的端对端评估可以用表格形式呈现:

序号 Input Output Ground Truth(标准答案) Score(评分)
1 ... ... ... ...
2 ... ... ... ...
3 ... ... ... ...

评估的具体方式不必拘泥,重点是建立一套符合落地场景的具体标准,用以判断Agent的输出是否正确。

核心要点

  • 评估标准需要根据应用场景定制
  • 评估的真正目的是调优,而非简单的通过/失败判断
  • 端对端评估看整体,非端对端评估看细节
  • 两种评估结合使用,才能全面提升Agent质量
相关推荐
Shockang19 小时前
AI 编码智能体生产化工程
人工智能
jay神20 小时前
深度学习确定baseline之后怎么做改进?
人工智能·深度学习·yolo·计算机视觉·分类
acrel720 小时前
安科瑞Acrel-1000变电站综合自动化系统在合肥某新材料公司35kV综合自动化项目中的应用分析
大数据·人工智能
UWA20 小时前
隐藏视频变“常驻刺客”,VideoPlayer与“N/A”纹理该怎么查
人工智能·性能优化·音视频·memory·cpu·游戏开发
V哥AI增长20 小时前
小红书笔记在生成式AI引擎中的可见性机制解析:从抓取原理到GEO工程化实践
大数据·人工智能·笔记
ajassi200021 小时前
AI语音智能体开发日记(十二)GX8006 固件定制指南——从双唤醒词到 UART 音频传输
人工智能·ai·ai编程
大模型momo21 小时前
告别单体 Agent:多智能体设计模式(Multi-Agent Patterns)深度实战手册
人工智能·agent·multi-agent·多agent
DisonTangor21 小时前
【SeeDream开源平替】MiniMax H3 重磅开源:全模态视频生成新标杆,2K 画质 + 原生立体声,15 秒大片一键生成!
人工智能·ai作画·开源·aigc·音视频
很楠爱上21 小时前
(附上相关学习资源)适合新手做的第一个agent项目*ovo*Dify Agent 全栈实战:从智能选车顾问到新能源汽车之家的端到端开发
人工智能·汽车·agent·项目·开发笔记
IT智慧客073121 小时前
2026年7月前端面试高频考点与趋势分析(面20个前端后的总结)
人工智能