【AI】智能体经典范式

一个现代的智能体,其核心能力在于能将大语言模型的推理能力与外部世界联通。它能够自主地理解用户意图、拆解复杂任务,并通过调用代码解释器、搜索引擎、API等一系列"工具",来获取信息、执行操作,最终达成目标。 然而,智能体并非万能,它同样面临着来自大模型本身的"幻觉"问题、在复杂任务中可能陷入推理循环、以及对工具的错误使用等挑战,这些也构成了智能体的能力边界,业界涌现出了多种经典的架构范式。

  • ReAct (Reasoning and Acting): 一种将"思考"和"行动"紧密结合的范式,让智能体边想边做,动态调整。
  • Plan-and-Solve: 一种"三思而后行"的范式,智能体首先生成一个完整的行动计划,然后严格执行。
  • Reflection: 一种赋予智能体"反思"能力的范式,通过自我批判和修正来优化结果。

ReAct

ReAct诞生之前,主流的方法可以分为两类:一类是"纯思考"型,如思维链 (Chain-of-Thought),它能引导模型进行复杂的逻辑推理,但无法与外部世界交互,容易产生事实幻觉;另一类是"纯行动"型,模型直接输出要执行的动作,但缺乏规划和纠错能力。

ReAct的巧妙之处在于,它认识到思考与行动是相辅相成的。思考指导行动,而行动的结果又反过来修正思考。为此,ReAct范式通过一种特殊的提示工程来引导模型,使其每一步的输出都遵循一个固定的轨迹:

  • Thought (思考): 这是智能体的"内心独白"。它会分析当前情况、分解任务、制定下一步计划,或者反思上一步的结果。
  • Action (行动): 这是智能体决定采取的具体动作,通常是调用一个外部工具。
  • Observation (观察): 这是执行Action后从外部工具返回的结果,例如搜索结果的摘要或API的返回值。

智能体将不断重复这个 Thought -> Action -> Observation 的循环,将新的观察结果追加到历史记录中,形成一个不断增长的上下文,直到它在Thought中认为已经找到了最终答案,然后输出结果。

那怎么判断循环是否结束呢?在实际部署中,系统不依赖模型的"主观感觉"来判断结束,而是采用工程化硬截断策略:

  • 显式终结动作:预设 Finish 作为特殊行动,模型输出该指令时即视为任务完成。
  • 最大迭代上限:设置硬性轮次阈值(通常为5-15轮),作为安全兜底,防止陷入死循环或消耗过量Token。
  • 结果同质化检测:当连续两轮的观察结果高度相似(语义相似度超过阈值)时,判定信息已穷尽,强制终止。
  • 资源耗尽强制返回:达到上限时,将当前最完整的观察结果拼接后返回。

Plan-and-Solve

Plan-and-Solve Prompting 核心动机是为了解决思维链在处理多步骤、复杂问题时容易"偏离轨道"的问题。

与 ReAct 将思考和行动融合在每一步不同,Plan-and-Solve 将整个流程解耦为两个核心阶段:

  • 规划阶段 (Planning Phase): 智能体接收用户的完整问题,它的第一个任务不是直接去解决问题或调用工具,而是将问题分解,并制定出一个清晰、分步骤的行动计划。这个计划本身就是一次大语言模型的调用产物。
  • 执行阶段 (Solving Phase): 获得完整的计划后,智能体进入执行阶段。它会严格按照计划中的步骤,逐一执行。每一步的执行都可能是一次独立的 LLM 调用,或者是对上一步结果的加工处理,直到计划中的所有步骤都完成,最终得出答案。

Reflection

Reflection 机制的灵感来源于人类的学习过程,其核心工作流程可以概括为一个简洁的三步循环:执行 -> 反思 -> 优化。

  • 执行 (Execution):首先,智能体使用我们熟悉的方法(如 ReAct 或 Plan-and-Solve)尝试完成任务,生成一个初步的解决方案或行动轨迹。
  • 反思 (Reflection) :接着,智能体进入反思阶段。它会调用一个独立的、或者带有特殊提示词的大语言模型实例,来扮演一个"评审员"的角色。这个"评审员"会审视第一步生成的结果,并从多个维度进行评估,例如:
    • 事实性错误:是否存在与常识或已知事实相悖的内容?
    • 逻辑漏洞:推理过程是否存在不连贯或矛盾之处?
    • 效率问题:是否有更直接、更简洁的路径来完成任务?
    • 遗漏信息:是否忽略了问题的某些关键约束或方面? 根据评估,它会生成一段结构化的反馈 (Feedback),指出具体的问题所在和改进建议。
  • 优化 (Refinement):最后,智能体将再次调用大语言模型,要求它根据反馈内容对最初的结果进行修正,生成一个更完善的结果。
相关推荐
武子康17 分钟前
删掉邮箱后,Agent Trace 仍可能泄露什么:一条可重放脱敏流水线
人工智能·llm·agent
Csvn18 分钟前
LLM 当裁判?先懂它的 4 个偏心——自动化评测实战(E03)
人工智能
呆萌很18 分钟前
简要介绍 torchvision.datasets.ImageFolder
人工智能
guanguan0_018 分钟前
用 AI 做技术方案评审:输入 3 个方案,输出对比矩阵 + 推荐理由
javascript·人工智能·矩阵·ai编程
代码里的AI星22 分钟前
深度解析:基于RAG架构的企业级“品牌AI可见度”监测体系构建
人工智能·架构
YHL24 分钟前
🐴 Harness 工程:用工程化手段驯服 LLM 的幻觉
人工智能
陈彬深大26 分钟前
《AI 渐进编程》之二十八: 对 AI 的理解决定使用效果
人工智能
信誓旦旦的程序猿28 分钟前
【零依赖量化数据实战 #25】北交所技术指标与基本面
java·人工智能·python·股票数据api·股票数据·股票数据api接口·股票api数据接口
Capricorn198829 分钟前
Bug排障实录:Software 3.0 遭遇文献幻觉?知芽 Notebook Skill 底层架构解析
人工智能·笔记·架构·bug·论文笔记