Reflexion:让 Agent 从错误中学习

Reflexion 到底是什么?

Reflexion 是一种面向语言智能体的学习框架。它把环境反馈转写成自然语言形式的 self-reflection ,再将这些经验加入后续上下文。

这里的"学习"主要发生在上下文与记忆中,不等于更新 LLM 的权重。因而它比重新训练或 Fine-tuning 更轻量,也更容易观察 Agent 是如何修正策略的。

三个角色,加上一段记忆

Reflexion 将一次任务拆成执行、评价和反思三个职责。它们可以由不同模型承担,也可以由同一个 LLM 使用不同 Prompt 分别扮演。

一次完整迭代怎样运行?

可以把 Reflexion 理解成一个带复盘能力的 Agent loop。

它与 ReAct、传统 RL 有什么区别?

方法 核心机制 是否更新模型参数 主要优势
ReAct 交替进行 Reasoning 与 Acting 通常不更新 能够边思考边调用工具、观察环境
Reflexion 在 ReAct/CoT 之外增加评价、反思和记忆 通常不更新 利用语言经验纠正后续策略
Traditional RL 根据奖励信号优化策略参数 通常需要 适合大规模、可重复训练的环境
相关推荐
hsjiasb1 小时前
FreeRTOS学习(二十六)——动态内存管理heap_1到heap_5
stm32·单片机·学习·学习笔记·freertos
崇子嵘1 小时前
基于zynqMP15eg的linux驱动学习
学习
知识分享小能手3 小时前
线性代数学习教程,从入门到精通,向量组的线性相关性 — 完整知识点梳理(7)
学习·线性代数·机器学习
Shell运维手记3 小时前
Linux 常用基础命令学习笔记
linux·运维·笔记·学习·算法·github
动词ing4 小时前
【学习笔记】C语言(数组指针与指针数组+字符数组+函数+参数传递+字符串作为形参+递归函数+指针函数+回调函数+结构体嵌套+内存动态分配函数)
c语言·笔记·学习
小O的算法实验室6 小时前
IEEE TII,学习为多目标深度学习生成偏好
人工智能·深度学习·学习
吃好睡好便好7 小时前
说说高温对情绪的影响
学习·生活·情绪·高温
for_ever_love__8 小时前
python基础语法学习: 文件操作
python·学习
m4Rk_8 小时前
【论文阅读】Agent 记忆机制(38):AMA——用多智能体协作动态选择记忆粒度
论文阅读·人工智能·学习
YUS云生8 小时前
大模型学习·第46天:Agent智能体核心概念与ReAct框架
前端·学习·react.js