Reflexion:让 Agent 从错误中学习

Reflexion 到底是什么?

Reflexion 是一种面向语言智能体的学习框架。它把环境反馈转写成自然语言形式的 self-reflection ,再将这些经验加入后续上下文。

这里的"学习"主要发生在上下文与记忆中,不等于更新 LLM 的权重。因而它比重新训练或 Fine-tuning 更轻量,也更容易观察 Agent 是如何修正策略的。

三个角色,加上一段记忆

Reflexion 将一次任务拆成执行、评价和反思三个职责。它们可以由不同模型承担,也可以由同一个 LLM 使用不同 Prompt 分别扮演。

一次完整迭代怎样运行?

可以把 Reflexion 理解成一个带复盘能力的 Agent loop。

它与 ReAct、传统 RL 有什么区别?

方法 核心机制 是否更新模型参数 主要优势
ReAct 交替进行 Reasoning 与 Acting 通常不更新 能够边思考边调用工具、观察环境
Reflexion 在 ReAct/CoT 之外增加评价、反思和记忆 通常不更新 利用语言经验纠正后续策略
Traditional RL 根据奖励信号优化策略参数 通常需要 适合大规模、可重复训练的环境
相关推荐
GEO从入门到精通3 小时前
课程怎么选?2026年GEO学习资源全梳理
学习
优化Henry4 小时前
LTE 载波频率与频点配置详解
运维·网络·学习·5g·信息与通信
xiaomu001234 小时前
高湿环境床垫湿度管理技术框架:湿度阈值、排湿结构与材料选型
经验分享·学习·学习方法
zhangrelay5 小时前
ROS项目设计案例智能大模型正经乱答案例
linux·笔记·学习·ubuntu·机器人
probex_5 小时前
学习笔记:知识图谱是什么,在测试里能干什么
笔记·学习·知识图谱
每天题库8 小时前
危险货物道路运输从业资格证题库刷题重点与错题梳理
学习·安全·考试·题库·考证
m4Rk_8 小时前
【论文阅读】Agent 记忆机制(86):Skill-Pro——用 Non-Parametric PPO 将交互经验演化为可复用技能
论文阅读·人工智能·学习·开源·github
AOI小白新手上路8 小时前
从 Keil 调试视角看 51 指针,到 Cortex-M 内存映射访问寄存器 · 学习笔记
笔记·学习
Joe_Wang59 小时前
【从0到1学习JVM · 15】对象在堆里来回倒腾,究竟怎样才会进老年代?
java·jvm·学习·垃圾回收
软件开发技术深度爱好者10 小时前
中学生学习工具:多学科自学启导者(轻量版)实现
学习·ai·技术实践