现代智能体系统的自主迭代能力研究综述

原文:https://mp.weixin.qq.com/s/V_JQYnoNlZXHCjHVMvSLCw

标题: Self-Improvements in Modern Agentic Systems: A Survey

链接:https://arxiv.org/pdf/2607.13104

github: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

这是一篇 97 页的综述,系统的梳理了大模型自我改进智能体(Self‑Improving Agent) ,建立统一形式化框架,把纷繁的 Agent 自改进工作划分两大范式:基础模型改进(FMImprovement,改模型权重,慢循环) 与脚手架改进(Scaffolding Improvement,不改模型权重,改外围组件,快循环)。

通俗理解:智能体 = 基础大模型(θ,大脑) + 脚手架 Σ(外壳,包含提示词 Prompt、记忆 Memory、工具 Tool、控制逻辑)。自我改进要么更新大脑权重,要么改造大脑外面这套运行外壳。

研究背景与动机

过去两年,「自我反思、自我纠错、自博弈、Agentic RL、技能学习、开放式进化」等概念爆炸式增长,但术语混乱、各说各话:同样的机制有人叫 self-correction,有人叫 meta-prompting,有人叫 self-play。已有综述要么只关注模型微调,要么只关注智能体框架,缺乏统一视角,也几乎没人追溯经典 AI 的理论根源。

论文三大核心贡献:

  • 历史溯源:梳理自我改进系统完整发展脉络,从 1790 年代最小二乘法一路梳理到 Gödel 机器哥德尔机、元学习,再到今天的大模型 Agent

  • 统一形式化与系统分类 :将 Agent 定义为 \(\mathcal{A}_t=(\theta_t,\Sigma_t\));区分两大改进路径:基础模型改进(修改参数 θ)、脚手架改进(修改脚手架 Σ,冻结 θ) ;并且按照「更新目标 」和「驱动更新的学习信号来源」对全部文献分类

  • 应用、评估与前沿:梳理六大应用场景,系统分析评估方案、现存缺陷,提出未来开放研究方向与安全约束,给出可落地的设计原则

历史演进脉络(从古典 AI 到现代 Agent)

时期 代表思想
1790s--1960s 最小二乘(高斯用它预测了谷神星位置)、控制论(Wiener)、Ashby 稳态、图灵"儿童机"、感知机、Samuel 跳棋程序;Gödel 奠定"程序可操作自身代码"的理论基础;I. J. Good 提出"智能爆炸"设想
1960s--1980s 符号主义:冯·诺依曼自复制自动机、Lenat 的 AM 与 EURISKO(把启发式规则当作可修改的对象),但 EURISKO 实际依赖人类当外部评委,缺乏自主闭环评价,这一教训延续至今
1980s--2000s 连接主义与元学习兴起:Schmidhuber 1987 自指学习框架、1991 快速权重编程器(后被证明等价于未归一化的线性 Transformer)、1993 自指权重矩阵、1994 增量式自改进 + 成功故事算法;AIXI、Gödel 机(能数学证明改进有益才重写自身代码的理论上限)
2000s--2020s 安全反思(Orseau & Ring:自欺、奖励篡改风险;反射预言机、逻辑归纳)、有界递归自改进、神经架构搜索(NAS)、AlphaGo 式自博弈
2020s 至今 基础模型时代:自然语言成为统一的"自我修改介质",大幅缩小了可行修改的搜索空间。快循环(上下文学习,机制上等价于 1991 快速权重)+ 慢循环(RLHF/RLAIF 参数固化)嵌套,ReAct、Reflexion 等把执行错误转成语言反思

核心形式化定义

1)Agent 的数学定义

\(\mathcal{A}{t}=(\theta{t},\Sigma_{t}\))

  • \(\theta_t\):基础模型神经网络参数(大脑);

  • \(\Sigma_t=(p_t,m_t,\mathcal{T}_t,g_t\)):脚手架(外壳)

    • \(p_t\):提示词 / 系统指令;

    • \(m_t\):记忆系统;

    • \(\mathcal{T}_t\):工具集合;

    • \(g_t\):控制、调度、安全约束逻辑。

Agent 的策略:\(\pi_{\theta_t,\Sigma_t}(A_t|X_t\);\(X_t\))是临时瞬时执行状态(对话上下文,任务结束就丢弃,不属于 Agent 固有配置)。

2)自我改进的定义

自我改进算子 \(\mathcal{U}\):Agent 依靠自己运行产生学习信号,持久地修改自己固有配置 (区分临时上下文\(X_t\))。

\(\mathcal{A}{t+1}=\mathcal{U}\big(\mathcal{A}{1:t},\mathcal{E}(\pi_{\theta_{t},\Sigma_{t}};\Sigma_{t},\mathcal{C}_{t})\big)\)

  • \(\mathcal{E}\):Agent 执行过程,产出学习信号(轨迹、反思、批判、修改建议);

  • \(\mathcal{C}_t\):任务环境 / 上下文;

注意,必须是持久修改。单次任务内部临时思考不算自我改进;修改后会影响后续多个任务。

3)与经典学习范式的关系

  • 强化学习 RL:更新 θ 对应传统 RL 策略优化;更新脚手架 Σ 不属于传统 RL,会直接改变 MDP 马尔可夫决策过程本身

  • 在线学习 Online Learning:θ 更新面临分布漂移、灾难性遗忘;Σ 更新可以快速适配,但会出现记忆污染、提示模板漂移

  • 主动学习 Active Learning:自改进 Agent 很多时候不需要人类标注,靠好奇心驱动自主探索获取信息

4)技能 Skill 的概念

技能是可复用的自改进算子,可以保存在任意载体:提示、记忆条目、工具、模型权重。分为:

  • 对象级技能:解决外部任务;

  • 元级别技能:用来修改 Agent 自身配置(修改提示、写新工具、更新记忆),是自我改进的核心。

自我改进的两条主路径

分类体系总览

├── 路径一:基础模型改进(θₜ → θₜ₊₁,Σ 不动)------ 慢、稳、贵

│ ├── 5.1 内在生成式示范 𝒟ₜ:自己造训练数据

│ ├── 5.2 内在评估反馈 eₜ:自己当裁判

│ └── 5.3 外在探索经验 τₜ:从环境交互中学习

└── 路径二:脚手架改进(Σₜ → Σₜ₊₁,θ 冻结)------ 快、可逆、灵活

├── 6.1 提示优化(p)

├── 6.2 记忆进化(m)

├── 6.3 工具治理(𝒯)

└── 6.4 全脚手架重构(Σ)

路径一:基础模型改进(Foundation Model Improvement,慢循环)

脚手架固定不变 \(\Sigma_{t+1}=\Sigma_t\),更新模型权重 \(\theta\)。

\(\theta_{t+1}=\text{IMPROVE}\theta(\theta{1:t};S_t)\) \(S_t\)是学习信号,分三类来源:

1)内在生成式示范(自己造数据练自己)

思想:基础模型既是学习者又是数据生产者,靠权重里压缩的语义先验自动生成指令-回答对、推理轨迹、执行日志,把瓶颈从"人工标注"转移到"生成策略与过滤机制的设计"。

  • 生成策略:Self-Instruct(种子样本自举扩容)、Evol-Instruct(让 LLM 改写指令、逐步加难度)、自一致性过滤(STaR 系列:只留高置信推理路径)、外部验证器(单元测试筛正确解)、课程式生成(递归分解复杂问题)、TT-SI(测试时自改进:推理时用不确定性检测薄弱点,现场生成针对性 LoRA 微调数据,样本效率极高);

  • 数据格式:从简单的指令-回答对,到带思维链的推理轨迹,再到结构化的工具调用/代码执行序列(含中间环境反馈),乃至元认知制品(问题分解树、自编辑指令)、多模态样本。格式要匹配目标能力:推理轨迹教逻辑、代码+测试教编程、动作日志教工具使用;

  • 挑战与陷阱:递归自训练会导致模型崩溃;自我一致性过滤在"自信地错"时会失效;课程分解若丢掉原问题约束反而有害;超出模型感知范围的错误会被改进过程放大。

2)内在评估反馈(自己当裁判)

思想:学习信号是模型自己(或内部评估器)给出的分数、偏好对、批评与修订。

  • Rubric****(评分标准)反馈:Constitutional AI(按成文原则自我批评排序,产生 AI 反馈做 RLHF)、Meta-Rewarding(模型同时充当选手、评委、评委的评委,把判断和元判断都变成偏好对)、自进化奖励学习(奖励模型给自己的改进数据打标);

  • 纠正性反馈:SELF(用语言反馈迭代修订答案)、RISE(递归自省后微调)、Reflect-Retry-Reward(反思失败→重试→用反馈做 RL)、ReST meets ReAct、AlphaAllM(搜索+批评构建更强训练信号)。

3)外在探索经验(从真实或模拟环境中学习)

思想:信号来自"行动之后实际发生了什么"------轨迹、奖励、可执行结果。trajectory 不只是 (s,a,r,s'),还包含网页、截图、编译错误、工具调用、中间推理。

  • 真实任务环境:

    • 程序化验证器:代码通过单测即奖励(如 SWE-RL 类);

    • 学习奖励模型:WebRL(训练结果监督奖励模型自动标注网页导航轨迹)、UI-Genie(策略与奖励模型协同进化)、MobileGUI-RL(GRPO 用于移动端 GUI 导航);

  • 模拟代理环境(世界模型):WebEvolver(共进化网页世界模型做模拟 rollout)、WebSynthesis(可逆的搜索式轨迹合成)、WebDreamer(网页转移模型做规划)、SPA(自博弈学习状态估计与转移模型)、WMPO(像素空间世界模型上想象 rollout,避免昂贵物理试错)、GLoW(双尺度文本世界记忆引导 Go-Explore 式探索,真实环境交互次数比 RL 基线少 100--800 倍)。

路径二:脚手架改进(Scaffolding Improvement,快循环)

模型权重冻结不变 \(\theta_{t+1}=\theta_t\),修改脚手架组件 \(\Sigma\):

\(\Sigma_{t+1}=\text{IMPROVE}\Sigma(\Sigma{1:t};S_t)\)

\(S_t\)依然来自 Agent 自身运行得到的反馈信号。脚手架分 4 个子模块,可以单独更新,也可以全部整体更新:

1)提示词 Prompt 优化 \(p_t\)

  • 标量反馈优化:APE、OPRO(让 LLM 当优化器迭代改进提示词);

  • 定性反馈精炼:Self-Refine、多智能体辩论(单次输出纠错的开山之作);Reflexion(失败后生成"语言内省"存入记忆,约束后续尝试);MAPS(从失败案例中归纳可复用语言规则并注入提示词);ACE(生成器-反思者-策展者流水线,把提示词和记忆当"不断演化的战术手册",缓解简洁性偏差与上下文坍缩);Scrable(持续定性评估直到文本质量达标);

  • 种群进化:Evo-Prompt、DSPy/EvoPrompt 系------维护提示词种群,变异+选择;

  • 文本梯度优化:TextGrad(把"差劲的输出反馈"当作梯度,反向传播到提示词/工具描述,自动微分的语言版)、GEPA。

2)记忆系统进化 \(m_t\)

  • 记忆对象(存什么):

    • 显式:人类可读、可审计可修正(可控但难扩展,易检索噪声);包括外部知识(代码库、文档),智能体用效用反馈动态更新/修剪;

    • 隐式:潜在 token、隐藏状态、KV cache 增强(紧凑快速但不可解释,易表征漂移);

    • 趋势:从"无限聊天记录"转向高密度加工后的抽象;

  • 记忆结构(怎么组织):在经典 RAG 之上发展出 Agentic RAG(自主控制检索);Generative Agents 的相关性+新近性+重要性混合启发式;RMM(可微排序缓解"相似≠有用"错位);MemoryBank、CTIM-Rover(索引情景片段复用成功经验);MIRIX(多专属子存储路由,突破扁平索引限制);多模态记忆(MrSteve 检索过去视频帧);

  • 记忆处理(怎么读写删):增删改查策略本身的进化,如 Mem0、A-MEM、MemGPT 等,把记忆管理从固定策略变成可学习/可自我改进的组件。

3)工具治理 Tool \(\mathcal{T}_t\)

  • 动态工具路由:AgentOrchestra、Task-Planner、GenerativeAgent 等学习何时调哪个工具;

  • 迭代工具精炼:CRAFT、Voyager 式,边用边改工具实现;

  • 自主工具创建:Voyager(Minecraft 中自主写技能代码入库复用)、ToolMaker、AgentRxiv、OpenHands 等把 "造工具" 本身变成智能体的能力,这是突破基础模型原生上限的关键机制。

4)完整脚手架更新 Full Scaffolding \(\Sigma_t\)

把整个代码库/运行逻辑当作可变基板,改进程序本身运行在脚手架之内,形成真正的自指:

  • 自指代码更新(代表:Sakana 的 Darwin Gödel Machine):智能体改自己的源码 → 跑 benchmark 验证 → 把可行版本存入分支档案库,从档案库采样继续变异。DGM 用经验验证取代了 Gödel 机不切实际的数学证明,SWE-bench 上从 20% 自动提升到 50%;

  • 生成-测试-打补丁循环(自演化代码智能体);

  • 开放式智能体设计搜索:ADAS、AIRA 等把智能体架构本身当搜索空间;

  • 安全要点 :这类系统最危险,一次性的提示注入可能演变成持久性架构漏洞(被污染的记忆/被劫持的工具逻辑被 commit 进下一版)。因此任何对 Σ 或 θ 的提交都必须经过验证器门控(功能正确性、工具权限边界、随机扰动鲁棒性),改进只能发生在显式定义 + 持续审计的安全边界内。

六大应用领域

领域 代表进展
软件工程 区分评估基准(SWE-bench)与自改进方法":SWE-agent、Agentless 只是非自改进基线;Live-SWE-agent(边解真实 issue 边扩展自己的脚手架)、SE-Agent(跨轨迹修订/重组)、AlphaEvolve 等
网页导航与自动化 WebRL(RL+进化课程)、SeeAct(视觉理解+动作落地)、WebCoach / ReAP(跨会话记忆存储轨迹反思,不重训基座模型就能避免重复犯错)
游戏与策略推理 Voyager、GLoW、SPRT、GAEA、Strategist-Zero、WorldEvolver、RISE 等自博弈、技能库、世界记忆是主要机制
科学发现 SciAgent、ChemCrow、MLAgentBench、DiscoveryWorld、PaperBench、DGM 等假设生成、实验设计、自动化 ML 研究流水线
具身智能与机器人 数据飞轮路线:RoboCat、AutoRT、MEDAL++、Robot-Powered Data Flywheels(自动采集真实数据迭代改进策略);脚手架路线:RoboGen(自动生成任务/场景/监督的课程进化)、RACAS(自管理记忆积累控制知识)
通用计算机控制 脚手架改进:Agent S(经验增强分层规划+持续记忆)、SEAgent(自主课程+世界状态评估);模型改进:UI-Genie、GUI-Reflection、ComputerRL(OSWorld 上持续在线 RL)、PC Agent-E(少量种子+合成动作决策)

评估

自我改进的智能体不能用"单次跑分"衡量,要追踪迭代过程中的性能轨迹(在累计资源预算约束下)。

  • 测量方式:

    • 指标式(Φ_metric):确定性可执行验证(如单测通过=1),客观但只适用于有形式化成功标准的任务;

    • 裁判式(Φ_judge):LLM-as-a-Judge、Agent-as-a-Judge(评委智能体可主动与环境交互取证,比静态 LLM 评委更可靠),适用于开放式任务;风险是智能体过度迎合裁判的潜在偏好(刷分通道),需要裁判多样性、跨模型交叉验证等保障;

  • 基准分类:

    • 机制基准:隔离验证改 θ还是改 Σ哪个起效;

    • 领域基准:在领域约束下测端到端改进;

  • 严谨性要求:留出集/对抗测试/时间切分防反馈泄漏;显式核算成本预算(算力、token、人工介入次数);报告安全与回归率,而非只报平均成功率。

讨论与未来方向

论文给出的核心设计原则是 快循环探索、慢循环巩固(fast loop exploration, slow loop consolidation):

  • 快循环( \(\Sigma\)):快速试错、探索、可逆调整;

  • 慢循环( \(\theta\)):把验证有效的能力沉淀进参数,跨任务摊销成本。

重要警示:

  • Critic(评委)是攻击面而非中立裁判:把评委嵌进闭环训练,智能体会学会"让评委满意"而非"把任务做对"。对策:生成器与验证器解耦;验证器更新必须受人审约束且只能单调收紧;

  • 分层门控是全脚手架自改进的必选项:自改进对象是非平稳的,弱系统要可靠地约束更强的后继系统极其困难,必须建立自我修改的严格权限体系与可回滚机制;

  • 开放问题包括:长周期真实世界评估、可观测/可修改的训练推理基础设施、从有界 RSI 走向通用 RSI、递归自修改下的安全可控、人机协同改进等。

相关推荐
Ticnix1 小时前
RAG 烂大街?烂大街的只是那条流水线——真正的分水岭在这五处
后端·python·agent
Ticnix2 小时前
RAG 检索不准,九成的锅不在向量——不同文件,就该有不同的入库方案
后端·python·agent
吴佳浩3 小时前
Agent 安全红线:越狱防御、间接注入与数据防泄漏实战
人工智能·agent·ai编程
吴佳浩3 小时前
Claude Code 与 Hermes Agent 深度拆解:顶级 Coding Agent 为什么都放弃了纯 Chat 模式?
人工智能·agent·ai编程
Csvn3 小时前
前言与后记 · 全书完结
人工智能·aigc·agent
Csvn3 小时前
附录 C+D+E 参数速查表 · 术语表 · 中文模型 API 上手
人工智能·aigc·agent
Csvn3 小时前
第 29 章 完整开发流程与学习路线
人工智能·aigc·agent
Csvn3 小时前
附录 A+B 主流框架速查 & 工具与资源清单
人工智能·aigc·agent
用户976104399213 小时前
7.3框架接口实现
agent