北航的工作 Mem2Evolve 发表于 ACL 2026,提出了一种全新的智能体自我进化范式,把"能力扩展"与"经验蒸馏"两个过程耦合起来,实现更稳定、更高效的智能体持续进化
背景
LLM 智能体在各类应用中已取得显著成功,研究者们不再满足于静态的任务特定系统,而是开始追求能够自我进化的智能体。然而现有框架通常把这两个进化过程割裂处理:
-
Experience-Centric:系统从过往任务中学习,优化执行策略、精炼提示词或构建经验库,但能力空间被锁定在预定义的固定工具集和专家智能体中,无法突破预设边界
-
Capability-Centric:系统动态创建新工具或生成新的专家智能体,但新资产的创建缺乏经验指导,导致成功无法复制、错误反复出现,进化过程不稳定
受皮亚杰平衡理论(Piaget, 1972)启发,智能通过同化(整合新经验)和顺应(调整内部结构)的相互作用演化。本文提出协同进化(Co-Evolution) 范式 Mem2Evolve:能力扩展使智能体完成更广泛任务,产生更多经验,经验蒸馏又指导后续能力扩展,从而实现能力与经验的协同进化
方法

Mem2Evolve 是一个基于双记忆机制(Dual-Memory)的自我进化智能体框架,通过前向推理(Forward Inference)和反向进化(Backward Evolution)的循环,实现能力与经验的协同进化
双记忆机制
Asset Memory 是可扩展的能力仓库,包含两个子库:
-
Agent Bank :每个条目 \(m_{agt} = \langle \rho, \epsilon, \sigma, \mathbb{T}_{avail} \rangle\),包含角色、专长、行为建议和可用工具集
-
Tool Bank :每个条目 \(m_{tool} = \langle n, d_{func}, c_{impl}, \omega_{doc} \rangle\),符合 MCP(Model Context Protocol) 标准,确保跨 LLM 后端的互操作性
Experience Memory 存储从成功和失败中提炼的可转移经验,指导未来的任务执行和资产创建:
-
Agent Exp:针对特定专家智能体的策略性洞察
-
Tool Exp:从工具创建和调试过程中提炼的实现指南
前向推理
遵循"先复用,按需创建"策略,分为三个阶段:
-
任务规划(Task Planning) :LLM 作为规划器把任务 \(q_t\) 分解为子任务序列 \(\mathcal{S} = \{s_1, s_2, \ldots, s_k\}\),每个子任务明确目标、输出格式和依赖关系
-
资产招募(Asset Recruitment) :对每个子任务 \(s_i\),通过招募函数 \(\Gamma(s_i)\) 决定使用现有资产还是创建新资产
\\\Gamma(s_i) = \\begin{cases} m\^\* \& \\text{sim}(s_i, \\mathcal{M}_A) \\geq \\delta \\\\ \\text{Create}(s_i \\mid \\mathcal{M}_E, \\text{Web}) \& \\text{otherwise} \\end{cases} \\
-
招募路径 :如果存在相似度超过阈值 \(\delta\),直接复用最匹配的专家智能体(Top-1)或工具(Top-K)
-
创建路径 :对于缺失的能力调用 Create 函数生成新资产,创建过程由经验记忆和 Web 搜索结果共同指导
-
-
执行(Execution) :每个子任务分配给招募的专家智能体,注入从 \(\mathcal{E}_{agt}\) 检索到的角色特定经验,在 ReAct 框架内完成 Think-Action-Observation 循环
反向进化
任务完成后,反向进化旨在保留高质量资产以供未来重用,并从执行轨迹中提炼可转移的经验教训。我们把它形式化为轨迹评估、资产记忆演化和经验记忆演化三步:
-
轨迹评估:使用 LLM-as-a-Judge 评估,评估结果为成功或失败以及相应的意见
-
资产记忆演化:通过自我修正循环确保新资产的质量,验证通过后加入 Asset Memory
\m_{\\text{final}} = \\begin{cases} m_{\\text{new}} \& \\text{if } r_t = 1 \\land \\text{Valid}(m_{\\text{new}}, c_t) \\\\ \\text{Improve}(m_{\\text{new}}, c_t) \& \\text{otherwise} \\end{cases} \\
-
Valid:让 LLM 根据批评意见合成测试用例,验证资产可靠性
-
Improve:基于批评和测试失败信息修正资产,重复直到通过验证
-
-
经验记忆演化:每次任务后,系统都会反思轨迹和轨迹评估以提取记忆项,如果轨迹成功则从成功轨迹中抽象高层指导原则(策略性建议、有效实现模式),如果轨迹失败则编码反模式和失败-修复对以防止类似错误,最后合并到 Experience Memory
工具创建的完整流程
Mem2Evolve 的工具创建采用三阶段策略以确保生成质量:
-
工具规格生成阶段:系统在编写实际代码前先输出一份形式化的规格说明,包括工具名称、描述、输入参数(名称、类型、描述及默认值)、输出格式,以及用自然语言分步描述的核心执行逻辑(如"Step 1: 验证输入合法性")
-
文档与经验收集阶段:系统通过双重渠道为工具实现准备参考资料,一方面使用 Web 搜索工具检索 GitHub 上的开源实现和 Stack Overflow 的调试讨论,另一方面利用已生成的工具规格查询 Experience Memory 获取相关开发经验
-
工具实现阶段 :系统基于规格说明和收集的参考资料生成符合 MCP(Model Context Protocol) 标准的可执行 Python 工具,要求包含完整导入、显式参数列表(不使用
**kwargs)、健壮的输入验证与错误处理,并遵循 PEP 8 规范,同时提供模块级的TOOL_CONFIG配置以确保跨 LLM 后端的互操作性
实验

所有实验使用 GPT-5-chat 作为 LLM 骨干,可以看到 Mem2Evolve 在所有基准上均取得最佳表现

对于单任务自进化,用少量初始记忆初始化系统后性能均优于无记忆设置;对于跨任务自进化,跨任务记忆初始化一致地提升了性能,且效果与 25% 单任务初始化相当。尽管源任务与目标任务存在领域差异,智能体仍保持稳定的进化轨迹,未出现负迁移
总结
Mem2Evolve 是一篇很标准的顶会工作,思想和实现方式都很直接,现有工作都是单方面那我就协同,最关键的是要有这样的科研 sense
PDF 链接: https://arxiv.org/pdf/2604.10923
Github 链接: https://github.com/BUAA-IRIP-LLM/Mem2Evolve