"Mem2Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation" 论文笔记

北航的工作 Mem2Evolve 发表于 ACL 2026,提出了一种全新的智能体自我进化范式,把"能力扩展"与"经验蒸馏"两个过程耦合起来,实现更稳定、更高效的智能体持续进化

背景

LLM 智能体在各类应用中已取得显著成功,研究者们不再满足于静态的任务特定系统,而是开始追求能够自我进化的智能体。然而现有框架通常把这两个进化过程割裂处理:

  • Experience-Centric:系统从过往任务中学习,优化执行策略、精炼提示词或构建经验库,但能力空间被锁定在预定义的固定工具集和专家智能体中,无法突破预设边界

  • Capability-Centric:系统动态创建新工具或生成新的专家智能体,但新资产的创建缺乏经验指导,导致成功无法复制、错误反复出现,进化过程不稳定

受皮亚杰平衡理论(Piaget, 1972)启发,智能通过同化(整合新经验)和顺应(调整内部结构)的相互作用演化。本文提出协同进化(Co-Evolution) 范式 Mem2Evolve:能力扩展使智能体完成更广泛任务,产生更多经验,经验蒸馏又指导后续能力扩展,从而实现能力与经验的协同进化

方法

Mem2Evolve 是一个基于双记忆机制(Dual-Memory)的自我进化智能体框架,通过前向推理(Forward Inference)和反向进化(Backward Evolution)的循环,实现能力与经验的协同进化

双记忆机制

Asset Memory 是可扩展的能力仓库,包含两个子库:

  • Agent Bank :每个条目 \(m_{agt} = \langle \rho, \epsilon, \sigma, \mathbb{T}_{avail} \rangle\),包含角色、专长、行为建议和可用工具集

  • Tool Bank :每个条目 \(m_{tool} = \langle n, d_{func}, c_{impl}, \omega_{doc} \rangle\),符合 MCP(Model Context Protocol) 标准,确保跨 LLM 后端的互操作性

Experience Memory 存储从成功和失败中提炼的可转移经验,指导未来的任务执行和资产创建:

  • Agent Exp:针对特定专家智能体的策略性洞察

  • Tool Exp:从工具创建和调试过程中提炼的实现指南

前向推理

遵循"先复用,按需创建"策略,分为三个阶段:

  • 任务规划(Task Planning) :LLM 作为规划器把任务 \(q_t\) 分解为子任务序列 \(\mathcal{S} = \{s_1, s_2, \ldots, s_k\}\),每个子任务明确目标、输出格式和依赖关系

  • 资产招募(Asset Recruitment) :对每个子任务 \(s_i\),通过招募函数 \(\Gamma(s_i)\) 决定使用现有资产还是创建新资产

    \\\Gamma(s_i) = \\begin{cases} m\^\* \& \\text{sim}(s_i, \\mathcal{M}_A) \\geq \\delta \\\\ \\text{Create}(s_i \\mid \\mathcal{M}_E, \\text{Web}) \& \\text{otherwise} \\end{cases} \\

    • 招募路径 :如果存在相似度超过阈值 \(\delta\),直接复用最匹配的专家智能体(Top-1)或工具(Top-K)

    • 创建路径 :对于缺失的能力调用 Create 函数生成新资产,创建过程由经验记忆和 Web 搜索结果共同指导

  • 执行(Execution) :每个子任务分配给招募的专家智能体,注入从 \(\mathcal{E}_{agt}\) 检索到的角色特定经验,在 ReAct 框架内完成 Think-Action-Observation 循环

反向进化

任务完成后,反向进化旨在保留高质量资产以供未来重用,并从执行轨迹中提炼可转移的经验教训。我们把它形式化为轨迹评估、资产记忆演化和经验记忆演化三步:

  • 轨迹评估:使用 LLM-as-a-Judge 评估,评估结果为成功或失败以及相应的意见

  • 资产记忆演化:通过自我修正循环确保新资产的质量,验证通过后加入 Asset Memory

    \m_{\\text{final}} = \\begin{cases} m_{\\text{new}} \& \\text{if } r_t = 1 \\land \\text{Valid}(m_{\\text{new}}, c_t) \\\\ \\text{Improve}(m_{\\text{new}}, c_t) \& \\text{otherwise} \\end{cases} \\

    • Valid:让 LLM 根据批评意见合成测试用例,验证资产可靠性

    • Improve:基于批评和测试失败信息修正资产,重复直到通过验证

  • 经验记忆演化:每次任务后,系统都会反思轨迹和轨迹评估以提取记忆项,如果轨迹成功则从成功轨迹中抽象高层指导原则(策略性建议、有效实现模式),如果轨迹失败则编码反模式和失败-修复对以防止类似错误,最后合并到 Experience Memory

工具创建的完整流程

Mem2Evolve 的工具创建采用三阶段策略以确保生成质量:

  • 工具规格生成阶段:系统在编写实际代码前先输出一份形式化的规格说明,包括工具名称、描述、输入参数(名称、类型、描述及默认值)、输出格式,以及用自然语言分步描述的核心执行逻辑(如"Step 1: 验证输入合法性")

  • 文档与经验收集阶段:系统通过双重渠道为工具实现准备参考资料,一方面使用 Web 搜索工具检索 GitHub 上的开源实现和 Stack Overflow 的调试讨论,另一方面利用已生成的工具规格查询 Experience Memory 获取相关开发经验

  • 工具实现阶段 :系统基于规格说明和收集的参考资料生成符合 MCP(Model Context Protocol) 标准的可执行 Python 工具,要求包含完整导入、显式参数列表(不使用 **kwargs)、健壮的输入验证与错误处理,并遵循 PEP 8 规范,同时提供模块级的 TOOL_CONFIG 配置以确保跨 LLM 后端的互操作性

实验

所有实验使用 GPT-5-chat 作为 LLM 骨干,可以看到 Mem2Evolve 在所有基准上均取得最佳表现

对于单任务自进化,用少量初始记忆初始化系统后性能均优于无记忆设置;对于跨任务自进化,跨任务记忆初始化一致地提升了性能,且效果与 25% 单任务初始化相当。尽管源任务与目标任务存在领域差异,智能体仍保持稳定的进化轨迹,未出现负迁移

总结

Mem2Evolve 是一篇很标准的顶会工作,思想和实现方式都很直接,现有工作都是单方面那我就协同,最关键的是要有这样的科研 sense

PDF 链接: https://arxiv.org/pdf/2604.10923

Github 链接: https://github.com/BUAA-IRIP-LLM/Mem2Evolve

相关推荐
Web3&Basketball3 小时前
从0到1落地多模态表格/发票结构化识别:踩坑全记录
深度学习·大模型·ai技术
thesky1234565 小时前
27届大模型面试准备(六十六):大模型推理调度与弹性扩缩容工程——排队、优先级、抢占与弹性
大模型·抢占·连续批处理·推理调度·请求优先级·弹性扩缩容·chunked prefill
Tom·Ge1 天前
AI创业者通识日报 | 2026年8月28日
大模型·ai创业·ai创业者
VIP_CQCRE1 天前
在 WorkBuddy 里一键接入 Claude、GPT、Gemini、DeepSeek:Ace Data Cloud 让 AI 模型调用更简单
ai·大模型·openai·workbuddy·ace data cloud
Web3&Basketball1 天前
从0到1落地Claude Playwright浏览器自动化Agent:踩坑全记录
深度学习·大模型·ai技术
七牛云行业应用1 天前
国产新模型选型:GLM-5.3、DeepSeek V4、GLM-5.3-Flash、Qwen3.8-Flash-Next、Kimi K3 怎么选
人工智能·大模型·ai编程
thesky1234561 天前
27届大模型面试准备(六十二):大模型数值精度与混合精度工程——BF16/FP8、AMP、Loss Scale 与精度对齐
大模型·amp·混合精度·fp8·bf16·数值精度·梯度缩放
deepseek231 天前
智谱开源 GLM-5.3-Flash 拆解:320B 只激活 18B 的混合注意力架构与十万张国产卡
人工智能·大模型·glm