"MemEvolve: Meta-Evolution of Agent Memory Systems" 论文笔记

OPPO AI Agent Team 与 LV-NUS lab 的工作,发表在 ICML 2026 上。当前的自进化记忆系统都停留在用固定的记忆架构去积累经验这一层,本文提出 MemEvolve ,一个**同时进化「经验知识」与「记忆架构本身」**的元进化框架,让 Agent 不仅能积累经验,还能不断改进它是怎么从经验里学习的这件事

背景

语言 Agent 的自我进化高度依赖记忆系统(Memory System) :它持续记录 Agent 与环境的交互,将其蒸馏为各种形式的知识与技能,从而让 LLM Agent 在任务求解和世界探索中持续变强。记忆的表征形态一路演进:从最初的原始轨迹存储 + few-shot 提示 ,到更抽象的文本产物(tips、shortcuts、reasoning template),再到近期的结构化工具接口 (API、MCP)和代码级仓库

于是一个很自然的问题浮现:到底什么样的记忆架构最能驱动 Agent 自我提升?

本文的核心论断是:不存在一个普适最优的记忆架构 。比如一个从历史轨迹里蒸馏可复用 API 的记忆系统,在网页浏览任务上表现优异,但对数学、科学推理几乎无用;反过来,基于自我批判(self-critique)的记忆在推理密集型任务上很强,却在编码和工具使用场景下失效。作者认为这些 trade-off 源于当前记忆系统的静态本质(static nature) :研究者设计一条固定的记忆流水线(ingestion / abstraction / retrieval)嵌进 Agent,就假设它能靠「不断接触新经验」维持长期进化。但这忽略了一个关键现实------不同任务耦合着不同的记忆需求(memory affordances),一个无法针对当前任务自我调整的记忆系统,从根本上就与开放式 Agent 进化的前提相悖

图2 | Agent 自我进化与人类学习的类比。平庸学习者(Mediocre Learner) 无法从经验受益(即无记忆的 Agent);熟练学习者(Skillful Learner) 能从过去经验提取可复用技能,但用的是固定预定义的抽象方式 ;而**自适应学习者(Adaptive Learner)**在积累经验的同时,还能动态调整「经验被巩固和利用的策略」。

MemEvolve 研究的核心问题就是:一个记忆系统如何在促进 Agent 系统进化 的同时,还能元进化(meta-evolve)自身的架构,以在目标任务域上取得更优性能,同时保持泛化性?

方法

MemEvolve 概念上是一个**双层优化(bilevel optimization)**过程:

  • 内层循环(Inner Loop):一阶进化。Agent 在固定的记忆系统引导下,通过持续的新任务流填充自己的经验库

  • 外层循环(Outer Loop):二阶进化。元学习出一个更有效的记忆架构,来加速未来的学习

这形成一个良性循环:外层进化出更好的架构 → 提升 Agent 学习效率 → 更强的 Agent 产出更高质量的轨迹 → 为外层提供更精确的适应度信号去驱动下一轮架构进化

EvolveLab:统一的模块化设计空间

由于记忆系统的设计空间庞大且异构(知识图谱、技能库、向量数据库......),直接做可控优化几乎不可能。为此本文把任意记忆架构 \(\Omega\) 解耦为四个功能独立又相互依赖的组件 \(\Omega = (E, U, R, G)\):

  • ♣ Encode(编码 \(E\)) :把原始经验(轨迹片段 \(\tau_t = (s_t, a_t, s_{t+1})\)、工具输出、自我批判)转化为结构化表征 \(e_t = E(\epsilon_t)\)。可以简单如压缩原始 trace,也可复杂如提炼可泛化的 lessons

  • ♦ Store(存储 \(U\)) :把编码后的经验整合进持久记忆,\(M_{t+1} = U(M_t, e_t)\)。载体可以是向量数据库、知识图谱等

  • ♥ Retrieve(检索 \(R\)) :提供任务相关的记忆内容 \(c_t = R(M_t, s_t, Q)\),指导 Agent 的策略决策。检索内容可以是可复用工具、规划经验或蒸馏的程序性知识

  • ♠ Manage(管理 \(G\)) :执行离线、异步的操作,如整合(consolidation)、抽象、选择性遗忘,以维护长期记忆质量与效率,\(M_t' = G(M_t)\)

这一模块化抽象把每个记忆系统表示为 \((E, U, R, G)\) 四个可编程实现的具体组合,构成一个基因型(genotype),正是 MemEvolve 元进化的操作对象

基于此设计空间,作者构建了 EvolveLab :一个统一、可扩展的自进化记忆代码库,把 12 个代表性记忆系统 (Voyager、ExpeL、Generative、DILU、AWM、Mobile-E、Cheatsheet、SkillWeaver、G-Memory、Agent-KB、Memp、EvolveR)在同一模块化接口下重新实现,全部继承自单一抽象基类 BaseMemoryProvider,强制实现统一的四组件接口。EvolveLab 同时提供标准化测试平台(GAIA、xBench、DeepResearchBench 等),支持在线模式(■online,边处理任务流边更新记忆) 和**离线模式(■offline,先从静态轨迹积累经验再在未见任务上评估)**两种范式

双层进化过程(Dual-Evolution Process)

传统自进化记忆在固定 \(\Omega\) 下演化:\(M_{t+1} = \Omega(M_t, \epsilon_\tau),\ \epsilon_\tau \in E(\tau)\),这能积累知识但从根本上排除了架构适应 ,因为接口 \(\Omega\) 本身不可变

MemEvolve 不再维护单个静态 \(\Omega\),而是在每个进化迭代 \(k\) 维护一个候选记忆系统的有限集合 \(\{\Omega_j^{(k)}\}_{j \in J^{(k)}}\),每个 \(\Omega_j^{(k)} \triangleq (E_j^{(k)}, U_j^{(k)}, R_j^{(k)}, G_j^{(k)})\)。初始迭代从单例集(\(|J^{(0)}| = 1\),即一个手工设计的 baseline 记忆)出发,后续迭代允许多个竞争候选:

  • 内层(经验进化) :对每个候选 \(\Omega_j^{(k)}\),其记忆状态从空初始化,沿轨迹 \(\tau \in T_j^{(k)}\) 更新 \(M_{t+1,j}^{(k)} = \Omega_j^{(k)}(M_{t,j}^{(k)}, \epsilon_\tau)\)。执行后对每条轨迹产出反馈向量 \(f_j(\tau) \in \mathbb{R}^d\)(\(d=3\) 对应任务成功、Token 消耗、延迟 三个指标),聚合算子 \(S\) 汇总为 \(F_j^{(k)} = S(\{f_j(\tau)\})\)

  • 外层(架构进化) :元进化算子 \(F\) 根据汇总 \(\{F_j^{(k)}\}\) 选出高性能候选、提出新变体,产生下一代候选集:\(\{\Omega_{j'}^{(k+1)}\} = F(\{\Omega_j^{(k)}\}, \{F_j^{(k)}\})\)。具体地,\(F\) 按 \(F_j^{(k)}\) 排序,保留 top-\(K\) 记忆系统,再通过修改或重组它们的四个组件 \((E, U, R, G)\) 生成新架构,\(K\) 为固定的存活预算(survivor budget)

一句话概括:每轮迭代交替执行「在固定架构下从空初始化演化经验库」和「基于诱导出的性能演化架构本身」,让记忆库与治理它的架构协同进化(co-evolve),产出越来越自适应、越来越资源感知的记忆驱动行为

Diagnose-and-Design 进化(元进化算子 F 的核心)

元进化算子 \(F\) 分解为两个协同部分:架构选择诊断-设计进化

1. 架构选择(Architectural Selection)

把每个候选的汇总向量定义为 \(F_j^{(k)} \triangleq (\mathrm{Perf}_j^{(k)}, -\mathrm{Cost}_j^{(k)}, -\mathrm{Delay}_j^{(k)})\)(三个维度都是越大越好)。候选先按 \(F_j^{(k)}\) 做非支配排序(non-dominated sorting) 得到 Pareto rank \(\rho_j^{(k)}\);同一 Pareto rank 内再按主性能指标 \(\mathrm{Perf}\) 排序;取 top-\(K\) 作为父代集合 \(P^{(k)}\)。这保证架构进化由「兼顾任务效果与资源效率的系统」引导,同时在 Pareto 等价的候选中优先任务性能

2. 诊断-设计进化(Diagnose-and-Design Evolution)

对每个父代架构 \(\Omega_p^{(k)}\),\(F\) 通过两阶段生成 \(S\) 个后代 \(\{\Omega_{p,s}^{(k+1)}\}\):

  • 诊断(Diagnosis) :用父代自己执行批次 \(T_p^{(k)}\) 的轨迹级证据 检查它。对每条轨迹提供结果统计(成功指标、Token 成本)+ 任务查询的结构化描述;一个 replay 接口 允许回放对应轨迹,做针对性检查(包括检索失败、无效抽象、存储低效 等)。诊断阶段产出一份结构化缺陷画像(defect profile) \(D(\Omega_p^{(k)})\),刻画四个组件上的架构瓶颈

  • 设计(Design) :以缺陷画像为条件,只修改模块化接口内允许的实现位点 来构造重设计架构,从而保证兼容性、把架构变更隔离在指定设计空间内。产出 \(S\) 个变体 \(\Omega_{p,s}^{(k+1)} = \mathrm{Design}(\Omega_p^{(k)}, D(\Omega_p^{(k)}), s)\),它们在编码策略、存储规则、检索约束或管理策略上各不相同,但都符合统一接口、都能被 Agent 执行

聚合所有父代的后代,即得到下一代候选架构集。这一机制保证架构更新既有经验依据,又被结构化约束在统一设计空间内

实验

Benchmark:GAIA、WebWalkerQA、xBench-DeepSearch(xBench-DS)、TaskCraft 四个高难度 Agentic 基准

Agent 框架 :集成到两个代表性框架------SmolAgent (轻量双 Agent 架构)和 Flash-Searcher (高性能单 Agent 深研系统);另在两个 held-out 多 Agent 系统上验证泛化:腾讯 CK-Pro (main/file/web 三 Agent)和 OWL(planner/coordinator/web/document/coding 分层系统)

模型 :主干用 GPT-5-mini (同时也支撑元进化算子 \(F\)),另加 DeepSeek V3.2Kimi K2 测跨 LLM 泛化

配置 :双层进化跑 \(K_{max}=3\) 轮;外层存活预算 \(K=1\)(每轮只保留 top-1 架构,扩展出 \(S=3\) 个后代);内层每个候选在 60 条轨迹的批次上评估(40 条新采样 + 20 条复用上一轮以稳定跨轮比较)

主要结果

  • 记忆系统对 Agent 至关重要 :xBench 上 SmolAgent + GPT-5-Mini 初始 pass@1 为 51%,接入 MemEvolve 后 +6%,pass@3 涨到 68%;Flash-Searcher + GPT-5-Mini 从 69% 提到 74%。在 GAIA 上 MemEvolve + Flash-Searcher pass@3 达 80.61%,超过 OWL-Workforce、CK-Pro 等强多 Agent 系统,且避免了构建庞大昂贵的离线知识库

  • 跨任务 / 跨模型 / 跨框架泛化 :WebWalkerQA 和 xBench 上用的记忆系统直接继承自 TaskCraft 上进化的结果、未做任何任务特定元进化 ,仍带来一致增益(WebWalkerQA 58.82→61.18%,xBench 69.0→74.0%),说明 MemEvolve 捕获的是任务无关的记忆设计原则而非对单个数据集的过拟合。在跨 LLM 上虽用 GPT-5-Mini 进化,迁移到 Kimi K2 和 DeepSeek V3.2 无需人工适配

  • 成本可控:MemEvolve 的增益不是靠堆 Token 换来的。API 成本与 No-Memory baseline 相当(GAIA:0.085 vs 0.086;xBench:0.136 vs 0.141),执行延迟也与其他自进化 baseline 同一量级

与人工设计记忆系统的对比

作者把 EvolveLab 里 7 个代表性人工记忆系统接到 Flash-Searcher 上对比:

  • 现有记忆系统难以带来一致增益 :DILU 在 xBench 和 WebWalkerQA 上提升却在 GAIA 上掉 2.42%;Dynamic Cheatsheet 靠技能凝练在 WebWalkerQA 上 +1.76% 却在 GAIA、xBench 上表现很差;ExpeL 在三个基准上全部退化 ,因为它原本是为 ALFWorld、HotpotQA 这类简单具身/QA 场景设计的,机制不适配长程、长上下文的深度研究。这印证了任务感知记忆设计(task-aware memory design)的必要性

  • MemEvolve 提供稳健一致的改进 :虽在 TaskCraft 上进化,却在三个基准上稳定取得 3.54%~5.0% 的提升,且累积成功率曲线随任务推进逐渐稳定收敛到明显更优的水平,说明它发现的是有原则的记忆设计而非脆弱的任务特定启发式

关于「泛化」与「记忆系统无法跨域泛化」这一动机看似冲突的问题,作者澄清:TaskCraft 上进化的记忆确实不太可能迁移到根本不同的任务族 (如具身动作,环境/动作空间/工具集差异巨大);但 MemEvolve 能在共享任务域内发现广泛适用的架构,同时保留必要时进一步做任务特定适配的能力

元进化动态(Meta-Evolving Dynamics)

图6 展示了从固定的 AgentKB 架构出发,逐步进化到越来越 agentic、越来越高效的记忆架构的路径:

  • Agent 会自发进化出高效记忆架构 :初始 AgentKB 对 encode 和 store 都采用冻结设计,无法吸收新经验。第一轮里出现激进候选(\(\Omega_1^{(1)}\):把单条轨迹分解为 9 种技能粒度的 Adaptive Decision System)和保守候选(\(\Omega_3^{(1)}\):四层存储轨迹 + 检索时引入 LLM meta-guardrail 过滤无关信息的 Meta Memory System),后者胜出

  • 第三轮进化里,从 \(\Omega_3^{(2)}\) Riva 到 \(\Omega_1^{(3)}\) Cerebra,记忆系统学会不仅蒸馏文本洞察,还蒸馏可复用工具,并引入对记忆数据库的周期性维护,为底层框架提供更快的进化动量

  • 进化出的记忆在实际中确实有效 (图7):从最简 few-shot baseline 进化出的 Lightweight 系统能在不同任务阶段自适应地提供不同粒度的记忆------早期规划阶段给高层任务分解策略,执行推进时给细粒度工具使用建议 + 高亮关键信息的工作记忆;它甚至表现出预测性行为,预判目标信息可能出现在在线旅游网站的图片内容里,成功引导 Agent 在 trip.com 上定位证据

总结

MemEvolve 揭示了几条自动进化出的记忆设计原则更多的 agentic 参与、分层组织、多层抽象。它把「自进化记忆」这件事从「人工精心设计单一架构并期望其跨域泛化」推进到「由经验交互反馈驱动的、架构级的自适应进化」

个人觉得这篇工作的立意很好,抓住了当前记忆系统研究的一个真痛点------大家都在卷「记忆表征形态」(tips vs 工具 vs 图谱),但很少有人去问「这个记忆架构本身该不该随任务自适应」。把记忆系统解耦成 Encode/Store/Retrieve/Manage 四组件、再用 Pareto 排序 + Diagnose-and-Design 去做架构级进化,思路是干净且可复现的(配套开源了 EvolveLab,把 12 个记忆系统统一实现,这个工程贡献本身就很有价值)。双层优化 = 内层进化经验 + 外层进化架构的框架也很自然

论文标题:MemEvolve: Meta-Evolution of Agent Memory Systems

机构:OPPO AI Agent Team, LV-NUS lab

核心贡献者:Guibin Zhang, Haotian Ren(通讯:Wangchunshu Zhou, Shuicheng Yan)

arXiv:2512.18746(2025.12)

代码https://github.com/bingreeky/MemEvolve

关键词:Self-Evolving Memory, Meta-Evolution, Agent Memory Architecture, Bilevel Optimization, Modular Design Space (Encode/Store/Retrieve/Manage)

相关推荐
绵满18 小时前
"Collaborative Memory: Multi-User Memory Sharing in LLM Agents with Dynamic Access Control" 论文笔记
多智能体·智能体记忆
wangxin2084 天前
别让模型猜:语言解压——把压缩的关系与言外之意变成可计算的分叉
人工智能·多智能体·大模型训练·语言学·coordclaw·语义解压
绵满4 天前
"AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems" 论文笔记
大模型·推荐系统·多智能体
wangxin2085 天前
大模型稀疏注意力和MoE的宽度丢失与多智能体的维度补充
人工智能·ai·多智能体·管理学·组织管理·coordclaw·稀释注意力
wangxin2087 天前
多智能体协作收敛效率关键:大模型幻觉和角色视角
人工智能·ai·多智能体·团队协作·管理学·组织管理·coordclaw
zhoupenghui1688 天前
【AI大模型应用开发】【项目实战】35.基于A2A协议的智能助手(多智能体)(三)项目实现之天气MCP服务器&票务员MCP服务器&订票MCP服务器
agent·多智能体·mcp·a2a·天气mcp服务器·票务员mcp服务器·订票mcp服务器
wangxin2088 天前
同一只股票三个 AI 写出三种段位:CoordClaw 多智能体如何产出投研级股评
人工智能·多智能体·团队协作·管理学·组织管理·coordclaw·ai数字社会
周航宇JoeZhou12 天前
JP3-2-3-MyItem智能业务
java·多智能体·rag·智能体·springai·mcp·skills
wangxin20813 天前
CoordClaw 底层机制解构:多智能体协作的工程原理
人工智能·ai·多智能体·组织管理·openclaw·coordclaw·ai数字社会