"AutoMem: A Text-Gradient Recursive Self-Improvement Framework for Automated Memory Architectures Search" 论文笔记

华东师范大学 ICALK 实验室联合上海人工智能实验室的工作 AutoMem ,目前挂在 Arxiv 26.07 上,把 LLM Agent 的长期记忆设计重新表述成一个任务自适应的记忆架构搜索 问题,本质上就是给每个 task 找一个现有方法的最佳组合

这篇工作可以看成是紧接着 MemEvolve 的思路往前走了一步。MemEvolve 把整个记忆系统当成一个整体去演化,每一个候选都是一份单体(monolithic)实现 ,好处是灵活,坏处是失败发生时无法把责任归因到具体的记忆模块,也无法做受控的模块级回归实验。AutoMem 的核心区别就在于把记忆拆成四个模块,并把失败归因与架构演化的粒度从整体细化到了模块,从而得到可归因、可受控编辑、且天然合法的候选架构

背景

长期记忆已经是 LLM Agent 的重要组件,它让 Agent 能把过去交互、轨迹、任务执行中的可复用信息保存下来并在未来决策中复用。但记忆并不是单一的检索增强存储,而是一个高度耦合的子系统,涉及四类决策:写什么、怎么存、怎么取、怎么随时间维护。问题在于,绝大多数记忆系统都是人工设计并一次性固定

而记忆是否有效取决于多个模块之间的相互作用,一个任务失败可能有多种原因。因此改进 Agent 记忆需要优化整条记忆架构 ,而不是去调某一个孤立的检索组件。基于这一观察,作者遵循 MemEvolve 的工作把长期记忆拆解为四个模块 Encode / Store / Retrieve / Manage,把记忆设计转化为在如下空间上的架构搜索问题:

\\\mathcal{A} = \\mathcal{E} \\times \\mathcal{S} \\times \\mathcal{R} \\times \\mathcal{M} \\

具体地,作者构造了一个包含 5 种编码器、5 种存储、6 种检索器、4 种管理策略的离散搜索空间。一个记忆架构就是一个元组 \(a = (e, s, r, m)\),由于部分模块之间存在兼容性约束(例如图检索必须配图结构存储),可行空间被定义为经过合法性过滤的子集:

\\\mathcal{A} = \\{(e, s, r, m) \\in \\tilde{\\mathcal{A}} \\mid \\mathrm{Valid}(e, s, r, m) = 1\\} \\

这样的定义把「模块候选集」和「具体记忆架构」分离开,保证搜索到的每个架构都是合法的(valid-by-construction)。作者随后做了一个随机搜索的先导实验,得到三条关键结论:

  • Finding 1:强记忆架构确实存在,但高度任务特定,不同任务的最优模块组合完全不同,呈现散落、依赖数据集的尖峰

  • Finding 2 :模块效应是耦合而非可加 的。单个模块的好坏无法孤立评估,检索器 \(r\) 的价值取决于编码是否写入了有信息量的内容、存储能否支持所需的检索操作,因此架构质量由跨模块兼容性决定

  • Finding 3 :随机搜索能偶然撞到 SOTA,却浪费评测预算。每个候选都需要一次昂贵的完整 Agent rollout,而下一个候选又与之前的成功失败独立采样,无法把失败信号转化成可复用的搜索信号

方法

AutoMem 是一个文本梯度(text-gradient)递归自改进 框架,在评测预算 \(T\) 的约束下搜索最优可行架构。整体目标是:

\a\^{\\star} \\in \\arg\\max_{a \\in \\mathcal{A}} \\mathbb{E}_{B \\sim \\mathcal{D}}\\left\[\\mathrm{Acc}(A_a; B)\\right, \quad \text{s.t.} \quad N_{\text{eval}} \le T \]

其中除绝对准确率外,作者还关注记忆带来的增益,定义为装配架构 \(a\) 的 Agent 相对无记忆 Agent \(A_0\) 的提升:

\\\Delta(a; B) = \\mathrm{Acc}(A_a; B) - \\mathrm{Acc}(A_0; B) \\

由于搜索空间 \(\mathcal{A}\) 离散、模块耦合、且只能通过完整 rollout 观测,无法求解析梯度。AutoMem 的做法是从失败 rollout 中构造出一个文本形式的优化信号,由两个组件循环驱动:EGAS 负责提出候选,FGMD 负责诊断失败并产出下一轮的文本梯度

模块化的记忆架构空间

四个模块各自的候选如下,每一项都对应一类既有记忆系统的做法:

  • Encode:tip(可迁移启发式)、insight(失败根因)、trajectory(动作观察轨迹)、workflow(编排逻辑)、shortcut(参数化宏)

  • Store:json(精确键值)、vector(FAISS 稠密索引)、hybrid(json 加 vector)、graph(实体关系图)、llm_graph(LLM 构建的时序知识图)

  • Retrieve:hybrid(词法加语义)、contrastive(成功失败对比)、cbr_rerank(案例库加重排)、graph(多跳遍历)、hyde(假设文档嵌入)、mmr(多样性重排)

  • Manage:lightweight(遗忘)、json_full(合并加更新)、tool_manager(校验)、graph_consolidate(合并加演化)

这个四模块视角揭示了一个关键事实:已有记忆系统并不是互不可比的单体,而是同一架构空间里的固定点。技能库型系统重仓 Encode,图记忆系统强调 Store,记忆库型系统聚焦 Manage,它们各自把其余模块留在通用默认值上,因此一旦失败发生在自己不擅长的模块,就很难适配

Experience-Guided Architecture Search(EGAS)

EGAS 用一个 proposer LLM 来提出候选架构,其关键在于不只看最新的诊断反馈,而是把三类搜索状态作为结构化先验一起喂给 proposer:\(\{a_t^{(1)}, \ldots, a_t^{(K)}\} = \mathrm{Propose}_\theta\left(\delta_t, \mathcal{L}_t, \mathcal{G}_t, P_t\right)\)

  • Pareto 前沿 \(P_t\) :在准确率、记忆增益、成本三个目标上的非支配候选集合。支配关系定义为 \(a_i \succ a_j\) 当且仅当 \(\mathrm{Acc}_i \ge \mathrm{Acc}_j\)、\(\Delta_i \ge \Delta_j\)、\(\mathrm{Cost}_i \le \mathrm{Cost}_j\) 且至少有一项严格更优

  • 经验账本 \(\mathcal{L}\) :跨轮可复用的搜索知识。每条记为 \(\ell = (c, u, q, z)\),即条件、推荐或不推荐的编辑、支持证据、以及状态(active / pending / refuted)。active 条目会把 proposer 推向有正证据的编辑,refuted 与死胡同条目则阻止重复探索已经失败的方向

  • 观测图 \(\mathcal{G}\) :记录任务模式层面上哪些模块选择有效的统计。节点是任务模式与模块选择,边上维护运行均值 \(\mu(c, u) = \frac{1}{n(c, u)} \sum_{j:\, c_j = c,\, u_j = u} \Delta(a_j; B_j)\),其作为软先验而非硬规则,尤其适合这种「缺失记忆比错误检索更难归因」的 Encode 模块

这里每个 proposal 只改动具名坐标 ,而不是重新生成一份记忆实现。这让搜索是受控的单坐标编辑 ,且由确定性检查器保证合法:\(a_t^{(k)} \in \mathcal{A} \iff \mathrm{Valid}(e_t^{(k)}, s_t^{(k)}, r_t^{(k)}, m_t^{(k)}) = 1\),非法提案直接拒绝重采。前沿 leader 会周期性地在验证集上复评,以减轻在搜索批次上的过拟合

Failure-Guided Module Diagnosis(FGMD)

FGMD 把失败 rollout 转换成模块级的文本梯度,回答三个问题:这次失败是否可归因于记忆、哪个模块最可能负责、下一步该尝试什么编辑。这正是与 MemEvolve 整体演化最本质的区别所在

  • Scope 过滤 :不是所有失败都该更新记忆架构。一个规则门先剔除掉工具错误、超时、评测器歧义、纯推理错误等与记忆无关的失败,只有 \(g_i = \mathrm{Scope}(\tau_i) = 1\) 的轨迹才进入归因

  • 模块归因 :一个规则分类器 根据记忆轨迹信号(相关单元是否存在、是否被检索、一致性裁判是否保留、保留的单元是否陈旧)给每条失败打上主导失败模式 \(f_i = \mathrm{Classify}(\tau_i)\),例如 extraction gap、low-quality extraction、retrieval miss、judge-rejected、retrieval noise、stale memory,再由一张固定表映射到负责模块 \(b_i \in \{E, S, R, M\}\)。规则难以归因的疑难 case 交给诊断 LLM 复核

  • 聚合 :单条轨迹的诊断有噪声,于是在整轮上聚合成每模块失败直方图。直方图提名候选瓶颈,再由诊断 LLM 结合代表性失败轨迹敲定主瓶颈 \(q_t^{\star}\),当直方图与诊断师意见不一致时记录分歧

  • 文本梯度合成 :最终把本轮诊断信号合成为一个结构化的文本梯度 \(\delta_{t+1} = \left(q_t^{\star}, \mathcal{E}_t, \rho_t, \mathcal{R}_t\right)\)

    其中 \(q_t^{\star}\) 是主瓶颈模块,\(\mathcal{E}_t\) 是有据可查的证据(代表性失败任务),\(\rho_t\) 是置信度,\(\mathcal{R}_t\) 是被约束在合法编辑范围内的推荐架构改动。这个梯度只指定一个坐标加一个方向 ,例如 Retrieve 瓶颈推荐 hybrid -> contrastive

  • 差分验证 :为避免一直沿着无用方向走,FGMD 把当前轮与上一轮比较。如果上一次编辑针对模块 \(q\) 却没带来增益,就在账本里降级 该推荐;如果带来增益,就提升为 active 原则。这就把「失败归因 → 架构搜索 → 验证保留或推翻」闭成一个环

整体流程 :先评估无记忆基线并初始化账本与观测图,每轮 EGAS 提出 \(K\) 个候选、在搜索批上评估并更新 Pareto 前沿,FGMD 分析失败产出 \(\delta_{t+1}\),账本与观测图随之更新,最终由验证集选出前沿 leader 并在测试集上报告

实验

设置:在 GAIA、WebWalkerQA、xBench-DeepSearch 三个 Agentic 搜索与推理基准上评测,Backbone 用 Qwen3.5-122B-A10B 与 gpt-5.1-mini(另有 gpt-5.4)。指标包括准确率、记忆增益、token 成本、延迟、推理步数、检索命中率、回归率。基线覆盖了 No-Memory、Mem0、MemoryBank、ExpeL、Voyager、Agent-KB、Memp、DiLu、Dynamic Cheatsheet、Mobile-Agent-E 以及最相关的自演化记忆系统 MemEvolve

主结果(Table 2)

  • 在 Qwen3.5-122B-A10B 和 gpt-5.1-mini 下,AutoMem 在三个基准上全部取得最佳准确率

  • 增益并非靠堆砌记忆或拉长交互得到。Qwen 下 AutoMem 同时显著降低了 token 成本、延迟与步数,例如 GAIA 上 128.4k tokens 明显低于 MemoryBank 的 200.4k

引导搜索 vs 随机搜索

  • 只用 5 轮演化就达到 71.5%,已超过 10 次随机试验的最好结果 69.7%,即用大约一半的搜索预算得到更强架构

  • 演化过程单调改进,第一轮到最后 55.8 → 64.2 → 67.9 → 71.5,说明累积反思与失败引导反馈确实提供了有方向的信号,而随机搜索波动剧烈且多数采样架构还不如无记忆基线

  • token 成本上,AutoMem 相对随机搜索在 GAIA 为 0.55×、xBench 为 0.47×,用不到一半的 token 得到更强架构(71.5 vs 69.7)

发现的架构(Figure 4)

  • GAIA:Tip+Workflow+Trajectory 编码 / Graph 存储 / Contrastive 检索 / Lightweight 管理

  • WebWalkerQA:Insight+Workflow+Shortcut / JSON / Hybrid / Tool-manager

  • xBench-DS:Tip+Insight+Trajectory / JSON / cbr_rerank / Lightweight

三个基准收敛到明显不同的模块组合,为「记忆架构应随任务分布自适应而非固定」这一核心主张提供了直接证据

总结

虽然作者坦诚了两点局限,但是这两个局限有点过于明显和削弱这篇工作的意义了:一是搜索停在任务/基准级 ,每个基准只产出一条 E/S/R/M 路径,还做不到按当前 query 动态路由到样本/回合级;二是搜索空间十分有限,是已知记忆组件的重组 ,尚未发明全新的记忆模块或跨模块交互原语,但是 MemEvolve 好像是不限制搜索空间的?其实本质上就是给每个 task 找一个现有方法的最佳组合,所以我看起来这篇工作会显得没那么有意义

PDF 链接: https://arxiv.org/abs/2608.14621

Github 链接: https://github.com/ECNU-ICALK/AutoMem

相关推荐
可乐ea5 天前
智能体记忆不是越多越好:ALTK-Evolve 八模型评测,记忆要按模型能力“配药“
prompt·rag·ai agent·智能体记忆
绵满6 天前
"LatentMem: Customizing Latent Memory for Multi-Agent Systems" 论文笔记
多智能体·智能体记忆
绵满13 天前
"OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation" 论文笔记
多智能体·智能体记忆
绵满14 天前
"MemEvolve: Meta-Evolution of Agent Memory Systems" 论文笔记
多智能体·智能体记忆
绵满15 天前
"Collaborative Memory: Multi-User Memory Sharing in LLM Agents with Dynamic Access Control" 论文笔记
多智能体·智能体记忆
宇擎智脑科技4 个月前
AI Agent 的“记忆“与“进化“:从被动存储到闭环学习的技术路径
智能体记忆·hermes agent
绵满5 个月前
"INMS: Memory Sharing for Large Language Model based Agents" 论文笔记
多智能体·智能体记忆