"LatentMem: Customizing Latent Memory for Multi-Agent Systems" 论文笔记

同济 + 上海 AI Lab + 港中文 + 南大 + 上交的工作,目前挂在 Arxiv 26.03 上。当前多智能体系统(MAS)的记忆设计普遍存在两个瓶颈:记忆同质化 (缺乏角色感知的定制)和信息过载 (记忆条目过于细碎冗长)。本文提出 LatentMem ,一个可学习的隐空间多智能体记忆框架:用一个轻量经验库存原始轨迹,用一个记忆合成器(memory composer) 结合角色画像把原始轨迹蒸馏成定长的隐式记忆(latent memory) ,再通过 LMPO 把任务级信号反传给合成器,让它学会产出紧凑且高效用的表示

背景

LLM 驱动的多智能体系统靠角色分工协作解决复杂任务,而多智能体记忆 是它随时间持续适应的物质基础。失败暴露隐藏约束、成功 rollout 暴露可复用策略、奖励把行为锚定在环境反馈上。近期工作越来越倾向于多粒度记忆库,在不同抽象层次上捕捉经验:MAS 轨迹、蒸馏出的语义洞察、可编排的技能 schema。但作者指出现有记忆系统被两个关键问题卡住:

  • 记忆同质化:大多数方法采用 one-size-fits-all 的策略,忽视了 Agent 的功能异质性,导致角色遵从性被破坏、相关性错误被放大,削弱系统鲁棒性

  • 信息过载:MAS 本身就有很长的交互上下文,多粒度记忆设计又引入大量存储条目,最终淹没 Agent、遮蔽关键决策信号

由此引出核心问题:在 MAS 又长又复杂的上下文里,能否设计一种既角色感知又 token 高效、且不需要大量人工工程的可学习记忆?

方法

LatentMem 由两个核心组件构成:一个用于存取历史轨迹的轻量经验库(experience bank) ,和一个把检索到的轨迹转成紧凑、角色感知隐式记忆的可学习记忆合成器(memory composer)。整体流程分四步:(1)从经验库检索相关轨迹;(2)结合角色画像用 LMPO 训练过的合成器压成隐式记忆;(3)把隐式记忆注入 Agent 的推理过程;(4)任务完成后把新轨迹存回经验库形成自改进闭环

问题形式化

一个 MAS 记为 \(\mathcal{X} = (\mathcal{A}, \mathcal{G}, \mathcal{M})\),含 \(N\) 个 Agent、执行图 \(\mathcal{G}\)(可以是静态拓扑也可以是中心化的动态调度)和全局记忆模块 \(\mathcal{M}\)。每个 Agent \(a_k = (\gamma_k, \pi_{\theta_k})\) 由角色画像 \(\gamma_k\) 和策略 \(\pi_{\theta_k}\) 定义,执行时接收输入 prompt \(p\) 和检索到的记忆 \(m\),产出响应 \(o = a_k(p, m)\)。优化目标是找到最大化 MAS 期望表现的记忆模块:\\max_{\\mathcal{M}} \\mathbb{E}_{q \\sim D, \\tau \\sim \\mathcal{X}(q)}\[R(\\tau)\]这个形式化对具体记忆架构不可知,从手工符号系统到可学习参数化记忆都能套进来

Memory Bank

为了忠实记录历史轨迹供未来复用,作者构造了一个极度轻量的经验库。秉持可扩展系统应依赖通用学习机制而非手工知识的原则,这个库只存原始轨迹,不引入任何人工先验(既不做轨迹压缩也不做洞察抽取)

  • 初始化 :用覆盖多领域、多 MAS 框架的轨迹集合填充经验库,让合成器学到可泛化的记忆模式。每条轨迹 \(\tau = \{(\alpha_j, p_j, o_j)\}_{j=1}^{H}\) 记录每一步活跃 Agent 的索引、输入 prompt 和输出

  • 检索 :新 query \(q\) 到来时做基于相似度的检索,取 top-\(K\) 条相关轨迹 \(\mathcal{T}q = \text{top-}K{\tau_i \in \mathcal{B}}(\text{sim}(v(q), v(\tau_i)))\)其中 \(v(\cdot)\) 用 MiniLM 把 query/轨迹映到 embedding 空间、\(\text{sim}\) 是余弦相似度

  • 更新 :任务完成后新轨迹直接 append 进库 \(\mathcal{B} \leftarrow \mathcal{B} \cup \{\tau_{\text{new}}\}\),实现推理时的在线增量积累,无需重训

注意这里直接把检索到的原始轨迹喂给 Agent 是次优的,会用过量上下文淹没 LLM,也抓不住异质 MAS 里的角色特定表示,所以才需要 Memory Composer

Memory Composer

合成器 \(\mathcal{C}\) 实例化为一个参数为 \(\phi\) 的深度网络 \(\sigma_\phi\)。在第 \(j\) 步推理,它以检索轨迹 \(\mathcal{T}q\) 和当前活跃 Agent 的角色画像 \(\gamma{\alpha_j}\) 为输入,产出一个定长、角色感知的隐式记忆矩阵 :\(m_j = \sigma_\phi(\gamma_{\alpha_j}, \mathcal{T}_q) \in \mathbb{R}^{L' \times D}\)其中 \(L'\) 是隐式记忆的固定长度、\(D\) 是基座模型隐藏维度

关键设计在于注入方式 :活跃 Agent 先把输入 prompt 编码成隐状态序列 \(h_j \in \mathbb{R}^{L \times D}\),然后把隐式记忆 \(m_j\) 拼接到 \(h_j\) 上形成 \(\mathbb{R}^{(L+L') \times D}\) 的扩展输入,得到记忆增强策略 \(\tilde\pi_{\theta_{\alpha_j}}(p_j, m_j) = \pi_{\theta_{\alpha_j}}(\text{concat}(h_j, m_j))\)。这种注入发生在模型层面,对 Agent 层透明,不需要改动系统架构(相当于把记忆当成几个额外的 latent token 塞进去,而不是拼一大段文字进 prompt)

LMPO

这是全文的训练核心,是 GRPO 的一个变体,目的是端到端优化合成器,同时冻结所有 Agent 骨干

  • 可微接口 :隐式记忆 \(m_j = \sigma_\phi(\mathcal{T}q, \gamma{\alpha_j})\) 是一个可微接口,\(\phi\) 通过它影响活跃 Agent 自回归产出的 \(o_j\)。因为组合策略 \(\tilde\pi\) 是以 \(m_j\) 为条件的,任何任务级目标的梯度都能穿过 Agent 的前向过程反传回 \(\phi\),从而端到端优化合成器(Agent 本身不动,只学怎么造记忆)

  • 组内相对优势 :给定 query 采样一组 \(G\) 条轨迹,用 group-based advantage \(\hat{A}_i = \frac{R(\hat\tau_i) - \text{mean}(\{R\})}{\text{std}(\{R\}) + \epsilon}\) 刻画相对质量

  • Token 级目标 :标准 RL 常用轨迹级目标,会让长 MAS 交互里的 token 对梯度贡献被稀释,抓不住长程协调模式。因此 LMPO 改用 token 级 surrogate 目标 (PPO 式 clip),重要性采样比 \(r_{i,j,t}(\phi)\) 衡量的是 Agent 策略在第 \(j\) 步第 \(t\) 个 token 上被更新后的记忆调制了多少

实验

评测覆盖:知识密集 QA(TriviaQA、PopQA)、代码(KodCode、BigCodeBench)、推理 QA(StrategyQA)、符号规划(PDDL)。其中 TriviaQA/KodCode/StrategyQA/PopQA 是 held-in,BigCodeBench/PDDL 是 held-out

MAS 框架 :AutoGen、MacNet 是 in-distribution,CAMEL、DyLAN 是没见过的框架(引入新角色和协作模式)。骨干用 Qwen3-4B-Instruct-2507 和 Llama-3.1-8B-Instruct

Baseline:memory-free + 单智能体记忆(Voyager、Generative、JoyAgent)+ 多智能体记忆(MetaGPT、ChatDev、OAgents、G-Memory)

训练配置 :embedding 用 all-MiniLM-L6-v2,合成器是从骨干初始化、用 LoRA 训练的轻量 transformer,检索数 \(K=1\),隐式记忆长度 \(L'=8\)

主要结果

  • 跨领域跨框架高性能:在 AutoGen、MacNet 上分别平均超过单/多智能体记忆 baseline 约 7.86% 和 6.66%,AutoGen + TriviaQA 上提升 16.20%,最大提升在 DyLAN + PopQA 上达 19.36%

  • 强泛化:在 held-out 上多数 baseline 都掉点(MetaGPT/Voyager 在 PDDL 上分别掉 4.44%/2.77%),而 LatentMem 在 PDDL 上 +7.10%、在没见过的 CAMEL + KodCode 上 +7.05%

  • 高效率:既拿到最大性能增益又只花最少的时间和 token。DyLAN + TriviaQA 上把推理时间相对 OAgents 砍到 1/2.16,AutoGen + KodCode 上用的 token 甚至比 No-Memory 还少 0.01M;对比之下 JoyAgent 多花 1.87M token 只换来 2.50% 提升

  • 对比多智能体微调 :和在同等算力下用 GRPO 训练的 MARTI 比,LatentMem 全面胜出,AutoGen + TriviaQA 上高出 11.73%。这说明只训一个造记忆的小合成器比直接微调整个 Agent 骨干更划算

框架分析与消融

  • 角色感知可视化:t-SNE 显示 user-proxy 和 assistant 的记忆形成两个清晰分离的簇,即使在没见过的 CAMEL + BigCodeBench 上依然分得开,证明它确实避免了同质化记忆

  • 随任务时程扩展:累积准确率随经验积累稳步上升,早期方差大但很快稳定并持续改进

  • 消融 :去掉角色画像(\(\gamma\))→ AutoGen 上掉 2.30%、复杂的 MacNet 上掉 6.45%,说明角色感知对复杂 MAS 更重要;去掉经验库实时更新 → KodCode 上掉 3.60%、PDDL 上掉 7.63%,说明在线更新对适应复杂任务分布至关重要

  • Case Study :Vanilla MacNet 常犯步骤重复 (pick-move-drop 来回循环),MacNet + OAgents 则盲目照抄检索到的轨迹违反任务规范;而 LatentMem 的角色感知隐式记忆让 Agent 强化角色遵从、自我纠错

总结

LatentMem 的核心贡献是把多智能体记忆从**「手工设计的离散文本记忆」** 推进到**「可学习的定长隐式记忆」**:用极轻量经验库存原始轨迹,用角色画像条件化的合成器把轨迹蒸成角色感知的 latent token,再靠 LMPO + 隐式记忆可微性做端到端优化,一次性缓解了记忆同质化和信息过载两个问题

不过有两点值得琢磨: 一是隐式记忆是模型内部的 latent 向量,可解释性基本没有了,t-SNE 能看出分簇但到底记了什么说不清,这在需要 agent 审计的场景是个隐患;二是检索只取 \(K=1\)、隐式长度只有 \(L'=8\),压缩比这么高的情况下对更长程、更多轨迹的任务能不能扛住,正文没充分展开

论文标题:LatentMem: Customizing Latent Memory for Multi-Agent Systems

机构:同济大学、上海 AI Lab、香港中文大学(CUHK)、南京大学、上海交通大学

核心贡献者:Muxin Fu(一作);通讯:Xiaoye Qu, Yu Cheng, Yang Yang

arXiv:2602.03036v2(2026.03)

代码https://github.com/KANABOON1/LatentMem

关键词:Multi-Agent Memory, Latent Memory, Role-Aware Customization, LMPO

相关推荐
AI大佬的小弟2 天前
大模型名词精讲14:Multi-Agent(多智能体协作)
多智能体·multiagent·langgraph·ai协作·ai入门·a2a·大模型基础概念
云卷云舒___________4 天前
Anthropic披露内部模型Model 2、Codex多智能体v2委派多模型、英伟达开源550B推理教师模型 | 8月16日 AI日报
多智能体·codex·英伟达·anthropic·ai日报·model2·推理教师模型
绵满7 天前
"OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation" 论文笔记
多智能体·智能体记忆
绵满8 天前
"MemEvolve: Meta-Evolution of Agent Memory Systems" 论文笔记
多智能体·智能体记忆
绵满9 天前
"Collaborative Memory: Multi-User Memory Sharing in LLM Agents with Dynamic Access Control" 论文笔记
多智能体·智能体记忆
wangxin20813 天前
别让模型猜:语言解压——把压缩的关系与言外之意变成可计算的分叉
人工智能·多智能体·大模型训练·语言学·coordclaw·语义解压
绵满13 天前
"AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems" 论文笔记
大模型·推荐系统·多智能体
wangxin20814 天前
大模型稀疏注意力和MoE的宽度丢失与多智能体的维度补充
人工智能·ai·多智能体·管理学·组织管理·coordclaw·稀释注意力
wangxin20816 天前
多智能体协作收敛效率关键:大模型幻觉和角色视角
人工智能·ai·多智能体·团队协作·管理学·组织管理·coordclaw