"Scaling Teams or Scaling Time? Memory Enabled Lifelong Learning in LLM Multi-Agent Systems" 论文笔记

LLMA-Mem 目前挂在 Arxiv 26.04 上,探讨了 LLM 多智能体系统中 "横向扩展团队规模" 与 "纵向积累时间经验" 两种扩展维度之间的交互关系,提出通过记忆设计实现更高效的终身学习

背景

LLM 多智能体系统(Multi-Agent Systems, MAS)可以通过两个不同维度进行扩展:"增加智能体数量""通过积累经验随时间改进"。尽管先前的工作分别研究了这两个维度,但它们在现实成本约束下的交互作用尚不清楚


图1 | LLMA-Mem 启用的扩展空间与成本对比。上:多智能体系统的二维扩展空间;下:每任务平均 Token 用量,LLMA-Mem 在所有模型上均显著降低 Token 消耗。

核心洞察:本文提出应将 LLM 多智能体系统视为一个由团队规模和终身学习能力共同定义的概念性扩展空间。在这个视角下,扩展不再是一个单轴问题,而是变成了一个系统性问题:团队组成与随时间学习之间的交互如何影响长期效果和效率

现有研究的局限

  1. 团队规模扩展:早期工作如 MacNet(Qian et al., 2024)发现协作扩展遵循 logistic 模式,收益递减。Kim et al.(2025)的大规模对照研究表明,在固定预算下扩展团队规模可能因协调开销、工具调用竞争和错误放大而产生净负收益。Xu et al.(2026)则指出,同质化智能体中单个智能体通过多轮执行并利用 KV-cache 复用,可以大幅缩小甚至消除大规模团队的优势

  2. 终身学习扩展:现有工作如 Agent Workflow Memory(Wang et al., 2024)、ReasoningBank(Ouyang et al., 2025)、SimpleMem(Liu et al., 2026)等主要关注单智能体场景,多智能体系统中的终身学习行为如何随团队规模变化仍不明确

两个研究问题

  • RQ1:记忆设计如何改善多智能体系统中的终身学习?

  • RQ2:终身学习能力如何与多智能体系统中的团队规模交互?

方法


图3 | LLMA-Mem 维护三个互补记忆组件:情景记忆(任务经验)、程序记忆(整合后可重用策略)和交互记忆(智能体能力与团队协作)。右图展示了三种决定记忆如何跨智能体分布和访问的拓扑配置。

LLMA-Mem 是一个统一记忆框架,由三个相互依赖的记忆模块组成,支持不同多智能体拓扑结构

三大记忆模块

  1. 情景记忆(Episodic Memory)

    • 存储过去任务执行的丰富记录,包括任务上下文、智能体交互、结果和事后反思

    • 形式化定义:\(e_i = \langle a_{\mathrm{id}}, t_i, \tau_i, C_i, \mathcal{A}_i, o_i, c_i, \mathcal{L}i, \mathcal{P}{i}^{\mathrm{rel}} \rangle\)

    • 作用:作为后续抽象的原始经验基础,支持基于案例的推理

  2. 程序记忆(Procedural Memory)

    • 存储从情景经验中抽象出的可重用策略和技能

    • 与情景记忆的实例特定性不同,程序记忆捕获跨多个任务被证明有效的泛化知识

    • 形式化定义:\(p_j = \langle a_{\mathrm{id}}, t_j^c, t_j^d, \eta_j, \kappa_j, s_j, f_j, \mathcal{E}_j^{\mathrm{src}} \rangle\)

    • 可靠性估计:\(rho_j = \frac{s_j}{s_j + f_j}\)(越多的情景记忆抽象出的越少程序记忆,可靠性越高)

    • 作用:通过压缩原始轨迹为紧凑的程序记忆,显著降低 Token 消耗

  3. 交互记忆(Transactive Memory)

    • 捕获 "谁知道什么",即团队内谁擅长什么任务、谁可靠等信息

    • 跟踪每个智能体的专业领域和可靠性,支持高效的任务分配和协调

    • 可靠性更新:\(\xi_k^{(t+1)} = \frac{\mathrm{successes}_k}{\mathrm{total\_tasks}_k}\)

三种记忆拓扑配置

  • 本地拓扑(Local Topology) :每个智能体维护私有记忆库 \(\mathcal{M}i = \langle \mathcal{E}{i}, \mathcal{P}{i}, \mathcal{T}{i} \rangle\)。知识仅在显式通信中传递。消融实验显示此拓扑在终身学习场景中效果最佳

  • 共享拓扑(Shared Topology) :所有智能体访问集中式记忆库 \(\mathcal{M}_{\text{shared}}\)。所有经验贡献给公共池,利于集体复用但可能引入检索噪声

  • 混合拓扑(Hybrid Topology) :\(\mathcal{M}{i}^{\text{hybrid}} = \langle \mathcal{E}{i}^{\text{local}}, \mathcal{T}{i}^{\text{local}}, \mathcal{P}{\text{shared}}, \mathcal{T}_{\text{shared}} \rangle\)。情景记忆保持本地(保留角色特定经验),程序记忆和团队统计全局共享

记忆生命周期


图4 | 任务执行期间系统使用相关性-重要性分数检索相关记忆,任务结束后更新情景和交互统计,并定期将情景经验整合为可重用的程序知识。

  1. 检索(Retrieval)

    • 检索分数:\(\mathrm{score}(m,q) = \mathrm{rel}(m,q) + \mathrm{imp}(m)\)

    • 其中 \(\mathrm{rel}(m,q)\) 为语义相关性(余弦相似度),\(\mathrm{imp}(m)\) 为记忆重要性(程序记忆为成功率,情景记忆为任务得分)

    • 分层策略:优先查询程序记忆,若无足够相关程序则回退到情景记忆

  2. 更新(Update)

    • 新情景追加到情景记忆:\(\mathcal{E}^{(t+1)} = \mathcal{E}^{(t)} \cup \{e_{\mathrm{new}}\}\)

    • 程序使用统计更新:\(s_j^{(t+1)} = s_j^{(t)} + \mathbb{1}{\mathrm{success}}, \quad f_j^{(t+1)} = f_j^{(t)} + \mathbb{1}{\mathrm{failure}}\)

    • 交互记忆统计刷新

  3. 整合(Consolidation)(每 N 个情景执行一次):

    • 按情景中学到的教训(lessons_learned)进行语义聚类

    • 从成功的经验中提取通用策略

    • 创建新的程序记忆,移除冗余程序(源情景是其他程序的子集)

算法1(简化)

txt 复制代码
输入:情景记忆 ε
输出:新程序 P_new
1. 按 lessons_learned 的语义相似度对情景聚类
2. 对每个大小 ≥ 2 的簇:
3.   取成功的经验 E_succ
4.   若 |E_succ| ≥ 2,从中提取通用策略,创建程序
5. 移除源情景是其他程序子集的冗余程序

实验

实验设置

  • 基准(Benchmark)MultiAgentBench(Zhu et al., 2025),选择三个协作环境:编程(Coding)、研究(Research)、数据库(Database),各 100 个任务

  • 模型:Claude-Sonnet-4.5、DeepSeek-V3.2、Qwen3-next-80B、Qwen3-32B-Instruct。Claude-Sonnet-4.5 作为统一评估模型。所有模型通过 Amazon Bedrock API 访问

  • 基线

    • W.o. Memory:无记忆模块

    • MARBLE(Zhu et al., 2025):MultiAgentBench 原生的多智能体协作框架,含短时、长时和共享记忆

    • A-Mem(Xu et al., 2025):代表性记忆框架,维护动态知识网络和演化记忆存储

  • 评估指标

    • TS(Task Score):最终任务输出正确性/质量

    • CS(Communication Score):智能体间沟通和规划质量

    • AS(t)(运行平均表现) :\(\frac{1}{t}\sum_{i=1}^{t}S_i\)

    • AAS(Average of AS) :\(\frac{1}{T}\sum_{i=1}^{T}AS(i)\),系统整个生命周期表现的标量汇总

    • CMA_t(累积表现增益) :\(\sum_{i=1}^{t}(s_i^{\mathrm{method}} - s_i^{\mathrm{no\_mem}})\),相对于无记忆基线的累积增益

主要结果(表1)

  • LLMA-Mem 在 TS 上表现最佳或持平,如 Qwen3-next-80B 在研究环境提升 +10.67

  • CS 趋势更复杂:记忆帮助智能体更有效地行动,但协调仍对模型家族和环境特定的交互模式更敏感

  • 从终身学习视角(AAS)看,LLMA-Mem 优势明显

    • 最大增益:DeepSeek-v3.2 在研究环境 +5.92,Qwen3-32B-Instruct 在数据库环境 +3.19

    • 唯一例外是 Qwen3-Next-80B 在研究环境(TS 提升但 CS 下降)


图5 | CMA 曲线。LLMA-Mem 相比 MARBLE 和 A-Mem 表现更稳定的长期改进,尤其在 DeepSeek-v3.2 和 Qwen3-32B-Instruct 上差异明显。A-Mem 和 MARBLE 在任务序列后期出现负 CMA,说明基线记忆设计随任务推进更容易出现性能衰减。

成本分析(图1)

  • LLMA-Mem 比 MARBLE 和 A-Mem 平均 Token 用量更低,降幅从 19.4% 到 171.7%

  • 节省主要来自更低的输入 Token 开销:程序记忆将原始轨迹压缩为紧凑形式,避免上下文膨胀

  • 关键洞察:LLMA-Mem 的增益不是通过消耗更多 Token 获得的,而是在提升性能的同时降低 Token 消耗

团队规模影响(图1)

  • 二维扩展空间:从时间维度看,所有团队规模下 LLMA-Mem 都随任务索引增加持续改进;从空间维度看,增加团队规模通常也带来性能提升

  • 非单调性(Non-Monotonic)

    • Qwen3-32B-Instruct 中 3 智能体团队优于 5 智能体团队

    • Claude-Sonnet-4.5 中 5 智能体团队在第 5 个任务后超越 7 智能体团队

    • 核心洞察:支持更强经验积累和复用的记忆设计,可以使更小的团队在长期表现上超越更大的团队

  • 成本视角:增加团队规模一致导致更高的计算成本。Qwen3-32B-Instruct 受益于 LLMA-Mem 的终身学习能力,以 3 智能体团队在任务得分上取得了优势

消融实验(表3)

1. 记忆拓扑影响( N=5 固定)

  • 本地拓扑在 TS、CS、AAS 三项指标上均最佳

  • **归因:**在编程环境中,不同智能体扮演不同功能角色(分解、实现、调试、验证)。本地记忆允许每个智能体积累与其角色紧密耦合的程序和经验,使后续检索更兼容、更可直接复用。共享拓扑中,一个角色产生的经验可能被另一个职责不同的智能体检索到,导致不兼容的记忆复用

2. 整合间隔 (N) 影响(本地拓扑下)

  • (N=5) 表现最佳,(N=2)、10、20 均更差

  • 非单调效应

    • 太频繁(N=2):经验证据不足时转化为程序,导致不稳定或过于具体的程序记忆

    • 太稀疏(N=10, 20):有用经验长期困在情景形式中,延迟重用

    • 中等频率(N=5):提供足够的重复证据形成可靠程序,同时足够快速支持未来任务

总结

LLMA-Mem 是一个通过情景-程序-交互三元记忆架构实现 LLM 多智能体系统终身学习的框架,揭示了 "团队规模扩展" 与 "时间经验积累" 之间的非单调权衡关系

论文标题:Scaling Teams or Scaling Time? Memory Enabled Lifelong Learning in LLM Multi-Agent Systems

作者:Shanglin Wu, Yuyang Luo, Yueqing Liang, Kaiwen Shi, Yanfang Ye, Ali Payani, Kai Shu

机构:Emory University, Illinois Institute of Technology, University of Notre Dame, Cisco Research

代码https://github.com/ShanglinWu/MAS_lifelong_learning

关键词:LLM Multi-Agent Systems, Lifelong Learning, Memory Architecture, Team Size Scaling, Procedural Memory

相关推荐
stereohomology2 小时前
实战微调排版细节:豆包Seed 2.1 Turbo 不弱于GLM5.2?
人工智能·大模型·对比·why不coding
会思想的苇草i4 小时前
oMLX 部署本地大模型
大模型·ai编程·开发·本地部署·omlx
梦想三三12 小时前
LangChain模型调用与多轮对话完整实战
阿里云·langchain·大模型·api
yuhaiqun198912 小时前
Agent之间怎么对话?A2A协议+多智能体协作+NL2SQL+对话状态跟踪+Vibe Coding+Spec Coding全讲透(附代码)
多智能体·nl2sql·a2a·vibe·spec coding·对话状态跟踪
程序员三明治12 小时前
【AI】RAG 生成阶段的最后一公里:Prompt 设计、幻觉抑制与引用对齐
java·人工智能·ai·大模型·llm·prompt·rag
kishu_iOS&AI13 小时前
【02】Context Engineering:Prompt不再是核心
ai·大模型·loop·rag·harness·agent 架构
thesky1234561 天前
27届大模型岗面试准备(三):位置编码全景——从绝对编码到 RoPE/ALiBi 的演进与手推
人工智能·ai·大模型
山林竹笋1 天前
人工智能领域开源TOP20(2026.06.22-2026.06.28)
人工智能·开源·大模型·智能体·技术趋势