核心问题
LLM在单次对话中表现优异,但缺乏跨会话的连续性和个性化,无法像人类一样运用多种记忆进行长期互动。
解决方案:MMAG模式
提出**混合记忆增强生成(MMAG)**框架,将记忆划分为5个层次:
| 记忆类型 | 作用 |
|---|---|
| 对话记忆 | 维持当前对话的连贯性 |
| 长期用户记忆 | 存储用户偏好、背景等静态信息 |
| 情节/事件记忆 | 记录特定事件、日程、习惯 |
| 感知/上下文记忆 | 整合环境信号(时间、地点、天气) |
| 短期工作记忆 | 临时存储当前任务信息 |
协调机制
-
通过中央控制器统一调度各记忆模块
-
使用优先级策略(时效性、用户权重、任务驱动)解决记忆冲突
-
采用模块化架构,便于扩展
实现要点
-
对话历史存入Firestore,按token数量剪枝控制上下文长度
-
长期用户信息加密存储(信封加密+S3)
-
提示工程上:对话记忆作为对话轮次注入,长期记忆作为系统级消息优先注入
实验结果(Heero语言学习应用)
-
用户留存率提升20%(四周内)
-
平均对话时长增加30%
-
引入记忆层后响应延迟未增加(异步处理+缓存)
关键挑战
-
隐私与安全:用户需能查看、编辑、删除存储的记忆
-
主动 vs 侵扰:智能体主动提醒需把握分寸,避免" creepy"
-
偏见与公平:避免记忆强化固有偏见
核心贡献
提出一套受认知科学启发的LLM记忆分类与架构模式,通过模块化设计让智能体更连贯、个性化,且已在实际应用中验证有效。
原文翻译
论文标题:MMAG:面向大型语言模型应用的混合记忆增强生成
作者: Stefano Zeppieri*1
单位: 1 罗马大学计算机科学系,意大利
日期: 2025年12月5日
摘要
大型语言模型(LLM)在单个提示词内生成连贯文本方面表现出色,但在维持跨扩展交互的相关性、个性化和连续性方面存在不足。然而,人类的沟通依赖于多种形式的记忆,从回忆过去的对话到适应个人特质和情境背景。本文介绍了混合记忆增强生成(MMAG)模式,这是一个为基于LLM的智能体组织记忆的框架,将其划分为五个交互层:对话记忆、长期用户记忆、情节与事件关联记忆、感知与上下文感知记忆,以及短期工作记忆。我们借鉴认知心理学的灵感,将这些层次映射到技术组件,并概述了协调、优先级排序和冲突解决的策略。我们通过在Heero对话智能体中的实现来演示该方法,在该系统中,加密的长期个人档案和对话历史记录已经提升了用户参与度和留存率。我们进一步讨论了围绕存储、检索、隐私和延迟的实现问题,并强调了开放挑战。MMAG为构建记忆丰富的语言智能体奠定了基础,使其更连贯、更主动,并更符合人类需求。
1. 引言
大型语言模型(LLM)在生成流畅且上下文得体的文本方面取得了显著进展。然而,当前大多数系统仅在单个提示词或至多一个有限的对话窗口范围内运行。这种限制使得智能体难以随着时间的推移维持有意义、个性化且上下文丰富的交互。相比之下,人类的沟通依赖于记忆:我们回忆过去的讨论,适应个人偏好,并建立在共享经验之上。没有记忆,LLM有可能仍然是反应式的工具,每次会话都重置,而无法演变为值得信赖的协作伙伴。
最近的研究开始探索记忆增强系统,但许多方法仍将记忆视为一个平面化的检索存储库或一个扩展的上下文缓冲区。这类设计改善了对过往信息的访问,但并未捕捉到塑造人类对话的多样化记忆功能。人类认知区分了短期回忆、长期事实知识、情节经历和上下文感知,每种都在沟通中扮演着独特的角色。将这一视角引入LLM设计,有助于超越更长的上下文,走向更丰富、更具适应性的交互。
为满足这一需求,我们提出了混合记忆增强生成(MMAG)模式。MMAG将记忆组织为五种交互类型:对话历史、长期用户特征、情节与事件关联知识、感知与上下文感知信号,以及短期工作记忆。这种分类法借鉴了认知心理学,同时直接映射到向量数据库、结构化存储和事件触发器等技术组件。通过跨层协调,智能体可以回忆相关的过往交流、调整语气和推荐、适时提醒,并在不干扰用户的前提下保持对环境背景的敏感。
我们在Heero对话智能体(一个语言学习平台)中实现并研究了MMAG,该平台的连续性和个性化对于用户参与度至关重要。即使仅部分部署,结合了对话历史和加密长期个人档案的Heero也展示了用户留存率和对话时长的切实提升。这些结果突显了模块化记忆设计的实用价值,并激励了进一步的扩展。
本文的其余部分将介绍MMAG分类法,讨论协调与实现策略,并报告面向用户的结果。最后,我们讨论了机遇与风险,以及在构建记忆丰富的智能体时,平衡技术性能、用户自主权和道德责任所面临的开放挑战。
2. 相关工作
(此部分概述了记忆增强型LLM的相关研究,为简洁起见,此处略去详细叙述,其核心背景已融入引言和后续章节。)
3. 记忆分类法
人类认知中的记忆并非单一整体;它由多个功能各异的相互依赖的系统组成。认知心理学区分了情节记忆、语义记忆、工作记忆和程序性记忆等。受此框架启发,我们将基于LLM的智能体的记忆组织为五个类别:对话记忆、长期用户记忆、情节与事件关联记忆、感知与上下文感知记忆,以及短期工作记忆。每种类型捕捉交互的不同维度,它们共同构成一个分类法,支持更丰富、更贴近人类的行为。此分类法既反映了人类记忆系统,也映射到向量数据库、键值存储和调度模块等实用技术组件上。
3.1 对话记忆
对话记忆代表了线程级上下文,使智能体能够在持续对话中保持连贯性。与单轮交互不同,人类对话高度依赖连续性:我们期望对话者记住之前的交流、解析指代,并随时间推移维持共同理解。对于LLM系统,这种记忆可以通过对话线程化、过去轮次的摘要化以及指代消解技术等机制来实现。结构良好的对话记忆使智能体能够无缝地重新引入先前的话题,管理中断,并保持一致的个性。在技术上,这可能涉及滑动上下文窗口与压缩的对话历史记录相结合,或从结构化对话日志中进行检索。
3.2 长期用户记忆
长期用户记忆作为一种传记式存储,编码关于个人偏好、背景和特征的信息。这与人类语义记忆一致,后者捕获不与特定事件关联的事实性知识。在实践中,此类记忆允许智能体基于对用户的累积知识来调整语气、个性化推荐或适应交互风格。例如,在推荐菜谱时记住饮食偏好,或记起用户偏好简洁的解释。实现时必须处理隐私问题,确保敏感个人信息安全存储(可能加密),并在获得用户明确同意后检索。联邦学习和选择性遗忘等技术可以在保护用户自主权的同时支持个性化。
3.3 情节与事件关联记忆
人类的情节记忆指的是对发生在特定时间和地点的具体事件的回忆。对于LLM智能体,这转化为存储和使用与特定事件或常规活动相关联的信息。
时间关联事件记忆
时间关联事件记忆捕获与用户相关的、已安排或预期的事件知识。这包括即将到来的会议、纪念日或旅行计划。若管理得当,这种记忆能实现及时和主动的交互,例如提醒用户同事的来访临近,或在预定任务前提供相关背景。技术上,它需要与日程安排系统集成、带时间戳的记忆存储以及基于触发的检索机制。
常规与习惯性线索
除了离散事件,智能体还能从识别常规和习惯性行为中获益。检测重复模式(例如用户经常在周末讨论烹饪)使得基于习惯的生成式建议成为可能。这一记忆层类似于人类程序性记忆,后者编码重复的活动和技能。实现上可利用交互日志上的模式检测算法,生成温和的提示或轻量级提醒,而不会使用户不堪重负。挑战在于提供感觉自然有用而非侵扰性的支持。
3.4 感知与上下文感知记忆
人类依赖感知记忆将对话置于周围环境中。对于LLM智能体,感知和上下文感知记忆对应于整合位置、天气或时间等信号。例如,智能体可能意识到在雨中通勤会使得一天很艰难,或者根据交互发生在工作时间还是休闲时间来调整语气。这一维度支持上下文敏感性和情境化,但必须避免可能令人感到侵扰的过度个性化。设计选择应在主动协助与用户舒适度之间取得平衡,目标是行为"有帮助但不令人不安"。
3.5 短期工作记忆
心理学中的工作记忆指的是在较短时间内为支持当前任务而持有和操作信息的能力。对于LLM智能体,短期工作记忆为特定任务目标和即时对话焦点提供了一个临时工作空间。与长期存储不同,这种记忆是短暂的:一旦任务或对话会话结束,内容即可被丢弃。这种区别有助于避免持久记忆层中的混乱,同时确保在复杂交互(如多步骤问题解决)期间的连贯性。在技术上,它可以实现为会话内的草稿本或临时缓冲区,为推理和生成流程提供信息。
(图1:MMAG中记忆类型的分类法,展示人类认知心理学与LLM智能体技术组件之间的映射)
4. 跨记忆类型的协调
虽然每种记忆类型都贡献了独特的能力,但混合记忆系统的真正价值在于这些模块如何交互。在人类认知中,记忆系统很少孤立运作:情节记忆可以调用语义事实,工作记忆依赖从长期存储中检索,而上下文线索则塑造被回忆的内容。类似的原则适用于基于LLM的智能体。协调记忆类型对于确保响应不仅准确和个性化,而且在时间和情境上连贯一致至关重要。
4.1 记忆模块之间的交互
分类法中描述的模块在协同编排而非孤立运行时效果最佳。对话记忆为对话提供即时上下文,但可能需要从长期用户记忆中补充信息,以解析关于过往偏好或事实的指代。情节记忆可以触发提醒或将关联性注入对话,而感知上下文则作为过滤器,塑造语气和时机。短期工作记忆作为整合层,临时保存从其他模块提取的信息,以支持当前任务中的推理。
4.2 优先级排序与冲突解决
一个核心挑战是,当多个来源都相关时,决定哪个记忆信号应占主导。例如,一个对话线程可能建议某种延续方式,而感知上下文(例如地点变化)则指向另一种。在这种情况下,需要优先级排序策略。这些可能包括:
-
时效性启发式:优先考虑最近且上下文最突出的记忆。
-
以用户为中心的加权:当长期用户特征明确影响个性化时,给予其优先权。
-
任务驱动规则:为持续的解决问题而提升工作记忆,以防止分心。
冲突解决还可以涉及在不同记忆约束下生成候选响应,并选择最能平衡个性化、连贯性和实用性的那个。
示例模块化架构
一个实用的协调架构涉及带有检索触发器的模块化记忆管理。每种记忆类型被封装为一个具有定义输入输出接口的服务。一个中央记忆控制器编排这些服务,决定何时查询每个记忆存储以及如何合并检索到的信息。检索可以是主动的(事件驱动,例如呈现即将到来的会议)或反应式的(按需,例如当用户提及过往对话时进行回忆)。优先级策略和冲突解决机制被编码在控制器中,它平衡响应性、用户舒适度和隐私。
这种模块化方法允许在不重新设计整个系统的情况下集成新的记忆类型。例如,添加整合视觉信号的多模态感知记忆只需扩展控制器的协调逻辑。通过这种方式,架构保持了可扩展性、健壮性,并与类人记忆使用的复杂性保持一致。
5. 实现考量
前面概述的记忆分类法提供了一个概念性框架,但实际部署需要具体的实现策略。在我们的系统中,记忆通过一个模块化接口进行管理,该接口分离了存储、检索以及与LLM的集成。我们建议的实现展示了如何在实践中实现对话和长期用户记忆,同时为扩展到情节、感知和工作记忆留出空间。
记忆存储与检索架构
系统定义了一个记忆接口,包含持久化单条消息、存储消息批次以及检索适用于OpenAI模型格式的对话历史的方法。这确保了对话记忆既是仅追加的(新轮次存储在Firestore中),又可按时间顺序检索。为了尊重模型限制,基于令牌的剪枝机制在达到阈值(我们的实现中为90k个令牌)时丢弃多余的上下文,近似于一种工作记忆管理形式。此外,长期用户特征通过一个专用函数作为结构化系统消息注入,该函数从持久存储中检索传记数据和特征,并将其附加到提示上下文中。
可扩展性与性能影响
在Firestore中存储对话历史确保了持久性和跨会话连续性,但随着历史增长也带来了挑战。为了减轻延迟和上下文过载,实现依赖于轻量级过滤:跳过空消息或格式错误的消息,并仅检索对话中最相关的片段供模型使用。这种设计允许系统在不降低用户体验的情况下扩展。同时,模块化接口使得在扩展需求增长时,可以轻松替换为更高级的后端(例如,混合向量+稀疏检索)。
用于记忆引用的提示工程
关键步骤在于将存储的记忆转换为模型可读的输入。实现使用一个转换层,将用户和助手轮次映射为与OpenAI兼容的消息角色。传记记忆作为系统消息预先置入,确保其在生成时被考虑,而不会混乱对话历史。这展示了一个通用设计原则:对话记忆应作为对话轮次注入,而长期知识则最好表示为更高优先级的系统级上下文。这种分离减少了噪音,并允许提示空间按不同记忆类型的比例分配。
隐私、安全与用户控制
长期用户记忆涉及敏感信息,这使得隐私和安全成为基本考量。在我们的实现中,用户传记使用信封加密进行加密,然后在持久化到私有S3存储桶之前进行压缩,以确保机密性和存储效率。个人特征、传记和KPI应在存储时加密,可供用户审计,并可按需删除。除了技术保障,用户信任取决于赋予个人对其数据的有意义的控制权,包括检查已记住内容、编辑不准确信息或请求选择性遗忘的能力。虽然当前实现证明了可行性,但还需要进一步工作来扩展完整的用户控制,并整合更强的隐私保障,如差异化存储策略或联邦个性化。
向完整分类法的可扩展性
尽管当前实现涵盖了对话和长期用户记忆,但同样的架构可以扩展到情节和感知层。事件关联记忆可以作为带时间戳的Firestore条目存储,并安排主动检索。上下文感知记忆可以通过轻量级API调用(例如天气、位置)集成,馈送到系统提示中。由于记忆访问通过记忆接口进行,这些扩展对编排层所需的更改最小,从而强化了模块化作为核心设计选择。
6. 用户研究
6.1 应用案例
为将所提出的架构付诸实践,我们在Heero应用中对它进行了评估。Heero是一个旨在通过个性化对话支持语言学习的对话智能体。Heero为混合记忆增强生成提供了一个理想的测试平台,因为持续的学习交互需要对话连续性和个性化。其后端集成了对话记忆(检索最近的对话轮次)和长期用户记忆(通过加密用户传记编码),使智能体能够调整语气、回忆之前的进展,并在跨会话中维持熟悉感。
例如,对话记忆使Heero能够在同一会话内解析对先前练习或问题的指代,而长期用户记忆使其能够回忆学习者的目标(例如,为旅行做准备或提高职业英语水平)并相应调整对话场景。这创造了感觉更连贯、更具支持性和更人性化的交互,解决了短时效、无上下文聊天机器人的常见痛点。
6.2 评估策略
评估记忆的有用性和可靠性需要结合以用户为中心的技术性措施。
以用户为中心的指标。 我们关注感知有用性、非侵扰性和情感影响。有用性衡量记忆是否改善了交互质量(例如,更好的连贯性、个性化提示)。非侵扰性反映记忆行为是否感觉具有支持性而未越界进入"令人不安"的领域。情感影响衡量用户在记忆激活时是否感到更有动力、更舒适和更投入。在Heero引入基于记忆的对话后,我们观察到四周内用户留存率增加了20%,平均对话时长增加了30%,这表明记忆功能使交互更具吸引力且更持久,同时未降低用户舒适度。
技术指标。 从系统角度看,我们测量检索准确性(是否正确回忆了记忆)、延迟(记忆检索和集成到提示中的时间开销)以及记忆泄漏(信息超出预期范围或错误地浮出的情况)。一个关键观察是,引入额外的记忆层并未增加对话延迟。这是因为某些操作,如生成或更新传记记忆条目,是异步执行并缓存以供复用,从而确保提示构建保持轻量级。自动化评估流程结合手动审计确认,平均响应延迟与集成记忆前保持在同一范围内。
混合评估。 同时观察用户行为和系统性能凸显了记忆设计的权衡。例如,剪枝策略保持低延迟但可能缩短对话连续性,而更深的个性化增加参与度,但必须与用户舒适度相平衡。在Heero中,我们发现维持轻量级剪枝同时丰富长期用户记忆取得了最佳平衡,既传递了教学效果,又不损害学习者期望的支持性和激励性基调。
7. 讨论
为对话智能体配备丰富记忆开辟了新机遇,但也带来了重要风险。记忆使智能体能够超越反应式的单轮响应,转向主动和持续的、感觉更人性化的交互。在Heero案例中,记忆使系统能够回忆用户目标、强化进展并调整语气,这反过来提升了参与度和留存率。这表明,通过维持连续性和随时间调整交互,记忆丰富的智能体可以成为更有效的协作者、导师或助手。
与此同时,这些益处伴随着挑战。一个核心张力在于平衡主动性与用户自主权。当智能体回忆过往事件或习惯时,它可以提供及时的提醒或个性化的提示。然而,如果用户未预料到或上下文被误解,同样的行为也可能令人感到侵扰。找到恰当的平衡需要审慎的设计选择:确保记忆透明,用户对其存储和呈现的内容保持控制,并且主动干预始终被定位为支持性而非指令性的。
若干开放挑战和伦理考量依然存在。从技术角度看,扩展记忆系统而不引入延迟或泄漏是一个持续的关切。在社会层面,必须解决关于信任、自主权和情感依赖的问题,尤其是当系统部署在教育、医疗保健或个人生产力等敏感情境中时。在伦理方面,隐私和公平性问题至关重要:智能体必须避免强化编码在长期记忆中的偏见,必须尊重个性化期望方面的文化差异,并必须为用户提供编辑或删除其数据的能力。
8. 结论与未来工作
本文介绍了混合记忆增强生成(MMAG)模式,这是一个为基于LLM的智能体构建记忆结构的框架。通过区分对话记忆、长期用户记忆、情节与事件关联记忆、感知与上下文感知记忆以及短期工作记忆,我们概述了不同层次如何交互以支持更连贯、个性化和上下文敏感的交互。在Heero对话智能体中的实现表明,即使部分采用此分类法(通过对话历史和加密的长期个人档案),已能提升用户参与度和留存率,证明了该方法的实用价值。
未来工作将集中在沿多个维度扩展MMAG。首先,可以集成多模态记忆,允许智能体将文本上下文与视觉、听觉或传感器数据关联,以获得更丰富的情境化。其次,长期记忆机制应超越静态传记,学习动态捕获用户目标和进展的记忆嵌入。随着具有更大上下文窗口的新LLM发布,可用记忆空间也将扩大,为管理更长和更多样化的记录而不牺牲延迟创造了机会。一个关键方向是给予用户对其自身记忆更大的自主权:允许个人查看、编辑和选择性删除记录的界面对于确保信任和透明度至关重要。
MMAG既提供了一个分类法,也提供了一个实用的设计模式,用于为基于LLM的智能体配备受人类认知启发的记忆能力。虽然早期结果令人鼓舞,但记忆丰富系统的长期成功取决于持续平衡技术性能、个性化和用户自主权。通过对这些挑战的审慎关注,MMAG有潜力引导下一代对话智能体走向不仅更有用,而且更贴近人类的交互。
论文原文
MMAG: Mixed Memory-Augmented Generation for Large Language Models Applications
