AI Agent 正在深入企业核心业务场景------AI Coding、智能客服、电商导购、AI 办学、金融顾问------但大模型天生"失忆",Agent 难以胜任长期、复杂的真实任务。Hologres 长记忆服务解决这一根本性瓶颈:让员工的隐性经验沉淀为可复用的组织记忆资产,让 Agent 跨设备、跨会话持续学习越用越"懂你",同时通过按需检索节省 Token,记忆越多省得越多。在 Snap Research 发布的 LoCoMo 权威评测中,Hologres 以总分 95.23 分位列世界第一,刷新多跳任务(Multi-hop, 96.74%)与时间推理(Temporal Reasoning, 97.45%)两大维度 SOTA,全面超越 Mem0、Zep 等主流长记忆项目------100% Mem0 兼容,全托管云原生 AI Agent 记忆基础设施。
Hologres 长记忆服务四大核心价值一览
-
记忆最准:LoCoMo 世界第一,总分 95.23,Multi-hop / Temporal Reasoning 双项 SOTA
-
成本最省:实测 Token 节省 78.7%~98.7%,记忆条目越多省得越多
-
记忆不断:跨设备、跨会话持续学习,Agent 越用越"懂你"
-
知识可传:员工隐性经验 → 团队共享记忆 → 组织数字资产,人走经验不走
一、Agent 时代,"记忆"为何成为刚需?
大模型正在从"对话工具"进化为"智能体(Agent)"。然而,一个根本性痛点始终困扰着开发者:大模型天生"失忆"。上下文窗口有限、对话轮次一多就遗忘前文、跨会话信息无法延续------这些问题让 Agent 在真实业务场景中难以胜任长期、复杂的任务。
长记忆服务因此成为 AI Agent 基础设施中不可或缺的一环。它不仅解决"记住"的问题,更帮助企业将员工的隐性知识------驱动 Agent 思考方式的决策逻辑、协作经验------转化为可传承、可复用的组织数字资产。其核心价值体现在四个维度:
-
记忆延续:跨设备、跨会话,长期记忆持续学习,Agent 越用越"懂你";你在手机上告诉它的偏好,换到电脑端的 Agent 依然记得,无需重复交代;
-
Token 节省:通过记忆精炼与按需检索,记忆内容不再每轮重复塞进 prompt,用到才取回,从而大幅降低推理成本;
-
知识资产化:把资深员工的判断逻辑、话术经验沉淀下来,从个人记忆走向团队与组织记忆,避免人走经验走;
-
准确可靠:在权威评测中验证记忆的召回精度与推理能力,让"记住"真正可用。
为了客观衡量各家长记忆产品的真实能力,Snap Research 发布了 LoCoMo(Long Conversation Memory) 基准测试------一套面向长对话记忆场景的权威评测标准。为了用客观、可量化的指标验证产品能力,Hologres 长记忆服务参加了由 Snap Research 发布的权威评测基准 LoCoMo,并取得了当前全球最佳成绩。
二、LoCoMo 评测体系:权威、全面、高难度
LoCoMo 由 Snap Research 独立发布,是一套非厂商自测的第三方评测基准,确保结果的公正性与可比性。评测围绕长对话记忆的核心能力,设计了四大任务维度:
| 维度 | 说明 |
|---|---|
| Single-hop(单跳任务) | 从记忆中检索单一事实并直接回答,考验基础召回能力 |
| Multi-hop(多跳任务) | 需要关联多条记忆、进行多步推理才能得出答案,考验记忆关联与推理深度 |
| Temporal Reasoning(时间推理) | 涉及时间顺序、事件先后的推理,考验记忆的时间感知能力 |
| Open Domain(开放域任务) | 结合外部知识与记忆进行开放式问答,考验综合应用能力 |
四大维度从简单到复杂、从单点到综合,全面覆盖长记忆服务的核心能力边界。评测数据集基于真实长对话构建,对话轮次多、信息密度高、干扰项丰富,对记忆系统的提取精度、召回率和推理能力提出了极高要求。
评测详情及数据集开源地址:github.com/snap-resear...
三、Hologres 长记忆服务成绩单:总分 95.23,登顶世界第一,刷新两大核心维度SOTA
Hologres 长记忆服务在 LoCoMo 评测中交出了如下成绩单:
| 评测维度 | 得分 | 排名 |
|---|---|---|
| Multi-hop | 96.74% | 🥇 第一 |
| Temporal Reasoning | 97.45% | 🥇 第一 |
| Single-hop | 95.46% | --- |
| Open Domain | 81.46% | --- |
| Overall(总分) | 95.23% | 🥇 世界第一 |
说明:以上成绩为多轮平均值。
从结果来看,Hologres 不仅拿下总分第一,还在最能体现长期记忆核心能力的关键维度Multi-hop、Temporal Reasoning排名第一,刷新当前 SOTA。
其中:
-
Multi-hop 96.74%:说明其不仅"记得住",还能把不同记忆片段串联起来,支撑复杂推理;
-
Temporal Reasoning 97.45%:说明其在时间序列理解、事件顺序还原和历史变化判断上表现突出;
-
Single-hop 95.46%:说明 Hologres 在记忆召回的准确性上具备极强优势,能够快速、稳定地找到正确记忆。
刷新 Multi-hop、Temporal Reasoning 两大核心维度SOTA,意味着 Hologres 长记忆服务不仅在"记住"层面做到了极致,更在"理解"和"推理"层面展现了领先能力------尤其是在时间推理这一公认最难的维度上,97.45% 的得分体现了对记忆时序关系的精准把握。
相比原生 Mem0,Hologres 在整体成绩上实现了 2.73% 的显著提升。而相较 Zep、MemoryLake 等同类方案,Hologres 也展现出了更均衡、更稳定的能力优势。
四、技术架构解析:成绩背后的硬实力
4.1 整体架构概览
Hologres 长记忆服务采用分层记忆架构,支持短期记忆、长期记忆、语义记忆等多种记忆体系(图记忆正在建设中),满足不同业务场景对记忆粒度、时效性和关联性的差异化需求。
其核心差异化在于:基于 Hologres 实时数仓的云原生架构。区别于纯软件方案将记忆存储在独立向量数据库中,Hologres 将向量检索、全文检索、结构化查询统一在一个引擎内,天然支持多模态混合检索,避免了多系统间的数据同步开销和一致性问题;同时还支持高性能的向量检索、全文检索和混合检索能力,记忆检索的性能和准确率均处于业界领先水平。
4.2 关键技术能力
4.2.1 分层记忆架构:从"能存"到"会用"
Hologres 长记忆服务并不是简单地把对话记录保存下来,而是围绕 Agent 的真实使用过程构建了一套分层记忆体系。目前已支持:
-
短期记忆:服务于当前任务上下文,保证对话和执行的连续性;
-
长期记忆:沉淀用户偏好、历史行为、任务经验,实现跨会话延续;
-
语义记忆:抽取结构化知识和稳定认知,支撑更高效的检索与复用;
-
图记忆:正在建设中,用于增强实体关系建模和复杂推理能力。
这种分层设计的价值在于,不同类型的信息会采用更合适的组织方式、存储策略和召回机制。Agent 不再只是"堆历史记录",而是真正拥有一套可以学习、提炼、检索和推理的记忆系统。多层次协同,让 Agent 的记忆既有"广度"又有"深度"。
4.2.2 云原生底座:不是纯软件拼装,而是实时数仓能力外溢
与很多基于开源组件拼装的纯软件方案不同,Hologres 长记忆服务背后依托的是 Hologres 实时数仓的云原生架构能力。这意味着它从一开始就具备企业级系统所要求的:
-
高并发实时写入
-
海量数据存储与查询
-
弹性扩缩容
-
服务高可用与稳定性保障
长记忆系统的难点,不仅在算法,更在工程。真实业务里,记忆不是"离线导入一批数据"这么简单,而是用户每次对话、每次操作、每次反馈都可能实时产生新记忆。要做到"刚写入就能查""大量并发下依然稳定""规模扩大后性能不掉队",底层架构至关重要。
Hologres 在这一点上的优势非常明显:向量、全文数据均支持实时写入、实时更新,记忆写入即可查询,从而让用户与模型的交互更加连续自然,没有"记忆延迟生效"的割裂感。
4.2.3 100% Mem0 兼容:开箱即用,迁移无门槛
在生态兼容层面,Hologres 长记忆服务实现了 100% 兼容开源 Mem0 框架,支持通过简洁 API 快速接入,同时原生支持 MCP。这意味着,现有采用 Mem0 的开发者和企业用户,可以几乎零成本地迁移到 Hologres 长记忆服务,享受更强的性能和企业级能力,而无需重构上层 Agent 应用。
包括 OpenClaw、Hermes 等主流 Agent 应用,也能够实现无缝迁移和快速接入。这种兼容性,大大降低了长记忆能力落地的门槛。
4.2.4 全托管服务,成本更优
用户无需投入硬件成本,无需关心系统部署、运维和故障处理。通过长记忆系统自动的记忆精炼与结构化存储等技术,可显著降低大模型的 Token 消耗,经内部测试,可减少 75%~98%+ 的 Token 消耗,大幅降低推理成本,让企业以更低成本获得更高质量的记忆服务。
4.2.5 高性能检索:毫秒级响应,支撑复杂记忆调用
长记忆系统最终是否好用,检索体验是核心。Hologres 支持:
-
毫秒级向量检索
-
毫秒级全文检索
-
混合检索能力
-
记忆写入即可查
-
高准确率召回
这使得系统既能够处理语义相似召回,也能够满足关键词精确匹配,还能在复杂任务中通过混合检索提升命中率和回答质量。LoCoMo 中 Multi-hop、Temporal Reasoning、Single-hop 的高分,正与这种高质量记忆召回和组合能力密切相关。
4.2.6 团队记忆共享:从个人记忆走向组织记忆
很多开源长记忆方案更偏向"单 Agent 的个人记忆容器",而企业真正需要的是:记忆可以组织化、共享化、沉淀为团队资产。
Hologres 长记忆服务支持记忆共享能力,可作为多 Agent 协作场景中的统一知识底座。无论是客服 Agent、销售 Agent、运营 Agent,还是内部办公助手,都可以在统一的记忆体系上复用经验与知识,避免重复学习、重复构建。
4.2.7 百亿级扩展能力:支撑企业真实增长
在规模能力上,Hologres 基于云原生分布式架构和弹性能力,支持向量与全文的百亿级规模扩展。这对于企业来说非常关键:早期试点可能只是千级、万级记忆,但一旦进入生产环境,用户数、对话量、知识沉淀速度都可能迅速上升,底层系统必须具备长期承载能力。
相比之下,原生 Mem0 更偏开发友好型框架,在企业生产环境中容易面临记忆丢失、提取有限、召回能力不足、运维复杂等问题;而纯开源方案则往往需要用户自行搭建、调优、扩容和排障,缺乏完整的企业级保障。
Hologres 的价值就在于:既保留了 Mem0 生态兼容和开发体验,又提供了真正面向生产环境的云原生长记忆基础设施能力。
4.3 与开源架构的差异对比
| 对比维度 | 原生 Mem0 / 纯开源方案 | Hologres 长记忆服务 |
|---|---|---|
| 记忆完整性 | 存在记忆丢失、提取有限问题 | 实时写入即可查,无丢失 |
| 召回能力 | 单一向量召回,准确率受限 | 向量 + 全文 + 混合检索,召回率与准确率双优 |
| 运维成本 | 需自行部署、运维、扩容 | 全托管,零运维 |
| 扩展性 | 受限于单机或简单集群架构 | 云原生分布式,百亿级弹性 |
| 企业级保障 | 缺乏 SLA、安全合规能力 | 企业级 SLA、数据安全、合规保障 |
五、不只是"记得准",更是"省得多":Token 消耗实测
高分证明了"记得准",但对企业和开发者而言,还有一个同样关键的问题:用长记忆会不会更费 Token、更贵? 答案恰恰相反------外接 Hologres 长记忆服务,比 Agent 内置记忆显著省 Token,而且记忆越多、省得越多。
5.1 为什么外接长记忆反而更省?
关键差异在于记忆"何时进入 prompt":
-
内置记忆:把全部记忆的目录树(overview)塞进每一轮请求的系统 prompt,无论这一轮是否真的用到记忆,都要重复支付这笔固定开销;
-
Hologres 长记忆:记忆内容不进 prompt,只有真正用到时才按需检索取回。两者的检索开销处于同一量级,差距几乎全部来自内置记忆每轮重复注入的固定成本。
一句话总结:内置记忆是"每轮都把整个书架搬进房间",Hologres 是"需要哪本书才去书架上取"。 记忆条目越多,那个"书架"越大,每轮重复搬运的浪费也越夸张。
5.2 实测数据:节省 78.7%~98.7%
在 Qoder IDE + Hologres OpenMemory MCP 环境下,模拟真实研发场景,覆盖代码仓知识、专业文档知识、琐碎个人信息三类记忆,实测结果如下(按记忆条目数排列,可见节省率单调上升):
| 记忆场景 | 记忆条目数 | 使用内置记忆总成本 | 使用Hologres OpenMemory总成本 | Token 节省率 |
|---|---|---|---|---|
| 代码仓知识 | 27 | 18,210(10 轮) | 3,885(10 轮) | 78.7% |
| 专业文档 | 47 | 35,802(12 轮) | 5,201(12 轮) | 85.5% |
| 代码仓知识 | 435 | 795,920(40 轮) | 14,840(40 轮) | 98.1% |
| 专业文档 | 519 | 941,565(41 轮) | 17,097(41 轮) | 98.2% |
| 琐碎个人记忆 | 1,007 | 525,353(14 轮) | 7,022(14 轮) | 98.7% |
说明:本报告仅评估 Token 成本,不含检索质量维度;两侧工具定义(MCP schema 等)开销对称不计。
六、为什么企业在长记忆场景下更适合选择 Hologres
LoCoMo 榜单第一证明了 Hologres 长记忆的技术实力,而对企业来说,最终更重要的是:它是否真正"可用、可扩、可管、可落地"。
Hologres 长记忆服务具备以下企业级优势:
-
100% Mem0 开源兼容:已有 Mem0 用户可低成本迁移,无需推倒重来;
-
MCP 协议原生支持:可无缝对接主流 Agent 框架和生态;
-
企业级 SLA 保障:具备高可用、数据安全、稳定运维与合规能力;
-
弹性扩缩容:支持从千级到百亿级记忆规模的平滑扩展;
-
阿里云生态集成:可与 DataWorks、PAI、MaxCompute 等产品协同,便于在数据、训练、应用环节形成闭环;
-
成本更友好:全托管服务,无需自购硬件、无需自行运维;并通过记忆精炼等技术降低 Token 消耗;
-
免费公测政策:当前提供免费公测,并支持按量付费模式,覆盖接口调用、存储条数、Token 等多个维度。
典型场景:
-
AI Coding:跨会话持续积累项目上下文记忆,Agent 越用越懂你的代码库,让开发效率成倍提升;
-
电商购物 Agent:深度记住用户偏好与消费禁忌,实现因果级个性化推荐,让每次购物都更懂你所需;
-
**AI 伴学:**持续追踪知识断点与遗忘曲线,精准诊断薄弱环节并动态调整学习路径,让提分更有针对性;
-
金融理财顾问:基于持仓历史与重大生活事件变化,给出个性化风控与资产配置建议,守护每一笔财富。
对于企业而言,这意味着不仅能"跑出高分",更能真正将长记忆能力落到生产环境,服务业务增长。
七、快速上手指南
Step 1: 新建 Hologres 长记忆服务

Step 2:获取 API-KEY 与访问地址

Step 3:Agent 应用接入 Hologres 长记忆服务
如下 Agent 支持通过插件直接接入 Hologres 长记忆服务。接入后,Agent 将自动完成记忆提取、存储、检索等任务。执行如下命令,即可完成多个 Agent 应用的一键接入。
-
OpenClaw
-
Hermes Agent
-
AI Coding 工具:QoderCLI,ClaudeCode,Codex 等,详见手册。
shell
# Mac & Linux 一键安装命令:
curl -fsSL https://hologres-open-memory.oss-cn-hangzhou.aliyuncs.com/hologres-openmemory/install.py | python3 -
八、总结与展望
Hologres 长记忆服务以总分 95.23分 登顶 LoCoMo 排行榜世界第一,刷新 Multi-hop、Temporal Reasoning 两大核心维度SOTA,用客观数据证明了其在长对话记忆领域的技术领先性。
我们的愿景,是让 Hologres 长记忆服务成为 AI Agent 记忆基础设施的首选------让每一个 Agent 都拥有可靠、高效、可传承的"长期记忆"。
接下来,我们将持续演进:支持更多评测基准验证、拓展图记忆等新型记忆体系、深化与主流 Agent 生态的集成,为开发者和企业提供更强大的记忆底座。
立即体验 Hologres 长记忆服务,免费公测进行中。