Hologres 长记忆服务 LoCoMo 评测登顶世界第一,刷新多项 SOTA

AI Agent 正在深入企业核心业务场景------AI Coding、智能客服、电商导购、AI 办学、金融顾问------但大模型天生"失忆",Agent 难以胜任长期、复杂的真实任务。Hologres 长记忆服务解决这一根本性瓶颈:让员工的隐性经验沉淀为可复用的组织记忆资产,让 Agent 跨设备、跨会话持续学习越用越"懂你",同时通过按需检索节省 Token,记忆越多省得越多。在 Snap Research 发布的 LoCoMo 权威评测中,Hologres 以总分 95.23 分位列世界第一,刷新多跳任务(Multi-hop, 96.74%)与时间推理(Temporal Reasoning, 97.45%)两大维度 SOTA,全面超越 Mem0、Zep 等主流长记忆项目------100% Mem0 兼容,全托管云原生 AI Agent 记忆基础设施。

Hologres 长记忆服务四大核心价值一览

  • 记忆最准:LoCoMo 世界第一,总分 95.23,Multi-hop / Temporal Reasoning 双项 SOTA

  • 成本最省:实测 Token 节省 78.7%~98.7%,记忆条目越多省得越多

  • 记忆不断:跨设备、跨会话持续学习,Agent 越用越"懂你"

  • 知识可传:员工隐性经验 → 团队共享记忆 → 组织数字资产,人走经验不走

一、Agent 时代,"记忆"为何成为刚需?

大模型正在从"对话工具"进化为"智能体(Agent)"。然而,一个根本性痛点始终困扰着开发者:大模型天生"失忆"。上下文窗口有限、对话轮次一多就遗忘前文、跨会话信息无法延续------这些问题让 Agent 在真实业务场景中难以胜任长期、复杂的任务。

长记忆服务因此成为 AI Agent 基础设施中不可或缺的一环。它不仅解决"记住"的问题,更帮助企业将员工的隐性知识------驱动 Agent 思考方式的决策逻辑、协作经验------转化为可传承、可复用的组织数字资产。其核心价值体现在四个维度:

  • 记忆延续:跨设备、跨会话,长期记忆持续学习,Agent 越用越"懂你";你在手机上告诉它的偏好,换到电脑端的 Agent 依然记得,无需重复交代;

  • Token 节省:通过记忆精炼与按需检索,记忆内容不再每轮重复塞进 prompt,用到才取回,从而大幅降低推理成本;

  • 知识资产化:把资深员工的判断逻辑、话术经验沉淀下来,从个人记忆走向团队与组织记忆,避免人走经验走;

  • 准确可靠:在权威评测中验证记忆的召回精度与推理能力,让"记住"真正可用。

为了客观衡量各家长记忆产品的真实能力,Snap Research 发布了 LoCoMo(Long Conversation Memory) 基准测试------一套面向长对话记忆场景的权威评测标准。为了用客观、可量化的指标验证产品能力,Hologres 长记忆服务参加了由 Snap Research 发布的权威评测基准 LoCoMo,并取得了当前全球最佳成绩。

二、LoCoMo 评测体系:权威、全面、高难度

LoCoMo 由 Snap Research 独立发布,是一套非厂商自测的第三方评测基准,确保结果的公正性与可比性。评测围绕长对话记忆的核心能力,设计了四大任务维度:

维度 说明
Single-hop(单跳任务) 从记忆中检索单一事实并直接回答,考验基础召回能力
Multi-hop(多跳任务) 需要关联多条记忆、进行多步推理才能得出答案,考验记忆关联与推理深度
Temporal Reasoning(时间推理) 涉及时间顺序、事件先后的推理,考验记忆的时间感知能力
Open Domain(开放域任务) 结合外部知识与记忆进行开放式问答,考验综合应用能力

四大维度从简单到复杂、从单点到综合,全面覆盖长记忆服务的核心能力边界。评测数据集基于真实长对话构建,对话轮次多、信息密度高、干扰项丰富,对记忆系统的提取精度、召回率和推理能力提出了极高要求。

评测详情及数据集开源地址:github.com/snap-resear...

三、Hologres 长记忆服务成绩单:总分 95.23,登顶世界第一,刷新两大核心维度SOTA

Hologres 长记忆服务在 LoCoMo 评测中交出了如下成绩单:

评测维度 得分 排名
Multi-hop 96.74% 🥇 第一
Temporal Reasoning 97.45% 🥇 第一
Single-hop 95.46% ---
Open Domain 81.46% ---
Overall(总分) 95.23% 🥇 世界第一

说明:以上成绩为多轮平均值。

从结果来看,Hologres 不仅拿下总分第一,还在最能体现长期记忆核心能力的关键维度Multi-hop、Temporal Reasoning排名第一,刷新当前 SOTA。

其中:

  • Multi-hop 96.74%:说明其不仅"记得住",还能把不同记忆片段串联起来,支撑复杂推理;

  • Temporal Reasoning 97.45%:说明其在时间序列理解、事件顺序还原和历史变化判断上表现突出;

  • Single-hop 95.46%:说明 Hologres 在记忆召回的准确性上具备极强优势,能够快速、稳定地找到正确记忆。

刷新 Multi-hop、Temporal Reasoning 两大核心维度SOTA,意味着 Hologres 长记忆服务不仅在"记住"层面做到了极致,更在"理解"和"推理"层面展现了领先能力------尤其是在时间推理这一公认最难的维度上,97.45% 的得分体现了对记忆时序关系的精准把握。

相比原生 Mem0,Hologres 在整体成绩上实现了 2.73% 的显著提升。而相较 Zep、MemoryLake 等同类方案,Hologres 也展现出了更均衡、更稳定的能力优势。

四、技术架构解析:成绩背后的硬实力

4.1 整体架构概览

Hologres 长记忆服务采用分层记忆架构,支持短期记忆、长期记忆、语义记忆等多种记忆体系(图记忆正在建设中),满足不同业务场景对记忆粒度、时效性和关联性的差异化需求。

其核心差异化在于:基于 Hologres 实时数仓的云原生架构。区别于纯软件方案将记忆存储在独立向量数据库中,Hologres 将向量检索、全文检索、结构化查询统一在一个引擎内,天然支持多模态混合检索,避免了多系统间的数据同步开销和一致性问题;同时还支持高性能的向量检索、全文检索和混合检索能力,记忆检索的性能和准确率均处于业界领先水平。

4.2 关键技术能力

4.2.1 分层记忆架构:从"能存"到"会用"

Hologres 长记忆服务并不是简单地把对话记录保存下来,而是围绕 Agent 的真实使用过程构建了一套分层记忆体系。目前已支持:

  • 短期记忆:服务于当前任务上下文,保证对话和执行的连续性;

  • 长期记忆:沉淀用户偏好、历史行为、任务经验,实现跨会话延续;

  • 语义记忆:抽取结构化知识和稳定认知,支撑更高效的检索与复用;

  • 图记忆:正在建设中,用于增强实体关系建模和复杂推理能力。

这种分层设计的价值在于,不同类型的信息会采用更合适的组织方式、存储策略和召回机制。Agent 不再只是"堆历史记录",而是真正拥有一套可以学习、提炼、检索和推理的记忆系统。多层次协同,让 Agent 的记忆既有"广度"又有"深度"。

4.2.2 云原生底座:不是纯软件拼装,而是实时数仓能力外溢

与很多基于开源组件拼装的纯软件方案不同,Hologres 长记忆服务背后依托的是 Hologres 实时数仓的云原生架构能力。这意味着它从一开始就具备企业级系统所要求的:

  • 高并发实时写入

  • 海量数据存储与查询

  • 弹性扩缩容

  • 服务高可用与稳定性保障

长记忆系统的难点,不仅在算法,更在工程。真实业务里,记忆不是"离线导入一批数据"这么简单,而是用户每次对话、每次操作、每次反馈都可能实时产生新记忆。要做到"刚写入就能查""大量并发下依然稳定""规模扩大后性能不掉队",底层架构至关重要。

Hologres 在这一点上的优势非常明显:向量、全文数据均支持实时写入、实时更新,记忆写入即可查询,从而让用户与模型的交互更加连续自然,没有"记忆延迟生效"的割裂感。

4.2.3 100% Mem0 兼容:开箱即用,迁移无门槛

在生态兼容层面,Hologres 长记忆服务实现了 100% 兼容开源 Mem0 框架,支持通过简洁 API 快速接入,同时原生支持 MCP。这意味着,现有采用 Mem0 的开发者和企业用户,可以几乎零成本地迁移到 Hologres 长记忆服务,享受更强的性能和企业级能力,而无需重构上层 Agent 应用。

包括 OpenClaw、Hermes 等主流 Agent 应用,也能够实现无缝迁移和快速接入。这种兼容性,大大降低了长记忆能力落地的门槛。

4.2.4 全托管服务,成本更优

用户无需投入硬件成本,无需关心系统部署、运维和故障处理。通过长记忆系统自动的记忆精炼与结构化存储等技术,可显著降低大模型的 Token 消耗,经内部测试,可减少 75%~98%+ 的 Token 消耗,大幅降低推理成本,让企业以更低成本获得更高质量的记忆服务。

4.2.5 高性能检索:毫秒级响应,支撑复杂记忆调用

长记忆系统最终是否好用,检索体验是核心。Hologres 支持:

  • 毫秒级向量检索

  • 毫秒级全文检索

  • 混合检索能力

  • 记忆写入即可查

  • 高准确率召回

这使得系统既能够处理语义相似召回,也能够满足关键词精确匹配,还能在复杂任务中通过混合检索提升命中率和回答质量。LoCoMo 中 Multi-hop、Temporal Reasoning、Single-hop 的高分,正与这种高质量记忆召回和组合能力密切相关。

4.2.6 团队记忆共享:从个人记忆走向组织记忆

很多开源长记忆方案更偏向"单 Agent 的个人记忆容器",而企业真正需要的是:记忆可以组织化、共享化、沉淀为团队资产。

Hologres 长记忆服务支持记忆共享能力,可作为多 Agent 协作场景中的统一知识底座。无论是客服 Agent、销售 Agent、运营 Agent,还是内部办公助手,都可以在统一的记忆体系上复用经验与知识,避免重复学习、重复构建。

4.2.7 百亿级扩展能力:支撑企业真实增长

在规模能力上,Hologres 基于云原生分布式架构和弹性能力,支持向量与全文的百亿级规模扩展。这对于企业来说非常关键:早期试点可能只是千级、万级记忆,但一旦进入生产环境,用户数、对话量、知识沉淀速度都可能迅速上升,底层系统必须具备长期承载能力。

相比之下,原生 Mem0 更偏开发友好型框架,在企业生产环境中容易面临记忆丢失、提取有限、召回能力不足、运维复杂等问题;而纯开源方案则往往需要用户自行搭建、调优、扩容和排障,缺乏完整的企业级保障。

Hologres 的价值就在于:既保留了 Mem0 生态兼容和开发体验,又提供了真正面向生产环境的云原生长记忆基础设施能力。

4.3 与开源架构的差异对比

对比维度 原生 Mem0 / 纯开源方案 Hologres 长记忆服务
记忆完整性 存在记忆丢失、提取有限问题 实时写入即可查,无丢失
召回能力 单一向量召回,准确率受限 向量 + 全文 + 混合检索,召回率与准确率双优
运维成本 需自行部署、运维、扩容 全托管,零运维
扩展性 受限于单机或简单集群架构 云原生分布式,百亿级弹性
企业级保障 缺乏 SLA、安全合规能力 企业级 SLA、数据安全、合规保障

五、不只是"记得准",更是"省得多":Token 消耗实测

高分证明了"记得准",但对企业和开发者而言,还有一个同样关键的问题:用长记忆会不会更费 Token、更贵? 答案恰恰相反------外接 Hologres 长记忆服务,比 Agent 内置记忆显著省 Token,而且记忆越多、省得越多。

5.1 为什么外接长记忆反而更省?

关键差异在于记忆"何时进入 prompt":

  • 内置记忆:把全部记忆的目录树(overview)塞进每一轮请求的系统 prompt,无论这一轮是否真的用到记忆,都要重复支付这笔固定开销;

  • Hologres 长记忆:记忆内容不进 prompt,只有真正用到时才按需检索取回。两者的检索开销处于同一量级,差距几乎全部来自内置记忆每轮重复注入的固定成本。

一句话总结:内置记忆是"每轮都把整个书架搬进房间",Hologres 是"需要哪本书才去书架上取"。 记忆条目越多,那个"书架"越大,每轮重复搬运的浪费也越夸张。

5.2 实测数据:节省 78.7%~98.7%

在 Qoder IDE + Hologres OpenMemory MCP 环境下,模拟真实研发场景,覆盖代码仓知识、专业文档知识、琐碎个人信息三类记忆,实测结果如下(按记忆条目数排列,可见节省率单调上升):

记忆场景 记忆条目数 使用内置记忆总成本 使用Hologres OpenMemory总成本 Token 节省率
代码仓知识 27 18,210(10 轮) 3,885(10 轮) 78.7%
专业文档 47 35,802(12 轮) 5,201(12 轮) 85.5%
代码仓知识 435 795,920(40 轮) 14,840(40 轮) 98.1%
专业文档 519 941,565(41 轮) 17,097(41 轮) 98.2%
琐碎个人记忆 1,007 525,353(14 轮) 7,022(14 轮) 98.7%

说明:本报告仅评估 Token 成本,不含检索质量维度;两侧工具定义(MCP schema 等)开销对称不计。

六、为什么企业在长记忆场景下更适合选择 Hologres

LoCoMo 榜单第一证明了 Hologres 长记忆的技术实力,而对企业来说,最终更重要的是:它是否真正"可用、可扩、可管、可落地"。

Hologres 长记忆服务具备以下企业级优势:

  • 100% Mem0 开源兼容:已有 Mem0 用户可低成本迁移,无需推倒重来;

  • MCP 协议原生支持:可无缝对接主流 Agent 框架和生态;

  • 企业级 SLA 保障:具备高可用、数据安全、稳定运维与合规能力;

  • 弹性扩缩容:支持从千级到百亿级记忆规模的平滑扩展;

  • 阿里云生态集成:可与 DataWorks、PAI、MaxCompute 等产品协同,便于在数据、训练、应用环节形成闭环;

  • 成本更友好:全托管服务,无需自购硬件、无需自行运维;并通过记忆精炼等技术降低 Token 消耗;

  • 免费公测政策:当前提供免费公测,并支持按量付费模式,覆盖接口调用、存储条数、Token 等多个维度。

典型场景:

  • AI Coding:跨会话持续积累项目上下文记忆,Agent 越用越懂你的代码库,让开发效率成倍提升;

  • 电商购物 Agent:深度记住用户偏好与消费禁忌,实现因果级个性化推荐,让每次购物都更懂你所需;

  • **AI 伴学:**持续追踪知识断点与遗忘曲线,精准诊断薄弱环节并动态调整学习路径,让提分更有针对性;

  • 金融理财顾问:基于持仓历史与重大生活事件变化,给出个性化风控与资产配置建议,守护每一笔财富。

对于企业而言,这意味着不仅能"跑出高分",更能真正将长记忆能力落到生产环境,服务业务增长。

七、快速上手指南

Step 1: 新建 Hologres 长记忆服务

Step 2:获取 API-KEY 与访问地址

Step 3:Agent 应用接入 Hologres 长记忆服务

如下 Agent 支持通过插件直接接入 Hologres 长记忆服务。接入后,Agent 将自动完成记忆提取、存储、检索等任务。执行如下命令,即可完成多个 Agent 应用的一键接入。

  • OpenClaw

  • Hermes Agent

  • AI Coding 工具:QoderCLI,ClaudeCode,Codex 等,详见手册

shell 复制代码
# Mac & Linux 一键安装命令:
curl -fsSL https://hologres-open-memory.oss-cn-hangzhou.aliyuncs.com/hologres-openmemory/install.py | python3 -

八、总结与展望

Hologres 长记忆服务以总分 95.23分 登顶 LoCoMo 排行榜世界第一,刷新 Multi-hop、Temporal Reasoning 两大核心维度SOTA,用客观数据证明了其在长对话记忆领域的技术领先性。

我们的愿景,是让 Hologres 长记忆服务成为 AI Agent 记忆基础设施的首选------让每一个 Agent 都拥有可靠、高效、可传承的"长期记忆"。

接下来,我们将持续演进:支持更多评测基准验证、拓展图记忆等新型记忆体系、深化与主流 Agent 生态的集成,为开发者和企业提供更强大的记忆底座。

立即体验 Hologres 长记忆服务,免费公测进行中。

相关推荐
achong1 小时前
PenguinHarness实测:LlamaFactory作者新作,0.2元造自进化Agent
人工智能·深度学习
AlloyTeamZy1 小时前
我发现,一个人做小游戏最难的,根本不是写代码
前端·人工智能·程序员
Hotchip_MEMS1 小时前
当雾化器遇上MEMS:一场从交互到制造的全链路效率提升
人工智能·笔记·物联网·电脑·制造
水如烟2 小时前
孤能子视角:LLM是续指代投器——从“续指论”与“代投机制”看大语言模型的本质定位
人工智能
BerryS3N2 小时前
2026年AI前沿技术全景深度解析:大模型推理范式变革、Agentic AI工程架构与底层基础设施演进
人工智能·架构
天天爱吃肉82182 小时前
【重磅发布:拿下新超仁达代理权 】
大数据·人工智能·python·功能测试·汽车
HIT_Weston2 小时前
167、【Agent】【OpenCode】TuiThreadCmd(EvenSource)
人工智能·agent·opencode
TunerT_TQ2 小时前
Valhalla 静态工程审阅 #022|百度PaddlePaddle 源码证据驱动评测【大厂开源基础设施特辑】
人工智能·百度·开源·paddlepaddle·#深度学习·#飞桨
spter。2 小时前
AI 面试相同请求为什么会重复调用,如何解决
人工智能·面试·职场和发展