【ICLR 2026 2026】MemoryVLA 论文解读|从认知科学与机器人记忆机制视角

摘要

本文解读 ICLR 2026 论文《MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation》。该论文提出MemoryVLA ,一个认知科学启发的认知-记忆-动作框架 ,通过融合工作记忆(短期)感知-认知记忆库(长期,类海马体)扩散动作专家 ,为视觉-语言-动作(VLA)模型显式建模非马尔可夫的长时序依赖,其特别之处在于用"检索 + 门控融合 + 紧凑整合"三大机制同时保留细粒度感知细节与高层认知语义,而非简单拼接历史帧。实验表明MemoryVLA 在 150+ 任务、3 类机器人上全面超越 SOTA:SimplerEnv-Bridge 达 71.9%(+14.6 超 CogACT)、LIBERO 五套件 96.5%、真实世界长时序任务 83%(+26 分 vs CogACT 57%),而推理延迟仅增加 3.6%,为机器人操作领域的时序记忆建模提供了重要借鉴。

论文基本信息

项目 内容
标题(英文) MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
标题(中文) MemoryVLA:面向机器人操作的视觉-语言-动作模型感知-认知记忆
作者 Hao Shi, Bin Xie, Yingfei Liu, Lin Sun, Fengrong Liu, Tiancai Wang, Erjin Zhou, Haoqiang Fan, Xiangyu Zhang, Gao Huang
机构 清华大学 · Dexmal(原力灵机)· 旷视科技 · 天津大学 · 哈工大 · StepFun
会议 ICLR 2026 2026
arXiv https://arxiv.org/abs/2508.19236
项目网站 https://github.com/shihao1895/MemoryVLA

背景与动机

为什么 VLA 需要记忆?

机器人操控任务本质上是非马尔可夫 的:以 Push Buttons 任务为例,按下按钮前后画面几乎无差异,仅看当前帧根本无法判断动作是否已完成。然而 OpenVLA、\\pi_0、CogACT 等主流 VLA 模型只使用当前观测,完全忽略时序依赖,导致早期动作对后续决策的影响被系统性丢弃。

朴素方案------直接把历史帧拼进输入------也有两个致命伤:一是自注意力的二次复杂度 严重限制了可用时序上下文长度;二是顺序帧输入与模型单帧机器人预训练分布错配,训练不稳定。

认知科学启示:双重记忆系统

人类之所以能完成长时序操作,靠的是工作记忆 (神经活动缓存短期表征)与情景记忆(海马体存储逐字细节与语义要点)的协同。MemoryVLA 把这一双重记忆系统搬进 VLA:工作记忆承载当前时刻的感知与认知表征,感知-认知记忆库(PCMB)则像海马体一样长期保存"细节 + 语义"两条历史流。

相关工作与已有尝试的局限

VLA 模型(均无显式时序建模)可归为两条路线:RT-2 / OpenVLA 将动作离散化为 token 自回归生成;\\pi_0 / CogACT / DexVLA / HybridVLA 用扩散动作头采样连续轨迹。机器人时序建模的已有尝试包括:RoboFlamingo 用 LSTM 传递潜变量,但感知历史过于粗糙;TraceVLA 把轨迹画在当前帧、UniVLA 把历史动作拼进 prompt(仅类 CoT)、CronusVLA 做滑窗多帧聚合;Octo / RoboVLMs / Interleave-VLA 做交错图文视频建模,但实现复杂、计算昂贵。关键差异在于:其它方法只保留单一粒度的历史,而 MemoryVLA 在统一记忆框架里同时建模高层认知语义与细粒度感知细节。

历史视角:VLA 时序建模的演化脉络

从 2023 年到 2026 年,VLA 时序建模经历了清晰的三阶段演进:2023 年 RT-2 / RoboFlamingo 确立单帧 VLA 范式,RoboFlamingo 首次以 LSTM 潜变量尝试时序建模(但粒度粗糙);2024--2025 年 TraceVLA / UniVLA / CronusVLA / 4D-VLA 通过轨迹叠加、历史动作 prompt、滑窗多帧等方式补时序;2026 年 MemoryVLA(ICLR 2026)用工作记忆 + 感知-认知记忆库完整建模"细节 + 语义",其扩展版 MemoryVLA++(arXiv:2606.09827)进一步加入世界模型想象未来。这一脉络印证了从反应式时序感知的技术迁移,也让 MemoryVLA 的"轻量时序能力"(延迟仅 +3.6%)比昂贵的视频交错输入务实得多。

为什么这项工作能成为 Oral:负载假设的审计

从创新模式看,MemoryVLA 命中了三条高 Oral 率路径:其一,审计并扭转负载假设 ------审计 VLA 隐含的"当前观测足够(马尔可夫)"假设,用 Push Buttons 的视觉不变性证明其不成立,再以显式记忆扭转之(真实长时序 +26 分、双流消融 +7.3/+8.4);其二,替换核心算子 ------把"单帧输入"替换为"记忆增强的时序表示",跨注意力检索 + 时间戳位置编码 + 门控融合(时间戳 PE +2.1、门控 vs 相加 +4.2、Token 合并 vs FIFO +5.2,均以消融隔离);其三,受控诊断------每次只隔离一个变量,覆盖记忆类型 / 长度 / 检索 / 融合 / 整合 / 认知 token 数,并在 LIBERO-Long-90、Clean Table & Count 双基准验证。"选对模式"与"做到极致"兼备,是其在 ICLR 2026 获得 Oral 的关键因素。

研究主线:从问题到结论

图 7:MemoryVLA 研究主线(Mermaid 流程图)------非马尔可夫操控问题 → 认知科学双重记忆启示 → 工作记忆 + 感知-认知记忆库设计 → 检索/门控融合/整合三机制 → 全基准 SOTA,长时序 +26 分

基准/方法设计

MemoryVLA 是一个认知-记忆-动作 框架,核心设计有三块:Vision-Language Cognition Module(视觉-语言认知模块) ------7B Prismatic VLM(OXE 预训练)以 DINOv2 + SigLIP 并行视觉骨干提取特征,经 SE-bottleneck 压缩出 256 个感知 token 构成工作记忆,LLaMA-7B 的 EOS 输出作为 1 个认知 token 承载高层语义;Perceptual-Cognitive Memory Bank(PCMB,感知-认知记忆库) ------类海马体长期存储,感知流存细粒度细节、认知流存语义摘要,各 L 条;Memory-Conditioned Action Expert(记忆条件动作专家)------DiT + DDIM(10 步去噪),以记忆增强 token 为条件生成 T=16 步 7-DoF 动作序列。

图 1:(a) Push Buttons 前后视觉不变,需时序建模;(b) 人类双重记忆系统;(c) MemoryVLA 的感知-认知记忆库;(d) 全面超越 SOTA 基线

分类全景

图 8:VLA 时序建模方案分类全景(Mermaid 结构树)------五类方案中仅 MemoryVLA 同时建模细粒度感知细节与高层认知语义

方法细节

系统总览

图 2:MemoryVLA 总体架构:VLM 编码出感知/认知 token 形成工作记忆,查询 PCMB 检索历史、门控融合并整合,扩散 Transformer 预测未来动作序列

记忆三大机制

  • Memory Retrieval(检索) :工作记忆 token 作为双查询,对带时间戳正弦位置编码的记忆条目做 2 层跨注意力------把"什么时候发生"也编入相似度,检索不只认内容、还认时序。
  • Gate Fusion(门控融合)g\^x=\\sigma(\\mathrm{MLP}(\[x,H\^x\]))\\tilde x = g\^x\\odot H\^x + (1-g\^x)\\odot x------自适应决定历史与当前的混合比例,由网络按需"回忆"。
  • Consolidation(整合) :容量超限时,按余弦相似度合并最相邻的一对条目------压缩冗余、保住要点,防止记忆无限膨胀。

图 3:记忆模块细节:(a) 带时间戳位置编码的跨注意力检索;(b) 门控融合当前与历史表示;(c) 超容量时合并最相似相邻条目

记忆不是"拼接更多帧",而是按需检索 + 自适应融合 + 紧凑整合------在几乎不增加算力的前提下引入时序依赖。这也解释了为何记忆模块开销极小:认知条目仅 1 token、感知压缩至 256 通道、整合持续合并冗余,检索与跨注意力代价被压到最小。

训练与实现细节

训练采用 8×A100 + FSDP,全局 batch 256,学习率 2\\times10\^{-5};输入仅单张第三视角 224\\times224 RGB(无腕部相机/本体感知)。数据流上,单片段内保持时序顺序的流式 dataloader,LIBERO 分组采样 16 帧/组,与记忆长度 16 对齐;数据增强为随机裁剪 90% + 亮度/对比度/饱和度/色调扰动,评测时关闭。SimplerEnv 评测采用 CogACT 自适应动作集成(\\alpha=0.1),LIBERO / Mikasa 无集成。代码、模型、日志全部开源(github.com/shihao1895/MemoryVLA),项目页含机器人视频。

实验设计与结果

评测协议

实验覆盖 3 机器人 × 6 基准 × 150+ 任务。仿真侧:SimplerEnv(Bridge:WidowX 4 任务;Fractal:Google 机器人 4 任务 × VM/VA 双协议)、LIBERO(Franka 五套件 130 任务)、Mikasa-Robo(Franka 5 个记忆依赖任务);真实世界侧:12 个任务------6 通用(Insert Circle、Egg in Pan/Oven、Stack Cups/Blocks、Pick Diverse Fruits)+ 6 长时序(Seq. Push Buttons、Change Food、Guess Where、Clean Table & Count、Pick Place Order、Clean Restaurant Table)。基线包括 OpenVLA、\\pi_0、CogACT、SpatialVLA、TraceVLA、CronusVLA;每任务 24--100 次试验取成功率。

图 4:实验设置全景:上排四个仿真基准,下排真实世界通用与长时序任务、鲁棒性评测

四大基准与真实世界结果

基准 OpenVLA π0 CogACT MemoryVLA 增益
SimplerEnv-Bridge 4.2 68.4* 57.3 71.9 +14.6
SimplerEnv-Fractal 36.8 -- 68.1 72.7 +4.6
LIBERO(五套件) 75.9 94.2* 93.2 96.5 +3.3
Mikasa-Robo 28.4 29.4 -- 41.2 +11.8
真实:通用任务 31 72 76 85 +9
真实:长时序 9 52 57 83 +26

全基准碾压 SOTA,长时序差距最大(+26 vs CogACT)------记忆机制在"需要回忆"的任务上价值最显著。

消融分析:三大机制各自有效

  • 双流记忆缺一不可 :仅认知 63.5 / 仅感知 64.6 → 双流 71.9(+7.3/+8.4)。
  • 记忆长度 16 最优:4 与 64 均回落到 67.7------太短记不住、太长引入噪声。
  • 时间戳 PE:69.8 → 71.9------检索必须感知"什么时候发生"。
  • 门控融合 > 简单相加 (71.9 vs 67.7);Token 合并 > FIFO(71.9 vs 66.7)。

检索 / 融合 / 整合三个机制各自贡献 2--5 分且互不冗余------记忆系统设计是"系统解"而非单个技巧。

长时序任务的记忆依赖设计

附录中的任务设计进一步说明"为什么这些任务必须靠记忆":Seq. Push Buttons 需按颜色顺序按三个按钮,每一步都要回忆"按到哪了";Guess Where 先盖住方块再揭开,可逆动作要求持续跟踪物体位置;Clean Table & Count 每清走一物按一次计数器,显式进度监控、错按即扣分;Pick Place Order 必须按胡萝卜→香蕉→橙子顺序取放,顺序违规立即终止。这些任务从单帧无法判定下一步------正是 MemoryVLA 相对基线的最大增益来源(+26 分)。

真实世界 OOD 鲁棒性

  • Pick Place Order :base 100%------未见背景 100、干扰物 92、光照 96、容器 100、遮挡 96;未见物体 89% 为最低。
  • Clean Restaurant Table:base 96%------各 OOD 变体 86--96%,保持高鲁棒。

背景 / 干扰物 / 光照 / 容器 / 遮挡的分布偏移几乎不掉点;未见物体类型是真实世界泛化的主要余量。

图 5:真实世界 OOD 评测:两代表任务在未见背景/干扰物/光照/物体/容器/遮挡下的变体示例与量化结果

记忆检索案例研究

注意力可视化证明记忆检索确实在解决决策歧义 ,而非机械地缓存帧:Change Food(真实) 中,当前帧出现两个食物、仅凭单帧无法判定该拿哪个,模型强烈关注最近的运动趋势帧 与歧义出现前的关键决策帧Shell Game Touch(仿真) 中,杯子盖上后才露馅,模型持续关注最初揭示方块位置的那几帧------这是唯一可靠线索。

图 6:记忆检索注意力可视化:真实 Change Food(上)与仿真 Shell Game Touch(下),模型始终关注能消除当前观测歧义的历史帧

零样本任务泛化与仿真 OOD

  • 零样本任务泛化:Apple To Basket 训练 → Eggplant To Basket / Blush To Basket / Apple To Plate 未见任务仍高分。
  • 仿真 OOD :干扰物 / 背景 / 光照 / 纹理偏移下基本不掉点;未见相机视角大幅回落(92.0→42.0)------仿真到部署的视角鸿沟是主要短板。

推理效率

RTX 4090 上延迟 0.194s、吞吐 82.5Hz,相对基线仅 +3.6% 开销;显存 16.6GB(+0.8GB)。记忆模块轻量但有效------时间建模不必用昂贵的视频交错输入换。

结果对比总结

结果对比总结

图 9:MemoryVLA 结果对比总结(Mermaid 流程图)------真实长时序 83% vs CogACT 57%(+26 分),四基准全部 SOTA,记忆开销仅 +3.6% 延迟

关键发现

  • 全基准碾压 SOTA:SimplerEnv-Bridge 71.9%(+14.6 vs CogACT)、Fractal 72.7(+4.6)、LIBERO 五套件 96.5(+3.3)、Mikasa-Robo 41.2(+11.8)。
  • 真实世界长时序增益最大 :83% vs CogACT 57%,+26 分;通用任务也 +9 分(85 vs 76)。
  • 双流记忆缺一不可:仅认知 63.5 / 仅感知 64.6 → 双流 71.9,各 +7.3/+8.4。
  • 每个机制都有独立消融证据:时间戳 PE +2.1(69.8→71.9)、门控 vs 相加 +4.2、Token 合并 vs FIFO +5.2、记忆长度 16 最优(4/64 回落到 67.7)。
  • 记忆开销近乎免费:延迟 0.194s 仅 +3.6%、吞吐 82.5Hz、显存 +0.8GB------时序能力不必用视频交错输入换。
  • 泛化短板明确:任务级零样本泛化成立,但未见相机视角 92.0→42.0、未见物体 89% 是最低项------分布偏移大时记忆也救不了。

局限性

  • 严重 OOD 仍脆弱:Pick Coke Can 在未见相机视角下 92.0%→42.0%------分布偏移大时记忆也救不了,仿真到部署的视角鸿沟是主要短板。
  • 记忆长度靠人工设定:通用任务 16、长时序 256------没有自适应扩展机制。
  • 认知 token 单点瓶颈:1 个 4096 维 EOS token 承载全部语义;增至 4 个无增益。

作者展望两条演进路径:记忆反思 ------把长期记忆对齐到 LLM 输入空间,支持嵌入空间的思维链;终身记忆------生物启发的整合把常用经验蒸馏为永久表征,跨场景 / 任务 / 本体泛化。

常见问题(FAQ)

MemoryVLA 是什么?

MemoryVLA 是为视觉-语言-动作(VLA)模型引入显式时序记忆的框架:以工作记忆承载当前感知/认知表征,以感知-认知记忆库(PCMB,类海马体)长期保存"细节 + 语义"两条历史流,再用记忆条件扩散专家生成动作,在 150+ 任务上全面超越 SOTA。

感知-认知记忆库(PCMB)与工作记忆有什么区别?

工作记忆是当前时刻 VLM 编码出的 256 个感知 token + 1 个认知 token,属于短期缓存;PCMB 是长期存储:感知流存细粒度视觉细节、认知流存语义摘要,各 L 条,通过检索、门控融合、整合三个机制与工作记忆交互。

记忆机制为什么几乎不增加推理开销?

因为记忆模块被设计得极轻:认知条目仅 1 token、感知压缩至 256 通道、整合持续合并冗余条目,检索只做 2 层跨注意力。实测 RTX 4090 上延迟仅 0.194s(+3.6%)、显存 +0.8GB。

记忆长度怎么选?

消融显示记忆长度 16 最优:4 与 64 都回落到 67.7(vs 16 的 71.9)------太短记不住、太长引入噪声。论文在通用任务用 16、长时序任务用 256,但长度目前仍需人工设定。

MemoryVLA 在哪些任务上增益最大?

在需要"回忆"的非马尔可夫任务上增益最大:真实世界长时序任务 +26 分(83% vs CogACT 57%),如 Seq. Push Buttons、Guess Where、Clean Table & Count 等单帧无法判定下一步的任务。

代码和模型开源吗?

开源。代码、模型、日志全部在 github.com/shihao1895/MemoryVLA,项目页含真实机器人演示视频。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
新新学长搞科研1 天前
【IEEE出版】2026年计算机视觉与具身智能国际学术会议(CVEI 2026)
计算机视觉·具身智能
_张一凡1 天前
【论文解读】一篇读懂LAWM-3D:从 DreamDojo 的 2D 潜动作到 3D 感知,关键不是加多视角而是三道防泄漏设计
3d·具身智能·世界模型
Bright Data2 天前
小米新发布的 Robotics-1 在向市场传递什么信息?
训练数据·具身智能·视频数据
m0_547486662 天前
《机器人学与具身智能》全套课件PDF2026
机器人·具身智能
白拾3 天前
【arXiv preprint 2026】JEPA-VLA:视频预测嵌入,为 VLA 补上缺失的视觉知识|从具身智能世界模型视角
具身智能·世界模型·jepa·jepa-vla 论文分享·vla 机器人·自监督表示·v-jepa2
白拾5 天前
【ICML 2026 (Oral)】RoboMME 论文解读:首个大规模具身记忆评测基准,系统评估 VLA 长程记忆
人工智能·机器人·具身智能·vla·icml·记忆·基准评测
TsingtaoAI6 天前
基于MyCobot Pro 450机器人的VLA多模态具身智能实训建设方案
机器人·大模型·具身智能
科研小刘带你玩学术7 天前
【科研快讯】从自动执行到自主决策:具身智能正在推动AI进入机器人智能时代
人工智能·机器学习·具身智能·未来趋势·ai机器人·智能系统
HyperAI超神经9 天前
15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge
人工智能·深度学习·机器人·多模态·图像生成·具身智能·智能体