论文:Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
机构:清华AIR、域变换
链接:https://air-embodied-brain.github.io/Zeva/
1.介绍
1.1 研究背景与核心痛点
-
背景:具身基础模型(如VLA和WAM)发展迅速,但在真实世界部署中仍面临挑战。
-
核心痛点(分布偏移) :机器人在真实世界中不可避免会遇到预训练阶段未见的物理条件。具体包括:
-
新颖的物体几何形状(novel object geometries)
-
接触动力学(contact dynamics)
-
视觉变化(visual variations)
-
具身特有的执行误差(embodiment-specific execution errors)
-
-
直接后果 :由于机器人状态是连续且高维的,上述条件的微小变化会导致"相同动作产生不同结果"。因此,仅靠预训练无法覆盖极其多样化的真实物理交互。
1.2 现有方法的局限
-
作者主张 :为了实现真正的泛化,机器人必须在执行过程中 ,从自身的物理交互经验中学习,即学习"动作与其引发的状态变化之间的因果关系",并应用于后续动作。
-
现有方法的局限性:
-
测试时训练(Test-time training) :如 RoboFTT 和 WAM-TTT,它们通过梯度更新(gradient updates)将部署历史转化为自适应权重或记忆模块。缺陷:这导致动作和状态变化的底层结构变得隐含(implicit),且需要更新权重。
-
上下文学习(In-context learners) :如 GEN-1.5 和 Skild S1,它们保持模型权重冻结,根据少量演示推断新任务。缺陷 :这些方法主要针对任务泛化 (task generalization),而非作者强调的即时交互学习(on-the-fly interaction learning)。
-
3. 解决方案:Zeva 框架
核心概念 :Zeva 是第一个 能够基于机器人自身交互经验进行上下文学习,并保持模型完全冻结(frozen)的框架。
核心贡献:
-
问题定义 :将真实世界的动作泛化定义为上下文因果学习(ICCL),即冻结的机器人在不进行测试时权重更新的情况下,从自身物理交互中学习。
-
框架提出 :提出了包含因果交互提取、双时间尺度因果记忆 和上下文策略注入 的 Zeva 框架,实现了无需梯度的自我进化。
-
实验验证:在模拟和真实世界操作中进行了验证,证明了其相对于前沿具身策略模型具有更强的成功率和跨尝试改进的能力。
2. 方法
2.1 上下文因果学习
作者将问题定义为上下文因果学习 (In-Context Causal Learning,ICCL),而非标准的模仿学习(Imitation Learning)。智能体需要从交互中泛化到新任务 T∼P(T)。这里的"学习"并非传统的参数更新,而是推断环境的因果结构(即"我的动作"与"状态发生的变化"之间的因果关系)。
关键约束 :整个学习过程不需要权重更新
过程描述 :在第 r 次尝试时,策略 π 利用从之前尝试中提取的因果上下文 Mr−1 ,来引导当前的动作生成。该目标最小化预测的实际因果效应 与真实发生的因果效应之间的差距。这里 Δsτ是真实的状态变化,而 Inference代表冻结的策略模型利用上下文 Mr−1做出的预测。

定义交互三元组(Interaction Triplets):
- 在时间步 τ:动作 uτ 与环境的交互,导致了 视觉状态变化
(即效应)
。
其中 ϕ将这三者编码为一个因果交互单元 ,所有这些单元的集合构成了因果上下文 M。
2.2 Zeva 框架

Zeva 是一个将原始交互转化为"双时间尺度因果记忆"的框架,它包含三个核心部分:
-
因果交互提取(Causal Interaction Extraction):将动作和效应映射到潜在空间(对应公式中的 ϕ)。
-
双时间尺度记忆管理(Dual timescale Memory Management):结构化组织交互经验,以便高效检索。
-
上下文策略注入(In-Context Policy Injection):为冻结的基础模型提供因果提示。
与基础模型(Cosmos3)耦合的机制:采用"双路径"架构,包含自回归路径(autoregressive path)(编码多模态上下文)和扩散路径(diffusion path)。在每次执行动作转换时,CTE(因果转换编码器)提取一个相位令牌(phase token)和一个因果交互信号。最终生成的因果提示(Causal Prompt)用于条件化扩散路径的全注意力模块(full-attention blocks)
2.2.1 因果转换编码器 (CTE)
为了弥合"原始像素"与"因果推理"之间的鸿沟,作者引入了 因果转换编码器(Causal Transition Encoder, CTE),其作用是将交互过程映射到一个潜在的因果空间。
在每个时间步 τ,CTE 提取三个瞬态信号:视觉潜变量 sτ、动作编码 uτ 以及观测到的效应 dτ。然后利用一个门控递归单元 (GRU) 将这些瞬态信号整合成因果交互状态 Bτ
当前的因果状态 Bτ不仅依赖于当前时刻的视觉、动作和效应,还依赖于上一时刻的历史因果状态 Bτ−1,这赋予了模型时序记忆能力。初始状态 B0由全局上下文 g 和初始观测 s0初始化
最终生成的因果状态 Bτ会被投影为两个关键组件:
-
相位令牌 (Phase Token) pτ:代表任务的进度(Task progress)。
-
因果交互信号 (Causal Interaction Signal) eτ:表征物理动力学特征。
这两者结合,就构成因果交互单元:,这个是后续记忆组织与检索的基本单位。
目标函数: 采用多目标损失函数对因果转移编码器进行优化,以确保能够捕捉物理因果关系。
- **因果效应预测损失 (Leffect):**利用因果交互信号 eτ 和候选动作,去预测实际的视觉状态变化 Δsτ,强迫模型必须理解"动作导致了什么后果"。
- **任务身份聚类损失 (Ltask):监督对比损失,**它将属于同一任务的交互片段(episodes)在潜在空间中进行聚类。
- 相位推进损失 (Lphase): 确保相位令牌 pτ 能够捕获任务执行的**单调递增(monotonic progression)**过程,将 pτ与任务进度严格绑定。
2.2.2 双时间尺度因果记忆
Zeva 将记忆分为两个并行的通道:短期(Brief) 和长期(Persistent)
简短交互轨迹 (Brief Interaction Trace, BIT)
提供即时局部上下文 。它存储最近的一系列交互信号,形成一个滑动窗口(sliding window),滑动窗口存储最近 个交互信号,提供当前动作效能的即时局部上下文;每次 attempt 结束时重置。
持久交互记忆 (Persistent Interaction Memory, PIM)
在同一 episode 内跨 attempt 累积因果单元 ξ = (p, e);每个新 episode 开始前清空。通过基于相似度的合并去重,沉淀可复用经验。随着尝试次数增加,记忆会无限膨胀。为了保证可扩展性(scalability),作者采用了基于相似度的合并策略(similarity based merging),而不是简单地不断添加新条目
持久记忆的更新机制:当一个新的交互单元 ξτ=(pτ,eτ)产生时,系统会进行如下操作:
- 寻找最相似的记录:在长期记忆
中找到与当前单元最相似的历史记录
相似度得分由相位令牌相似度 (任务进度是否一致)和因果信号相似度(物理动力学是否一致)加权相加得出。权重分别为 βp 和 βe
- 条件合并:如果相似度超过阈值则合并;如果相似度低于阈值,系统将其作为新条目加入(Union)记忆库
2.2.3 上下文策略注入
这是将存储经验转化为可供大模型理解的结构化"因果提示(Causal Prompt)"
- 相位条件检索 (Phase-Conditioned Retrieval)
从海量的长期记忆(PIM)中,精准找到对当前动作最有用的经验。系统使用当前时刻的相位令牌 pτ(代表当前任务进度) 作为查询(Query),在持久记忆 中检索历史交互单元。

- 因果提示构建 (Causal Prompt Construction)
将各类信息融合打包,格式化为模型能够理解的输入

g(任务令牌 task token) :提供全局目标锚定。pτ(当前相位令牌) :提供当前进度的锚定。Pproj(Hbriefτ)(投影后的短期记忆) :提供当前尝试内刚刚发生的即时反馈。Pproj(Rτ)(投影后的长期检索记忆) :提供过去多次尝试中总结出的因果证据。Fmem(记忆上下文编码器) :通过共享投影器(projector)后,Fmem将这些片段融合成一个最终的综合上下文表示 Mτ。
据过去成功或失败的经验动态调整当前动作策略 ,以实现任务成功率最大化。
推理时需要注意:
-
参数完全冻结 :在部署期间,所有的模型参数(包括基础模型和记忆编码器等)都保持冻结(frozen),不进行任何梯度更新。
-
记忆动态更新 :唯一的"在线学习"行为,是智能体实时更新它的因果记忆(即前面提到的 BIT 和 PIM 库)。
-
动态上下文决策 :基础的冻结模型将不断演化的记忆上下文 Mτ视为动态上下文(dynamic context),以此为基础进行每一步的决策。
3. 实验结果
- RoboCasa365-Atomic5(仿真环境):
测试环境:5 个厨房操作任务,包括TurnOn ElectricKettle、CloseToaster OvenDoor、TurnOn Microwave、CoffeeSetup Mug、OpenStand MixerHead
评估协议:50 个随机 episodes/task
- ChemLab-Evo(真实世界)
平台构建:使用 ARX 机械臂,在 80cm × 60cm 的工作空间内,构建包含 7 个任务的化学实验室基准 ChemLab-Evo
任务复杂度分层:
- Level 1 (Atomic / 原子级):单个操作原语。拾取试管/放置烧杯/倒水
- Level 2 (Short-sequence / 短序列):短技能组合。滴定/配盐溶液
- Level 3 (Complex / 复杂级):长时序、多阶段程序。天平称量/萃取
在仿真测试环境的结果如下:Zeva 平均成功率 76.8%,超越最强基线 4.4 个百分点

在ChemLab-Evo评估的结果如下:Zeva 平均过程分数 57.32,超最佳基线平均 12.59 分

消融实验对比:

探究 Zeva 是否会随着在多次尝试过程中交互经验的积累而提高任务完成概率:

基于人类示范的单样本预热:人类物理引导 ARX 机械臂一次完成任务,CTE 编码动作-状态变化轨迹初始化 PIM,且无需进行梯度更新。
效果:Place Beaker +20 个百分点、Pour Water +15 个百分点;Pick Up Test Tube 早期提升,最终收敛 100%。

采用t-SNE技术对CTE在全部七项ChemLab-Evo任务中学习到的交互嵌入表示进行可视化呈现:
完整的CTE表征生成了结构紧凑、具有明确任务特异性的聚类,而剔除"效应流"则导致任务内部数据分布更加分散、任务间数据混合程度增加。

4. 总结
Zeva 是一种让机器人在真实世界中"不改脑子,只加经验,越做越好"的新型具身智能框架。
Zeva 的创新在于:它保持基础模型完全冻结,但引入了一个**"因果转换编码器"** 来提取动作与物理状态变化之间的因果关系,并存入一个双时间尺度的记忆库(短期记录当前尝试,长期跨次积累经验)。在实际执行时,机器人会检索记忆库中的因果经验,将其作为"上下文提示"注入给冻结的模型,从而指导当前的动作。
这种方法使得机器人无需昂贵的梯度微调,就能在反复尝试中实现"无梯度自我进化"------尝试次数越多,成功率越高,并且在模拟和真实化学实验中均大幅超越了现有的前沿模型。