26年6月来自上海交大、东方理工、腾讯、清华和中关村学院的论文"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?"。
世界-动作模型(WAM)通常依赖视频生成来连接视觉世界建模和机器人控制。然而,基于视频的WAM面临三个相互关联的限制:密集的多帧未来标记使得推理成本高昂;完整的视频预测会将资源消耗在与动作无关的时间和外观细节上;而长时程的未来想象可能会引入误差,从而误导动作预测。这些问题引出一个简单的问题:世界动作模型真的需要视频生成吗?
ImageWAM,是一个简单的WAM框架,它将预训练的图像编辑模型重新用于机器人动作预测。与视频生成相比,图像编辑提供一个更匹配的先验:它只需要对目标帧的变换进行建模,专注于与动作相关的当前帧到目标帧的视觉差异,并通过编辑预训练将任务指令与局部视觉变化联系起来。实际上,ImageWAM在推理时并不解码目标帧;相反,它将一个流匹配动作专家模型基于图像编辑去噪生成的KV缓存进行训练,并将其用作一个紧凑的世界-动作上下文。在不同的模拟器和真实世界实验中,ImageWAM 的性能均优于标准 VLA 基线模型和同等水平的 WAM 模型,且无需额外的策略预训练。此外,它还能将基于视频的 WAM 模型的浮点运算次数 (FLOPs) 降低至 1/6,延迟降低至 1/4。注意分析进一步表明,编辑缓存能够聚焦于与任务相关的变化区域,从而支持将图像编辑作为基于视频的世界动作建模的有效替代方案。
如图 1 所示:

1 问题描述
考虑基于当前视觉观测和任务指令的机器人操作。在每个时间步 t,机器人接收图像观测 o_t 和任务指令 l,并预测一个动作块:
a_t:t+H = (a_t,a_t+1,...,a_t+H),
其中 H 表示动作范围。策略学习目标是:
π_θ(a_t:t+H | o_t, l).
世界动作模型在动作预测之前引入一个中间视觉推理步骤。基于视频生成的世界动作模型通常通过预测未来的视觉轨迹来实现这一中间步骤:
(o_t,l) → oˆ_t+1:t+H+1 → a_t:t+H.
这使得先推理后行动的策略学习成为可能,但需要生成跨越多个未来帧的密集时空视觉tokens。ImageWAM 算法并非预测完整的未来轨迹,而是仅预测终点帧:
(o_t,l) → oˆ_edit ≡ oˆ_t+H+1 → a_t:t+H.
其中 oˆ_edit 是一个单一的源条件帧,它概括当前观测任务指定的视觉变换。它作为动作预测的紧凑的世界-动作中间帧。
2 ImageWAM 架构
ImageWAM 基于 OmniGen2 84、Ovis-U1 85 和 Flux2 86 等图像编辑模型,并在其图像编辑分支上附加一个动作专家。OmniGen2 提供一个源条件图像编辑骨干网络,该网络以当前观测值 o_t 和任务指令 l 作为输入。ImageWAM 并非仅使用编辑分支来解码编辑后的图像,而是重用去噪过程中生成的中间 Transformer KV缓存作为动作生成的条件上下文。
如图 2所示:ImageWAM 流水线

在训练过程中,随机采样一个编辑去噪时间步 τ,并在该时间步运行编辑分支。对于每个 Transformer 层 l,收集相应的KV缓存 Cτ_edit。
缓存 Cτ_edit 在视觉潜信息通过编辑主干与任务指令交互后计算得出。因此,它包含任务相关的视觉变换信息,而无需解码最终编辑后的图像。
动作专家基于 Cτ_edit 生成动作。这种设计将图像编辑模型的内部推理过程转移到机器人控制:编辑分支推理源观测值在任务指令下应如何变化,而动作专家则将此编辑上下文转换为可执行的机器人动作。与视频生成 WAM 不同,ImageWAM 不需要生成或解码未来的视频tokens。
除了对未来视频tokens进行去噪的标准视频 WAM 变体之外,还实现一种 Fast-WAM 风格的变体 13。在该变体中,未来的视频tokens仅在训练期间用于视频协同训练,但在推理时会被移除。动作专家基于由当前观测值和任务指令生成的 KV 缓存进行操作,而无需实例化或对未来的视频tokens进行去噪。这提供一个视频 WAM 基线模型,其推理接口与 Fast-WAM 相同,均不包含未来tokens。
其冻结编辑模型中的 VLM 和多模态理解组件,包括用于编码任务指令和视觉上下文的模块。训练期间仅更新基于扩散的图像生成分支和动作专家。冻结的 VLM 提供稳定的语言-视觉条件,而可训练的扩散分支则学习预测与任务相关的未来帧,并生成可用于动作生成的编辑缓存。
3 动作预测与训练
图像编辑目标。编辑分支经过训练,能够预测与任务相关的未来终点帧。令 o_t+H+1 表示目标未来观测值,令 z∗_t+H +1 = E_vae(o_t+H+1) 为其潜表示。对图像噪声 ε_z ∼ N(0,I) 和图像流时间 r ∈ (0,1) 进行采样,并构建插值图像潜表示:
z_r =(1−r)z∗_t+H+1s +rε_z。
扩散图像分支,预测相应的速度场(目标函数L_img)。该目标保持编辑分支预测与任务相关未来视觉状态的能力,并鼓励提取的编辑缓存编码有用的视觉变换信息。
动作流匹配。动作专家使用动作流匹配目标生成动作块。令 a∗_t:t+H 表示专家动作块,ε_a ∼ N(0,I) 表示高斯噪声。对动作流时间 s ∈ (0, 1) 进行采样,并构建插值动作样本 a_s。
在当前观测值、任务指令和编辑上下文缓存 Cτ_edit 的条件下,动作专家预测速度场(目标函数L_act)。s 表示动作流匹配时间,而 τ 表示用于提取编辑缓存的图像编辑去噪时间步长。在训练过程中对 τ 进行采样,使动作专家能够接触到来自去噪过程不同阶段的编辑缓存。最后,通过 L = L_act + L_img 联合优化扩散图像分支和动作专家。
4 高效推理
在推理阶段,ImageWAM 避免生成完整的未来视频,也不需要解码完整的编辑图像。不运行完整的图像编辑去噪轨迹,而是选择一个固定的编辑去噪时间步 τ⋆,并仅执行一次编辑分支前向步骤,以获得:
Cτ⋆_edit =fτ⋆_edit (o_t, l)。
动作专家通过对基于此缓存的动作样本进行去噪来生成动作块:
aˆ_t:t+H ∼p_θ(a_t:t+H |o_t, l, Cτ⋆_edit)。
这种推理过程比基于视频生成的 WAM 更紧凑。视频 WAM 通常需要对多个未来帧中的密集时空tokens进行去噪和解码。相比之下,ImageWAM 计算一组逐层编辑缓存,并将其直接用作动作专家的上下文。因此,ImageWAM 保留 WAM 的先推理后行动原则,同时避免对密集未来视频tokens的实例化。
为了进行比较,还为视频 WAM 主干网络实现一种 Fast-WAM 式的推理策略。在该策略中,未来视频tokens在测试时被移除。视频主干网络仅处理当前观测值和任务指令,而动作专家则使用由此产生的当前上下文 KV 缓存来生成动作。因此,该变体保持简洁的动作条件化接口,同时避免在部署过程中对未来视频tokens进行去噪。
实验设置
与许多依赖额外具身策略预训练(P.T.)的VLA和WAM基线模型不同,Image-WAM不使用额外的具身数据,仅基于下游基准测试用例进行训练。用Flux.2 4B在LIBERO 87、LIBERO-Plus 88和RoboTwin 2.0 89上评估Image-WAM,并在图3所示的多个真实世界操作任务上进行测试。

LIBERO 和 LIBERO-Plus。在 LIBERO 92 和 LIBERO-Plus 88 数据集上评估模型。对于 LIBERO,遵循标准基准测试协议,并在四个标准测试套件上进行训练:空间、物体、目标和 LIBERO-Long。每个套件包含 500 个专家演示,涵盖 10 个任务。
LIBERO-Plus 提供一个更具挑战性的评估环境,该环境基于 LIBERO 任务构建,并增加了视觉和布局的变化。与之前的工作一样,用相同的原始 LIBERO 训练演示,而不使用增强的 LIBERO-Plus 训练数据。在 LIBERO-Plus 协议下评估训练好的策略,并报告平均成功率。
RoboTwin 2.0。还在 RoboTwin 2.0 89 上进行评估,RoboTwin 2.0 是一个用于双臂机器人操作的大规模模拟基准测试。该基准测试涵盖 50 多个任务,并要求策略在各种物体布局和场景条件下协调两个机械臂。沿用先前工作3, 13的多任务设置,用来自所有任务的示范数据训练单一策略,其中包括在干净场景中收集的2500条轨迹和在场景随机化程度较高的环境下收集的25000条轨迹。所有模型均训练3万步。在干净和随机化的测试环境下评估每种方法,并报告每个任务100次试验的平均成功率。
真实世界实验。还使用 Dobot XTrainer 双臂机器人平台评估模型,该平台用于执行以下任务:收集碗(T1)、折叠毛巾(T2)、打开抽屉并存放记号笔(T3)以及将杯子挂到架子上(T4)。这些任务涉及长距离操作、视觉遮挡、精细操作和可变形体操作,其能够评估模型在实际应用中的性能。每个任务包含 100 条轨迹。模型在所有任务的合并数据集上进行训练,所有模型均训练 3 万步。报告在该平台上,在多种不同初始配置下进行 100 次试验的总体成功率。