DreamZero 与 DreamDojo:世界模型与策略的分层协同综合分析与对比
0x00 概要
0.1 缘由
本文结合高深远博士的访谈,以及一些优秀的博客进行解读,探讨 DreamZero(WAM)、DreamDojo(LAM)之间的关系(也参考了ω-EVA),从设计设想出发分析它们在分层控制、交互式验证范式上的共识与差异。
访谈中几句让我印象深刻:
在具身智能的语境里,世界模型就是 DreamDojo,策略是 DreamZero,机器人就相当于是 agent。
在这个循环里,agent 起到连接循环的作用,可以是 Gemini 这类 VLM。它输出文本,也给 world state 打分。如果 world state 是 video,就能直接用现有基模来处理。
可以把 WAM 当作 policy,用它输出 action,再接给 DreamDojo 或其他更常见意义上的世界模型。
世界模型的作用,是你给它 action,它预测未来状态。这样在执行 action 之前,不需要真的和现实世界交互,就能看到不同 action 的后果,就可以先搜索再决策。人脑里也在做这件事,只是很快。
实际应用里,可以用 DreamZero、WAM 对不同文本步骤做预测,选出最佳方案。确定子任务后,把更 low level 的动作轨迹交给 DreamDojo,继续优化接近速度、抓取角度、力度等细节,最终做出更好的决策。
"
我的判断:
- 在第一性原理上,DreamZero / DreamDojo的配合 与 ω-EVA 高度一致:都强调动作执行前的后果检验,而非直接"观测 → 动作"的单跳映射;
- 在系统形态上,不完全一致:访谈设想是跨模型、跨层级协同;ω-EVA 是单模型内部的 Envision-Verify-Act 闭环;
- 在工程演化上,二者可以合流:用 DreamZero 做高层候选生成和方案筛选,用 DreamDojo 或 ω-EVA 风格的 refiner 做低层后果校正,形成可扩展的分层交互式控制栈;
- DreamZero / DreamDojo 类似 Dreamer-like loop。
0.2 一句话定位
- DreamZero(WAM) :以 Wan2.1-I2V-14B 视频扩散模型为骨干,用 Register Token 架构把动作当作另一种"去噪目标",与视频 token 在同一个 DiT 里联合去噪,同时预测动作和视频。输出是低层关节角度,可直接驱动电机。
- DreamDojo(LAM/世界模型) :以 Cosmos-Predict2.5 为基座,用 Feature Modulation 把动作当作"条件输入"注入 DiT,只预测未来视频,不输出动作。其潜动作(Latent Action)来自 44k 小时无标注人类视频,通过 LAM 自监督提取,支持"给定动作、想象后果"的仿真、规划与评估。
- 交互关系 :DreamZero(上层)→ 调用 → DreamDojo(下层)是单向、明确、工程可行的;DreamZero 是"策略"(policy)------它回答"我该做什么",并直接输出可执行的关节角度;DreamDojo 是世界模型(world model)------它回答"如果我这样做,世界会变成什么样",并只输出未来视频。在分层控制里,DreamZero 是上层决策者,DreamDojo 是下层模拟器,二者构成"先想清楚、再动手"的闭环。
- ω-EVA(arxiv 2606.09457)是一个 Latent Interactive World Model,约 1.2B 参数,实现 Envision-Verify-Act 闭环。
0x01 面对的难点与核心冲突
这是一个"想清楚再动手"的问题。
1.1 核心冲突的一句话版本
在具身智能里有一对矛盾: "动作"到底是模型的输出目标,还是模型的输入条件?
- 如果动作是输出 (我要生成动作去控制机器人)------这就是策略,对应 DreamZero;
- 如果动作是输入 (给我一段动作,我要预测世界会怎样变化)------这就是世界模型,对应 DreamDojo。
这两个看似只差一个字的选择,会从基座模型、注意力机制、训练损失一路连锁反应到推理实时性,最终长出两种完全不同形态的模型。理解了这条主线的起点,后面所有差异都能串起来。
1.2 深挖:难点与冲突的四个层次
我们逐层拆开这条主线,看看每个层次卡在哪里。
第一层:任务定义的对立------"做什么" vs "会怎样"
| 维度 | DreamZero | DreamDojo | ||
|---|---|---|---|---|
| 问题定义 | 我应该做什么?(What should I do?) | 如果我这样做会怎样?(What will happen?) | ||
| 动作的角色 | 输出目标(要预测的 y) | 条件输入(要依赖的 c) | ||
| 建模方式 | 联合分布 p(动作, 视频 | 观测) | 条件分布 p(视频 | 观测, 动作) |
| 输出类型 | 动作 + 视频 | 仅视频 | ||
| 适用场景 | 直接控制机器人 | 仿真、规划、评估、预训练 |
这是最底层、最不可调和的差异。它决定了后面所有架构选择。
第二层:架构路径的对立------动作怎么进入网络?
动作要进入一个视频扩散 Transformer,只有两条路:
- Register Token(DreamZero) :把动作当作附加 token,拼接到视频 token 序列末尾,与视频 token 共享同一套注意力层,在注意力空间里自由交互;
- Feature Modulation(DreamDojo) :动作不进 token 序列,而是通过两个 MLP 编码后,加到 timestep embedding(全局)与 AdaLN-LoRA(逐层)上,通过缩放/平移激活值间接影响视频生成。
这两条路各自卡在什么难点上?
- Register Token 需要修改整个注意力管线(四种注意力 mask 模式、3D+1D 混合 RoPE、Flash Attention kernel、patch embedding),无法直接复用预训练权重,但换来的是"动作-视频深度融合";
- Feature Modulation 不改变 token 序列,可以直接加载 Cosmos-Predict2.5 的预训练 checkpoint,只新增两个轻量 MLP(零初始化最后一层),但代价是动作与视频的交互是间接的(靠调制而非注意力)。
第三层:因果性与实时性的冲突
- DreamZero 因原生因果架构 + KV cache 直接支持自回归推理,但 14B 模型在 H100 上单步约 3s、GB200 约 0.6s,实时性吃紧(论文用块级推理 + KV cache 复用维持 ~7Hz);
- DreamDojo 基座是全双向注意力,训练时质量高、能一次生成固定长度视频,但无法自回归延展,必须经过 Self-Forcing DMD2 蒸馏(双向教师 35 步 → 因果学生 4 步)才能拿到 10.81 FPS 的实时能力。
第四层:数据依赖的错位
- DreamZero 需要高质量带标注机器人动作数据(预训练用 DROID、AgiBot 等示教数据)------标注贵、规模小;
- DreamDojo 预训练只需要无标注人类视频(44k 小时),靠 LAM 自监督提取潜动作作为伪标签------数据近乎无限,但后训练仍需要真实机器人动作对齐动力学。
1.3 换个视角看难点:为什么"先想清楚再动手"这么难?
想象你在玩"扔球砸瓶子"的游戏。你可以有两种玩手机器:
- 一种是闭着眼睛扔------拿起球就扔,不看角度、不看距离,能不能砸中全看运气;
- 一种是先想想再扔------先假装扔一次,在脑子里"预演"一下球会飞到哪里、会不会砸中,不对就换个角度,想好了再真扔。
第二种显然更聪明,但"预演"非常费脑子,而且你得先真的懂"球被扔出去会怎么飞"这件事。机器人也一样:DreamZero 是那个"负责决定怎么扔"的手,DreamDojo 是那个"负责在脑子里预演球会飞向哪"的脑。难点在于------让手和脑各干各的还能配合默契,比让一个人既当手又当脑还难。
难点本质是"决策与动力学的解耦"与"动作在两种模型中的角色二义性"。动作在 WAM 里是可微的输出目标(register token 与视频 token 联合去噪),在世界模型里是不可微的条件输入(只能零阶梯度估计)。这导致:无法用同一个训练目标同时优化两者;跨模块的信用分配困难(失败时无法判定是 proposal 错、world model 错还是 refiner 错);时延叠加后闭环频率下降;长序列中误差累积漂移;以及从单臂到双臂、从仿真到真机的跨形态动作语义一致性保持。
0x02 两个项目的详细对比
2.1 一张表看懂两个模型
| 维度 | DreamZero | DreamDojo |
|---|---|---|
| 全称 | World Action Model(WAM) | World Model for Embodied AI / Latent Action Model(LAM) |
| 论文 | arxiv 2602.15922 | arxiv 2602.06949(ICML 2026) |
| 团队 | 阿里 + NVIDIA GEAR Lab | NVIDIA GEAR Lab |
| 基座模型 | Wan2.1-I2V-14B-480P | Cosmos-Predict2.5 |
| 架构类名 | CausalWanModel |
ActionChunkConditionedMinimalV1LVGDiT |
| 层数/规模 | 32 层,dim=2048,ffn=8192,16 头 | 10 |
| 动作的角色 | 输出目标(去噪目标) | 条件输入(调制信号) |
| 动作进入方式 | Register token(拼接 token 序列) | Feature modulation(MLP → timestep emb + AdaLN-LoRA) |
| 输出 | 动作序列 + 未来视频 | 仅未来视频 |
| 注意力 | Blockwise Causal(4 种模式) | 双向(训练)→ 因果(蒸馏后) |
| RoPE | 3D 视频 + 1D 动作/状态 | 3D RoPE(仅视频) |
| 语言条件 | 有(T5/UMT5-XXL 跨注意力) | 无(空文本) |
| 输入帧数 | 33 帧多视角(2×2 网格拼接) | 13 帧(640×480) |
| 输出动作 | 24 步动作序列(action_horizon=24) | 无 |
| 训练阶段 | 2 阶段(预训练 + 微调) | 4 阶段(LAM → 预训练 → 后训练 → 蒸馏) |
| 预训练数据 | 机器人示教数据(DROID、AgiBot) | 44k 小时无标注人类视频 |
| 动作标签 | 必须 | 预训练不需要(LAM 伪标签),后训练需要 |
| 损失 | L_dynamics + L_action(MSE,可解耦噪声调度) | L_flow + 0.1·L_temporal |
| 蒸馏 | 无需(架构原生因果) | 需要(Self-Forcing DMD2,双向→因果) |
| 实时性 | H100 ~3s/step,GB200 ~0.6s/step;块级推理 + KV cache ~7Hz | 蒸馏后 10.81 FPS(640×480,4 步 ODE) |
| 参数量 | 14B(DiT)+ 13B(T5,可卸载) | 2B / 14B |
| 开源 | 权重公开,代码未完全开源 | NVIDIA Open Model License,github.com/NVIDIA/DreamDojo |
| 前向动力学 | ✅ | ✅ |
| 反向动力学 | ✅(有限程度,非独立逆模型) | ❌ |
| 能否直接控制机器人 | ✅ 直接输出关节角度 | ❌ 仅输出视频 |
| 能否做仿真 | 间接(通过预测视频) | 直接(给定动作预测视频) |
| 训练规模 | DeepSpeed ZeRO-2,数万步 | 256×H100(预训练 140k)+128×H100(后训练 50k)+蒸馏 13k |
2.2 按"动作的角色"分阵营

DearmZero-action
2.3 前向/反向动力学对比
这是最容易被忽略但极其关键的差异:
| DreamDojo | DreamZero | |
|---|---|---|
| 前向动力学(s_t + a_t → s_{t+1}) | ✅ 唯一能力 | ✅ |
| 反向动力学(s_t + s_{t+1} → a_t) | ❌ 无 | ✅(有限程度) |
- DreamDojo 只学前向动力学:动作是输入条件,token 序列里根本没有动作 token,模型没有任何解码动作的出口;
- DreamZero 同时学前向与部分反向动力学 :
ActionDecoder把 register token 解码回动作。但它不是独立逆模型------register token 与视频 token 在同一前向传播中联合去噪,信息流双向泄漏(视频→动作、动作→视频),存在"自我验证"闭环,无法独立验证一致性。
0x03 两个项目如何解决这些难点
3.1 解法总览:一张映射表
| 难点 | DreamZero 的解法 | DreamDojo 的解法 |
|---|---|---|
| 动作-视频关系建模 | Register Token:动作当作去噪目标,与视频共享注意力 | Feature Modulation:动作当作条件,MLP 注入 timestep + AdaLN-LoRA |
| 复用预训练权重 | 需改因果注意力、patch emb,改造代价高 | 不碰 token 序列,直接加载 Cosmos-Predict2.5 checkpoint |
| 因果自回归生成 | 原生 Causal DiT + KV cache,天然支持 | 训练用双向注意力,靠 Self-Forcing DMD2 蒸馏成因果学生 |
| 实时性 | 块级推理 + KV cache 复用,维持 ~7Hz | 蒸馏 35→4 步 ODE,640×480 下 10.81 FPS |
| 数据匮乏 | 需要高质量机器人示教数据(有标注) | 预训练只用无标注人类视频(LAM 提取潜动作) |
| 跨本体泛化 | MultiEmbodimentActionEncoder(每本体独立线性层) | 384 维通用动作空间 + 本体分区子集 |
| 决策前验证后果 | 通过上层调用 DreamDojo 做 rollout 验证 | 自身就是"给定动作预测后果"的验证器 |
3.2 两条贯穿性的设计主线
我们可以把两个解法收束成两条主线,这也是理解整个领域的关键:
主线一:把"想象"从"决策"里显式拆出来(系统层面)。 传统 VLA 是"观测 → 动作"的单跳映射,遇到没见过的场景就抓瞎。DreamZero+DreamDojo 的设想是:决策前先"想象"各种方案的后果,再择优执行------这就是论文里反复出现的 Propose → Envision → Verify/Act 三段式。DreamZero 负责 Propose(生成候选动作),DreamDojo 负责 Envision(预测每个候选的后果),最后由 agent 或评估模块 Verify。这本质上是把"决策"和"动力学"两个解耦的子问题交给两个各司其职的模型。
主线二:用"世界模型知识"驯服数据短缺(数据层面)。 机器人的动作标注稀缺,但人类视频几乎无限。DreamDojo 的 LAM 证明了:重建视频是手段,提取动作为目的------通过 32 维信息瓶颈,让"重建下一帧"被迫编码"帧与帧之间的运动信息",这就是潜动作。于是世界模型可以在无标注视频上大规模预训练,再通过后训练对齐机器人动力学,最后蒸馏成实时模型。DreamZero 则反过来,直接在有标注数据上联合学习动作与视频。
3.3 换个视角看解决方案:为什么"策略 + 世界模型"的分工有效?
因为"负责扔"和"负责预演"其实用了两种不同的知识。DreamZero 学的是"怎么扔才准"(它见过很多次成功/失败的示范),DreamDojo 学的是"球被扔出去会怎样飞"(它看过海量的视频,知道重力、速度这些规律)。一个专门学"动作",一个专门学"物理",各练各的绝活,再互相配合------就像足球里前锋负责进球、守门员负责扑救,各司其职比每个人都干所有事强得多。
分工具备三重合理性:其一,数据解耦 ------世界模型可以在海量无标注人类视频上自监督预训练(LAM 的 32 维信息瓶颈把"重建视频"转化为"提取动作"),而策略只需在相对少但高质量的有标注数据上微调;其二,模块解耦 ------世界模型升级(换更好的 backbone、更大的视频数据)不影响策略,策略迭代(换 LoRA、换调度)不重训世界模型,两者可独立演进;其三,决策正确性解耦------把"后果检验"从策略的隐式副作用中显式抽出,变成可独立评估、可观测、可归因的一等公民。
0x04 当前业界的实现方案总结
把 DreamZero/DreamDojo 放回 2026 年的技术版图里,我们可以看清两条并行的实现路线,以及它们正在合流的证据。
4.1 WAM 路线(联合动作-视频,策略向)
- DreamZero:Register token 联合去噪,动作=输出目标,直接控制机器人。
- Fast-WAM(arxiv 2603.16666,Mar 2026) :提出了一个关键问题------WAM 到底需不需要在推理时显式生成未来视频? 答案是否定的:训练时联合建模视频的价值巨大,但推理时可以跳过未来视频生成,只对当前观测做一次前向编码直接输出动作。190ms 推理延迟,比 imagine-then-execute 快 4 倍以上。这条结论间接支持了"在 latent space 而非像素空间做后果推理"的方向(见下)。
4.2 世界模型路线(动作条件视频预测,仿真向)
- DreamDojo:LAM 提取潜动作 + 动作条件视频预测 + 蒸馏实时化。
- MotuBrain / Motus:开源 WAM 之一。用 UniDiffuser 统一生成框架,把视频和动作视为两种连续模态,三流 Mixture-of-Transformers(MoT)融合视频生成、动作建模与语言条件。同一个模型支持 VLA 策略、世界建模、视频生成、逆动力学、联合视频-动作预测五种推理模式;50--100 条同本体轨迹即可适配新人形机器人;RoboTwin 2.0 上 95.8%(Clean)/ 96.1%(Randomized),WorldArena 64.87 EWMScore。
4.3 其他可对照路线
- VLA-JEPA(arxiv 2602.10098,Feb 2026) :用 JEPA 在 latent space 做未来状态预测,替代像素级重建。关键设计是 leakage-free 状态预测------未来帧只用于构造训练目标,不输入 VLM 主干,杜绝 shortcut、防止潜动作坍塌。架构:Qwen3-VL + V-JEPA2 编码器 + Flow Matching DiT 动作头。已集成到 LeRobot。
- ω-EVA(arxiv 2606.09457,Jun 2026,BAAI) :Latent Interactive World Model,约 1.2B 参数,把 Envision-Verify-Act 做进单模型内部闭环(详见 5.6)。
- Feedback World Model(类别概念) :把预测反馈显式注入策略生成过程。区别在于反馈途径(latent vs pixel)、反馈深度(单步 vs 多步 rollout)、反馈粒度(整条轨迹 vs 一个动作 chunk)。
4.4 共同趋势
所有路线指向同一方向:业界已经从"世界模型只做训练辅助"转向"世界模型在推理时参与动作修正" 。Fast-WAM 进一步提醒我们:这种参与不必是像素级高成本生成,latent space 内的轻量验证可能就是未来的标准实践。DreamZero 走"像素级想象"(视频+动作联合生成),ω-EVA / VLA-JEPA 走"潜空间想象",DreamDojo 处于中间(预训练在像素空间,部署靠蒸馏压缩)。
0x05 两个项目如何交互、依赖关系
5.1 论文作者思路
两篇论文作者高博士在访谈设想里,可以把 DreamZero 与 DreamDojo 连接起来。

DreamZero-relationship
也就是说:
- 在"角色层级"上:DreamZero 在上(决策者),DreamDojo 在下(模拟器)------这与论文作者"DreamZero is the upper layer, DreamDojo is the lower layer"一致;
- 在"输出粒度"上:DreamZero 输出的是低层关节角度(比任何"意图 token"都具体),DreamDojo 输出的是未来视频(比关节角度更抽象)。
其中,agent 输出文本(子任务步骤)、给 world state 打分、决定要不要换方案。若 world state 是视频,就能直接用现有视频基模处理。这一设计把"跨模型、跨层级"的协同与"文本作为高层语义接口"统一了起来。
5.2 单向可调用性
"DreamZero is the upper layer, DreamDojo is the lower layer." 这个层级是单向的:
scss
DreamZero (上层) → 调用 → DreamDojo (下层) :✅ 已设计、可行
DreamDojo (下层) → 调用 → DreamZero (上层) :❌ 无意义
为什么反向无意义?因为 DreamDojo 是纯前向动力学模型:
- 它不输出动作------没有 action decoder 或 register token,无法"告诉"上层该做什么;
- 它没有"意图" ------不接收语言指令或任务目标,无法理解"想达成什么";
- 它的输出维度单一------只输出视频,不提供状态的抽象表示(state),对决策来说信息不够浓缩。
5.3 方式一:推理时世界模型滚动(在线规划)
这是两个项目最主要的交互方式,等价于基于模型的强化学习里的"想象 rollout":

DreamZero-rollout
对应访谈里的原话: "实际应用里,可以用 DreamZero、WAM 对不同文本步骤做预测,选出最佳方案。确定子任务后,把更 low level 的动作轨迹交给 DreamDojo,继续优化接近速度、抓取角度、力度等细节,最终做出更好的决策。"
拆成两段看:
- 上层预测与筛选(DreamZero/WAM) :输入任务文本指令,模拟不同文本步骤对应的未来视频状态和粗粒度动作,输出筛选出的最优子任务序列及初步动作方案------完成 high-level action planning;
- 低层轨迹优化(DreamDojo) :接收上层确定的子任务及粗略轨迹,作为物理世界模拟器对动作精细化修正------优化接近速度、抓取角度、力度等 low-level 细节,生成可执行的高精度轨迹。
这在真实机器人上非常自然:失败往往不是"完全不会做",而是"角度差一点、力度差一点、时序差一点"。
5.4 方式二:预训练初始化与权重复用
DreamDojo 还能反向"哺育" DreamZero 的训练:
方式二:DreamZero 使用 DreamDojo 做预训练初始化
DreamDojo 的 latent action encoder ──► 初始化 DreamZero 的 action encoder
DreamDojo 的世界模型 backbone ──► 替换 DreamZero 的视频 DiT(替换 Wan2.1)
具体可复用的资产:
- LAM 潜动作编码器 → 初始化 DreamZero 动作编码器,共享潜在动作空间,减少动作编码训练量;
- 视频预测 backbone → 替换 DreamZero 的 Wan2.1 基座,提供更聚焦机器人交互的世界动态先验。
5.5 依赖关系总结表
| 调用方向 | 可行性 | 实际意义 |
|---|---|---|
| DreamZero → DreamDojo | ✅ 技术可行,接口兼容 | 高:基于模型的 RL、在线规划、合成数据 |
| DreamDojo → DreamZero | ❌ 架构不支持 | 无:DreamDojo 不输出动作/策略信息 |
| 联合训练 | ✅ 理论上可行 | 中:框架上需要集成两者的训练管道 |
| 权重复用 | ✅ 实际可行 | 高:LAM weights、video backbone 均可复用 |
四类工程协同方案:
- DreamDojo 作为 DreamZero 的训练数据增强器:用 DreamDojo 生成大量"如果动作 X,结果视频 Y"的合成数据,训练 DreamZero 策略;
- DreamDojo 作为 DreamZero 的评估环境:在仿真中用 DreamDojo 替代物理引擎,评估 DreamZero 策略的泛化能力;
- LAM 初始化 DreamZero 动作编码器:共享潜在动作空间;
- DreamDojo 视频预测 backbone 替换 DreamZero 的 Wan2.1 基座:提供机器人交互世界动态先验。
5.6 与 ω-EVA 的一致性:Envision-Verify-Act
把视角抬高一点,DreamZero+DreamDojo 的交互设想,与 ω-EVA 论文的 Propose → Envision → Verify/Act 三段式在原则上完全同向:
| 维度 | DreamZero + DreamDojo | ω-EVA |
|---|---|---|
| 模块边界 | 跨模型分工协作 | 单模型三阶段训练,单推理图内完成 |
| 分层语义 | 显式区分文本步骤筛选 + low-level 细化 | 重点在动作候选的后果校正 |
| 验证方式 | 多候选并行评分,选最优分支 | 对单个候选执行一次 consequence-aware rewrite |
| 产物形态 | 偏爱未来视频/状态仿真作为评估接口 | 推理中不解码未来视频,latent space 内完成后果推理,强调实时性 |
一句话:DreamZero 与 DreamDojo 的分层协同,是系统工程视角下的"外环规划 + 内环修正";ω-EVA 是模型机制视角下的"内置提案--验算--执行"。两者不是互斥关系,而是同一演化方向上的不同实现粒度。
0x06 未来趋势判断
6.1 可执行优化路线
针对两者叠加闭环的现实瓶颈,可能的优化方向是:
- 分级计算预算:高层候选筛选低频运行,低层 refiner 高频运行;资源不足时优先保证低层安全修正回路;
- 多候选并行 + 轻量验证:上层保留 K 个候选,下层先 latent 快筛,再对 Top-M 做高保真验证;
- 失败归因可观测化:给 proposal、world model、refiner 各自记录质量指标(proposal 多样性、future-latent 一致性、refine 前后成功率提升);
- 多模态后果校验:不只视觉 latent,还引入力觉、触觉、关节电流------接触任务里视觉往往无法覆盖全部失败信号;
- 在线自进化闭环:执行后将真实结果与 imagined consequence 做偏差对齐,逐步校准 world model 与 refiner 的误差。
6.2 最值得押注的方向
- 分层 token 化控制:high-level token 管子任务与阶段转换,low-level token 或连续动作管轨迹细节------这正是"双层 Action Token"设想的落地方向,也是 DreamZero/DreamDojo 角色分工的天然延伸;
- 单模型内闭环 + 跨模型外环结合:内环用 ω-EVA 风格快速修正,外环用 DreamDojo 风格更长时域评估与重规划;
- 统一评测协议:不能只比成功率,还要比时延、稳定性、恢复能力和 OOD 鲁棒性。
6.3 业界共识的长期判断
- 视频预测的训练收益 比推理时 rollout 更重要(Fast-WAM 的实证结论)------未来推理时的"想象"会更大概率发生在 latent space,而不是像素空间;
- 世界模型将内嵌进动作决策回路,形成"先提案、再验算、后执行"的交互闭环;
- 从演化脉络看:第 1 代世界模型做训练辅助/离线生成 → 第 2 代进入推理做外部规划/重型 rollout → 第 3 代内嵌进决策回路。DreamZero+DreamDojo 与 ω-EVA 都落在第 3 代方向,一个偏系统编排,一个偏模型内闭环。
6.4 换个视角看未来:往哪里走?
以后会越来越"省力"。现在"预演"还要在脑子里放一整部高清"电影"(生成完整未来视频),又慢又费电;将来可能只要在脑子里快速闪过几个"画面关键词"就够了(在潜空间里想象,不必真的把画面渲染出来)。再往后,那个专门负责"预演"的脑可能会直接被装进"手"里,连预演都省了------手一伸出去就知道该用多大力气。到那时,机器人的"手"会越来越聪明,需要的"外部大脑"越来越少。
三个确定性趋势:其一,推理时的后果推理将向 latent space 迁移 ------Fast-WAM 已实证推理时像素级未来生成可被剪枝,ω-EVA / VLA-JEPA 提供 latent 级轻量验证的工程范式;其二,从跨模型管线走向混合闭环 ------内环用单模型内闭环(ω-EVA 式)快速修正,外环用跨模型管线(DreamZero+DreamDojo 式)长时域评估与重规划;其三,评测从"成功率单一指标"走向多维协议------时延、稳定性、恢复能力、OOD 鲁棒性将成为标配。最终形态大概率是"分层 token 化控制 + 潜空间世界模型 + 可观测的失败归因",而 DreamZero 与 DreamDojo 的分工,就是这个形态的第一块拼图。
0x07 结语
DreamZero 与 DreamDojo 是同一枚技术硬币的两面:一个把动作当作输出目标 直接驱动机器人,一个把动作当作条件输入预测世界后果。它们在基座选型、架构路径、训练范式上看似针锋相对,实则因为目标不同而各择其道------而正是这种互补性,让它们构成了"上层决策 + 下层模拟"的完整体系。
回望全文,真正值得记住的是三句话:
- 动作的角色决定一切:输出目标(策略)还是条件输入(世界模型),派生出了 register token vs feature modulation 的架构分野;
- 协同是单向的、也是深刻的:DreamZero 调用 DreamDojo 做在线规划、预训练初始化与权重复用,反过来则无意义;这与 ω-EVA 的 Envision-Verify-Act 是同一方向上的不同实现粒度;
- 未来属于"潜空间想象 + 分层 token 控制" :像素级的未来生成终将让位于 latent space 的轻量后果推理,而世界模型将越来越深地内嵌进动作决策回路。
0xFF 参考
- DreamZero:arxiv.org/abs/2602.15922(World Action Model)
- DreamDojo:arxiv.org/abs/2602.06949(ICML 2026),github.com/NVIDIA/DreamDojo
- ω-EVA:arxiv.org/abs/2606.09457(Latent Interactive World Model,BAAI)
- Fast-WAM:arxiv.org/abs/2603.16666
- MotuBrain / Motus:arxiv.org/abs/2604.27792(生数科技)
- VLA-JEPA:arxiv.org/abs/2602.10098
- 访谈:与 GEAR 高深远聊世界模型、自进化循环和 DreamDojo
- 【insight】World Model方向观察:大一统很远,闭环进化更近
附录:两个项目逐一拆解
附录A. DreamZero:联合动作-视频生成的 World Action Model
A.1 基础架构与基本功能
DreamZero(arxiv 2602.15922,阿里 + NVIDIA GEAR Lab)是 World Action Model,以预训练视频扩散模型 Wan2.1-I2V-14B-480P 为骨干(32 层 DiT,dim=2048,ffn_dim=8192,16 头,Apache 2.0),联合预测视频和动作。
核心哲学一句话:动作和视频是同一枚硬币的两面------要理解世界动态,就必须同时理解世界如何被动作改变、动作如何产生,所以它们在同一个注意力空间里学习。
数学定义:建模 ------同时预测未来动作与未来视频。
基本功能:
- 直接控制机器人 :输出 24 步动作序列(action_horizon=24),经
ActionDecoder解码为具体机器人关节角度; - 联合预测未来视频:作为策略的同时也能"想象"执行动作后的世界画面;
- 语言条件化:接收自然语言指令(T5 编码),是完整 VLA(Vision-Language-Action)。
A.2 架构图

DreamZero-arch
工程要点:one block in, one action chunk out 的闭环节拍;通过 KV cache 与块级推理减少重复计算,维持 ~7Hz 实时控制频率。推理链路:

DreamZero-eng
A.3 数据流
输入 :多视角图像(如 3 个相机拼接为 2×2 网格,33 帧序列,320×176/320×160)+ 机器人本体状态 + 自然语言指令。 输出:24 步动作序列 + 未来视频帧。
ini
DreamZero:
输入: [帧序列33帧(T)] + [语言指令] + [机器人状态]
输出: [24步动作序列] + [未来视频帧]
任务指令 → VLM理解 → DreamZero (WAM) → 关节角度 → 电机控制
↑高层语义 ↑规划/推理 ↑低层执行
A.4 核心组件说明
1. Register Token 机制(核心创新) 在标准视频 DiT 的 token 序列末尾附加 action/state token,与视频 token 共享注意力层,通过 causal attention mask 控制可见性:
csharp
[first_frame_tokens(880) | frame_1_tokens(880) | action_1..24(24) | state_1(1)]
↑ 条件帧,仅自注意力 ↑ 可见首帧+自身+action+state ↑ 动作寄存器 ↑ 状态寄存器
- 视频块能看到"当前正在执行什么动作";
- 动作块能看到"当前视频画面是什么样的";
- 状态块纯条件信息,只 self-attention。
2. 四种注意力模式 (CausalWanSelfAttention)
| 模式 | KV Cache | Teacher Forcing | 含 Action? | 用途 |
|---|---|---|---|---|
| 1 | ❌ | ✅ | ✅ | 含动作的训练(主训练模式) |
| 2 | ❌ | ✅ | ❌ | 无动作的预训练/微调 |
| 3 | ❌ | ❌ | ✅/❌ | 完整序列一次推理 |
| 4 | ✅ | ❌ | ✅/❌ | 高效逐步推理(部署) |
3. Action Encoder / Decoder
- 编码:
MultiEmbodimentActionEncoder,每种机器人独立线性层(跨本体支持); - 解码:
CategorySpecificMLP,output_dim = action_dim(如 GR-1 的 29 DoF)------直接输出关节角度。
4. 损失函数
scss
L = L_dynamics + L_action
= MSE(video_pred, video_target) + MSE(action_pred, action_target)
- 视频与动作共享同一流匹配过程,支持解耦噪声调度(视频 Beta(3,1) 偏高频,动作均匀分布);
- 动作 loss 带掩码(action_mask / has_real_action);
- 当前无 temporal consistency loss。
A.5 历史发展脉络
- 第 1 代:世界模型做训练辅助或离线生成,推理时旁路;
- 第 2 代:世界模型进入推理,但主要做外部规划或重型 rollout;
- 第 3 代:世界模型内嵌进动作决策回路------DreamZero 的 Register Token 让动作与视频在同一个 DiT 里联合去噪,属于 WAM 路线的代表性实现。基座选择 Wan2.1-I2V-14B 的原因:需要开放的 token 序列架构(可灵活附加动作模态)、需要图生视频(I2V)能力、需要语言条件化(T5 成熟方案)、需要可改造的因果注意力,以及 14B 成熟规模与 Apache 2.0 许可。
A.6 优点
- 直接控制:输出低层关节角度,可无缝驱动电机,无需额外解码层;
- 动作-视频深度融合:register token 在注意力空间自由关联两者,模型能同时学到前向与有限的反向动力学;
- 原生因果 + KV cache:架构即部署,无需蒸馏;
- 跨本体支持:MultiEmbodimentActionEncoder 一套架构适配多机械臂;
- 语言条件化:是完整 VLA,能理解高层任务指令。
A.7 缺点
- 计算开销大:token 序列变长(每块 +24 动作 +1 状态),注意力计算量增大;14B 模型 H100 单步 ~3s,实时性吃紧;
- 实现复杂度高:4 种注意力 mask 模式、3D+1D 混合 RoPE、Flash Attention kernel 改动,无法直接复用预训练权重;
- 信息泄漏/自我验证:register token 与视频 token 联合去噪,信息流双向泄漏,无独立逆模型验证一致性;
- 数据依赖:必须高质量带标注机器人动作数据(预训练用 DROID、AgiBot 等);
- 代码未开源:仅发布权重,社区复现与二次开发受限。
A.8 改进方向
- 借鉴 Fast-WAM:推理时跳过像素级未来生成,仅在 latent 层做后果推理,换取 4 倍以上延迟下降;
- 引入独立反向动力学模型打破"自我验证"闭环;
- 用 DreamDojo 的 LAM 潜动作编码器做预训练初始化、用其视频骨干替换 Wan2.1;
- 增加 temporal consistency loss,缓解长序列漂移;
- 分级计算预算:高频低层闭环 + 低频候选验证分离。
附录B. DreamDojo:动作条件化的潜动作世界模型
B.1 基础架构与基本功能
DreamDojo(arxiv 2602.06949,ICML 2026,NVIDIA GEAR Lab)是 Latent Action Model + 动作条件视频预测世界模型。基座为 Cosmos-Predict2.5 (ActionChunkConditionedMinimalV1LVGDiT,支持 2B/7B/14B),NVIDIA Open Model License,代码开源。
核心哲学一句话:世界模型的任务是回答"如果...会怎样"------动作是给定的实验条件,不是模型的产出,所以动作应作为控制信号注入,尽量少改动基座内部结构。
数学定义:建模 ------给定动作预测视频。
基本功能:
- 高保真未来评估器:给定动作序列,预测未来视频,给 policy 提供后果反馈;
- 仿真/规划/评估:在仿真中替代物理引擎,做 rollout 与策略评估;
- 训练数据增强器:生成"动作 X → 结果视频 Y"的合成数据;
- 预训练初始化来源:LAM 潜动作编码器 + 视频骨干可被上层策略复用。
B.2 架构图

DreamDojo-arch
蒸馏后的架构变化 (ActionChunkCausalDITwithConditionalMask):
- 注意力改为 Causal(每帧只能关注自己和之前帧);
- 加 KV Cache(rolling window 12 帧);
- 加 CUDA Graph(逐时间步预编译);
- RoPE 改为手动索引(video_pos 参数);
- 推理时 T=1(逐帧生成)。
B.3 数据流

DreamDojo-dataflow
B.4 核心组件说明
1. LAM(Latent Action Model)------潜动作提取器 通过具有信息瓶颈的 VAE:编码器 将两个连续帧映射到 32 维潜在空间,解码器 重建下一帧。
为什么"重建视频"就是"提取动作"?因为 32 维信息瓶颈迫使 只能编码"f^t 中没有但 f^{t+1} 需要的运动信息"。如果 编码了视觉外观(如"杯子是红的"),解码器用不上------f^t 里已有;只有当 编码"手从 A 移到 B"时解码器才需要它。在最小化重建误差的压力下, 被迫编码运动,这就是动作的定义。
"
arduino
f^t 提供了"世界长什么样"
â 提供了"世界如何改变"
↓
f^{t+1} = 世界样子 + 世界变化
2. 384 维通用动作空间分区(手工约定的统一动作接口)
makefile
[0:29) 29 dims: Fourier GR-1 关节位置
[29:58) 29 dims: 重定向后的 GR-1(Manus 手套遥操作数据)
[58:101) 43 dims: Unitree G1 关节位置
[101:147) 46 dims: 双臂 YAM
[147:169) 22 dims: AgiBot
[169:220) 51 dims: 保留位
[220:352) 132 dims: MANO 手部骨架
[352:384) 32 dims: LAM 潜在动作(与 latent_action 逐元素相乘,是乘法!)
好处:不同机器人后训练只需替换 action MLP 第一层(输入维度固定 384);可混合多数据源同时训练;LAM 潜动作经逐元素乘法直接注入,无需改架构。注意是乘法不是加法------latent_action 作为"缩放因子"调节已有槽位,输出 0 时清零、负数时反向。
3. 两条动作 MLP 注入路径
- MLP-1(4608→4C→C)→ 加到 timestep embedding:全局路径,告诉模型"当前去噪进度 + 动作是 X";
- MLP-2(4608→4C→3C)→ 加到 AdaLN-LoRA:逐层路径,分解为 9 个调制参数(scale/shift/gate for self/cross/ffn),每层 LayerNorm 被调制,细粒度调整每层计算方式。
4. 损失函数
ini
L_final = L_flow + λ·L_temporal (λ = 0.1)
L_temporal = E[Σ||(z^{i+1} - z^i) - (v^{i+1} - v^i)||²]
- 标准流匹配 loss + 时间一致性 loss(强制相邻帧预测速度与 GT 速度一致);
- 不预测动作,无动作 loss。
5. 蒸馏(Self-Forcing DMD2) 双向注意力教师(35 步去噪)→ 因果注意力学生(4 步 ODE),学生用自己历史生成作上下文,生成 N' > N 帧只对最后 N 帧算损失(强迫长程一致性)。蒸馏后 640×480 下 10.81 FPS,支持任意长度自回归生成。
B.5 历史发展脉络
- 基座选择:Cosmos-Predict2.5 原生支持 AdaLN-LoRA(NVIDIA 为世界模型专门设计的条件化机制),且同一团队便于深度修改(加 mask channel、改 attention、加蒸馏流程),是世界基础模型(flow matching + temporal consistency),比通用视频生成模型更适合物理交互建模;
- LAM 自监督预训练:44k 小时无标注人类视频 → 潜动作提取;
- 世界模型预训练:140k 步(256×H100),视频 + 潜动作对;
- 机器人后训练:50k 步(128×H100),对齐机器人动力学;
- 蒸馏部署:13k 步,双向 → 因果 + KV cache,10 FPS 实时。
B.6 优点
- 数据效率:预训练完全不需要动作标签,利用海量无标注人类视频;
- 低成本复用预训练权重:Feature Modulation 不改 token 序列,直接加载 Cosmos-Predict2.5 checkpoint,只新增两个轻量 MLP;
- 高保真仿真:给定动作预测视频,可直接替代物理引擎做 rollout、评估、规划;
- 实时性好:蒸馏后 10.81 FPS,支持任意长度自回归;
- 跨本体统一接口:384 维通用动作空间 + 分区,一套模型适配多种机器人+人类动作格式;
- 开源:代码开源,社区可复现。
B.7 缺点
- 不输出动作:无法单独作为策略使用,只能做世界模型/模拟器;
- 只学前向动力学:没有反向动力学能力,无法反推动作;
- 动作-视频交互间接:调制(scale/shift)不如注意力交互紧密;
- 需要蒸馏:基座双向注意力无法直接自回归部署,需要额外的蒸馏流水线;
- 后训练仍需真实动作:预训练免标注,但对齐机器人动力学仍需要真实机器人动作数据;
- 无语言条件:不接收任务指令,无法理解"想达成什么"。
B.8 改进方向
- 为世界模型增加"后果校验"闭环:把"想象结果 vs 真实结果"的偏差作为损失,在线校准(在线自进化);
- 引入潜空间后果推理接口:参考 ω-EVA 的 Tri-branch Refiner,在 latent 层直接修正动作,不必解码像素视频;
- 扩展多模态后果校验:不只看视觉,引入力觉/触觉/关节电流信号;
- 与策略联合训练或联合蒸馏:让"决策"与"想象"共享动力学先验(MotuBrain 的方向);
- 统一评测协议:除成功率外增加时延、稳定性、恢复能力、OOD 鲁棒性指标。

TransFormer-封面
本文使用 markdown.com.cn 排版