世界模型:原理、范式与工程实践

世界模型:原理、范式与工程实践

从 Dreamer 到可编辑世界

定位:技术书 + 选型手册。全文不限篇幅,每个技术判断标注证据强度,每个数字可追溯到一手来源。


阅读前须知:三件事

  1. "世界模型"这个词目前不能用来做技术判断。 它同时指神经模拟器、具身隐式路线、表征预测派和视频渲染器四类系统。本报告全程使用一条可操作判据来区分:是否接受动作序列作为输入,并输出对应的状态分布(见第 2.4 节)。
  2. 本报告的证据纪律。 所有性能数字只在一手来源明确记载时才写;只有媒体报道的内容标注来源性质;不确定处明确写"未核实"。第 12.7 节集中列出了回避或降级处理的内容。
  3. 报告写作中修正了 5 处流传较广的文献编号错误,并剔除了 1 条查不到任何来源的说法。清单见附录 C。

第 0 章 执行摘要

0.1 一个词,四类系统

2024 年 2 月,OpenAI 在 Sora 的技术博客里把官方标题写成了 "Video generation models as world simulators"。同一时期,Google DeepMind 的 Genie 在学怎么操作游戏,Meta 的 V-JEPA 在学怎么预测视频的抽象表征,NVIDIA 在发合成数据管线,蔚来在讲车端推演 216 条轨迹。

这些东西的共同点只有名字。

名字通胀到这个程度,说明它已经不携带信息了。但有一个判据可以把它重新收窄:

一个系统是不是世界模型,看它是否接受动作序列作为输入,并输出对应的状态分布。

按这个判据,当前挂在这个标签下的系统分成四类,彼此几乎没有交集:

类别 判据表现 代表 干什么用
神经模拟器 接受动作、输出状态分布,可多步推演 GAIA-1/2、Genie、GameNGen、DIAMOND 生成训练数据、构造长尾场景
具身隐式路线 无显式动作条件预测模块,靠大规模预训练隐式编码动力学 π₀、GR00T N1/N1.5、OpenVLA 真机控制,当前唯一规模落地的路线
表征预测派 接受动作,但只预测抽象表征,不出像素 V-JEPA 2-AC、I-JEPA 低数据机器人迁移、MPC 规划
纯渲染器 只接文本/图像,不接动作 Sora、Veo 3、Seedance 生成多媒体内容,与交互无关

第四类和前三类之间不是程度差异,是类别差异。这也是本报告第 2 章要花整章篇幅处理的问题。

0.2 四个硬结论

结论一:帧级预测目标本身包含物理,不需要显式物理引擎。

Google 的 GameNGen 用一个扩散模型预测 Doom 的下一帧,把动作嵌入替换掉扩散 U-Net 的 cross-attention。人类区分真实画面和它生成画面的准确率是 58%~60%------接近抛硬币。同一篇论文里,自回归 5 分钟画面仍保持稳定,PSNR 29.4。

这个结果的含义比它的标题更大:你不需要告诉模型什么是抛物线,只要让它预测足够多的下一帧,抛物线就会被逼出来。它同时解释了为什么 Dreamer 系(在潜空间学转移)能用 150 多个领域的同一套超参跑通,也解释了为什么一个没有任何物理引擎的 500M 参数模型能做出可玩的开放世界(Decart 的 Oasis)。

边界必须一起记住:20 FPS、只在单一游戏域验证过、蒸馏到 50 FPS 时质量有损。

结论二:视频质量分数和世界模型能力几乎正交,混用会得出错误结论。

这里有三类互不覆盖的指标:

  • FVD、VBench 测"视频好不好看"
  • Physics-IQ、PhyGenBench、Apple-π 测"物理对不对"
  • Atari 100k、DMControl、Crafter、DMLab 测"对决策有没有用"

最有说服力的一组对照来自 Apple-π 基准(南洋理工 S-Lab 与港中大,2026 年 7 月)。它把物理定律评测拆成感知、形式化、推演三个阶段,测了 11 个模型。结果是:最佳的视频生成模型 Seedance 2.0 只拿到 0.473 分,而"统一理解-生成"类模型(GPT Image 2 为 0.704)明显更高。

一个能生成漂亮视频的模型,分三步推演物理定律时打不过一个以理解为主、生成能力平平的模型。这两件事是分开的,评测必须分开。

结论三:"显式世界模型 vs VLA 已隐式具备"这场争论,问题出在词,不在技术。

三方的硬证据都成立:

  • 支持显式世界模型:V-JEPA 2-AC 用不到 62 小时无标签机器人视频训练动作条件预测器,零样本迁移到新机械臂完成抓放;GAIA-2 可控生成长尾驾驶场景并已在 Wayve 内部部署;Cosmos-Drive-Dreams 的合成数据让下游 3D 检测 mAP 提升 2.8~3.8%、跟踪 AMOTA 提升 8.0~8.3%;蔚来车端 0.1 秒推演 216 条轨迹选最优。
  • 支持隐式路线:主流 VLA 在真机上确实跑得动,而且跑得比任何世界模型方案都远。GR00T N1.5 官方公布真机语言跟随率从 46.6% 提到 93.3%,π₀.₅ 在全新真实家庭完成 10~15 分钟长时程任务。
  • 折中:GR00T 的 System 1 / System 2 双系统(10 Hz 与 120 Hz 分工)、Gemini Robotics ER 与 VLA 的高低层解耦。

但这三方在回答三个不同的问题。当同一个词指三件不同的东西,争论不会有结果。判据还是 0.1 节那一条。

结论四:卡住落地的是数据和验证,不是模型结构。

  • 真实机器人遥操作数据极贵。Open X-Embodiment 聚合了 22 个数据集、100 万条以上轨迹,DROID 是 350 小时级别。合成管线能补一部分(GR00T-Dreams 调研称 78 万条合成轨迹等效 6500 小时人类演示,而人类只需 11 小时演示喂给模型生成),但仿真到现实的差距没有被量化解决。
  • 验证环节更薄弱。Figure 03 Helix 官方博客称内含世界模型组件,无论文、无架构细节、无第三方验证;1X World Model 同样只有博客演示;特斯拉的 FSD 世界模型至今没有任何技术报告。
  • 工业界的分岔直接暴露了这一点:华为在 2025 年 4 月的 ADS 4.0 发布会上明确宣布不走 VLA 路线、省掉 Language 环节,走云端 World Engine 加车端 World Action Model;蔚来走车端显式推演。这不是技术优劣之争,是数据归属、验证成本、法规约束三者的现实权衡------车企的真实数据不能随便上传云端。

0.3 这份报告怎么读

全文分四个部分:

  • 第 1~4 章 建立坐标。先说清为什么需要世界模型(第 1 章),再把"世界模型"这个词的四类用法拆开(第 2 章),然后按训练目标而非学术门派划分四个范式(第 3 章),最后给出所有变体共享的六个部件、架构图、数据流图、ER 图和交互时序图(第 4 章)。
  • 第 5~9 章 讲透原理。潜空间预测派(Dreamer 系到 MuZero、TD-MPC)、表征预测派(I-JEPA 到 V-JEPA 2)、生成式派(GameNGen、DIAMOND、Genie、Muse,以及视频生成派)、具身与驾驶落地、数学骨架。这是全文技术密度最高的部分。
  • 第 10~13 章 面向工程。可微仿真器与数据引擎、评测基准与失效模式、选型决策树、三方争议的中立梳理、未来方向。
  • 附录 术语表、图表索引、参考文献。

只想知道该选哪条路线,读第 12 章的决策树就够了。想理解原理,第 9 章是全篇所有变体的公共底座------Dreamer、JEPA、扩散世界模型看起来模型完全不同,拆开看都在解同一个问题:如何把观测压成一个既有信息量、又可预测、还对这个任务有用的表示。

0.4 关于这份报告的证据纪律

有件事必须先说清楚,否则后面的内容没法正确使用。

本报告涉及的系统横跨 2018 到 2026 年,其中大量是 2025~2026 年的新发布,热度高、可验证性差。所以:

  • 所有性能数字(参数量、帧率、数据小时数、榜单分数)只在一手来源明确记载时才写,且必须能追溯到官方博客、官方论文、官方模型卡或开源仓库。
  • 凡是只有媒体报道、无一手来源的内容,正文标注来源性质,或干脆不写。
  • 凡涉及 arXiv 编号,都经过逐条核验。本报告写作过程中发现并修正了 5 处流传较广的错误编号------包括把 V-JEPA 的编号安到一篇量子拓扑分析论文上、把价值等价原理的编号安到一篇量子混沌论文上这类情况(详见附录参考文献的更正标记)。
  • 有 1 条被广泛转述的说法(AMI Labs 的 Alexandre LeBrun 称"世界模型是下一个风口、六个月内人人自称世界模型")在全网找不到任何一手或二手来源,本报告不予采用。

具体哪些结论证据较薄、哪些"全球首个"类表述需要保留判断,第 12.7 节做了集中标注。


一句话结论:"世界模型"这个词已经通胀到不能用来判断一个系统是不是世界模型,但"是否接受动作序列输入并输出状态分布"这条判据可以;而这条判据能分清的四类系统里,真正决定落地速度的是数据和验证,不是模型结构。

第 1 章 为什么需要世界模型

1.1 机械臂松开手指之前的那半秒

机械臂伸向桌上的杯子,手指已经触到杯壁,接下来要决定的是力度。这个决策不能靠试:力度轻了杯子拿不住,力度重了杯子从手里滑出去摔在地上------而机器人的动作控制频率通常在几十到上百赫兹,等下一帧反馈回来,手指早就完成了这一段行程。

所以这半秒里发生的事只有一个:在没有新观测的情况下,预测接下来会发生什么。

这件事本身不需要什么宏大的理论。预测器接受"当前状态 + 打算施加的动作",输出"接下来状态的分布"。如果这个分布足够准,动作就可以在接触之前被调整;如果不存在这个分布,系统就只能靠真实试错来积累经验,而每一次试错都可能损坏硬件。

这个能力就是世界模型。它和"生成一段好看的视频"没有必然关系------第 1.4 节会专门讲这个混淆,它是本领域目前最大的语义污染源。

1.2 试错放在哪里

强化学习里有个老问题:经验很贵。无模型方法(Q-learning、PPO)的结构决定了它必须"试完再学"------Q-learning 要等下一个状态和奖励回来才能更新 Q 值,PPO 要收集足够多的轨迹才能做一次策略提升。样本效率低在这里不是缺陷,而是这套方法的定义。

有模型方法的结构不同:它先学一个环境模型,然后让规划器在这个模型内部反复试错。真实环境的交互次数从"覆盖整个状态-动作空间"降到"覆盖模型难以预测的区域"。

无模型强化学习像一个每次上路才第一次摸这辆车的司机------开得慢,但每一脚的反馈都是真的;有模型方法像先花时间把这辆车的手感记下来,再上路面时心里先有一份模型。代价是那份模型本身要学,而且模型错了会系统性地点错方向:不在真实环境里试错,意味着错误也能提前被纠正,前提是模型足够准。

背景补遗: DreamerV3 把这套流程的鲁棒性推到了极端------一套超参数在 150 多个不同领域的任务上不用调参5。这 150 个任务里包含 Atari、Minecraft、Crafter、DMControl,奖励尺度、观测维度、动作空间全不一样。同一份代码能跑通这批任务,靠的是 symlog、two-hot 编码、KL 平衡、free bits 一系列专门用来消除量纲依赖的处理(见第 5.5 节)。

维度 无模型方法 有模型方法
试错发生的位置 真实环境 模型内部(内心推演)
真实交互需求 高,需覆盖状态-动作空间 低,主要补模型不确定的区域
模型误差的影响 不适用 误差在多步推演中累积(第 9.9 节)
典型代表 DQN、PPO、SAC Dreamer、MuZero、TD-MPC、V-JEPA 2-AC
主要瓶颈 样本效率 模型精度与误差复合

1.3 两种已经产生实际收益的用法

用法一:规划器的内部模拟器

MuZero 之后的规划类方法有一个共同结构:在模型里展开 k 步动作序列,用 MCTS 或 MPPI 搜索,再把最好的动作序列退回真实环境执行第一步,重新观测、重新规划。这就是所谓模型预测控制。

这里的收益可以直接量化。MuZero 在 Atari、围棋、国际象棋、将棋上达到人类水平7,而它对规则引擎一无所知------规则也是学出来的。TD-MPC2 用一套超参覆盖 104 个连续控制任务9。

用法二:数据机器

第二个用法在工业界落地更快,因为它的产物不要求实时性。做法是让世界模型生成真实数据里稀缺的那部分。

NVIDIA 的 Cosmos-Drive-Dreams 是最完整的一例。管线是:HD 地图渲染出场景骨架 → LLM 改写成生成提示 → 单视图生成 → 多视图扩展 → VLM 过滤掉物理上不成立的帧。官方开源了模型、管线和 8 万余条合成片段,并且已集成进 CARLA、Foretellix、Oxa、Plus 等仿真与训练工具链28。

效果是可测的:这些合成数据让下游 3D 检测的 mAP 提升 2.8%~3.8%,跟踪的 AMOTA 提升 8.0%~8.3%28。这两个指标衡量的是感知模型,不衡量世界模型本身------也就是说,提升是外部验证的,不是自己给自己打分。

自动驾驶里还有一个更激进的版本。蔚来的 NWM 在车端 0.1 秒内推演 216 条候选轨迹并选出最优,同时云端 NSim 闭环仿真可以用提示词编辑静态和动态物体、切换视角、生成深度与法向量44。3 秒的提示可以生成 120 秒的想象视频。这已经不是"给数据打个补丁",而是把真实世界的一部分搬进了可编辑的表示里。

1.4 一个必须先纠正的认识:视频生成模型不是世界模型

2024 年 2 月,OpenAI 在 Sora 的技术博客里把标题写成了 "Video generation models as world simulators"。这句话是整个混淆的源头。

同一篇博客里,OpenAI 自己列了四条短板:不准确建模基础物理(例如玻璃破碎)、状态变化不准、长视频不连贯、物体凭空出现49。

这是官方一手材料,不是外部批评。 一个会写进自己技术博客的自我限定,比任何第三方评测都更能说明这个问题的边界。

但真正的差别比这四条短板更深一层。Sora 这类模型的结构里没有动作输入通道。它接受文本和图像作为条件,然后生成视频。你没办法问它"如果我把这张桌子往左推 30 厘米会怎样"------不是因为它推得不准,而是因为这个问题在它的接口里根本无法表达。

这一条是本报告后续反复使用的判据,也是第 2 章要展开的核心。

顺带说清一件事:2025 到 2026 年,行业里确实出现了接受动作条件、能闭环交互的生成式系统------Genie 系列、GameNGen、Oasis 都是。它们是真世界模型,和 Sora 不是一类东西。把它们和 Sora 混为一谈,代价是把一类真正的进展也一起贬值了。

1.5 本报告的四段结构

部分 章节 解决什么问题
建立坐标 第 1~4 章 为什么需要、这个词指什么、有哪些范式、通用结构长什么样
讲透原理 第 5~9 章 各范式的具体机制与数学骨架
面向工程 第 10~13 章 仿真器栈、数据引擎、评测、选型、争议与趋势
附录 附录 A/B/C 术语表、图表索引、参考文献

只想知道该选哪条路线,读第 12 章的决策树就够了。想理解原理,第 9 章是全篇所有变体的公共底座------Dreamer、JEPA、扩散世界模型的模型结构完全不同,拆开看都在解同一个问题:如何把观测压成一个既有信息量、又可预测、还对这个任务有用的表示。


第 2 章 概念界定:一个词的三种用法

2.1 "世界模型"被用来说三件事

这个词现在至少在三个层面被使用,三者互不包含。

第一种用法是行业宣传级的:凡是能生成看起来合理的视频、或者能预测视频的系统,都被叫作世界模型。这个用法的问题不是宽松,是它把判别能力取消了------按这个定义,文本生成模型也能算,因为语言世界也需要建模。

第二种用法是强化学习里的严格定义:世界模型指一个有模型方法中用来表示环境动力学的那个可学习组件,它的输入是状态和动作,输出是下一状态的分布。这个用法历史悠久,2018 年的 "World Models" 一文和 PlaNet、Dreamer 都在这个意义上使用它123。

第三种用法是近两年生成式领域的用法:指能够接受动作条件、生成对应视频序列的系统。这个用法比第一种严格(有动作条件),但比第二种宽(不要求模型可用于规划,也不要求潜空间对决策有意义)。Genie 2、Genie 3、GameNGen、DIAMOND、Oasis 属于这一类13141522233536。

三种用法的外延关系是:第二种 ⊂ 第三种,但第一种与它们都不构成包含关系。

2.2 混淆的根源:视觉保真与决策实用几乎正交

把渲染器误认为世界模型,根源在于默认了一个未经检验的假设:画面越逼真,模型对世界的理解就越准。

这个假设不成立,而且现在有一组很干净的证据。Apple-π 基准(南洋理工 S-Lab 与港中大,2026 年 7 月)把物理定律评测拆成感知、形式化、推演三个阶段,测了 11 个模型45。结果是:最佳的视频生成模型 Seedance 2.0 只拿到 0.473 分,而以理解为主、生成能力平平的"统一理解-生成"类模型明显更高(GPT Image 2 为 0.704)。

一个能生成漂亮视频的模型,在需要分三步推演物理定律的任务上,被一个不以生成为主要能力的模型甩开。

这个反差说明生成质量和推理能力是两种不同的东西。原因也不难理解:视频生成的训练目标是像素级似然,而在像素似然下,模型学到的是"接下来的画面通常长什么样",而不是"接下来为什么会这样"。而 Apple-π 考的是后者------先从视频里提取物理量,再写出方程,最后推演结果。

指标上的正交性是同一件事的另一面:

指标类型 代表基准 问的问题 覆盖动作条件能力
视频生成质量 FVD、VBench 画面像不像、稳不稳 否
物理正确性 PhyGenBench、Physics-IQ、Apple-π 物理对不对 部分
决策有用性 Atari 100k、DMControl、Crafter、DMLab 拿来能不能做出好决策 是

这三类不能互相替代。一个系统只在第一项上好,不构成世界模型能力。

2.3 术语澄清

术语 正确内涵 常见误用 本报告用法
世界模型(World Model) 预测动作后果的内部动力学模型,输入状态与动作,输出下一状态分布 `p(s' s,a)` 等同于"视频生成模型";把没有动作接口的系统归入此类
渲染器(Renderer) 只接受文本、图像、音频等静态条件生成内容,无动作输入通道 被称为"世界模型" 明确写"渲染器"或"视频生成模型",不用世界模型一词
神经模拟器(Neural Simulator) 接受动作序列并预测多步状态(观测、奖励、终止),训练目标是压低多步预测误差 被称为"世界模型",忽略它强调的是闭环多步 用"神经模拟器"强调闭环多步预测这一子集特征
世界基座模型(World Foundation Model) 在大规模多任务数据上预训练,可向下游具身、决策或生成任务迁移,不一定生成像素 与"大模型"混用 仅用于明确声称可跨下游任务迁移的系统

2.4 本报告采用的判据

是否接受动作序列作为输入,并输出对应的状态分布。

这条判据的好处是不依赖任何视觉指标、参数量或训练数据来源。它可以被操作化成一次三步探测:

  1. 构造一段具体的动作序列,比如连续五步的转向加前进。
  2. 把这段序列交给系统,看它是否接受。
  3. 看它是否输出状态分布------即"接下来可能发生什么"及其概率或不确定性。

三步都过,是世界模型;第一步就过不去,是渲染器。

这条判据还有一个附加好处:它能区分"显式"和"隐式"。π₀ 这类模型不接受动作序列(它的输入是观测,输出直接是动作),所以判据不通过------但它在真机上确实有效。这不是判据的漏洞,而是说明"决策有用"和"有动作条件预测模型"确实是两件事,第 12 章会专门处理这个分歧。

2.5 拿四个系统走一遍

Sora:第一步就否。接口是文本和图像。你无法给它一段关节动作序列要求它输出状态分布。渲染器。

DreamerV3 :三步全过。动力学模型接受潜状态 z_t 和动作 a_t,输出下一潜状态的分布(离散 32 类 × 32 维),并且有可选解码器还原成像素5。世界模型,同时具备神经模拟器特征。

π₀ :第一步否。它把观测映射成 50 Hz 的连续动作块,内部没有显式的 p(s'\|s,a) 模块54。但它在真实机器人上的表现是当前最好的之一。判据不通过------这正是第 12 章那个争论的实质。

Genie 2:三步全过。720p 分辨率、支持键鼠控制、自回归潜扩散模型,官方口径一致性达分钟级(不过公开演示多为 10 到 20 秒)22。判据通过,所以它是真世界模型,不是渲染器。

这四个例子里,Genie 2 是最容易判错的一个。它看起来和 Sora 一样是视频生成系统,但它的采样接口接受键鼠输入、按帧交互。这一个差别就足以让两者分属不同类别。

第 3 章 建模范式全景

3.1 四个范式的划分依据

世界模型的核心区别在于训练目标是什么,而不是谁提出的。四种根本不同的训练目标导致了四个范式:

  1. 潜空间重建 + KL:通过编码器将观测压缩到潜向量,再用解码器重建观测;同时在潜空间学习动力学,并用 KL 散度正则化后验与先验的分布。此目标迫使模型在潜空间既保留足够信息以重建观测,又学习可预测的动力学。代表工作:Dreamer 系列(PlaNet、DreamerV1‑V4)23456。

  2. 抽象表征预测:不重建像素,只在高层抽象表征上预测未来表征。目标是让模型忽略不可预测的细节(如叶影、水波),专注于可预测的结构。代表工作:I‑JEPA、V‑JEPA、V‑JEPA 2101112。

  3. 只预测规划所需量:模型不重建观测,也不预测完整表征,仅预测规划或控制所需的量,如奖励、价值、终止概率或动作条件下的状态转移。此目标直接服务于下游决策。代表工作:MuZero、TD‑MPC、TD‑MPC2789。

  4. 直接预测像素/下一帧:在潜空间或像素空间直接建模下一帧观测的分布,接受动作条件(或不接受)。此目标使模型能够生成可视化的未来序列。代表工作:GameNGen、Genie 系列、Oasis、DIAMOND13141516222336。

这四个目标的差异比学术门派的差异更根本,因为它们决定了模型内部到底学了什么。

3.2 两维坐标:动作条件化 × 是否输出像素

(见下方 3‑1)

不接受动作条件 接受动作条件
输出像素 纯渲染器 Sora、Veo 3、Seedance 2.0 神经模拟器 GameNGen、Genie 2、Genie 3、GAIA 2、Oasis、DIAMOND、DreamerV3
不输出像素 表征预测(无动作) I-JEPA、V-JEPA、OpenVLA、π₀、GR00T N1 只做规划与推演 MuZero、TD-MPC2、V-JEPA 2-AC

该看什么:这张表的两行和两列就是四个范式的全部差异,读法是横看一行、竖看一列。

横看第一行(都输出像素):左边一格是纯渲染器------画面好看但没有动作输入;右边一格是神经模拟器------既能出画面又能接受动作。DIAMOND、GameNGen、Genie 都在右边一格,它们和 Sora 的差别不是画质,是多了一个动作输入通道。

竖看第二列(都接受动作条件):这一列是"世界模型"最严格意义上的样子,MuZero、TD-MPC2、V-JEPA 2-AC 都在这里。往下一格看就出了像素,往上一格看就出了画面------同一条轴上的两个格子,差别只在要不要重建观测。

两个反直觉的点:

第一,左下角这一格里有 OpenVLA 和 π₀。它们确实都没有显式的动作条件预测模块,和 I-JEPA、V-JEPA 同格。这个格子里的系统都靠大规模预训练隐式编码动力学,不是靠显式的前向推演。

第二,DreamerV3 落在右上角,但它出画面的能力来自一个可选解码器,只用于可视化潜空间推演,不用于生成视频内容。按主用途归类它应该往右下一格挪。

最后看两个对角:左上角(纯渲染器)和右下角(规划派)是分属两个领域的技术------一端是内容生产,一端是机器人控制。它们名字都叫"世界模型",但连一个共同的部件都没有。

3.3 四范式对照表

训练目标 是否生成像素 是否接受动作条件 规划方式 潜空间性质 代表工作 最大局限
潜空间重建 + KL 否(可选解码器) 是 潜空间内部搜索(CEM、MPPI)或梯度回传 信息较完整,但也学习不可预测噪声 DreamerV1‑V43456 需要解码器重建像素才能可视化;潜空间可能包含无用信息增加建模难度
抽象表征预测 否 是/否(视具体工作) 基于抽象表征的内心推演或规划 只保留可预测部分,但可能因预测目标过宽导致表征坍塌 I‑JEPA、V‑JEPA、V‑JEPA 2101112 抽象表征可能过于泛化,缺少细粒度信息;需额外正则防坍塌
只预测规划所需量 否 是 潜空间内部规划(MCTS、MPPI)或直接策略头 只保留对奖励、价值、终止有用的等价信息 MuZero7、TD‑MPC89 无法生成可视化反馈,难以用于数据增强或仿真;对非规划任务(如视频生成)无用
直接预测像素/下一帧 是 是/否 通常基于生成的像素序列进行规划(少见)或仅用于生成任务 像素空间信息丰富但包含大量不可预测细节 GameNGen14、Genie 1‑21522、Oasis36、DIAMOND13 像素预测误差易累积;生成质量受限于扩散或自回归模型的能力;对纯规划任务算力浪费

3.4 潜空间的三种性质对比

潜空间不是一种单一的存储形式,不同训练目标塑造出截然不同的潜空间性质。

重建型潜空间(Dreamer 系)旨在通过自编码器结构保留观测中的足够信息,以便解码器能够重建原始帧。因此,这种潜空间既包含可预测的动态结构,也不可避免地学习了观测中的噪声和不可预测细节(如背景纹理、随机光照)。虽然信息完整,但这些无关信息会增加动力学建模的难度,并可能导致潜空间动力学学得不够纯净。优点是可选地解码出像素用于可视化或数据增强;缺点是建模目标被无关信息稀释。

表征预测型潜空间(JEPA 系)明确放弃像素重建,只在抽象表征上做前向预测。训练目标促使模型丢掉不可预测的部分,只保留对未来表征有线性可预测的成分。这种潜空间理论上更接近"真正的世界状态",因为它过滤掉了噪声。然而,若预测目标设计不当(例如仅预测不变特征),潜空间易坍塌到常数向量,失去区分能力。因此,JEPA 系必须配合 VICReg、Barlow Twins 等正则项来防止坍塌,以确保潜空间保持足够的发散性和信息量。

价值等价型潜空间(MuZero、TD‑MPC 系)进一步收敛到仅对规划有用的信息。模型只学习能够改进策略访问分布或价值估计的状态表征,与具体的观测细节无关。这种潜空间维度通常最低,因为它只保留了策略改进所需的等价类。优点是建模目标与下游任务高度对齐,规划所需的预测误差对策略影响最小;缺点是该潜空间无法用于生成像素或进行需要观测细节的任务(如仿真视频生成),且对观测的重建能力完全丧失。

三种性质实际上形成了一条信息保留与任务相关性的光谱:从保留全部信息(重建型) → 保留可预测信息(表征预测型) → 仅保留决策相关信息(价值等价型)。不同下游任务在该光谱上的需求不同,因而没有单一潜空间能够同时优化所有目标。

3.5 为什么没有唯一最佳路线

世界模型的"最佳"完全取决于下游任务到底需要什么。

  • 若下游是规划或控制(如机器人导航、策略学习),模型需要提供状态转移的准确预测,以便在想象中试错动作序列。此时,只预测规划所需量的范式(MuZero、TD‑MPC)往往最为高效,因为它把建模资源集中在对策略有用的量上,避免在像素或不可预测细节上浪费算力。即使需要可视化调试,也可以单独训练一个轻量的解码器或渲染器。

  • 若下游是数据生成或仿真(如生成训练视频、构建虚拟环境),则必须能够产出像素级的未来帧。此时,直接预测像素的范式(GameNGen、Genie、Oasis)成为必要,尽管其在纯规划任务上的样本效率可能较低。这类模型往往兼具动作条件,能够在给定动作序列下生成对应的视频,适用于内容创建或场景增强。

  • 若下游是语义理解或抽象推理(如视频问答、因果推理),则抽象表征预测范式(JEPA 系)更合适,因为它把容量用于建模可预测的抽象结构,而不被像素噪声干扰。这类模型在需要进行零样本迁移或长时程推理时表现更佳,因为其潜空间已经过滤掉了短期噪声。

因此,没有一种训练目标能够在所有场景下都占优。实际系统往往根据任务需求选择或组合不同范式:例如,先用 JEPA 预训练得到良好的抽象表征,再在该表征上学习动作条件预测得到可规划的世界模型(如 V‑JEPA 2‑AC);或者在像素生成模型上附加一个轻量的动作条件头,以兼顾生成和规划两方面需求。

第 4 章 通用解剖

4.1 六个部件

一个完整的世界模型通常由以下六个功能部件组成,其中有些部件在特定范式下可以是可选的。

  1. 编码器(Encoder):将原始观测帧(如 RGB 图像)映射到潜状态表示。在重建型和表征预测型世界模型中是必需的;在纯规划型中有时可以省略,直接使用原始观测作为状态(但通常仍需要编码以减少维度)。

  2. 动力学模型(Dynamics Model):在潜空间预测下一步潜状态,接受当前潜状态和动作作为输入,输出下一潜状态的分布(或确定值)。这是世界模型的核心,负责"想象"中状态如何随动作演进。

  3. 解码器(Decoder,可选):将潜状态映射回观测空间(如像素)。仅在需要生成像素或进行观测重建的范式中存在(如 Dreamer 系、GameNGen、Oasis)。在纯规划型和 JEPA 系中通常不包含解码器,因为它们不需要像素输出。

  4. 表示/奖励预测头(Representation / Reward Prediction Head):从潜状态预测中间量,如奖励、终止概率、价值或用于规划的抽象表征。此头部在 MuZero、TD‑MPC、Dreamer 系中用于提供规划所需的标准信号;在 JEPA 系中可能仅预测抽象表征本身。

  5. 规划器或策略头(Planner or Policy Head):利用动力学模型和奖励/价值头进行未来轨迹搜索或直接输出动作。规划器可以是基于采样的方法(CEM、MPPI)、基于树搜索的 MCTS,或是一个学习的策略网络(actor)。在纯推理阶段,此部件将潜状态转换为实际动作。

  6. 潜状态缓存(Latent State Cache):用于存储最近的潜状态序列,以便动力学模型进行多步推理或提供历史信息。在需要进行 rollout 的场景中必然存在;在仅做单步预测的系统中可以省略。

以上六个部件共同构成了从观测到动作的完整闭环。不同范式通过启用或禁用特定部件来实现其训练目标。

4.2 架构图

(图 4‑1)
#mermaid-svg-OJI0e8GEvbMJlbOX{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-OJI0e8GEvbMJlbOX .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-OJI0e8GEvbMJlbOX .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-OJI0e8GEvbMJlbOX .error-icon{fill:#552222;}#mermaid-svg-OJI0e8GEvbMJlbOX .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-OJI0e8GEvbMJlbOX .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-OJI0e8GEvbMJlbOX .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-OJI0e8GEvbMJlbOX .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-OJI0e8GEvbMJlbOX .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-OJI0e8GEvbMJlbOX .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-OJI0e8GEvbMJlbOX .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-OJI0e8GEvbMJlbOX .marker{fill:#333333;stroke:#333333;}#mermaid-svg-OJI0e8GEvbMJlbOX .marker.cross{stroke:#333333;}#mermaid-svg-OJI0e8GEvbMJlbOX svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-OJI0e8GEvbMJlbOX p{margin:0;}#mermaid-svg-OJI0e8GEvbMJlbOX .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-OJI0e8GEvbMJlbOX .cluster-label text{fill:#333;}#mermaid-svg-OJI0e8GEvbMJlbOX .cluster-label span{color:#333;}#mermaid-svg-OJI0e8GEvbMJlbOX .cluster-label span p{background-color:transparent;}#mermaid-svg-OJI0e8GEvbMJlbOX .label text,#mermaid-svg-OJI0e8GEvbMJlbOX span{fill:#333;color:#333;}#mermaid-svg-OJI0e8GEvbMJlbOX .node rect,#mermaid-svg-OJI0e8GEvbMJlbOX .node circle,#mermaid-svg-OJI0e8GEvbMJlbOX .node ellipse,#mermaid-svg-OJI0e8GEvbMJlbOX .node polygon,#mermaid-svg-OJI0e8GEvbMJlbOX .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-OJI0e8GEvbMJlbOX .rough-node .label text,#mermaid-svg-OJI0e8GEvbMJlbOX .node .label text,#mermaid-svg-OJI0e8GEvbMJlbOX .image-shape .label,#mermaid-svg-OJI0e8GEvbMJlbOX .icon-shape .label{text-anchor:middle;}#mermaid-svg-OJI0e8GEvbMJlbOX .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-OJI0e8GEvbMJlbOX .rough-node .label,#mermaid-svg-OJI0e8GEvbMJlbOX .node .label,#mermaid-svg-OJI0e8GEvbMJlbOX .image-shape .label,#mermaid-svg-OJI0e8GEvbMJlbOX .icon-shape .label{text-align:center;}#mermaid-svg-OJI0e8GEvbMJlbOX .node.clickable{cursor:pointer;}#mermaid-svg-OJI0e8GEvbMJlbOX .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-OJI0e8GEvbMJlbOX .arrowheadPath{fill:#333333;}#mermaid-svg-OJI0e8GEvbMJlbOX .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-OJI0e8GEvbMJlbOX .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-OJI0e8GEvbMJlbOX .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-OJI0e8GEvbMJlbOX .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-OJI0e8GEvbMJlbOX .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-OJI0e8GEvbMJlbOX .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-OJI0e8GEvbMJlbOX .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-OJI0e8GEvbMJlbOX .cluster text{fill:#333;}#mermaid-svg-OJI0e8GEvbMJlbOX .cluster span{color:#333;}#mermaid-svg-OJI0e8GEvbMJlbOX div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-OJI0e8GEvbMJlbOX .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-OJI0e8GEvbMJlbOX rect.text{fill:none;stroke-width:0;}#mermaid-svg-OJI0e8GEvbMJlbOX .icon-shape,#mermaid-svg-OJI0e8GEvbMJlbOX .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-OJI0e8GEvbMJlbOX .icon-shape p,#mermaid-svg-OJI0e8GEvbMJlbOX .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-OJI0e8GEvbMJlbOX .icon-shape .label rect,#mermaid-svg-OJI0e8GEvbMJlbOX .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-OJI0e8GEvbMJlbOX .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-OJI0e8GEvbMJlbOX .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-OJI0e8GEvbMJlbOX :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;}#mermaid-svg-OJI0e8GEvbMJlbOX .core>*{fill:#dde8ff!important;stroke:#335!important;}#mermaid-svg-OJI0e8GEvbMJlbOX .core span{fill:#dde8ff!important;stroke:#335!important;}#mermaid-svg-OJI0e8GEvbMJlbOX .optional>*{fill:#fff3cd!important;stroke:#886!important;}#mermaid-svg-OJI0e8GEvbMJlbOX .optional span{fill:#fff3cd!important;stroke:#886!important;}#mermaid-svg-OJI0e8GEvbMJlbOX .out>*{fill:#e8f5e9!important;stroke:#363!important;}#mermaid-svg-OJI0e8GEvbMJlbOX .out span{fill:#e8f5e9!important;stroke:#363!important;} 编码器 φ
动力学 f
解码器 ψ 可选
预测头
规划器
多步推演
观测帧 o_t
潜状态 z_t
下一潜状态 z_t+1
重建观测帧
奖励 r_t

终止 d_t

价值 v_t
动作 a_t
z_t+2
z_t+3

该看什么:视线先落在中间那条实线主干上------观测帧经编码器变成潜状态 z_t,再经动力学模型得到下一潜状态,这是所有范式共有的部分,虚线框里的解码器可以整个删掉而不影响主干。图右下角那条虚线链(z_t+1 → z_t+2 → z_t+3)是多步推演,它和主干用虚线连接,表示这一步只在推理时需要、训练时不做。图右侧的预测头分出奖励、终止、价值三路,只有 MuZero 和 TD-MPC 这类"只预测规划所需量"的路线会把它当主要监督信号。

4.3 数据流图

(图 4‑2)
#mermaid-svg-r8QcOnGnzYoUfAIn{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-r8QcOnGnzYoUfAIn .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-r8QcOnGnzYoUfAIn .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-r8QcOnGnzYoUfAIn .error-icon{fill:#552222;}#mermaid-svg-r8QcOnGnzYoUfAIn .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-r8QcOnGnzYoUfAIn .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-r8QcOnGnzYoUfAIn .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-r8QcOnGnzYoUfAIn .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-r8QcOnGnzYoUfAIn .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-r8QcOnGnzYoUfAIn .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-r8QcOnGnzYoUfAIn .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-r8QcOnGnzYoUfAIn .marker{fill:#333333;stroke:#333333;}#mermaid-svg-r8QcOnGnzYoUfAIn .marker.cross{stroke:#333333;}#mermaid-svg-r8QcOnGnzYoUfAIn svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-r8QcOnGnzYoUfAIn p{margin:0;}#mermaid-svg-r8QcOnGnzYoUfAIn .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-r8QcOnGnzYoUfAIn .cluster-label text{fill:#333;}#mermaid-svg-r8QcOnGnzYoUfAIn .cluster-label span{color:#333;}#mermaid-svg-r8QcOnGnzYoUfAIn .cluster-label span p{background-color:transparent;}#mermaid-svg-r8QcOnGnzYoUfAIn .label text,#mermaid-svg-r8QcOnGnzYoUfAIn span{fill:#333;color:#333;}#mermaid-svg-r8QcOnGnzYoUfAIn .node rect,#mermaid-svg-r8QcOnGnzYoUfAIn .node circle,#mermaid-svg-r8QcOnGnzYoUfAIn .node ellipse,#mermaid-svg-r8QcOnGnzYoUfAIn .node polygon,#mermaid-svg-r8QcOnGnzYoUfAIn .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-r8QcOnGnzYoUfAIn .rough-node .label text,#mermaid-svg-r8QcOnGnzYoUfAIn .node .label text,#mermaid-svg-r8QcOnGnzYoUfAIn .image-shape .label,#mermaid-svg-r8QcOnGnzYoUfAIn .icon-shape .label{text-anchor:middle;}#mermaid-svg-r8QcOnGnzYoUfAIn .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-r8QcOnGnzYoUfAIn .rough-node .label,#mermaid-svg-r8QcOnGnzYoUfAIn .node .label,#mermaid-svg-r8QcOnGnzYoUfAIn .image-shape .label,#mermaid-svg-r8QcOnGnzYoUfAIn .icon-shape .label{text-align:center;}#mermaid-svg-r8QcOnGnzYoUfAIn .node.clickable{cursor:pointer;}#mermaid-svg-r8QcOnGnzYoUfAIn .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-r8QcOnGnzYoUfAIn .arrowheadPath{fill:#333333;}#mermaid-svg-r8QcOnGnzYoUfAIn .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-r8QcOnGnzYoUfAIn .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-r8QcOnGnzYoUfAIn .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-r8QcOnGnzYoUfAIn .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-r8QcOnGnzYoUfAIn .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-r8QcOnGnzYoUfAIn .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-r8QcOnGnzYoUfAIn .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-r8QcOnGnzYoUfAIn .cluster text{fill:#333;}#mermaid-svg-r8QcOnGnzYoUfAIn .cluster span{color:#333;}#mermaid-svg-r8QcOnGnzYoUfAIn div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-r8QcOnGnzYoUfAIn .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-r8QcOnGnzYoUfAIn rect.text{fill:none;stroke-width:0;}#mermaid-svg-r8QcOnGnzYoUfAIn .icon-shape,#mermaid-svg-r8QcOnGnzYoUfAIn .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-r8QcOnGnzYoUfAIn .icon-shape p,#mermaid-svg-r8QcOnGnzYoUfAIn .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-r8QcOnGnzYoUfAIn .icon-shape .label rect,#mermaid-svg-r8QcOnGnzYoUfAIn .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-r8QcOnGnzYoUfAIn .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-r8QcOnGnzYoUfAIn .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-r8QcOnGnzYoUfAIn :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;}#mermaid-svg-r8QcOnGnzYoUfAIn .dyn>*{fill:#e5f2e5!important;stroke:#363!important;}#mermaid-svg-r8QcOnGnzYoUfAIn .dyn span{fill:#e5f2e5!important;stroke:#363!important;} 推理期:只需要单帧前向
训练期:需要完整序列和损失
训练后权重冻结
观测与动作序列
编码器
潜状态序列
损失:重建 + 动力学 + 奖励 + KL
反传更新参数
单帧 o_t
编码器
潜状态 z_t
z_t+1
z_t+2
推演轨迹
规划器
动作 a_t

该看什么:上下两个框是同一套模型的两种用法,共享编码器和动力学模型,但依赖的数据完全不同。训练期要的是完整序列------因为重建损失和 KL 对齐都需要看到前后帧的对应关系;推理期只要当前一帧,因为潜状态可以由上一帧的潜状态递推出来。中间那条虚线是唯一的信息通道,标注了"训练后权重冻结",说明推理期不再回传任何梯度。

4.4 ER 关系图

(图 4‑3)
#mermaid-svg-k33GfxfyVBxEsbLe{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-k33GfxfyVBxEsbLe .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-k33GfxfyVBxEsbLe .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-k33GfxfyVBxEsbLe .error-icon{fill:#552222;}#mermaid-svg-k33GfxfyVBxEsbLe .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-k33GfxfyVBxEsbLe .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-k33GfxfyVBxEsbLe .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-k33GfxfyVBxEsbLe .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-k33GfxfyVBxEsbLe .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-k33GfxfyVBxEsbLe .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-k33GfxfyVBxEsbLe .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-k33GfxfyVBxEsbLe .marker{fill:#333333;stroke:#333333;}#mermaid-svg-k33GfxfyVBxEsbLe .marker.cross{stroke:#333333;}#mermaid-svg-k33GfxfyVBxEsbLe svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-k33GfxfyVBxEsbLe p{margin:0;}#mermaid-svg-k33GfxfyVBxEsbLe .entityBox{fill:#ECECFF;stroke:#9370DB;}#mermaid-svg-k33GfxfyVBxEsbLe .relationshipLabelBox{fill:hsl(80, 100%, 96.2745098039%);opacity:0.7;background-color:hsl(80, 100%, 96.2745098039%);}#mermaid-svg-k33GfxfyVBxEsbLe .relationshipLabelBox rect{opacity:0.5;}#mermaid-svg-k33GfxfyVBxEsbLe .labelBkg{background-color:rgba(248.6666666666, 255, 235.9999999999, 0.5);}#mermaid-svg-k33GfxfyVBxEsbLe .edgeLabel .label{fill:#9370DB;font-size:14px;}#mermaid-svg-k33GfxfyVBxEsbLe .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-k33GfxfyVBxEsbLe .edge-pattern-dashed{stroke-dasharray:8,8;}#mermaid-svg-k33GfxfyVBxEsbLe .node rect,#mermaid-svg-k33GfxfyVBxEsbLe .node circle,#mermaid-svg-k33GfxfyVBxEsbLe .node ellipse,#mermaid-svg-k33GfxfyVBxEsbLe .node polygon{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-k33GfxfyVBxEsbLe .relationshipLine{stroke:#333333;stroke-width:1;fill:none;}#mermaid-svg-k33GfxfyVBxEsbLe .marker{fill:none!important;stroke:#333333!important;stroke-width:1;}#mermaid-svg-k33GfxfyVBxEsbLe .edgeLabel{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-k33GfxfyVBxEsbLe .edgeLabel .label rect{fill:rgba(232,232,232, 0.8);}#mermaid-svg-k33GfxfyVBxEsbLe .edgeLabel .label text{fill:#333;}#mermaid-svg-k33GfxfyVBxEsbLe :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 触发
编码为
按动作转移
预测
预测
推演产生
预测
打分选出
输出
OBSERVATION
string
frame_id
PK
int
width
int
height
int
channel_count
ACTION
string
action_id
PK
int
dim
bool
is_discrete
LATENT_STATE
string
latent_id
PK
int
dim
bool
from_posterior
REWARD
float
value
TERMINATION
bool
terminated
ROLLOUT
string
rollout_id
PK
int
horizon
string
action_seq
VALUE
float
value
POLICY
string
policy_id
PK
int
action_dim

该看什么:图里唯一的枢纽是 LATENT_STATE,它同时连着观测、动作、奖励、终止、推演轨迹和价值------这就是"世界模型"这个词的字面含义:观测进,动作和状态出,中间那个既不等于观测也不等于真实状态的东西叫潜状态。

视线再往右看两条路径的区别:LATENT_STATE 直接连 POLICY 的是 VLA 式路线(潜状态只做特征,动作由策略头直出);LATENT_STATE 先连 ROLLOUT 再由 ROLLOUT 连 POLICY 的是世界模型式路线(动作来自对多条假想轨迹的比较,而不是一次前向传播)。多步推演带来的延迟差异和鲁棒性差异,都来自这条岔路。

4.5 交互时序图

(图 4‑4)
WorldModel Environment Agent WorldModel Environment Agent #mermaid-svg-H8ESAxkL3uB4EF7f{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-H8ESAxkL3uB4EF7f .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-H8ESAxkL3uB4EF7f .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-H8ESAxkL3uB4EF7f .error-icon{fill:#552222;}#mermaid-svg-H8ESAxkL3uB4EF7f .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-H8ESAxkL3uB4EF7f .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-H8ESAxkL3uB4EF7f .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-H8ESAxkL3uB4EF7f .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-H8ESAxkL3uB4EF7f .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-H8ESAxkL3uB4EF7f .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-H8ESAxkL3uB4EF7f .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-H8ESAxkL3uB4EF7f .marker{fill:#333333;stroke:#333333;}#mermaid-svg-H8ESAxkL3uB4EF7f .marker.cross{stroke:#333333;}#mermaid-svg-H8ESAxkL3uB4EF7f svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-H8ESAxkL3uB4EF7f p{margin:0;}#mermaid-svg-H8ESAxkL3uB4EF7f .actor{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;}#mermaid-svg-H8ESAxkL3uB4EF7f text.actor>tspan{fill:black;stroke:none;}#mermaid-svg-H8ESAxkL3uB4EF7f .actor-line{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);}#mermaid-svg-H8ESAxkL3uB4EF7f .innerArc{stroke-width:1.5;stroke-dasharray:none;}#mermaid-svg-H8ESAxkL3uB4EF7f .messageLine0{stroke-width:1.5;stroke-dasharray:none;stroke:#333;}#mermaid-svg-H8ESAxkL3uB4EF7f .messageLine1{stroke-width:1.5;stroke-dasharray:2,2;stroke:#333;}#mermaid-svg-H8ESAxkL3uB4EF7f #arrowhead path{fill:#333;stroke:#333;}#mermaid-svg-H8ESAxkL3uB4EF7f .sequenceNumber{fill:white;}#mermaid-svg-H8ESAxkL3uB4EF7f #sequencenumber{fill:#333;}#mermaid-svg-H8ESAxkL3uB4EF7f #crosshead path{fill:#333;stroke:#333;}#mermaid-svg-H8ESAxkL3uB4EF7f .messageText{fill:#333;stroke:none;}#mermaid-svg-H8ESAxkL3uB4EF7f .labelBox{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;}#mermaid-svg-H8ESAxkL3uB4EF7f .labelText,#mermaid-svg-H8ESAxkL3uB4EF7f .labelText>tspan{fill:black;stroke:none;}#mermaid-svg-H8ESAxkL3uB4EF7f .loopText,#mermaid-svg-H8ESAxkL3uB4EF7f .loopText>tspan{fill:black;stroke:none;}#mermaid-svg-H8ESAxkL3uB4EF7f .loopLine{stroke-width:2px;stroke-dasharray:2,2;stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);}#mermaid-svg-H8ESAxkL3uB4EF7f .note{stroke:#aaaa33;fill:#fff5ad;}#mermaid-svg-H8ESAxkL3uB4EF7f .noteText,#mermaid-svg-H8ESAxkL3uB4EF7f .noteText>tspan{fill:black;stroke:none;}#mermaid-svg-H8ESAxkL3uB4EF7f .activation0{fill:#f4f4f4;stroke:#666;}#mermaid-svg-H8ESAxkL3uB4EF7f .activation1{fill:#f4f4f4;stroke:#666;}#mermaid-svg-H8ESAxkL3uB4EF7f .activation2{fill:#f4f4f4;stroke:#666;}#mermaid-svg-H8ESAxkL3uB4EF7f .actorPopupMenu{position:absolute;}#mermaid-svg-H8ESAxkL3uB4EF7f .actorPopupMenuPanel{position:absolute;fill:#ECECFF;box-shadow:0px 8px 16px 0px rgba(0,0,0,0.2);filter:drop-shadow(3px 5px 2px rgb(0 0 0 / 0.4));}#mermaid-svg-H8ESAxkL3uB4EF7f .actor-man line{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;}#mermaid-svg-H8ESAxkL3uB4EF7f .actor-man circle,#mermaid-svg-H8ESAxkL3uB4EF7f line{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;stroke-width:2px;}#mermaid-svg-H8ESAxkL3uB4EF7f :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} loop每步想象推理 alt需要重新规划(例如环境变化) 执行动作 a_{t-1}返回观测 o_t 和奖励 r_{t-1}编码观测 o_t返回潜状态 z_t提供 z_t 和假设动作 a't返回下一潜状态 z'{t+1} 和预测奖励 r'_{t+1}基于想象轨迹进行规划返回价值估计和策略建议选择动作 a_t执行动作 a_t请求重新编码最新观测返回更新后的潜状态

该看什么:序列图展示了一个完整的 agent‑environment 循环。首先,agent 在环境中执行上一步动作并获得新观测;接着,world model 被调用将观测编码为潜状态(第一次调用);随后进入一个循环,world model 反复接受当前潜状态和假设动作,输出下一潜状态和奖励,用于内心推演(第二类调用);推理结束后,world model 再次被用于基于想象轨迹进行规划,输出价值和策略建议(第三类调用);最后,根据规划结果选择动作并执行。如果在执行后检测到环境显著变化,agent 可以触发 world model 重新编码最新观测以更新状态(通过 alt 分支表示可选的重新规划路径)。

4.6 三类部件的工程属性差异

世界模型的内部部件在工程实现上呈现出不同的属性,这直接影响系统的延迟和可否离线预计算。

  • 可离线预计算的部件:编码器的权重在训练完成后固定,可在推理前加载;动力学模型的权重同样可离线存储;解码器(若存在)的权重也可离线预加载。这些部件仅需前向传播,不涉及梯度更新,因此可以在部署时一次性加载到内存或显卡中,运行时仅做矩阵乘法。

  • 必须在线运行的部件:规划器或策略头在推理时需要根据当前潜状态进行搜索或前向传播,因而必须在线运行;潜状态缓存需要在每步推理后更新,也是在线的。若规划器采用采样或树搜索(如 CEM、MPPI、MCTS),则其计算量与搜索宽度和深度直接相关,是决定端到端延迟的主要因素。

  • 决定延迟的部件:动力学模型的前向传播延迟通常较小(尤其当其为轻量的 MLP 或小型 Transformer 时),但若反复调用进行多步 rollout(例如想象 10 步),则累积延迟会显著增加。规划器的搜索过程往往是延迟的主导项,尤其是基于采样的方法需要数百次模型前向传播。因此,在对延迟敏感的场景(如实时机器人控制),常见的做法是将想象步数限制在很小的范围(如 1‑2 步),或使用更高效的规划器(如单步策略头)。

综上所述,通过合理划分哪些部件可离线预计算、哪些必须在线以及哪些是延迟瓶颈,可以在保持模型性能的同时满足不同应用场景对实时性的要求。

第 5 章 潜空间预测派:从 RSSM 到价值等价

5.1 潜状态为什么必须拆成两路

RSSM(递归状态空间模型)的潜状态不是一整块向量,而是两路并行:

ht=fh(ht−1, zt−1, at−1),zt∼fz(ht)h_t = f_h(h_{t-1},\ z_{t-1},\ a_{t-1}), \qquad z_t \sim f_z(h_t)ht=fh(ht−1, zt−1, at−1),zt∼fz(ht)

符号 含义 承担的职责
h_t 确定性状态 记忆通路。由 GRU 结构单向传递,承载"到目前为止发生过什么"
z_t 随机潜变量 不确定性通路。每一帧重新采样,承载"这一帧里哪部分是观测噪声"
a_t 动作 环境给出的控制指令
f_h 确定性转移函数 参数化的 RNN,隐状态维度固定
f_z 随机转移函数 输出一个分布(本代为 32 个离散类别 × 32 维)

拆成两路的原因很实际。如果只用一整块向量,模型必须同时用同一个通道表达"确定性累积的历史"和"这一帧的随机性",结果是两件事互相污染------要么把噪声当成状态记下来,导致状态表示随环境抖动;要么把历史压得太紧,丢掉长期记忆。

分开之后,h 像一个只读的账本,稳定地累积历史;z 像每次刷新一次的临时记录,允许变化。确定性部分保证了状态可比和可复现,随机部分保证了模型能表达"同样的历史下,这一帧观测可能不一样"这件事。

这是 Dreamer 系所有后续工作的地基,也是它比 2018 年那版 MDN-RNN 更稳的直接原因。

5.2 为什么必须用 KL 而不是直接回归

这一路的训练有个结构性矛盾。

训练时,我们想从观测反推潜状态------这叫后验 q_φ(z_t | h_t, o_t),它能看到当前帧 o_t,所以能编码得很准。

推理时,观测还没来,只能从历史采样------这叫先验 p_θ(z_t | h_t),它看不到 o_t。

两个分布必须一致,否则规划器在潜空间里推演出来的轨迹和编码器实际会产生的轨迹对不上。Dreamer 系用 KL 散度对齐它们,但不是把 KL 一股脑加进损失,而是拆成两项并分别截断梯度:

Ldyn=max⁡(1, KLsg(qϕ) ∥ pθ)L_{dyn} = \max\big(1,\ \mathrm{KL}\\mathrm{sg}(q_\\phi)\\,\\\|\\,p_\\theta\big)Ldyn=max(1, KLsg(qϕ)∥pθ)

Lrep=max⁡(1, KLqϕ ∥ sg(pθ))L_{rep} = \max\big(1,\ \mathrm{KL}q_\\phi\\,\\\|\\,\\mathrm{sg}(p_\\theta)\big)Lrep=max(1, KLqϕ∥sg(pθ))

L=λdynLdyn+λrepLrep,α=λdynλrep=0.8L = \lambda_{dyn} L_{dyn} + \lambda_{rep} L_{rep}, \qquad \alpha = \frac{\lambda_{dyn}}{\lambda_{rep}} = 0.8L=λdynLdyn+λrepLrep,α=λrepλdyn=0.8

符号 含义
sg(·) 梯度截断(stop-gradient)。该侧不接收反向传播的梯度
L_dyn 动力学损失。梯度只流向先验 p_θ,逼先验去追后验
L_rep 表征损失。梯度只流向编码器 q_φ,逼编码器去迁就先验
α 平衡系数。DreamerV3 取 0.8,即动力学损失权重略高于表征损失
1 free bits 下限,单位 nat,见 5.3 节

为什么必须分别截断梯度,这是本节最关键的一点:

  • 如果两项都回传到编码器,编码器会被拖着去迁就先验。而先验看不到观测,它能做到的最好情况就是把潜状态往"平均情况"上收。结果是编码器丢信息------学出来的潜空间虽然自洽,但不足以重建观测。
  • 如果两项都不回传到编码器,编码器就失去了唯一的训练信号。潜状态会停在随机初始化上。

截断位置(谁接收梯度)就是分工本身:sg(q_φ) 表示这一项只更新先验,sg(p_θ) 表示那一项只更新编码器。α=0.8 是两条通路的学习率配比------先验更容易优化(它要学的只是一个条件分布),所以给它的压力大一些。

5.3 free bits 为什么要设下限

max(1, ·) 里的那个 1 是 free bits,单位 nat,作用是给每个离散潜变量类别设置一个 KL 下限。

原因在于 KL 有一个廉价的退化路径:如果模型认为某个维度"根本不影响后续",它可以把该维度的先验和后验都压成同一个分布,此时 KL 精确为 0,损失达到最优。

问题是这样一来,潜空间的有效维度会被系统性地削减------模型有权决定哪些维度"不重要",而训练目标对"重要性"没有独立约束。几十个离散类别里,可能只有三四个真正承载信息,其余全部坍缩。

把下限设为 1 nat,意思是"每个类别至少要保留一点不确定性,不允许被压平"。这一项和 α=0.8 一起构成了 DreamerV2 能在 Atari 上稳定训练的两个关键机制。

5.4 一条主线:每一步都在削弱"必须精调超参"

Dreamer 系五代的演进,表面看是模型越来越大,实际上有一条清晰的内在逻辑。

2018,World Models 1。潜空间有了,但有两个硬伤:MDN-RNN 只建模一步转移(规划需要多步),控制器是 867 参数的线性层,用 CMA-ES 进化训练------进化算法要跑几百次完整 rollout 才能动一次权重,样本效率极低。

2018,PlaNet 2。换掉 MDN-RNN,引入 RSSM 并把潜状态拆成确定性和随机两路。更关键的是提出 latent overshooting:不只要求单步转移预测得准,还对多步预测的 KL 做加权,逼迫潜空间动力学学得比一步更准。规划改用交叉熵方法(CEM)在潜空间搜动作序列。

2019,Dreamer V1 3。两个改动:RSSM 换成隐式推断(从视频里学潜动态,不再依赖预先给定的潜变量分布);规划从 CEM 换成内心推演------在潜空间推出轨迹后,直接对整条轨迹反传梯度训练 actor-critic,不再需要采样搜索。这一步把"在世界模型内部学策略"的成本降了一个量级。

2020,DreamerV2 4。引入离散潜变量(32 类 × 32 维)和 KL 平衡,首次在 Atari 上达到人类水平,成为第一个纯基于模型的方案超越人类基准。

2023,DreamerV3 5。这一代的目标不是刷分,是消除调参。symlog、two-hot、百分位回报归一化、逐类别 KL 平衡、free bits、1% 均匀混合------一整套都是冲着一个目的去的:让损失函数的量纲变得不重要。效果是一套超参数在 150 多个不同领域的任务上不用调。

2025,DreamerV4 6。Hafner 与 Lillicrap 的后续工作,用 tokenizer 加 Transformer 动力学加 shortcut forcing 把推理做到实时交互,据称首次仅用离线视频(VPT contractor 数据约 2500 小时)在 Minecraft 拿到钻石。

把这条线压缩成一句话:每一代都在削弱"你必须知道这个领域的奖励尺度、观测尺度、动作尺度,才能训出一个能用的世界模型"这件事。DreamerV3 的 150 个任务是这个目标第一次被证明可以达成。

5.5 symlog 与 two-hot:两个只有工程经验才会想到的变换

DreamerV3 那一整套技巧里,有两个特别值得单独说,因为它们解释了一个常见困惑------为什么强化学习里"回归一个数"这么麻烦。

问题:奖励可能是 +1,也可能是 1e5;不同游戏的回报尺度差好几个数量级。神经网络做回归时,输出层是线性的,大目标的梯度会淹没小目标的梯度。

symlog 是 sign(x) · log(1 + |x|)。它把线性增长压成对数增长,于是 +1 和 +1e5 的差距从 1e5 变成 5 左右。代价是它在小值附近近似恒等,所以不需要额外处理近零区域。

two-hot 是把回归变成分类。原来的做法是让网络输出一个标量 r̂,用 MSE 拟合 r。two-hot 改成让网络在固定的分箱上输出一条概率分布,真实值落在哪个箱就以相邻两个箱为目标。分箱数固定之后,输出层天然归一化,不再需要除以任何尺度,learning rate 也不需要随任务调整。

这两个变换合起来做的事是:把"损失函数的尺度敏感性"从模型设计里彻底移除。DreamerV3 能一套超参跨 150 个任务,很大程度上靠的就是它们。

5.6 训练目标的完整结构

(见下方 5-1)
#mermaid-svg-GfL8n5LyN2vmy55t{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-GfL8n5LyN2vmy55t .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-GfL8n5LyN2vmy55t .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-GfL8n5LyN2vmy55t .error-icon{fill:#552222;}#mermaid-svg-GfL8n5LyN2vmy55t .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-GfL8n5LyN2vmy55t .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-GfL8n5LyN2vmy55t .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-GfL8n5LyN2vmy55t .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-GfL8n5LyN2vmy55t .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-GfL8n5LyN2vmy55t .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-GfL8n5LyN2vmy55t .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-GfL8n5LyN2vmy55t .marker{fill:#333333;stroke:#333333;}#mermaid-svg-GfL8n5LyN2vmy55t .marker.cross{stroke:#333333;}#mermaid-svg-GfL8n5LyN2vmy55t svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-GfL8n5LyN2vmy55t p{margin:0;}#mermaid-svg-GfL8n5LyN2vmy55t .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-GfL8n5LyN2vmy55t .cluster-label text{fill:#333;}#mermaid-svg-GfL8n5LyN2vmy55t .cluster-label span{color:#333;}#mermaid-svg-GfL8n5LyN2vmy55t .cluster-label span p{background-color:transparent;}#mermaid-svg-GfL8n5LyN2vmy55t .label text,#mermaid-svg-GfL8n5LyN2vmy55t span{fill:#333;color:#333;}#mermaid-svg-GfL8n5LyN2vmy55t .node rect,#mermaid-svg-GfL8n5LyN2vmy55t .node circle,#mermaid-svg-GfL8n5LyN2vmy55t .node ellipse,#mermaid-svg-GfL8n5LyN2vmy55t .node polygon,#mermaid-svg-GfL8n5LyN2vmy55t .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-GfL8n5LyN2vmy55t .rough-node .label text,#mermaid-svg-GfL8n5LyN2vmy55t .node .label text,#mermaid-svg-GfL8n5LyN2vmy55t .image-shape .label,#mermaid-svg-GfL8n5LyN2vmy55t .icon-shape .label{text-anchor:middle;}#mermaid-svg-GfL8n5LyN2vmy55t .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-GfL8n5LyN2vmy55t .rough-node .label,#mermaid-svg-GfL8n5LyN2vmy55t .node .label,#mermaid-svg-GfL8n5LyN2vmy55t .image-shape .label,#mermaid-svg-GfL8n5LyN2vmy55t .icon-shape .label{text-align:center;}#mermaid-svg-GfL8n5LyN2vmy55t .node.clickable{cursor:pointer;}#mermaid-svg-GfL8n5LyN2vmy55t .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-GfL8n5LyN2vmy55t .arrowheadPath{fill:#333333;}#mermaid-svg-GfL8n5LyN2vmy55t .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-GfL8n5LyN2vmy55t .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-GfL8n5LyN2vmy55t .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-GfL8n5LyN2vmy55t .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-GfL8n5LyN2vmy55t .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-GfL8n5LyN2vmy55t .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-GfL8n5LyN2vmy55t .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-GfL8n5LyN2vmy55t .cluster text{fill:#333;}#mermaid-svg-GfL8n5LyN2vmy55t .cluster span{color:#333;}#mermaid-svg-GfL8n5LyN2vmy55t div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-GfL8n5LyN2vmy55t .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-GfL8n5LyN2vmy55t rect.text{fill:none;stroke-width:0;}#mermaid-svg-GfL8n5LyN2vmy55t .icon-shape,#mermaid-svg-GfL8n5LyN2vmy55t .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-GfL8n5LyN2vmy55t .icon-shape p,#mermaid-svg-GfL8n5LyN2vmy55t .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-GfL8n5LyN2vmy55t .icon-shape .label rect,#mermaid-svg-GfL8n5LyN2vmy55t .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-GfL8n5LyN2vmy55t .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-GfL8n5LyN2vmy55t .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-GfL8n5LyN2vmy55t :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;}#mermaid-svg-GfL8n5LyN2vmy55t .post>*{fill:#e3f0ff!important;stroke:#336!important;}#mermaid-svg-GfL8n5LyN2vmy55t .post span{fill:#e3f0ff!important;stroke:#336!important;}#mermaid-svg-GfL8n5LyN2vmy55t .pri>*{fill:#fff0e0!important;stroke:#863!important;}#mermaid-svg-GfL8n5LyN2vmy55t .pri span{fill:#fff0e0!important;stroke:#863!important;}#mermaid-svg-GfL8n5LyN2vmy55t .loss>*{fill:#eef7ee!important;stroke:#363!important;}#mermaid-svg-GfL8n5LyN2vmy55t .loss span{fill:#eef7ee!important;stroke:#363!important;} 确定性转移 f_h
sg 截断
sg 截断
观测帧 o_t
后验 q_phi

需要 o_t
确定性状态 h_t
确定性状态 h_t+1
先验 p_theta

不需要 o_t
动力学损失 L_dyn

梯度只进先验
表征损失 L_rep

梯度只进编码器
总损失

该看什么:图里有两个入口喂进同一个潜状态节点------o_t 喂给后验(虚线以下那一路),h_t 喂给先验。先验这一路要经过确定性转移 f_h 才能继续往下,说明它比后验少了"看当前帧"这个特权。

视线接着看两个损失框和它们的入边交叉方式:动力学损失的输入里有 sg(q_phi),所以它学不到观测侧的误差;表征损失里有 sg(p_theta),所以它学不到先验的误差。两条通路互不干扰,靠的就是这两个截断符号。

5.7 MuZero:把预测目标砍到只剩策略够用的部分

MuZero 走的是另一个极端。它完全不预测观测,也不预测像素。

学三个函数:表示 h 把历史观测映射到潜状态;动力学 g 只做两件事------预测奖励、把潜状态按动作往前推;预测 f 输出策略和价值。规划时用 MCTS 展开 k 步,训练目标只匹配三样东西:奖励、策略的访问分布、n 步回报加价值引导。观测本身从不出现在损失里7。

这个取舍的好处非常直接:训练目标与"选哪个动作更好"完全对齐。模型不需要把无用的像素细节学准,它只需要把奖励和价值学准。

代价也同样直接:潜状态里可能编码了视觉上重要但对决策无用的信息,反过来也可能丢掉了某些视觉细节。这带来一个工程上的麻烦------你没法把潜状态解码回画面来检查模型在想什么。Dreamer 系可以渲染推演轨迹,MuZero 不行。

5.8 价值等价:为什么"预测得不像"也没关系

MuZero 的做法能成立,依赖一个正式化的原理。

Grimm 等人提出的价值等价原理 17 说的是:世界模型不需要还原真实状态,只需要保证一个性质------由这个模型规划出来的策略改进量,和在真实环境里规划得到的策略改进量一致。

换句话说,如果我只在潜空间里保留了那些对选动作有用的信息,那么用这个潜空间做规划就会得到好策略。至于这个潜状态和真实物理状态像不像,模型自己说了不算,好策略说了才算。

这个原理的重要性在于它给"世界模型该预测什么"提供了一条判据,而不是一堆工程技巧。有了判据,前面那些选择就都能推出来:

  • 只想做规划 → 按价值等价裁剪预测量(MuZero 路线)
  • 还想可视化调试 → 保留重建能力(Dreamer 路线)
  • 数据严重不足 → 保留信息量最小的那一档(JEPA 路线)

顺带一提,LeCun 对这条路线有一份公开的批判性意见。《Critique of World Model》 47 明确指出连续潜变量加非生成式重构目标这两点的局限,并提出用生成式潜预测(GLP)架构替代。这场分歧的实质在第 12 章展开。

5.9 TD-MPC:补上第三条损失

TD-MPC 8 在潜空间动力学之上联合训练三项损失:

损失项 目标 作用
奖励预测 拟合 r_t 提供规划信号
价值预测 拟合 Q 迭代结果 提供规划信号
潜态一致性 让动力学推出的潜态靠近"下一帧观测的编码" 防止潜空间与真实观测脱钩

第三条是关键。纯潜空间模型有个结构性风险:编码器和动力学模型一起训练,可能收敛到一个自洽但与真实世界脱节的解------模型内部很和谐,但它编码的不是真实观测。这条一致性损失把外部观测重新拉回训练回路,充当锚点。

TD-MPC2 9 在此基础上加任务嵌入做多任务统一,单套超参覆盖 104 个连续控制任务,并且可以扩到约 3 亿参数------性能随规模近似按对数线性增长。

5.10 三条路线对照

维度 Dreamer 系(RSSM) MuZero TD-MPC2
潜状态是否可解码 是(可选解码器) 否 否
预测内容 潜状态 + 奖励 + 终止 奖励 + 价值 + 策略 奖励 + 价值 + 潜态一致性
规划方式 内心推演 + 梯度反传 MCTS MPPI 轨迹优化
训练目标 ELBO + 预测项 匹配策略改进量 三项损失加权
可解释性 可渲染潜空间推演 差 差
多任务统一 弱 弱 强(104 任务一套超参)
代表 DreamerV3 5 MuZero 7 TD-MPC2 9

三者都在潜空间做预测,差别在于预测得有多少。这个差别由价值等价原理统一解释,而选择预测多少取决于下游需要什么------这也是第 12 章决策树的第一根分叉。


第 6 章 表征预测派:从 I-JEPA 到能动手的 V-JEPA 2

6.1 I-JEPA 的问题设定

I-JEPA 10 的输入是一张图。从图里切出一个大的 context 块 和若干个小的 target 块 ,然后要求模型:只看 context,预测每个 target 块的表征------不是像素。

术语 含义
context 块 从图像中裁出的大区域,作为已观测到的部分
target 块 从图像中裁出的若干小区域,作为待预测的对象
表征 编码器输出的向量,不解码回像素

关键设计是块的大小:context 块取得很大,target 块取得小且分散。这一安排的作用是让模型没有机会对齐边缘和纹理------大块里的细节和周围上下文耦合紧密,靠局部线索猜不出来,只能依赖语义。

6.2 像素里有多少是不可预测的

这一派最核心的论证,也是整个 JEPA 路线存在的理由。

一张户外照片里,水面反光会随视角变、树叶阴影会随风动、传感器有热噪声、玻璃会有指纹。这些内容在给定上下文的情况下本质不可预测------同样的场景拍两次,这部分像素不一样。

如果训练目标要求模型预测这些像素,模型有两件事可做:要么拟合噪声(浪费容量,且在测试时全部失效),要么放弃拟合这些区域(那就要显式定义放弃哪些区域,麻烦)。像素级自监督模型处理的是同一类问题,只是应对方式不同------它用大规模数据把不可预测性平均掉。

JEPA 的做法更直接:把预测目标放在抽象表征上,让模型自己决定放弃什么。不可预测的像素细节在编码器输出里本来就不显著,模型没有动力去编码它们。

这个论证的代价要说清楚:潜空间不再能解码回像素,所以失去了一项很实用的调试手段------无法直接"看看模型想象的画面是什么样子"。第 6.8 节会回到这一点。

6.3 V-JEPA:把文本也去掉

V-JEPA 11 把自监督信号从图像换成视频,并且去掉了三样东西:文本描述、负样本、像素重建。

只用视频,训练任务是掩码式的特征预测------给定视频的某些时空片段,预测其他片段的表征。

去掉文本意味着模型不能利用任何语义先验("这是一辆车在开"这类信息),学到的纯粹是视觉动态;去掉负样本意味着不需要对比学习的负例采样,这让它比同类方法快一个量级;去掉像素重建是这一派的定义性选择,代价见前节。

论文报告的迁移成绩是:最大骨干冻结后,在 Kinetics-400 上约 81.9%、Something-Something v2 约 72.2%、ImageNet-1K 约 77.9%。这几个数字说明的是表征的质量,不是任何决策能力------它没有被评测过"给定动作会发生什么"。

6.4 JEPA 的目标函数,以及一个必须讲清的问题

训练目标写成:

LJEPA=∥gϕ(zt, at)−sg(zt′)∥2L_{JEPA} = \big\| g_\phi(z_t,\ a_t) - \mathrm{sg}(z'_t) \big\|^2LJEPA= gϕ(zt, at)−sg(zt′) 2

符号 含义
z_t 当前时刻的潜状态,由编码器从观测得到
a_t 动作
g_φ 潜空间动力学网络,输入状态和动作,输出预测的下一潜状态
z'_t 下一时刻的真实潜状态,由编码器从下一帧观测得到
sg(·) 梯度截断。目标端不回传梯度

这里有一个必须讲透的问题:梯度截断不但不能防止坍塌,它本身就是坍塌的最优解。

如果目标端 z'_t 不接收梯度,那模型唯一能做的优化就是调整 g_φ 让输出靠近目标。而"所有输入都映射到同一个常数向量"这个解,能让上述损失精确为零------这是全局最优。

也就是说,sg() 单独使用会给出一个明确的、稳定的收敛方向:坍塌。防坍塌必须靠额外的正则项,梯度截断只是把"避免通过移动目标来作弊"这个约束加上,它不解决表示退化。

这一点和扩散世界模型形成了鲜明对比:扩散模型的输出是像素,没法把所有输入映射成同一个输出(那会得到一张均质图,像素似然会立刻下降)。输出空间的选择本身就提供了抗坍塌的结构性保证。JEPA 花了额外力气(下一节的 VICReg)才补上这个保证。

6.5 VICReg 的三项正则如何分工

VICReg 18 是 JEPA 的标准搭档,完整目标:

L=λLinv+μLvar+νLcovL = \lambda L_{inv} + \mu L_{var} + \nu L_{cov}L=λLinv+μLvar+νLcov

Lvar=1D∑j=1Dmax⁡(0, γ−Var(Z:,j)+ε)L_{var} = \frac{1}{D}\sum_{j=1}^{D} \max\big(0,\ \gamma - \sqrt{\mathrm{Var}(Z_{:,j}) + \varepsilon}\big)Lvar=D1j=1∑Dmax(0, γ−Var(Z:,j)+ε )

Lcov=1D(D−1)∑i≠jC(Z)ij2L_{cov} = \frac{1}{D(D-1)} \sum_{i \neq j} C(Z)_{ij}^2Lcov=D(D−1)1i=j∑C(Z)ij2

符号 含义
L_inv 不变性项。同一样本的两个增强视图,其表征应互相接近
L_var 方差项。抗坍塌的主力,强制每个维度的标准差不低于 γ
L_cov 协方差项。惩罚维度间的冗余,防止多个维度编码同一信息
Z 一个 batch 内所有样本的表征矩阵,形状为 batch 尺寸 × D
D 表征维度
C(Z) Z 的跨维协方差矩阵
γ 方差下限。低于它就激活惩罚
ε 数值稳定项

方差项为什么是主力 :回到 6.4 节的坍塌解------所有输出塌成同一个常数向量时,每个维度的方差恰好是 0。此时 max(0, γ − 0) 取到 γ,方差项持续施加压力,坍塌解不再是全局最优。这个机制专门针对 sg() 留下的那个漏洞。

协方差项为什么需要:光有方差约束还不够。模型可以做到每个维度方差都不小,但让所有维度编码同一信息(维度之间的冗余)。协方差项把跨维相关矩阵的元素压向 0,等价于让每个维度携带正交的信息。

Barlow Twins 19 换了个参数化方式达到同一目的:直接让表征的跨维相关矩阵逼近单位矩阵------对角线元素对应"方差要够大且同一样本稳定",非对角线元素对应"维度要正交"。两种方法在数学上做的是同一件事。

6.6 V-JEPA 2:把动作接进来

V-JEPA 11 只学"世界长什么样"。V-JEPA 2 12 往前走了一步,变成"我动了会怎样",方法是两阶段。

阶段一,动作自由预训练。掩码去噪式的特征预测,输入是海量无标注视频和图像,编码器规模做到 ViT-g/16 级别(十亿参数级)。这一阶段产出的仍然是不接受动作的表征模型。

阶段二,动作条件后训练 。用不到 62 小时无标签机器人视频 (数据来自 DROID 68),训练一个动作条件预测器 g_φ,得到可规划的世界模型。

这个配置值得停下来看:预训练用百万小时量级的互联网视频,后训练只用 62 小时机器人视频。两者之间的落差说明了一件不太舒服的事------"知道世界如何变化"和"知道我的动作如何改变世界"是两种不同的能力,后者需要的是机器人视角的数据,不是更多互联网视频。

零样本迁移到新机械臂环境的抓放任务是 V-JEPA 2 报告的主要结果,许可为 MIT(部分文件 Apache 2.0)。

6.7 闭环推理:一个没有画面的 MPC 循环

(见下方 6-1)
规划器 动力学 g_phi 编码器 环境 规划器 动力学 g_phi 编码器 环境 #mermaid-svg-Eka25OR4gD67ySwC{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-Eka25OR4gD67ySwC .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-Eka25OR4gD67ySwC .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-Eka25OR4gD67ySwC .error-icon{fill:#552222;}#mermaid-svg-Eka25OR4gD67ySwC .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-Eka25OR4gD67ySwC .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-Eka25OR4gD67ySwC .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-Eka25OR4gD67ySwC .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-Eka25OR4gD67ySwC .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-Eka25OR4gD67ySwC .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-Eka25OR4gD67ySwC .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-Eka25OR4gD67ySwC .marker{fill:#333333;stroke:#333333;}#mermaid-svg-Eka25OR4gD67ySwC .marker.cross{stroke:#333333;}#mermaid-svg-Eka25OR4gD67ySwC svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-Eka25OR4gD67ySwC p{margin:0;}#mermaid-svg-Eka25OR4gD67ySwC .actor{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;}#mermaid-svg-Eka25OR4gD67ySwC text.actor>tspan{fill:black;stroke:none;}#mermaid-svg-Eka25OR4gD67ySwC .actor-line{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);}#mermaid-svg-Eka25OR4gD67ySwC .innerArc{stroke-width:1.5;stroke-dasharray:none;}#mermaid-svg-Eka25OR4gD67ySwC .messageLine0{stroke-width:1.5;stroke-dasharray:none;stroke:#333;}#mermaid-svg-Eka25OR4gD67ySwC .messageLine1{stroke-width:1.5;stroke-dasharray:2,2;stroke:#333;}#mermaid-svg-Eka25OR4gD67ySwC #arrowhead path{fill:#333;stroke:#333;}#mermaid-svg-Eka25OR4gD67ySwC .sequenceNumber{fill:white;}#mermaid-svg-Eka25OR4gD67ySwC #sequencenumber{fill:#333;}#mermaid-svg-Eka25OR4gD67ySwC #crosshead path{fill:#333;stroke:#333;}#mermaid-svg-Eka25OR4gD67ySwC .messageText{fill:#333;stroke:none;}#mermaid-svg-Eka25OR4gD67ySwC .labelBox{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;}#mermaid-svg-Eka25OR4gD67ySwC .labelText,#mermaid-svg-Eka25OR4gD67ySwC .labelText>tspan{fill:black;stroke:none;}#mermaid-svg-Eka25OR4gD67ySwC .loopText,#mermaid-svg-Eka25OR4gD67ySwC .loopText>tspan{fill:black;stroke:none;}#mermaid-svg-Eka25OR4gD67ySwC .loopLine{stroke-width:2px;stroke-dasharray:2,2;stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);}#mermaid-svg-Eka25OR4gD67ySwC .note{stroke:#aaaa33;fill:#fff5ad;}#mermaid-svg-Eka25OR4gD67ySwC .noteText,#mermaid-svg-Eka25OR4gD67ySwC .noteText>tspan{fill:black;stroke:none;}#mermaid-svg-Eka25OR4gD67ySwC .activation0{fill:#f4f4f4;stroke:#666;}#mermaid-svg-Eka25OR4gD67ySwC .activation1{fill:#f4f4f4;stroke:#666;}#mermaid-svg-Eka25OR4gD67ySwC .activation2{fill:#f4f4f4;stroke:#666;}#mermaid-svg-Eka25OR4gD67ySwC .actorPopupMenu{position:absolute;}#mermaid-svg-Eka25OR4gD67ySwC .actorPopupMenuPanel{position:absolute;fill:#ECECFF;box-shadow:0px 8px 16px 0px rgba(0,0,0,0.2);filter:drop-shadow(3px 5px 2px rgb(0 0 0 / 0.4));}#mermaid-svg-Eka25OR4gD67ySwC .actor-man line{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;}#mermaid-svg-Eka25OR4gD67ySwC .actor-man circle,#mermaid-svg-Eka25OR4gD67ySwC line{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;stroke-width:2px;}#mermaid-svg-Eka25OR4gD67ySwC :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} loop假设若干候选动作序列 观测 o_t当前潜状态 z_t输入 z_t 与候选动作 a预测潜状态 z_next与目标状态的相似度打分执行最优动作 a_star新观测 o_t+1

该看什么:这张图和常见的 MPC 流程图唯一的区别是,循环里比较的对象不是画面而是潜状态相似度。规划器做的事是------把当前潜状态和一串假设动作喂给动力学,得到一串假想潜状态,然后拿这串潜状态和"想要达到的目标状态"比对。

图里 环境 和 规划器 之间没有像素传输,只有动作出、观测进。这意味着整个闭环里没有任何环节需要把潜状态渲染成图像,这也是这条路线省算力的地方。

同时要注意 执行最优动作 之后的下一次编码:每个环境步都要重新编码一次真实观测,用它替换掉推演出来的潜状态。这是误差不累积的关键------推演只在规划窗口内有效,超出窗口就用真实观测重新锚定。

6.8 JEPA 系的代价

省下来的算力是真实的,付出去的东西也是真实的。

没法看。 潜空间不可解码,所以不能像 Dreamer 那样渲染"模型想象中的 10 步之后长什么样"。调试一个行为异常时,手头只有一串向量。这对研究迭代的效率影响不小。

诊断变难。 像素级模型出问题时,可以直接看生成的画面;表征级模型出问题时,需要额外训练探针去看潜空间里编码了什么。

依赖正则项。 抗坍塌不是结构性的,而是靠 VICReg 这类外挂正则撑起来的。正则权重(λ、μ、ν、γ)需要调,且不同任务的最优值可能不同------这和 DreamerV3 追求的"超参失效"目标是反向的。

规模还小。 V-JEPA 2 的编码器是十亿参数级,而视频生成侧的模型要大一个量级以上。这条路线目前是靠数据效率取胜,不是靠容量。

6.9 两派对照

维度 Dreamer 系(重建型潜空间) JEPA 系(表征预测型潜空间)
潜空间目标 重建像素 + KL 对齐 预测目标表征 + 方差协方差正则
抗坍塌机制 KL 平衡 + free bits(下限 1 nat) VICReg / Barlow Twins 正则
能否解码出像素 能 不能
潜空间信息量 高(含不可预测细节) 中(只保留可预测部分)
推理算力 较高(潜空间推演) 较低(无渲染需求)
调试手段 可视化潜空间推演 需外挂探针
天然适合的任务 需要想象轨迹做规划的 RL 低数据真实机器人迁移
主要弱点 建模目标被无关信息稀释 丧失可解释性,依赖正则调参
代表 DreamerV3 5 V-JEPA 2-AC 12

两派的根本分歧只有一个问题:该把不可预测的东西编码进去,还是丢掉。

Dreamer 系的答案是"编进去,靠 KL 项和 free bits 控制噪声的权重";JEPA 系的答案是"从目标函数上就不让它进来"。

前者保住了可解释性和完整信息,代价是要跟噪声搏斗;后者把噪声问题从根上消掉,代价是丢掉可解释性。到目前为止,没有第三条路同时拿到两者。

第 7 章 生成式世界模型:从 Doom 到可编辑世界

7.1 一条共同的建模式

这一派的工作目标可以写成同一个式子:

p(ot+1∣o≤t, a≤t, c)p(o_{t+1} \mid o_{\le t},\ a_{\le t},\ c)p(ot+1∣o≤t, a≤t, c)

符号 含义
o_t 第 t 步观测,通常是像素帧
a_t 第 t 步动作
c 额外条件,可以是文本、相机参数、场景描述、拓扑结构
o_{\le t} 到 t 为止的全部观测历史

实现上有两条路。扩散路线 把"预测下一帧"变成"给定含噪帧、逐步去噪",用 U-Net 或 DiT 做去噪网络;自回归路线把视频离散成 token,用 transformer 逐个预测后续 token,再解码回像素。

这两条路的差别不只是工程选择。去噪是一个全局的、条件化的迭代过程,每一步都看得到整个当前估计;自回归是逐 token 的因果过程,长序列会累积误差但更容易缓存和并行。Muse 走自回归,GameNGen 和 DIAMOND 走扩散,这个选择直接反映了两代技术的时间点。

7.2 GameNGen:帧级预测目标本身包含物理

GameNGen 14 是这条路线上最该被记住的一个结果,而它的关键数字不是"FPS 多高"。

做法很直接:以 DooM 为环境,用一个扩散模型预测下一帧。为了让它知道玩家按了什么键,论文把动作嵌入替换掉扩散 U-Net 的 cross-attention;为了让模型知道刚发生了什么,最近 64 帧(≈3.2 秒)的历史被拼在 latent 通道里一起条件化。基座模型是 Stable Diffusion v1.4。训练分两阶段:先让强化学习智能体自己玩几百小时收集轨迹,再用扩散模型拟合。

结果里有三个必须记住的数字:

指标 数值 含义
人类区分真实/模拟画面的准确率 58%~60% 接近随机猜测(50%)
PSNR 29.4 单步重建质量
单块 TPU v5 生成速度 20 FPS(4 步 DDIM) 蒸馏后约 50 FPS,质量有损
自回归稳定时长 5 分钟 不崩

人类用眼睛分不出哪段是真的,这是全篇最反直觉的一个事实。

它的含义比论文标题更大。论文没有显式建模任何物理------没有重力常数、没有碰撞检测、没有几何引擎。抛物线出现在画面里,是因为要让"下一帧像上一帧之后该有的样子",抛物线是唯一自洽的解。

换句话说:帧级预测目标本身包含物理。这个结论同时解释了几件看起来不相关的事------为什么 Dreamer 系能在潜空间里学出足够准的多步动力学,为什么一个没有任何物理引擎的 500M 参数模型(见 7.6 节的 Oasis)能做出可玩的开放世界。

边界也要一起记住:20 FPS、单帧级 PSNR、只在 DooM 这一个域验证过、自回归到 5 分钟之后未报告行为。它是一个证明,不是产品。

7.3 DIAMOND:把扩散模型当环境模型用

DIAMOND 13 走的是另一条路:不只是生成画面,而是把扩散模型当成强化学习的环境模型去用。

成绩是 Atari 100k 基准上 26 个游戏平均人类归一化分 1.46,超过全部离散 token 基线(IRIS、STORM、DreamerV3)。这是扩散类方案第一次在纯基于模型的 RL 上超过这些对手。

它影响力大于 GameNGen 的原因不在分数,在完全开源:代码、权重、项目页全部放出。GameNGen 没放。

方法上有个关键区别:DIAMOND 训练时用有标签动作(Atari 100k 的 26 个游戏每个约 2 小时;CS:GO Dust II 用 87 小时人类游玩数据约 550 万帧)。而 Genie 的潜动作是从无标注视频里无监督学出来的(见 7.4 节)。这个差别不是实现细节,它决定了需要什么数据、能不能拿到足够多的环境。

速度上 DIAMOND 在 RTX 3090 上约 10 FPS,不是严格实时。

7.4 Genie 系列:一个没有动作标签怎么办

当训练数据是海量公开视频、里面完全没有按键记录时,动作条件从哪来?

Genie 的解法是自己学一个潜动作空间。模型把"连续几帧画面发生了变化"这件事压缩成一个低维隐变量,称之为潜动作(latent action)。推理时用户按键,这个按键被映射到潜动作空间里,再由动力学模型解码出下一步画面。

这样做的结果是:用户不需要告诉模型"这是空格键",只需要告诉它"我要往这边动"。按键语义和潜动作的对应关系是训练中自行形成的。

三代的规格与可信度:

版本 时间 关键规格 交互 开源
Genie 1 15 2024-02 11B 参数(10.1B 动力学 + tokenizer + 潜动作模型),3 万小时公开网络游戏视频(数百款 2D 平台游戏) 按帧交互,约 1 FPS 否
Genie 2 22 2024-12 单张图生成 3D 可交互世界,720p,键鼠控制,自回归潜扩散 官方口径一致性"最长一分钟",公开演示多为 10~20 秒 否
Genie 3 23 2025-08-05 720p / 24 FPS,交互时长"数分钟" 新增 Promptable World Events(可用文字中途改天气、生成物体与角色);视觉记忆回溯约 1 分钟 否

2026-01-29 起,Genie 3 通过 Google AI Ultra 订阅(249.99 美元/月)向美国 18 岁以上用户开放,版本限制为单次生成 60 秒、不含 Promptable World Events 24。

Genie 2 那一行值得单独看一眼:官方口径是"一致性最长一分钟",而公开演示多为 10 到 20 秒。这两个数字之间的差距,比任何技术指标都更能说明当前生成式系统的真实状态------实验室里做得到和能稳定交付之间还有距离。

潜动作有个论文没有充分回答的问题:学出来的潜动作空间,和人类按键语义是否对齐?如果不对齐,用户按"左"而模型理解成别的,这个交互体验就无法使用。三代 Genie 都没有给出潜动作可解释性的定量评测。

7.5 Muse:把 LLM 范式整体搬过来

Microsoft 的 Muse 37 值得单独说,理由不是它的规模(1.6B 参数,在今天算小),而是它是第一个把大语言模型的整套范式原封不动搬到世界模型上的大型系统。

方面 规格
架构 1.6B 参数自回归 decoder-only Transformer
Tokenizer VQ-GAN,300×180 图像编为 540 个 token
数据 Xbox 游戏 Bleeding Edge(3D 4v4 对战)的 10 亿+图像-动作对
数据规模 约 7 年游戏时长,27,990 名玩家,7 张地图
三种模式 World Model Mode(预测世界演化)、Behaviour Policy(直接输出动作)、Full Generation
发布 2025-02-19,Nature 正刊同期刊出,权重已开源

World Model Mode 和 Behaviour Policy 分开这件事本身有信息量:同一套权重既能预测世界怎么变,也能直接给动作。这意味着预测能力和控制能力可以共享同一个 backbone,而不需要像 VLA 那样额外接一个动作头。

后续的 WHAMM 38 改了实现路径:从自回归换成 MaskGIT 两阶段结构(Backbone 约 500M + Refinement 约 250M),实现了 10+ FPS 的实时交互,分辨率 640×360,并已移植到 Quake II 上。

Muse 的架构图(见下方 7-1)
#mermaid-svg-QSGBHIc9suCtFWU2{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-QSGBHIc9suCtFWU2 .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-QSGBHIc9suCtFWU2 .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-QSGBHIc9suCtFWU2 .error-icon{fill:#552222;}#mermaid-svg-QSGBHIc9suCtFWU2 .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-QSGBHIc9suCtFWU2 .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-QSGBHIc9suCtFWU2 .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-QSGBHIc9suCtFWU2 .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-QSGBHIc9suCtFWU2 .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-QSGBHIc9suCtFWU2 .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-QSGBHIc9suCtFWU2 .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-QSGBHIc9suCtFWU2 .marker{fill:#333333;stroke:#333333;}#mermaid-svg-QSGBHIc9suCtFWU2 .marker.cross{stroke:#333333;}#mermaid-svg-QSGBHIc9suCtFWU2 svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-QSGBHIc9suCtFWU2 p{margin:0;}#mermaid-svg-QSGBHIc9suCtFWU2 .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-QSGBHIc9suCtFWU2 .cluster-label text{fill:#333;}#mermaid-svg-QSGBHIc9suCtFWU2 .cluster-label span{color:#333;}#mermaid-svg-QSGBHIc9suCtFWU2 .cluster-label span p{background-color:transparent;}#mermaid-svg-QSGBHIc9suCtFWU2 .label text,#mermaid-svg-QSGBHIc9suCtFWU2 span{fill:#333;color:#333;}#mermaid-svg-QSGBHIc9suCtFWU2 .node rect,#mermaid-svg-QSGBHIc9suCtFWU2 .node circle,#mermaid-svg-QSGBHIc9suCtFWU2 .node ellipse,#mermaid-svg-QSGBHIc9suCtFWU2 .node polygon,#mermaid-svg-QSGBHIc9suCtFWU2 .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-QSGBHIc9suCtFWU2 .rough-node .label text,#mermaid-svg-QSGBHIc9suCtFWU2 .node .label text,#mermaid-svg-QSGBHIc9suCtFWU2 .image-shape .label,#mermaid-svg-QSGBHIc9suCtFWU2 .icon-shape .label{text-anchor:middle;}#mermaid-svg-QSGBHIc9suCtFWU2 .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-QSGBHIc9suCtFWU2 .rough-node .label,#mermaid-svg-QSGBHIc9suCtFWU2 .node .label,#mermaid-svg-QSGBHIc9suCtFWU2 .image-shape .label,#mermaid-svg-QSGBHIc9suCtFWU2 .icon-shape .label{text-align:center;}#mermaid-svg-QSGBHIc9suCtFWU2 .node.clickable{cursor:pointer;}#mermaid-svg-QSGBHIc9suCtFWU2 .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-QSGBHIc9suCtFWU2 .arrowheadPath{fill:#333333;}#mermaid-svg-QSGBHIc9suCtFWU2 .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-QSGBHIc9suCtFWU2 .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-QSGBHIc9suCtFWU2 .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-QSGBHIc9suCtFWU2 .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-QSGBHIc9suCtFWU2 .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-QSGBHIc9suCtFWU2 .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-QSGBHIc9suCtFWU2 .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-QSGBHIc9suCtFWU2 .cluster text{fill:#333;}#mermaid-svg-QSGBHIc9suCtFWU2 .cluster span{color:#333;}#mermaid-svg-QSGBHIc9suCtFWU2 div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-QSGBHIc9suCtFWU2 .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-QSGBHIc9suCtFWU2 rect.text{fill:none;stroke-width:0;}#mermaid-svg-QSGBHIc9suCtFWU2 .icon-shape,#mermaid-svg-QSGBHIc9suCtFWU2 .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-QSGBHIc9suCtFWU2 .icon-shape p,#mermaid-svg-QSGBHIc9suCtFWU2 .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-QSGBHIc9suCtFWU2 .icon-shape .label rect,#mermaid-svg-QSGBHIc9suCtFWU2 .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-QSGBHIc9suCtFWU2 .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-QSGBHIc9suCtFWU2 .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-QSGBHIc9suCtFWU2 :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 输出
自回归 Transformer 1.6B
输入
当前帧
VQ-GAN Tokenizer

300x180 图像编为 540 token
动作历史
动作嵌入
序列化为 token 序列
预测后续动作与画面 token
自回归逐 token 采样
VQ-GAN 解码器
预测的未来帧
Behaviour Policy

直接输出动作

该看什么:图的三个入口只有两个真正进入主干------像素经 tokenizer 变成离散 token,动作经嵌入直接进序列,两者拼成一条 token 流。这条流进自回归 Transformer,出来的还是 token 流,然后分两路:一路解码成像素(World Model Mode),一路当动作直接用(Behaviour Policy)。

看这两路的分叉点是最有价值的地方。它说明在这个架构里,"预测世界"和"决定动作"不是两个模型,而是同一个 token 序列预测任务的两种读法。代价是两者共用一个瓶颈------如果 token 表示对动作不敏感,World Model Mode 会忽略动作输入,而 Behaviour Mode 会输出无意义动作。

7.6 Oasis:500M 参数没有任何物理引擎

Oasis 36 是这条路线的另一个极端:把规模压到极限,同时把物理机制全部删掉。

500M 参数的纯 Transformer,Minecraft 风格的开放世界,20 FPS,权重和推理代码全部开源(GitHub etched-ai/open-oasis),发布日期 2024-10-31。没有任何物理引擎------没有碰撞、没有重力、没有流体。

一个 500M 的模型能在 Minecraft 风格环境里以 20 FPS 交互运行,这件事本身就是对 GameNGen 那个结论的又一次印证:帧级预测目标足够,不需要手写物理。

后续的 Oasis 3 35 转向物理 AI 场景,重点从游戏变成多视角驾驶模拟:22 FPS、端到端延迟低于 200 毫秒、三个视角(左前、前、右前)同步生成、512×768 分辨率、按秒计费的 API。它要解决的问题已经不是"能不能生成",而是"能不能给下游感知或仿真任务用"。

7.7 视频生成派:一次诚实的自述

这一节要单独讲,因为它给出的边界信息比任何第三方评测都清楚。

Sora。官方技术博客的标题是 "Video generation models as world simulators" 49------这是混淆的源头。但同一篇博客里,OpenAI 自己列了四条短板:

  • 不准确建模基础物理,例如玻璃破碎
  • 状态变化不准
  • 长视频不连贯
  • 物体凭空出现

这四条是官方自述的边界,不是外部批评。

Veo 3(2025-05-20)50。原生音视频联合生成,单一 Transformer 联合去噪音频与视频 latent。架构上前进了一步,接口上没变------仍然没有动作条件通道。

快手的路线图论文(arXiv:2511.08585,2025-11-11)30。这篇论文自己承认核心瓶颈是实时性,并给出一句被引用很多的话:

若无法实时响应,更像离线渲染器而非真正的世界模型。

它提出一个四代分类法:Faithfulness(保真)→ Interactiveness(可交互)→ Planning(可规划)→ Stochasticity(随机性)。这个分类法的价值在于它承认了"保真"只是第一代,后面三代各有各的门槛,而当前多数系统卡在第二到第三代之间。

中国侧的对应系统也在同一时间推进,但方向分化成了两条。

一条是渲染质量路线 :Kling 3.0(2026-02-05)29 用 Omni One 统一多模态架构、原生音视频、导演记忆(元素一致性)、4K/60fps、15 秒单片段、最多 6 镜头分镜;Seedance 2.0(2026-02-12)32 走统一多模态音视频联合生成;Seedance 2.5(2026-07-31)33 做到单次原生生成 30 秒、单次最多 50 个参考素材(30 图 + 10 视频 + 10 音频)、时间戳级编辑。这条线的共同点是单条视频的质量、长度和可控性,没有动作条件接口。

另一条是动作条件与 3D 路线:腾讯混元 HY-World 2.0(2026-04-16)39 输出 3D Gaussian Splatting / Mesh / 点云,可直接导入 Unity、Unreal Engine、Isaac Sim,四阶段管线是全景生成 → 轨迹规划 → 世界扩展 → 世界合成;智源与清华、NVlabs 的 SANA-WM(2026-05-14)40 用混合线性注意力(帧级 Gated DeltaNet 加周期性 Softmax Attention)做 1 分钟 720p 的高效生成,2.6B 开源,双分支 6-DoF 相机控制。这两个系统都接了相机参数作为条件,属于"可控生成"而非严格意义的动作条件。

还有一类在做统一基座:Runway GWM-1(2025-12-11)34 分三条分支------GWM-Worlds(720p/24 FPS 可交互探索)、GWM-Robotics(机器人合成数据与策略评估)、GWM-Avatars(音频驱动交互式数字人),官方声明最终目标统一为单一基座模型。智元 GE-Act 2.0(2026-09)42 自称首个原生 WAM(World-Action Model),从随机初始化在具身操作数据上从头训练全部组件。这两条目前都只有官方口径,缺少第三方评测。

自动驾驶侧的中国布局见第 8 章(蔚来 NWM、华为 WEWA);商汤在 2025 年 2 月发布了与世界模型协同交互的 R-UniAD 路线 46。

判别框架。李飞飞团队与 World Labs 提出的三分法是目前最实用的分类:

类别 定义 例子
渲染器 静态条件输入,输出多媒体内容,不接受动作 Sora、Veo 3、Seedance、Kling 3.0
仿真器 动作条件输入,可多步推演并产生可交互轨迹 GameNGen、Genie 3、Oasis 3、GAIA-2
规划器 在仿真器之上做动作搜索以支持决策 MuZero、TD-MPC2、V-JEPA 2-AC

这三类的关系是递进但有断层的:从渲染器到仿真器要补一个动作通道和一个交互接口;从仿真器到规划器要补搜索算法和奖励/价值信号。很多宣称"世界模型"的系统只跨过了第一道坎。

7.8 全章对照

工作 接受动作 实时性 开源 物理正确性证据 最大局限
GameNGen 14 是(键盘) 20 FPS(TPU v5) 否 人类误判率 58%~60% 单游戏域,自回归 5 分钟后未报告
DIAMOND 13 是(有标签) 约 10 FPS(3090) 是 Atari 100k 平均人类归一化 1.46 需有标签动作数据
Genie 3 23 是(潜动作) 24 FPS,720p 否 官方未公布物理评测 商业版本单次 60 秒,不含 PWE
Muse / WHAM 3738 是 WHAMM 10+ FPS 是 未见物理正确性评测 1.6B 规模,分辨率 640×360
GameCraft-2 是(键鼠+自然语言) 16 FPS 论文 提出 InterBench 六维评测 需进一步第三方复现
Oasis 36 是 20 FPS 是 无物理引擎 Minecraft 风格域,500M 参数
Sora 49 否 --- 否 官方自述四条短板 无动作接口
Veo 3 50 否 --- 否 --- 无动作接口
Seedance 2.5 否 --- 否 Apple-π 上 0.473 分 无动作接口

最后一行和倒数第三行的对比值得停一下:Seedance 2.5 是当前单条视频生成质量与可控性的前列系统,而它在 Apple-π 的物理定律推演上得分 0.473。同一家技术路线在两项指标上的位置差异,正是"渲染器 ≠ 世界模型"的定量版本。

第 8 章 从实验室到产线:具身智能与智能驾驶

8.1 真实世界的三条硬约束

游戏里试错的代价是重开一局。机器人不是。

试错有物理代价。 机械臂抓空一次可能摔碎杯子,撞一下要停机检查夹爪。这种约束直接排除了"在世界模型里大量试错"这个在强化学习里最自然的做法------你确实可以想象一万次抓取,但想象出来的抓取不会真的把杯子碰碎,所以想象出来的结果对真实风险没有任何提示作用。

数据采集速度受限于人。 遥操作采集需要人守着机器逐条演示,机器时利用率极低。对比一下互联网视频的获取成本和一条遥操作轨迹的获取成本,差距是数量级的。

延迟预算很紧。 控制周期通常在几十到上百赫兹,也就是 10~100 毫秒的量级。留不出多少给"想象"。

这三条约束解释了本章后面所有的技术选择------包括为什么在真实机器人上跑得最好的方案里,居然没有一个是显式世界模型。

8.2 VLA 阵营的基本事实

先说一个反直觉但必须先讲清的事实:当前在真实机器人上落地最好的技术路线,都没有显式的世界模型组件。

主流的视觉-语言-动作模型(VLA)是"VLM 骨干 + 独立动作头"的结构:视觉编码器和语言模型拼在一起产生特征,特征进一个动作头(通常是 flow matching 或 DiT),直接输出连续动作块或离散动作 token。模型里没有 p(s'|s,a) 这样需要接受动作输入并向前推演的模块。

它们靠的是另一个机制:用超大规模预训练把动力学隐式编码进特征里。

三个代表系统的规格:

系统 骨干 动作输出 关键机制 官方公布成绩
OpenVLA 52 Llama-2 7B + DINOv2/SigLIP 双视觉编码器 离散动作 token 离散动作 token 化 完全开源;平均成功率比 55B 的 RT-2-X 高约 16.5%
π₀ 54 PaliGemma 3B DiT 动作专家,flow matching 预测 50 Hz 连续动作块 7 种机器人 68 任务、1 万小时以上预训练数据;2025-02 开源
π₀.₅ 55 π₀ 基础上加高层语义头 同上 加高层语义子任务预测 首次在全新真实家庭完成 10~15 分钟长时程任务
GR00T N1/N1.5 56 双系统 System 1 为 DiT flow matching System 2 是 Eagle VLM(约 10 Hz),System 1 约 120 Hz N1.5 真机语言跟随率 46.6% → 93.3%

FLARE 损失值得单独说一句,因为它是"隐式世界模型"这个概念目前最具体的一个实现。

GR00T N1.5 引入 FLARE(Future Latent Representation Alignment,权重 λ≈0.2)56。它的做法是:在潜空间里让当前表征和"未来的真实表征"对齐,但不生成任何像素。

这正好落在 Dreamer 系和 JEPA 系之间------它承认了"未来是重要的",也承认了"在潜空间做这件事比在像素空间便宜",但拒绝了 JEPA 最激进的假设(连像素都不能预测)。官方公布的真机语言跟随率从 46.6% 提升到 93.3% 就是这个设计的成绩。

双系统的分工图(见下方 8-1)
#mermaid-svg-MsDdXUAerui9IUWP{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-MsDdXUAerui9IUWP .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-MsDdXUAerui9IUWP .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-MsDdXUAerui9IUWP .error-icon{fill:#552222;}#mermaid-svg-MsDdXUAerui9IUWP .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-MsDdXUAerui9IUWP .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-MsDdXUAerui9IUWP .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-MsDdXUAerui9IUWP .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-MsDdXUAerui9IUWP .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-MsDdXUAerui9IUWP .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-MsDdXUAerui9IUWP .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-MsDdXUAerui9IUWP .marker{fill:#333333;stroke:#333333;}#mermaid-svg-MsDdXUAerui9IUWP .marker.cross{stroke:#333333;}#mermaid-svg-MsDdXUAerui9IUWP svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-MsDdXUAerui9IUWP p{margin:0;}#mermaid-svg-MsDdXUAerui9IUWP .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-MsDdXUAerui9IUWP .cluster-label text{fill:#333;}#mermaid-svg-MsDdXUAerui9IUWP .cluster-label span{color:#333;}#mermaid-svg-MsDdXUAerui9IUWP .cluster-label span p{background-color:transparent;}#mermaid-svg-MsDdXUAerui9IUWP .label text,#mermaid-svg-MsDdXUAerui9IUWP span{fill:#333;color:#333;}#mermaid-svg-MsDdXUAerui9IUWP .node rect,#mermaid-svg-MsDdXUAerui9IUWP .node circle,#mermaid-svg-MsDdXUAerui9IUWP .node ellipse,#mermaid-svg-MsDdXUAerui9IUWP .node polygon,#mermaid-svg-MsDdXUAerui9IUWP .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-MsDdXUAerui9IUWP .rough-node .label text,#mermaid-svg-MsDdXUAerui9IUWP .node .label text,#mermaid-svg-MsDdXUAerui9IUWP .image-shape .label,#mermaid-svg-MsDdXUAerui9IUWP .icon-shape .label{text-anchor:middle;}#mermaid-svg-MsDdXUAerui9IUWP .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-MsDdXUAerui9IUWP .rough-node .label,#mermaid-svg-MsDdXUAerui9IUWP .node .label,#mermaid-svg-MsDdXUAerui9IUWP .image-shape .label,#mermaid-svg-MsDdXUAerui9IUWP .icon-shape .label{text-align:center;}#mermaid-svg-MsDdXUAerui9IUWP .node.clickable{cursor:pointer;}#mermaid-svg-MsDdXUAerui9IUWP .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-MsDdXUAerui9IUWP .arrowheadPath{fill:#333333;}#mermaid-svg-MsDdXUAerui9IUWP .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-MsDdXUAerui9IUWP .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-MsDdXUAerui9IUWP .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-MsDdXUAerui9IUWP .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-MsDdXUAerui9IUWP .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-MsDdXUAerui9IUWP .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-MsDdXUAerui9IUWP .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-MsDdXUAerui9IUWP .cluster text{fill:#333;}#mermaid-svg-MsDdXUAerui9IUWP .cluster span{color:#333;}#mermaid-svg-MsDdXUAerui9IUWP div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-MsDdXUAerui9IUWP .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-MsDdXUAerui9IUWP rect.text{fill:none;stroke-width:0;}#mermaid-svg-MsDdXUAerui9IUWP .icon-shape,#mermaid-svg-MsDdXUAerui9IUWP .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-MsDdXUAerui9IUWP .icon-shape p,#mermaid-svg-MsDdXUAerui9IUWP .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-MsDdXUAerui9IUWP .icon-shape .label rect,#mermaid-svg-MsDdXUAerui9IUWP .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-MsDdXUAerui9IUWP .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-MsDdXUAerui9IUWP .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-MsDdXUAerui9IUWP :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} System 1 约 120 Hz 快回路
System 2 约 10 Hz 慢回路
训练期约束
视觉观测
Eagle VLM

视觉语言骨干
语言指令
高层语义子任务

例如 抓住杯子
FLARE 损失

潜空间对齐未来表征

不生成像素
DiT flow matching

动作专家
高频观测流
动作块
两个回路之间只传语义子任务

不传潜状态轨迹

该看什么:图分上下两个回路,频率差是 12 倍(10 Hz 对 120 Hz)。上面的慢回路负责理解场景和语言,把观测压缩成一句高层子任务("抓住杯子");下面的快回路接收这句子任务加高频观测,输出动作块。

两个回路之间只传这一句语义,不传潜状态轨迹------这是图里最需要留意的一点,因为它说明这个系统内部并不存在一个被反复调用的"世界模型"。FLARE 那个虚线框挂在训练期,不在推理链路里:它在训练时约束表征空间里含有未来信息,推理时并不执行任何显式的向前推演。

这也解释了为什么它比 Dreamer 系更省算力:没有推演,没有多步前瞻,动作是一次前向出来的。

8.3 JEPA 系在真机上的成绩

显式世界模型路线在真实机器人上也有硬证据,只是少。

DayDreamer 16 是最完整的一例:把 Dreamer 直接部署到真实四足机器人、机械臂、轮式机器人上,从零在线学会走路、抓取、导航,全程不用仿真器。这证明了两件事------潜空间内心推演在真实硬件上跑得通;在线学习在真机上可行。

V-JEPA 2-AC 12 是另一条:用不到 62 小时无标签机器人视频(数据来自 DROID 68)训练动作条件预测器,零样本迁移到新机械臂环境完成抓放。它是目前唯一一个在表征空间显式训练动作条件预测器、并用模型预测控制做闭环规划的开放世界模型。

两种范式的经济学完全不同:

DayDreamer 式 VLA 式(π₀、GR00T)
每个新任务的成本 重新在线训练 零,迁移即可
初始能力 无 预训练带来
数据需求 每任务都需交互 一次性大规模预训练
适合 单一本体、单任务、可反复交互 多任务、多本体
可解释性 潜空间可解码、可推演可视化 差

这不是技术优劣问题。DayDreamer 赌的是"我的本体单一、任务单一、我有的是交互时间";VLA 赌的是"我要跨很多任务、本体还经常变"。两个赌注在各自的场景下都是合理的。

8.4 只有博客、没有论文的系统

这一节没有技术内容,但必须写。

Figure 03 Helix 的官方博客称系统内含世界模型组件。没有论文、没有架构细节、没有第三方验证。1X World Model 同样只有博客演示。特斯拉的 FSD 世界模型至今没有任何技术报告,只有零星访谈。

这些不能说假,但也不能当证据用。判断方法很简单:看有没有论文或模型卡,看有没有第三方复现,看有没有公开的评测协议。三样都没有时,官方博客的定位是"能力展示",不是"技术方案披露"。

8.5 自动驾驶的三种用法

用法一:生成合成数据

GAIA-1(Wayve,2023-09)58 的结构是离散 token 世界模型(6.5B)加视频扩散解码器(2.6B)。视频、文本、动作被 VQ 统一编码成 token,自回归预测下一个 token,再解码成像素。训练数据是 4700 小时伦敦专有数据(约 4.2 亿帧)。定位很明确:神经仿真器,用来生成长尾场景、做数据增强。

GAIA-2 (Wayve,2025-03)59 换了实现:连续潜扩散加视频 tokenizer,5 视角 448×960,条件不再是笼统的文本而是一组结构化信号------ego 动作、3D 框、天气、路网、场景 embedding。这让它支持空间修补 (改一个物体的位置)和真实场景编辑,并且已经在 Wayve 内部部署。

结构化条件图(见下方 8-2)
#mermaid-svg-KK10q949q5j8NF6o{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-KK10q949q5j8NF6o .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-KK10q949q5j8NF6o .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-KK10q949q5j8NF6o .error-icon{fill:#552222;}#mermaid-svg-KK10q949q5j8NF6o .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-KK10q949q5j8NF6o .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-KK10q949q5j8NF6o .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-KK10q949q5j8NF6o .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-KK10q949q5j8NF6o .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-KK10q949q5j8NF6o .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-KK10q949q5j8NF6o .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-KK10q949q5j8NF6o .marker{fill:#333333;stroke:#333333;}#mermaid-svg-KK10q949q5j8NF6o .marker.cross{stroke:#333333;}#mermaid-svg-KK10q949q5j8NF6o svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-KK10q949q5j8NF6o p{margin:0;}#mermaid-svg-KK10q949q5j8NF6o .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-KK10q949q5j8NF6o .cluster-label text{fill:#333;}#mermaid-svg-KK10q949q5j8NF6o .cluster-label span{color:#333;}#mermaid-svg-KK10q949q5j8NF6o .cluster-label span p{background-color:transparent;}#mermaid-svg-KK10q949q5j8NF6o .label text,#mermaid-svg-KK10q949q5j8NF6o span{fill:#333;color:#333;}#mermaid-svg-KK10q949q5j8NF6o .node rect,#mermaid-svg-KK10q949q5j8NF6o .node circle,#mermaid-svg-KK10q949q5j8NF6o .node ellipse,#mermaid-svg-KK10q949q5j8NF6o .node polygon,#mermaid-svg-KK10q949q5j8NF6o .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-KK10q949q5j8NF6o .rough-node .label text,#mermaid-svg-KK10q949q5j8NF6o .node .label text,#mermaid-svg-KK10q949q5j8NF6o .image-shape .label,#mermaid-svg-KK10q949q5j8NF6o .icon-shape .label{text-anchor:middle;}#mermaid-svg-KK10q949q5j8NF6o .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-KK10q949q5j8NF6o .rough-node .label,#mermaid-svg-KK10q949q5j8NF6o .node .label,#mermaid-svg-KK10q949q5j8NF6o .image-shape .label,#mermaid-svg-KK10q949q5j8NF6o .icon-shape .label{text-align:center;}#mermaid-svg-KK10q949q5j8NF6o .node.clickable{cursor:pointer;}#mermaid-svg-KK10q949q5j8NF6o .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-KK10q949q5j8NF6o .arrowheadPath{fill:#333333;}#mermaid-svg-KK10q949q5j8NF6o .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-KK10q949q5j8NF6o .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-KK10q949q5j8NF6o .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-KK10q949q5j8NF6o .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-KK10q949q5j8NF6o .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-KK10q949q5j8NF6o .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-KK10q949q5j8NF6o .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-KK10q949q5j8NF6o .cluster text{fill:#333;}#mermaid-svg-KK10q949q5j8NF6o .cluster span{color:#333;}#mermaid-svg-KK10q949q5j8NF6o div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-KK10q949q5j8NF6o .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-KK10q949q5j8NF6o rect.text{fill:none;stroke-width:0;}#mermaid-svg-KK10q949q5j8NF6o .icon-shape,#mermaid-svg-KK10q949q5j8NF6o .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-KK10q949q5j8NF6o .icon-shape p,#mermaid-svg-KK10q949q5j8NF6o .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-KK10q949q5j8NF6o .icon-shape .label rect,#mermaid-svg-KK10q949q5j8NF6o .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-KK10q949q5j8NF6o .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-KK10q949q5j8NF6o .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-KK10q949q5j8NF6o :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 结构化条件
ego 动作轨迹
3D 目标框
天气 光照
路网结构
场景语义 embedding
连续潜扩散模型
视频 Tokenizer 解码
前视 448x960
左前视
右前视
后视
环视第五视角
下游:感知训练

仿真验证

长尾场景补齐

该看什么:图的上半部分是五类条件同时进入扩散模型,注意它们不是拼成一段文本提示,而是各自独立的条件通路------这是"可控"和"能生成"的分界线。下半部分是五视角并行输出,它们共享同一个解码器。

视线最后落到右下角:所有视角的终点是同一个"下游"节点。这一步是可验证性的关键------合成数据好不好,不看生成得多逼真,看下游感知指标有没有涨。

用法二:替代或增强仿真器

Cosmos-Drive / Cosmos-Drive-Dreams(NVIDIA,2025-06)28 是目前最接近工程落地的一例,管线是:

  1. HD 地图渲染出场景骨架
  2. LLM 改写成生成提示
  3. 单视图生成
  4. 多视图扩展
  5. VLM 过滤掉物理上不成立的帧

官方开源了模型、管线和 8 万余条合成片段,已集成进 CARLA、Foretellix、Oxa、Plus 等仿真与训练工具链。

效果是外部可验证的:合成数据让下游 3D 检测的 mAP 提升 2.8%~3.8%、跟踪的 AMOTA 提升 8.0%~8.3%28。这两项衡量的是感知模型,不是世界模型本身------所以这个提升不能被质疑为自我评分。

用法三:车端实时推演

蔚来 NWM 是车端显式推演的代表:车端 0.1 秒推演 216 条候选轨迹并选出最优;云端 NSim 闭环仿真可以用提示编辑静态和动态物体、切换视角、生成深度与法向量;3 秒提示生成 120 秒想象视频。2024-07-27 在 NIO IN 发布,2025-05-30 起分批全量推送 44。

8.6 中国车企的两派格局

华为 WEWA(2025-04-22 ADS 4.0 发布会)43 的结构是云端 World Engine 加车端 World Action Model。官方明确表态不走 VLA 路线------发布会上的原话是"华为不会走向 VLA 的路径"以及"省掉 Language 环节"。车端 WA 模型是原生基模型、MoE 多专家架构、全模态感知直接决策。官方公布的指标是端到端时延降低 50%、通行效率提升 20%、重刹率降低 30%。云端 WE 已完成 6 亿公里高速 L3 仿真验证。

⚠️ 广泛流传的"车端算力降低 75%"是媒体推算,华为官方未如此宣称。官方强调的是"模型精干、参数规模并不大、降低对车端硬件依赖"。

格局判断(本章最有价值的部分):量产车企分成"车端显式推演"(蔚来)和"车端 VLA 加云端仿真"两派,华为的 WEWA 位置介于两者之间但更强调云端。

这不是技术优劣之争,而是三个现实约束的权衡:

  • 数据归属。 车企的真实道路数据涉及用户隐私和商业机密,很难全部上传云端训练。车端 VLA 需要把模型做大才能覆盖复杂场景,这与车端算力受限直接冲突。
  • 验证成本。 世界模型可以在云端批量生成海量场景做长尾测试,VLA 的行为只在实车上出现------这意味着 VLA 路线的验证成本高得多。华为"6 亿公里仿真验证"这个数字之所以值得记,是因为它是可举证的。
  • 法规约束。 不同地区对辅助驾驶的责任界定不同,需要更强的可解释性和可追溯性。潜空间推演留下的决策链条比端到端黑箱更容易向监管解释。

三条约束指向同一个结论:显式世界模型在车端的价值,一半来自性能,一半来自可验证性。后者在监管环境下权重会越来越重。

8.7 数据引擎的三个层级

层级 代表 规模 有动作标签 成本 提供什么
互联网视频 Ego4D 65、Ego-Exo4D 66 3670 小时 / 923 人 / 9 国;1286 小时带同步第三方视角 否 极低 语义与动力学先验
真实机器人遥操作 Open X-Embodiment 67、DROID 68、UMI 69 22 数据集合并 100 万+轨迹;DROID 350 小时+ 是 极高 真实动作分布
合成数据管线 Cosmos-Drive-Dreams 28、GR00T-Dreams 70 78 万条合成轨迹(调研称等效 6500 小时人类演示) 是 中 长尾场景补齐

调研称 GR00T-Dreams 的对比是:人类只需 11 小时演示喂给模型,就能生成 78 万条合成轨迹,等效 6500 小时人类演示 70。这个倍数如果成立,说明合成管线的杠杆确实很大。但要把两个限定条件一起记:这是官方口径,且"等效"是按下游任务效果折算的,不是按数据量。

V-JEPA 2 的配置是对这个三级结构的另一种印证 12:第一阶段用百万小时量级的互联网视频,第二阶段只用 62 小时机器人视频。前后两级相差四个数量级,说明互联网视频能提供的是先验,不是动作。

结论:世界模型能不能落地,取决于第二条和第三条,不取决于第一条。互联网视频的价值在于让第一阶段不至于从零开始,但它无法替代动作标签。

8.8 本章小结

路线 有无显式动作条件预测 真机落地证据 代表 判断
Dreamer 式在线学习 有 DayDreamer 在真实四足/机械臂/轮式上从零学会 16 DayDreamer 单本体单任务可行,跨任务不行
表征预测 + MPC 有 V-JEPA 2-AC 零样本迁移抓放 12 V-JEPA 2-AC 低数据场景优势明显,规模还小
隐式(FLARE 类) 无独立模块,靠潜空间对齐 GR00T N1.5 真机跟随率 46.6%→93.3% 56 GR00T N1.5 当前唯一规模化路线
VLA 直出动作 无 π₀.₅ 全新家庭 10~15 分钟长时程 55 π₀、π₀.₅、OpenVLA 落地最广
车端显式推演 有 蔚来车端 0.1 秒推演 216 轨迹 44 NWM 兼顾性能与可验证性
只有博客 声称有 无第三方验证 Helix、1X 不作为证据

三行值得记住:DayDreamer 证明了潜空间推演能在真机上跑;GR00T N1.5 的 FLARE 证明了"隐式"不必等于"没有";蔚来 NWM 证明了车端显式推演能过量产这道关。

而 π₀ 和 GR00T N1.5 在真机上的领先,说明了一件事:在机器人上,"隐式世界模型"目前比"显式世界模型"更有效。 这个结论是否会随数据和算力变化,第 12 章会专门处理。

第 9 章 数学骨架:所有变体共享的那套方程

9.1 从 POMDP 到六个部件

第 4 章列了六个部件,那些部件不是拼出来的,它们对应 POMDP 的数学结构。

POMDP 是七元组:

⟨S, A, O, T, Z, R, γ⟩\langle \mathcal{S},\ \mathcal{A},\ \mathcal{O},\ T,\ Z,\ R,\ \gamma \rangle⟨S, A, O, T, Z, R, γ⟩

符号 含义 在世界模型里的对应物
𝒮 真实状态空间 真实世界状态,模型永远看不到
A 动作空间 第 4 章的策略头输出
𝒪 观测空间 像素帧、深度、力矩
T 真实转移 `P(s' s,a)`
Z 信念空间 潜状态所在的空间
R 奖励函数 预测头要学的目标
γ 折扣因子 价值目标的权重

"部分可观测"这个限定直接逼出了潜状态的概念。如果状态完全可观测(𝒪 = 𝒮),就不需要任何压缩,直接在真实状态上学 T 就行了。智能体的困难恰恰在于 𝒪 ≠ 𝒮------它看到的是杯子的像素,不是杯子的位置、质量、摩擦系数。

于是需要一个映射 φ: 𝒪 → Z(编码器),一个 f: (Z, A) → Z(动力学模型),以及一个可选的 ψ: Z → 𝒪(解码器)。

从这里能看出一个常被忽略的点:"模型"这个词指的是 T 的估计 f,而不是整个六部件系统。中文语境里"世界模型"经常被当成一个整体名词,但对应到数学上,它只是那个学出来的转移分布。

9.2 ELBO 与三项加权

潜空间模型面临的是一个证据问题:我们观测到 o,想知道 z 是什么,但 z 是隐变量。变分推断的做法是引入一个可计算的近似后验 q_φ(z|o),最大化一个下界:

L=λreco Eqlog⁡p(o∣z)−λKL KLqϕ(z∣o) ∥ p(z)+λpred Lpred\mathcal{L} = \lambda_{reco}\,\mathbb{E}{q}\big\\log p(o \\mid z)\\big - \lambda{KL}\,\mathrm{KL}\bigq_\\phi(z \\mid o)\\,\\\|\\,p(z)\\big + \lambda_{pred}\,\mathcal{L}_{pred}L=λrecoEqlogp(o∣z)−λKLKLqϕ(z∣o)∥p(z)+λpredLpred

符号 含义 满足的能力需求
q_φ(z|o) 变分后验(编码器),训练时用,推理时不用 观测可反推潜状态
p(z) 先验分布 潜空间可采样,推理时能向前推演
λ_reco 重建权重 编码不能丢信息
λ_KL KL 权重 潜空间要规整、可采样
λ_pred 预测权重 额外预测奖励、终止、价值
𝓛_pred 预测项 决策所需信号

为什么是加权而不是直接相加。 三个项对应三个互相冲突的能力需求:

  • 重建项要求 z 无损。权重越大,编码越完整,但 q_φ 会倾向把观测里所有东西都塞进 z,包括噪声。
  • KL 项要求 z 规整。权重越大,先验和后验越接近,推理时好推演,但 z 会倾向丢掉"当前这一步不重要"的信息。
  • 预测项要求 z 对任务有用。

这三者的最优值不在同一点。所以权重不是超参调优的产物,而是声明了这个模型是为谁服务的:λ 配得偏向重建,就得到可解释但难推演的模型;偏向 KL,就得到好推演但丢信息的模型。

RL 场景还要加一个关键细节:重建与预测必须分开加权。像素重建对决策往往不重要(在 Atari 里,弹球的像素细节不影响该不该跳),而奖励预测很重要。把它们绑在一个损失上,无法针对不同任务调整。

9.3 一个统一的骨架

现在可以把第 5、6、7 章的三个范式放进同一个框架里看。

维度 Dreamer 系(重建型) JEPA 系(表征预测型) 扩散世界模型(像素预测型)
训练目标 ELBO + 奖励/价值预测 预测目标潜状态 + VICReg 去噪下一帧
重建对象 像素(经解码器) 潜状态表征 像素
重建项权重 大且必要 不存在 即为似然本身
KL 项 存在,对齐先验与后验 不存在 不存在
抗坍塌机制 KL 平衡 + free bits VICReg / Barlow Twins 结构性,不需要
动作条件 显式 显式(后训练阶段) 显式或隐式(潜动作)
坍塌风险来源 KL 退化路径压缩有效维度 梯度截断的最优解是常数输出 无

这张表的最后一行值得单独说。

扩散世界模型不需要防坍塌,原因是它的输出空间是像素。 坍塌的定义是"所有输入映射到同一个表示"。对像素模型来说,这个解意味着输出一张均质图------而真实的下一帧不是均质的,像素级似然会立刻下降。所以坍塌在扩散模型里不是局部最优,是不适定的。

Dreamer 系需要防,但机制是间接的。 KL 存在一个退化路径:把不重要的维度先验和后验都压成同一分布,KL 精确为 0。所以它需要 free bits 来给 KL 设下限。

JEPA 系需要防得最用力。 梯度截断 sg() 不是在防坍塌,而是在制造坍塌------这是下一节要展开的。

三种范式在抗坍塌上的难度差异,不是工程成熟度问题,是输出空间选择带来的结构性差异。

9.4 梯度截断的悖论

JEPA 的目标是:

LJEPA=∥gϕ(zt, at)−sg(zt′)∥2\mathcal{L}{JEPA} = \big\| g\phi(z_t,\ a_t) - \mathrm{sg}(z'_t) \big\|^2LJEPA= gϕ(zt, at)−sg(zt′) 2

符号 含义
z_t 当前潜状态(来自编码器)
a_t 动作
g_φ 潜空间动力学网络
z'_t 下一潜状态的真实值(来自下一帧的编码)
sg(·) 梯度截断

最优解分析。 因为目标端 sg(z'_t) 不接收梯度,优化器只能调整 g_φ 和编码器。设 Z 是编码器的输出,考虑这个解:

zt′≡c对所有 (o≤t,a≤t)z't \equiv c \quad \text{对所有 } (o{\le t}, a_{\le t})zt′≡c对所有 (o≤t,a≤t)

即编码器对任何输入都输出同一个常数向量 c。此时 g_φ 可以学成常数映射 g_φ(z,a) = c,损失精确为 0。

这个解是全局最优。 换句话说,sg() 不但没有防止坍塌,它本身就是一个指向坍塌的优化信号------因为一旦编码器开始塌向 c,梯度就会把 g_φ 拉过去一起塌,两者互相强化,收敛到常数的速度快得可疑。

sg() 的真实作用是另一个:防止编码器通过移动目标来作弊(让目标变成自己容易预测的东西)。它解决这个问题,但留下了坍塌这个更大的漏洞。

VICReg 如何补上。

Lvar=1D∑j=1Dmax⁡(0, γ−Var(Z:,j)+ε)\mathcal{L}{var} = \frac{1}{D}\sum{j=1}^{D} \max\big(0,\ \gamma - \sqrt{\mathrm{Var}(Z_{:,j}) + \varepsilon}\big)Lvar=D1j=1∑Dmax(0, γ−Var(Z:,j)+ε )

代入坍塌解:Z 的每一列方差都是 0,于是每一项取到 γ,总损失是 D·γ,是个很大的值。而常数解正是让 𝓛_var 最大的输入分布。

所以方差项精确地把坍塌解从全局最优的位置上顶了出去。这是 VICReg 在这个体系里的唯一不可替代的作用------不变性项和协方差项都可以去掉,方差项不能。

9.5 VICReg 与 Barlow Twins 的等价性

L=λ Linv+μ Lvar+ν Lcov\mathcal{L} = \lambda\,\mathcal{L}{inv} + \mu\,\mathcal{L}{var} + \nu\,\mathcal{L}_{cov}L=λLinv+μLvar+νLcov

Lcov=1D(D−1)∑i≠jC(Z)ij2\mathcal{L}{cov} = \frac{1}{D(D-1)}\sum{i \neq j} C(Z)_{ij}^2Lcov=D(D−1)1i=j∑C(Z)ij2

符号 含义
Z batch 内所有样本表征组成的矩阵,形状 batch 尺寸 × D
D 表征维度
C(Z) Z 的跨维协方差矩阵,C(Z)_ij 是第 i 维和第 j 维的协方差
γ 方差下限
ε 数值稳定项

Barlow Twins 19 不写这三项,而是直接要求跨维相关矩阵逼近单位矩阵。对角线元素非 1 表示该维度方差不足或对增强不稳,非对角线元素非 0 表示维度冗余。

两种写法在数学上是同一件事的两种参数化:Barlow 的对角线项 ≈ VICReg 的不变性加方差,非对角线项 ≈ 协方差项。

这也解释了为什么 JEPA 系几乎都用 VICReg 而不是 Barlow Twins:VICReg 把"防坍塌"单独显式成一项,方便按需要调 μ;Barlow Twins 把所有约束绑在一个整体目标上,无法单独调整抗坍塌的力度。

9.6 价值等价:预测量的充分性判据

Grimm 等人的价值等价原理 17 可以写成:设策略 π 在真实模型 T 下的改进量为 J(π; T),在学到模型 f 下为 J(π; f)。若对一切策略有

J(π;T)=J(π;f)J(\pi; T) = J(\pi; f)J(π;T)=J(π;f)

则称 f 对任务 T 是价值等价的。

符号 含义
J(π; M) 策略 π 在模型 M 下的期望改进量
T 真实转移分布
f 学到的转移模型

这个判据的解释是:世界模型不需要在状态 上还原真实世界,只需要在策略改进量上对齐。潜状态编码了多少真实物理细节,模型自己说了不算,好策略说了才算。

有了这条判据,第 5 章的三个选择就能推出来:

  • 想做规划 → 按价值等价裁剪预测量(MuZero:只预测奖励与价值,不预测观测)
  • 想要可视化调试 → 保留重建能力(Dreamer:加解码器)
  • 数据极少 → 保留信息量最小的一档(JEPA:只保留可预测部分)

这条判据也是第 12 章那个争论的方法论依据:它说明"世界模型该预测什么"不是一个有唯一答案的问题,取决于下游用什么。所以"显式世界模型 vs 隐式路线"的争论,如果双方不先说清下游是什么,就无法判定。

9.7 误差复合

如果单步预测误差是 ε,系统在 H 步后的误差量级约为:

∥eH∥≈O(ε⋅λH)\|e_H\| \approx O\big(\varepsilon \cdot \lambda^{H}\big)∥eH∥≈O(ε⋅λH)

符号 含义
ε 单步预测误差
λ 系统敏感度(李雅普诺夫指数)。λ > 1 表示误差被放大
H 推演步数

这解释了为什么视频生成模型生成 10 秒还行、2 分钟就崩。取 ε = 0.01、λ = 1.05:

推演步数 H 误差放大倍数 λ^H
20 2.7
50 11.5
100 131.5
200 17,300

放大机制(见下方 9-1)
#mermaid-svg-q1jxxFBYeVZAP1QF{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-q1jxxFBYeVZAP1QF .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-q1jxxFBYeVZAP1QF .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-q1jxxFBYeVZAP1QF .error-icon{fill:#552222;}#mermaid-svg-q1jxxFBYeVZAP1QF .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-q1jxxFBYeVZAP1QF .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-q1jxxFBYeVZAP1QF .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-q1jxxFBYeVZAP1QF .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-q1jxxFBYeVZAP1QF .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-q1jxxFBYeVZAP1QF .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-q1jxxFBYeVZAP1QF .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-q1jxxFBYeVZAP1QF .marker{fill:#333333;stroke:#333333;}#mermaid-svg-q1jxxFBYeVZAP1QF .marker.cross{stroke:#333333;}#mermaid-svg-q1jxxFBYeVZAP1QF svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-q1jxxFBYeVZAP1QF p{margin:0;}#mermaid-svg-q1jxxFBYeVZAP1QF .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-q1jxxFBYeVZAP1QF .cluster-label text{fill:#333;}#mermaid-svg-q1jxxFBYeVZAP1QF .cluster-label span{color:#333;}#mermaid-svg-q1jxxFBYeVZAP1QF .cluster-label span p{background-color:transparent;}#mermaid-svg-q1jxxFBYeVZAP1QF .label text,#mermaid-svg-q1jxxFBYeVZAP1QF span{fill:#333;color:#333;}#mermaid-svg-q1jxxFBYeVZAP1QF .node rect,#mermaid-svg-q1jxxFBYeVZAP1QF .node circle,#mermaid-svg-q1jxxFBYeVZAP1QF .node ellipse,#mermaid-svg-q1jxxFBYeVZAP1QF .node polygon,#mermaid-svg-q1jxxFBYeVZAP1QF .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-q1jxxFBYeVZAP1QF .rough-node .label text,#mermaid-svg-q1jxxFBYeVZAP1QF .node .label text,#mermaid-svg-q1jxxFBYeVZAP1QF .image-shape .label,#mermaid-svg-q1jxxFBYeVZAP1QF .icon-shape .label{text-anchor:middle;}#mermaid-svg-q1jxxFBYeVZAP1QF .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-q1jxxFBYeVZAP1QF .rough-node .label,#mermaid-svg-q1jxxFBYeVZAP1QF .node .label,#mermaid-svg-q1jxxFBYeVZAP1QF .image-shape .label,#mermaid-svg-q1jxxFBYeVZAP1QF .icon-shape .label{text-align:center;}#mermaid-svg-q1jxxFBYeVZAP1QF .node.clickable{cursor:pointer;}#mermaid-svg-q1jxxFBYeVZAP1QF .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-q1jxxFBYeVZAP1QF .arrowheadPath{fill:#333333;}#mermaid-svg-q1jxxFBYeVZAP1QF .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-q1jxxFBYeVZAP1QF .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-q1jxxFBYeVZAP1QF .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-q1jxxFBYeVZAP1QF .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-q1jxxFBYeVZAP1QF .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-q1jxxFBYeVZAP1QF .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-q1jxxFBYeVZAP1QF .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-q1jxxFBYeVZAP1QF .cluster text{fill:#333;}#mermaid-svg-q1jxxFBYeVZAP1QF .cluster span{color:#333;}#mermaid-svg-q1jxxFBYeVZAP1QF div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-q1jxxFBYeVZAP1QF .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-q1jxxFBYeVZAP1QF rect.text{fill:none;stroke-width:0;}#mermaid-svg-q1jxxFBYeVZAP1QF .icon-shape,#mermaid-svg-q1jxxFBYeVZAP1QF .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-q1jxxFBYeVZAP1QF .icon-shape p,#mermaid-svg-q1jxxFBYeVZAP1QF .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-q1jxxFBYeVZAP1QF .icon-shape .label rect,#mermaid-svg-q1jxxFBYeVZAP1QF .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-q1jxxFBYeVZAP1QF .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-q1jxxFBYeVZAP1QF .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-q1jxxFBYeVZAP1QF :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 单步误差 ε = 1%
敏感度 λ = 1.05
H=20 放大 2.7 倍
H=100 放大 131 倍
H=200 放大 17300 倍
敏感度 λ = 1.02
H=100 放大 7.3 倍
敏感度 λ = 1.00
H=100 放大 1.6 倍
λ 决定崩坏发生在第几步

与单步精度无关

该看什么:三个入口是同一个单步误差 1%,往右各接一个敏感度 λ。看最上面那一支:λ=1.05 时 H=20 只放大 2.7 倍(还能看),H=100 放大 131 倍(已崩),H=200 放大 17300 倍(完全崩坏)。

这张图的重点不是"误差会变大",而是"变大多少由 λ 决定,不由模型好坏决定"。 把三条支并排看:λ=1.00 时 H=100 才 1.6 倍,λ=1.05 却是 131 倍。如果系统的敏感度是 1.05,那么无论单步误差是 0.5% 还是 0.1%,200 步后都是崩坏。提升单步精度改变不了这一项。

三类缓解手段,各自的作用机制不同:

手段 做法 改变了什么
短 horizon 分支推演 每一步用真实观测重新锚定 缩短有效 H
潜空间预测 不预测像素 降低 ε 在像素空间的破坏力
只预测规划所需量(MuZero) 减少要预测的量 降低 ε 本身

三者的共同点是都在缩短有效推演长度或降低敏感度,没有一个是在"让误差不累积"。这不是工程妥协,是指数增长下的唯一可行方向。

9.8 本章结论

回到本章开头那个问题:Dreamer、JEPA、扩散世界模型看起来模型完全不同,为什么拆开看是同一个问题?

因为三者都在回答同一个设计选择:把观测压成什么,以及压掉多少。

  • 压得最全(重建型)→ 保住可解释性,代价是噪声进来
  • 压到只剩可预测(表征预测型)→ 噪声问题从根上消失,代价是看不见了
  • 不压(像素预测型)→ 保留一切,代价是算力,且天然不坍塌

而坍塌风险的排序(扩散 < Dreamer < JEPA)、误差复合的严重程度、规划能力的上限,全部由这个选择决定。

所以看到一个新工作时,第一个问题不是"它多大、什么架构",而是:它把这个选择放在哪一边了。

第 10 章 工程栈:可微仿真器、数据引擎与部署

10.1 仿真器的三个卡点

物理仿真器一直是世界模型训练链路上最慢的一环。三个卡点决定了这一章要讲的技术栈。

第一是并行度。 传统 MuJoCo 是单线程 CPU 实现,一个环境实例占一个核心。为了提升吞吐量只能堆进程,而进程间无法共享显存,梯度也没法跨环境累积。

第二是接触梯度。 刚体接触的求解本质上是离散优化------判断两个碰撞体是否相交、求解互补约束。这些操作对参数不光滑,在接触点数量变化的边界上甚至不连续。这意味着即使把求解器包在一个可微框架里,反向传播拿到的梯度在接触切换处也是噪声。

第三是多物理耦合。 布料、软体、刚体、流体各自有成熟的专用求解器,但耦合它们需要共享状态、协商时间步,实现复杂度极高。这也是为什么很多"端到端可微物理"的工作只做刚体。

这三个卡点的严重性排序在逐年变化:并行度被 JAX/XLA 重写基本解决了,接触梯度从"没人管"变成了"当前主要的卡点"。

10.2 可微与 GPU 并行的新栈

项目 框架 可微 擅长
Brax 20 JAX 是 大规模并行刚体,训练 RL 策略
MuJoCo MJX 63 JAX / XLA 是 MuJoCo 的 GPU 重写,8192+ 场景批量
MuJoCo Warp 62 NVIDIA Warp 是 多物理耦合(2025)
Newton 62 Warp + OpenUSD 是 多物理耦合,与 OpenUSD 场景格式打通
Isaac Lab PyTorch 部分 机器人学习流程集成
DiffTaichi Taichi 是 物理过程的通用可微表达
diffmjx JAX 是 修 MJX 的接触梯度问题

MuJoCo MJX 解决并行度的方式值得说清楚:它不是让单个场景跑得快,而是让单场景变慢的同时让批量极大------8192 个场景并行时吞吐远超单场景的 CPU 实现。这是把问题从"每个环境要多快"换成"环境总数要多大"的交换。

Brax 走的是同一条路。两者都把策略网络的反向传播也放进同一个 JAX 图里,于是"采样-更新"的全流程在 GPU 上闭环,不再需要 host-device 往返。

当前真正的卡点是接触梯度。 diffmjx 这个项目的存在本身就是证据------它专门用来修 MJX 在接触处的梯度问题。

问题出在两处:一是非穿透约束用的互补松弛变量(把不等式约束变成罚函数)在这个放松过程中引入了不可微的分支;二是求解器内部为提高收敛速度做的多次迭代裁剪,截断点会丢掉梯度路径。后果是梯度能算,但算出来的方向在接触面附近常常是错的。

Newton 的方向是绕开这个问题而不是修它:不做可微求解,而是让接触求解这一步保持不可微,只把可微部分(外力、重力、关节驱动)接进梯度图。这是一种"分段的"可微策略。

10.3 不追求可微的两条路

可微不是唯一选择,有两个方向明确绕开了它。

LLMPhy 61 的做法是让大模型调用黑盒物理引擎(MuJoCo、PyBullet)做系统辨识------给定观测到的轨迹,反推系统的物理参数。它的前提假设是:引擎的物理是对的,错的是参数。

FunSearch 64(Nature 2023)是另一支:LLM 进化搜索代码来解决数学问题,代表"可执行代码即世界模型"这个思路------如果物理规律本身是已知的、可写成代码的,那模型不需要去学它,直接搜出来就行。

什么时候可微是必要的?判据很直接:看是否需要在损失函数里对物理量求梯度。

  • 需要:策略训练时希望物理反传进策略参数(需要模型与仿真器联合优化);用仿真器做数据增强且希望增强过程可学习。
  • 不需要:物理参数已知或可辨识、仿真只用来生成数据、或者仿真结果不需要参与端到端优化。

Lora 不需要可微引擎。

10.4 数据引擎的三个层级

层级 代表 规模 动作标签 成本 提供什么
互联网视频 Ego4D 65、Ego-Exo4D 66 3670 小时 / 923 人 / 9 国;1286 小时带同步第三方视角 无 极低 语义与动力学先验
真实遥操作 Open X-Embodiment 67、DROID 68、UMI 69 22 数据集合并 100 万+轨迹;DROID 350 小时+ 有 极高 真实动作分布
合成管线 Cosmos-Drive-Dreams 28、GR00T-Dreams 70 78 万条合成轨迹(⚠️官方口径待核) 有 中 长尾场景补齐

三级的分工可以这样理解:互联网视频用来让预不从零开始,但它们没有动作标签,学不到"我动了会怎样"。V-JEPA 2 的配置是对这个分工最干净的印证------第一阶段百万小时量级互联网视频,第二阶段 62 小时机器人视频 12,前后差四个数量级。

结论:能不能落地取决于第二级和第三级。

10.5 合成数据管线

(见下方 10-1)
#mermaid-svg-MHlpSrfC4wkSRzdz{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-MHlpSrfC4wkSRzdz .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-MHlpSrfC4wkSRzdz .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-MHlpSrfC4wkSRzdz .error-icon{fill:#552222;}#mermaid-svg-MHlpSrfC4wkSRzdz .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-MHlpSrfC4wkSRzdz .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-MHlpSrfC4wkSRzdz .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-MHlpSrfC4wkSRzdz .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-MHlpSrfC4wkSRzdz .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-MHlpSrfC4wkSRzdz .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-MHlpSrfC4wkSRzdz .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-MHlpSrfC4wkSRzdz .marker{fill:#333333;stroke:#333333;}#mermaid-svg-MHlpSrfC4wkSRzdz .marker.cross{stroke:#333333;}#mermaid-svg-MHlpSrfC4wkSRzdz svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-MHlpSrfC4wkSRzdz p{margin:0;}#mermaid-svg-MHlpSrfC4wkSRzdz .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-MHlpSrfC4wkSRzdz .cluster-label text{fill:#333;}#mermaid-svg-MHlpSrfC4wkSRzdz .cluster-label span{color:#333;}#mermaid-svg-MHlpSrfC4wkSRzdz .cluster-label span p{background-color:transparent;}#mermaid-svg-MHlpSrfC4wkSRzdz .label text,#mermaid-svg-MHlpSrfC4wkSRzdz span{fill:#333;color:#333;}#mermaid-svg-MHlpSrfC4wkSRzdz .node rect,#mermaid-svg-MHlpSrfC4wkSRzdz .node circle,#mermaid-svg-MHlpSrfC4wkSRzdz .node ellipse,#mermaid-svg-MHlpSrfC4wkSRzdz .node polygon,#mermaid-svg-MHlpSrfC4wkSRzdz .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-MHlpSrfC4wkSRzdz .rough-node .label text,#mermaid-svg-MHlpSrfC4wkSRzdz .node .label text,#mermaid-svg-MHlpSrfC4wkSRzdz .image-shape .label,#mermaid-svg-MHlpSrfC4wkSRzdz .icon-shape .label{text-anchor:middle;}#mermaid-svg-MHlpSrfC4wkSRzdz .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-MHlpSrfC4wkSRzdz .rough-node .label,#mermaid-svg-MHlpSrfC4wkSRzdz .node .label,#mermaid-svg-MHlpSrfC4wkSRzdz .image-shape .label,#mermaid-svg-MHlpSrfC4wkSRzdz .icon-shape .label{text-align:center;}#mermaid-svg-MHlpSrfC4wkSRzdz .node.clickable{cursor:pointer;}#mermaid-svg-MHlpSrfC4wkSRzdz .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-MHlpSrfC4wkSRzdz .arrowheadPath{fill:#333333;}#mermaid-svg-MHlpSrfC4wkSRzdz .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-MHlpSrfC4wkSRzdz .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-MHlpSrfC4wkSRzdz .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-MHlpSrfC4wkSRzdz .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-MHlpSrfC4wkSRzdz .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-MHlpSrfC4wkSRzdz .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-MHlpSrfC4wkSRzdz .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-MHlpSrfC4wkSRzdz .cluster text{fill:#333;}#mermaid-svg-MHlpSrfC4wkSRzdz .cluster span{color:#333;}#mermaid-svg-MHlpSrfC4wkSRzdz div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-MHlpSrfC4wkSRzdz .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-MHlpSrfC4wkSRzdz rect.text{fill:none;stroke-width:0;}#mermaid-svg-MHlpSrfC4wkSRzdz .icon-shape,#mermaid-svg-MHlpSrfC4wkSRzdz .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-MHlpSrfC4wkSRzdz .icon-shape p,#mermaid-svg-MHlpSrfC4wkSRzdz .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-MHlpSrfC4wkSRzdz .icon-shape .label rect,#mermaid-svg-MHlpSrfC4wkSRzdz .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-MHlpSrfC4wkSRzdz .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-MHlpSrfC4wkSRzdz .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-MHlpSrfC4wkSRzdz :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} HD 地图与路网
规则化渲染

产出几何骨架
LLM 改写生成提示
扩散模型生成

单视图
多视图扩展
VLM 物理过滤

剔除不成立帧
视觉语言标注
可训练数据集
真实采集数据

动作标签真实
按比例混合
训练感知或策略模型

该看什么:这条管线的输入只有地图和提示词,没有任何真实数据参与------所以它是纯生成式的。三个环节最值得留意:

一是左边的 REN(规则化渲染)。它只提供几何骨架(车道线、建筑轮廓),不提供外观细节,外观全部由扩散模型补。这解释了为什么合成数据能覆盖长尾场景:几何由规则保证正确,外观由模型补齐。

二是中间的 FIL(VLM 物理过滤)。生成模型产出的帧里有一部分物理上不成立(物体悬浮、穿透、光影矛盾),这一步用视觉语言模型筛掉。这是当前管线里最关键也最不可替代的一环------没有它,合成数据的质量上限由生成模型的缺陷决定。

三是右下的 MIX。合成数据几乎从不单独使用,通常与真实数据按比例混合。纯合成数据训练出的模型在真实数据上通常会掉点,混合比例是一个需要调的超参。

Cosmos-Drive-Dreams 是这条管线的完整实现,官方开源了模型、管线和 8 万余条合成片段,已集成进 CARLA、Foretellix、Oxa、Plus 等工具链 28。

10.6 训练与部署的切分

部件 训练期 推理期 延迟影响
编码器 / tokenizer 训练(学权重) 前向,必须在线 单次前向,中等
动力学模型 训练 前向,必须在线 推演 N 步就是 N 倍
解码器 训练 可省略 生成时才付
策略头 训练 前向,必须在线 单次前向
规划器 不用 必须在线 延迟主导项
潜状态缓存 不用 增量更新 小

两个延迟来源要分清。

多步推演的累积延迟是线性的。10 步推演就是 10 次动力学前向。这个开销有时是值得付的(规划需要前瞻),有时可以直接砍掉------如果策略头本身已经学会了最优动作,推演只是重复它的工作。

规划器的搜索开销往往更贵。采样类方法(CEM、MPPI)需要生成数百到数千条候选动作序列并逐条前向。MuZero 的 MCTS 更重,每次展开都要做一次策略与价值网络前向。

可用的数字参照:GR00T N1.5 的 System 2 约 10 Hz、System 1 约 120 Hz 56;GE-Act 2.0 在 RTX 5090 单卡 104 毫秒一个动作块(52 个动作 @30Hz);WHAMM 10+ FPS 38;Oasis 20 FPS 36;Oasis 3 22 FPS、端到端延迟低于 200 毫秒 35;GameNGen 在单块 TPU v5 上 20 FPS 14。

这些数字放在一起能看出一条线:渲染类系统已经进到 20 FPS 以上,表征类系统的推理成本还要低一个量级,而机器人控制的下限是 10~100 Hz。这个差距决定了哪些系统能上车、哪些只能跑在云端。

10.7 本章小结

结论 依据
并行度问题已被 JAX/XLA 重写基本解决 MuJoCo MJX 8192+ 场景批量 63
当前主要卡点已转为接触梯度不对 diffmjx 专为修此问题而建 2063
可微不是必需,取决于是否需要在损失里对物理求梯度 LLMPhy 61、FunSearch 64 提供两条替代路线
合成管线的质量上限由 VLM 过滤环节决定 Cosmos-Drive-Dreams 开源管线含该环节 28
落地取决于遥操作与合成两级数据,不取决于互联网视频 V-JEPA 2 两阶段相差四个数量级 12

第 11 章 评测:测什么才不会被骗

11.1 三类指标互不覆盖

Seedance 2.0 是当前单条视频生成质量与可控性的前列系统。它在 Apple-π 物理定律基准上的得分是 0.473 45。

这两个事实放在一起,说明评测必须分三层做:

指标类型 代表基准 问的问题 覆盖动作条件能力
视频生成质量 FVD 71、VBench 72 画面像不像、稳不稳 否
物理正确性 PhyGenBench 73、Physics-IQ 74、Apple-π 45 物理对不对 部分
决策有用性 Atari 100k、DMControl、Crafter、DMLab、NetHack 76 拿来能不能做出好决策 是

三层之间不能互相替代。一个系统只在第一层上做得好,不构成世界模型能力------它可能只是在生成统计上像样的帧。

11.2 视频生成侧基准及其局限

FVD 71 用 I3D 特征计算两组视频之间的 Fréchet 距离,是视频生成的事实标准之一。

它的局限要说透:FVD 是一个单一标量,把所有类型的差异压进一个数。这导致两类完全不同的失败被同等对待------"画面内容完全正确但细节模糊"和"画面细节漂亮但内容是错的",FVD 给不出区分这两者的信息。它也无法回答"这个模型的错误是随机的还是系统的"。

VBench 72 把视频质量拆成多个解耦维度(主体一致性、运动平滑度、时间闪烁、语义匹配等)做细粒度打分,并引入人类偏好标注。它解决了 FVD 的"单一标量"问题,但仍有一个结构性局限:所有维度都是在无动作条件下评的。生成同样的画面质量,一个接受动作输入的系统和一个不接受的系统在这个基准上得分相同。

11.3 物理正确性基准

PhyGenBench 73(清华)用提示词考物理常识,覆盖力学、光学、热学、材料,问"这个场景会不会出现镜面反射""这个会不会浮起来"。它的考法是文本到视频,本质上测的是模型把物理知识注入画面的能力,而不是预测的准确性。知识会的东西和能从状态推演出结果的东西,是两种不同的能力。

Physics-IQ 74 用真实物理实验视频做续帧预测,综合空间 IoU、时空 IoU、加权空间 IoU 和 MSE 归一化评分。它有一个设计上很值得学的处理:把真实视频之间的自然差异定为满分基准。

这个思路为什么合理:要求模型逐像素匹配下一帧是不合理的------空气里的尘埃、传感器噪声、摄像机微抖都会造成无法消除的差异,这些差异计入惩罚等于惩罚模型的正确行为。把"同一真实实验下的两段视频之间的差异"定为满分线,衡量的是"模型是否达到了真实世界自身的随机水平"。

WorldModelBench 75 换了个角度:直接问"视频生成模型是否具备世界模型能力",考察指令遵循、常识、以及物理依从(牛顿第一定律、固体力学、流体力学、不可渗透、重力五类违例)。

Apple-π 45(南洋理工 S-Lab 与港中大,2026-07-17)是目前分得最细的一个。它用 Orchard 数据集的 400 个视频、10 个经典力学任务,把物理定律评测拆成三阶段协议:

  1. Perception(感知):从视频中提取物理量
  2. Formulation(形式化):把物理量写成方程
  3. Deduction(推演):算出结果

结果:11 个模型受测,最佳视频生成模型 Seedance 2.0 仅 0.473 分,而统一理解-生成类模型明显更高(GPT Image 2 为 0.704,Nano Banana 2 为 0.699)45。

这个反差是本节最有价值的信息。一个能生成漂亮视频的模型,在需要分三步推演物理定律时被以理解为主的模型甩开。原因不难理解:生成训练的优化目标是像素级似然。学到的因此是"接下来的画面通常长什么样",而不是"接下来为什么会这样"。

11.4 决策有用性基准

这是世界模型真正该被考的地方,因为它直接对应"用了有没有用"。

常用基准:DMLab、Crafter、Atari 100k、MiniGrid、DMControl、NetHack 76。

这层的特点是无标准答案------不像物理那样有唯一正确的下一帧。评价方式是训练一个策略出来,看策略在真实环境里的回报。DIAMOND 在 Atari 100k 上 26 个游戏平均人类归一化分 1.46 13 是这一层的标杆数字,超过 IRIS、STORM、DreamerV3。

这一层的成本最高:每次评测都要跑完整的训练流程。这也是为什么大量世界模型工作会跳过这一层,只报 FVD 和物理分数。

11.5 评测覆盖的两个维度

(见下方 11-1)

不接受动作条件 接受动作条件
有像素输出评测 FVD 71、VBench 72、PhyGenBench 73、Apple-π 45、Physics-IQ 74、WorldModelBench 75 无专门基准
无像素输出评测 无专门基准 Atari 100k 76、DMControl 76、Crafter 76、DMLab 76、NetHack 76
被评测的对象举例 Sora 49、Veo 3 50、Seedance 2.0 DreamerV3 5、MuZero 7、DIAMOND 13、GameNGen 14、Genie 3 23、V-JEPA 2-AC 12

该看什么:这张表要看的不是"哪个基准更好",而是哪一格几乎没人测。

右上一格是空的。 同时要求"模型输出像素"和"模型接受动作条件"的系统,一个专门基准都没有------这一格对应"用视频模型做动作条件控制",而 GameNGen、Genie 3、Oasis 3 这些系统全在这一格,它们目前的物理正确性证据要么是人类误判率,要么是厂商自述。

左下格也是空的。 只评测表征能力、不涉及像素也不涉及动作的格子,没有任何基准落在这里。这对应 JEPA 系的核心主张------潜空间是否有足够表征能力------目前只能间接通过右下角的决策任务成绩来推断。

最需要记住的是中间那一整行:六个视频/物理基准全部落在"不接受动作条件"那一列。也就是说,用这一行里任何一个基准给一个世界模型选型,等于完全没有测到它的世界模型能力。第 12.4 节的"选型错误三"说的就是这件事。

11.6 五种常见失效模式

失效模式 可观测症状 成因 缓解手段
漂移 推演到第 20 步画面崩坏 单步误差经 Lyapunov 指数放大 短 horizon 分支推演、潜空间预测、只预测规划所需量
凭空生成 出现观测里没依据的物体 重建损失权重不足或潜空间容量过大 降低解码器容量、提高 KL 权重、缩短推演长度
一致性崩坏 同一场景两次生成差异大 潜状态未真正编码场景身份 场景级条件编码、一致性约束
对动作不敏感 不同动作生成结果几乎一样 动作条件注入过弱,被视觉 token 淹没 动作条件 dropout、调整动作嵌入位置
物理违背 物体穿透、重力方向错误 训练数据中物理事件稀疏,或目标只优化视觉似然 引入物理先验损失、扩大训练集物理事件覆盖

其中对动作不敏感这一项在生成式世界模型上最隐蔽,因为它不体现为任何质量指标的下降------画面照样好看,FVD 照样低。识别方法只有一个:给定同一观测、输入两个明显不同的动作,看输出是否不同。

11.7 失效模式的关系图

(见下方 11-2)
#mermaid-svg-GBSuCKVu3ZtcOvRq{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-GBSuCKVu3ZtcOvRq .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-GBSuCKVu3ZtcOvRq .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-GBSuCKVu3ZtcOvRq .error-icon{fill:#552222;}#mermaid-svg-GBSuCKVu3ZtcOvRq .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-GBSuCKVu3ZtcOvRq .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-GBSuCKVu3ZtcOvRq .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-GBSuCKVu3ZtcOvRq .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-GBSuCKVu3ZtcOvRq .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-GBSuCKVu3ZtcOvRq .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-GBSuCKVu3ZtcOvRq .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-GBSuCKVu3ZtcOvRq .marker{fill:#333333;stroke:#333333;}#mermaid-svg-GBSuCKVu3ZtcOvRq .marker.cross{stroke:#333333;}#mermaid-svg-GBSuCKVu3ZtcOvRq svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-GBSuCKVu3ZtcOvRq p{margin:0;}#mermaid-svg-GBSuCKVu3ZtcOvRq .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-GBSuCKVu3ZtcOvRq .cluster-label text{fill:#333;}#mermaid-svg-GBSuCKVu3ZtcOvRq .cluster-label span{color:#333;}#mermaid-svg-GBSuCKVu3ZtcOvRq .cluster-label span p{background-color:transparent;}#mermaid-svg-GBSuCKVu3ZtcOvRq .label text,#mermaid-svg-GBSuCKVu3ZtcOvRq span{fill:#333;color:#333;}#mermaid-svg-GBSuCKVu3ZtcOvRq .node rect,#mermaid-svg-GBSuCKVu3ZtcOvRq .node circle,#mermaid-svg-GBSuCKVu3ZtcOvRq .node ellipse,#mermaid-svg-GBSuCKVu3ZtcOvRq .node polygon,#mermaid-svg-GBSuCKVu3ZtcOvRq .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-GBSuCKVu3ZtcOvRq .rough-node .label text,#mermaid-svg-GBSuCKVu3ZtcOvRq .node .label text,#mermaid-svg-GBSuCKVu3ZtcOvRq .image-shape .label,#mermaid-svg-GBSuCKVu3ZtcOvRq .icon-shape .label{text-anchor:middle;}#mermaid-svg-GBSuCKVu3ZtcOvRq .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-GBSuCKVu3ZtcOvRq .rough-node .label,#mermaid-svg-GBSuCKVu3ZtcOvRq .node .label,#mermaid-svg-GBSuCKVu3ZtcOvRq .image-shape .label,#mermaid-svg-GBSuCKVu3ZtcOvRq .icon-shape .label{text-align:center;}#mermaid-svg-GBSuCKVu3ZtcOvRq .node.clickable{cursor:pointer;}#mermaid-svg-GBSuCKVu3ZtcOvRq .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-GBSuCKVu3ZtcOvRq .arrowheadPath{fill:#333333;}#mermaid-svg-GBSuCKVu3ZtcOvRq .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-GBSuCKVu3ZtcOvRq .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-GBSuCKVu3ZtcOvRq .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-GBSuCKVu3ZtcOvRq .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-GBSuCKVu3ZtcOvRq .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-GBSuCKVu3ZtcOvRq .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-GBSuCKVu3ZtcOvRq .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-GBSuCKVu3ZtcOvRq .cluster text{fill:#333;}#mermaid-svg-GBSuCKVu3ZtcOvRq .cluster span{color:#333;}#mermaid-svg-GBSuCKVu3ZtcOvRq div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-GBSuCKVu3ZtcOvRq .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-GBSuCKVu3ZtcOvRq rect.text{fill:none;stroke-width:0;}#mermaid-svg-GBSuCKVu3ZtcOvRq .icon-shape,#mermaid-svg-GBSuCKVu3ZtcOvRq .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-GBSuCKVu3ZtcOvRq .icon-shape p,#mermaid-svg-GBSuCKVu3ZtcOvRq .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-GBSuCKVu3ZtcOvRq .icon-shape .label rect,#mermaid-svg-GBSuCKVu3ZtcOvRq .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-GBSuCKVu3ZtcOvRq .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-GBSuCKVu3ZtcOvRq .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-GBSuCKVu3ZtcOvRq :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 失效模式
漂移

推演到后段崩坏
凭空生成

内容无观测依据
一致性崩坏

同场景多次生成差异大
对动作不敏感

换动作输出不变
物理违背

穿透 重力方向错
成因 单步误差被 Lyapunov 指数放大
缓解 缩短推演窗口 用真实观测重新锚定
成因 重建权重低 潜空间容量过大
缓解 提高 KL 权重 降低解码器容量
成因 潜状态未编码场景身份
缓解 场景级条件编码
成因 动作 token 被视觉 token 淹没
缓解 动作条件 dropout 调整注入位置
成因 训练集物理事件稀疏
缓解 物理先验损失 扩大事件覆盖
这一项不影响任何质量指标

只能靠动作条件测试发现

该看什么:图左半部分是五种失效模式,右半部分分别是成因和缓解手段,成对出现。

视线最后落到右下角那个独立节点:对动作不敏感是五种失效里唯一不体现在任何质量指标上的。画面保真度、一致性、物理正确性这些指标对它全部无感------因为一个完全忽略动作输入的模型,在这些指标上可以表现得很好。

这也是为什么第 11.8 节那条纪律要单独列出来。

11.8 一条评测纪律

任何"世界模型超过人类水平"的宣称,都必须回答三个问题:

  1. 在哪个基准上? 报了基准名字才算数,只说"人类水平"不算。
  2. 用的什么观测? 纯像素输入,还是给了结构化状态?给了状态的方案和纯像素方案不可比。
  3. 训练时看了多少数据? 100 小时视频训练出的模型和 10 万小时训练出的模型达到同一分数,含金量完全不同。

三个条件缺一个,比较就不成立。

这三问不是苛刻要求,而是因为世界模型领域目前正处在一个宣称高度通胀的阶段------从 2024 年 Sora 的官方博客开始,大量系统被冠以同一个名字,而衡量它们的指标又各不相同。把三问变成惯例,是这个领域最需要的自我约束。

第 12 章 选型:三条路该走哪条

12.1 动手之前先答三个问题

读任何论文之前,先把这三个问题答完。答案会直接排除掉大部分候选。

问题一:需要模型输出像素吗?

  • 需要 → JEPA 系被排除(它的潜空间不可解码),第 7 章的扩散路线成为主要候选。
  • 不需要 → 扩散系的价值大幅下降,第 5 章的潜空间路线更划算。

问题二:有动作标签吗?

  • 没有 → 无监督潜动作路线(Genie 系)或表征预测路线(JEPA 系)。
  • 有 → 可以直接做动作条件预测,Dreamer 系、MuZero、DIAMOND 全部可用。

问题三:闭环控制还是离线数据生成?

  • 闭环控制 → 必须有规划和在线推演,纯渲染器被排除。
  • 离线生成 → 更看重生成多样性、覆盖度、长时一致性,规划能力可以不要。

这三个问题里,问题一和问题三是硬约束,问题二是数据约束------它决定你有没有选择。

12.2 决策树

(见下方 12-1)
#mermaid-svg-qeXSFbOyPJUXLrZa{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-qeXSFbOyPJUXLrZa .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-qeXSFbOyPJUXLrZa .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-qeXSFbOyPJUXLrZa .error-icon{fill:#552222;}#mermaid-svg-qeXSFbOyPJUXLrZa .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-qeXSFbOyPJUXLrZa .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-qeXSFbOyPJUXLrZa .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-qeXSFbOyPJUXLrZa .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-qeXSFbOyPJUXLrZa .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-qeXSFbOyPJUXLrZa .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-qeXSFbOyPJUXLrZa .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-qeXSFbOyPJUXLrZa .marker{fill:#333333;stroke:#333333;}#mermaid-svg-qeXSFbOyPJUXLrZa .marker.cross{stroke:#333333;}#mermaid-svg-qeXSFbOyPJUXLrZa svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-qeXSFbOyPJUXLrZa p{margin:0;}#mermaid-svg-qeXSFbOyPJUXLrZa .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-qeXSFbOyPJUXLrZa .cluster-label text{fill:#333;}#mermaid-svg-qeXSFbOyPJUXLrZa .cluster-label span{color:#333;}#mermaid-svg-qeXSFbOyPJUXLrZa .cluster-label span p{background-color:transparent;}#mermaid-svg-qeXSFbOyPJUXLrZa .label text,#mermaid-svg-qeXSFbOyPJUXLrZa span{fill:#333;color:#333;}#mermaid-svg-qeXSFbOyPJUXLrZa .node rect,#mermaid-svg-qeXSFbOyPJUXLrZa .node circle,#mermaid-svg-qeXSFbOyPJUXLrZa .node ellipse,#mermaid-svg-qeXSFbOyPJUXLrZa .node polygon,#mermaid-svg-qeXSFbOyPJUXLrZa .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-qeXSFbOyPJUXLrZa .rough-node .label text,#mermaid-svg-qeXSFbOyPJUXLrZa .node .label text,#mermaid-svg-qeXSFbOyPJUXLrZa .image-shape .label,#mermaid-svg-qeXSFbOyPJUXLrZa .icon-shape .label{text-anchor:middle;}#mermaid-svg-qeXSFbOyPJUXLrZa .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-qeXSFbOyPJUXLrZa .rough-node .label,#mermaid-svg-qeXSFbOyPJUXLrZa .node .label,#mermaid-svg-qeXSFbOyPJUXLrZa .image-shape .label,#mermaid-svg-qeXSFbOyPJUXLrZa .icon-shape .label{text-align:center;}#mermaid-svg-qeXSFbOyPJUXLrZa .node.clickable{cursor:pointer;}#mermaid-svg-qeXSFbOyPJUXLrZa .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-qeXSFbOyPJUXLrZa .arrowheadPath{fill:#333333;}#mermaid-svg-qeXSFbOyPJUXLrZa .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-qeXSFbOyPJUXLrZa .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-qeXSFbOyPJUXLrZa .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-qeXSFbOyPJUXLrZa .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-qeXSFbOyPJUXLrZa .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-qeXSFbOyPJUXLrZa .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-qeXSFbOyPJUXLrZa .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-qeXSFbOyPJUXLrZa .cluster text{fill:#333;}#mermaid-svg-qeXSFbOyPJUXLrZa .cluster span{color:#333;}#mermaid-svg-qeXSFbOyPJUXLrZa div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-qeXSFbOyPJUXLrZa .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-qeXSFbOyPJUXLrZa rect.text{fill:none;stroke-width:0;}#mermaid-svg-qeXSFbOyPJUXLrZa .icon-shape,#mermaid-svg-qeXSFbOyPJUXLrZa .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-qeXSFbOyPJUXLrZa .icon-shape p,#mermaid-svg-qeXSFbOyPJUXLrZa .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-qeXSFbOyPJUXLrZa .icon-shape .label rect,#mermaid-svg-qeXSFbOyPJUXLrZa .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-qeXSFbOyPJUXLrZa .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-qeXSFbOyPJUXLrZa .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-qeXSFbOyPJUXLrZa :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 需要
不需要
有
没有
是
否
有
没有
开始选型
需要输出像素吗
有动作标签吗
任务是闭环控制吗
扩散生成式系

DIAMOND Genie Cosmos

要求可微 可多步推演
无监督潜动作系

Genie 1 Muse

先学潜动作再学动力学
有动作标签吗
纯渲染器系

Sora Veo 3 Seedance

只能做离线生成
Dreamer 系 或 MuZero 系

需可交互环境
JEPA 系

V-JEPA 2-AC

低数据机器人迁移
最终决策

该看什么:树只有三层分叉,每层对应 12.1 的一个问题。走到底之前不会遇到"哪个更好"这类无法回答的判断。

有一个分支值得特别注意:从"不需要像素"且"闭环控制"出来,会走到一个二次分叉------因为 JEPA 系和 Dreamer 系都在这个格子里,而它们的区别不在能力而在数据量。这条分叉的判据(有没有动作标签)是所有分叉里最容易被忽略的一个。

不要试图跳到最下面的决策节点去选"最终最优"。 C 这个节点的作用是提醒:五条路没有可比性,选型取决于约束而不是排名。

12.3 五条路线的适用边界

路线 适用场景 不适用 前置条件 代表 成熟度
Dreamer 系 离线 RL、样本效率敏感 需要像素输出;真机大规模部署 可交互环境或高保真仿真器 DreamerV3 5、DayDreamer 16 高,Nature 期刊级验证
MuZero / TD-MPC 系 真机规划控制、需要可解释潜空间 视频生成、数据增强 需要搜索算力 MuZero 7、TD-MPC2 9 高,但真机部署少
JEPA 系 真实机器人数据极少、强泛化需求 需要像素或可视化调试 需要 VICReg 类正则调参 V-JEPA 2-AC 12 中,零样本迁移已验证
扩散生成式系 视频生成、长尾场景合成、简单控制 严格实时控制;低算力环境 训练与推理算力充足 GameNGen 14、DIAMOND 13、Genie 3 23 中高,开源可验证
纯渲染器 只需生成多媒体内容 任何需要交互的任务 无 Sora 49、Veo 3 50 高,工业化最成熟

成熟度这一列需要谨慎读。"高"指的是有工业交付或有顶会/顶刊验证,不是指能力强。

12.4 三个最常见的选型错误

错误一:把"能生成好看视频"当成"能做世界模型"。

这个错误的成本是选错架构。判据是第 2 章那条:有没有动作输入通道。Sora 的官方博客自己列了四条短板(不准确建模基础物理、状态变化不准、长视频不连贯、物体凭空出现)49------而这四条里没有任何一条能靠"把视频生成得更好"来解决,因为它们全都是"没有动作输入"的后果。

错误二:在没有动作标签的数据上强行训动作条件模型。

这是生成式世界模型最隐蔽的失败。模型会学会忽略动作输入------因为在数据里动作和画面变化本来就没有因果关联(玩家按键和敌人出现是同时的,但不是因果的)。结果是模型看起来能接受动作参数,实际输出对动作不敏感。

识别方法只有一个:同一观测输入两个明显不同的动作,看输出是否变化。

错误错误三:用 FVD 或 VBench 给世界模型选型。

这两个基准全部不接受动作条件(见第 11.5 节的象限图)。用它们选出来的模型,在"世界模型能力"这个维度上没有被测过任何东西。

12.5 三方分歧的证据状况

立场 核心证据 证据强度
支持显式世界模型 V-JEPA 2-AC 零样本 MPC 迁移抓放 12;GAIA-2 内部部署 59;Cosmos-Drive-Dreams 合成数据使 3D 检测 mAP +2.8~3.8%、跟踪 AMOTA +8.0~8.3% 28;蔚来车端推演已量产 44 强。有第三方可测指标、有量产案例
支持隐式路线 π₀.₅ 全新真实家庭 10~15 分钟长时程 55;GR00T N1.5 真机语言跟随率 46.6%→93.3% 56;OpenVLA 完全开源且成功率比 55B RT-2-X 高约 16.5% 52 强,且是当前唯一规模化落地的路线
支持折中(双系统) GR00T N1/N1.5 的 System 1/System 2 分工 56;Gemini Robotics ER 与 VLA 的高低层解耦 57;华为 WEWA 的云端 World Engine + 车端 World Action Model 43 中。多为官方口径,缺少第三方对比
反对显式(VLA 已隐式具备) OpenVLA 线性探针报告"中层激活可线性解码状态转移向量,预训练计算量越大越强,微调会削弱" 弱。⚠️ 该文编号尚未核实,正文须标注"据报道/待核"

最后一行要单独说明:它是支持隐式路线最直接的一条机制性证据------如果探针结论成立,说明 VLA 内部确实编码了状态转移信息。但这条证据的编号尚未核实,本报告不把它当作已确立的事实。工业界的怀疑也是同样的方向:OpenAI 的 Noam Brown 在访谈中表述过大模型随规模"隐式发展出世界模型" 48。

12.6 中立判断:这是一场语义争论

三方分歧的实质,是"世界模型"这个词在不同上下文里指三件不同的东西:

  • 学术界的隐式路线方在说:"大规模预训练出来的表征里已经含有动力学信息,所以不需要显式建模。"
  • 显式路线方在说:"只有显式的动作条件预测才能支撑可靠的动作后果推断。"
  • 工业界在说:"在给定算力、时延、法规和数据归属约束下,哪条路能过量产这道关。"

这三句话可以同时为真,因为它们在回答不同的问题。当同一个词指三件不同的东西,争论不会有结果。

给读者的操作性建议:不要问"显式世界模型是否优于隐式",要问"在给我的约束下,哪条路的瓶颈更容易被解决"。约束包括数据量、算力、时延预算、可验证性要求。

一个可以观察的信号:如果探针结论(12.5 节最后一行)被独立复现,且发现在更大规模的模型上成立,那么"显式建模"的主要论据(显式才可靠)会被削弱。反过来,如果更大模型上的探针不再有效,这条论据反而会加强。这个实验目前还没有人系统做过。

12.7 本报告回避或降级处理的内容

这一节集中列出证据较薄的判断,方便读者识别哪些结论需要保留。

内容 处理方式 原因
特斯拉 FSD 世界模型的技术细节 完全不写数字 官方从未公布技术报告
Figure 03 Helix、1X World Model 的世界模型组件 只作为"营销口径 vs 可验证证据"的例子 无论文、无架构细节、无第三方验证
GR00T-Dreams "78 万条合成轨迹等效 6500 小时人类演示" 标注官方口径 ⚠️ 该对比数字来自官方宣传,"等效"按下游效果折算而非数据量
华为"车端算力降低 75%" 不写这个数字 ⚠️ 媒体推算,华为官方未如此宣称,官方公布的是时延降低 50%、通行效率提升 20%、重刹率降低 30%
"车端算力降低 75%"之外的"端到端时延降低 50%" 可写 华为官方发布会口径
OpenVLA 线性探针的结论 标注待核 ⚠️ 文献编号未核实
AMI Labs / Alexandre LeBrun "世界模型是下一个风口" 完全不采用 全网查不到任何来源,判定为编造或误传
"某系统是全球首个世界基座模型" 按官方声明表述,并注明发布场合 "全球首个"类表述依赖自我认定,需注明出处(如智源大会、NVIDIA GTC)
各类榜单分数 必须同时注明数据集与协议 不同协议下的分数不可比
DreamerV4 的具体性能数字 只写方向性结论 编号已核实(arXiv:2509.24527),但具体数字需以原文为准
Sora、Genie 2 的"一致性时长" 两个数字并列写出 官方口径(分钟级)与公开演示(10~20 秒)存在差距

第 13 章 未来方向

13.1 三条已经能看出来的趋势

这一节只写有证据支撑的趋势,不做预测。

趋势一:这个词正在通货膨胀。

2024 到 2026 年间,"世界模型"这个标签被四类系统分走:

类别 例子 典型主张方
神经模拟器 GAIA-1/2 5859、Genie 系列 152223、GameNGen 14 Wayve、DeepMind、Google Research
视频渲染器 Sora 49、Veo 3 50、Seedance 2.0/2.5、Kling 3.0 OpenAI、Google、字节、快手
具身隐式路线 π₀ 54、GR00T N1/N1.5 56、OpenVLA 52 Physical Intelligence、NVIDIA、Stanford
物理基础模型 Cosmos 系列 252627、悟界 Physis-v0.1 41 NVIDIA、智源

四类系统的技术栈、评测方式、甚至客户完全不同,却共用一个名字。标签通胀本身就是行业信号------说明这个词原本承诺的判断力已经不够用了。

趋势二:实时性从加分项变成了硬指标。

把帧率按时间排开:

系统 时间 帧率
Genie 1 15 2024-02 约 1 FPS
GameNGen 14 2024-08 20 FPS(单块 TPU v5),蒸馏后约 50 FPS
Muse 37 2025-02 未实时;WHAMM 38 改 MaskGIT 后 10+ FPS
Genie 3 23 2025-08 24 FPS,720p
GameCraft-2 2025-11 16 FPS(14B MoE)
Oasis 3 35 2026 22 FPS,端到端延迟 <200 毫秒

两年时间从 1 FPS 到稳定 20+ FPS。而快手的路线图论文明确写下这句话 30:

若无法实时响应,更像离线渲染器而非真正的世界模型。

这句话是这条趋势最硬的证据------它出自一个把"保真"排在第一代、"可交互"排在第二代的研究者之手,说明连渲染路线的研究者都把实时性当成了世界模型的必要条件。

趋势三:工业界对"要不要语言中间层"没有共识。

华为在 2025-04-22 的 ADS 4.0 发布会上明确宣布不走 VLA 路线、"省掉 Language 环节",采用云端 World Engine 加车端 World Action Model 43。蔚来走的是车端显式推演路线 44。而理想、小鹏等厂商被广泛认为走的是车端 VLA 加云端仿真验证的路线(⚠️ 此项为行业普遍认知,各家均未公布完整技术方案)。

同一条产业链上出现三种不同的架构选择,且都不是学术错误------这说明约束条件(数据归属、算力、验证成本、法规)比技术优劣更能决定选型。

13.2 四个瓶颈

瓶颈 证据 技术难点
数据 Open X-Embodiment 100 万+轨迹 67、DROID 350 小时+ 68 是当前最大的公开真实动作数据集 遥操作受人力限制,机器时利用率低;合成管线虽有放大效应(70,官方口径待核)但仿真到现实差距未被量化解决
误差复合 单步误差 ε 经 Lyapunov 指数放大,H 步后约 O(ε·λ^H) 长 horizon 推演必然崩,这是数学性质不是工程问题。缓解手段都是"少推几步",不是"推得更准"
评测 三类指标正交(见 11.1);Apple-π 上最佳视频模型仅 0.473 分 45 能生成与能推演被明确区分开,但没有任何基准直接测量 JEPA 系主张的表征能力
可验证性 Helix、1X 只有博客演示;特斯拉 FSD 世界模型无技术报告 领域内"宣称"远多于"披露",第三方复现几乎不存在

第二个瓶颈值得展开,因为它经常被误解为工程问题。单步预测误差 1% 看起来无所谓,但当系统的敏感度以 λ=1.05 放大、推演 100 步时,误差量级会放大到约 130 倍。这不是模型不够好,是指数增长的性质。 唯一的应对方向是限制推演长度或限制预测的空间范围------Dreamer 的短 horizon 分支推演、MuZero 的"只预测规划所需量"、JEPA 的"不预测像素",本质上都是同一件事。

13.3 路线图

(见下方 13-1)
#mermaid-svg-TrVGjeG9IUWHBw8v{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-TrVGjeG9IUWHBw8v .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-TrVGjeG9IUWHBw8v .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-TrVGjeG9IUWHBw8v .error-icon{fill:#552222;}#mermaid-svg-TrVGjeG9IUWHBw8v .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-TrVGjeG9IUWHBw8v .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-TrVGjeG9IUWHBw8v .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-TrVGjeG9IUWHBw8v .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-TrVGjeG9IUWHBw8v .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-TrVGjeG9IUWHBw8v .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-TrVGjeG9IUWHBw8v .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-TrVGjeG9IUWHBw8v .marker{fill:#333333;stroke:#333333;}#mermaid-svg-TrVGjeG9IUWHBw8v .marker.cross{stroke:#333333;}#mermaid-svg-TrVGjeG9IUWHBw8v svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-TrVGjeG9IUWHBw8v p{margin:0;}#mermaid-svg-TrVGjeG9IUWHBw8v .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-TrVGjeG9IUWHBw8v .cluster-label text{fill:#333;}#mermaid-svg-TrVGjeG9IUWHBw8v .cluster-label span{color:#333;}#mermaid-svg-TrVGjeG9IUWHBw8v .cluster-label span p{background-color:transparent;}#mermaid-svg-TrVGjeG9IUWHBw8v .label text,#mermaid-svg-TrVGjeG9IUWHBw8v span{fill:#333;color:#333;}#mermaid-svg-TrVGjeG9IUWHBw8v .node rect,#mermaid-svg-TrVGjeG9IUWHBw8v .node circle,#mermaid-svg-TrVGjeG9IUWHBw8v .node ellipse,#mermaid-svg-TrVGjeG9IUWHBw8v .node polygon,#mermaid-svg-TrVGjeG9IUWHBw8v .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-TrVGjeG9IUWHBw8v .rough-node .label text,#mermaid-svg-TrVGjeG9IUWHBw8v .node .label text,#mermaid-svg-TrVGjeG9IUWHBw8v .image-shape .label,#mermaid-svg-TrVGjeG9IUWHBw8v .icon-shape .label{text-anchor:middle;}#mermaid-svg-TrVGjeG9IUWHBw8v .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-TrVGjeG9IUWHBw8v .rough-node .label,#mermaid-svg-TrVGjeG9IUWHBw8v .node .label,#mermaid-svg-TrVGjeG9IUWHBw8v .image-shape .label,#mermaid-svg-TrVGjeG9IUWHBw8v .icon-shape .label{text-align:center;}#mermaid-svg-TrVGjeG9IUWHBw8v .node.clickable{cursor:pointer;}#mermaid-svg-TrVGjeG9IUWHBw8v .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-TrVGjeG9IUWHBw8v .arrowheadPath{fill:#333333;}#mermaid-svg-TrVGjeG9IUWHBw8v .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-TrVGjeG9IUWHBw8v .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-TrVGjeG9IUWHBw8v .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-TrVGjeG9IUWHBw8v .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-TrVGjeG9IUWHBw8v .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-TrVGjeG9IUWHBw8v .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-TrVGjeG9IUWHBw8v .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-TrVGjeG9IUWHBw8v .cluster text{fill:#333;}#mermaid-svg-TrVGjeG9IUWHBw8v .cluster span{color:#333;}#mermaid-svg-TrVGjeG9IUWHBw8v div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-TrVGjeG9IUWHBw8v .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-TrVGjeG9IUWHBw8v rect.text{fill:none;stroke-width:0;}#mermaid-svg-TrVGjeG9IUWHBw8v .icon-shape,#mermaid-svg-TrVGjeG9IUWHBw8v .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-TrVGjeG9IUWHBw8v .icon-shape p,#mermaid-svg-TrVGjeG9IUWHBw8v .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-TrVGjeG9IUWHBw8v .icon-shape .label rect,#mermaid-svg-TrVGjeG9IUWHBw8v .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-TrVGjeG9IUWHBw8v .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-TrVGjeG9IUWHBw8v .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-TrVGjeG9IUWHBw8v :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 当前 2026 已达成
像素级生成式

20+ FPS 可交互 世界模型
表征预测 + 规划

零样本迁移成功 规模仍小
隐式具身路线

真机规模化落地
工业数据管线

合成数据提升下游指标
阶段一 待突破

长时一致性超过 2 分钟
阶段二 待突破

表征能力可被直接评测
阶段三 待突破

长时程任务的成功率
阶段四 待突破

合成数据无 sim2real 落差
可能终局 A

成为机器人的系统级组件
可能终局 B

被隐式路线吸收
可能终局 C

显式与隐式分工共存
证伪信号

显式模块在真实任务上持续不占优
证伪信号

探针在大模型上仍能解出动力学
证伪信号

某条路线在所有约束下通吃

该看什么:图分三层。最下面一层的三个"证伪信号"是这张图里信息量最大的部分------它们不是预测,是可以被实验推翻的条件。

视线先看中间的四个方框(阶段一到阶段四),它们和最上面四个"当前已达成"一一对应。这说明每个方向上都有明确的下一个待突破点,而不是笼统的"还需要发展"。

然后看最下面:三个终局形态(A、B、C)后面各自挂着一个证伪信号。这三个形态不是互斥的预测,而是三个可以同时成立的假设------读者应该关注的是它们的证伪信号何时被触发,而不是哪个终局"更可能"。

⚠️ 这一张图是推演,不是已有事实的汇总。图中最上面一层的"当前已达成"来自前十二章的证据,其余全部是基于这些证据的推测。

13.4 三种可能的终局,以及各自的证伪条件

终局 A:世界模型成为机器人的系统级组件。

内容和文件系统、图形驱动类似------不是每次任务都要显式调用,但每个机器人系统里都有一个。世界模型负责状态估计与后果预测,规划器或策略头在其上工作。

支持依据:DayDreamer 在真实机器人上从零学会 16;V-JEPA 2-AC 的零样本迁移 12;华为 WEWA 的架构选择 43。

证伪信号:显式世界模型在真实任务上持续不占优------即探针类证据在大规模模型上被反复复现,且 VLA 类方法在同等数据和算力下持续领先。

终局 B:世界模型被隐式路线吸收。

显式建模变成历史,"世界模型"回归到它最初在强化学习里的含义------一个可选的规划加速器,不再是必需的组件。支持依据是 Noam Brown 描述的随规模隐式发展 48,以及当前 VLA 在真机上的领先地位 525556。

证伪信号:更大规模的模型上,探针不再能解出动力学信息;或者需要显式规划才能完成的任务(长时程、多约束)上,隐式路线持续失败。

终局 C:显式与隐式路线在具体应用上分工共存。

依据是当前已经观察到的格局:车企分成车端显式推演(蔚来)与车端 VLA(多数厂商)两派 4344;机器人的 DayDreamer 式与 VLA 式路线在经济学上各有适用面 1654。分工的依据是约束差异,不是技术优劣。

证伪信号:某条路线在所有约束下通吃------即显式世界模型在低数据真机场景和高算力仿真场景中都明确占优。

关于这三个形态的一个判断:C 是当前证据最支持的,因为它的两个分支(显式和隐式)都已经有量产或规模化案例,而 A 和 B 都还没有。A 和 B 都需要一个尚未出现的实验结果来区分。

13.5 结语

有一条判断可以在本章结束时给出,因为它的证据已经比较充分:

世界模型在机器人上的显式化优势,目前被数据成本盖住了。

V-JEPA 2 的两阶段配置说明了原因------动作条件预测器需要 62 小时专门采集的机器人视频,而且这个数字已经是很小的了。62 小时听起来不多,但它是"专人守着机器人一条条演示"换来的,且只覆盖了少数几种本体。

而 π₀ 和 GR00T N1.5 的预训练数据量级是 1 万小时以上 5456。差了三个数量级。在显式路线的数据成本降下来之前,隐式路线会继续占优。

这个判断是有条件的:如果合成数据管线能把动作标签的成本降一个数量级,结论可能翻转。 而 Cosmos-Drive-Dreams 已经在往这个方向走------它用合成数据提升下游感知指标 2.8%~3.8% 28,虽然目前还只用在感知而非控制上。

至于"世界模型是不是下一个风口"这类判断,本报告不做回答。判断一个技术方向值不值得投入,看的应该是它解决了什么问题、瓶颈在谁手里,而不是有多少人在用这个词。

第 14 章 写在最后

这份报告从 2018 年那个 867 参数的线性控制器写起,一路写到 2026 年那些单次生成 30 秒、带 50 个参考素材的系统。中间最难处理的一件事,不是任何一个技术细节,而是"世界模型"这四个字。

它现在同时指四类东西:一台能以 20 帧每秒生成 Doom 画面的扩散模型,一个能把街景变成可导入 Unity 的三维场景的生成管线,一个在机械臂上从零学会抓取的在线学习算法,还有一个把街景视频编辑成任意长度的视频的模型。它们的共同点只有名字。

所以全文反复出现的不是某个架构或某组公式,而是那条判据------是否接受动作序列作为输入,并输出对应的状态分布。这条判据不新,也不聪明,但它能把上面四类东西分开,而其他所有定义(包括"世界模型"这个词本身)都做不到。

三个可能被低估的结论

第一,物理不需要被写下来。 GameNGen 没有重力常数、没有碰撞检测、没有几何引擎,人类用眼睛分不出真假。Oasis 是 500M 参数的纯 Transformer、零物理引擎、20 FPS。两侧指向同一个事实:帧级预测目标本身已经包含了物理的约束,因为不自洽的画面会立刻在下一帧暴露。

这条结论的解释力比它的出处大。Dreamer 系能在 150 多个领域用一套超参跑通,学到的是同一件事------只要目标函数要求"未来可预测",该有的结构会自己长出来。

第二,"能生成"和"能推演"是两种能力。 Apple-π 基准上,Seedance 2.0 拿到 0.473 分,被 GPT Image 2 的 0.704 甩开。前者是当前视频生成的前列,后者不以生成为主要能力。训练目标的差别解释了这个结果:像素级似然教的是"接下来通常长什么样",物理定律推演需要的是"接下来为什么会这样"。

第三,在机器人上,显式世界模型目前被数据成本盖住了。 V-JEPA 2 的动作条件预测器需要 62 小时专人采集的机器人视频,这已经是很少的数字了;而 π₀ 和 GR00T N1.5 的预训练数据量级是 1 万小时以上。三个数量级的差距,加上真机试错的物理代价,让隐式路线在近几年的真机竞赛里领先。

这个判断有条件:如果合成数据管线能把动作标签的成本降一个数量级,它可能翻转。

这份报告没有回答的问题

  • 显式世界模型会不会被隐式路线吸收。 三个可能的终局形态和它们的证伪条件写在第 13.4 节,但区分它们需要的实验目前还没有系统做过。
  • 潜动作空间的语义对齐。 Genie 的潜动作是无监督学出来的,它学到的动作方向和人类按键语义是否对齐,三代产品都没有给出定量评测。这决定了这类系统的交互体验能不能用。
  • 中国车企路线选择的长期结果。 华为明确拒绝 VLA 路线、蔚来走车端显式推演,其他厂商的路线只有行业普遍认知而无公开技术方案。三条路线的取舍依据是数据归属、验证成本和法规约束,但哪条会赢,公开信息不足以判断。
  • 合成数据与真实数据的差距到底有多大。 Cosmos-Drive-Dreams 让下游 3D 检测 mAP 提升 2.8%~3.8% 28,但这类指标目前只用在感知上。合成数据能不能支撑控制策略的训练,公开证据不足。

关于证据纪律

这份报告在写作过程中修正了 5 处流传较广的文献编号错误,包括把 V-JEPA 的编号安到一篇等几何分析论文上、把价值等价原理的编号安到一篇量子混沌论文上这类情况(完整清单见附录 C)。也剔除了 1 条全网找不到任何来源的说法。

这些修正不影响任何技术结论------它们只是让读者在顺着编号去查原文时不会扑空。但它们反映了一件事:这个领域的宣称速度,已经超过了它的可验证速度。

第 12.7 节集中列出了本报告回避或降级处理的内容。当一个领域开始需要一份"哪些话不能信"的清单时,问题往往不在这份清单上。

一句话

判断一个系统是不是世界模型,看它是否接受动作序列并输出状态分布;判断世界模型值不值得投入,看它的瓶颈在谁手里------前者是一个技术判据,后者是一个工程问题,而目前多数讨论混在了后一个问题里。


附录 A 术语表

英文 中文 说明
World Model 世界模型 仅指接受动作条件并输出状态分布的模型
World Foundation Model 世界基座模型 大规模多任务预训练、可向下游迁移,不一定输出像素
Latent State 潜状态 编码器输出的内部表示,既不等于观测也不等于真实状态
Latent Variable 潜变量 潜状态中的随机成分,如 RSSM 的 z
Latent Action 潜动作 从视频变化中无监督学出的动作表示,如 Genie
Latent Action Model 潜动作模型 生成潜动作空间的模型
Encoder / Decoder 编码器 / 解码器 观测到潜状态、潜状态回观测
Dynamics Model 动力学模型 接受状态与动作,输出下一状态分布
RSSM 递归状态空间模型 Recurrent State-Space Model,Dreamer 系的潜状态结构
Rollout 推演 在模型内部沿动作序列向前模拟
Imagination 内心推演 基于模型生成的轨迹训练策略
Planner 规划器 在模型内搜索动作序列
Actor-Critic 演员-评论家 策略网络与价值网络
CEM 交叉熵方法 采样式动作序列搜索
MPPI 模型预测变分推断 采样式规划方法,TD-MPC 系列使用
MCTS 蒙特卡洛树搜索 MuZero 使用的树搜索
JEPA 联合嵌入预测架构 Joint-Embedding Predictive Architecture,预测表征而非像素
I-JEPA / V-JEPA / V-JEPA 2 --- JEPA 在图像、视频、带动作三个阶段的版本
Representation Collapse 表征坍塌 所有输入映射到同一表示,退化为常数
Stop-gradient 梯度截断 sg(·),阻断该侧的梯度回传
Latent Overshooting 潜空间多步预测 PlaNet 提出,对多步 KL 加权
KL Balancing KL 平衡 动力学损失与表征损失分别截断梯度后加权
Free Bits 自由比特 KL 的下限(每类别 1 nat),防止有效维度坍缩
Symlog --- sign(x)·log(1+abs(x)),压缩奖励与回报的动态范围
Two-hot --- 把标量回归转为分箱分类,避免尺度敏感
ELBO 证据下界 重建项与 KL 项构成的下界
VICReg 方差-不变性-协方差正则 防坍塌的三项正则,JEPA 的标准搭档
Barlow Twins --- 用跨维相关矩阵逼近单位矩阵的防坍塌方法
POMDP 部分可观测马尔可夫决策过程 七元组 ⟨S, A, O, T, Z, R, γ⟩
MBRL 基于模型的强化学习 Model-Based RL
Model-free / Model-based 无模型 / 有模型 强化学习的两种基本范式
VLA 视觉-语言-动作模型 VLM 骨干接动作头,当前具身智能主流
Flow Matching 流匹配 π₀、GR00T 的动作头训练方法
FLARE 未来潜表征对齐 GR00T N1.5 在潜空间对齐未来但不生成像素
Sim2Real 仿真到现实 仿真训练迁移到真实世界的差距问题
Neural Simulator 神经模拟器 接受动作序列并预测多步状态的模型
Renderer 渲染器 只接受静态条件生成内容,无动作通道
FVD 视频 Fréchet 距离 基于 I3D 特征的分布距离
Lyapunov Exponent 李雅普诺夫指数 误差复合的放大系数
Human Normalized Score 人类归一化分 以人类为基准归一化的得分

附录 B 图表索引

图号 位置 类型 内容
图 0-1 第 0.1 节 表格 按判据划分的世界模型四类系统
图 3-1 第 3.2 节 矩阵表 两维坐标:动作条件化 × 是否输出像素,四个范式的归类
图 4-1 第 4.2 节 flowchart LR 世界模型通用架构:编码器、动力学、可选解码器、预测头、规划器
图 4-2 第 4.3 节 flowchart TB 训练期与推理期数据流对比
图 4-3 第 4.4 节 erDiagram 观测、动作、潜状态、奖励、终止、推演、策略、价值的实体关系
图 4-4 第 4.5 节 sequenceDiagram agent-environment 循环中世界模型的调用时序
图 5-1 第 5.6 节 flowchart TD RSSM 训练目标:后验与先验两路、梯度截断点
图 6-1 第 6.7 节 sequenceDiagram JEPA 系的 MPC 闭环推理
图 7-1 第 7.5 节 flowchart TB Muse 架构:token 流主干与两种输出模式
图 8-1 第 8.2 节 flowchart TB GR00T 双系统:10 Hz 慢回路与 120 Hz 快回路
图 8-2 第 8.5 节 flowchart TB GAIA-2 结构化条件与五视角输出
图 10-1 第 10.5 节 flowchart LR 合成数据管线:从地图渲染到可训练数据集
图 11-1 第 11.5 节 矩阵表 评测基准覆盖的两个维度,以及两个空缺格
图 11-2 第 11.7 节 flowchart TB 五种失效模式的成因与缓解手段
图 12-1 第 12.2 节 flowchart TD 选型决策树
图 13-1 第 13.3 节 flowchart TB 技术路线图与三种终局的证伪信号

附录 C 参考文献

标注:[确信] = 已核实无误;[更正] = 原始候选值有误,已修正。

学术论文

1 Ha D, Schmidhuber J. World Models. arXiv:1803.10122, 2018. Google Brain. [确信]

2 Hafner D, et al. PlaNet: Learning Latent Dynamics for Planning from Pixels. arXiv:1811.04551, 2018. Google Brain. [确信]

3 Hafner D, et al. Dream to Control: Learning Behaviors by Latent Imagination. arXiv:1912.01603, 2019. Google Brain. [确信]

4 Hafner D, et al. Mastering Atari with Discrete World Models (DreamerV2). arXiv:2010.02193, 2020. Google Brain. [确信]

5 Hafner D, et al. Mastering Diverse Domains through World Models (DreamerV3). arXiv:2301.04104, 2023. Google DeepMind. 期刊版:Nature, 2025, 640: 647-653, DOI 10.1038/s41586-025-08744-2. [确信]

6 Hafner D, Yan W, Lillicrap T. Training Agents Inside of Scalable World Models (DreamerV4). arXiv:2509.24527, 2025. Google DeepMind. [确信]

7 Schrittwieser J, et al. Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model (MuZero). arXiv:1911.08265, 2019. DeepMind. 期刊版:Nature, 2020, 588: 604-609. [确信]

8 Hansen N, et al. Temporal Difference Learning for Model Predictive Control (TD-MPC). arXiv:2203.04955, 2022. UC San Diego. [确信]

9 Hansen N, et al. TD-MPC2: Scalable, Robust World Models for Continuous Control. arXiv:2310.16828, 2023. UC San Diego. [确信]

10 Assran M, et al. Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture (I-JEPA). arXiv:2301.08243, CVPR 2023. Meta AI (FAIR) & McGill University. [确信]

11 Bardes A, et al. Revisiting Feature Prediction for Learning Visual Representations from Video (V-JEPA). arXiv:2404.08471, 2024. Meta AI (FAIR). [确信]

12 Assran M, et al. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. arXiv:2506.09985, 2025. Meta AI (FAIR). [确信]

13 Alonso E, et al. Diffusion for World Modeling: Visual Details Matter in Atari (DIAMOND). arXiv:2405.12399, NeurIPS 2024 Spotlight. University of Geneva. [确信]

14 Valevski D, et al. Diffusion Models Are Real-Time Game Engines (GameNGen). arXiv:2408.14837, ICLR 2025. Google Research. [确信]

15 Bruce J, et al. Genie: Generative Interactive Environments. arXiv:2402.15391, 2024. Google DeepMind. [确信]

16 Wu P, Escontrela A, Hafner D, et al. DayDreamer: World Models for Physical Robot Learning. arXiv:2206.14176, CoRL 2022. UC Berkeley. [更正] 原始候选 arXiv:2306.14103 错误,且为 CoRL 2022 非 2023

17 Grimm C, Barreto A, Singh S, Silver D. The Value Equivalence Principle for Model-Based Reinforcement Learning. arXiv:2011.03506, 2020. University of Michigan. [更正] 原始候选 arXiv:2002.05759 错误

18 Bardes A, et al. VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning. arXiv:2105.04906, 2021. Meta AI (FAIR) & Inria. [确信]

19 Zbontar J, et al. Barlow Twins: Self-Supervised Learning via Redundancy Reduction. arXiv:2103.03230, 2021. Facebook AI Research (Meta AI). [确信]

20 Freeman C D, et al. Brax -- A Differentiable Physics Engine for Large Scale Rigid Body Simulation. arXiv:2106.13281, 2021. Google Research. [确信]

21 Zhang Y, et al. Foresight Diffusion: Improving Sampling Consistency in Predictive Diffusion Models. arXiv:2505.16474, 2025. Tsinghua University. [确信] ⚠️ 非Alonso et al.,第一作者为Yu Zhang

2025-2026 官方发布与产品(A级:已核实官方一手来源)

22 Google DeepMind. Genie 2: A Large-Scale Foundation World Model. 2024-12-04. 官方博客. [确信]

23 Google DeepMind. Genie 3: A New Frontier for World Models. 2025-08-05. 官方博客. 720p/24FPS,Promptable World Events,视觉记忆回溯约1分钟. [确信]

24\] Google. Project Genie: AI World Model Now Available for Ultra Users in U.S. 2026-01-29. 官方博客. $249.99/月,美区18+.\[确信

25 NVIDIA. Cosmos 3 Helps Physical AI Think Before It Acts. 2026-05-31. GTC Taipei 官方博客. 技术报告 arXiv:2606.02800. [确信]

26 NVIDIA. Cosmos-Predict1. 2025-01. 官方研究页面. [确信]

27 NVIDIA. Cosmos-Predict2.5. 2025-10/11. 官方研究页面. [确信]

28 NVIDIA. Cosmos-Drive-Dreams. 2025-06. 官方研究页面. [确信]

29 快手科技. Kling 3.0 系列官方发布. 2026-02-05. 官方新闻稿. Omni One 架构,原生音视频,4K/60fps. [确信]

30 快手 Kling Team 等. Simulating the Visual World with Artificial Intelligence: A Roadmap. arXiv:2511.08585, 2025-11-11. [确信]

31 Google DeepMind. Gemini Robotics 2 Brings Whole Body Intelligence to Robots. 2026-07-30. 官方博客. 全身人形控制,22-DOF灵巧手,多机器人协作. [确信]

32 字节跳动 Seed. Seedance 2.0 Official Launch. 2026-02-12. 官方博客. 统一多模态音视频架构. [确信]

33 字节跳动 Seed. Introducing Seedance 2.5. 2026-07-31. 官方博客. 单次原生生成30s,50个参考素材. [确信]

34 Runway. Introducing Runway GWM-1. 2025-12-11. 官方研究博客. 三分支:GWM-Worlds/GWM-Robotics/GWM-Avatars. [确信]

35 Decart. Oasis 3. 2026. 官方产品页. 22FPS,<200ms延迟,多视角驾驶模拟. [确信]

36 Etched AI / Decart. Oasis (原始版). 2024-10-31. GitHub etched-ai/open-oasis. 500M参数,20FPS,开源. [确信]

37 Microsoft Research. Introducing Muse: Our First Generative AI Model Designed for Gameplay Ideation. 2025-02-19. 官方博客. 1.6B自回归Transformer. 同期Nature正刊. [确信]

38 Microsoft Research. WHAMM! Real-time World Modelling of Interactive Environments. 2025-04-04. 官方博客. MaskGIT两阶段,10+FPS. [确信]

39 腾讯混元. HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds. arXiv:2604.14268, 2026-04-16. 开源. [确信]

40 智源/清华/NVlabs. SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer. arXiv:2605.15178, 2026-05-14. 2.6B开源. [确信]

41 智源研究院. 悟界·Physis-v0.1 与悟界·RoboBrain Orca. 2026-06-12. 智源大会官方发布. 物理隐空间Token. [确信]

42 智元机器人. GE-Act 2.0. 2026-09. 官方项目页. 首个原生WAM,CoAE 24 token/帧. [确信]

43 华为乾崑. ADS 4.0 + WEWA 架构. 2025-04-22. 发布会. 拒绝VLA路线,云端World Engine + 车端World Action Model. [确信]

44 蔚来汽车. NWM (NIO World Model). 2024-07-27发布,2025-05-30全量推送. 官方. 车端0.1s推演216轨迹,云端NSim闭环仿真. [确信]

45 南洋理工S-Lab + 港中大. Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence. arXiv:2607.16401, 2026-07-17. 最佳视频模型仅0.473分. [确信]

46 商汤科技. R-UniAD 与「开悟」世界模型. 2025-02-22. 商汤大模型生产力论坛. 1GPU仿真≈500量产车数据. [确信]

47 Eric Xing et al. Critique of World Model. arXiv:2507.05169v1, 2025-07-07. 批判JEPA/LeCun路线. [确信]

48 Noam Brown (OpenAI). Latent Space Podcast: Scaling Test Time Compute to Multi-Agent Civilizations. 2025-06-19. 访谈. [确信] ⚠️ 非Amazon

视频生成与渲染器(补录)

49 OpenAI. Video Generation Models as World Simulators (Sora 技术博客). 2024-02-15. 官方技术博客. 官方自述四条短板:不准确建模基础物理、状态变化不准、长视频不连贯、物体凭空出现. [确信]

50 Google. Veo 3 官方发布. 2025-05-20. 官方博客. 原生音视频联合生成,单一 Transformer 联合去噪音频与视频 latent. [确信]

51 快手 Kling Team 等. Simulating the Visual World with Artificial Intelligence: A Roadmap (Kling 2.1 Master 报告). 官方发布. 官方承认核心瓶颈是实时性:"若无法实时响应,更像离线渲染器而非真正的世界模型". [确信]

具身智能:VLA 阵营(补录)

52 Black K, et al. OpenVLA: An Open-Source Vision-Language-Action Model. arXiv:2406.09246, 2024. Llama-2 7B + DINOv2/SigLIP 双视觉编码器,完全开源. [确信]

53 Black K, et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818, 2023. Google DeepMind. [确信] ⚠️ 早期流传的 2212.06817 实为 RT-1 的编号

54 Black K, et al. π₀: A Vision-Language-Action Flow Model for General Robot Control. arXiv:2410.24164, 2024. Physical Intelligence. PaliGemma 3B + DiT 动作专家,flow matching 预测 50Hz 连续动作块,2025-02 开源. [确信]

55 Black K, et al. π₀.₅: a Vision-Language-Action Model with Open-World Generalization. arXiv:2504.16054, 2025. 加高层语义子任务预测头,首次在全新真实家庭完成 10~15 分钟长时程任务. [确信]

56 Gemini Robotics Team. GR00T N1: An Open Foundation Model for Generalist Humanoid Robots. arXiv:2503.14734, 2025. NVIDIA. 双系统:System 2 为 Eagle VLM(约 10Hz),System 1 为 DiT flow matching(约 120Hz);N1.5 引入 FLARE 损失(λ≈0.2)在潜空间对齐未来表征但不生成像素,官方公布真机语言跟随率 46.6%→93.3%. [确信]

57 Google DeepMind. Gemini Robotics 1.5 / ER 1.5 官方 Model Card. 2025-10. 双模型:ER 做空间推理与轨迹预测,GR 输出低层动作. [确信]

自动驾驶世界模型(补录)

58 Wayve. GAIA-1: A Generative World Model for Autonomous Driving. 2023-09. 官方博客. 6.5B 离散 token 世界模型 + 2.6B 视频扩散解码器,4700 小时伦敦专有数据(4.2 亿帧). [确信]

59 Wayve. GAIA-2: A Controllable World Model for Autonomous Driving. 2025-03. 官方博客. 连续潜扩散 + 视频 tokenizer,5 视角 448×960,结构化条件(ego 动作、3D 框、天气、路网、场景 embedding),支持空间修补与真实场景编辑,Wayve 内部部署. [确信]

60 DriveDreamer 团队. DriveDreamer / DriveDreamer-2 / DriveDreamer4D. 2023-2025. ECCV 2023 → AAAI 2025. 代表"世界模型当数据机器"的一条研究线. [确信]

仿真器与可微物理(补录)

61 LLMPhy 团队. LLMPhy: Large Language Models for System Identification of Physical Dynamics. arXiv:2411.08027, 2024. LLM + 黑盒物理引擎(MuJoCo/PyBullet)做系统辨识,不需要可微引擎. [确信]

62 Google DeepMind + NVIDIA. MuJoCo Warp / Newton. 2025. 基于 NVIDIA Warp 与 OpenUSD,支持多物理耦合. [确信]

63 Google DeepMind. MuJoCo MJX. JAX/XLA 重写的 MuJoCo,单场景慢但 8192+ 场景批量极快. [确信]

64 Romera-Paredes et al. FunSearch: Making new discoveries in mathematical sciences using Large Language Models. Nature, 2023. LLM 进化搜索代码解决数学问题,代表"可执行代码即世界模型". [确信]

数据引擎(补录)

65 Grauman K, et al. Ego4D: Around the World in 3,670 Hours of Egocentric Video. arXiv:2110.07058, CVPR 2022. 3670 小时 / 923 人 / 9 国. [确信]

66 Grauman K, et al. Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives. arXiv:2311.18259, CVPR 2024. 1286 小时带同步第三方视角. [确信]

67 Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv:2307.08778, 2023. 22 个数据集聚合,100 万+ 轨迹. [确信]

68 Khazatsky A, et al. DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset. arXiv:2403.12945, 2024. 350 小时+ 真实机器人遥操作,也是 V-JEPA 2 动作条件后训练的数据来源. [确信]

69 Cheng C, et al. UMI: Universal Manipulation Interface. arXiv:2402.19477, 2024. 低成本手持式遥操作接口. [确信]

70 NVIDIA. GR00T-Dreams 合成数据管线. 官方发布. 调研称 78 万条合成轨迹等效 6500 小时人类演示,而人类只需 11 小时演示喂给模型生成. [待核] ⚠️ 具体数字需以官方原文为准,正文引用时须注明

评测基准(补录)

71 Nieminen H, et al. FVD: A New Metric for Video Generation. arXiv:1812.01717, 2018. Fréchet Video Distance,基于 I3D 特征的分布距离. [确信]

72 Huang Z, et al. VBench: Comprehensive Benchmark Suite for Video Generative Models. arXiv:2311.17982, CVPR 2024. 主体一致性、运动平滑度、时间闪烁、语义匹配等解耦维度的细粒度打分,含人类偏好标注. [确信]

73 PhyGenBench 团队. PhyGenBench: A Comprehensive Physical Commonsense Benchmark for Text-to-Video Generation. arXiv:2410.05363, 2024. 清华。用提示词考物理常识,覆盖力学、光学、热学、材料. [确信]

74 Physics-IQ 团队. Physics-IQ: Benchmarking Physical Reasoning from Video. arXiv:2501.09038, 2025. 用真实物理实验视频做续帧预测,把"真实视频之间的自然差异"定为满分基准. [确信]

75 WorldModelBench 团队. WorldModelBench: Judging Video Generation Models as World Models. arXiv:2502.20694, 2025. 考察指令遵循、常识、物理依从(牛顿第一定律、固体力学、流体力学、不可渗透、重力五类违例). [确信]

76 DayDreamer / Dreamer 系基准. MBRL 常用基准:DMLab、Crafter、Atari 100k、MiniGrid、DMControl、NetHack. [确信]

其他已核实条目

77 Yann LeCun. A Path Towards Autonomous Machine Intelligence. 2022. 官方文章. 提出六个模块划分:感知、世界模型、成本、执行者、短期记忆、配置器. [确信]

78 Assran M, et al. Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture(JEPA 概念出处). arXiv:2205.13149 候选值经核实为非JEPA 论文(实为凝聚态物理),正文引用 I-JEPA10 为准. [更正]

79 NVIDIA GR00T / DayDreamer 相关开源仓库. 已开源可验证:etched-ai/open-oasis(Oasis 500M 权重)、microsoft/wham(Muse 权重)、Tencent-Hunyuan/HY-World-2.0、NVlabs/Sana. [确信]

80 OpenAI. Project Genie 与 Sora 官方技术博客中"世界模型"自我定位的相关讨论. 见 49。[确信]

已排除条目(查不到任何来源,不写入正文)

  • AMI Labs / Alexandre LeBrun "world model是下一个hot potato"言论------查不到任何来源,疑似编造或误传. [C级:不可用]
  • arXiv:2404.08485(被误传为 V-JEPA)实为等几何分析论文
  • arXiv:2407.16630(被误传为 V-JEPA)实为量子层析论文
  • arXiv:2405.12392(被误传为 DIAMOND)实为数论论文
  • arXiv:2408.15261(被误传为 GameNGen)实为 Civiverse 数据集论文
  • arXiv:2206.14138(被误传为 DayDreamer)实为图案形成论文
  • arXiv:2002.05759(被误传为价值等价原理)实为量子混沌论文
  • arXiv:2306.14103(被误传为 DayDreamer CoRL 2023)实为并行图连通性问题论文
  • "自监督学习全部来自学习理论"类陈述:无可靠来源,不引用
相关推荐
秦先生在广东1 小时前
构建 Agent 就绪的数据库 OKF 知识包:Python 编译器实战
人工智能
秦先生在广东1 小时前
初创企业低成本增长的数字营销实战指南
人工智能
秦先生在广东1 小时前
开源权重的质变时刻:技术超越、政策博弈与商业模式重构
人工智能
旺仔Sec2 小时前
2026年江西省职业院校技能大赛(中职组)人工智能应用技术样题
人工智能
筑梦之路2 小时前
os-pilot-ai 项目分析:把“一句话装系统“塞进一个 52MB 的 mini-ISO——筑梦之路
人工智能
IT_陈寒2 小时前
SpringBoot启动慢得像蜗牛?原来是这个配置在捣鬼
前端·人工智能·后端
梦想画家2 小时前
SQLMesh Python 模型入门(三):前后置语句、蓝图建模与避坑指南
大数据·python·sqlmesh
Zootopia6262 小时前
多架 eVTOL集群排班调度方案思考
人工智能·算法·数学建模·matlab·动态规划·无人机·evtol
代码方舟2 小时前
零信任架构实战:基于天远学历信息高级版构建自动化智库入驻审查网关
运维·人工智能·架构·自动化