发展历程
-
第一阶段:World Model 是为了让 RL 少采数据。
- Dreamer 的核心问题是:"真实环境交互太贵,能不能在脑内练习?"于是最重要的指标是 sample efficiency。世界不需要生成得漂亮,只需要 latent dynamics 足够支持 policy learning。
- DreamerV3 则进一步问:"这个方法能不能不用每个任务重新调参?"因此热点从单任务性能变成 robustness / generality / one configuration across domains。
-
第二阶段:World Model 本身的 sequence modeling 能不能更强、更 scalable?
- IRIS 、STORM 开始明显受到 GPT/Transformer 成功的影响。关注点从"RSSM 怎么设计"逐渐变成:world dynamics 能不能像 language modeling 一样做 sequence modeling?
- IRIS 使用 visual-token autoregression;STORM 则把 Transformer 塞回 Dreamer-style stochastic latent framework。
-
第三阶段:只要 latent 对控制够用真的就够了吗?------ 开始强调 visual fidelity。
- DIAMOND 是一个明显转折点。它质疑"压得越 compact 越好":如果 Atari 的小球、HUD、敌人等细节被离散 tokenizer 丢掉,world model 即使 latent prediction 很准,也可能给 agent 一个错误世界。因此研究热点开始出现 control-sufficient representation→high-fidelity generative simulation\boxed{\text{control-sufficient representation}\rightarrow\text{high-fidelity generative simulation}}control-sufficient representation→high-fidelity generative simulation
-
第四阶段:World Model 从"Agent 的内部工具"变成"产品本身"。
- GameNGen 是这一步最鲜明的代表。Dreamer/IRIS/DIAMOND 的终极产物是 policy;GameNGen 的终极产物是 可玩的 neural game engine。于是研究指标也从 HR/NDCG 式的 agent score,明显增加了 PSNR、LPIPS、FVD、FPS、long-horizon stability 等 生成模型指标。GameNGen 的两阶段设计甚至完全把 RL Agent 降格成了 data collector。
-
第五阶段:从 action-conditioned world model 走向 foundation world model / world-action model。
- Genie 解决的是 数据规模瓶颈:如果训练 world model 必须拥有 ((o,a)) pair,就无法充分利用 Internet-scale video。因此它用 LAM 从 (xt,xt+1)→a~t(x_t,x_{t+1})\rightarrow \tilde a_t(xt,xt+1)→a~t自己发现 action,再让用户通过 latent action 控制世界。研究热点由"如何预测未来"扩展成 如何从无标注视频中发现 controllable dynamics。
-
此外:JOWA 则代表另一股正在汇合的趋势:既然 world model 学到了非常强的 temporal/world representation,为什么还要让 action/value learning 成为一个弱小的外挂 head?于是开始追求:World Understanding+Action/Value Learning→Joint Pretraining\boxed{\text{World Understanding}+\text{Action/Value Learning}\rightarrow\text{Joint Pretraining}}World Understanding+Action/Value Learning→Joint Pretraining
-
JOWA 的目的不是像 Genie 那样生成一个给人玩的世界,而是利用 shared Transformer 同时获得 general-purpose world representation 和 decision-making ability,并利用大规模 offline data 做跨游戏迁移。
| Model | 开始时间 | 发表刊物 | Backbone | Input | Output |
|---|---|---|---|---|---|
| Dreamer | 2019.12 | ICLR 2020 | RSSM (GRU + continuous stochastic latent) | Previous latent state st−1s_{t-1}st−1, action at−1a_{t-1}at−1, current observation oto_tot | Latent state sts_tst, reconstructed observation o^t\hat{o}_to^t, reward r^t\hat{r}_tr^t |
| IRIS | 2022.09 | ICLR 2023 | Discrete Autoencoder + GPT-like Autoregressive Transformer | Historical visual tokens z≤tz_{\le t}z≤t and actions a≤ta_{\le t}a≤t | Next-frame tokens zt+1z_{t+1}zt+1, reward rtr_trt, termination dtd_tdt |
| DreamerV3 | 2023.01 | Nature 2025 | RSSM (Block-GRU + categorical stochastic latent) | Previous states (ht−1,zt−1)(h_{t-1},z_{t-1})(ht−1,zt−1), action at−1a_{t-1}at−1, current observation xtx_txt | States (ht,zt)(h_t,z_t)(ht,zt), reconstructed observation x^t\hat{x}_tx^t, reward r^t\hat{r}_tr^t, continuation c^t\hat{c}_tc^t |
| STORM | 2023.09 | NeurIPS 2023 | Categorical VAE + GPT-like Transformer | Historical stochastic latents z≤tz_{\le t}z≤t and actions a≤ta_{\le t}a≤t | Next latent zt+1z_{t+1}zt+1, reward rtr_trt, continuation ctc_tct |
| Genie | 2024.02 | arXiv 2024 | ST-Transformer; ST-ViViT Tokenizer + Latent Action Model + MaskGIT Dynamics | Historical video tokens z<tz_{<t}z<t and latent actions a<ta_{<t}a<t | Next-frame visual tokens ztz_tzt |
| DIAMOND | 2024.05 | NeurIPS 2024 | EDM-style Diffusion + 2D U-Net | Noisy next frame xt+1τx_{t+1}^{\tau}xt+1τ, historical frames xt−L+1:tx_{t-L+1:t}xt−L+1:t, actions at−L+1:ta_{t-L+1:t}at−L+1:t | Denoised next observation xt+1x_{t+1}xt+1; separate model predicts reward and termination |
| GameNGen | 2024.08 | ICLR 2025 | Stable Diffusion v1.4 Latent U-Net | Noisy next-frame latent, historical frame latents, historical/current actions | Next-frame latent, decoded into next game frame xt+1x_{t+1}xt+1 |
| JOWA | 2024.10 | ICLR 2025 | VQ-VAE + shared GPT-2-style Transformer | Historical visual tokens z≤tz_{\le t}z≤t, actions a≤ta_{\le t}a≤t, task embedding uuu | Next-frame tokens, reward, termination, and action Q-value distribution |
Dreamer
-
Dream to Control: Learning Behaviors by Latent Imagination, Google Brain, 1912, ICLR 2020.
-
Motivation
-
当时已经能够从图像中学习 latent world model,例如 PlaNet 可以学习:(st,at)→st+1,rt(s_t,a_t)\rightarrow s_{t+1},r_t(st,at)→st+1,rt真正的问题变成了:
有了 world model 之后,到底应该怎样利用它学出一个好的 policy?
-
论文认为已有方法主要有两个问题。
- 第一,很多 model-based 方法只优化有限 imagination horizon HHH 内的 reward:rt+γrt+1+⋯+γHrt+H,r_t+\gamma r_{t+1}+\cdots+\gamma^H r_{t+H},rt+γrt+1+⋯+γHrt+H,因此容易产生 shortsighted behavior:超过 HHH 的长期收益完全看不到。
- 第二,PlaNet/CEM 等方法常使用 derivative-free online planning,没有充分利用 neural world model 本身是可微的这一特点。
-
因此 Dreamer 的核心问题就是:能否在 learned latent world 中,利用可微 dynamics,高效学出 long-horizon policy?\boxed{\text{能否在 learned latent world 中,利用可微 dynamics,高效学出 long-horizon policy?}}能否在 learned latent world 中,利用可微 dynamics,高效学出 long-horizon policy?
-
Contribution
-
1、Learning long-horizon behaviors by latent imagination
- Dreamer 在 learned world model 中生成:st→st+1→⋯→st+H,s_t\rightarrow s_{t+1}\rightarrow\cdots\rightarrow s_{t+H},st→st+1→⋯→st+H,并同时学习两个模型:Actor πϕ(at∣st)\boxed{\text{Actor }\pi_\phi(a_t|s_t)}Actor πϕ(at∣st)和Critic vψ(st).\boxed{\text{Critic }v_\psi(s_t)}.Critic vψ(st).Critic 通过 value prediction 把 imagination horizon HHH 之后的未来收益 bootstrap 回来,因此 Actor 不再只看 HHH 步以内的 reward。Dreamer 使用 VλV_\lambdaVλ 在不同长度的 return estimates 之间折中。
- 更关键的是,Actor 不是通过 CEM 搜索 action,而是直接利用 differentiable world model:
ϕ→at→st+1→rt+1,v(st+1) \phi \rightarrow a_t \rightarrow s_{t+1} \rightarrow r_{t+1},v(s_{t+1}) ϕ→at→st+1→rt+1,v(st+1)把 value 的 analytic gradient 反向传播穿过 imagined dynamics:
∇ϕVλ \boxed{ \nabla_\phi V_\lambda } ∇ϕVλ来训练 policy. - 所以这是 Dreamer 最核心的技术贡献:Latent Imagination+Actor-Critic+Value Bootstrapping+Analytic Gradient through Dynamics\boxed{\text{Latent Imagination}+\text{Actor-Critic}+\text{Value Bootstrapping}+\text{Analytic Gradient through Dynamics}}Latent Imagination+Actor-Critic+Value Bootstrapping+Analytic Gradient through Dynamics
-
2、证明这种方法在 visual control 上确实有效
Dreamer 在 20 个 image-based continuous-control tasks 上,用统一超参数取得了比当时 model-based 和 model-free baselines 更好的 data efficiency、computation time 和最终性能。

IRIS
-
Transformers are Sample-Efficient World Models, University of Geneva, 2209, ICLR 2023.
-
Motivation
-
第一,RL 太 sample-inefficient。 真实环境交互昂贵,而 learning in imagination 可以让 policy 在 world model 里大量训练,从而减少真实环境样本需求;但前提是 world model 必须在较长 horizon 上足够准确,否则 policy 会学会利用模型错误。
-
第二,既然 Transformer 很擅长 sequence modeling,能不能把 environment dynamics 也当成 sequence modeling? IRIS 受到 GPT、VQGAN/DALL-E 的启发:先用 discrete autoencoder 把图像压成少量 visual tokens,再让 autoregressive Transformer 建模
(z0,a0,z1,a1,...) (z_0,a_0,z_1,a_1,\ldots) (z0,a0,z1,a1,...)这样的序列,从而把 world dynamics learning 转化成 visual-token autoregressive modeling.
-
Contribution
-
1、提出 Transformer-based imagination world model。
World model 由 discrete autoencoder E,DE,DE,D 和 GPT-like Transformer GGG 构成;GGG 根据历史 frame/action tokens,自回归预测下一帧 tokens,同时预测 reward 和 episode termination。Policy 完全在这些 imagined trajectories 中训练。 -
2、把 dynamics modeling 明确重构成 sequence modeling。
这是 IRIS 在架构层面最有代表性的思想:xt→discrete AEzt x_t \xrightarrow{\text{discrete AE}} z_t xtdiscrete AE zt然后:
(z≤t,a≤t)→Transformerzt+1. (z_{\le t},a_{\le t}) \xrightarrow{\text{Transformer}} z_{t+1}. (z≤t,a≤t)Transformer zt+1.也就是 autoencoder 先建立一套"视觉语言",Transformer 再学习这套语言随时间如何演化。 -
3、证明这种 Transformer world model 很 sample-efficient。
在 Atari 100k 中,仅约两小时真实 gameplay,IRIS 达到 mean human-normalized score 1.046,在 26 个游戏中的 10 个达到 superhuman performance,并成为当时 without lookahead search 方法的新 SOTA。 作者还展示了 world model 能学到游戏机制,部分游戏甚至能做到接近 pixel-perfect 的长程预测。

DreamerV3
-
Mastering diverse control tasks through world models, Google DeepMind, 2301, Nature 2025 April.
-
Motivation
-
现有 RL 方法往往针对特定 benchmark 做了大量专门设计与 hyperparameter tuning;但如果从 Atari 换到 robotics、DMLab、ProcGen、Minecraft,不同 observation scale、reward scale、action space、sparse/dense rewards 都会导致训练不稳定。
-
DreamerV3 的目标因此不是再提出一个完全不同的 world-model framework,而是把 Dreamer 做成一个 single-configuration general-purpose RL algorithm。
-
Contribution
-
1、把 Dreamer 系列做成跨 domain 稳定工作的通用算法。
DreamerV3 仍然采用 world model + imagination + actor-critic 的基本框架,但加入大量 robustness 技术,包括:
KL balancing + free bits \text{KL balancing + free bits} KL balancing + free bitssymlog / symexp \text{symlog / symexp} symlog / symexpsymexp two-hot reward/value prediction \text{symexp two-hot reward/value prediction} symexp two-hot reward/value predictionpercentile return normalization \text{percentile return normalization} percentile return normalization以及 categorical latent 的 unimix 等。
这些设计的共同目的都是:
让 optimization 不再强依赖不同任务的数值 scale 和视觉复杂度 \boxed{\text{让 optimization 不再强依赖不同任务的数值 scale 和视觉复杂度}} 让 optimization 不再强依赖不同任务的数值 scale 和视觉复杂度例如 free bits + 较小的 representation-loss weight,使复杂视觉和简单 Atari 图形都能使用同一组 representation hyperparameters. -
2、提出更 robust 的 prediction / critic / actor learning 机制。
对大范围数值,使用 symlog 压缩;reward 和 critic 不再简单做 scalar MSE,而使用 exponentially spaced bins + two-hot categorical loss,使 gradient magnitude 与 target scale 解耦。Actor 则通过 return-range normalization 避免不同 reward scale 改变 exploration/exploitation 的平衡。 -
证明一套配置可以覆盖极其不同的任务。
DreamerV3 在 visual/non-visual、continuous/discrete action、dense/sparse reward、2D/3D、procedural environments 上统一测试,并达到或超过许多为单一 benchmark 专门设计的 expert algorithms。 最有代表性的结果是从 pixels 和 sparse rewards 出发,不借助 human data 或 curriculum,在 Minecraft 中学会获得 diamond。

STORM
-
STORM: Efficient Stochastic Transformer based World Models for Reinforcement Learning, Beijing Institute of Technology, 2310, NeurIPS 2023.
-
Motivation
-
DreamerV3 等方法使用 GRU/LSTM 作为 sequence model,虽然有效,但 recurrent computation 天然不利于并行;而已有 Transformer world model(如 IRIS/TWM)虽然引入了 Transformer,却训练成本仍然较高,性能也没有明显超过 DreamerV3。
-
与此同时,world-model imagination 会产生 autoregressive error accumulation,因此表示里还需要保留一定 stochasticity 来提高鲁棒性。
-
因此 STORM 的核心思路是:
categorical stochastic representation+Transformer sequence model\boxed{\text{categorical stochastic representation}+ \text{Transformer sequence model}} categorical stochastic representation+Transformer sequence model也就是既利用 Transformer 的并行和长程建模能力,又保留 stochastic latent 来减轻 model error accumulation。
-
Contribution
-
1、提出 Stochastic Transformer-based World Model。
STORM 用 categorical VAE 编码当前图像得到 stochastic latent ztz_tzt,再用 Transformer 建模历史 latent-action sequence,得到 contextual representation ht.h_t.ht. Agent state 使用:
st=ht,zt. s_t=h_t,z_t. st=ht,zt.其中 hth_tht 提供历史 context,ztz_tzt 提供当前视觉信息与 stochasticity。论文的消融也表明,在需要历史信息的任务中 hth_tht 很重要,而 stochastic ztz_tzt 有助于缓解不准确 world model 带来的问题。 -
2、把 Transformer 的并行优势真正用于 Dreamer-style imagination RL。
STORM 的 Actor-Critic 学习基本继承 DreamerV3,因此它的主要创新不是新的 RL objective,而是:
Dreamer-style agent learning+更高效的 Transformer world model\boxed{\text{Dreamer-style agent learning}+ \text{更高效的 Transformer world model}} Dreamer-style agent learning+更高效的 Transformer world model作者强调 Transformer 改善了 sequence modeling / generation quality,同时显著提高训练效率。 -
3、同时提升 Atari100k 的性能和训练效率。
STORM 在 Atari100k 上达到 126.7% mean human-normalized score,当时刷新 without-lookahead-search 方法的结果;训练 1.85 小时真实交互数据,仅需约 4.3 小时 RTX 3090 训练。

DIAMOND
-
Diffusion for World Modeling: Visual Details Matter in Atari, University of Geneva, 2405, NeurIPS 2024.
-
Motivation
-
DIAMOND 的 motivation 可以概括成一个核心问题:
World Model 为了"压缩"而丢掉的视觉细节,会不会正是 RL 决策需要的? \boxed{\text{World Model 为了"压缩"而丢掉的视觉细节,会不会正是 RL 决策需要的?}} World Model 为了"压缩"而丢掉的视觉细节,会不会正是 RL 决策需要的? -
DreamerV3、IRIS、STORM 等方法通常在 compact discrete latent space 中建模 dynamics,这有利于降低计算量和长期 rollout 的误差累积,但也会造成有损压缩。对于 Atari,一些很小的视觉元素 ------ 球、子弹、敌人位置等 ------ 可能直接决定 action;如果 tokenizer 把它们抹掉,world model 即使 latent dynamics 很稳定,对 agent 来说仍然是"错误的世界"。
-
与此同时,diffusion model 已经证明自己擅长高保真图像生成、条件生成和多模态分布建模。因此 DIAMOND 问的是:
能不能不用强离散压缩,而直接用 diffusion 来学习一个高保真的 world model? \boxed{ \text{能不能不用强离散压缩,而直接用 diffusion 来学习一个高保真的 world model?} } 能不能不用强离散压缩,而直接用 diffusion 来学习一个高保真的 world model?
-
Contribution
-
首次系统地把 diffusion world model 用于 imagination-based RL。
DIAMOND(DIffusion As a Model Of eNvironment Dreams)直接根据历史 observation 和 action,通过 diffusion 生成下一帧 observation:
(xt−L+1:t,at−L+1:t)→xt+1. (x_{t-L+1:t},a_{t-L+1:t}) \rightarrow x_{t+1}. (xt−L+1:t,at−L+1:t)→xt+1.Actor-Critic 随后直接在这个生成出来的视觉环境中训练。主模型采用轻量的 2D U-Net + frame stacking,而不是先把图像压成 IRIS 那样的 discrete tokens。 -
解决 diffusion 作为 world model 时的效率和长期稳定性问题。
普通 diffusion 需要很多 denoising steps,这对于每个 environment step 都要生成一帧的 RL 来说太慢;而且 autoregressive rollout 很容易累积误差。DIAMOND 因此重点研究了 diffusion parameterization、sampling steps 等设计,使模型能用很少的 denoising steps 进行稳定的 long-horizon imagination。论文默认仅使用 3 个 denoising steps。 -
证明更好的 visual fidelity 确实能带来更好的 RL performance。
DIAMOND 在 Atari100k 上达到 mean human-normalized score 1.46,成为当时完全在 world model 中训练 agent 的新 SOTA;作者进一步分析发现,一些游戏中的提升确实来自对 task-critical visual details 更准确的建模。 -
另外,它还把 diffusion world model 单独拿出来,在静态 CS:GO gameplay 数据上训练成了一个可交互的 neural game engine,说明这种模型不仅可以作为 agent 的 imagination environment,也可以直接成为视觉 simulator。
Genie
-
Genie: Generative Interactive Environments, Google DeepMind, 2402, ICML 2024.
-
Motivation
-
Genie 的 motivation 可以概括成一个很明确的问题:
能不能不依赖 action labels,仅从海量视频里学出可交互的 world model? \boxed{\text{能不能不依赖 action labels,仅从海量视频里学出可交互的 world model?}} 能不能不依赖 action labels,仅从海量视频里学出可交互的 world model? -
传统 world model 往往需要训练数据:
(ot,at,ot+1), (o_t,a_t,o_{t+1}), (ot,at,ot+1),也就是除了视频,还必须知道用户/agent 做了什么 action。问题是 Internet 上的视频规模巨大,但绝大多数只有:
(o1,o2,...,oT), (o_1,o_2,\ldots,o_T), (o1,o2,...,oT),没有 action annotation。这使得传统 action-conditioned world model 很难直接利用 Internet-scale video data。 -
Genie 因此希望从纯视频中自动发现"什么变化可以被理解为 action",再利用这些 latent actions 建立可控的生成环境。
同时,普通 video generation 通常是:
text / initial frame→entire video, \text{text / initial frame}\rightarrow\text{entire video}, text / initial frame→entire video,用户无法在每一步介入;而 Genie 想要的是:
frame-level controllability \boxed{\text{frame-level controllability}} frame-level controllability也就是用户每一步给一个 action,模型再生成下一帧,从"video generator"变成真正的 generative interactive environment。
-
Contribution
-
1、提出从无标注视频中学习 latent action 的 Latent Action Model(LAM)。
LAM 根据前后帧推断:
(x≤t,xt+1)→a~t, (x_{\le t},x_{t+1}) \rightarrow \tilde a_t, (x≤t,xt+1)→a~t,并通过 VQ-VAE 把 action 压缩成一个很小的离散 action space,实验中只有 8 个 latent actions。这样,训练数据不再需要真实 action labels。

-
提出完整的 generative interactive environment 架构。
Genie 包含三个核心组件:
Video Tokenizer+Latent Action Model+Dynamics Model \boxed{ \text{Video Tokenizer}+ \text{Latent Action Model}+ \text{Dynamics Model} } Video Tokenizer+Latent Action Model+Dynamics Model其中 video tokenizer 把视频变成离散 visual tokens,LAM 推断 latent actions,dynamics model 根据:
(z<t,a<t) (z_{<t},a_{<t}) (z<t,a<t)预测下一帧 tokens (z_t)。Dynamics model 使用 ST-Transformer + MaskGIT 来完成 autoregressive next-frame generation。


-
证明 Internet-scale video 可以训练 foundation world model。
Genie 仅使用视频数据训练,就能够接受 text-to-image 生成图、手绘草图、真实照片等不同 prompt,并把它们变成可交互环境;最终模型规模约 11B 参数。更重要的是,用户可以在 inference 时直接选择 latent action,让模型逐帧生成不同 trajectory。
GameNGen
-
Diffusion Models Are Real-Time Game Engines, Google Research, 2408, ICLR 2025.
-
Motivation
-
GameNGen 的 motivation 比 DIAMOND 又往前走了一步。它关注的已经不主要是"如何用 world model 训练更好的 agent",而是:
神经网络本身能不能直接成为一个实时 game engine? \boxed{\text{神经网络本身能不能直接成为一个实时 game engine?}} 神经网络本身能不能直接成为一个实时 game engine?
-
传统游戏引擎的核心循环是:根据用户输入更新内部 game state,然后按照人工编写的规则渲染下一帧。与此同时,diffusion/video model 已经能生成很逼真的视频。那么一个自然的问题是:能不能彻底不用手写游戏逻辑,而让生成模型根据玩家 action 直接生成下一帧?
-
同时,作者强调,interactive simulation 并不等于普通 video generation。它至少同时要求:用户 action 是在线到来的;模型必须逐帧 autoregressive generation;长时间 rollout 不能迅速漂移;还必须足够快,达到 real-time interaction。此前 neural game simulator 往往在游戏复杂度、速度、long-horizon stability 或 visual quality 中至少有一项明显不足。
-
因此,论文直接提出:
Can a neural model running in real-time simulate a complex game at high quality?
-
Contribution
-
证明复杂游戏可以完全由生成模型实时运行。
GameNGen 用一个 augmented Stable Diffusion v1.4 来模拟 DOOM:
(o<t,a≤t)→ot (o_{<t},a_{\le t}) \rightarrow o_t (o<t,a≤t)→ot不再显式执行传统 game logic,而是根据过去画面和玩家动作直接生成下一帧。它在单 TPU 上达到 20 FPS,能够稳定进行数分钟交互,并学习 health/ammo、攻击敌人、开门、破坏物体等复杂 game-state dynamics。
-
解决 action-conditioned diffusion 的长程 autoregressive instability。
普通训练使用 teacher forcing,但 inference 时模型会把自己上一帧的预测继续作为输入,于是误差不断累积。GameNGen 的关键技术是 noise augmentation:训练时主动污染历史 context latent,让模型学会从"不完美历史"中恢复正确状态,从而大幅减轻 autoregressive drift。没有该方法时,论文中仅 20--30 帧后质量就明显退化。
-
给出一套让 neural game engine 真正可用的完整 pipeline。
包括:先训练一个 RL agent 大规模玩 DOOM,并记录不同训练阶段的 trajectory 作为数据;再把 Stable Diffusion 改造成 action-conditioned next-frame predictor;对 latent decoder 单独 fine-tune,提高 HUD、文字和小细节质量;同时将 diffusion sampling 降到很少的步骤以满足实时运行。 作者自己将这三点总结为:大规模 agent data collection、noise augmentation 稳定 autoregressive generation、decoder fine-tuning 提升视觉质量。

JOWA
-
Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining, Chinese Academy of Sciences, 2410, ICLR 2025.
-
Motivation
-
JOWA 的 motivation 和前面的 GameNGen / Genie 不太一样,它重新把重点拉回到 "如何利用 World Model 获得更强、更通用的 Agent"。
-
它的核心问题是:
Offline RL 能不能像 LLM 一样,通过大规模多任务预训练获得 scaling 和泛化能力? \boxed{\text{Offline RL 能不能像 LLM 一样,通过大规模多任务预训练获得 scaling 和泛化能力?}} Offline RL 能不能像 LLM 一样,通过大规模多任务预训练获得 scaling 和泛化能力? -
现有 multi-task offline RL 有两个主要问题:一类方法依赖大量高质量甚至 expert trajectories;另一类虽然能扩大模型和数据规模,但对 unseen tasks 的迁移能力有限。与此同时,作者观察到视觉 world model 在大规模视频预训练后具有较好的跨场景泛化能力,因此提出:能否利用 image-based world modeling 来帮助 offline RL scale,并提升新任务泛化?
-
另一个关键问题是,直接把 Q-learning 网络做大并不容易。TD learning 本身比较不稳定,随着模型规模增加,这种问题可能更加严重。因此作者希望 world-modeling objective 不只是"额外预测未来",而是作为一种监督信号来帮助 representation learning、稳定大型 Q-network 的训练。
-
所以 JOWA 的核心思想是:
World Modeling+Action / Q-value Learning→Joint Pretraining \boxed{ \text{World Modeling}+ \text{Action / Q-value Learning} \rightarrow \text{Joint Pretraining} } World Modeling+Action / Q-value Learning→Joint Pretraining
-
Contribution
-
提出 Jointly-Optimized World-Action Model(JOWA)。
JOWA 用一个 shared Transformer backbone 同时承担两件事:
World Part:(z≤t,a≤t)→(zt+1,rt,dt) \text{World Part}: \quad (z_{\le t},a_{\le t}) \rightarrow (z_{t+1},r_t,d_t) World Part:(z≤t,a≤t)→(zt+1,rt,dt)和
Action Part:(z≤t,a<t)→Q(at). \text{Action Part}: \quad (z_{\le t},a_{<t}) \rightarrow Q(a_t). Action Part:(z≤t,a<t)→Q(at).也就是说,同一个 Transformer 上接:- next-observation head
- reward head
- termination head
- Q-value head
-
World part 用 supervised world-modeling loss,Action part 用 offline TD/CQL loss,两种 gradient 共同更新 Transformer。整体 objective:
L=βLworld+Laction \boxed{ \mathcal L = \beta\mathcal L_{\text{world}}+ \mathcal L_{\text{action}} } L=βLworld+Laction其中一个重要发现是:
Lworld 可以作为 TD learning 的 regularizer \boxed{ \mathcal L_{\text{world}} \text{ 可以作为 TD learning 的 regularizer} } Lworld 可以作为 TD learning 的 regularizer从而让大模型的 offline Q-learning 更稳定。 -
提出利用 World Model + Q-value 的高效 planning。
JOWA 并不是 inference 时简单:
at=argmaxaQ(st,a). a_t=\arg\max_a Q(s_t,a). at=argamaxQ(st,a).因为 (Q) 本身可能估计有误差。它利用 world model rollout 若干步:
st→st+1→⋯→st+H, s_t \rightarrow s_{t+1} \rightarrow\cdots\rightarrow s_{t+H}, st→st+1→⋯→st+H,计算:
∑i=0H−1γir^i⏟World Model:近期收益+γHmaxaQ^(st+H,a)⏟Q:远期收益. \underbrace{\sum_{i=0}^{H-1}\gamma^i\hat r_i} {\text{World Model:近期收益}}+ \underbrace{\gamma^H\max_a\hat Q(s{t+H},a)} _{\text{Q:远期收益}}. World Model:近期收益 i=0∑H−1γir^i+Q:远期收益 γHamaxQ^(st+H,a).再通过 parallelizable beam search 选择 action。可以把它理解成:
Model-based Planning+Q-value Bootstrapping \boxed{ \text{Model-based Planning}+ \text{Q-value Bootstrapping} } Model-based Planning+Q-value Bootstrapping作者还给出了 planning error bound,说明在一定条件下 planning 可以补偿 Q-value estimation error。 -
证明 Offline Model-Based RL 具有 scaling 和迁移潜力。
JOWA 在 15 个 Atari 游戏、约 6B visual/action tokens 上预训练一个统一模型,并测试 40M、70M、150M 等规模;随着模型容量增加,aggregate performance 呈现 scaling trend。更重要的是,预训练模型只使用 5k transitions(约几条 trajectory) 就能 fine-tune 到 unseen games,说明 world-action pretraining 确实带来了较强的 transfer ability。
Summary
- 第一类可以叫 agent-oriented / imagination-based world models。Dreamer、IRIS、DreamerV3、STORM、DIAMOND 的共同目标确实是:
学一个虚拟环境→让 Agent 在里面训练 \boxed{\text{学一个虚拟环境}\rightarrow\text{让 Agent 在里面训练}} 学一个虚拟环境→让 Agent 在里面训练它们通常不仅预测未来 observation/state,还需要 reward(以及 termination/continue),因为 Actor-Critic 要靠这些 imagined signals 学习。区别主要在"世界如何表示"和"dynamics 用什么建模":Dreamer/DreamerV3/STORM 主要在 compact latent state 中 rollout;IRIS 在 discrete visual-token space 中 autoregress;DIAMOND 则直接用 diffusion 在 image/observation space 中生成未来,因此更加重视 visual fidelity。IRIS 明确把 policy 纯粹放在 imagined trajectories 中训练;DIAMOND 也明确定位为"agent trained in a diffusion world model"。 - 第二类可以叫 simulator-oriented / generative interactive world models。GameNGen 和 Genie 的主要目标不再是"这个 WM 能不能让 RL 分数更高",而是:
给定历史 + action,能不能生成一个逼真、可控、长期稳定的未来世界 \boxed{\text{给定历史 + action,能不能生成一个逼真、可控、长期稳定的未来世界}} 给定历史 + action,能不能生成一个逼真、可控、长期稳定的未来世界GameNGen 最明显:RL agent 只是负责采集训练数据,最终产品是一个人可以直接玩的 neural game engine,而不是 policy。Genie 更进一步,从无 action-label 视频中自己学 latent action,目标是 generative interactive environment。但"不再强调 train in imagination"比"不能用于 train in imagination"更准确------Genie 甚至讨论了利用 latent actions 训练 agent 的潜力。 - 第三类:JOWA 的 shared Transformer 同时学习两件事:
World model: (z,a)→(z′,r,d) \text{World model: }(z,a)\rightarrow(z',r,d) World model: (z,a)→(z′,r,d)和
Action model: (z,a)→Q(a). \text{Action model: }(z,a)\rightarrow Q(a). Action model: (z,a)→Q(a).也就是说,它的 action side 核心是 Q-value / decision-making,不是像 VLA 或 autoregressive policy 那样直接预测下一动作。它本质上仍然属于 offline model-based RL,只是把 world modeling 和 action-value learning 放进同一个 backbone 中 jointly optimize。
| 类别 | 工作 | 核心目标 |
|---|---|---|
| Agent-oriented World Model | Dreamer, IRIS, DreamerV3, STORM, DIAMOND | 学虚拟环境,train agent in imagination |
| Simulator-oriented Generative World Model | Genie, GameNGen | 学可控、高保真、长期稳定的交互式世界生成器 |
| Joint World-Action Model | JOWA | World understanding + decision making 联合预训练 |
| Work | 代表性性能 | 数据效率 | 训练 / 推理效率 | 我的评价 |
|---|---|---|---|---|
| Dreamer | DMC 20 个 visual control tasks;5M env steps 后平均 823,超过 D4PG 用 100M steps 得到的 786 | 强:latent imagination 大幅减少真实交互 | 很强:在 compact latent space rollout,不需要生成图像 | 最"干净"的效率路线。牺牲视觉真实性,换取极便宜的 imagination;奠定后续 Agent-oriented WM 范式 |
| IRIS | Atari100k Mean HNS 1.046,10/26 games superhuman | 很强:仅 100k interactions ≈ 2h gameplay | 较弱:STORM 的统一比较估算约 168 V100-hours;每帧要 autoregressively 生成多个 visual tokens | 证明了 Transformer + visual tokens 能做 WM,但 token autoregression 很贵,后来基本被更高效架构超越 |
| DreamerV3 | Atari100k Mean HNS ≈ 1.10;更重要的是固定超参覆盖 8 domains、150+ tasks,并能从零学会 Minecraft diamond | 很强 | 很强:STORM 比较中约 12 V100-hours;latent recurrent rollout 非常便宜 | 综合性最好的传统 Agent-oriented WM。不是单 benchmark 最强,但 robustness / generality / efficiency 极其均衡 |
| STORM | Atari100k Mean HNS 1.266 | 很强:100k interactions | 非常强:4.3h RTX3090,折算约 9.3 V100-hours | 如果只看 Atari100k 的 performance / compute ratio,我认为这几篇里 STORM 最漂亮:Transformer 又快又强 |
| DIAMOND | Atari100k Mean HNS 1.459,11 games superhuman,为这批 imagination-based agents 中最高 | 很强:仍然只用 100k interactions | 中等偏弱:单游戏约 2.9 days / RTX4090;但只需 3 NFE/frame,显著少于 IRIS 的 16 NFE | 性能换算力的典型。视觉 fidelity 明显最好,并带来更强 Agent,但 image-space diffusion 天然比 compact latent rollout 贵 |
| Genie | 不适合用 game score 衡量;亮点是从无 action-label Internet video 学出可控 latent actions,并能泛化到 sketch/photo/OOD prompt | 从"action-labelled data"角度 极强;但总数据量巨大:约 30k hours video | 很弱 :约 10.7B params、942B training tokens、256 TPUv5p;25 MaskGIT steps/frame,约 1 FPS,memory 仅 16 frames | scaling / generality 最激进,但效率最差。更像 foundation-world-model proof-of-concept,而不是实用 simulator |
| GameNGen | DOOM next-frame PSNR 29.43;人类短视频真假判断接近随机;可稳定 multi-minute interaction | 较弱:70M examples,数据又来自约 50M RL env steps | 推理很强,训练很贵 :128 TPU-v5e 训练;4 DDIM steps 即可达到 20 FPS / 50 ms on TPU-v5 | 最大贡献是把 generative WM 从"能生成"推到了 real-time playable。但目前高度 domain-specific,靠巨量单游戏数据换效果 |
| JOWA | 150M 模型在 15 个 pretrained Atari games 上用 10% offline data 达到 78.9% IQM HNS ;5k transitions/task 微调 unseen games 达 64.7% IQM DNS | 非常强的 transfer efficiency:unseen game 约 4 trajectories 即可 fine-tune;但预训练本身约 6B tokens | 模型仅 150M,直接 Q inference 10.8 FPS ;加入 planning 后 1.26 FPS,但仍比 MCTS 0.12 FPS 快约 10× | 不追求 pixel fidelity,而追求 scaling + decision intelligence。最大亮点是 pretrained world representation 真正转化成了 few-shot decision ability |