摘要
本文解读 ICML 2019 论文《Learning Latent Dynamics for Planning from Pixels》(PlaNet,深度规划网络)。该论文提出从像素观测直接学习潜在动力学模型、并在潜在空间进行快速在线规划 的纯基于模型强化学习框架,通过融合RSSM 双路径潜在状态模型 、交叉熵方法(CEM)潜在空间规划 与latent overshooting 多步预测训练 ,首次让基于模型的智能体在 6 类像素级连续控制任务上全面跑通,其特别之处在于规划全程不生成图像、只在潜在空间评估动作序列。实验表明 PlaNet 仅用 1,000 episodes (约 200× 更少交互)就达到 D4PG 训练 100,000 episodes 的水平,cheetah 任务相对提升 26%,为世界模型(world model)这一研究范式提供了奠基性的技术底座。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机:为什么从像素规划如此困难?
- 研究主线:从问题到结论
- 基准/方法设计:三个组件如何协同
- 分类全景:三种潜在动力学模型设计
- [方法细节:RSSM 与 latent overshooting](#方法细节:RSSM 与 latent overshooting)
- [实验设计与结果:200× 数据效率的定量证据](#实验设计与结果:200× 数据效率的定量证据)
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [PlaNet 和 Dreamer 是什么关系?](#PlaNet 和 Dreamer 是什么关系?)
- [PlaNet 为什么能在潜在空间规划而不生成图像?](#PlaNet 为什么能在潜在空间规划而不生成图像?)
- [RSSM 和普通 VAE/RNN 有什么区别?](#RSSM 和普通 VAE/RNN 有什么区别?)
- [什么是 latent overshooting?](#什么是 latent overshooting?)
- [PlaNet 的规划参数怎么选?](#PlaNet 的规划参数怎么选?)
- [PlaNet 之后为什么社区转向了"想象学习"?](#PlaNet 之后为什么社区转向了"想象学习"?)
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Learning Latent Dynamics for Planning from Pixels |
| 标题(中文) | 从像素中学习潜在动力学进行规划 |
| 作者 | Danijar Hafner, Timothy Lillicrap, Ian Fischer, Ruben Villegas, David Ha, Honglak Lee, James Davidson |
| 机构 | Google Brain · DeepMind · Google Research 多伦多大学 · 密歇根大学 |
| 会议 | ICML 2019 |
| arXiv | 1811.04551 |
| 项目网站 | danijar.com/project/planet |
背景与动机:为什么从像素规划如此困难?
规划(planning)在已知动力学的场景中非常成功------AlphaGo、围棋、模拟机器人控制都依赖精确的模型。但在未知环境中,智能体必须先从交互中学习动力学 ,再用模型规划。这个"学习动力学"环节长期是瓶颈,论文总结了四大困难:模型不精确 、多步预测误差累积 、无法表达多种可能的未来 、训练分布外预测过于自信。
2019 年之前的基于模型强化学习主要分两类,都存在硬伤:
- 状态空间方法 :PILCO、PETS、Plan-by-backprop 等在低维状态上学习动力学并规划,但假设能直接拿到环境状态(或低维特征),无法处理高维像素输入。
- 像素规划方法:机器人社区用视频预测模型规划(如 Foresight 系列),但只能解决简单抓取/推物,难以扩展到更大的状态动作空间、更长的规划视野和稀疏奖励任务。
潜在空间方法 E2C、RCE 证明了"嵌入到潜在空间再规划"的可行性,但只解决了倒立摆、两连杆这样的简单任务。PlaNet 的历史定位正是填补这个空白:从像素出发,在紧凑潜在空间中学习可预测的动力学,让规划第一次在 6 类连续控制任务上达到与模型无关算法相当的性能------这也是后来 Dreamer 系列、TD-MPC、JEPA 世界模型家族的直接源头。
研究主线:从问题到结论

图 10:PlaNet 研究主线流程图(问题 → 动机 → 设计 → 方法 → 实验 → 结论,Mermaid 流程图)
基准/方法设计:三个组件如何协同
PlaNet 是纯基于模型的智能体,由三个组件构成闭环:RSSM 学习动力学 → CEM 在潜在空间规划 → 在线收集经验持续改进模型。

图 1:DeepMind Control Suite 的 6 个像素连续控制任务------cartpole(长视野+出视野记忆)、reacher(稀疏奖励)、cheetah(大状态空间)、finger(接触动力学)、cup(稀疏奖励)、walker(先站后走)。每个任务都代表一类独特的规划挑战。
核心设计要素包括:
- RSSM 双路径状态:状态拆分为确定性部分 h_t = f(h_{t-1}, s_{t-1}, a_{t-1}) 与随机部分 s_t \\sim p(s_t\|h_t)。确定路径由循环网络驱动负责跨步记忆,随机路径建模多未来与部分可观测性------消融证明两者缺一不可。
- 变分推断训练:编码器 q(s_t\|h_t, o_t) 推断近似后验,目标为重建项减 KL 散度,KL 用 3 个 free nats 截断防止正则过强。
- CEM 潜在空间规划 :视野 H=12 步、I=10 轮迭代、J=1000 条候选序列、K=100 精英重拟合,每步重规划(MPC)。奖励由潜在状态直接预测,无需生成图像,所以每步可快速评估上千条动作序列。
- 在线经验收集:5 条随机 seed 回合起步,每 100 次更新追加 1 条新回合,动作叠加高斯噪声探索。
分类全景:三种潜在动力学模型设计

图 11:潜在动力学模型三种设计分类树(Mermaid 流程图)
三种设计在消融中直接对比:纯确定 GRU 记忆强但无法表达多个未来,规划器容易利用模型不准确处;纯随机 SSM 能表达不确定性但信息难以记住多个时间步;RSSM 把两者结合,观察信息必须经过编码器采样步骤,避免从输入到重建的确定性捷径。
方法细节:RSSM 与 latent overshooting

图 2:潜在动力学模型设计:(a) 纯确定 RNN;(b) 纯随机 SSM;(c) RSSM 混合双路径(本文)。圆圈为随机变量、方块为确定性变量,实线为生成过程、虚线为推断模型。
Latent overshooting 是本文的第二个关键创新。标准变分下界只训练一步预测:转移模型的梯度只经过一步 KL,永远不会穿越多步转移链 。当模型容量有限时,一步预测最优≠多步预测最优,而规划恰恰需要多步预测。PlaNet 把变分下界推广为所有距离的平均:\\frac{1}{D}\\sum_{d=1}\^D \\ln p_d(o_{1:T}) \\geq \\sum_t \\big( \\text{重建项} - \\frac{1}{D}\\sum_{d=1}\^D \\beta_d \\, \\mathrm{KL}(q(s_t\|o_{\\leq t}) \| p(s_t\|s_{t-1})) \\big),即对每个距离 1 \\le d \\le D 都训练多步预测(D=5),且 d\>1 的项停止后验梯度------多步预测朝知情后验靠拢,而不是反过来。所有多步项都在潜在空间计算,作为正则器几乎不增加训练成本。
实现细节(来自附录 A):编码/解码沿用 World Models 的卷积网络,GRU 200 units 作确定路径,两层 FC 200+ReLU,潜在状态 30 维对角高斯,图像降到 5 bits;Adam 学习率 10\^{-3}、\\epsilon=10\^{-4}、梯度裁剪 1000,batch 50 \\times 50 长度 50;action repeat 按任务 2~8 不等。
实验设计与结果:200× 数据效率的定量证据
评测协议:6 类 DeepMind Control Suite 像素任务,统一超参数(仅 action repeat 不同),单张 V100 训练 10~20 小时;5 个随机种子 × 10 条轨迹取中位数,对比 A3C(10 万 episodes)、D4PG(10 万 episodes,像素输入)与 CEM+真实仿真上界。
| 任务 | A3C | D4PG | PlaNet (ours) |
|---|---|---|---|
| Cartpole Swing Up | 558 | 862 | 821 |
| Reacher Easy | 285 | 967 | 832 |
| Cheetah Run | 214 | 524 | 662 |
| Finger Spin | 129 | 985 | 700 |
| Cup Catch | 105 | 980 | 930 |
| Walker Walk | 311 | 968 | 951 |
| 数据效率 vs D4PG | --- | 1× | 200× |

图 3:PlaNet 与模型无关算法及模型设计消融的性能曲线(中位数 + 5--95 分位)。蓝色 RSSM 稳定领先,纯随机 SSM 在多数任务几乎学不会,纯确定 GRU 明显更差。

图 4:Agent 设计消融------在线经验收集 vs 随机收集、CEM 迭代 vs 单步最优。在线数据收集在所有任务上都有帮助,在 cartpole、finger、walker 上是必要条件;CEM 迭代搜索全面带来提升。
消融与扩展实验(附录 B/D/E/F/G):
- Latent overshooting 消融:多步预测训练显著改善 10 步开环预测精度与规划性能;纯确定 RNN 无随机潜在变量故不适用,正好体现正则器与模型结构无关的普适性。
- 单模型多任务:一个 agent 不被告知任务身份,仅从图像推断,动作空间 padding 对齐------全部 6 任务可解决,学习略慢于单任务版本,证明共享动力学模型的可行性。
- 开环视频预测:给定上下文帧,模型开环生成未来 50 步图像,RSSM 在 cheetah 上像素级准确,SSM/RNN 明显失真,+overshooting 更清晰。
- 潜在状态诊断:冻结模型后训练小网络从潜在状态预测仿真器真值位置/速度/奖励,开环预测远超规划视野------潜在空间蕴含环境物理状态。
- 规划参数分析:更多候选/更多迭代/更少精英都提升性能;视野 6 步不足,过长反而因搜索空间增大下降,cheetah 最优约 8 步。

图 5:Latent overshooting 消融------完整 RSSM 加 overshooting(蓝)在多数任务上稳定优于不带 overshooting 的版本(绿)。

图 6:单 agent 多任务学习的平均性能曲线------6 条曲线对应 6 个任务,全部可学、收敛略慢。

图 7:测试集上的开环视频预测对比------RSSM 系列未来 50 步保持清晰,纯确定 GRU 与纯随机 SSM 很快失真。

图 8:开环状态诊断------从潜在状态预测真实位置、速度与奖励,规划视野外仍准确。

图 9:真实仿真下不同规划器设置的性能(性能 132~837,蓝→黄)------更多序列、更多迭代、更少精英提升性能,最佳视野约 8 步。
结果对比总结

图 12:结果对比总结图(PlaNet 1k episodes vs 基线 100k episodes,Mermaid 流程图)
关键发现
- 200× 数据效率 :PlaNet 用 1,000 episodes 达到 D4PG 100,000 episodes 的性能,其中 cheetah 任务相对提升 26% ,数据效率增益高达 500+×。
- 双路径缺一不可:去掉随机路径智能体完全学不会,去掉确定路径显著退化------这是 RSSM 成为后续世界模型标配结构的直接证据。
- 在线经验收集必要:随机收集经验在 cartpole、finger、walker 三个任务上无法达到规划性能,CEM 迭代搜索在所有任务上都有提升。
- latent overshooting 收益:训练所有距离(1\\le d\\le 5)的多步预测,改善长期预测且计算开销近零,兼容任意潜在序列模型。
- 单模型多任务可行:不告知任务身份的单个 agent 解决全部 6 个任务,为共享动力学模型与多任务学习铺路。
- 潜在状态蕴含物理量:位置/速度/奖励可从潜在状态开环精确预测,远超规划视野(附录 F)。
局限性
- 固定 action repeat:无时间抽象,长视野任务效率受限。
- 规划视野有限:CEM 视野外的未来奖励被忽略,最终性能受限于搜索预算。
- 重建式学习:依赖图像重建训练信号,视觉多样性高时效率下降;潜在表示可解释性有限。
- 仿真域验证:尚未在真实机器人上验证,像素-动作分布偏移仍是挑战。
作者展望的未来方向包括层次时间抽象、学习值函数补足视野外回报、基于梯度的规划、免重建表示学习,以及多任务共享动力学模型------这些方向在后来的 Dreamer 系列中逐一落地。
常见问题(FAQ)
PlaNet 和 Dreamer 是什么关系?
PlaNet(ICML 2019)是 Hafner 世界模型系列的第一篇:纯模型基于潜在空间规划。Dreamer(ICML 2020)把规划改为在想象的轨迹上学习策略(actor-critic),不再需要每步 CEM 搜索;DreamerV2/V3 进一步扩展到 Atari、Minecraft 与真实机器人。RSSM 与 latent overshooting 均被 Dreamer 系列继承。
PlaNet 为什么能在潜在空间规划而不生成图像?
奖励模型直接定义在潜在状态上 r_t \\sim p(r_t\|s_t),规划器只需在潜在状态序列上累计预测奖励,不需要把潜在状态解码回图像,因此每步可批量评估 1,000 条动作序列,规划开销主要来自模型前向传播。
RSSM 和普通 VAE/RNN 有什么区别?
普通 RNN 隐藏状态是纯确定性的,无法表达多个未来;普通状态空间模型纯随机,难以跨步记忆。RSSM 把两者结合:确定性状态 h_t 由 RNN 驱动负责记忆,随机状态 s_t 在 h_t 上采样负责多未来建模,消融证明两者缺一不可。
什么是 latent overshooting?
把标准变分下界从一步预测推广到所有距离 1\\le d\\le D 的多步预测训练:对每个距离训练转移模型的多步预测一致性,d\>1 停止后验梯度。它本质是潜在空间中的正则器,训练成本近零,却能显著改善长期预测精度。
PlaNet 的规划参数怎么选?
CEM:视野 12 步、迭代 10 轮、候选 1,000 条、精英 100 条重拟合,每步重规划。附录 G 显示更多候选/迭代、更少精英都提升性能,视野 6 步不足、过长下降(cheetah 最优约 8 步)------规划预算与性能近似单调正相关。
PlaNet 之后为什么社区转向了"想象学习"?
PlaNet 每步都要跑 CEM 搜索,计算开销大且视野外回报被忽略。Dreamer 系列改为在想象轨迹上用 actor-critic 学习策略,把"搜索"换成"学习",训练后推理只需一次前向,兼顾数据效率与计算效率,更适合真实世界部署。
参考链接
- arXiv 原文:Learning Latent Dynamics for Planning from Pixels (1811.04551)
- 项目网站:danijar.com/project/planet
- A3C:Asynchronous Methods for Deep Reinforcement Learning (ICML 2016)
- D4PG:Distributed Distributional Deterministic Policy Gradients (ICLR 2018)
- PETS:Deep RL in a Handful of Trials using Probabilistic Dynamics Models (NeurIPS 2018)
- World Models (NeurIPS 2018)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)