【ICML 2019】PlaNet:从像素中学习潜在动力学进行规划|从世界模型奠基视角

摘要

本文解读 ICML 2019 论文《Learning Latent Dynamics for Planning from Pixels》(PlaNet,深度规划网络)。该论文提出从像素观测直接学习潜在动力学模型、并在潜在空间进行快速在线规划 的纯基于模型强化学习框架,通过融合RSSM 双路径潜在状态模型交叉熵方法(CEM)潜在空间规划latent overshooting 多步预测训练 ,首次让基于模型的智能体在 6 类像素级连续控制任务上全面跑通,其特别之处在于规划全程不生成图像、只在潜在空间评估动作序列。实验表明 PlaNet 仅用 1,000 episodes (约 200× 更少交互)就达到 D4PG 训练 100,000 episodes 的水平,cheetah 任务相对提升 26%,为世界模型(world model)这一研究范式提供了奠基性的技术底座。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Learning Latent Dynamics for Planning from Pixels
标题(中文) 从像素中学习潜在动力学进行规划
作者 Danijar Hafner, Timothy Lillicrap, Ian Fischer, Ruben Villegas, David Ha, Honglak Lee, James Davidson
机构 Google Brain · DeepMind · Google Research 多伦多大学 · 密歇根大学
会议 ICML 2019
arXiv 1811.04551
项目网站 danijar.com/project/planet

背景与动机:为什么从像素规划如此困难?

规划(planning)在已知动力学的场景中非常成功------AlphaGo、围棋、模拟机器人控制都依赖精确的模型。但在未知环境中,智能体必须先从交互中学习动力学 ,再用模型规划。这个"学习动力学"环节长期是瓶颈,论文总结了四大困难:模型不精确多步预测误差累积无法表达多种可能的未来训练分布外预测过于自信

2019 年之前的基于模型强化学习主要分两类,都存在硬伤:

  • 状态空间方法 :PILCO、PETS、Plan-by-backprop 等在低维状态上学习动力学并规划,但假设能直接拿到环境状态(或低维特征),无法处理高维像素输入。
  • 像素规划方法:机器人社区用视频预测模型规划(如 Foresight 系列),但只能解决简单抓取/推物,难以扩展到更大的状态动作空间、更长的规划视野和稀疏奖励任务。

潜在空间方法 E2C、RCE 证明了"嵌入到潜在空间再规划"的可行性,但只解决了倒立摆、两连杆这样的简单任务。PlaNet 的历史定位正是填补这个空白:从像素出发,在紧凑潜在空间中学习可预测的动力学,让规划第一次在 6 类连续控制任务上达到与模型无关算法相当的性能------这也是后来 Dreamer 系列、TD-MPC、JEPA 世界模型家族的直接源头。

研究主线:从问题到结论

图 10:PlaNet 研究主线流程图(问题 → 动机 → 设计 → 方法 → 实验 → 结论,Mermaid 流程图)

基准/方法设计:三个组件如何协同

PlaNet 是纯基于模型的智能体,由三个组件构成闭环:RSSM 学习动力学 → CEM 在潜在空间规划 → 在线收集经验持续改进模型

图 1:DeepMind Control Suite 的 6 个像素连续控制任务------cartpole(长视野+出视野记忆)、reacher(稀疏奖励)、cheetah(大状态空间)、finger(接触动力学)、cup(稀疏奖励)、walker(先站后走)。每个任务都代表一类独特的规划挑战。

核心设计要素包括:

  1. RSSM 双路径状态:状态拆分为确定性部分 h_t = f(h_{t-1}, s_{t-1}, a_{t-1}) 与随机部分 s_t \\sim p(s_t\|h_t)。确定路径由循环网络驱动负责跨步记忆,随机路径建模多未来与部分可观测性------消融证明两者缺一不可。
  2. 变分推断训练:编码器 q(s_t\|h_t, o_t) 推断近似后验,目标为重建项减 KL 散度,KL 用 3 个 free nats 截断防止正则过强。
  3. CEM 潜在空间规划 :视野 H=12 步、I=10 轮迭代、J=1000 条候选序列、K=100 精英重拟合,每步重规划(MPC)。奖励由潜在状态直接预测,无需生成图像,所以每步可快速评估上千条动作序列。
  4. 在线经验收集:5 条随机 seed 回合起步,每 100 次更新追加 1 条新回合,动作叠加高斯噪声探索。

分类全景:三种潜在动力学模型设计

图 11:潜在动力学模型三种设计分类树(Mermaid 流程图)

三种设计在消融中直接对比:纯确定 GRU 记忆强但无法表达多个未来,规划器容易利用模型不准确处;纯随机 SSM 能表达不确定性但信息难以记住多个时间步;RSSM 把两者结合,观察信息必须经过编码器采样步骤,避免从输入到重建的确定性捷径。

方法细节:RSSM 与 latent overshooting

图 2:潜在动力学模型设计:(a) 纯确定 RNN;(b) 纯随机 SSM;(c) RSSM 混合双路径(本文)。圆圈为随机变量、方块为确定性变量,实线为生成过程、虚线为推断模型。

Latent overshooting 是本文的第二个关键创新。标准变分下界只训练一步预测:转移模型的梯度只经过一步 KL,永远不会穿越多步转移链 。当模型容量有限时,一步预测最优≠多步预测最优,而规划恰恰需要多步预测。PlaNet 把变分下界推广为所有距离的平均:\\frac{1}{D}\\sum_{d=1}\^D \\ln p_d(o_{1:T}) \\geq \\sum_t \\big( \\text{重建项} - \\frac{1}{D}\\sum_{d=1}\^D \\beta_d \\, \\mathrm{KL}(q(s_t\|o_{\\leq t}) \| p(s_t\|s_{t-1})) \\big),即对每个距离 1 \\le d \\le D 都训练多步预测(D=5),且 d\>1 的项停止后验梯度------多步预测朝知情后验靠拢,而不是反过来。所有多步项都在潜在空间计算,作为正则器几乎不增加训练成本。

实现细节(来自附录 A):编码/解码沿用 World Models 的卷积网络,GRU 200 units 作确定路径,两层 FC 200+ReLU,潜在状态 30 维对角高斯,图像降到 5 bits;Adam 学习率 10\^{-3}\\epsilon=10\^{-4}、梯度裁剪 1000,batch 50 \\times 50 长度 50;action repeat 按任务 2~8 不等。

实验设计与结果:200× 数据效率的定量证据

评测协议:6 类 DeepMind Control Suite 像素任务,统一超参数(仅 action repeat 不同),单张 V100 训练 10~20 小时;5 个随机种子 × 10 条轨迹取中位数,对比 A3C(10 万 episodes)、D4PG(10 万 episodes,像素输入)与 CEM+真实仿真上界。

任务 A3C D4PG PlaNet (ours)
Cartpole Swing Up 558 862 821
Reacher Easy 285 967 832
Cheetah Run 214 524 662
Finger Spin 129 985 700
Cup Catch 105 980 930
Walker Walk 311 968 951
数据效率 vs D4PG --- 200×

图 3:PlaNet 与模型无关算法及模型设计消融的性能曲线(中位数 + 5--95 分位)。蓝色 RSSM 稳定领先,纯随机 SSM 在多数任务几乎学不会,纯确定 GRU 明显更差。

图 4:Agent 设计消融------在线经验收集 vs 随机收集、CEM 迭代 vs 单步最优。在线数据收集在所有任务上都有帮助,在 cartpole、finger、walker 上是必要条件;CEM 迭代搜索全面带来提升。

消融与扩展实验(附录 B/D/E/F/G):

  • Latent overshooting 消融:多步预测训练显著改善 10 步开环预测精度与规划性能;纯确定 RNN 无随机潜在变量故不适用,正好体现正则器与模型结构无关的普适性。
  • 单模型多任务:一个 agent 不被告知任务身份,仅从图像推断,动作空间 padding 对齐------全部 6 任务可解决,学习略慢于单任务版本,证明共享动力学模型的可行性。
  • 开环视频预测:给定上下文帧,模型开环生成未来 50 步图像,RSSM 在 cheetah 上像素级准确,SSM/RNN 明显失真,+overshooting 更清晰。
  • 潜在状态诊断:冻结模型后训练小网络从潜在状态预测仿真器真值位置/速度/奖励,开环预测远超规划视野------潜在空间蕴含环境物理状态。
  • 规划参数分析:更多候选/更多迭代/更少精英都提升性能;视野 6 步不足,过长反而因搜索空间增大下降,cheetah 最优约 8 步。

图 5:Latent overshooting 消融------完整 RSSM 加 overshooting(蓝)在多数任务上稳定优于不带 overshooting 的版本(绿)。

图 6:单 agent 多任务学习的平均性能曲线------6 条曲线对应 6 个任务,全部可学、收敛略慢。

图 7:测试集上的开环视频预测对比------RSSM 系列未来 50 步保持清晰,纯确定 GRU 与纯随机 SSM 很快失真。

图 8:开环状态诊断------从潜在状态预测真实位置、速度与奖励,规划视野外仍准确。

图 9:真实仿真下不同规划器设置的性能(性能 132~837,蓝→黄)------更多序列、更多迭代、更少精英提升性能,最佳视野约 8 步。

结果对比总结

图 12:结果对比总结图(PlaNet 1k episodes vs 基线 100k episodes,Mermaid 流程图)

关键发现

  • 200× 数据效率 :PlaNet 用 1,000 episodes 达到 D4PG 100,000 episodes 的性能,其中 cheetah 任务相对提升 26% ,数据效率增益高达 500+×
  • 双路径缺一不可:去掉随机路径智能体完全学不会,去掉确定路径显著退化------这是 RSSM 成为后续世界模型标配结构的直接证据。
  • 在线经验收集必要:随机收集经验在 cartpole、finger、walker 三个任务上无法达到规划性能,CEM 迭代搜索在所有任务上都有提升。
  • latent overshooting 收益:训练所有距离(1\\le d\\le 5)的多步预测,改善长期预测且计算开销近零,兼容任意潜在序列模型。
  • 单模型多任务可行:不告知任务身份的单个 agent 解决全部 6 个任务,为共享动力学模型与多任务学习铺路。
  • 潜在状态蕴含物理量:位置/速度/奖励可从潜在状态开环精确预测,远超规划视野(附录 F)。

局限性

  • 固定 action repeat:无时间抽象,长视野任务效率受限。
  • 规划视野有限:CEM 视野外的未来奖励被忽略,最终性能受限于搜索预算。
  • 重建式学习:依赖图像重建训练信号,视觉多样性高时效率下降;潜在表示可解释性有限。
  • 仿真域验证:尚未在真实机器人上验证,像素-动作分布偏移仍是挑战。

作者展望的未来方向包括层次时间抽象、学习值函数补足视野外回报、基于梯度的规划、免重建表示学习,以及多任务共享动力学模型------这些方向在后来的 Dreamer 系列中逐一落地。

常见问题(FAQ)

PlaNet 和 Dreamer 是什么关系?

PlaNet(ICML 2019)是 Hafner 世界模型系列的第一篇:纯模型基于潜在空间规划。Dreamer(ICML 2020)把规划改为在想象的轨迹上学习策略(actor-critic),不再需要每步 CEM 搜索;DreamerV2/V3 进一步扩展到 Atari、Minecraft 与真实机器人。RSSM 与 latent overshooting 均被 Dreamer 系列继承。

PlaNet 为什么能在潜在空间规划而不生成图像?

奖励模型直接定义在潜在状态上 r_t \\sim p(r_t\|s_t),规划器只需在潜在状态序列上累计预测奖励,不需要把潜在状态解码回图像,因此每步可批量评估 1,000 条动作序列,规划开销主要来自模型前向传播。

RSSM 和普通 VAE/RNN 有什么区别?

普通 RNN 隐藏状态是纯确定性的,无法表达多个未来;普通状态空间模型纯随机,难以跨步记忆。RSSM 把两者结合:确定性状态 h_t 由 RNN 驱动负责记忆,随机状态 s_th_t 上采样负责多未来建模,消融证明两者缺一不可。

什么是 latent overshooting?

把标准变分下界从一步预测推广到所有距离 1\\le d\\le D 的多步预测训练:对每个距离训练转移模型的多步预测一致性,d\>1 停止后验梯度。它本质是潜在空间中的正则器,训练成本近零,却能显著改善长期预测精度。

PlaNet 的规划参数怎么选?

CEM:视野 12 步、迭代 10 轮、候选 1,000 条、精英 100 条重拟合,每步重规划。附录 G 显示更多候选/迭代、更少精英都提升性能,视野 6 步不足、过长下降(cheetah 最优约 8 步)------规划预算与性能近似单调正相关。

PlaNet 之后为什么社区转向了"想象学习"?

PlaNet 每步都要跑 CEM 搜索,计算开销大且视野外回报被忽略。Dreamer 系列改为在想象轨迹上用 actor-critic 学习策略,把"搜索"换成"学习",训练后推理只需一次前向,兼顾数据效率与计算效率,更适合真实世界部署。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
_张一凡1 天前
【论文解读】一篇读懂LAWM-3D:从 DreamDojo 的 2D 潜动作到 3D 感知,关键不是加多视角而是三道防泄漏设计
3d·具身智能·世界模型
白拾3 天前
【arXiv preprint 2026】JEPA-VLA:视频预测嵌入,为 VLA 补上缺失的视觉知识|从具身智能世界模型视角
具身智能·世界模型·jepa·jepa-vla 论文分享·vla 机器人·自监督表示·v-jepa2
白拾4 天前
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角
扩散模型·世界模型·模仿学习·rss 2025·uwm 论文分享·机器人预训练
带娃的IT创业者4 天前
Spec-Kit 与物理智能的范式跃迁:当 GitHub 成为世界模型的协作基础设施
github·世界模型·规范驱动开发·机器人开发·开源协作·物理智能
猫先生Mr.Mao4 天前
世界模型之HY-World 2.0详解:生成完还能走进去——如何把文本、照片和视频变成可探索的 3D 世界
多模态·论文解读·3dgs·世界模型
旋生万物8 天前
电磁力 = 螺旋联络的 90° 旋转?麦克斯韦方程组的几何重构
人工智能·python·算法·机器学习·copilot·世界模型·物理ai
ergevv9 天前
从大模型到空间智能:未来机器人的终极架构畅想
机器人·vla·世界模型·空间智能·认知地图
一颗小树x14 天前
机器人世界模型:2026 技术全景与工程选型指南
机器人·指南·操作·vla·世界模型