《Dream to Control: Learning Behaviors by Latent Imagination》随记

博客地址:https://www.cnblogs.com/zylyehuo/
参考链接:从DreamerV1到DreamerV3|Model-based RL的学习之路

阶段一:学习世界模型(Dynamics Learning)

具体可以参考链接:《Learning Latent Dynamics for Planning from Pixels》随记


阶段二:在潜空间中想象(Behavior Learning)


阶段三:与环境交互(Environment Interaction)

PlaNet 和 Dreamer 的异同

PlaNet = 世界模型(RSSM) + 在线实时推演找最优解 。
Dreamer = 世界模型(RSSM) + 离线在梦境中训练 Actor/Critic + 依靠 Actor 实时反应 。
PlaNet 不是 Dreamer 的前奏,而是它的"前身"。Dreamer 是站在 PlaNet 的肩膀上,把耗时的"在线规划"替换成了更优雅、更具长远目光的"梦境 Actor-Critic 训练" 。

相同点

不管是 PlaNet 还是 Dreamer,它们认识世界的方式是一模一样的 。它们都会收集过去的经验,然后训练 RSSM(循环状态空间模型)。

不同点

有了"预测未来"的能力后,它们采取了不同的战术

相关推荐
dtq04245 天前
卫星导航原理4 - 地球坐标系
导航
dtq04246 天前
卫星导航原理3 - 天球坐标系
导航
奇妙之二进制22 天前
机器人导航路径规划算法入门(6)Dijkstra(迪杰斯特拉)算法深入解析
算法·导航
feasibility.25 天前
当“给机器人指路“成为一门数据工程学——SimpleNav 拆解:导航大模型的标准化之争
ai·机器人·无人机·导航·具身智能·vla·vln
thesky1234562 个月前
智能体面试准备(四十三):具身智能体与机器人实操——从 VLA 到 Sim2Real
机器人·导航·操作·具身智能·智能体·vla·视觉语言动作
硬小二2 个月前
什么是SPS,SPI的核心特点和应用总结
硬件·导航
Evand J3 个月前
【论文复现】MATLAB例程,存在测距误差的WSN无锚点分布式自定位,《WSN中存在测距误差的无锚点分布式自定位方法》
开发语言·分布式·matlab·定位·导航·wsn
君为先-bey4 个月前
NWM----导航世界模型
transformer·扩散模型·导航·具身智能·世界模型·条件扩散
腾讯位置服务4 个月前
5月产品上新|行业潜客产品、违停状态查询API、两轮车距离矩阵3大能力全新上线!
地图·导航·两轮车·腾讯位置服务
七夜zippoe4 个月前
OpenClaw Canvas 导航:URL 加载与控制
canvas·url·导航·openclaw·加载与控制