技术栈
在线强化学习
Better Bench
2 小时前
学习
·
强化学习
·
贝尔曼方程
·
离线强化学习
·
在线强化学习
·
q值
从摸石头过河到看录像学习:强化学习与离线RL的进化故事
举例:一个刚“出生”的机械臂,它面前有一个红色杯子。它想抓住这个杯子,但一开始它连手臂怎么动都会碰倒杯子。经过无数次摔倒和重来,它终于学会了稳稳抓取。这个“试错-学习-变强”的过程,就是强化学习的核心思想。本文将通过一个贯穿始终的机械臂学抓取的故事,由浅入深地揭开强化学习(RL)与离线强化学习(Offline RL)的算法演进史。
我是有底线的