技术栈

在线强化学习

Better Bench
2 小时前
学习·强化学习·贝尔曼方程·离线强化学习·在线强化学习·q值
从摸石头过河到看录像学习:强化学习与离线RL的进化故事举例:一个刚“出生”的机械臂,它面前有一个红色杯子。它想抓住这个杯子,但一开始它连手臂怎么动都会碰倒杯子。经过无数次摔倒和重来,它终于学会了稳稳抓取。这个“试错-学习-变强”的过程,就是强化学习的核心思想。本文将通过一个贯穿始终的机械臂学抓取的故事,由浅入深地揭开强化学习(RL)与离线强化学习(Offline RL)的算法演进史。
我是有底线的