技术栈
on-policy
爱听歌的周童鞋
3 小时前
强化学习
·
q-learning
·
on-policy
·
off-policy
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 7 | Part 7 | 时序差分方法(Q-learning 伪代码与例子)
学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第七讲 Part 7:时序差分方法(Q-learning 伪代码与例子),记录个人学习笔记,和大家一起分享交流😄
我是有底线的