强化学习路径教程

好久没有发文章了,最近都在学强化学习了!接下来我会发学习强化学习的路径和demo。


我是从原理论证到demo实现的方法进行摸索;当然,原理论证大家可以不用花太多时间,只需要知道知道大概就行,比如折扣因子γ、学习率、探索率、纯贪心策略、贪心策略、神经网络拟合等超参数就行。

大概:

原理论证:

推荐哔哩哔哩up主:

西湖大学WindyLab

【强化学习的数学原理】课程:从零开始到透彻理解(完结)_哔哩哔哩_bilibili

从贝尔曼方程->贝尔曼最优->MC->值函数和策略方法->时序差分->随机梯度近似和下降->值函数近似和策略梯度方法->TRPO->PPO->SAC->模仿学习->MPC->MBPO->离线强化学习->IPPO->MADDPG->MAPPO->HAPPO

demo实现:

我推荐学习这本书,有电子版的;

教材PDF+PPT+代码网址:这个是上面up主提供的;

  1. 【Github】:https://github.com/MathFoundationRL/Book-Mathmatical-Foundation-of-Reinforcement-Learning

  2. 【百度网盘】:https://pan.baidu.com/s/1kNxM8sl8FUWV6SiiGIep3Q?pwd=ghx8 3. 【Onedrive】:https://westlakeu-my.sharepoint.com/:f:/g/personal/lyujialing_westlake_edu_cn/EgN1-0jOU61BnaTkG7zJ9nsBUdjKEi6hNrdT5n8mp-qn3g?e=3MbtmD 其中GitHub的材料是最新的,有条件的推荐访问GitHub;

后面我也会把我个人跑课程项目以及基于开源项目的开发(不限于改网络)的demo发到Github上,当然可能不会发比较简单的demo。

相关推荐
xx_xxxxx_10 小时前
论文阅读-REINFORCE++与Lessons of Developing PRMs
人工智能·深度学习·机器学习·强化学习
爱听歌的周童鞋12 小时前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 9 | Part 1 | 策略梯度方法(该方法的基本思路)
强化学习·policy gradient·metric·policy-based
盼小辉丶15 小时前
PyTorch强化学习实战——分布式策略梯度
人工智能·pytorch·深度学习·强化学习
爱听歌的周童鞋1 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 7 | 值函数近似(DQN-Experience replay)
强化学习·deep q-learning·experience·replay buffer
爱听歌的周童鞋3 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 5 | 值函数近似(Sarsa 和 Q-learning)
强化学习·sarsa·q-learning·value function·approximation
闲研随记4 天前
RL算法学习:ArgMaxRL
算法·llm·强化学习·rl
XLYcmy4 天前
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search论文分享
llm·sft·强化学习·多模态·苹果·rag·检索
爱听歌的周童鞋5 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 4 | 值函数近似(原理-示例与分析)
强化学习·example·td-linear·bellman error
爱听歌的周童鞋5 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 2 | 值函数近似(原理-目标函数介绍)
强化学习·目标函数·value function·approximation·平稳分布
爱听歌的周童鞋5 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 7 | Part 7 | 时序差分方法(Q-learning 伪代码与例子)
强化学习·q-learning·on-policy·off-policy