强化学习路径教程

好久没有发文章了,最近都在学强化学习了!接下来我会发学习强化学习的路径和demo。


我是从原理论证到demo实现的方法进行摸索;当然,原理论证大家可以不用花太多时间,只需要知道知道大概就行,比如折扣因子γ、学习率、探索率、纯贪心策略、贪心策略、神经网络拟合等超参数就行。

大概:

原理论证:

推荐哔哩哔哩up主:

西湖大学WindyLab

【强化学习的数学原理】课程:从零开始到透彻理解(完结)_哔哩哔哩_bilibili

从贝尔曼方程->贝尔曼最优->MC->值函数和策略方法->时序差分->随机梯度近似和下降->值函数近似和策略梯度方法->TRPO->PPO->SAC->模仿学习->MPC->MBPO->离线强化学习->IPPO->MADDPG->MAPPO->HAPPO

demo实现:

我推荐学习这本书,有电子版的;

教材PDF+PPT+代码网址:这个是上面up主提供的;

  1. 【Github】:https://github.com/MathFoundationRL/Book-Mathmatical-Foundation-of-Reinforcement-Learning

  2. 【百度网盘】:https://pan.baidu.com/s/1kNxM8sl8FUWV6SiiGIep3Q?pwd=ghx8 3. 【Onedrive】:https://westlakeu-my.sharepoint.com/:f:/g/personal/lyujialing_westlake_edu_cn/EgN1-0jOU61BnaTkG7zJ9nsBUdjKEi6hNrdT5n8mp-qn3g?e=3MbtmD 其中GitHub的材料是最新的,有条件的推荐访问GitHub;

后面我也会把我个人跑课程项目以及基于开源项目的开发(不限于改网络)的demo发到Github上,当然可能不会发比较简单的demo。

相关推荐
幻影123!2 天前
AlphaZero 五子棋实战(番外二):白棋专项训练的一种方案
python·机器学习·强化学习·五子棋·alpha zero
I Am a robert girl3 天前
从科学代码库到智能体训练场:ScienceIDE 的架构拆解与工程启示
架构·强化学习·代码仓库·科学计算·监督微调·智能体训练·可编程环境
Better Bench4 天前
从摸石头过河到看录像学习:强化学习与离线RL的进化故事
学习·强化学习·贝尔曼方程·离线强化学习·在线强化学习·q值
论文复现现场4 天前
Qwen3.8-27B 做 GRPO 需要几张 4090?Coding Agent 显存预算与多卡验收
强化学习·qwen·大模型微调·rtx4090·算家云·grpo
微小冷5 天前
gymnasium初步教程
强化学习·gym·仿真环境·gymnasium·动力学仿真
Web3&Basketball6 天前
用 SGLang 决策端点做毫秒级 Agent 路由
python·大模型·agent·强化学习·多模态·推理
AI你一生一世6 天前
一年前,我用 RL 造了一批非自回归决策模型
强化学习·决策系统·低延迟推理·非自回归模型·实时竞价
盘古开天16667 天前
PPO算法原理详解(上):从策略梯度到近端策略优化的演进之路
人工智能·算法·机器学习·强化学习·ppo
盼小辉丶7 天前
PyTorch强化学习实战(27)——进化策略在强化学习中的应用
人工智能·pytorch·深度学习·强化学习
火星机器人life9 天前
PPO 会探索、CBF 会保命:RADAR-BPO 把复杂环境碰撞率压到 10.7%
强化学习·机器人导航·控制屏障函数·安全滤波