收藏!强化学习从入门到封神:5 本经典教材 + 8 大实战项目 + 7个免费视频,一站式搞定

原文:https://mp.weixin.qq.com/s/nfN0dWT3ZfDuW7ZGfaG6dA

学习资源

经典教材

《大模型算法:强化学习、微调与对齐》

  • 原创 100+ 架构图,系统讲解大模型、强化学习,涵盖:LLM / VLM 等大模型原理、训练算法(RL、RLHF、GRPO、DPO、SFT 与 CoT 蒸馏等)、效果优化与 RAG 等。
  • https://github.com/changyeyu/LLM-RL-Visualized | 1.5k**⭐**

Deep Reinforcement Learning Hands-On

Reinforcement Learning: An Introduction

动手学强化学习

  • 本书一共分为三个部分,分别为动手学习基础篇、动手学习进阶篇和动手学习前沿篇。基础篇关注于 tabular 场景下的 RL,即状态和动作空间都是有限的;进阶篇的内容突破这一限制,考虑连续的状态或动作,此时我们会使用到神经网络。最后,在前沿篇我们会介绍强化学习领域一些有趣的方向,以及相对应的前沿算法
  • 动手学强化学习
  • B站视频链接
  • https://github.com/boyu-ai/Hands-on-RL | 4.1k

蘑菇书EasyRL

  • 整理了李宏毅老师的《深度强化学习》中文视频、周博磊老师的《强化学习纲要》、李科浇老师的《世界冠军带你从零实践强化学习》以及多个强化学习的经典资料。包含RL经典论文解读,见github地址。
  • 蘑菇书EasyRL
  • https://github.com/datawhalechina/easy-rl | 12.8k

博客

OpenAI Spinning Up

Andrej Karpathy blog

小鸟FlappyBird游戏+DQN算法

刘建平Pinard - 博客园

视频资源

莫烦-强化学习

David Silver-强化学习课程

西湖大学-强化学习课程

【王树森】深度强化学习(DRL)

伯克利深度强化学习课程 CS285

李宏毅-深度强化学习

从零开始的强化学习代码实现

应用实战

github开源

强化学习仿真环境Legged Gym的初步使用------训练一个二阶倒立摆

https://blog.zzshub.cn/2024/06/25/DRL_LeggedgymCartpole2/

本篇教程大致介绍 Legged Gym 的结构,使用方法,并以一个二阶倒立摆为例来完成一次实际的强化学习训练。适合强化学习初学者复现。

文档包含 ①强化学习基本概念 ②Legged Gym 环境安装 ③Legged Gym 代码结构介绍 ④二阶倒立摆训练项目代码解读。

开发工具

序号 工具名称 工具描述
1 Gymnasium开源工具包 官网介绍 包含详细介绍、使用教程、api汇总等Gymnasium 是强化学习领域的一个开源工具包,用于开发和比较强化学习算法。它最初是OpenAI Gym 的延续,提供了标准化的 API 和多样化的环境,方便研究人员和开发者训练.测试和评估智能体(Agent)的表现。这是一个通用强化学习环境库,适用于广泛的RL任务Gymnasium是一个轻量级的工具包,主要基于CPU运行,适合学术研究和小规模实验。Gymnasium的学习、使用相关经验贴 【强化学习】Gymnasium库的介绍和使用如何开心地入门gym(gymnasium)
2 RLlib(Ray) Ray是UCBerkeley RISELab开发的分布式编程框架,其中的RLlib提供了很多的强化学习算法支持,支持常见的PPO、SAC、TD3、IMPALA、DQN等算法。提供了不错的分布式支持。后端支持:TensorFlow + PyTorchgithub:https://github.com/ray-project/ray
3 Gym Retro 大约18年,OpenAI 发布了完整版游戏强化学习研究平台------Gym Retro。游戏数量从大约 70 个雅达利和 30 个世嘉游戏增加到了1000多个游戏,其中包括对Game boy等各种模拟器的支持。此外,OpenAI 还将发布用于向 Gym 平台添加新游戏的工具。Github: https://github.com/openai/retro/tree/develop
相关推荐
白拾16 小时前
【arXiv 2026】LoGos:把人类思考带回围棋——通用大模型的专业领域专家之路|从围棋AI与LLM推理交叉视角
强化学习·大模型推理·arxiv 2026·logos 论文分享·围棋ai·专家知识注入
Terrence Shen18 小时前
【读论文系列】AGENTIC REINFORCEMENT LEARNING WITH IMPLICIT STEP REWARDS翻译+解读
大模型·agent·强化学习·rl
白拾19 小时前
【COLM 2025】Search-R1:强化学习让大模型学会边推理边搜索|从LLM检索增强推理视角
强化学习·colm 2025·search-r1 论文分享·llm后训练·检索增强推理
海天一色y1 天前
深入解析 DeepSpeedPPOTrainer:基于 PPO 的大规模 RLHF 训练实现
人工智能·强化学习·deepspeed·后训练
皮卡丘不断更2 天前
从一段 RGB 视频到机器人开门:读懂 Video2DoorTraversal 的仿真闭环
机器人·强化学习·数字孪生·具身智能·机器人仿真
山顶夕景2 天前
【MLLM Agent】多模态理解Agent研究进展
agent·强化学习·多模态·rl·agentic
闲研随记3 天前
【文献阅读 ICLR 2026】RL算法:DECS
算法·llm·强化学习·iclr·rl
XLYcmy3 天前
小红书 算法一面 十二
llm·负载均衡·强化学习·多模态·ppo·dpo·grpo
盼小辉丶5 天前
PyTorch强化学习实战——用预训练语言模型和ChatGPT玩转文本游戏
pytorch·深度学习·语言模型·chatgpt·强化学习
林间码客7 天前
Agentic-RL:从SFT到GRPO,让智能体学会“自主进化”
sft·强化学习·grpo·agentic-rl