MiniMind 学习笔记(十八):速通强化学习——从 MDP 到 PPO 的概念与算法地图在进入强化学习在 LLM 中的应用之前,先用一节内容串讲并总结强化学习的基础知识。这部分基本可以看作是对西湖大学赵世玉老师强化学习课程的学习整理(课程资料开源在 GitHub)。本节主要完成两件事:第一,把 RL 中重要且基础的概念、定义和公式梳理清楚——RL 是一个概念密度很高、符号也容易混乱的领域,先统一下记号,后面讨论具体算法时就不容易迷路;第二,梳理不同算法之间的思路演变和基本逻辑关系,建立一条主线:这些算法分别想解决什么问题,以及它们之间大致如何连接。