前言:
最近有个项目要用到RL,回顾一下RL,深化一下自己的RL的理
目录
- RL 定义
- RL 的学习方法
一 RL 定义

强化学习就是**智能体(Agent)通过试错,学出一套最优"条件反射"**的过程。
状态(State) :当下环境的快照,是决策的依据 (难点:使用什么特征,必须跟结果有因果相关性,一方面需要专业的背景知识,另一方面可以读相关的文献)。
动作(Action) :智能体能做的操作(注意点: 在具体业务中不同的action 其代价函数是不一样的)。
奖励(Reward) :环境对动作的即时打分(正=好,负=坏,难点,如何给合适的reward,需要根据不同的动作,给出不同的reward,比如同一个结果,有的action 开销更小,对应的奖赏更大,同时也影响到学习速度,要根据不同的任务做大数据分析,比如有的业务,部署到结束到无法采集需要的episode),是唯一的学习信号。
新状态(Next State, s′) :执行动作后环境变成的新局面,形成交互闭环(s→a→r,s′→...)。
策略(Policy, π) :从状态到动作的映射规则 (a=π(s) 或概率分布),是最终学到的大脑。
二 RL 学习的方法
在强化学习中,学习的核心目标是获得一个最优策略(policy),通常也称为actor。该策略根据当前环境状态(state)决定智能体应采取的动作(action).主要分为三步

第一步 策略表示
首先,定义一个参数化的函数(如神经网络)来表示actor,即策略 πθ(a∣s),它将状态映射到动作上的概率分布。

第二步 策略评估
定义一个评价指标来衡量该策略的优劣。在强化学习中,该指标通常为智能体与环境交互所获得的累积期望回报(expected total reward)。
单个轨迹,我们可以得到对应的total reward
强化学习目标是total reward 的数学期望最大,对应不同轨迹total reward的平均值

第三步:策略优化 梯度上升

智能体跟环境互动行程了轨迹:
,需要找个网络参数使得
total return的期望最大
在强化学习中,面临以下难点:
策略网络(Actor)的输出为随机策略,动作需从其概率分布中采样获得,引入随机性;
环境(Env)为黑盒(Black-Box),无法获取其内部状态或梯度信息;
奖励信号(Reward)通常也具有随机性,且往往稀疏。
关于损失函数的构建,强化学习的目标是最大化累积奖励(Total Reward),而深度学习框架默认采用梯度下降法最小化损失函数,因此将优化目标取负,即定义损失函数为累积奖励的负值(Loss = -Total Reward),从而将最大化问题转化为标准的最小化问题,使得梯度下降能够直接作用于该损失,实现对策略的有效优化。
参考:
先看 https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes
PPO
https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=6https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=4
https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=5
https://www.bilibili.com/video/BV1XP4y1d7Bk/?spm_id_from=333.337.search-card.all.click
https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=9
2022 RL 教程系列
https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=10
https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes
https://www.youtube.com/watch?v=75rZwxKBAf0&list=PLJV_el3uVTsMhtt7_Y6sgTHGHp1Vb2P2J&index=33
