Deep RL learning[2026/8]

前言:

最近有个项目要用到RL,回顾一下RL,深化一下自己的RL的理

機器學習2021】(中文版)


目录

  1. RL 定义
  2. RL 的学习方法

一 RL 定义

强化学习就是**智能体(Agent)通过试错,学出一套最优"条件反射"**的过程。

  • 状态(State) :当下环境的快照,是决策的依据难点:使用什么特征,必须跟结果有因果相关性,一方面需要专业的背景知识,另一方面可以读相关的文献)。

  • 动作(Action) :智能体能做的操作(注意点: 在具体业务中不同的action 其代价函数是不一样的)。

  • 奖励(Reward) :环境对动作的即时打分(正=好,负=坏,难点,如何给合适的reward,需要根据不同的动作,给出不同的reward,比如同一个结果,有的action 开销更小,对应的奖赏更大,同时也影响到学习速度,要根据不同的任务做大数据分析,比如有的业务,部署到结束到无法采集需要的episode),是唯一的学习信号。

  • 新状态(Next State, s′) :执行动作后环境变成的新局面,形成交互闭环(s→a→r,s′→...)。

  • 策略(Policy, π) :从状态到动作的映射规则 (a=π(s) 或概率分布),是最终学到的大脑


二 RL 学习的方法

在强化学习中,学习的核心目标是获得一个最优策略(policy),通常也称为actor。该策略根据当前环境状态(state)决定智能体应采取的动作(action).主要分为三步

第一步 策略表示

首先,定义一个参数化的函数(如神经网络)来表示actor,即策略 πθ(a∣s),它将状态映射到动作上的概率分布。

第二步 策略评估

定义一个评价指标来衡量该策略的优劣。在强化学习中,该指标通常为智能体与环境交互所获得的累积期望回报(expected total reward)。

单个轨迹,我们可以得到对应的total reward

强化学习目标是total reward 的数学期望最大,对应不同轨迹total reward的平均值

​​​​​​​

​​​​​​​​

第三步:策略优化 梯度上升

智能体跟环境互动行程了轨迹:,需要找个网络参数使得

total return的期望最大

​​​​​​​​​​​​​​

在强化学习中,面临以下难点:

策略网络(Actor)的输出为随机策略,动作需从其概率分布中采样获得,引入随机性;

环境(Env)为黑盒(Black-Box),无法获取其内部状态或梯度信息;

奖励信号(Reward)通常也具有随机性,且往往稀疏。

关于损失函数的构建,强化学习的目标是最大化累积奖励(Total Reward),而深度学习框架默认采用梯度下降法最小化损失函数,因此将优化目标取负,即定义损失函数为累积奖励的负值(Loss = -Total Reward),从而将最大化问题转化为标准的最小化问题,使得梯度下降能够直接作用于该损失,实现对策略的有效优化。

参考:

先看 https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes

PPO

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=6https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=4

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=5

https://www.bilibili.com/video/BV1XP4y1d7Bk/?spm_id_from=333.337.search-card.all.click

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=9

2022 RL 教程系列

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=10

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes

https://www.youtube.com/watch?v=75rZwxKBAf0&list=PLJV_el3uVTsMhtt7_Y6sgTHGHp1Vb2P2J&index=33

相关推荐
具身智能进化论1 小时前
国产协作机器人品牌如何选择,企业长期使用更看重什么
大数据·人工智能·机器人·工厂方法模式
AKAMAI1 小时前
2026年Gartner Peer Insights 边缘分布平台客户之声将Akamai评为客户之选
人工智能·云计算
用户938515635071 小时前
ESLint 代码规范完全指南——从 AST 原理到 flat config 逐行解析
javascript·后端·代码规范
pjj198541 小时前
opencv-轮廓特征和轮廓近似
人工智能·opencv·计算机视觉
weixin-a153003083162 小时前
python-装饰器
开发语言·python
大金SEO2 小时前
GEO优化资源配置:起步阶段的人力和时间投入预估
人工智能
其美杰布-富贵-李2 小时前
08 进阶评估指标与算法特定指标
人工智能·算法
我的xiaodoujiao2 小时前
快速学习Python基础知识详细图文教程17--类型注解和断点调试
开发语言·python·学习·测试工具
2601_950760792 小时前
Caspase-3/7在肠道炎症与肿瘤中的双重功能及其高灵敏度检测应用
人工智能·蛋白