Deep RL learning[2026/8]

前言:

最近有个项目要用到RL,回顾一下RL,深化一下自己的RL的理

機器學習2021】(中文版)


目录

  1. RL 定义
  2. RL 的学习方法

一 RL 定义

强化学习就是**智能体(Agent)通过试错,学出一套最优"条件反射"**的过程。

  • 状态(State) :当下环境的快照,是决策的依据难点:使用什么特征,必须跟结果有因果相关性,一方面需要专业的背景知识,另一方面可以读相关的文献)。

  • 动作(Action) :智能体能做的操作(注意点: 在具体业务中不同的action 其代价函数是不一样的)。

  • 奖励(Reward) :环境对动作的即时打分(正=好,负=坏,难点,如何给合适的reward,需要根据不同的动作,给出不同的reward,比如同一个结果,有的action 开销更小,对应的奖赏更大,同时也影响到学习速度,要根据不同的任务做大数据分析,比如有的业务,部署到结束到无法采集需要的episode),是唯一的学习信号。

  • 新状态(Next State, s′) :执行动作后环境变成的新局面,形成交互闭环(s→a→r,s′→...)。

  • 策略(Policy, π) :从状态到动作的映射规则 (a=π(s) 或概率分布),是最终学到的大脑


二 RL 学习的方法

在强化学习中,学习的核心目标是获得一个最优策略(policy),通常也称为actor。该策略根据当前环境状态(state)决定智能体应采取的动作(action).主要分为三步

第一步 策略表示

首先,定义一个参数化的函数(如神经网络)来表示actor,即策略 πθ(a∣s),它将状态映射到动作上的概率分布。

第二步 策略评估

定义一个评价指标来衡量该策略的优劣。在强化学习中,该指标通常为智能体与环境交互所获得的累积期望回报(expected total reward)。

单个轨迹,我们可以得到对应的total reward

强化学习目标是total reward 的数学期望最大,对应不同轨迹total reward的平均值

​​​​​​​

​​​​​​​​

第三步:策略优化 梯度上升

智能体跟环境互动行程了轨迹:,需要找个网络参数使得

total return的期望最大

​​​​​​​​​​​​​​

在强化学习中,面临以下难点:

策略网络(Actor)的输出为随机策略,动作需从其概率分布中采样获得,引入随机性;

环境(Env)为黑盒(Black-Box),无法获取其内部状态或梯度信息;

奖励信号(Reward)通常也具有随机性,且往往稀疏。

关于损失函数的构建,强化学习的目标是最大化累积奖励(Total Reward),而深度学习框架默认采用梯度下降法最小化损失函数,因此将优化目标取负,即定义损失函数为累积奖励的负值(Loss = -Total Reward),从而将最大化问题转化为标准的最小化问题,使得梯度下降能够直接作用于该损失,实现对策略的有效优化。

参考:

先看 https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes

PPO

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=6https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=4

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=5

https://www.bilibili.com/video/BV1XP4y1d7Bk/?spm_id_from=333.337.search-card.all.click

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=9

2022 RL 教程系列

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=10

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes

https://www.youtube.com/watch?v=75rZwxKBAf0&list=PLJV_el3uVTsMhtt7_Y6sgTHGHp1Vb2P2J&index=33

相关推荐
回眸&啤酒鸭2 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智2 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅2 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein2 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
小羊没烦恼!2 天前
初探性能优化——2个月到4小时的性能提升
java·开发语言·windows·算法·c#
LaughingZhu2 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台2 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
三十而立洋2 天前
Cookie 详解:从产生到安全,一次讲透
前端·javascript
wukangjupingbb2 天前
智能网联汽车安全能力框架
人工智能