Deep RL learning[2026/8]

前言:

最近有个项目要用到RL,回顾一下RL,深化一下自己的RL的理

機器學習2021】(中文版)


目录

  1. RL 定义
  2. RL 的学习方法

一 RL 定义

强化学习就是**智能体(Agent)通过试错,学出一套最优"条件反射"**的过程。

  • 状态(State) :当下环境的快照,是决策的依据难点:使用什么特征,必须跟结果有因果相关性,一方面需要专业的背景知识,另一方面可以读相关的文献)。

  • 动作(Action) :智能体能做的操作(注意点: 在具体业务中不同的action 其代价函数是不一样的)。

  • 奖励(Reward) :环境对动作的即时打分(正=好,负=坏,难点,如何给合适的reward,需要根据不同的动作,给出不同的reward,比如同一个结果,有的action 开销更小,对应的奖赏更大,同时也影响到学习速度,要根据不同的任务做大数据分析,比如有的业务,部署到结束到无法采集需要的episode),是唯一的学习信号。

  • 新状态(Next State, s′) :执行动作后环境变成的新局面,形成交互闭环(s→a→r,s′→...)。

  • 策略(Policy, π) :从状态到动作的映射规则 (a=π(s) 或概率分布),是最终学到的大脑


二 RL 学习的方法

在强化学习中,学习的核心目标是获得一个最优策略(policy),通常也称为actor。该策略根据当前环境状态(state)决定智能体应采取的动作(action).主要分为三步

第一步 策略表示

首先,定义一个参数化的函数(如神经网络)来表示actor,即策略 πθ(a∣s),它将状态映射到动作上的概率分布。

第二步 策略评估

定义一个评价指标来衡量该策略的优劣。在强化学习中,该指标通常为智能体与环境交互所获得的累积期望回报(expected total reward)。

单个轨迹,我们可以得到对应的total reward

强化学习目标是total reward 的数学期望最大,对应不同轨迹total reward的平均值

​​​​​​​

​​​​​​​​

第三步:策略优化 梯度上升

智能体跟环境互动行程了轨迹:,需要找个网络参数使得

total return的期望最大

​​​​​​​​​​​​​​

在强化学习中,面临以下难点:

策略网络(Actor)的输出为随机策略,动作需从其概率分布中采样获得,引入随机性;

环境(Env)为黑盒(Black-Box),无法获取其内部状态或梯度信息;

奖励信号(Reward)通常也具有随机性,且往往稀疏。

关于损失函数的构建,强化学习的目标是最大化累积奖励(Total Reward),而深度学习框架默认采用梯度下降法最小化损失函数,因此将优化目标取负,即定义损失函数为累积奖励的负值(Loss = -Total Reward),从而将最大化问题转化为标准的最小化问题,使得梯度下降能够直接作用于该损失,实现对策略的有效优化。

参考:

先看 https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes

PPO

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=6https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=4

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=5

https://www.bilibili.com/video/BV1XP4y1d7Bk/?spm_id_from=333.337.search-card.all.click

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=9

2022 RL 教程系列

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes&p=10

https://www.bilibili.com/video/BV1XP4y1d7Bk?spm_id_from=333.788.videopod.episodes

https://www.youtube.com/watch?v=75rZwxKBAf0&list=PLJV_el3uVTsMhtt7_Y6sgTHGHp1Vb2P2J&index=33

相关推荐
Anita-lee几秒前
跨境在线旅行社(OTA)国际化运营中的突发服务保障与海外用户体验管理
大数据·人工智能·ux
深海鱼在掘金7 分钟前
深入浅出RAG——第9章:高级检索策略
人工智能
evans在进步8 分钟前
Java 常用设计模式(二):装饰器、适配器、责任链、模板方法、策略与观察者
java·开发语言·设计模式
Forerror20269 分钟前
API网关怎么选?MAI Gateway入选2026年企业级AI网关推荐清单
人工智能·ai工具·maigateway·企业ai网关·企业级大模型网关
qiaozhangmenai9 分钟前
2026年度南京AI智能体开发定制公司推荐|企业AI Agent服务商选型指南
大数据·人工智能
思考着亮10 分钟前
1.RAG 基础
人工智能
mit6.82414 分钟前
Educated
人工智能
律宏阔18 分钟前
Headroom 宣传能省 60%~95% Token,真实会话能省多少?公开基准、独立 Agent 测试与社区实测整理
人工智能·agent
梨想橙汁18 分钟前
JS 核心语法:运算符流程控制、函数、数组与对象实战详解
前端·javascript
七牛开发者18 分钟前
拆解 dsh:Turn 与 Step 如何组织 Agent 主循环
前端·javascript·人工智能