Experience Replay

目录

[1. DQN and TD Learning](#1. DQN and TD Learning)

[2. Experience Replay](#2. Experience Replay)

[2.1 Benefits of Experience Replay](#2.1 Benefits of Experience Replay)

[3. Prioritized Experience Replay](#3. Prioritized Experience Replay)


1. DQN and TD Learning

强化学习的目标就是学习到policy函数 或最优动作价值函数 去控制Agent,让Agent基于当前的状态 来做出相应的动作 ,争取在未来得到尽量多的奖励。

由于我们并不知道 ,因此使用神经网络 来近似

目标是让预测值尽可能接近 ,因此对参数 的更新如下。

在使用过transition 后,会将transition 丢弃,这会造成经验的浪费。

按照顺序使用每一条transition 更新参数 ,前后transition有很强的关联,实验证明这样的相关性是有害的,如果把序列打散,消除相关性,则有利于把DQN训练的更好。

2. Experience Replay

把transition存到一个容量为n的队列(Replay Buffer)里。如果队列已满,存入新的transition就得把早前存的的那个删除,然后再存储新的transition。

其中n是超参数,n通常很大,例如取

从Replay Buffer中随机抽取一个transition来更新参数 ,实践中通常使用minbatch SGD,每次随机抽取多个transition,算多个梯度,用梯度的平均来更新参数

2.1 Benefits of Experience Replay

  1. 打破transition序列的相关性
  2. 重新使用过去的经验多次

3. Prioritized Experience Replay

Prioritized Experience Replay与Experience Replay的区别就是用非均匀抽样代替均匀抽样。

如果做均匀抽样,那么所有的transition都用相同的学习率;如果做非均匀抽样,根据抽样概率调整学习率, 即如果一条transition有较大的抽样概率,应该将它的学习率设置的比较小。

  • 每一条transition 都被标上 (TD Error)。
  • 如果一条transition是刚被收集到的,还没被用来训练DQN,所以并不知道它的 ,直接将它的学习率设置为最大值,给予其最高的权重。
  • 在训练DQN时,也要对 更新,每次使用transition时都要计算 ,这样transition就有了新的权重.

总而言之, 越大,那么抽样概率越大,进而学习率小,可抵消大抽样概率造成的偏差。

相关推荐
CServer_0116 分钟前
开源!西北某化工园区Ai+能源数字化案例
人工智能·能源
天天进步201520 分钟前
Pixelle-Video 源码解析 #15:AI 视频片段生成:从静态配图到动态短视频
人工智能·音视频
深瞳智检22 分钟前
深瞳智检(小程序)正式上线!【免费/快捷/方便】获取YOLO检测数据集
人工智能·yolo·目标检测·小程序·数据集·cv数据收集
AI行业说23 分钟前
誉财自动化YC‑18‑M8045线上模板机:四轴柔性缝制技术如何重塑服装产线
大数据·人工智能·自动化·缝纫机器人·模板机
美狐美颜SDK开放平台26 分钟前
直播APP开发核心功能详解:美颜SDK、音视频、礼物等功能成本怎么计算?
android·人工智能·计算机视觉·音视频·直播美颜sdk
javartisan28 分钟前
AI 大模型工程师完整学习目录
人工智能·学习
程序员阿明29 分钟前
spring boot4集成spring AI 2
人工智能·spring boot·spring
星栈独行35 分钟前
自定义 UI-UX-Pro-Max 的 CSV 知识库,把 AI 生成的后台拉回行业该有的样子
前端·人工智能·ui·ux
王志来1379447300835 分钟前
场景驱动选型:4U工控机箱如何匹配多元化工业需求
大数据·人工智能·python