1、强化学习中的回报与策略

一、强化学习中的回报

状态:

回报:

(更快的获得奖励可能比需要很长时间才能得到的奖励更具有吸引力)





折扣因子一般是比1少一点的数,如0.9,0.99,0.999等,下面为了说明目的,暂且使用0.5的折扣因子,这将极大的降低未来奖励的权重,或者说极大的折扣了未来的奖励,因为每经过一个时间戳,你只能获得比前一步少一半的奖励信用。

例子:

(你得到的奖励取决于奖励,而奖励又取决于你采取的行动,因此回报取决于你采取的行动)

例1:基于上述例子,若一直只往左走,折扣因子=0.5,则分别从不同状态起步获得的奖励计算如下:

例2:如果总往右走,那么如果从状态4开始,(下图中第一个0右上角的4表示状态4)

分别从不同状态起步获得的奖励计算如下:

二、强化学习中的策略

在强化学习中,我们的目标是提出一个称为策略Pi的函数,其任务是接收任何状态s作为输入,并将其映射到它希望我们采取的某个动作a。

强化学习的目标是找到一个策略Pi或S的Pi,它告诉你在每个状态下应采取什么行动,以最大化回报。

相关推荐
CV山月3 小时前
大模型强化学习对齐:从 RLHF 框架到 PPO 算法原理
人工智能·python·大模型·强化学习·多模态·研究生
机器学习之心2 天前
基于强化学习的股票价格预测与智能交易实战
强化学习·股票价格预测
XLYcmy2 天前
Self-Adapting Language Models论文分享
自然语言处理·llm·微调·sft·论文笔记·强化学习·自进化
指掀涛澜天下惊3 天前
强化学习进阶篇八 策略梯度算法
深度学习·学习·算法·强化学习
盼小辉丶3 天前
PyTorch强化学习实战——融合人类示范数据的高效强化学习
人工智能·pytorch·python·深度学习·强化学习
爱听歌的周童鞋3 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 2 | 蒙特卡洛方法(MC Basic 算法介绍)
强化学习·monte carlo·estimation·model-free·mc basic
爱听歌的周童鞋3 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 3 | 蒙特卡洛方法(MC Basic 算法例子)
强化学习·example·monte carlo·mc basic·episode length
盼小辉丶4 天前
PyTorch强化学习实战——基于图像-文本融合的自动化网页导航
人工智能·pytorch·深度学习·自动化·强化学习
Mid_search4 天前
Dueling Network
人工智能·深度学习·强化学习·dueling network
爱听歌的周童鞋5 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 1 | 蒙特卡洛方法(通过例子介绍蒙特卡洛)
强化学习·大数定律·monte carlo·estimation·model-free·expectation