强化学习----->轨迹、回报、折扣因子和回合

在上篇文章中,我们介绍了状态、动作、策略和奖励这几个基本概念。

本文将继续讨论强化学习中另外四个重要概念:轨迹回报折扣因子回合


轨迹(Trajectory)

轨迹描述了智能体与环境交互过程中经历的状态、动作和奖励序列,通常表示为:

复制代码
s0​,a0​,r1​,s1​,a1​,r2​,s2​,…

这是一个按时间顺序排列的"状态-动作-奖励"链。


回报(Return)

回报是指从某一时刻开始,轨迹上未来所有奖励的累积值,也称为累计奖励

例如,某轨迹获得的奖励依次为 0, 0, 0, 1,则其回报为 0+0+0+1=1。

回报常被用来评估策略的好坏。需要注意的是,策略本身通常是一个概率分布,而非确定性的动作选择。


折扣因子(Discount Factor)

在计算回报时,如果直接对远期奖励进行简单累加,可能导致回报无限增长,不利于学习稳定。为此,我们引入折扣因子 ​ γ∈(0,1),并定义折扣回报为:

复制代码
Gt​=rt+1​+γrt+2​+γ2rt+3​+…

例如,对应某轨迹的折扣回报可写作 0+0⋅γ+0⋅γ2+1⋅γ3+...。

折扣因子 γ的作用是调节智能体对近期奖励与远期奖励的重视程度:

  • 若 γ接近 0,智能体更关注近期奖励,策略会趋于"短视";

  • 若 γ接近 1,智能体更重视远期奖励,策略会更为"远视",甚至可能为长期收益接受短期的负奖励。


回合(Episode)

当智能体根据某个策略与环境交互,并在达到某个终止状态 时结束,这个过程称为一个回合 (或一次试验)。

如果环境或策略具有随机性,即使从同一初始状态出发,也可能得到不同的回合轨迹;反之,在完全确定性的环境中,每次从同一状态出发都将得到完全相同的回合。

相关推荐
林伽一6 分钟前
从开源基础设施到垂直封装,AI 产业的技术主轴正在位移
人工智能·科技·ai·语言模型
专业程序开发源6 分钟前
springboot篮球联赛管理系统13635-计算机课程设计、毕业设计
vue.js·spring boot·后端·python·django·php·课程设计
lie..9 分钟前
30天从零开始学AI应用开发(Day 3):30 分钟搭好开发环境,Python + VSCode 一次配齐
人工智能·python·大模型
β添砖java9 分钟前
机器学习2 KNN算法、距离度量、特征预处理、超参数选择、手写数字、鸢尾花
人工智能·算法·机器学习
cc_瀚海知行10 分钟前
模型调用 3|怎样让程序可靠地接收模型输出?
人工智能·ai
科创致远11 分钟前
科创致远 ESOP 系统深度评测:从参数解析到 ROI 实战验证
大数据·人工智能·制造·精益工程
CAIE研习社14 分钟前
从“会聊天”到能落地:光伏、风电运维里的AI怎么用?
大数据·人工智能
TAN-90°-16 分钟前
Deep Learning for Computer Vision——Generative Models 2
人工智能·深度学习·神经网络·算法·目标检测·机器学习·计算机视觉
洞见新研社20 分钟前
豆包手机发售,AI代理进入“终端”竞赛
人工智能·ai
benchmark_cc26 分钟前
策略临时需要一批股票的最新价格,先查行情还是先建股票池?——从量化策略执行逻辑看数据获取顺序
python·数据分析·pandas·量化交易·股票数据·quantdash