强化学习笔记1--基础概念

1、智能体与环境交互的基本要素

状态 (state, s∈S)

智能体在环境中所处的情形,是对当前环境的描述。

状态空间 (state space, S)

所有可能状态的集合。

动作 (action, a)

在某状态下智能体可以执行的操作。

动作空间 (action space, A(s))

状态ss 下可采取的动作集合。注意:不同状态对应的动作空间可以不同

状态转移 (state transition)

在当前状态 s 执行动作 a 后,环境转移到下一状态 s′ 的过程。

常用转移概率描述:

禁止区域 (forbidden area)

环境中某些特殊状态,表现为:

无法进入(转移概率恒为 0);或

进入即受严惩(极大的负奖励),用来表示危险或约束。

奖励 (reward, r)

智能体执行一个动作后,环境反馈的标量评价信号。一般 正值表示鼓励,负值表示惩罚

奖励也是随机的,其概率为:

示例:p(r=1∣s1,a1)=1 表示在状态 s1 采取动作 a1​ 后,得到奖励 1 概率为100%。


2. 策略

策略 (policy, π)

决定了智能体在每个状态下如何选择动作。是状态到动作概率分布的映射。

随机策略:π(a∣s) 表示在状态 s 下选择动作 a 的概率,满足

确定性策略可视为特殊情形,某个动作为 1,其余为 0。


3. 轨迹、回报与折扣回报

轨迹 (trajectory)

智能体与环境交互产生的状态、动作、奖励序列,例如:

回报 (return, Gt​)

从时刻 t 开始,之后获得的所有奖励的总和。

对于有限步任务,简单求和即可:

折扣回报 (discounted return)

为平衡近期与远期奖励,引入折扣因子 γ∈[0,1):

γ 越接近 1,越重视长期奖励;γ 越小,越看重眼前。

注意:即时奖励 Rt+1不被折扣(即系数为 1),后续奖励才依次乘以 γ,γ²,...。

回合与持续性任务

回合(episode) :交互序列自然终止的轨迹(如游戏结束)。这类问题称为 回合式任务(episodic tasks)。

持续性任务(continuing tasks):没有终止时刻,交互无限进行(如机器人持续运行)。此时折扣回报必不可少,否则回报可能发散。


4. 马尔可夫决策过程(MDP)

马尔可夫决策过程是强化学习问题的数学框架,核心元素包括:

状态集合 S

动作集合(可依赖状态)A(s)

奖励分布 p(r∣s,a) 或奖励函数 R(s,a)

状态转移概率 p(s′∣s,a)

折扣因子 γ

策略 π(a∣s)

马尔可夫性质 (Markov property):

下一状态与奖励的概率分布只依赖于当前状态和当前动作,与更早的历史无关:

相关推荐
后季暖13 小时前
langgraph笔记(2)&& fastapi笔记
笔记
小小筱筱14 小时前
LabVIEW笔记:解决周立功CAN卡驱动缺失导致的启动报错问题
笔记·labview
Wang's Blog14 小时前
PostgreSQL笔记4: 市场地位、生态全景与行业应用实践
数据库·笔记·postgresql
RainCity14 小时前
Java Swing 自定义组件库分享(十六)
java·笔记·后端
蒸蒸yyyyzwd16 小时前
cpp选手秋招准备 学习笔记day7 webserver
笔记·学习
Chen—LSN18 小时前
C语言——数据在内存中的存储
c语言·开发语言·经验分享·笔记
bitbrowser1 天前
giffgaff突然停用?先分清闲置停用和长期境外断开
笔记
九硕智慧建筑一体化厂家1 天前
数字化管控落地,直流照明构筑安全照明体系
运维·人工智能·笔记·安全·智慧城市
AI云海1 天前
天幕红尘笔记
笔记
青山是哪个青山1 天前
LangChain 学习笔记(三):LangSmith 调试与监控
笔记·学习·langchain