强化学习笔记1--基础概念

1、智能体与环境交互的基本要素

状态 (state, s∈S)

智能体在环境中所处的情形,是对当前环境的描述。

状态空间 (state space, S)

所有可能状态的集合。

动作 (action, a)

在某状态下智能体可以执行的操作。

动作空间 (action space, A(s))

状态ss 下可采取的动作集合。注意:不同状态对应的动作空间可以不同

状态转移 (state transition)

在当前状态 s 执行动作 a 后,环境转移到下一状态 s′ 的过程。

常用转移概率描述:

禁止区域 (forbidden area)

环境中某些特殊状态,表现为:

无法进入(转移概率恒为 0);或

进入即受严惩(极大的负奖励),用来表示危险或约束。

奖励 (reward, r)

智能体执行一个动作后,环境反馈的标量评价信号。一般 正值表示鼓励,负值表示惩罚

奖励也是随机的,其概率为:

示例:p(r=1∣s1,a1)=1 表示在状态 s1 采取动作 a1​ 后,得到奖励 1 概率为100%。


2. 策略

策略 (policy, π)

决定了智能体在每个状态下如何选择动作。是状态到动作概率分布的映射。

随机策略:π(a∣s) 表示在状态 s 下选择动作 a 的概率,满足

确定性策略可视为特殊情形,某个动作为 1,其余为 0。


3. 轨迹、回报与折扣回报

轨迹 (trajectory)

智能体与环境交互产生的状态、动作、奖励序列,例如:

回报 (return, Gt​)

从时刻 t 开始,之后获得的所有奖励的总和。

对于有限步任务,简单求和即可:

折扣回报 (discounted return)

为平衡近期与远期奖励,引入折扣因子 γ∈[0,1):

γ 越接近 1,越重视长期奖励;γ 越小,越看重眼前。

注意:即时奖励 Rt+1不被折扣(即系数为 1),后续奖励才依次乘以 γ,γ²,...。

回合与持续性任务

回合(episode) :交互序列自然终止的轨迹(如游戏结束)。这类问题称为 回合式任务(episodic tasks)。

持续性任务(continuing tasks):没有终止时刻,交互无限进行(如机器人持续运行)。此时折扣回报必不可少,否则回报可能发散。


4. 马尔可夫决策过程(MDP)

马尔可夫决策过程是强化学习问题的数学框架,核心元素包括:

状态集合 S

动作集合(可依赖状态)A(s)

奖励分布 p(r∣s,a) 或奖励函数 R(s,a)

状态转移概率 p(s′∣s,a)

折扣因子 γ

策略 π(a∣s)

马尔可夫性质 (Markov property):

下一状态与奖励的概率分布只依赖于当前状态和当前动作,与更早的历史无关:

相关推荐
晓梦林3 小时前
[ACTF2020 新生赛]BackupFile学习笔记
android·笔记·学习
xian_wwq4 小时前
【学习笔记】解剖 Claude Code —— Anthropic 的 Harness 参考实现-09/15
人工智能·笔记·学习
晓梦林4 小时前
Tools靶场学习笔记
笔记·学习
xian_wwq5 小时前
【学习笔记】什么是Harness Engineering- 01/15
人工智能·笔记·学习
笨笨饿5 小时前
#102_Codex无在VSCold无法打开
java·c语言·数据库·笔记
xian_wwq5 小时前
【学习笔记】Agent 安全护栏 —— 当 Agent DROP TABLE 了你的生产数据库-07/15
笔记·学习·安全
AOwhisky6 小时前
Linux(CentOS)系统管理入门笔记(第十四期)——计划任务与进程调度管理:atcron 与 nicechrt
linux·运维·笔记·centos·云计算·进程调度·计划任务
玖玥拾7 小时前
LeetCode 13 罗马数字转整数
笔记·算法·leetcode
kdxiaojie7 小时前
Linux 驱动研究 —— V4L2 内核层总结(上)
linux·服务器·笔记·学习