贝尔曼最优公式(BOE)

回顾上一节,我们给出了贝尔曼方程的状态价值函数:

和动作价值函数:

这两个函数都是对于给定策略π来说的,强化学习的目的是寻找最佳策略,所以下一个问题自然而然的是:

本篇就研究这个问题,进一步要回答四个问题:

  • 最优策略是否存在
  • 如果存在,最优策略是唯一的吗
  • 最优策略是固定的还是随机的
  • 怎么样获取最优策略

1

贝尔曼最优方程

首先,我们给出贝尔曼最优方程(Bellman optimality equation)的定义:

也可以写成矩阵形式:

这东西怎么求?还是得回到最简单的数学分析。先看两个例子。

  • 例1
  • 例2

我们再调整一下BOE公式,就很容易得到:

2

求解BOE

BOE的矩阵形式是关于状态价值函数的向量形式,我们可以定义函数:

为求解这个函数,我们要引入压缩映射定理,又称Banach不动点定理(Contraction Mapping Theorem):

什么是压缩映射,标准定义:

我们证明BOE函数矩阵形式满足压缩映射定理,其实也很简单:

3

BOE迭代算法

综上,我们可以给出贝尔曼最优方程的迭代步骤了:

这个也成为BOE的数值迭代算法(value iteration)!

相关推荐
FPGA信号处理2 小时前
【模式识别】第三节课:分类误差的来源与线性分类器
人工智能·分类·数据挖掘
hrrrrxeeeee2 小时前
电商从业者AI技能提升:证书选择与商品、客服、运营场景落地
人工智能
小和尚同志7 小时前
1.8k star 的开源 token 使用量监控神器— TokenTracker
人工智能·ai编程
极客 - L U8 小时前
神经网络 - 激活函数、损失函数、优化器
人工智能·深度学习·神经网络
数字融合8 小时前
透明化视频三维矿山井下照明重建技术
人工智能·python·数码相机
yi0118 小时前
LeetCode 219:存在重复元素 II——哈希表记录“最近一次出现的位置”
数据结构·人工智能·笔记·python·算法·leetcode·哈希表
xiangzhihong88 小时前
创之星花店多端业务闭环拆解
人工智能
奈落249 小时前
AI 编程从助手到 Agent:基于两份资料看哪些环节可以交出去,哪些必须自己攥住
大数据·人工智能
Joker可视化开发平台9 小时前
AI短剧接棒真人剧:开机量跌七成,普通人进场窗口在收窄
大数据·人工智能
澳鹏Appen9 小时前
澳鹏电子书 | 强化学习环境:为AI智能体打造高保真训练场
人工智能