强化学习与最优控制前言2
- [未来最优价值函数 J ~ \tilde{J} J~的四种求法](#未来最优价值函数 J ~ \tilde{J} J~的四种求法)
未来最优价值函数 J ~ \tilde{J} J~的四种求法
(1)问题近似法。取价值函数 J ~ \tilde{J} J~为一个与所求问题相关的更简单问题的未来最优价值函数,这个更简单的相关的问题可以用动态规划算法求出精确解。这种方法详细讨论确定性等价控制 与强制分解方案 。
(2)滚动优化与模型预测控制。此种方法中价值函数 J ~ \tilde{J} J~为某一已知启发式策略的代价函数。
其中使用滚动优化方法所得的启发式策略代价函数值通常通过仿真计算。尽管该方法适用于随机问题,但由于依赖仿真,它更适用于确定性问题,也适用于那些易于实现启发式算法的复杂组合优化问题。
滚动策略还可与自适应仿真和蒙特卡洛树搜索相结合,这类组合方法在西洋双陆棋、国际象棋、围棋等博弈场景中已被证明十分有效。
模型预测控制最初是为解决连续空间最优控制问题提出的,这类问题通常包含一个目标状态,例如经典控制中的原点状态。
模型预测控制可以被看作一种特定的滚动优化方法,其核心是通过次优优化来逼近目标状态。
(3)带参数的函数形式近似代价函数 / 价值函数 该方法中价值函数 J ~ \tilde{J} J~ 选自一类参数化函数族(包括神经网络),其参数通过状态 - 代价样本对以及某种增量最小二乘 / 回归算法进行 "优化" 或 "训练" 所得。
该种方法还涉及近似策略迭代及其各类变体,包括多种行动者 - 评论家(Actor-Critic) 架构。这些方法包含:
(i)基于仿真训练方式的策略评估
(ii)可能依赖策略空间近似的策略改进
(4)聚合:将多个状态、变量或子问题合并处理,以降低复杂度 该方法中价值函数 J ~ \tilde{J} J~ 是原问题经近似后得到的最优代价函数,该近似问题被称为集结问题(aggregate problem),其状态数量更少。
该集结问题可以通过多种方式构建,并可采用精确动态规划(DP)方法求解。求解所得的最优代价函数随后会被用作有限时域优化方案中的 J ~ \tilde{J} J~ 。
集结法也可用于对包含神经网络或基于线性特征的结构的参数化近似方案提供局部改进。