技术栈

优势演员-评论家算法

盼小辉丶
5 小时前
pytorch·深度学习·强化学习·优势演员-评论家算法
PyTorch强化学习实战(20)——优势演员-评论家(Advantage Actor-Critic, A2C)我们已经介绍了一种基于策略的方法,讨论了 REINFORCE 方法及其改进版本,后者使用折扣奖励来计算策略梯度(梯度指明了策略优化的方向),这两种方法在简单的CartPole问题中表现良好,但在更复杂的 Pong 环境中却无法收敛。 本节中,我们将讨论原始策略梯度方法的另一种变体,即演员-评论家 (actor-critic)算法,显著提升了方法的稳定性和收敛速度,现已成为深度强化学习中最强大的方法之一。
我是有底线的