【机器学习】机器学习的基本分类-强化学习-策略梯度(Policy Gradient,PG)

Policy Gradient(策略梯度)是强化学习中基于策略的优化方法,通过直接优化策略函数来最大化累积回报。与基于值的强化学习方法(如 Q-Learning 或 DQN)不同,Policy Gradient 不显式地学习状态值函数 V(s) 或动作值函数 Q(s, a),而是直接优化策略 的参数 θ。


核心思想

直接建模策略
  • 策略 是一个概率分布函数,描述了在状态 s 下采取动作 a 的概率。
  • 策略函数可以是任何可微的函数(如神经网络)。
目标函数
  • 目标是最大化累积期望回报 J(θ):

  • 通过梯度上升更新策略参数 θ。

策略梯度定理
  • 策略梯度的形式:

  • 其中 是从时间步 t 开始的累积回报,用于指导更新方向。


策略梯度算法

基本步骤
采样轨迹
  • 通过当前策略 与环境交互,生成一批轨迹(状态、动作、奖励序列)。
计算回报
  • 对每条轨迹计算累积回报 ,例如:

计算梯度
  • 对于每个状态-动作对,计算策略梯度:

更新策略参数
  • 使用梯度上升(或梯度下降的负值)更新策略参数 θ:


伪代码

python 复制代码
Initialize policy network with random weights θ

for episode in range(max_episodes):
    Generate trajectories by interacting with the environment using policy πθ
    Compute returns G_t for each step in the trajectories
    Compute policy gradient:
        ∇θ J(θ) = (1/N) * Σ [∇θ log πθ(a_t | s_t) * G_t]
    Update policy network:
        θ ← θ + α * ∇θ J(θ)

优势与不足

优势
连续动作空间适用性
  • 可直接处理连续动作空间,而基于值的方法需要离散化动作空间。
策略随机性
  • 随机策略可以自然地处理探索与利用的权衡问题。
易于扩展
  • 可以扩展到 Actor-Critic 方法(结合值函数的策略梯度)。
不足
高方差
  • 策略梯度估计的方差较高,需要大量采样来稳定更新。
收敛性较慢
  • 对于复杂环境,单纯的策略梯度方法收敛较慢。
数据利用效率低
  • 每次更新策略仅利用采样到的轨迹,未充分使用历史数据。

改进方法

REINFORCE
  • 使用完整的累积回报 代替真实环境奖励。
基线(Baseline)
  • 减少梯度方差的一种方法是引入基线函数 b(s),更新规则变为:

Actor-Critic
  • 结合值函数,使用 Q(s,a) 或 V(s) 来引导策略梯度更新。
Trust Region Policy Optimization (TRPO)
  • 限制策略更新的幅度,防止策略更新过大导致性能退化。
Proximal Policy Optimization (PPO)
  • 提高更新效率的同时,确保策略更新的稳定性。

应用场景

机器人控制
  • 连续动作控制问题,如机械臂操作和移动机器人导航。
游戏 AI
  • 策略梯度适用于具有复杂动作的游戏场景。
推荐系统
  • 动态地为用户提供推荐,优化长期回报。
金融交易
  • 策略优化股票交易中的买卖时机。
相关推荐
小鸡吃米…5 小时前
机器学习 - K - 中心聚类
人工智能·机器学习·聚类
好奇龙猫6 小时前
【AI学习-comfyUI学习-第三十节-第三十一节-FLUX-SD放大工作流+FLUX图生图工作流-各个部分学习】
人工智能·学习
沈浩(种子思维作者)6 小时前
真的能精准医疗吗?癌症能提前发现吗?
人工智能·python·网络安全·健康医疗·量子计算
minhuan6 小时前
大模型应用:大模型越大越好?模型参数量与效果的边际效益分析.51
人工智能·大模型参数评估·边际效益分析·大模型参数选择
Cherry的跨界思维6 小时前
28、AI测试环境搭建与全栈工具实战:从本地到云平台的完整指南
java·人工智能·vue3·ai测试·ai全栈·测试全栈·ai测试全栈
MM_MS6 小时前
Halcon变量控制类型、数据类型转换、字符串格式化、元组操作
开发语言·人工智能·深度学习·算法·目标检测·计算机视觉·视觉检测
ASF1231415sd6 小时前
【基于YOLOv10n-CSP-PTB的大豆花朵检测与识别系统详解】
人工智能·yolo·目标跟踪
水如烟7 小时前
孤能子视角:“意识“的阶段性回顾,“感质“假说
人工智能
Carl_奕然7 小时前
【数据挖掘】数据挖掘必会技能之:A/B测试
人工智能·python·数据挖掘·数据分析
旅途中的宽~7 小时前
《European Radiology》:2024血管瘤分割—基于MRI T1序列的分割算法
人工智能·计算机视觉·mri·sci一区top·血管瘤·t1