策略学习笔记

Vπ是Qπ关于动作a的期望。状态价值函数是动作价值函数的期望,评价当前状态和策略网络的好坏,给定状态S,策略网络越好V就越大。

用策略网络来近似策略函数。

关于状态S求期望,相当于对策略网络做评价。策略梯度就是价值数V关于 的导数

离散情况:

连续情况:

估算目标价值函数:

用Ut的观测值ut来近似Qπ,REINFORCE算法就是用观测到的ut来代替动作价值函数,需要玩完整局游戏观测到所有奖励才能更新策略网络

相关推荐
LuminousCPP1 小时前
数据结构-双向循环链表
c语言·数据结构·笔记·链表
小弥儿1 小时前
GitHub今日热榜 | 2026-08-11:图原生基础设施首日登顶
学习·开源·github
302wanger3 小时前
【阅读笔记】当AI拿走一切之后
笔记
疯狂打码的少年4 小时前
【数据结构】串(字符串):基本概念与存储
数据结构·笔记
for_ever_love__4 小时前
python基础语法学习: 数据容器
windows·python·学习
云空5 小时前
《电子专业完整学习路线图(分两套:本科四年版 / 零基础自学速成版)》
科技·学习·学习方法·高考
min(a,b)5 小时前
学习第16天:LangGraph 与 Agent 工作流编排
学习
woshihuanglaoshi5 小时前
鸿蒙技术进阶全景高级成长体系:从初中级到架构师的技能树/学习路径/项目实战/认证体系系统性方法论
学习·华为·harmonyos
AI即插即用5 小时前
即插即用系列 | IEEE TMI PLG-HN:原型学习引导的 CNN-Transformer 混合网络,攻克乳腺肿瘤分割难题
人工智能·深度学习·神经网络·学习·目标检测·cnn·transformer
Hotchip_MEMS6 小时前
TWS耳机微米级较量:超薄LGA封装如何助力MEMS麦克风小型化?
人工智能·笔记·物联网·电脑