策略学习笔记

Vπ是Qπ关于动作a的期望。状态价值函数是动作价值函数的期望,评价当前状态和策略网络的好坏,给定状态S,策略网络越好V就越大。

用策略网络来近似策略函数。

关于状态S求期望,相当于对策略网络做评价。策略梯度就是价值数V关于 的导数

离散情况:

连续情况:

估算目标价值函数:

用Ut的观测值ut来近似Qπ,REINFORCE算法就是用观测到的ut来代替动作价值函数,需要玩完整局游戏观测到所有奖励才能更新策略网络

相关推荐
一隅论数智13 小时前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
XiHongShi201613 小时前
STM32F407 RTC定时器例程,建议保存
stm32·单片机·学习
爱吃苹果的日记本14 小时前
离散数学第六课
学习·离散数学
AI职业加油站15 小时前
AI智能体应用工程师证书:政策红利下的职业新风口
大数据·运维·人工智能·学习·职场发展
深圳老胡15 小时前
STM32F407 控制 L6470 步进电机驱动 —— 控制过程简介
笔记·stm32·单片机·嵌入式硬件·代码规范
旖旎夜光15 小时前
力控面试题 01.01: 判定字符是否唯一(位运算) —— 题解
c++·学习·算法·leetcode·力控
奇思妙想聪明勤奋的小羊15 小时前
DeepAgents第5章:子Agent 与上下文隔离—让 Agent学会委派
人工智能·python·学习·语言模型
Because_of_Her115 小时前
并查集-听课笔记
笔记·算法·并查集
霍霍的袁16 小时前
【C++】map 和 set 的使用 | 从用法到底层
开发语言·c++·学习·visual studio