强化学习笔记6——异同策略、AC、等其他模型总结

异步两种方法:1:经验回放 2:数据动作非同时产生

举例QLearning为什么是异策略?

生成动作时e的概率从Q表选,1-e概况随机。 更新策略时,贪心策略选择Q_max作为动作。

策略优化两种主要方法:基于梯度下降和基于值函数

Policy Gradient主要缺点:不稳定 (坏策略迭代导致越来越坏),都是on-policy的 始终都是一种策略采样和更新效率低。
###########################################################################

Policy Gradient主要优化目标:(笔记5里有讲)

这里对比A3C 改进版的优化目标

############################################################################

AC,A2C,A3C 参考



这里注意Critic网络和Actor网络的更新:

对于Actor网络的策略梯度更新,使用Glearning策略梯度定理根据当前的策略 计算更新梯度

对于Critic网络的值函数更新,我们可以使用TD误差来计算当前状态值和下一时刻状态值之间的误差

A2C使用优势函数代替Critic网络中的原始回报Gt,可以作为衡量选取动作值和所有动作平均值好坏的指标。

A3C中,有一个全局网络(global network)和多个工作智能体(worker)

global network和worker里面都是A2C

worker和环境交互计算梯度不更新,传给globalNet。

globalNet不和环境交互,收集所有worker传来的梯度一起更新,然后将参数copy给worker。

==

总结:AC更新 actor使用策略梯度下降更新

Critic使用一下6选1都可以更新

相关推荐
皮卡丘不断更10 小时前
从一段 RGB 视频到机器人开门:读懂 Video2DoorTraversal 的仿真闭环
机器人·强化学习·数字孪生·具身智能·机器人仿真
山顶夕景13 小时前
【MLLM Agent】多模态理解Agent研究进展
agent·强化学习·多模态·rl·agentic
闲研随记1 天前
【文献阅读 ICLR 2026】RL算法:DECS
算法·llm·强化学习·iclr·rl
盼小辉丶4 天前
PyTorch强化学习实战——用预训练语言模型和ChatGPT玩转文本游戏
pytorch·深度学习·语言模型·chatgpt·强化学习
林间码客5 天前
Agentic-RL:从SFT到GRPO,让智能体学会“自主进化”
sft·强化学习·grpo·agentic-rl
XLYcmy6 天前
小红书 算法一面 四
深度学习·llm·sft·强化学习·多模态·grpo·奖励函数
TechEdu2026067 天前
[人工智能]Tianshou强化学习框架:概念、架构与工程实践
人工智能·ai·rl
盼小辉丶7 天前
PyTorch强化学习实战(22)——将强化学习应用于TextWorld互动小说游戏
pytorch·深度学习·强化学习
XLYcmy8 天前
小红书 算法一面 三
llm·sft·强化学习·多模态·损失函数·visual r1·奖励机制
chen_zn958 天前
《VLA 系列》RLT | RL Token | 轻量 Actor-Critic | 在线强化学习与源码解析
人工智能·强化学习·具身智能·vla