DDPG算法

DDPG算法

全称Deep Deterministic Policy Gradient,是对DPG、DQN的继承、发展和改进

  • 对DQN算法:使其能够适用于连续动作空间
  • 对DPG算法:使用神经网络来拟合函数

算法介绍

核心:确定性策略梯度理论 ,在DPG算法中被提出,原论文,推导过程相当复杂,我也不大能看懂,总之用就完事了😂

训练流程:参考了DQN,因此属于Off Policy算法,使用了经验回放缓存,引入了actor target和critic target

算法伪代码

相关推荐
饼饼学习空间智能1 小时前
家庭服务机器人训练数据怎么积累?仿真、真实采集与持续学习的技术路线分析
人工智能·算法·机器学习
蛋先生DX2 小时前
你瘦不下来但大模型可以:量化原理了解一下
深度学习·算法·llm
牛阿大3 小时前
LQR算法
算法
(╹◡╹)4 小时前
18.剪枝
算法·机器学习·剪枝
Fa_Mian_Tuan5 小时前
图论基础|邻接矩阵超详细讲解(含无向/有向/带权图+完整可运行C语言代码)
c语言·数据结构·笔记·算法·图论
hanhahai5 小时前
指针与函数(函数指针与指针函数)
算法
ValhallaCoder5 小时前
Leetcode-hot100(2026.08.17)
python·算法·leetcode
泡沫冰@6 小时前
GO 语言基础
开发语言·算法·golang
luj_17687 小时前
元设计的诱惑与现实
c语言·开发语言·c++·经验分享·算法