Dueling Network

目录

[1. Value Functions](#1. Value Functions)

[1.1 Discounted Return(折扣回报)](#1.1 Discounted Return(折扣回报))

[1.2 Action-value function](#1.2 Action-value function)

[1.3 State-value function](#1.3 State-value function)

[2. Optimal Value Functions](#2. Optimal Value Functions)

[2.1 Optimal action-value function](#2.1 Optimal action-value function)

[2.2 Optimal state-value function](#2.2 Optimal state-value function)

[2.3 Optimal advantage function](#2.3 Optimal advantage function)

[3. Dueling Network](#3. Dueling Network)

[3.1 Training](#3.1 Training)

[3.2 Overcome Non-identifiability](#3.2 Overcome Non-identifiability)


1. Value Functions

1.1 Discounted Return(折扣回报)

t 时刻的折扣回报

:折扣率,,超参数,人工手动调

若未来的奖励和此刻的奖励同样重要,则;若未来的奖励不重要,则 可以小些。

1.2 Action-value function

是随机变量,依赖于未来的所有动作,以及未来的所有状态

1.3 State-value function

关于动作 求期望把 消掉,得到的 只与 和状态 有关。

2. Optimal Value Functions

2.1 Optimal action-value function

关于 求最大化,得到的 只与状态 和动作 有关。

2.2 Optimal state-value function

关于 求最大化,得到的 只与状态 有关。

2.3 Optimal advantage function

,对 关于 求最大化,得到的 只与状态 有关,可以得到

能推出 ,由于 ,故

可得 。由于 ,于是

3. Dueling Network

eg.

DQN使用神经网络 对最优动作价值函数 做近似。

使用神经网络 来对 做近似。

使用神经网络 来对 做近似。

Dueling Network使用 来对对最优动作价值函数 做近似。

共享卷积层,可同时训练A和V。

3.1 Training

3.2 Overcome Non-identifiability

Equation 1有Non-identifiability问题,无法通过唯一确定。在训练过程中,如果神经网络V和A上下波动,幅度相同但方向相反,那么Dueling Network输出毫无差别,两个神经网络都不稳定,都训练不好。

Equation 2没有Non-identifiability问题, 可以避免神经网络V和A的输出随意上下波动

实践中,使用平均值的效果更好。

相关推荐
回眸&啤酒鸭2 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智2 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅2 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein2 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
LaughingZhu2 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台2 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb2 天前
智能网联汽车安全能力框架
人工智能
龙亘川2 天前
明月照湾区,智启新赛道:从顶流文旅IP盛会看智慧文旅升级路径
人工智能·智慧城市·开源软件·数据可视化
飞猫的边缘AI2 天前
边缘AI应用:家用AI摄像头怎么做数据训练?
人工智能·边缘计算·ai算法·边缘ai