Dueling Network

目录

[1. Value Functions](#1. Value Functions)

[1.1 Discounted Return(折扣回报)](#1.1 Discounted Return(折扣回报))

[1.2 Action-value function](#1.2 Action-value function)

[1.3 State-value function](#1.3 State-value function)

[2. Optimal Value Functions](#2. Optimal Value Functions)

[2.1 Optimal action-value function](#2.1 Optimal action-value function)

[2.2 Optimal state-value function](#2.2 Optimal state-value function)

[2.3 Optimal advantage function](#2.3 Optimal advantage function)

[3. Dueling Network](#3. Dueling Network)

[3.1 Training](#3.1 Training)

[3.2 Overcome Non-identifiability](#3.2 Overcome Non-identifiability)


1. Value Functions

1.1 Discounted Return(折扣回报)

t 时刻的折扣回报

:折扣率,,超参数,人工手动调

若未来的奖励和此刻的奖励同样重要,则;若未来的奖励不重要,则 可以小些。

1.2 Action-value function

是随机变量,依赖于未来的所有动作,以及未来的所有状态

1.3 State-value function

关于动作 求期望把 消掉,得到的 只与 和状态 有关。

2. Optimal Value Functions

2.1 Optimal action-value function

关于 求最大化,得到的 只与状态 和动作 有关。

2.2 Optimal state-value function

关于 求最大化,得到的 只与状态 有关。

2.3 Optimal advantage function

,对 关于 求最大化,得到的 只与状态 有关,可以得到

能推出 ,由于 ,故

可得 。由于 ,于是

3. Dueling Network

eg.

DQN使用神经网络 对最优动作价值函数 做近似。

使用神经网络 来对 做近似。

使用神经网络 来对 做近似。

Dueling Network使用 来对对最优动作价值函数 做近似。

共享卷积层,可同时训练A和V。

3.1 Training

3.2 Overcome Non-identifiability

Equation 1有Non-identifiability问题,无法通过唯一确定。在训练过程中,如果神经网络V和A上下波动,幅度相同但方向相反,那么Dueling Network输出毫无差别,两个神经网络都不稳定,都训练不好。

Equation 2没有Non-identifiability问题, 可以避免神经网络V和A的输出随意上下波动

实践中,使用平均值的效果更好。

相关推荐
大唐荣华1 小时前
模型训练显卡选型深度指南:价格、数量、性能与自建租赁抉择
人工智能·机器人·模型训练·具身智能·avida·navida
万岳科技系统开发1 小时前
私域直播AI数字人系统:AI技术如何重构企业直播运营模式
大数据·人工智能·重构
AI_Cloud_推荐1 小时前
SpringBoot集成百度人脸识别SDK实战:人脸检测、比对与注册
大数据·人工智能·spring boot·安全·百度·视觉检测
u1301301 小时前
AI 日报(2026年9月3日)
人工智能
AI 思录1 小时前
“人眼看着正常,AI执行却出事“:Prompt事故档案(一)
人工智能·安全·prompt·用户体验·ai伦理
Rauser Mack1 小时前
从交互困境到语音闭环:桌面AI全语音数字秘书架构解析
人工智能·架构·交互
智购科技无人售货机工厂1 小时前
2026自动售货机云端API设计规范:从RESTful到GraphQL的接口演进~YH
android·人工智能·驱动开发·单片机·云原生·pandas·设计规范
安托智造1 小时前
2026高端装备行业数智化交流会回顾:工业AI、虚拟孪生与3DE正向研发闭环如何落地
人工智能·plm·工业ai·3dexperience平台