目录
[1. Value Functions](#1. Value Functions)
[1.1 Discounted Return(折扣回报)](#1.1 Discounted Return(折扣回报))
[1.2 Action-value function](#1.2 Action-value function)
[1.3 State-value function](#1.3 State-value function)
[2. Optimal Value Functions](#2. Optimal Value Functions)
[2.1 Optimal action-value function](#2.1 Optimal action-value function)
[2.2 Optimal state-value function](#2.2 Optimal state-value function)
[2.3 Optimal advantage function](#2.3 Optimal advantage function)
[3. Dueling Network](#3. Dueling Network)
[3.1 Training](#3.1 Training)
[3.2 Overcome Non-identifiability](#3.2 Overcome Non-identifiability)
1. Value Functions
1.1 Discounted Return(折扣回报)
t 时刻的折扣回报
:折扣率,
,超参数,人工手动调
若未来的奖励和此刻的奖励同样重要,则;若未来的奖励不重要,则
可以小些。
1.2 Action-value function
是随机变量,依赖于未来的所有动作
,以及未来的所有状态
1.3 State-value function
对 关于动作
求期望把
消掉,得到的
只与
和状态
有关。
2. Optimal Value Functions
2.1 Optimal action-value function
对 关于
求最大化,得到的
只与状态
和动作
有关。
2.2 Optimal state-value function
对 关于
求最大化,得到的
只与状态
有关。
2.3 Optimal advantage function
由,对
关于
求最大化,得到的
只与状态
有关,可以得到
。
能推出
,由于
,故
。
由 可得
。由于
,于是
3. Dueling Network
eg.

DQN使用神经网络 对最优动作价值函数
做近似。

使用神经网络 来对
做近似。

使用神经网络 来对
做近似。

Dueling Network使用 来对对最优动作价值函数
做近似。


和
共享卷积层,可同时训练A和V。
3.1 Training

3.2 Overcome Non-identifiability

Equation 1有Non-identifiability问题,无法通过唯一确定
和
。在训练过程中,如果神经网络V和A上下波动,幅度相同但方向相反,那么Dueling Network输出毫无差别,两个神经网络都不稳定,都训练不好。
Equation 2没有Non-identifiability问题, 可以避免神经网络V和A的输出随意上下波动

实践中,使用平均值的效果更好。