目录
[1. Bootstrapping](#1. Bootstrapping)
[2. Problem of Overestimation](#2. Problem of Overestimation)
[2.1 Reason 1:Maximization](#2.1 Reason 1:Maximization)
[2.2 Reason 2:Bootstrapping](#2.2 Reason 2:Bootstrapping)
[3. Solutions](#3. Solutions)
[3.1 Target Network](#3.1 Target Network)
[3.2 Double DQN](#3.2 Double DQN)
1. Bootstrapping
在强化学习中,bootstraping的含义是用一估计值去更新同类的另一估计值。

TD target 在某种程度上来说是由DQN Q做出的估计,我们使用
来更新DQN Q。
2. Problem of Overestimation

2.1 Reason 1:Maximization



2.2 Reason 2:Bootstrapping


均匀高估问题不大,非均匀高估问题很大。DQN对最优动作价值的高估是非均匀的,就会导致Agent选择被高估的动作 (实际上它的价值不够大),就会导致网络训练的效果不好。

3. Solutions

1.解决Boostrapping问题,不用DQN自己算出来的TD target来更新DQN,而是用另一个神经网络(target network)来计算TD target。
2.缓解maximization造成的高估问题,用double DQN,也可用target network 。
3.1 Target Network

Target Network与DQN网络结构一样,但参数设置不一样。


更新target network的参数 需要用到DQN的参数
,无法独立于DQN,所以无法完全避免Bootstrapping.
3.2 Double DQN

原始方法会带来严重的高估问题。

使用Target Network可以改善高估问题。

使用Double DQN是三种方法里最好的,但是高估问题还是存在。

使用Double DQN必然可以缓解高估问题,因为Double DQN做出的估计值明显小于最大估计值。