Double DQN(DDQN)详解与实现

Double DQN(DDQN)详解与实现

    • [0. 前言](#0. 前言)
    • [1. DDQN 原理](#1. DDQN 原理)
    • [2. 使用 Keras 实现 DDQN](#2. 使用 Keras 实现 DDQN)
    • [3. 结果分析](#3. 结果分析)

0. 前言

深度 Q 网络 (Deep Q-Network, DQN)中,目标 Q 网络负责选择并评估每个动作,这会导致 Q 值被高估。为解决此问题,Double DQN (DDQN) 提出使用 Q 网络选择动作,而用目标 Q 网络评估动作。在本节中,我们将介绍 DDQN 的基本原理,并使用 Keras 实现 DDQN

1. DDQN 原理

DQN 中,智能体使用相同的Q值来选择和评估一个动作。这可能会导致学习中的最大化偏差。例如,假设对于某个状态S,所有可能的动作的真实Q值都为零。此时,DQN 估计值将会有一些高于零的值和一些低于零的值,由于选择具有最大Q值的动作,并且后续使用相同(最大化的)估计值函数评估每个动作的Q值,智能体就会高估Q值,换句话说,智能体过于乐观,这可能导致训练不稳定和低质量的策略。为了解决这个问题,DeepMind 提出了 Double DQN 算法。在 Double DQN 中,有两个具有相同结构但权重不同的Q网络。其中一个Q网络使用ε-贪婪策略确定动作,另一个Q网络确定其值 ( Q t a r g e t Q_{target} Qtarget)。

DQN 中, Q t a r g e t Q_{target} Qtarget 目标计算方式如下:
Q t a r g e t = R t + 1 + γ max ⁡ A Q ( S t + 1 , A t ) Q_{target}=R_{t+1} + \gamma \max_A Q(S_{t+1}, A_t) Qtarget=Rt+1+γAmaxQ(St+1,At)

其中,动作 A A A 是使用相同的 DQN Q ( S , A ; W ) Q(S,A; W) Q(S,A;W) 选择的,其中 W W W 是网络的训练参数:
Q t a r g e t = R t + 1 + γ max ⁡ A Q ( S t + 1 , a r g m a x t Q ( S , A ; W ) ; W ) Q_{target}=R_{t+1} + \gamma \max_A Q(S_{t+1},argmax_tQ(S,A;W); W) Qtarget=Rt+1+γAmaxQ(St+1,argmaxtQ(S,A;W);W)

Double DQN 中,目标方程有所不同,DQN Q ( S , A ; W ) Q(S,A;W) Q(S,A;W) 用于确定动作,而 DQN Q ( S , A ; W ′ ) Q(S,A;W') Q(S,A;W′) 用于计算目标。因此,方程将改写为:
Q t a r g e t = R t + 1 + γ max ⁡ A Q ( S t + 1 , a r g m a x t Q ( S , A ; W ) ; W ′ ) Q_{target}=R_{t+1} + \gamma \max_A Q(S_{t+1},argmax_tQ(S,A;W); W') Qtarget=Rt+1+γAmaxQ(St+1,argmaxtQ(S,A;W);W′)

这一简单的更改减少高估Q值的可能性,并且能够更快、更可靠地训练智能体。

2. 使用 Keras 实现 DDQN

定义 DDQNAgent 类,该类继承自DQNAgent 类。我们仅需重写 get_target_q_value() 方法,即可实现对最大Q值计算方式的修改。

python 复制代码
class DDQNAgent(DQNAgent):
    def __init__(self,
                 state_space, 
                 action_space, 
                 episodes=500):
        super().__init__(state_space, 
                         action_space, 
                         episodes)
        # Q Network weights filename
        self.weights_file = 'ddqn_cartpole.h5'
        print("-------------DDQN------------")

    def get_target_q_value(self, next_state, reward):
        # max Q value among next state's actions
        # DDQN
        # current Q Network selects the action
        # a'_max = argmax_a' Q(s', a')
        action = np.argmax(self.q_model.predict(next_state)[0])
        # target Q Network evaluates the action
        # Q_max = Q_target(s', a'_max)
        q_value = self.target_q_model.predict(\
                                      next_state)[0][action]

        # Q_max = reward + gamma * Q_max
        q_value *= self.gamma
        q_value += reward
        return q_value

3. 结果分析

10 次运行的平均结果中,DDQN 算法在 971 个训练回合内解决 CartPole-v0 问题。DQNDDQN 都证明了深度学习能够增强Q学习的扩展能力,使其可以解决具有连续状态空间和离散动作空间的问题。

相关推荐
AI人工智能+11 小时前
一种基于深度学习技术的高精度医疗机构执业许可证识别系统,构建了一套基于深度神经网络的端到端智能识别系统,为医疗行业提
深度学习·ocr·医疗机构执业许可证识别
硅谷秋水11 小时前
EgoSteer:一种基于第一人称视角视频、实现可控灵巧操作的全栈系统
深度学习·机器学习·语言模型·机器人·音视频
AI街潜水的八角12 小时前
基于YOLO26交通标志检测系统1:交通标志检测数据集说明(含下载链接)
深度学习·神经网络
aiblog13 小时前
深度学习中“Transformer”怎么翻译为中文?
人工智能·深度学习·transformer
AndrewHZ14 小时前
【LLM技术全景】阶段总结:技术原理篇核心知识回顾
人工智能·深度学习·算法·语言模型·大模型·llm·芯片开发
leoZ23117 小时前
实战复盘:用 Claude Code 从零搭一个 GitHub PR 统计工具
java·人工智能·python·深度学习·自然语言处理·github·llama
编码雪人17 小时前
非等间隔采样时间序列预测的图模型
深度学习·神经网络
LaughingZhu19 小时前
Product Hunt 每日热榜 | 2026-08-04
人工智能·经验分享·深度学习·神经网络·产品运营
科研小刘带你玩学术19 小时前
【学术干货】CVPR论文解析:扩散模型如何推动生成式人工智能进入新时代?
人工智能·深度学习·计算机视觉·生成式ai·扩散模型
又折桃枝换酒钱20 小时前
CrossLMM:通过双交叉注意力机制从大型多模态模型中解耦长视频序列
人工智能·深度学习·机器学习