DISTRIBUTED PRIORITIZED EXPERIENCE REPLAY(分布式优先级体验回放)论文阅读

标题:DISTRIBUTED PRIORITIZED EXPERIENCE REPLAY(分布式优先级体验回放)

作者:John Quan, Dan Horgan,David Budden,Gabriel Barth-Maron

单位: DeepMind

发表期刊:Machine Learning

发表时间:2018年

论文研究主题归类:深度强化学习

1.论文解决什么问题

提出了一种大规模深度强化学习的分布式架构,它使代理能够从比以前可能的数量级更多的数据中有效地学习。该算法将行动与学习脱钩:参与者通过根据共享的神经网络选择行动来与自己的环境实例交互,并在共享的经验回放记忆中积累由此产生的经验;学习者回放经验样本并更新神经网络。该体系结构依赖于优先级经验回放,只关注参与者生成的最重要的数据。该体系结构大大提高了机器学习环境的水平,在时间上获得了更好的表现。

2.是否有公开的数据集及源代码

数据集:https://github.com/blue-blue272/VideoReID-TCLNet

源代码:https://github.com/blue-blue272/VideoReID-TCLNet

3.论文的主要观点

作者认为分布式随机梯度下降被广泛用于监督学习,通过并行化更新参数的梯度来加速神经网络的训练,由此产生的参数更新可以同步、可以异步。受此启发,分布式异步参数更新和分布式数据生成应用于深度强化学习中。从数据集中非均匀采样并根据采样概率对更新进行加权以抵消由此引入的偏差,可以减少梯度的方差来提高收敛速度。experience replay在Q network上被证实非常有用。(有效解决了数据时序相关性和数据非静态分布的问题)还通过学习先前策略下的数据起到了过拟合的作用。

相关推荐
程序员buddha3 小时前
SpringBoot+Dubbo+Zookeeper实现分布式系统步骤
分布式·zookeeper·dubbo·springboot
啾啾Fun3 小时前
【表设计】外键的取舍-分布式中逐渐消失的外键
分布式·关系型数据库·外键
玄武后端技术栈3 小时前
什么是延迟队列?RabbitMQ 如何实现延迟队列?
分布式·后端·rabbitmq
liyongjun63163 小时前
Redis实现分布式获取全局唯一自增ID的案例。
redis·分布式·全局唯一id
开心星人3 小时前
【论文阅读】Towards Stable Backdoor Purification through Feature Shift Tuning
论文阅读
上海云盾-高防顾问4 小时前
如何用分布式防御抵扣大规模DDoS攻击?
分布式·ddos
不是吧这都有重名5 小时前
[论文阅读]Deep & Cross Network for Ad Click Predictions
论文阅读
hongjianMa6 小时前
【论文阅读】Attentive Collaborative Filtering:
论文阅读·深度学习·推荐系统·推荐算法·多模态·自注意力机制
hongjianMa6 小时前
【论文阅读】Adversarial Training Towards Robust Multimedia Recommender System
论文阅读·深度学习·推荐系统·多模态·对抗·vbpr