技术栈

蒙特卡洛树搜索

白拾
6 天前
蒙特卡洛树搜索·katago 论文分享·自对弈强化学习·围棋 ai·数据效率·arxiv 2020
【arXiv 2020】KataGo:把自对弈学习加速 50 倍|从围棋 AI 训练效率视角本文解读 arXiv 2020 论文《Accelerating Self-Play Learning in Go》。该论文提出KataGo 自对弈训练流程,通过融合playout 上限随机化、策略目标剪枝、全局池化与辅助预测目标,只用 19 天、约 1.4 GPU-年就从随机棋开始训练出超越 ELF OpenGo 最终模型的围棋 AI,其特别之处在于约 50 倍的计算量缩减大部分来自与围棋无关的通用改进。实验表明各改进组件独立消融的加速乘积约为 9.1 倍(且被低估),为自对弈强化学习的数据效率工程提供了
nju_spy
1 年前
强化学习·南京大学·alphago·蒙特卡洛树搜索·策略网络·价值网络·随机梯度算法
王树森深度强化学习DRL(三)围棋AlphaGo+蒙特卡洛深度强化学习(5_5):AlphaGo_哔哩哔哩_bilibili蒙特卡洛 Monte Carlo_哔哩哔哩_bilibili
我是有底线的