技术栈

自对弈强化学习

白拾
2 小时前
蒙特卡洛树搜索·katago 论文分享·自对弈强化学习·围棋 ai·数据效率·arxiv 2020
【arXiv 2020】KataGo:把自对弈学习加速 50 倍|从围棋 AI 训练效率视角本文解读 arXiv 2020 论文《Accelerating Self-Play Learning in Go》。该论文提出KataGo 自对弈训练流程,通过融合playout 上限随机化、策略目标剪枝、全局池化与辅助预测目标,只用 19 天、约 1.4 GPU-年就从随机棋开始训练出超越 ELF OpenGo 最终模型的围棋 AI,其特别之处在于约 50 倍的计算量缩减大部分来自与围棋无关的通用改进。实验表明各改进组件独立消融的加速乘积约为 9.1 倍(且被低估),为自对弈强化学习的数据效率工程提供了
我是有底线的