技术栈
alpha zero
幻影123!
2 小时前
人工智能
·
机器学习
·
强化学习
·
alpha zero
AlphaZero 五子棋实战(五):评估工具 —— 学会在错误的地方掉头
这个系列的前四篇讲了配置、参数、机制、踩坑。最后这篇讲一件最容易被忽略、但决定了前面所有努力是否有效的事:你怎么知道自己走错了?
幻影123!
1 个月前
python
·
深度学习
·
神经网络
·
强化学习
·
五子棋
·
alpha zero
·
mokugo
从零训练一个会下五子棋的AI
摘要:本人在两张消费级 GPU(RTX 4090 + RTX 2080 Ti)上,从零训练出了一个 15×15 五子棋 AlphaZero AI。本文记录了完整实战过程:从框架选型、网络架构、分布式训练,到 14 个真实踩坑(每个都有症状+根因+修复)、一套可靠的评估方法论(loss 下降≠棋力上升),以及 v1→v2→v3 的对照实验设计与早期数据。全文 7000+ 字,全部结论均有实测数据支撑,无水分。
我是有底线的