技术栈
决策过程
幻影123!
5 天前
人工智能
·
强化学习
·
马尔科夫
·
决策过程
AlphaZero 五子棋实战(一):单卡从零自举,我的v36 最终版配置
这是一个用消费级显卡跑了2个月多的 AlphaZero 五子棋自举实验:不喂棋谱、不装外部引擎当老师、不用开局库,就靠"网络 + MCTS + 自己跟自己下"从零长棋力。这篇文章把最终版 v36 的全套配置、参数、训练策略一次性摊开——包括每个参数现在是多少、为什么是这个值、以及它把外部引擎 Rapfi 打到了什么水平。
熊猫钓鱼>_>
4 个月前
人工智能
·
llm
·
强化学习
·
rl
·
马尔可夫
·
mdp
·
决策过程
强化学习与决策优化:从理论到工程落地的完整指南
摘要:强化学习(Reinforcement Learning, RL)作为人工智能领域的重要分支,正在从游戏场景走向工业现场。本文将深入讲解RL的核心原理、主流算法,并通过桥梁智能设计的具体案例,展示如何将RL技术落地应用于工程决策场景。
我是有底线的