AlphaZero 五子棋实战(番外二):白棋专项训练的一种方案python·机器学习·强化学习·五子棋·alpha zero
从科学代码库到智能体训练场:ScienceIDE 的架构拆解与工程启示架构·强化学习·代码仓库·科学计算·监督微调·智能体训练·可编程环境
从摸石头过河到看录像学习:强化学习与离线RL的进化故事学习·强化学习·贝尔曼方程·离线强化学习·在线强化学习·q值
Qwen3.8-27B 做 GRPO 需要几张 4090?Coding Agent 显存预算与多卡验收强化学习·qwen·大模型微调·rtx4090·算家云·grpo
gymnasium初步教程强化学习·gym·仿真环境·gymnasium·动力学仿真
用 SGLang 决策端点做毫秒级 Agent 路由python·大模型·agent·强化学习·多模态·推理
一年前,我用 RL 造了一批非自回归决策模型强化学习·决策系统·低延迟推理·非自回归模型·实时竞价