【arXiv 2026】LoGos:把人类思考带回围棋——通用大模型的专业领域专家之路|从围棋AI与LLM推理交叉视角

摘要

本文解读 arXiv 2026 论文《Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go》。该论文提出LoGos (Language-Oriented Go System),通过融合启发式规则合成专家数据长 CoT 混合冷启动GRPO 自探索强化学习 ,把通用大模型变成能在自然语言中分析局面、推理并落子的职业级围棋棋手,其特别之处在于全程不依赖稀缺的人类推理标注,仅用可规模化的结构化专家知识。实验表明 LoGos(32B) 在自建基准 KataGo-Bench-1K 上达到 88.6% 的预测准确率,约为最强通用 LLM 基线 Claude3.7-Sonnet(34.3%)的 2.6 倍,并超越职业棋手模拟器 KataGo-HumanSL-9d(87.8%),同时保持 32B 量级领先的通用推理能力,为稀缺语料专业领域的大模型应用提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go
标题(中文) LoGos:把人类思考带回围棋------通用大模型的专业领域专家之路
作者 Yichuan Ma, Linyang Li, Yongkang Chen, Peiji Li, Jiasheng Ye, Qipeng Guo, Dahua Lin, Kai Chen
机构 上海人工智能实验室 · 复旦大学 · 香港中文大学
会议 arXiv 2026
arXiv https://arxiv.org/abs/2601.16447
项目网站 https://github.com/Entarochuan/LoGos

背景与动机:为什么通用大模型下不好围棋?

围棋是通用大模型的"能力洼地"。2016 年 AlphaGo 用蒙特卡洛树搜索加深度神经网络击败李世石,2017 年 AlphaZero 更是不依赖人类知识就掌握了围棋,AI 的性能天花板早已确立。然而主流大模型在围棋上连入门水平都达不到:在 KataGo-Bench-1K 上,最强的通用模型 Claude3.7-Sonnet 也只有 34.3% 的预测准确率,远低于入门级模拟器 KataGo-HumanSL-18k 的 67.4%。

为什么差距这么大?原因有三点:

  • 语料稀缺:围棋的专业自然语言语料极少,靠预训练无法获得棋理与术语;
  • 蒸馏失效:直接蒸馏通用模型或在大规模领域语料上预训练(如 fin-R1、PMC-LLaMA 路线)在围棋上行不通;
  • 结构错配:ChessGPT 等棋类 LLM 只做结构化落子预测,没有自然语言推理,更谈不上保持通用能力。

本文的核心问题是:能否把专业能力注入通用模型,同时保持通用推理? 作者的洞察是:围棋虽然缺少"人类推理轨迹",但拥有大量可规模化的结构化专家知识(KataGo 引擎可批量标注)。如果把结构化知识变成"像人一样思考"的合成数据,再用长 CoT 推理数据做冷启动,最后用强化学习让模型自探索,也许就能绕过人工标注的瓶颈。

从历史视角看,围棋 AI 经历了从专用到通用的迁移:AlphaGo(2016)确立 MCTS+深度学习的路线,AlphaZero(2017)摆脱人类知识,KataGo(2020)开源并支持人类风格训练成为社区标准,而 LoGos(2026)是第一个用自然语言推理达到职业级的通用大模型。

研究主线:从问题到结论

图 10:LoGos 研究主线(Mermaid 流程图)------问题、动机、设计、方法、实验、结论的完整链路。

基准/方法设计:LoGos 的定位

图 1:LoGos 与通用 LLM、围棋专用模型的对战胜率对比------与职业棋手同级的对局表现,远超所有既有 LLM。

围棋的复杂度可以用 b\^d 刻画:b \\approx 250 是平均合法着法数,d \\approx 150 是典型对局长度,远超国际象棋(b \\approx 35d \\approx 80)。LoGos 把整局棋谱建模为输入序列:x_{k+1} = \\pi_\\theta(x_1, x_2, \\ldots, x_k),用 X/O 区分黑白双方,坐标即落子,无需棋盘编码即可训练。相比 KataGo 这类 MCTS 引擎,LoGos 输出的是带推理过程的自然语言回答,而不是一个孤立的落子坐标。

分类全景:LoGos 训练配方四要素

图 11:LoGos 训练配方四要素(Mermaid 分类图)------数据构造、混合冷启动、GRPO 自探索、2D 棋盘渲染。

方法细节:三阶段训练配方

LoGos 的训练分三步。第一步是专家数据构造:收集超过 500 万局业余顶尖与职业棋手对局,均匀采样出超过 1000 万(10M)个棋局状态,用开源引擎 KataGo 标注出前 10 个候选落子、后续变化与胜率数值,再按四步启发式模板(确认行棋方 → 分析多个候选点 → 总结选点 → 结构化输出)生成"像人一样思考"的合成样本;同时收集 10 万(100K)条职业解说构建解说数据集。

图 2:模型先分析局面再落子------给定棋局先描述形势,再给出下一步(R8)与胜率估计。

第二步是混合冷启动:把围棋数据与数学、代码等领域的蒸馏长 CoT 数据(OpenThoughts-114K、NuminaMath-QwQ-CoT-5M、OpenCodeReasoning、Bespoke-Stratos-17k 等)混合做监督微调,同时注入领域知识并激活长思维链能力。

图 3:整体方法------混合冷启动注入围棋专家知识与长 CoT 能力,GRPO 阶段模型自发形成"分析-推理-总结-落子"的稳定策略。

第三步是 GRPO 自探索 。作者设计了分段奖励函数:按落子与 KataGo 排名的匹配度分三档给奖励(c_1=0.8c_2=0.6c_3=0.4,满足 c_1 \> c_2 \> c_3 \> \\alpha_1 + \\alpha_2),同时用 \\alpha_1=0.1\\beta_1=10 惩罚胜率估计偏差,用 \\alpha_2=0.2\\beta_2=10 奖励同档内更优的落子。这个"平滑"的奖励设计让模型在长思维链形式下自我探索,最终把专家知识内化为稳定的自然语言推理策略。

训练细节上,冷启动阶段最大序列长度 32,768 tokens,cosine 学习率 4e-5 到 4e-6,7B 模型用 32 张 A800(80GB)、32B 用 64 张;GRPO 阶段基于 VeRL 框架,batch 64、每样本 16 个 rollouts、最大响应 8,192 tokens、KL 系数 5e-4。

实验设计与结果:职业级棋力与通用能力兼得

评测协议:围棋能力用自建 KataGo-Bench-1K(1000 个覆盖不同棋力水平的棋局状态,预测命中候选落子即算正确);通用能力用 GPQA-Diamond、BBEH、KOR-Bench、AIME、MATH、LiveCodeBench 六个基准(OpenCompass 框架,AIME/MATH 用 Qwen2.5-72B-Instruct 判分)。

主结果(KataGo-Bench 与通用基准,%):

模型 KataGo-Bench GPQA AIME MATH
DeepSeek-R1 17.6 69.7 86.7 97.6
o1-mini 27.3 61.1 56.7 95.0
Claude3.7-Sonnet 34.3 67.7 30.0 79.8
DeepSeek-R1-Distill-Qwen-32B 4.7 56.1 46.7 94.5
LoGos(7B) 88.1 37.9 40.0 93.2
LoGos(32B) 88.6 63.6 56.7 96.5
KataGo-HumanSL-9d 87.8 --- --- ---

自探索实验:冷启动为什么必不可少

图 4:自探索实验------(a) 冷启动模型的 RL 性能曲线;(b) 无冷启动直接 RL 的上限;(c) 朴素拟合 vs 启发式规则冷启动。

冷启动模型的 RL 起点是 60--70%(入门级),训练中快速越过中段棋手模拟器 KataGo-HumanSL-1d(79.7%),最终超过职业模拟器 HumanSL-9d。两个对照实验给出关键结论:

  • 无冷启动:直接对 Instruct / R1-Distill 模型做 GRPO,上限低于入门线 67.36%------通用推理数据无法替代领域知识;
  • 朴素拟合:去掉启发式规则只做直接预测,上限不到 50%,而启发式数据达到 88%------专家数据的结构化程度直接决定自探索天花板。

奖励设计消融:平滑奖励爬得更高

图 5:奖励设计消融------不同奖励设置下 RL 自探索的性能上限对比。

作者对比了三种变体:只奖励第一名落子的 Top-1 稀疏奖励、Top-3 不分档奖励、以及分档但去掉内层胜率惩罚的设置。结果显示稀疏奖励分布导致性能上限更低,而平滑的分段奖励达到最高探索上限。

数据混合比:一轮围棋数据最优

图 6:不同围棋数据混合比下的 RL 性能------1 epoch 围棋数据最终上限更高。

围棋数据训练 1 epoch 比 2 epoch 最终上限更高,说明冷启动只需"学到结构",过度拟合专家数据反而压缩自探索空间。同时把 0--10M 围棋数据混入后,MATH/AIME/OmniMath/GPQA 波动不超过 3 个点,领域数据注入不牺牲通用推理。

基准公平性:ELO 相关 r=0.92

图 7:ELO 等级分与 KataGo-Bench-1K 性能的相关性(r=0.92)------基准公平反映真实棋力。

作者组织多模型循环赛,用标准 ELO 公式 ELO(A)*{new} = ELO(A)*{old} + K \\cdot (S_A - E_A)K=32)更新等级分,期望得分 E_A = \\frac{1}{1 + 10\^{(ELO_B - ELO_A)/400}}。各模型 ELO 与基准准确率相关系数 r=0.92,证明基准分数与真实对局竞争力高度一致。

上下文诅咒:2D 棋盘渲染的解法

图 8:上下文诅咒------随棋谱序列长度增长,LLM 预测准确率下降,而直接表示盘面的引擎保持稳定。

棋谱序列越长,模型对局面的理解越差:任意两手棋 x_ix_j 互换都会产生全新局面。案例中 LoGos 前 160 手保持优势,随后 40 手连续失误被 Golaxy-GiantElephant 逆转。解法是在输入中附加 19×19 盘面数组(1=黑、-1=白、0=空),把"序列记忆"变成"显式状态"。

图 9:加入 2D 盘面渲染后------长序列(200+ 手)仍保持高准确率,上下文诅咒得到缓解。

结果对比总结

图 12:结果对比总结(Mermaid 流程图)------34.3% 基线到 88.6% 职业级,通用能力保持。

关键发现

  • 首个职业级围棋通用 LLM:LoGos(32B) 在 KataGo-Bench-1K 上达到 88.6%,约为最强通用基线 Claude3.7-Sonnet(34.3%)的 2.6 倍,并超过职业模拟器 HumanSL-9d(87.8%)。
  • 双尺寸验证:7B 模型同样达到 88.1%,说明范式在小模型上也可复现。
  • 通用能力不倒退:LoGos(32B) 的 MATH 96.5、GPQA 63.6、LiveCodeBench 50.9,全面优于同量级 Instruct 模型。
  • 自探索涌现:冷启动后模型在 RL 中自发形成"分析-推理-总结-落子"的稳定策略,无需人类示范。
  • 人类评估:邀请业余顶尖棋手盲评,落子正确率 96.5%,解说完全正确率 55.6%,同时发现术语误用与模糊解说的短板。
  • 开源三件套:首个 10M 级 LLM 围棋数据集、首个围棋评测基准 KataGo-Bench-1K(ELO 相关 r=0.92)、LoGos 模型全部发布。

局限性

  • 依赖专家知识源:方法需要可规模化的专业标注(如 KataGo)与按领域定制的启发式规则,迁移到其他领域需重新设计。
  • 训练效率:自探索 RL 较慢,训练棋局数远少于传统引擎;自回归架构对实时推理任务构成效率约束。
  • 术语误用:围棋 600+ 术语,开局阶段偶发错用(如把 D17 称作星位),且训练中没有任何术语奖励。
  • 解说模糊:部分解说如"建立雄厚外势"宽泛有效但信息量低,与人类期望不完全对齐。

常见问题(FAQ)

LoGos 是什么?

LoGos(Language-Oriented Go System)是上海AI实验室等团队发布的围棋大模型,名字取希腊语"语言"与"思想"之意,是第一个在自然语言推理下达到职业棋手水平的通用 LLM。

LoGos 和 AlphaGo、KataGo 有什么区别?

AlphaGo/KataGo 是专用引擎,用蒙特卡洛树搜索下棋,输出只有落子坐标;LoGos 是通用大模型,用自然语言分析局面、推理并落子,同时保持数学、代码等通用能力,还能给出人类可读的解说。

LoGos 的训练数据从哪里来?

作者收集 500 万+ 局业余顶尖与职业对局,采样 10M 个棋局状态用 KataGo 引擎按四步启发式模板标注成"思考型"合成数据,另收集 100K 条职业解说,全程不依赖人工标注推理链。

为什么必须"混合冷启动"再强化学习?

消融实验显示:直接对 Instruct 模型做 GRPO,上限低于入门线 67.36%;先混合围棋数据与长 CoT 数据微调再 RL,能达到 88%+。通用推理数据与结构化专家数据缺一不可。

KataGo-Bench-1K 公平吗?

公平。作者用多模型循环赛的 ELO 等级分与基准准确率做相关性分析,相关系数 r=0.92,说明基准分数与真实对局竞争力高度一致。

这套方法能用到围棋以外的领域吗?

作者认为可以,前提是领域具备"可规模化的结构化专家知识"(如科学发现、数据分析、工业控制),并把专家知识转成模型可学习的合成数据。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
网络工程小王5 小时前
【LLM开发实验】强化学习实现原理及实战
深度学习·强化学习·rlhf·ppo·dpo·grpo
Terrence Shen1 天前
【读论文系列】AGENTIC REINFORCEMENT LEARNING WITH IMPLICIT STEP REWARDS翻译+解读
大模型·agent·强化学习·rl
白拾1 天前
【COLM 2025】Search-R1:强化学习让大模型学会边推理边搜索|从LLM检索增强推理视角
强化学习·colm 2025·search-r1 论文分享·llm后训练·检索增强推理
海天一色y1 天前
深入解析 DeepSpeedPPOTrainer:基于 PPO 的大规模 RLHF 训练实现
人工智能·强化学习·deepspeed·后训练
weixin_440213292 天前
大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子
vllm·大模型推理·decode·kv cache·prefill·llm 部署
皮卡丘不断更2 天前
从一段 RGB 视频到机器人开门:读懂 Video2DoorTraversal 的仿真闭环
机器人·强化学习·数字孪生·具身智能·机器人仿真
程序猿编码2 天前
扔掉特征工程!我用三个LSTM“栈“写了一个依存句法分析器,句子结构一眼看穿
人工智能·深度学习·lstm·transformer·大模型推理
山顶夕景2 天前
【MLLM Agent】多模态理解Agent研究进展
agent·强化学习·多模态·rl·agentic
闲研随记3 天前
【文献阅读 ICLR 2026】RL算法:DECS
算法·llm·强化学习·iclr·rl