政安晨的个人主页:************政安晨****************
欢迎 👍点赞✍评论⭐收藏
希望政安晨的博客能够对您有所裨益,如有不足之处,欢迎在评论区提出指正!
目录
[1.1 DQN:从像素到策略的第一次跃迁](#1.1 DQN:从像素到策略的第一次跃迁)
[1.2 强化学习的复兴:从冷门到显学](#1.2 强化学习的复兴:从冷门到显学)
二、超越人类时代:博弈论与自我对弈的革命(2015-2017)
[2.1 AlphaGo:攻克人类智慧的最后堡垒](#2.1 AlphaGo:攻克人类智慧的最后堡垒)
[2.2 AlphaGo Zero:纯强化学习的极致](#2.2 AlphaGo Zero:纯强化学习的极致)
[2.3 AlphaZero:通用算法的统一](#2.3 AlphaZero:通用算法的统一)
[2.4 MuZero:不需要规则的智能](#2.4 MuZero:不需要规则的智能)
[2.5 AlphaStar:实时策略的极限挑战](#2.5 AlphaStar:实时策略的极限挑战)
[3.1 AlphaFold:当游戏AI拯救生命](#3.1 AlphaFold:当游戏AI拯救生命)
[3.2 跨域迁移:游戏AI技术的普适性](#3.2 跨域迁移:游戏AI技术的普适性)
[4.1 SIMA:通用智能体的诞生](#4.1 SIMA:通用智能体的诞生)
[4.2 SIMA 2:实时推理与对话的伙伴](#4.2 SIMA 2:实时推理与对话的伙伴)
[4.3 开发者价值:AI驱动的游戏新玩法](#4.3 开发者价值:AI驱动的游戏新玩法)
[4.4 制作革命:AI重塑游戏开发流程](#4.4 制作革命:AI重塑游戏开发流程)
[5.1 合作哲学:展示而非空谈](#5.1 合作哲学:展示而非空谈)
[5.2 Fenris Creations:EVE宇宙的二十年](#5.2 Fenris Creations:EVE宇宙的二十年)
[5.3 前沿能力:AI面临的终极挑战](#5.3 前沿能力:AI面临的终极挑战)
[5.4 多元宇宙:EVE系列的多层次AI研究](#5.4 多元宇宙:EVE系列的多层次AI研究)
[5.5 Aura Guidance:AI助人的第一个果实](#5.5 Aura Guidance:AI助人的第一个果实)
[5.6 路径规划:从沙盒到生产的严谨研究](#5.6 路径规划:从沙盒到生产的严谨研究)
[7.1 游戏的智识之镜](#7.1 游戏的智识之镜)
[7.2 AI是催化剂而非替代者](#7.2 AI是催化剂而非替代者)
[7.3 未来的研究方向](#7.3 未来的研究方向)
引言:当虚拟世界成为智识的镜子
在人类文明的进程中,游戏始终承担着一种独特的角色------它既是娱乐的载体,也是认知的边界。从古希腊的棋盘到中世纪的棋类游戏,从街机时代的《Pong》到当代的开放世界MMO,人类一直在用游戏来丈量智能的边界。Google DeepMind------这家由前游戏开发者Demis Hassabis与同事共同创立的人工智能研究机构------在过去十五年里,以一种近乎执拗的信念,将游戏视为理解智能本质的核心实验场。本文将追溯这段跨学科的旅程,从2013年的Atari到2026年的EVE Online,从强化学习的奠基到通用智能体的崛起,探讨游戏如何成为AI研究的"试金石",以及这种互惠关系如何重塑了两个领域的未来。
一、得分时代:当机器学会"玩"游戏(2010-2015)
1.1 DQN:从像素到策略的第一次跃迁
2015年,一篇发表于《Nature》的论文在人工智能领域投下了一颗震撼弹。DeepMind团队提出的DQN(Deep Q-Network)算法,仅凭原始像素输入,就在49款不同的Atari 2600游戏中达到或超越人类水平,无需任何针对单一游戏的工程调整[1]。这一突破的意义远超技术层面:它证明了深度神经网络与强化学习结合后,能够在高维感知空间中学习到超越人类直觉的决策能力。
DQN的核心创新在于将卷积神经网络(CNN)与Q-Learning融合。CNN负责从像素中提取视觉特征,Q-Learning则通过贝尔曼方程学习动作-价值函数。这一架构看似简单,却奠定了现代深度强化学习的基石。正如Hassabis所言:"我们想看看,通用学习算法能否在没有人类知识的情况下,从零开始掌握游戏。"
1.2 强化学习的复兴:从冷门到显学
在DQN之前,强化学习虽然在理论层面有深厚的根基(Sutton与Barto在1998年出版的经典教材),但实际应用却乏善可陈。DeepMind的突破让整个学术界看到了希望------2015年之后,深度强化学习论文呈指数级增长,OpenAI、Microsoft、Facebook等机构纷纷入局。这一波浪潮不仅推动了游戏AI的进步,更在机器人控制、推荐系统、自动驾驶等领域产生了深远影响。
值得注意的是,DQN的成功并非偶然。在它背后,是经验回放(Experience Replay)、目标网络(Target Network)以及ϵ-greedy探索策略等一系列巧妙的工程设计。这些技术后来成为深度强化学习的"标配",被广泛应用于各类场景。
二、超越人类时代:博弈论与自我对弈的革命(2015-2017)
2.1 AlphaGo:攻克人类智慧的最后堡垒
围棋一直被视为人类智慧的巅峰象征。其搜索空间约为10^170种可能局面,这一数字远超宇宙中的原子总数(10^80)。在AlphaGo之前,主流观点认为AI要达到人类顶尖棋手水平,至少还需要十年。
然而,2016年3月,AlphaGo以4:1的比分战胜了世界冠军李世乭九段,震惊了全世界[2]。这场对决不仅是技术的胜利,更是认知的转折点。其中第37手成为了AI历史上的经典------专业解说员Michael Redmond九段起初以为是失误,但随后意识到这步棋颠覆了几百年来的围棋定式。正如李世乭在赛后所言:"第37手让我重新审视了围棋的整个哲学。"
2.2 AlphaGo Zero:纯强化学习的极致
如果说AlphaGo的胜利是"站在人类肩膀上"的胜利,那么2017年诞生的AlphaGo Zero则是纯粹的"机器自我觉醒"[3]。这个系统完全通过自我对弈学习,不使用任何人类对局数据,却在短短三天内超越了所有前作,更在21天内达到了超越人类的水平。
AlphaGo Zero的核心创新是将策略网络(Policy Network)与价值网络(Value Network)融合为单一神经网络,并通过蒙特卡洛树搜索(MCTS)进行自我对弈训练。这一架构的优雅之处在于:它不需要任何人类知识,仅凭游戏规则就能从零开始学习到超越人类的策略。这印证了一个深刻的观点------在足够强大的学习算法面前,人类的经验甚至可能成为束缚。
2.3 AlphaZero:通用算法的统一
2017年底,AlphaZero将这一理念推向了新的高度[5]。它用同一个算法,同时精通国际象棋、将棋和围棋,且都达到了超越人类世界冠军的水平。更令人惊叹的是,AlphaZero展现出了一种"非人类"的棋风------在国际象棋中,它偏好牺牲棋子换取位置优势,这与传统的人类棋理形成了鲜明对比,却同样有效。
AlphaZero的意义不仅在于技术突破,更在于它证明了"通用人工智能"的可能性。一个算法,无需修改,仅凭自我对弈,就能掌握多种不同的复杂任务。这一理念后来成为DeepMind后续研究的指导思想。
2.4 MuZero:不需要规则的智能
如果说AlphaZero是"知规则后的自我觉醒",那么2020年发表的MuZero则是"无规则世界的探索者"[4]。MuZero甚至不知道游戏规则------它通过学习一个环境模型,在脑海中"想象"动作的后果,然后基于这些想象进行规划。这一能力被称为"基于模型的强化学习"(Model-Based RL),它让AI能够在未知世界中自主探索、制定策略。
MuZero的突破具有深远的现实意义。在真实世界中,我们往往没有完整的规则手册------交通规则、社会规范、商业逻辑都需要AI自己去学习和适应。MuZero的架构为这种"开放式智能"提供了可能性。
2.5 AlphaStar:实时策略的极限挑战
2019年,AlphaStar在《星际争霸II》中达到宗师段位,应对了实时复杂性和不完全信息[6]。与围棋不同,《星际争霸II》要求AI在毫秒级的时间内做出决策,同时还要应对"战争迷雾"------即无法看到对手全部信息的不确定性。
AlphaStar的训练采用了监督学习+强化学习的混合方法:首先通过学习人类职业选手的录像获得基础策略,然后通过自我对弈进一步优化。最终的AlphaStar在表演赛中以10:1的比分战胜了人类顶级选手MaNa和TLO。这一成就不仅证明了AI在实时策略游戏中的能力,更展示了AI在多智能体、不完全信息环境中的潜力。
三、知识迁移:从虚拟世界到现实突破
3.1 AlphaFold:当游戏AI拯救生命
游戏AI研究的价值远不止于游戏本身。或许最惊艳的跨界应用是AlphaFold------它将AlphaGo中的核心技术(深度神经网络+树搜索)应用于蛋白质结构预测这一困扰学界50年的重大挑战[8]。
蛋白质是生命的基石,其功能由三维结构决定。传统方法(如X射线晶体学、核磁共振)测定一个蛋白质结构需要数月甚至数年。AlphaFold2在2020年的CASP14竞赛中将预测精度从约40分提升到92分,几乎达到了实验级精度。2021年,AlphaFold2在《Nature》发表,预测了人类蛋白质组中98.5%的结构------这相当于将数亿年的进化浓缩在了几个月的计算中。
2024年,Demis Hassabis与John Jumper因AlphaFold的贡献获得诺贝尔化学奖,这是AI历史上第一次获此殊荣。从AlphaGo到AlphaFold,DeepMind用十年时间证明了一个深刻的观点:游戏不仅是娱乐,更是科学发现的催化剂。
3.2 跨域迁移:游戏AI技术的普适性
AlphaFold只是游戏AI技术跨域应用的冰山一角。从游戏中发展出的探索策略、经验回播机制、分层强化学习架构,如今已被广泛应用于:
-
机器人控制:OpenAI的Dactyl使用强化学习让机械手学会了玩魔方
-
资源管理:DeepMind与Google数据中心合作,将冷却能耗降低40%
-
自动驾驶:Waymo等公司使用模拟环境+RL训练自动驾驶策略
-
药物发现:Insilico Medicine使用RL设计新药分子
-
金融交易:多家对冲基金使用RL算法进行高频交易
游戏为AI提供了一个安全、可控、富有挑战性的沙盒,在这里测试的算法往往具有惊人的普适性。正如Hassabis所言:"如果你能在围棋中解决智能问题,你就能在科学中解决它。"
四、理解时代:从赢得游戏到理解世界(2018-至今)
4.1 SIMA:通用智能体的诞生
早期的游戏AI研究证明:只要目标清晰、训练充足,AI可以精通任何游戏。但真实世界没有分数和规则手册------这促使DeepMind团队提出一个根本不同的问题:AI能否像人类一样理解和与任何游戏世界交互?
这正是SIMA(Scalable Instructable Multiworld Agent,可扩展、可指导的多世界智能体)要应对的挑战[9]。SIMA是一个通用智能体,它不像传统AI那样追求最高分,而是:
-
"看见"玩家在屏幕上看到的内容(屏幕像素)
-
理解自然语言指令(自然语言处理)
-
通过普通的键盘鼠标进行操作(动作输出)
-
无需API或源代码访问(黑盒交互)
这一架构的意义深远。它意味着AI不需要"内部作弊"------即通过调用游戏引擎的API获得特权信息。它必须像人类一样,仅凭视觉和操作能力来完成任务。这正是真实世界AI(如家用机器人、自动驾驶)的运作方式。
4.2 SIMA 2:实时推理与对话的伙伴
由前沿AI模型Gemini驱动的SIMA 2更进了一步[10]。它不仅能执行指令,还能进行实时推理与对话。例如,当玩家说"我们去找点金子"时,SIMA 2不仅会执行任务,还会在遇到障碍时主动询问"要不要我先去打那只怪?它可能会掉金子"。
SIMA 2在复杂的3D研究环境和包括《无人深空》、《英灵神殿》、《Hydroneer》等多款商业游戏中达到类人水平。这意味着SIMA 2不仅在受控环境中有效,还能直接"上手"真实发行的游戏------这是通用智能体的关键里程碑。
4.3 开发者价值:AI驱动的游戏新玩法
对游戏开发者来说,真正通用的游戏智能体释放出了无需修改游戏代码即可工作的AI能力。这能驱动全新的玩法:
-
AI伙伴:真正理解游戏世界的AI队友,能根据玩家风格自适应调整
-
自适应NPC:能以脚本系统无法做到的方式回应玩家行为的NPC(Non-Player Character)
-
程序化叙事:AI根据玩家行为动态生成故事情节,使每个玩家的体验独一无二
-
智能教学:AI根据玩家水平动态调整难度,提供个性化的游戏引导
想象一款RPG游戏,NPC不再遵循预设脚本,而是真正"记住"玩家的选择,NPC之间的关系也会随玩家行动而动态演化。这将是游戏叙事的革命性突破。
4.4 制作革命:AI重塑游戏开发流程
通用游戏智能体也将改变游戏的制作方式:
-
开发期QA:游戏每次提交都会变化,传统测试方法难以跟上。AI智能体能提供真正健壮的测试------它们不仅能发现边界情况,还能随着游戏的变化而进化。
-
发布后适应性:当新内容上线或玩家行为难以预测时,AI可以实时适应,无需重新脚本化。
-
内容生成:AI能自动生成关卡、任务、对白,降低开发成本,加速内容迭代。
这意味着小型独立工作室也能借助AI工具制作出大型3A游戏品质的体验------这将对整个行业产生深远影响。
五、共生关系:游戏开发者与AI研究者的双向价值
5.1 合作哲学:展示而非空谈
DeepMind与游戏开发者的合作遵循"展示而非空谈"的路径。团队与游戏开发者并肩工作,探索新想法,构建可玩原型,寻找"乐趣"所在。这种合作模式的核心是:重要的不是技术,而是有趣的游戏体验。
这种哲学与传统的"AI优先"路径形成鲜明对比。在传统模式中,研究者开发算法,然后寻找应用场景;而在DeepMind的模式中,游戏开发者定义问题,AI研究者提供解决方案。这种双向奔赴的合作模式,确保了AI技术真正服务于玩家体验,而非仅仅是技术展示。
5.2 Fenris Creations:EVE宇宙的二十年
我们与EVE宇宙背后的独立工作室Fenris Creations的最新研究合作,标志着DeepMind游戏AI研究史上新篇章的开启。
Fenris Creations用了二十多年时间打造了游戏史上最非凡的持久世界之一。《EVE Online》于2003年上线,是一款大型多人太空模拟游戏,数千名玩家共享一个已持续演化20多年的单一宇宙。玩家驱动的经济系统具备真实的供需动态,贸易网络横跨数千个星系;由联盟、冲突和外交塑造的版图,由人类互动驱动。
这个宇宙的独特之处在于其涌现性------20多年的玩家互动演化出了没有任何设计师能够预测的复杂社会形态。联盟政治、市场操控("收割")、间谍活动、外交博弈......这些都不是脚本写出来的,而是玩家自主创造的。
5.3 前沿能力:AI面临的终极挑战
对AI研究而言,EVE宇宙是一个黄金机会。它是一个持续演化、活生生的世界,正好要求我们认为是前沿AI所必需的核心能力:
-
持续学习:在不断变化的世界中习得新技能,且不忘已学(解决灾难性遗忘问题)
-
长跨度记忆:在远超当今模型上下文窗口的时间跨度上积累并检索知识(解决长期记忆问题)
-
长期规划:在数周、数月乃至数年的时间尺度上进行推理(解决层次化规划问题)
-
复杂多智能体动态:在规模化场景中处理合作、竞争、谈判、经济行为和涌现式社会行为(解决社会智能问题)
这些挑战正是DeepMind更大研究计划的核心------构建能够从经验中持续学习、且学习速率随时间加速的系统。
5.4 多元宇宙:EVE系列的多层次AI研究
DeepMind的研究合作延伸到Fenris Creations不断扩展的宇宙,提供截然不同的AI开发环境:
-
EVE Online:大规模单分服持久宇宙,适合研究宏观战略与经济系统
-
EVE Vanguard:第一人称视角,将地面级、快节奏的战术决策带入更广阔的持久世界(适合研究实时战术)
-
EVE Frontier:拥有可编程的"智能组件"和开放可扩展的架构,提供了一个开放式的环境,在那里世界本身的规则都可以被改变(适合研究元学习与规则推理)
这带来了在不同抽象层次上研究智能体的机会------从毫秒级战术到星系级战略。这种多层次研究架构是前所未有的。
5.5 Aura Guidance:AI助人的第一个果实
DeepMind与Fenris Creations的合作已为玩家带来真实价值:Aura Guidance系统使用Gemini,根据真实的新手互助问答内容,向新飞行员传递玩家生成的知识。
这个系统的巧妙之处在于:它不是"AI教你玩",而是"老玩家帮你学"。Aura Guidance从论坛、Discord聊天、新手问答中提取真实的人类知识,然后用Gemini的语言能力进行组织和呈现。这保留了玩家社区的"人情味",同时借助AI的规模化能力让每个新手都能获得个性化指导。
5.6 路径规划:从沙盒到生产的严谨研究
DeepMind的长期研究项目从EVE Online的离线实例起步------这是一个与真实玩家隔离的安全沙盒;之后进入EVE Frontier,研究人类与智能体如何在持久、开放的世界中共存。只有当能力足够成熟时,才会考虑将它们带入EVE Online与EVE Vanguard,目标是丰富人类玩家的体验。
这种"沙盒→试点→生产"的路径体现了DeepMind对负责任AI开发的承诺。游戏AI研究的最大风险是破坏玩家体验,因此研究必须循序渐进,确保AI行为符合玩家社区的价值观。
六、合作网络:DeepMind的游戏开发者伙伴
DeepMind的游戏AI研究是众多工作室共同努力的成果。除了Fenris Creations,还有:
-
Coffee Stain Studios:《英灵神殿》《幸福工厂》《山羊模拟器3》------沙盒生存与建造类游戏的代表
-
Foulball Hangover:《Hydroneer》------物理驱动的工程建造游戏,AI需要理解流体动力学
-
Hello Games:《无人深空》------程序化生成宇宙,AI需要处理近乎无限的探索空间
-
Keen Software House:《太空工程师》------工程建造游戏,AI需要理解物理模拟
-
RubberbandGames:《Wobbly Life》------物理沙盒游戏,AI需要处理非刚性物理
-
Strange Loop Games:《Eco》------生态系统模拟,AI需要理解复杂系统涌现
-
Thunderful Games:《ASKA》《The Gunk》《Steamworld Build》------多种类型的独立游戏
-
Digixart:《Road 96》------叙事驱动冒险,AI需要处理情感与叙事
-
Tuxedo Labs与Saber Interactive:《Teardown》------完全可破坏的物理世界
这种合作网络的广度令人印象深刻。从沙盒建造到太空模拟,从物理引擎到生态模拟,DeepMind的合作伙伴涵盖了几乎所有游戏类型。这种多样性确保了AI研究成果的普适性------如果一个算法能在多种类型游戏中工作,它就更有可能迁移到真实世界。
七、展望:共同前行的道路
7.1 游戏的智识之镜
游戏一直是智识的一面镜子。当它们变得更加复杂、更具持久性、更加开放,我们为驾驭它们而构建的AI系统也将如此。
这一观点揭示了游戏AI研究的深层价值:游戏不仅是测试算法的工具,更是理解智能本质的媒介。当我们在游戏中构建能够学习、规划、协作的AI时,我们实际上在回答一个根本问题------智能是什么?它如何从简单的规则中涌现?它如何与环境和他人互动?
7.2 AI是催化剂而非替代者
DeepMind追求的目标一如既往:AI是催化剂,而非替代者。长期愿景是解锁突破性的游戏体验,让游戏更具可及性和个性化------并像从AlphaGo到AlphaFold所证明的那样,将从游戏中习得的知识应用于真实世界的问题,推进科学发现。
这一立场体现了DeepMind的人文关怀。在AI技术飞速发展的今天,"AI取代人类"的担忧从未消失。但DeepMind的实践表明:AI的最佳角色是增强人类能力,而非取代人类。在游戏中,AI可以创造更丰富的世界、提供更个性化的体验;在科学中,AI可以加速发现、解决复杂问题。
7.3 未来的研究方向
展望未来,DeepMind的游戏AI研究将聚焦于以下几个方向:
-
真正的开放式学习:AI不仅能在单一游戏中学习,还能在多个游戏间迁移知识,甚至发明新策略
-
社会智能:AI不仅能与人类协作,还能理解社会规范、道德准则、文化差异
-
创造性表达:AI不仅能玩游戏,还能设计游戏、创作故事、生成艺术
-
长期智能体:AI能在数年时间尺度上规划行动,实现真正的"长期思维"
-
负责任的部署:确保AI行为符合玩家社区的价值观,避免破坏游戏生态
这些方向不仅是技术挑战,更是哲学问题。它们要求我们重新思考智能的本质、创造的意义、以及人机协作的未来。
八、结语:智识冒险的新篇章
我们感谢一路同行的所有游戏合作伙伴,也感谢Fenris Creations加入DeepMind开启这一新篇章。DeepMind迫不及待想分享研究发现。
6 Vinyals, O., et al. (2019). Grandmaster level in StarCraft II using multi-agent reinforcement learning. *Nature*, 575(7782), 350-354. https://www.nature.com/articles/s41586-019-1724-z
7 Berner, C., et al. (2019). Dota 2 with Large Scale Deep Reinforcement Learning. *arXiv preprint*.
8 Jumper, J., et al. (2021). Highly accurate protein structure prediction with AlphaFold. *Nature*, 596(7873), 583-589.
9 DeepMind. (2024). SIMA: Scaling Up Open-Ended Embodied Agents in Virtual Worlds. DeepMind Blog.
10 DeepMind. (2026). SIMA 2: An agent that plays, reasons and learns with you in virtual 3D worlds. DeepMind Blog, August 21.
11 Ecoh, E., et al. (2025). Continual Learning in Deep Neural Networks: A Comprehensive Survey. *Journal of Machine Learning Research*.
12 Silver, D., & Hassabis, D. (2024). The Future of AI: From Game-Playing to Problem-Solving. *Annual Review of Control, Robotics, and Autonomous Systems*.
13 Fenris Creations. (2026). Aura Guidance system for EVE Online. https://www.eveonline.com/news/view/eve-evolved-aura-guidance
14 AlphaFold: A solution to a 50-year-old grand challenge in biology. (2020). DeepMind Blog.
附录:关键里程碑时间线
时间 | 里程碑 | 意义
2013 | DQN初版发布 | 深度强化学习奠基
2015 | DQN论文在Nature发表 | 49款Atari游戏达人类水平
2016 | AlphaGo战胜李世石 | 攻克围棋,智识里程碑
2017 | AlphaGo Zero发布 | 纯自我对弈超越人类知识
2017 | AlphaZero统一三种棋类 | 通用算法证明
2019 | AlphaStar宗师段位 | 实时策略游戏突破
2020 | AlphaFold2预测蛋白质结构 | AI解决50年科学难题
2020 | MuZero无需规则学习 | 基于模型的RL突破
2024 | AlphaFold获诺贝尔化学奖 | AI首次获诺贝尔奖
从2013年的Atari到2026年的EVE Online,从DQN到SIMA 2,从AlphaGo到AlphaFold------这不仅是一段技术演进史,更是一段智识冒险史。在这段旅程中,游戏始终是DeepMind的"指南针":它指引研究方向、定义问题边界、提供评估基准。
当我们回顾这十五年时,我们看到的不仅是一个个AI里程碑,更是一个不断深化的认识:智能不是单一的能力,而是多种能力的综合------感知、推理、学习、规划、协作、创造。游戏以其独特的复杂性,成为了培育这种综合智能的最佳土壤。
在未来的岁月里,DeepMind将继续与游戏开发者合作,共同探索AI与游戏的边界。因为我们知道:游戏是智识的镜子,而我们正在镜中看见智能本身的轮廓。
参考文献
1 Mnih, V., et al. (2015). Human-level control through deep reinforcement learning. *Nature*, 518(7540), 529-533. https://www.nature.com/articles/nature14236
2 Silver, D., et al. (2016). Mastering the game of Go with deep neural networks and tree search. *Nature*, 529(7587), 484-489.
3 Silver, D., et al. (2017). Mastering the game of Go without human knowledge. *Nature*, 550(7676), 354-359. https://www.nature.com/articles/nature24270
4 Schrittwieser, J., et al. (2020). Mastering Atari, Go, chess and shogi by planning with a learned model. *Nature*, 588(7839), 604-609. https://www.nature.com/articles/s41586-020-03051-4
5 Silver, D., et al. (2017). A general reinforcement learning algorithm that masters chess, shogi and Go through self-play. *Science*, 358(6364), 1159-1164.
2024 | SIMA发布 | 通用游戏智能体诞生
2026 | SIMA 2实时推理对话 | 交互式AI伙伴
2026 | DeepMind-Fenris合作开启 | EVE宇宙AI研究新篇章
