政安晨【人工智能随笔】— 从像素到星际:游戏如何塑造了现代AI的二十年演进史 (读DeepMind的EVE宇宙AI研究有感)

政安晨的个人主页:************政安晨****************

欢迎 👍点赞✍评论⭐收藏

希望政安晨的博客能够对您有所裨益,如有不足之处,欢迎在评论区提出指正!

目录

引言:当虚拟世界成为智识的镜子

一、得分时代:当机器学会"玩"游戏(2010-2015)

[1.1 DQN:从像素到策略的第一次跃迁](#1.1 DQN:从像素到策略的第一次跃迁)

[1.2 强化学习的复兴:从冷门到显学](#1.2 强化学习的复兴:从冷门到显学)

二、超越人类时代:博弈论与自我对弈的革命(2015-2017)

[2.1 AlphaGo:攻克人类智慧的最后堡垒](#2.1 AlphaGo:攻克人类智慧的最后堡垒)

[2.2 AlphaGo Zero:纯强化学习的极致](#2.2 AlphaGo Zero:纯强化学习的极致)

[2.3 AlphaZero:通用算法的统一](#2.3 AlphaZero:通用算法的统一)

[2.4 MuZero:不需要规则的智能](#2.4 MuZero:不需要规则的智能)

[2.5 AlphaStar:实时策略的极限挑战](#2.5 AlphaStar:实时策略的极限挑战)

三、知识迁移:从虚拟世界到现实突破

[3.1 AlphaFold:当游戏AI拯救生命](#3.1 AlphaFold:当游戏AI拯救生命)

[3.2 跨域迁移:游戏AI技术的普适性](#3.2 跨域迁移:游戏AI技术的普适性)

四、理解时代:从赢得游戏到理解世界(2018-至今)

[4.1 SIMA:通用智能体的诞生](#4.1 SIMA:通用智能体的诞生)

[4.2 SIMA 2:实时推理与对话的伙伴](#4.2 SIMA 2:实时推理与对话的伙伴)

[4.3 开发者价值:AI驱动的游戏新玩法](#4.3 开发者价值:AI驱动的游戏新玩法)

[4.4 制作革命:AI重塑游戏开发流程](#4.4 制作革命:AI重塑游戏开发流程)

五、共生关系:游戏开发者与AI研究者的双向价值

[5.1 合作哲学:展示而非空谈](#5.1 合作哲学:展示而非空谈)

[5.2 Fenris Creations:EVE宇宙的二十年](#5.2 Fenris Creations:EVE宇宙的二十年)

[5.3 前沿能力:AI面临的终极挑战](#5.3 前沿能力:AI面临的终极挑战)

[5.4 多元宇宙:EVE系列的多层次AI研究](#5.4 多元宇宙:EVE系列的多层次AI研究)

[5.5 Aura Guidance:AI助人的第一个果实](#5.5 Aura Guidance:AI助人的第一个果实)

[5.6 路径规划:从沙盒到生产的严谨研究](#5.6 路径规划:从沙盒到生产的严谨研究)

六、合作网络:DeepMind的游戏开发者伙伴

七、展望:共同前行的道路

[7.1 游戏的智识之镜](#7.1 游戏的智识之镜)

[7.2 AI是催化剂而非替代者](#7.2 AI是催化剂而非替代者)

[7.3 未来的研究方向](#7.3 未来的研究方向)

八、结语:智识冒险的新篇章

附录:关键里程碑时间线

参考文献


引言:当虚拟世界成为智识的镜子

在人类文明的进程中,游戏始终承担着一种独特的角色------它既是娱乐的载体,也是认知的边界。从古希腊的棋盘到中世纪的棋类游戏,从街机时代的《Pong》到当代的开放世界MMO,人类一直在用游戏来丈量智能的边界。Google DeepMind------这家由前游戏开发者Demis Hassabis与同事共同创立的人工智能研究机构------在过去十五年里,以一种近乎执拗的信念,将游戏视为理解智能本质的核心实验场。本文将追溯这段跨学科的旅程,从2013年的Atari到2026年的EVE Online,从强化学习的奠基到通用智能体的崛起,探讨游戏如何成为AI研究的"试金石",以及这种互惠关系如何重塑了两个领域的未来。

一、得分时代:当机器学会"玩"游戏(2010-2015)

1.1 DQN:从像素到策略的第一次跃迁

2015年,一篇发表于《Nature》的论文在人工智能领域投下了一颗震撼弹。DeepMind团队提出的DQN(Deep Q-Network)算法,仅凭原始像素输入,就在49款不同的Atari 2600游戏中达到或超越人类水平,无需任何针对单一游戏的工程调整[1]。这一突破的意义远超技术层面:它证明了深度神经网络与强化学习结合后,能够在高维感知空间中学习到超越人类直觉的决策能力。

DQN的核心创新在于将卷积神经网络(CNN)与Q-Learning融合。CNN负责从像素中提取视觉特征,Q-Learning则通过贝尔曼方程学习动作-价值函数。这一架构看似简单,却奠定了现代深度强化学习的基石。正如Hassabis所言:"我们想看看,通用学习算法能否在没有人类知识的情况下,从零开始掌握游戏。"

1.2 强化学习的复兴:从冷门到显学

在DQN之前,强化学习虽然在理论层面有深厚的根基(Sutton与Barto在1998年出版的经典教材),但实际应用却乏善可陈。DeepMind的突破让整个学术界看到了希望------2015年之后,深度强化学习论文呈指数级增长,OpenAI、Microsoft、Facebook等机构纷纷入局。这一波浪潮不仅推动了游戏AI的进步,更在机器人控制、推荐系统、自动驾驶等领域产生了深远影响。

值得注意的是,DQN的成功并非偶然。在它背后,是经验回放(Experience Replay)、目标网络(Target Network)以及ϵ-greedy探索策略等一系列巧妙的工程设计。这些技术后来成为深度强化学习的"标配",被广泛应用于各类场景。

二、超越人类时代:博弈论与自我对弈的革命(2015-2017)

2.1 AlphaGo:攻克人类智慧的最后堡垒

围棋一直被视为人类智慧的巅峰象征。其搜索空间约为10^170种可能局面,这一数字远超宇宙中的原子总数(10^80)。在AlphaGo之前,主流观点认为AI要达到人类顶尖棋手水平,至少还需要十年。

然而,2016年3月,AlphaGo以4:1的比分战胜了世界冠军李世乭九段,震惊了全世界[2]。这场对决不仅是技术的胜利,更是认知的转折点。其中第37手成为了AI历史上的经典------专业解说员Michael Redmond九段起初以为是失误,但随后意识到这步棋颠覆了几百年来的围棋定式。正如李世乭在赛后所言:"第37手让我重新审视了围棋的整个哲学。"

2.2 AlphaGo Zero:纯强化学习的极致

如果说AlphaGo的胜利是"站在人类肩膀上"的胜利,那么2017年诞生的AlphaGo Zero则是纯粹的"机器自我觉醒"[3]。这个系统完全通过自我对弈学习,不使用任何人类对局数据,却在短短三天内超越了所有前作,更在21天内达到了超越人类的水平。

AlphaGo Zero的核心创新是将策略网络(Policy Network)与价值网络(Value Network)融合为单一神经网络,并通过蒙特卡洛树搜索(MCTS)进行自我对弈训练。这一架构的优雅之处在于:它不需要任何人类知识,仅凭游戏规则就能从零开始学习到超越人类的策略。这印证了一个深刻的观点------在足够强大的学习算法面前,人类的经验甚至可能成为束缚。

2.3 AlphaZero:通用算法的统一

2017年底,AlphaZero将这一理念推向了新的高度[5]。它用同一个算法,同时精通国际象棋、将棋和围棋,且都达到了超越人类世界冠军的水平。更令人惊叹的是,AlphaZero展现出了一种"非人类"的棋风------在国际象棋中,它偏好牺牲棋子换取位置优势,这与传统的人类棋理形成了鲜明对比,却同样有效。

AlphaZero的意义不仅在于技术突破,更在于它证明了"通用人工智能"的可能性。一个算法,无需修改,仅凭自我对弈,就能掌握多种不同的复杂任务。这一理念后来成为DeepMind后续研究的指导思想。

2.4 MuZero:不需要规则的智能

如果说AlphaZero是"知规则后的自我觉醒",那么2020年发表的MuZero则是"无规则世界的探索者"[4]。MuZero甚至不知道游戏规则------它通过学习一个环境模型,在脑海中"想象"动作的后果,然后基于这些想象进行规划。这一能力被称为"基于模型的强化学习"(Model-Based RL),它让AI能够在未知世界中自主探索、制定策略。

MuZero的突破具有深远的现实意义。在真实世界中,我们往往没有完整的规则手册------交通规则、社会规范、商业逻辑都需要AI自己去学习和适应。MuZero的架构为这种"开放式智能"提供了可能性。

2.5 AlphaStar:实时策略的极限挑战

2019年,AlphaStar在《星际争霸II》中达到宗师段位,应对了实时复杂性和不完全信息[6]。与围棋不同,《星际争霸II》要求AI在毫秒级的时间内做出决策,同时还要应对"战争迷雾"------即无法看到对手全部信息的不确定性。

AlphaStar的训练采用了监督学习+强化学习的混合方法:首先通过学习人类职业选手的录像获得基础策略,然后通过自我对弈进一步优化。最终的AlphaStar在表演赛中以10:1的比分战胜了人类顶级选手MaNa和TLO。这一成就不仅证明了AI在实时策略游戏中的能力,更展示了AI在多智能体、不完全信息环境中的潜力。

三、知识迁移:从虚拟世界到现实突破

3.1 AlphaFold:当游戏AI拯救生命

游戏AI研究的价值远不止于游戏本身。或许最惊艳的跨界应用是AlphaFold------它将AlphaGo中的核心技术(深度神经网络+树搜索)应用于蛋白质结构预测这一困扰学界50年的重大挑战[8]。

蛋白质是生命的基石,其功能由三维结构决定。传统方法(如X射线晶体学、核磁共振)测定一个蛋白质结构需要数月甚至数年。AlphaFold2在2020年的CASP14竞赛中将预测精度从约40分提升到92分,几乎达到了实验级精度。2021年,AlphaFold2在《Nature》发表,预测了人类蛋白质组中98.5%的结构------这相当于将数亿年的进化浓缩在了几个月的计算中。

2024年,Demis Hassabis与John Jumper因AlphaFold的贡献获得诺贝尔化学奖,这是AI历史上第一次获此殊荣。从AlphaGo到AlphaFold,DeepMind用十年时间证明了一个深刻的观点:游戏不仅是娱乐,更是科学发现的催化剂。

3.2 跨域迁移:游戏AI技术的普适性

AlphaFold只是游戏AI技术跨域应用的冰山一角。从游戏中发展出的探索策略、经验回播机制、分层强化学习架构,如今已被广泛应用于:

  • 机器人控制:OpenAI的Dactyl使用强化学习让机械手学会了玩魔方

  • 资源管理:DeepMind与Google数据中心合作,将冷却能耗降低40%

  • 自动驾驶:Waymo等公司使用模拟环境+RL训练自动驾驶策略

  • 药物发现:Insilico Medicine使用RL设计新药分子

  • 金融交易:多家对冲基金使用RL算法进行高频交易

游戏为AI提供了一个安全、可控、富有挑战性的沙盒,在这里测试的算法往往具有惊人的普适性。正如Hassabis所言:"如果你能在围棋中解决智能问题,你就能在科学中解决它。"

四、理解时代:从赢得游戏到理解世界(2018-至今)

4.1 SIMA:通用智能体的诞生

早期的游戏AI研究证明:只要目标清晰、训练充足,AI可以精通任何游戏。但真实世界没有分数和规则手册------这促使DeepMind团队提出一个根本不同的问题:AI能否像人类一样理解和与任何游戏世界交互?

这正是SIMA(Scalable Instructable Multiworld Agent,可扩展、可指导的多世界智能体)要应对的挑战[9]。SIMA是一个通用智能体,它不像传统AI那样追求最高分,而是:

  • "看见"玩家在屏幕上看到的内容(屏幕像素)

  • 理解自然语言指令(自然语言处理)

  • 通过普通的键盘鼠标进行操作(动作输出)

  • 无需API或源代码访问(黑盒交互)

这一架构的意义深远。它意味着AI不需要"内部作弊"------即通过调用游戏引擎的API获得特权信息。它必须像人类一样,仅凭视觉和操作能力来完成任务。这正是真实世界AI(如家用机器人、自动驾驶)的运作方式。

4.2 SIMA 2:实时推理与对话的伙伴

由前沿AI模型Gemini驱动的SIMA 2更进了一步[10]。它不仅能执行指令,还能进行实时推理与对话。例如,当玩家说"我们去找点金子"时,SIMA 2不仅会执行任务,还会在遇到障碍时主动询问"要不要我先去打那只怪?它可能会掉金子"。

SIMA 2在复杂的3D研究环境和包括《无人深空》、《英灵神殿》、《Hydroneer》等多款商业游戏中达到类人水平。这意味着SIMA 2不仅在受控环境中有效,还能直接"上手"真实发行的游戏------这是通用智能体的关键里程碑。

4.3 开发者价值:AI驱动的游戏新玩法

对游戏开发者来说,真正通用的游戏智能体释放出了无需修改游戏代码即可工作的AI能力。这能驱动全新的玩法:

  • AI伙伴:真正理解游戏世界的AI队友,能根据玩家风格自适应调整

  • 自适应NPC:能以脚本系统无法做到的方式回应玩家行为的NPC(Non-Player Character)

  • 程序化叙事:AI根据玩家行为动态生成故事情节,使每个玩家的体验独一无二

  • 智能教学:AI根据玩家水平动态调整难度,提供个性化的游戏引导

想象一款RPG游戏,NPC不再遵循预设脚本,而是真正"记住"玩家的选择,NPC之间的关系也会随玩家行动而动态演化。这将是游戏叙事的革命性突破。

4.4 制作革命:AI重塑游戏开发流程

通用游戏智能体也将改变游戏的制作方式:

  • 开发期QA:游戏每次提交都会变化,传统测试方法难以跟上。AI智能体能提供真正健壮的测试------它们不仅能发现边界情况,还能随着游戏的变化而进化。

  • 发布后适应性:当新内容上线或玩家行为难以预测时,AI可以实时适应,无需重新脚本化。

  • 内容生成:AI能自动生成关卡、任务、对白,降低开发成本,加速内容迭代。

这意味着小型独立工作室也能借助AI工具制作出大型3A游戏品质的体验------这将对整个行业产生深远影响。

五、共生关系:游戏开发者与AI研究者的双向价值

5.1 合作哲学:展示而非空谈

DeepMind与游戏开发者的合作遵循"展示而非空谈"的路径。团队与游戏开发者并肩工作,探索新想法,构建可玩原型,寻找"乐趣"所在。这种合作模式的核心是:重要的不是技术,而是有趣的游戏体验。

这种哲学与传统的"AI优先"路径形成鲜明对比。在传统模式中,研究者开发算法,然后寻找应用场景;而在DeepMind的模式中,游戏开发者定义问题,AI研究者提供解决方案。这种双向奔赴的合作模式,确保了AI技术真正服务于玩家体验,而非仅仅是技术展示。

5.2 Fenris Creations:EVE宇宙的二十年

我们与EVE宇宙背后的独立工作室Fenris Creations的最新研究合作,标志着DeepMind游戏AI研究史上新篇章的开启。

Fenris Creations用了二十多年时间打造了游戏史上最非凡的持久世界之一。《EVE Online》于2003年上线,是一款大型多人太空模拟游戏,数千名玩家共享一个已持续演化20多年的单一宇宙。玩家驱动的经济系统具备真实的供需动态,贸易网络横跨数千个星系;由联盟、冲突和外交塑造的版图,由人类互动驱动。

这个宇宙的独特之处在于其涌现性------20多年的玩家互动演化出了没有任何设计师能够预测的复杂社会形态。联盟政治、市场操控("收割")、间谍活动、外交博弈......这些都不是脚本写出来的,而是玩家自主创造的。

5.3 前沿能力:AI面临的终极挑战

对AI研究而言,EVE宇宙是一个黄金机会。它是一个持续演化、活生生的世界,正好要求我们认为是前沿AI所必需的核心能力:

  • 持续学习:在不断变化的世界中习得新技能,且不忘已学(解决灾难性遗忘问题)

  • 长跨度记忆:在远超当今模型上下文窗口的时间跨度上积累并检索知识(解决长期记忆问题)

  • 长期规划:在数周、数月乃至数年的时间尺度上进行推理(解决层次化规划问题)

  • 复杂多智能体动态:在规模化场景中处理合作、竞争、谈判、经济行为和涌现式社会行为(解决社会智能问题)

这些挑战正是DeepMind更大研究计划的核心------构建能够从经验中持续学习、且学习速率随时间加速的系统。

5.4 多元宇宙:EVE系列的多层次AI研究

DeepMind的研究合作延伸到Fenris Creations不断扩展的宇宙,提供截然不同的AI开发环境:

  • EVE Online:大规模单分服持久宇宙,适合研究宏观战略与经济系统

  • EVE Vanguard:第一人称视角,将地面级、快节奏的战术决策带入更广阔的持久世界(适合研究实时战术)

  • EVE Frontier:拥有可编程的"智能组件"和开放可扩展的架构,提供了一个开放式的环境,在那里世界本身的规则都可以被改变(适合研究元学习与规则推理)

这带来了在不同抽象层次上研究智能体的机会------从毫秒级战术到星系级战略。这种多层次研究架构是前所未有的。

5.5 Aura Guidance:AI助人的第一个果实

DeepMind与Fenris Creations的合作已为玩家带来真实价值:Aura Guidance系统使用Gemini,根据真实的新手互助问答内容,向新飞行员传递玩家生成的知识。

这个系统的巧妙之处在于:它不是"AI教你玩",而是"老玩家帮你学"。Aura Guidance从论坛、Discord聊天、新手问答中提取真实的人类知识,然后用Gemini的语言能力进行组织和呈现。这保留了玩家社区的"人情味",同时借助AI的规模化能力让每个新手都能获得个性化指导。

5.6 路径规划:从沙盒到生产的严谨研究

DeepMind的长期研究项目从EVE Online的离线实例起步------这是一个与真实玩家隔离的安全沙盒;之后进入EVE Frontier,研究人类与智能体如何在持久、开放的世界中共存。只有当能力足够成熟时,才会考虑将它们带入EVE Online与EVE Vanguard,目标是丰富人类玩家的体验。

这种"沙盒→试点→生产"的路径体现了DeepMind对负责任AI开发的承诺。游戏AI研究的最大风险是破坏玩家体验,因此研究必须循序渐进,确保AI行为符合玩家社区的价值观。

六、合作网络:DeepMind的游戏开发者伙伴

DeepMind的游戏AI研究是众多工作室共同努力的成果。除了Fenris Creations,还有:

  • Coffee Stain Studios:《英灵神殿》《幸福工厂》《山羊模拟器3》------沙盒生存与建造类游戏的代表

  • Foulball Hangover:《Hydroneer》------物理驱动的工程建造游戏,AI需要理解流体动力学

  • Hello Games:《无人深空》------程序化生成宇宙,AI需要处理近乎无限的探索空间

  • Keen Software House:《太空工程师》------工程建造游戏,AI需要理解物理模拟

  • RubberbandGames:《Wobbly Life》------物理沙盒游戏,AI需要处理非刚性物理

  • Strange Loop Games:《Eco》------生态系统模拟,AI需要理解复杂系统涌现

  • Thunderful Games:《ASKA》《The Gunk》《Steamworld Build》------多种类型的独立游戏

  • Digixart:《Road 96》------叙事驱动冒险,AI需要处理情感与叙事

  • Tuxedo Labs与Saber Interactive:《Teardown》------完全可破坏的物理世界

这种合作网络的广度令人印象深刻。从沙盒建造到太空模拟,从物理引擎到生态模拟,DeepMind的合作伙伴涵盖了几乎所有游戏类型。这种多样性确保了AI研究成果的普适性------如果一个算法能在多种类型游戏中工作,它就更有可能迁移到真实世界。

七、展望:共同前行的道路

7.1 游戏的智识之镜

游戏一直是智识的一面镜子。当它们变得更加复杂、更具持久性、更加开放,我们为驾驭它们而构建的AI系统也将如此。

这一观点揭示了游戏AI研究的深层价值:游戏不仅是测试算法的工具,更是理解智能本质的媒介。当我们在游戏中构建能够学习、规划、协作的AI时,我们实际上在回答一个根本问题------智能是什么?它如何从简单的规则中涌现?它如何与环境和他人互动?

7.2 AI是催化剂而非替代者

DeepMind追求的目标一如既往:AI是催化剂,而非替代者。长期愿景是解锁突破性的游戏体验,让游戏更具可及性和个性化------并像从AlphaGo到AlphaFold所证明的那样,将从游戏中习得的知识应用于真实世界的问题,推进科学发现。

这一立场体现了DeepMind的人文关怀。在AI技术飞速发展的今天,"AI取代人类"的担忧从未消失。但DeepMind的实践表明:AI的最佳角色是增强人类能力,而非取代人类。在游戏中,AI可以创造更丰富的世界、提供更个性化的体验;在科学中,AI可以加速发现、解决复杂问题。

7.3 未来的研究方向

展望未来,DeepMind的游戏AI研究将聚焦于以下几个方向:

  1. 真正的开放式学习:AI不仅能在单一游戏中学习,还能在多个游戏间迁移知识,甚至发明新策略

  2. 社会智能:AI不仅能与人类协作,还能理解社会规范、道德准则、文化差异

  3. 创造性表达:AI不仅能玩游戏,还能设计游戏、创作故事、生成艺术

  4. 长期智能体:AI能在数年时间尺度上规划行动,实现真正的"长期思维"

  5. 负责任的部署:确保AI行为符合玩家社区的价值观,避免破坏游戏生态

这些方向不仅是技术挑战,更是哲学问题。它们要求我们重新思考智能的本质、创造的意义、以及人机协作的未来。

八、结语:智识冒险的新篇章

我们感谢一路同行的所有游戏合作伙伴,也感谢Fenris Creations加入DeepMind开启这一新篇章。DeepMind迫不及待想分享研究发现。

6 Vinyals, O., et al. (2019). Grandmaster level in StarCraft II using multi-agent reinforcement learning. *Nature*, 575(7782), 350-354. https://www.nature.com/articles/s41586-019-1724-z

7 Berner, C., et al. (2019). Dota 2 with Large Scale Deep Reinforcement Learning. *arXiv preprint*.

8 Jumper, J., et al. (2021). Highly accurate protein structure prediction with AlphaFold. *Nature*, 596(7873), 583-589.

9 DeepMind. (2024). SIMA: Scaling Up Open-Ended Embodied Agents in Virtual Worlds. DeepMind Blog.

10 DeepMind. (2026). SIMA 2: An agent that plays, reasons and learns with you in virtual 3D worlds. DeepMind Blog, August 21.

11 Ecoh, E., et al. (2025). Continual Learning in Deep Neural Networks: A Comprehensive Survey. *Journal of Machine Learning Research*.

12 Silver, D., & Hassabis, D. (2024). The Future of AI: From Game-Playing to Problem-Solving. *Annual Review of Control, Robotics, and Autonomous Systems*.

13 Fenris Creations. (2026). Aura Guidance system for EVE Online. https://www.eveonline.com/news/view/eve-evolved-aura-guidance

14 AlphaFold: A solution to a 50-year-old grand challenge in biology. (2020). DeepMind Blog.

附录:关键里程碑时间线

时间 | 里程碑 | 意义

2013 | DQN初版发布 | 深度强化学习奠基

2015 | DQN论文在Nature发表 | 49款Atari游戏达人类水平

2016 | AlphaGo战胜李世石 | 攻克围棋,智识里程碑

2017 | AlphaGo Zero发布 | 纯自我对弈超越人类知识

2017 | AlphaZero统一三种棋类 | 通用算法证明

2019 | AlphaStar宗师段位 | 实时策略游戏突破

2020 | AlphaFold2预测蛋白质结构 | AI解决50年科学难题

2020 | MuZero无需规则学习 | 基于模型的RL突破

2024 | AlphaFold获诺贝尔化学奖 | AI首次获诺贝尔奖

从2013年的Atari到2026年的EVE Online,从DQN到SIMA 2,从AlphaGo到AlphaFold------这不仅是一段技术演进史,更是一段智识冒险史。在这段旅程中,游戏始终是DeepMind的"指南针":它指引研究方向、定义问题边界、提供评估基准。

当我们回顾这十五年时,我们看到的不仅是一个个AI里程碑,更是一个不断深化的认识:智能不是单一的能力,而是多种能力的综合------感知、推理、学习、规划、协作、创造。游戏以其独特的复杂性,成为了培育这种综合智能的最佳土壤。

在未来的岁月里,DeepMind将继续与游戏开发者合作,共同探索AI与游戏的边界。因为我们知道:游戏是智识的镜子,而我们正在镜中看见智能本身的轮廓。

参考文献

1 Mnih, V., et al. (2015). Human-level control through deep reinforcement learning. *Nature*, 518(7540), 529-533. https://www.nature.com/articles/nature14236

2 Silver, D., et al. (2016). Mastering the game of Go with deep neural networks and tree search. *Nature*, 529(7587), 484-489.

3 Silver, D., et al. (2017). Mastering the game of Go without human knowledge. *Nature*, 550(7676), 354-359. https://www.nature.com/articles/nature24270

4 Schrittwieser, J., et al. (2020). Mastering Atari, Go, chess and shogi by planning with a learned model. *Nature*, 588(7839), 604-609. https://www.nature.com/articles/s41586-020-03051-4

5 Silver, D., et al. (2017). A general reinforcement learning algorithm that masters chess, shogi and Go through self-play. *Science*, 358(6364), 1159-1164.

2024 | SIMA发布 | 通用游戏智能体诞生

2026 | SIMA 2实时推理对话 | 交互式AI伙伴

2026 | DeepMind-Fenris合作开启 | EVE宇宙AI研究新篇章


相关推荐
中科同志科技1 小时前
元器件拆焊真空焊接设备深度解读:工艺流程与优化策略
大数据·人工智能·机器人·汽车
zww89491111 小时前
AI导购线上商城搭建实战:从系统架构到部署全流程指南
人工智能·系统架构
发量惊人的中年网工1 小时前
游戏开服就被DDoS攻击怎么办?开服7分钟服务器被打穿的复盘与防护清单
运维·服务器·网络·安全·游戏
空堂与归1 小时前
英伟达AI服务器涨价超15%:HBM存储成本飙升,AI算力经济重构开始
服务器·人工智能·重构·英伟达
IT_陈寒1 小时前
Python多进程池的坑:子进程竟然不会退出
前端·人工智能·后端
苏子寒1 小时前
Nano-VLLM全代码解析笔记(2)-block_manager
人工智能·笔记·python·机器学习·nlp·vllm
皮卡丘不断更1 小时前
Vibe Coding 有了接口原型后:用智能体做一份联调差异单
软件工程·智能体·vibe coding·接口联调
大鹏说大话1 小时前
用 Semantic Kernel 在 .NET 中构建你的第一个 AI 智能体(Agent)
人工智能·.net
EterNity_TiMe_1 小时前
一个网页管理多种远程连接:Docker 部署 Next Terminal 与资产审计
运维·人工智能·docker·ai·容器