DeepMind基础世界模型Genie：一张草图即为一个世界，通用AI智能体要来了？

学术头条2024-02-26 19:50

一张草图即为一个世界！Google DeepMind 推出了首个以无监督方式从未经标注的互联网视频中训练而来的生成交互环境模型------Genie。该模型可以通过文本、合成图像、照片甚至草图来生成无数种可玩（动作可控）的虚拟世界。

据介绍，Genie 它由一个时空视频 tokenizer、一个自回归动力学模型和一个简单且可扩展的潜在行动模型组成，具有 11 B 参数，可以用它从未见过的图像（如现实世界的照片或草图）进行提示，使人们能够与自己想象中的虚拟世界进行互动------本质上就是充当一个基础世界模型。

另外，Genie 的独特之处在于它可以完全通过网络视频学习精细控制。这是一项挑战，因为互联网视频通常没有关于正在执行的动作的标签，甚至没有关于应该控制图像哪个部分的标签。值得注意的是，Genie 不仅能了解观察对象的哪些部分通常是可控的，还能推断出在生成环境中一致的各种潜在动作。

研究团队表示，Genie 的出现，有助于加速通用智能体的到来。以往的研究表明，游戏环境可以成为开发智能体的有效试验平台，但往往受到可用游戏数量的限制。有了 Genie，未来的智能体就可以在永无止境的新生成世界中接受训练。

此外，Genie 被认为是一种通用方法，可应用于多个领域，无需任何额外的领域知识。