DeepMind基础世界模型Genie:一张草图即为一个世界,通用AI智能体要来了?

一张草图即为一个世界!Google DeepMind 推出了首个以无监督方式从未经标注的互联网视频中训练而来的生成交互环境模型------Genie。该模型可以通过文本、合成图像、照片甚至草图来生成无数种可玩(动作可控)的虚拟世界。















据介绍,Genie 它由一个时空视频 tokenizer、一个自回归动力学模型和一个简单且可扩展的潜在行动模型组成,具有 11 B 参数,可以用它从未见过的图像(如现实世界的照片或草图)进行提示,使人们能够与自己想象中的虚拟世界进行互动------本质上就是充当一个基础世界模型。

另外,Genie 的独特之处在于它可以完全通过网络视频学习精细控制。这是一项挑战,因为互联网视频通常没有关于正在执行的动作的标签,甚至没有关于应该控制图像哪个部分的标签。值得注意的是,Genie 不仅能了解观察对象的哪些部分通常是可控的,还能推断出在生成环境中一致的各种潜在动作。

研究团队表示,Genie 的出现,有助于加速通用智能体的到来。以往的研究表明,游戏环境可以成为开发智能体的有效试验平台,但往往受到可用游戏数量的限制。有了 Genie,未来的智能体就可以在永无止境的新生成世界中接受训练。

此外,Genie 被认为是一种通用方法,可应用于多个领域,无需任何额外的领域知识。

论文链接:https://arxiv.org/abs/2402.15391

项目链接:https://sites.google.com/view/genie-2024/

相关推荐
chatexcel14 分钟前
元空AI+Clawdbot:7×24 AI办公智能体新形态详解(长期上下文/自动化任务/工具粘合)
运维·人工智能·自动化
All The Way North-16 分钟前
彻底掌握 RNN(实战):PyTorch API 详解、多层RNN、参数解析与输入机制
pytorch·rnn·深度学习·循环神经网络·参数详解·api详解
bylander29 分钟前
【AI学习】TM Forum《Autonomous Networks Implementation Guide》快速理解
人工智能·学习·智能体·自动驾驶网络
Techblog of HaoWANG1 小时前
目标检测与跟踪 (8)- 机器人视觉窄带线激光缝隙检测系统开发
人工智能·opencv·目标检测·机器人·视觉检测·控制
laplace01231 小时前
Claude Skills 笔记整理
人工智能·笔记·agent·rag·skills
2501_941418551 小时前
【计算机视觉】基于YOLO11-P6的保龄球检测与识别系统
人工智能·计算机视觉
码农三叔1 小时前
(8-3)传感器系统与信息获取:多传感器同步与传输
人工智能·机器人·人形机器人
人工小情绪1 小时前
Clawbot (OpenClaw)简介
人工智能
童话名剑2 小时前
情感分类与词嵌入除偏(吴恩达深度学习笔记)
笔记·深度学习·分类
2501_933329552 小时前
品牌公关AI化实践:Infoseek舆情系统技术架构解析
人工智能·自然语言处理