DeepMind基础世界模型Genie:一张草图即为一个世界,通用AI智能体要来了?

一张草图即为一个世界!Google DeepMind 推出了首个以无监督方式从未经标注的互联网视频中训练而来的生成交互环境模型------Genie。该模型可以通过文本、合成图像、照片甚至草图来生成无数种可玩(动作可控)的虚拟世界。















据介绍,Genie 它由一个时空视频 tokenizer、一个自回归动力学模型和一个简单且可扩展的潜在行动模型组成,具有 11 B 参数,可以用它从未见过的图像(如现实世界的照片或草图)进行提示,使人们能够与自己想象中的虚拟世界进行互动------本质上就是充当一个基础世界模型。

另外,Genie 的独特之处在于它可以完全通过网络视频学习精细控制。这是一项挑战,因为互联网视频通常没有关于正在执行的动作的标签,甚至没有关于应该控制图像哪个部分的标签。值得注意的是,Genie 不仅能了解观察对象的哪些部分通常是可控的,还能推断出在生成环境中一致的各种潜在动作。

研究团队表示,Genie 的出现,有助于加速通用智能体的到来。以往的研究表明,游戏环境可以成为开发智能体的有效试验平台,但往往受到可用游戏数量的限制。有了 Genie,未来的智能体就可以在永无止境的新生成世界中接受训练。

此外,Genie 被认为是一种通用方法,可应用于多个领域,无需任何额外的领域知识。

论文链接:https://arxiv.org/abs/2402.15391

项目链接:https://sites.google.com/view/genie-2024/

相关推荐
AI码农小姐姐11 分钟前
AI漫剧推文短视频动态镜头实现:FFmpeg zoompan 与 Ken Burns 效果实践
人工智能·音视频·ai工具·ai漫剧
技灵AI18 分钟前
ChatGPT Images 2.5 深度解读:延迟减半、Sketch 草图与 Flare/Sunburst 双模型 API
人工智能·gpt·aigc·音视频·images2.5
Geek-Chow21 分钟前
12. 完整重演:一句话请求的完整旅程 + 动手练习
人工智能
m0_7345717621 分钟前
深入理解人工智能chatGPT 外部工具与知识增强层 (Tools & RAG Layer)
人工智能·chatgpt
智能运维指南23 分钟前
2026年企业自动化运维平台选型:四类架构的差异与决策逻辑
运维·人工智能·嘉为蓝鲸
user_admin_god24 分钟前
第 01 篇:OpenAI 兼容 API 初探 —— 用 curl 跑通第一次对话
java·人工智能·spring boot·语言模型·devops
梦帮科技25 分钟前
RNS 代币架构:ERC20 五件套扩展与六钱包分配
人工智能·sql·区块链·database·合成复用原则·加密货币
林澈在路上32 分钟前
游戏场景背景音乐定制AI软件哪款好 2026对比推荐
大数据·人工智能·aigc·音视频
宁渡AI大模型1 小时前
AI 全栈面试新趋势:Vibe Coding、前端、Java 后端高频面试题深度解析|河南宁渡科技有限公司编程教程
java·javascript·人工智能·python·ai大模型
AI码农小姐姐1 小时前
AI漫剧推文短视频自动化生产:从文本分镜到视频合成的工程实现
人工智能·音视频·ai工具·ai漫剧·知漫剧