DeepMind基础世界模型Genie:一张草图即为一个世界,通用AI智能体要来了?

一张草图即为一个世界!Google DeepMind 推出了首个以无监督方式从未经标注的互联网视频中训练而来的生成交互环境模型------Genie。该模型可以通过文本、合成图像、照片甚至草图来生成无数种可玩(动作可控)的虚拟世界。















据介绍,Genie 它由一个时空视频 tokenizer、一个自回归动力学模型和一个简单且可扩展的潜在行动模型组成,具有 11 B 参数,可以用它从未见过的图像(如现实世界的照片或草图)进行提示,使人们能够与自己想象中的虚拟世界进行互动------本质上就是充当一个基础世界模型。

另外,Genie 的独特之处在于它可以完全通过网络视频学习精细控制。这是一项挑战,因为互联网视频通常没有关于正在执行的动作的标签,甚至没有关于应该控制图像哪个部分的标签。值得注意的是,Genie 不仅能了解观察对象的哪些部分通常是可控的,还能推断出在生成环境中一致的各种潜在动作。

研究团队表示,Genie 的出现,有助于加速通用智能体的到来。以往的研究表明,游戏环境可以成为开发智能体的有效试验平台,但往往受到可用游戏数量的限制。有了 Genie,未来的智能体就可以在永无止境的新生成世界中接受训练。

此外,Genie 被认为是一种通用方法,可应用于多个领域,无需任何额外的领域知识。

论文链接:https://arxiv.org/abs/2402.15391

项目链接:https://sites.google.com/view/genie-2024/

相关推荐
ting945200043 分钟前
Humalike X Hermes 深度技术剖析:单指令注入群聊社交智能的底层架构、算法与跨 IM 平台实现
人工智能·算法·架构
涤生大数据1 小时前
一次“没有运行日志”的DolphinScheduler任务失败排查
大数据·数据库·人工智能·状态模式
东风破_1 小时前
Vibe Coding 上头之后,我开始用 SDD 给 AI 编程加一张“施工图”
人工智能·程序员
weixin_403810131 小时前
AI智能体写安卓自动化脚本教程:Cursor/Trae+CLI 实战,自然语言生成代码
android·人工智能·自动化·跨境电商·安卓自动化脚本·多账户运营
深圳雨林凯AI2 小时前
雨林凯AI四方连图介质适配原理:像素密度、纱线纹理与颜色管理怎么协调
人工智能
ZGIAI2 小时前
ZGI 混合检索:汇集候选并统一重排
人工智能·架构
ZGIAI2 小时前
ZGI 运行日志:还原任务与节点状态
人工智能·架构
Scott9999HH2 小时前
2026 中小企业如何破局 AI 搜索?轻量化 GEO 优化系统架构设计与 Python 实战落地
人工智能
玩转单片机与嵌入式2 小时前
深入浅出TinyML 16:FFT、频带能量和MFCC分别适合什么任务?
stm32·深度学习·tinyml
甲维斯2 小时前
opencode的“恶果”来了,吃掉100G空间!
人工智能