全球首款原生全模态交互式世界模型来了,AI 视频终于能“玩”了

这是苍何的第 580 篇原创!

大家好,我是苍何。

判断一段 AI 生成内容究竟是一段视频,还是一个真正的世界,可以试试一个最简单的动作:转身。

沿着街道向前走,拐过一个路口,再回到原地,刚才的建筑还在吗?

推开桌上的杯子,它会按照真实的方向倒下吗?

镜头从第一人称切换到第三人称,人物、空间和光影还能保持一致吗?

这些听起来很自然的事情,对今天的 AI 视频模型来说,却都很难。

过去两年,AI 视频一直在卷画质、时长和运镜。但无论画面多逼真,只要用户无法进入、无法控制,场景也记不住刚才发生了什么,它本质上仍然只是一段被提前生成好的内容。

现在,AI 视频正在跨过一条新的分界线:从生成画面,走向生成世界。

8 月 17 日,智象未来发布了 HiDream-O1-World,并将它定位为全球首款原生全模态交互式世界模型。

它把目标推进了一步:生成一个可以自由探索、持续交互,并且遵循一定物理规律的动态世界。

当观众走进画面

HiDream-O1-World 提供了漫游、编辑和交互三类核心能力。

在漫游状态下,用户可以通过屏幕上的移动按钮控制角色前进、后退和转向,也可以在第一人称与第三人称视角之间切换。

第一人称更像是整个人进入了场景。你可以转头、环顾、仰视和俯察,画面会跟随视角实时变化;第三人称则更接近游戏,可以同时观察角色动作和周围环境。

这件事表面看只是"让画面动起来",背后的难度却比生成一条普通视频高得多。

普通视频只需要保证前后几秒看起来连贯,但可交互世界必须记住整个场景:一棵树原来在哪里,一栋建筑是什么结构,角色刚才走过哪条路,视线之外的物体是否还存在。

否则用户走几步、转个身,整个世界就会偷偷刷新。房子变了,物体消失了,角色也可能突然换了一张脸。

这也是很多生成式场景最容易出现的"越玩越崩"。

HiDream-O1-World 还提供了编辑能力。用户可以通过文字、语音或图片下达指令,让角色完成抓取、奔跑、下蹲、跳跃等动作,也可以驾驶载具,或者触发近战、射击等更复杂的交互。

按照官方介绍,模型支持长时视频的连续生成,并能保持音视频同步。这意味着用户的多次操作可以被串联成一段持续发展的体验,各个片段之间也能保持连贯。

换句话说,你的选择可以直接改变角色行为和故事走向,体验也由此摆脱了模型提前安排好的固定路线。

比如当在角色前进时,打下文字"神兽出现",在前面就会很自然的出现了神兽。

角色在飞行过程中,可以改变前方的实时环境:

讲真,这个万物生长这一段,极其丝滑,你丝毫不会怀疑这是由模型本身生成的。

还可以一句话把船变成茶杯,把树变成糖果,把水变成红茶,几乎没有延迟,很自然。

让你看看,雨过天晴的感觉。

还有这个用 HiDream-O 1-World 做的也非常的逼真,结果实时能呈现。

过去所谓的互动内容,很多时候仍然是几个固定分支之间的选择。你选择 A,就播放 A 视频;选择 B,就播放 B 视频。

世界模型会根据用户此刻的输入,继续生成接下来发生的事情,每一种结果都可以在交互过程中实时出现。

用户因此从观众变成了参与者,甚至同时成为这个世界的导演。

一个世界,首先必须有记忆

要实现这种体验,需要先解决两个基础问题:时空一致性和物理一致性。 单帧画面的精致,只是起点。

所谓时空一致性,是指无论用户怎样移动视角、切换镜头或重新回到原来的位置,场景的空间关系都不能突然改变。

所谓物理一致性,则是角色与物体的运动、碰撞、重力、形变和光影变化,需要符合人对现实世界的基本认知。

在 HiDream-O1-World 之前,智象未来已经围绕空间一致性展开了长期研究。

其发表的论文《DreamWorld:Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling》已被 ECCV 2026 录用。论文聚焦一个很具体的问题:给定一张图片和一条相机运动轨迹,模型如何在大幅改变视角后,继续生成结构稳定的新画面。

ECCV 2026(欧洲计算机视觉国际会议):与 CVPR和ICCV齐名,是全球计算机视觉与人工智能领域的三大顶级学术会议之一,每两年举行一届。

常见的相机控制视频模型会把相机参数或点云投影作为生成条件,剩余的空间结构交给视频模型自行推断。当镜头转向原图没有展示过的区域,模型很容易生成扭曲的物体和互相冲突的空间关系。

DreamWorld 把三维几何特征放到了生成流程的中间位置。模型先借助 3D Foundation Model 推演目标视角下的空间结构,再根据几何特征合成最终画面。

DreamWorld 技术路线:先生成目标视角的几何结构,再完成画面合成

这套 Geometry-then-Appearance 流程把空间推理和视觉生成拆成两个阶段。前一个阶段专注结构补全、跨视角一致性和相机轨迹,后一个阶段负责纹理、细节与真实感。

从论文给出的案例可以看到,直接使用投影结果时,灯具、桌椅等物体容易发生形变;加入几何先验后,新视角里的物体轮廓和空间关系更加稳定。

红框区域展示了投影伪影和物体形变,最右侧为 DreamWorld 的生成结果

DreamWorld 在 RealEstate10K、Tanks-and-Temples 和 WorldScore 等基准上取得了领先结果。这项研究聚焦相机控制下的新视角生成,HiDream-O1-World 则覆盖漫游、编辑和交互等完整能力。两项工作分属不同层面,共同指向一个基础目标:让场景在镜头运动和持续交互中保持稳定。

按照智象未来披露的信息,HiDream-O1-World 引入了 "3D 先验注入 Memory 上下文"与 TTT 两套机制,让模型持续"记住"眼前的世界。

"3D 先验注入 Memory 上下文"负责保存场景中的几何结构、空间坐标和物体关系。可以把它理解成模型在生成画面的同时,也在脑海中维护着一张持续更新的空间地图。

TTT,也就是 Test-Time Training,则负责在推理过程中根据当前的相机轨迹和场景状态进行动态适配。每一次移动和视角切换,模型都会重新校正自己对这个世界的理解。

简单来说,Memory 负责记住这个世界,TTT 负责在变化中不断校准这个世界。

两者共同解决的,是世界模型最关键的持久性问题:人走了,世界不会刷新;镜头转回去,场景也不会被重新发明一遍。

在物理一致性上,智象未来还加入了大量碰撞、流体、柔性形变、重力抛射等高难度训练数据,让模型学习不同物体之间的运动与因果关系。

它需要让每个动作发生以后,后续变化依然合理。单帧的真实感,也要延伸到连续的因果关系中。

这也是视频生成模型与世界模型之间一个非常重要的区别:视频关心下一帧像不像,世界模型还要关心下一步对不对。

第三方榜单第一,意味着什么?

除了演示效果,HiDream-O1-World 也参加了美团 LongCat 团队与复旦大学推出的交互式世界模型评测基准 WBench。

WBench 一共包含 289 个测试案例、1058 轮交互和 22 项细分指标,从视频质量、设定遵循、交互能力、一致性和物理合理性五个维度,对模型进行综合评估。

在最新公开榜单中,HiDream-O1-World 的综合得分为 80.9 分,位列第一 ;其中物理维度为 73.3 分,同样排名第一 ,一致性维度达到 88.0 分

WBench 最新榜单:HiDream-O1-World 综合得分与物理维度均排名第一

这个结果超过了腾讯混元 HY-World 1.5、阿里 Happy Oyster 等模型。更值得关注的是,WBench 的评测范围已经从画面质量延伸到操作响应、空间维持和后续变化的合理性。

当然,一次评测并不能证明模型已经真正理解了完整的物理世界,但它至少说明,交互式生成正在从主观 Demo,逐步走向可以量化比较的阶段。

当视频变成世界,内容行业会发生什么?

世界模型最直接的落地方向,是互动影游。

传统影视内容是线性的,创作者决定开始和结局;传统游戏虽然可以交互,却需要提前制作大量场景、角色、动作和剧情分支。

如果世界能够被实时生成,这两种内容形态之间的边界就会开始模糊。

未来,一部电影也许会拥有持续生长的剧情。观众可以走进场景,与角色交谈,改变某个关键事件,并看到一个从未被编剧提前写下的结局。

对于创作者来说,它也可能改变内容生产方式。过去需要建模、贴图、绑定、动画和渲染才能完成的场景,未来或许可以先通过一句话生成,再通过自然语言不断修改。

另一个更具产业价值的方向,是具身智能仿真。

机器人和自动驾驶系统需要在大量不同环境中训练,但真实世界的数据采集成本高、速度慢,一些危险和极端场景也很难反复复现。

如果世界模型能够快速生成具有空间与物理一致性的城市、工厂和室内环境,就能为机器人提供一个可反复试错的虚拟训练场。

智象未来此前已经与诺亦腾机器人展开合作:由诺亦腾提供真实的人体动作数据,再通过生成模型扩展不同人物、环境与视觉条件,在保留动作信息的同时放大数据规模。

世界模型的长远价值也在这里:既服务人的观看与创作,也能成为机器学习如何行动的数据基础设施。

从 Model the World 到 Mold the World

过去的大语言模型,以文字 Token 为基础理解和压缩人类知识;图像与视频模型,则主要学习视觉世界的分布。

真实世界始终由多种模态共同构成。

它同时包含图像、声音、动作、空间、时间、触觉和因果关系。想让 AI 真正理解并参与这个世界,仅仅把不同模型连接在一起可能还不够。

HiDream-O1-World 背后的 UiT 原生全模态架构,尝试从底层把图像像素、文本 Token、视频、音频、动作和空间关系映射到同一个共享 Token 空间,再交给同一套 Unified Transformer 进行理解、生成和推理。

这条路线强调的核心,是"统一"。

图像、文本、动作和声音从一开始就在同一套表征系统里共同训练、相互影响。

智象未来创始人梅涛曾用两个词概括自己对世界模型的判断。过去人们谈论 Model the World ,让 AI 表达和理解世界。在他看来,世界模型还应该走向 Mold the World,让 AI 推演、构造乃至重塑世界。

从这个角度看,HiDream-O1-World 展示了视频生成之外的更大目标。

它代表着一次方向上的变化:AI 开始尝试建立一个能够被持续探索、实时干预的世界。

当然,今天的世界模型距离真正稳定、开放且可长期运行的数字世界,还有很长的路要走。连续生成和当前的榜单成绩,共同构成了这一阶段的起点。

但当画面开始拥有记忆,角色开始响应行动,场景开始遵循因果,视频和世界之间的那条边界,已经变得越来越模糊。

当观看变成进入,AI 生成内容也就拥有了通往"世界"的入口。

相关推荐
一只叫煤球的猫1 小时前
Spring AI 2.0 源码解析(一):一次 ChatClient 调用到底经历了什么?
后端·面试·ai编程
andongni2031 小时前
后端参数校验
spring boot·后端·mybatis
颜进强1 小时前
06 - OpenSpec change 从模糊想法到完整契约:new change / explore / propose 三连
前端·后端·ai编程
Cache技术分享1 小时前
499. Java 反射 - 获取类型上的注解
前端·后端
用户69371750013841 小时前
9531 款 AI 工具流量真相:当 90% 的访问涌向 100 个平台,普通创业者还有机会吗?
前端·后端
颜进强1 小时前
07 - OpenSpec change 修正带与照单施工:update 修订 + apply 实现
前端·后端·ai编程
Scene2161 小时前
线程调度与 Schedulers:Project Reactor 并发模型的核心引擎
后端
ClouGence1 小时前
当 AI 开始直接操作数据库,传统数据库管理工具还有必要吗?
数据库·后端·agent
lazy H2 小时前
不同的消息队列有什么区别?Kafka、RabbitMQ、RocketMQ、Pulsar、ActiveMQ 选型对比
后端·中间件·kafka·rabbitmq·rocketmq