原来世界模型,已经能边玩边生成了

这是苍何的第 584 篇原创!

大家好,我是苍何。

兄弟们,最近我连续看了几段爱诗科技旗下 PixVerse R2 的视频,有个感觉特别强烈:这玩意儿已经很难用单一品类来概括了。

第一段,是空间体验。

人在一个修仙世界里,可以通过 WASD 控制移动,再用方向键调整镜头。每一次操作都会成为新的输入,眼前的场景也会跟着继续生成。

第二段,是互动影游。

故事已经开始,用户可以通过选择、文字或语音参与其中。角色接下来做什么,镜头如何演出,局部剧情往哪里发展,都会受到输入影响。

第三段,是数字人。

直播带货、三星堆等场景里,数字人可以持续接收提示词输入,结合人设和上下文做出回应。语音、表情、神态和动作被放进同一段实时表演中,交流过程也更接近一个持续存在的角色。

把这几段视频摆在一起看,会发现它们很像三类完全不同的产品:一个像游戏,一个像互动电影,一个像可以随时交流的虚拟角色。

它们的底层却来自同一个实时世界模型。

更准确地说,是同一套实时世界模型提供生成底座,Director Agent 负责理解意图和组织演出,Runtime 负责管理持续变化的内容状态。

一个模型,开始撑起空间、故事和角色三种玩法。

一个世界持续运行,有多难?

过去生成一段内容,任务结束于成片交付。

实时世界模型面对的是另一种工作方式:内容始终在运行,用户随时可能按下一个方向键、说一句话、换一个目标,模型需要立刻接住这次变化,再继续生成后面的世界。

生成下一段只是起点。

真正麻烦的地方,在于连续经历多次操作以后,场景、角色、运动和上下文还能不能保持稳定。

比如用户刚刚经过一座建筑,转动视角后,这座建筑的位置和形态需要延续;角色上一轮做了一个动作,下一轮的姿态需要自然衔接;故事里刚刚发生的事件,也应该继续影响后面的演出。

每一次生成还会成为下一次生成的历史。一个很小的偏差写入历史后,可能沿着后续内容不断放大,最后出现人物变脸、场景突变、亮度漂移、动作断裂等问题。

视频生成关心下一段看起来是否自然,持续运行的世界还要关心每一次变化能否接得住。

R1 做成全球首个,R2 开始解决 Scaling

2026 年 1 月,爱诗科技发布 PixVerse R1。根据 PixVerse 官方发布信息,R1 是全球首个实时世界模型,也是行业第一次把连续、可交互的 1080P AI 视频生成,以及对用户输入的即时响应,放进同一套实时系统。

这一定位也有一线媒体的外部报道作背书:36氪称其为全球首个支持最高 1080P 分辨率的通用实时世界模型;新华网则指出,R1 首次将视频生成延迟降至"即时"响应,推动 AIGC 视频从静态输出迈入实时交互的新阶段。

这不是简单地把一段视频生成得更快,而是第一次让视频从"生成后播放",走向"边生成、边交互、边延续"的实时世界。

到了 4 月,R1 又完成了一次行业首次:用户第一次可以用个性化 Avatar 进入 AI 生成世界,与其他人实时共同探索、共同影响世界走向。7 月发布的 PixVerse Game Engine,则进一步把实时世界模型、AI Agent 和结构化游戏机制连接起来。

这一连串更新证明了实时生成世界的技术路线能够跑通。

R2 更关键的变化,是让一次输入进入正在运行的内容状态:它会继续影响剧情分支、角色记忆、任务进度、结果反馈和关系变化。

接下来还要回答一个更难的问题:当模型规模、训练数据、交互任务、控制信号和运行时间继续增长,已有能力如何一起增长?

过去的长视频和实时生成框架,往往依赖一条很长的训练流水线。

双向基础模型先转成自回归模型,再构造面向具体任务的蒸馏 Teacher,接着进行 DMD 蒸馏,后面还要加入带 Self-Rollout 的训练,继续修正训练和推理之间的差异。

流程每多一个阶段,就会多一次能力迁移和目标对齐。上游积累的画面、运动、条件遵循和长程稳定能力,也可能在迁移中产生折损。

图 1:R2 将原先的多阶段训练流水线收敛为 Omni Causal AR 与 Real-Time Acceleration 两个核心过程。(来源:PixVerse R2 技术报告)

PixVerse R2 把这条长流水线收敛成两个核心过程。

第一步,持续预训练统一的 Omni Causal AR,让模型在同一个体系里吸收更多数据、任务、模态和长时间交互轨迹。

第二步,通过 Real-Time Acceleration,直接把已经形成的世界建模能力加速到低延迟的实时运行区间。

同一个 Omni Causal AR 同时承担 Student ODE 的初始化和蒸馏 Teacher,Teacher、Student 与真实的自回归推理共享同一套因果建模基础。

它会把完整时空建模获得的生成先验,转化为沿时间单向推进的世界状态变化。Text、Reference、Audio 与 Action,也由此成为持续推动世界演化的因果信号。

少了反复搬运,新增能力可以沿着同一条训练路径继续积累。

这也是 R2 所说的 Scaling:世界模型从"能不能做",开始走向"能不能持续做大"。

一个模型,怎么接住不同玩法?

空间探索、互动影游和数字人,表面上差别很大,底层输入的节奏也完全不同。

按一次 WASD,需要模型马上反馈移动结果;一句 Prompt 可能描述一个完整事件;一段语音同时包含语义、情绪、节奏和时间信息;参考图片还要约束角色或场景的视觉状态。

如果把这些信号全部塞进固定长度的时间单元,响应速度和表达完整度很容易互相牵制。

R2 引入了 Dynamic Chunk

模型会根据控制信号的语义边界和持续时间,自适应地切分音视频序列。短 Chunk 用来接住动作和局部指令,长 Chunk 用来保留事件、运动和音视频语义的完整结构。

简单理解,用户按下一个方向键,系统就用更细的时间颗粒快速响应;用户给出一段复杂的剧情指令,系统会留出更完整的生成空间。

Text、Reference、Audio 和 Action 因此能够进入同一套因果生成接口,持续改变下一段世界状态。

这也是报告标题里 "Omni" 的含义:不同模态、不同任务和不同控制信号,都在同一个模型中学习和运行。

图 2:Text、Reference、Audio 与 Action 可以在不同交互时刻进入同一个因果生成过程,并驱动下一段音视频。(来源:PixVerse R2 技术报告)

世界一直往前走,怎么减少漂移?

长时间运行会带来两个直接问题。

历史全部保留,计算和显存成本会越来越高;历史裁剪过多,角色身份、场景设定和关键事件又容易丢失。

R2 给出的方案是一套多尺度记忆体系。

Sink Memory 保存角色、场景、风格和世界规则等长期锚点;Rolling History 关注最近的动作、姿态、镜头和环境变化;Object KV Cache 复用并压缩已经计算过的对象级历史表征。

长期信息、近期动态和对象状态各走一条通道,模型可以在固定预算内维持世界身份与局部连续性。

训练阶段还加入了 Hybrid Teacher Forcing 和 Diffusion Forcing。

模型一边学习干净历史,保持单次生成的质量上限;一边接触带噪历史,提前适应真实运行中由自身生成的小误差。

图 3:Hybrid TF/DF 的统一因果掩码。Diffusion Forcing 只读取历史窗口;Teacher Forcing 中干净查询读取干净历史,带噪查询读取此前历史与自身状态,任何未来状态均不可见。(来源:PixVerse R2 技术报告)

R2 还建立了一个 Error Bank,把有代表性的错误历史状态存下来,再按一定比例放回训练过程。模型会反复学习如何识别、吸收和修复已经出现偏差的历史。

技术报告给出了一组阶段性结果:长期亮度漂移指标从 0.201 降到 0.129,降幅约 35.8%;29 个长序列样例中有 20 个获得改善,5 个明确无动作的样例全部减少了错误运动。

截图来源:PixVerse R2 技术报告。

这组数字很有意思。

它意味着模型的训练目标里,已经加入了"犯错以后怎么继续走"这件事。

能力有了,怎么塞进实时交互?

完整的世界模型能力很重,实时交互又对延迟极其敏感。

R2 的实时加速层主要做三件事。

第一件是 DDMD with Adversarial Regularization。

条件对齐负责让模型准确响应 Prompt、Reference、Audio 和 Action,分布匹配负责继承 Teacher 的生成能力,对抗正则则用真实数据帮助模型维持纹理、运动和整体真实感。

第二件是 Block-sparse Attention。

模型把注意力计算集中到当前控制、近期运动和关键世界状态相关的少量计算块上。报告称注意力稀疏度已经提升到 90% 以上,当前评测中的画面质量、动作连续性、条件遵循和长时稳定性没有出现明显退化。

第三件是 Pyramid Ultra-few-step Distillation。

模型先用一到两个低分辨率阶段确定场景布局、主体运动和镜头结构,再通过一个高分辨率阶段恢复纹理、边缘和局部细节。

先搭骨架,再补细节,高分辨率空间里的重复计算会少很多。

这三部分共同做了一件事:把已经形成的世界建模能力,尽可能完整地加速到实时运行区间。

三种玩法,指向同一个变化

理解完这些技术,再回头看开头的三段视频,会发现三类体验恰好对应了 R2 的不同能力。

空间体验里的 WASD 和镜头控制,对应 Action 的即时输入、Dynamic Chunk 的快速响应,以及长期运行中的场景连续性。

互动影游里的选择、文字和语音,对应多模态控制进入正在发生的故事,让输入继续影响角色行为、局部演出和后续分支。

数字人方向则把语音、人设、记忆、表情和动作放进持续互动过程。角色要听懂当下的问题,也要保持前后身份一致,让回答与表演能够衔接起来。

World、Story、Character,构成了 PixVerse R2 当前最清晰的三个产品入口。

往更远处看,互动影视的观众可以进入剧情,实时生成游戏的内容会跟着玩家行动继续生长,虚拟角色也能从一段预制表演走向持续交流。

互动娱乐的内容形态,正在从固定成品变成一套持续运行、持续响应的系统。

写在最后

回头看 PixVerse 这一年的演进,R1 证明了实时视频世界模型可以成立,R2 开始建立一条统一、可扩展、能够持续提升的训练路径。

一个模型可以继续吸收更多数据、更多任务、更多控制方式和更长时间尺度,再让这些能力进入实时交互。

空间、故事和角色,也由此拥有了共同的技术底座。

当世界能够持续接收输入并继续演化,AI 生成的内容也有了可参与、可延续的生命力。一个真正可以走进去的世界,开始出现了。

如果让你从空间探索、互动影游和实时数字人中选一个先体验,你会选哪一个?

评论区聊聊,点赞、在看,也欢迎关注我。

相关推荐
七牛开发者1 小时前
拆解 DeepSeek Harness:Profile 与 Bundle 如何装配运行时
前端·javascript·后端
HjhIron1 小时前
从零搭建后端业务:数据库表设计、索引优化与部署架构解析
后端
Zane19941 小时前
为什么 del 一个对象有时立刻消失,有时却纹丝不动?一文讲透引用计数与垃圾回收
后端·python
编码浪子1 小时前
Rust 智能指针深度实战:Box/Rc/Arc/RefCell 选型决策与内存管理避坑
开发语言·后端·rust
提线木偶2 小时前
CORS 到底谁说了算?一份跨域配置的避坑指南
前端·后端
卷无止境3 小时前
Python的contextlib与 FastAPI 中的上下文管理
后端·python·fastapi
用户938515635073 小时前
从同源策略到Nginx代理:React+NestJS全栈项目跨域实战
后端·docker
卷无止境3 小时前
FastAPI Events 深度解析与工程实践
后端·python·fastapi
FYKJ_20103 小时前
springboot网上购书商城---附源码15749
java·spring boot·后端·python·spark·django·php