这是苍何的第 584 篇原创!
大家好,我是苍何。
兄弟们,最近我连续看了几段爱诗科技旗下 PixVerse R2 的视频,有个感觉特别强烈:这玩意儿已经很难用单一品类来概括了。
第一段,是空间体验。
人在一个修仙世界里,可以通过 WASD 控制移动,再用方向键调整镜头。每一次操作都会成为新的输入,眼前的场景也会跟着继续生成。


第二段,是互动影游。
故事已经开始,用户可以通过选择、文字或语音参与其中。角色接下来做什么,镜头如何演出,局部剧情往哪里发展,都会受到输入影响。

第三段,是数字人。
直播带货、三星堆等场景里,数字人可以持续接收提示词输入,结合人设和上下文做出回应。语音、表情、神态和动作被放进同一段实时表演中,交流过程也更接近一个持续存在的角色。



把这几段视频摆在一起看,会发现它们很像三类完全不同的产品:一个像游戏,一个像互动电影,一个像可以随时交流的虚拟角色。
它们的底层却来自同一个实时世界模型。
更准确地说,是同一套实时世界模型提供生成底座,Director Agent 负责理解意图和组织演出,Runtime 负责管理持续变化的内容状态。
一个模型,开始撑起空间、故事和角色三种玩法。
一个世界持续运行,有多难?
过去生成一段内容,任务结束于成片交付。
实时世界模型面对的是另一种工作方式:内容始终在运行,用户随时可能按下一个方向键、说一句话、换一个目标,模型需要立刻接住这次变化,再继续生成后面的世界。
生成下一段只是起点。
真正麻烦的地方,在于连续经历多次操作以后,场景、角色、运动和上下文还能不能保持稳定。
比如用户刚刚经过一座建筑,转动视角后,这座建筑的位置和形态需要延续;角色上一轮做了一个动作,下一轮的姿态需要自然衔接;故事里刚刚发生的事件,也应该继续影响后面的演出。

每一次生成还会成为下一次生成的历史。一个很小的偏差写入历史后,可能沿着后续内容不断放大,最后出现人物变脸、场景突变、亮度漂移、动作断裂等问题。
视频生成关心下一段看起来是否自然,持续运行的世界还要关心每一次变化能否接得住。
R1 做成全球首个,R2 开始解决 Scaling
2026 年 1 月,爱诗科技发布 PixVerse R1。根据 PixVerse 官方发布信息,R1 是全球首个实时世界模型,也是行业第一次把连续、可交互的 1080P AI 视频生成,以及对用户输入的即时响应,放进同一套实时系统。
这一定位也有一线媒体的外部报道作背书:36氪称其为全球首个支持最高 1080P 分辨率的通用实时世界模型;新华网则指出,R1 首次将视频生成延迟降至"即时"响应,推动 AIGC 视频从静态输出迈入实时交互的新阶段。
这不是简单地把一段视频生成得更快,而是第一次让视频从"生成后播放",走向"边生成、边交互、边延续"的实时世界。
到了 4 月,R1 又完成了一次行业首次:用户第一次可以用个性化 Avatar 进入 AI 生成世界,与其他人实时共同探索、共同影响世界走向。7 月发布的 PixVerse Game Engine,则进一步把实时世界模型、AI Agent 和结构化游戏机制连接起来。
这一连串更新证明了实时生成世界的技术路线能够跑通。

R2 更关键的变化,是让一次输入进入正在运行的内容状态:它会继续影响剧情分支、角色记忆、任务进度、结果反馈和关系变化。
接下来还要回答一个更难的问题:当模型规模、训练数据、交互任务、控制信号和运行时间继续增长,已有能力如何一起增长?

过去的长视频和实时生成框架,往往依赖一条很长的训练流水线。
双向基础模型先转成自回归模型,再构造面向具体任务的蒸馏 Teacher,接着进行 DMD 蒸馏,后面还要加入带 Self-Rollout 的训练,继续修正训练和推理之间的差异。
流程每多一个阶段,就会多一次能力迁移和目标对齐。上游积累的画面、运动、条件遵循和长程稳定能力,也可能在迁移中产生折损。

图 1:R2 将原先的多阶段训练流水线收敛为 Omni Causal AR 与 Real-Time Acceleration 两个核心过程。(来源:PixVerse R2 技术报告)
PixVerse R2 把这条长流水线收敛成两个核心过程。
第一步,持续预训练统一的 Omni Causal AR,让模型在同一个体系里吸收更多数据、任务、模态和长时间交互轨迹。
第二步,通过 Real-Time Acceleration,直接把已经形成的世界建模能力加速到低延迟的实时运行区间。

同一个 Omni Causal AR 同时承担 Student ODE 的初始化和蒸馏 Teacher,Teacher、Student 与真实的自回归推理共享同一套因果建模基础。
它会把完整时空建模获得的生成先验,转化为沿时间单向推进的世界状态变化。Text、Reference、Audio 与 Action,也由此成为持续推动世界演化的因果信号。
少了反复搬运,新增能力可以沿着同一条训练路径继续积累。
这也是 R2 所说的 Scaling:世界模型从"能不能做",开始走向"能不能持续做大"。
一个模型,怎么接住不同玩法?
空间探索、互动影游和数字人,表面上差别很大,底层输入的节奏也完全不同。
按一次 WASD,需要模型马上反馈移动结果;一句 Prompt 可能描述一个完整事件;一段语音同时包含语义、情绪、节奏和时间信息;参考图片还要约束角色或场景的视觉状态。
如果把这些信号全部塞进固定长度的时间单元,响应速度和表达完整度很容易互相牵制。
R2 引入了 Dynamic Chunk。
模型会根据控制信号的语义边界和持续时间,自适应地切分音视频序列。短 Chunk 用来接住动作和局部指令,长 Chunk 用来保留事件、运动和音视频语义的完整结构。

简单理解,用户按下一个方向键,系统就用更细的时间颗粒快速响应;用户给出一段复杂的剧情指令,系统会留出更完整的生成空间。
Text、Reference、Audio 和 Action 因此能够进入同一套因果生成接口,持续改变下一段世界状态。
这也是报告标题里 "Omni" 的含义:不同模态、不同任务和不同控制信号,都在同一个模型中学习和运行。

图 2:Text、Reference、Audio 与 Action 可以在不同交互时刻进入同一个因果生成过程,并驱动下一段音视频。(来源:PixVerse R2 技术报告)
世界一直往前走,怎么减少漂移?
长时间运行会带来两个直接问题。
历史全部保留,计算和显存成本会越来越高;历史裁剪过多,角色身份、场景设定和关键事件又容易丢失。
R2 给出的方案是一套多尺度记忆体系。
Sink Memory 保存角色、场景、风格和世界规则等长期锚点;Rolling History 关注最近的动作、姿态、镜头和环境变化;Object KV Cache 复用并压缩已经计算过的对象级历史表征。
长期信息、近期动态和对象状态各走一条通道,模型可以在固定预算内维持世界身份与局部连续性。
训练阶段还加入了 Hybrid Teacher Forcing 和 Diffusion Forcing。
模型一边学习干净历史,保持单次生成的质量上限;一边接触带噪历史,提前适应真实运行中由自身生成的小误差。

图 3:Hybrid TF/DF 的统一因果掩码。Diffusion Forcing 只读取历史窗口;Teacher Forcing 中干净查询读取干净历史,带噪查询读取此前历史与自身状态,任何未来状态均不可见。(来源:PixVerse R2 技术报告)
R2 还建立了一个 Error Bank,把有代表性的错误历史状态存下来,再按一定比例放回训练过程。模型会反复学习如何识别、吸收和修复已经出现偏差的历史。
技术报告给出了一组阶段性结果:长期亮度漂移指标从 0.201 降到 0.129,降幅约 35.8%;29 个长序列样例中有 20 个获得改善,5 个明确无动作的样例全部减少了错误运动。

截图来源:PixVerse R2 技术报告。
这组数字很有意思。
它意味着模型的训练目标里,已经加入了"犯错以后怎么继续走"这件事。
能力有了,怎么塞进实时交互?
完整的世界模型能力很重,实时交互又对延迟极其敏感。
R2 的实时加速层主要做三件事。

第一件是 DDMD with Adversarial Regularization。
条件对齐负责让模型准确响应 Prompt、Reference、Audio 和 Action,分布匹配负责继承 Teacher 的生成能力,对抗正则则用真实数据帮助模型维持纹理、运动和整体真实感。
第二件是 Block-sparse Attention。
模型把注意力计算集中到当前控制、近期运动和关键世界状态相关的少量计算块上。报告称注意力稀疏度已经提升到 90% 以上,当前评测中的画面质量、动作连续性、条件遵循和长时稳定性没有出现明显退化。
第三件是 Pyramid Ultra-few-step Distillation。
模型先用一到两个低分辨率阶段确定场景布局、主体运动和镜头结构,再通过一个高分辨率阶段恢复纹理、边缘和局部细节。
先搭骨架,再补细节,高分辨率空间里的重复计算会少很多。
这三部分共同做了一件事:把已经形成的世界建模能力,尽可能完整地加速到实时运行区间。

三种玩法,指向同一个变化
理解完这些技术,再回头看开头的三段视频,会发现三类体验恰好对应了 R2 的不同能力。
空间体验里的 WASD 和镜头控制,对应 Action 的即时输入、Dynamic Chunk 的快速响应,以及长期运行中的场景连续性。
互动影游里的选择、文字和语音,对应多模态控制进入正在发生的故事,让输入继续影响角色行为、局部演出和后续分支。

数字人方向则把语音、人设、记忆、表情和动作放进持续互动过程。角色要听懂当下的问题,也要保持前后身份一致,让回答与表演能够衔接起来。
World、Story、Character,构成了 PixVerse R2 当前最清晰的三个产品入口。
往更远处看,互动影视的观众可以进入剧情,实时生成游戏的内容会跟着玩家行动继续生长,虚拟角色也能从一段预制表演走向持续交流。
互动娱乐的内容形态,正在从固定成品变成一套持续运行、持续响应的系统。
写在最后
回头看 PixVerse 这一年的演进,R1 证明了实时视频世界模型可以成立,R2 开始建立一条统一、可扩展、能够持续提升的训练路径。
一个模型可以继续吸收更多数据、更多任务、更多控制方式和更长时间尺度,再让这些能力进入实时交互。
空间、故事和角色,也由此拥有了共同的技术底座。
当世界能够持续接收输入并继续演化,AI 生成的内容也有了可参与、可延续的生命力。一个真正可以走进去的世界,开始出现了。
如果让你从空间探索、互动影游和实时数字人中选一个先体验,你会选哪一个?
评论区聊聊,点赞、在看,也欢迎关注我。