【多篇论文阅读】Interactive World Models

Vid2World: Crafting Video Diffusion Models to Interactive World Models

类型判断:改造原理/配方(不是从零新架构)。本质是:给已有双向 video Diffusion 补两样能力------只能看过去、能跟帧级 action 走。

  1. 题目: Vid2World: Crafting Video Diffusion Models to Interactive World Models
  2. 时间: 2025.05
  3. 单位: Tsinghua University; Chongqing University
  4. 英文关键词: video Diffusion transfer, causalization, causal action guidance
  5. 1段话总结论文干了什么
    把互联网预训练的全序列 video Diffusion(实验用 DynamiCrafter)改成可逐步自回归、按 action 反事实推演的 interactive world model。配方就两步:结构+训练目标因果化;帧级 action 注入 + 独立 dropout,从而在逐步 rollout 时做 classifier-free action guidance。
  6. 存在问题
    领域 world model 数据贵、画质粗;现成 video Diffusion 画质好,但双向看未来、条件通常是整段文本,既不能在线交互,也不能精细控每一步 action。
  7. 解决方法
    原理: Video Diffusion → Interactive World Model = Causalization + Action Conditioning。
  • Causalization(结构): temporal attention 加因果 mask;非因果 temporal conv 不用简单 shift(会错位),而用 mixed weight transfer------时间维对齐位置保留原权重,多出来的"过去侧"位置用核均值初始化,尽量保住预训练。
  • Causalization(目标): 训练用 Diffusion Forcing(每帧独立噪声水平),对齐推理时「历史干净、只去噪当前帧」。
  • Action: 每个 action 经轻量 MLP 对齐到对应帧;训练时每个 timestep 的 action 独立以概率 p 置 ∅,逼模型同时学有/无最新 action 的 score;推理用 ε=(1+λ)ε_cond−λ ε_uncond 做 Causal Action Guidance。
  1. 相比其他方法的创新之处
    把「被动全序列 Diffusion → 交互 world model」拆成可操作的两段改造,并给出保权重的 conv 迁移与面向逐步交互的 action CFG;不是再挂一个 ControlNet/adapter 了事。
  2. 基于前人的哪些方法
    DynamiCrafter:作为被改造的预训练 video Diffusion 底座,继承其互联网视频先验。
    Diffusion Forcing:直接采用其「每帧独立噪声」训练方式,使全序列 Diffusion 能做自回归 rollout。
    Classifier-free guidance:把 CFG 从类别/文本条件,延伸到因果逐步生成下的「最新一帧 action」条件。
  3. 实验
    exp1:
    设置:RT-1 上同底座 transfer 后做视频预测(含 NAR / 自回归)
    数据:RT-1
    结论:画质与相似度明显强于其他 transfer;自回归也可稳定逐步生成
    exp2:
    设置:CS:GO 上与 DIAMOND 比 16 帧 action-conditioned 预测
    数据:Dust II 人类对局 holdout
    结论:FVD/FID 大幅领先,说明改造后的 video Diffusion 可当高保真游戏 world model
  4. 提到的同类工作
    Genie(2024): 无标视频学可控环境
    DIAMOND(2024): 自回归 Diffusion 游戏 world model
    AVID(2024): 冻结 video 模型上 action adapter
    Diffusion Forcing(2024): 分帧噪声支撑 AR Diffusion
  5. 相关性最高的工作
    Diffusion Forcing(2024)
    DIAMOND(2024)
    AVID(2024)

MIRA: Multiplayer Interactive World Models with Representation Autoencoders

类型判断:完整新模型系统(+大规模数据开源)。该记清三段结构:Representation Codec → Latent DiT World Model → 四人 tile 条件;以及「多人」到底多在哪。

  1. 题目: MIRA: Multiplayer Interactive World Models with Representation Autoencoders
  2. 时间: 2026.07
  3. 单位: General Intuition; Kyutai; Epic Games
  4. 英文关键词: multiplayer world model, representation autoencoder, Rocket League
  5. 1段话总结论文干了什么
    在 Rocket League 上做四人、强物理交互的实时 world model:四视角+四路 action 联合进 latent Diffusion,单卡 B200 约 20fps;约 1 万小时 bot 数据与代码开源。核心不是"多加几路输入",而是在共享场景里把变化正确归因到对应玩家,并跨视角一致。
  6. 存在问题
    多数 world model 单 agent,其他人当环境纹理;多人设定下易误归因、忽略某玩家、纠缠多人效果;像素空间又慢又难学动力学。
  7. 解决方法
    模型结构(三块):
  8. Codec(Representation Autoencoder): 冻结 DINOv3-L 多中间层聚合 → 线性 bottleneck(空间↓2×2、时间↓2→10Hz、通道→32)→ 时空 ViT decoder(空间全注意、时间因果;先空间上采样再注意)。重建:L1+LPIPS+P-DINO。世界模型只在 latent 上预测。
  9. Latent World Model: flow-matching DiT,因子化时空 attention;Diffusion Forcing(每帧独立 τ)抗自回归漂移;PSD/shortcut 式 few-step 蒸馏到 1--2 步实时;action 与 τ 经 AdaLN。
  10. Multiplayer: 四玩家 latent 沿高度 tile,空间 attention 一次跨四视角;各玩家键盘 action 分路 embed 后按固定顺序拼进条件,广播到所有位置,让模型自己学"谁的操作影响谁的画面";训练 action dropout。先单玩家预训练再 warm-start 四人,优于直接四人训。
    推理:真 clip warmup → 固定长度 rolling window + KV cache;每 latent 解出 2 帧 → 20fps。
  11. 相比其他方法的创新之处
    把 multiplayer 从"单控接口看多人画面"推到「四路 action 同时条件 + 四视角联合生成」的强物理 3D 竞技设定;系统消融证明预训练表征 latent、Forcing、二人阶段迁移的必要性;用 physics probe 测动力学而不只看脸。
  12. 基于前人的哪些方法
    Representation Autoencoder / DINOv3:用冻结自监督特征建可重建、又利于动力学预测的 latent,作为 WM 的预测空间。
    DIAMOND 路线的 latent Diffusion 游戏 WM:继承「在压缩空间里做 action-conditioned 下一帧」的实时游戏模拟范式,扩展到四人。
    Diffusion Forcing:用于训练期混合干净/带噪历史,降低自回归误差累积。
    Shortcut / consistency 类蒸馏:把多步 flow 压成 1--2 步,支撑实时。
  13. 实验
    exp1:
    设置:5B 四人模型,按四路 GT action 长程 rollout;测分布质量、物理 probe、可控性、实时性
    数据:~10k hours Rocket League bot 对局
    结论:单卡实时约 20fps;跨视角事件一致;物理读出与真值可对齐;分布质量至少稳到测过的 5 分钟,实践可小时级不塌
  14. 提到的同类工作
    DIAMOND(2024): 单玩家实时游戏 WM
    Genie / Genie 3(2024/2025): 可控生成环境
    WHAM(2025): 四人对局数据,条件仍是单玩家控制
    MultiWorld 等(2026): 多智能体条件,场景动力学通常更弱
  15. 相关性最高的工作
    DIAMOND(2024)
    Genie(2024)
    WHAM(2025)

Infinite Worlds with Versatile Interactions(LingBot-World 2.0 / Infinity)

类型判断:系统升级 = A+B+C 组合。相对 1.0,拼的是:更稳的因果预训练(MoBA)+ 实时蒸馏(consistency+DMD)+ 更富交互数据/动作 + Director--Pilot agentic harness。重点记「组合了什么、各块改了什么」。

  1. 题目: Infinite Worlds with Versatile Interactions
  2. 时间: 2026.07
  3. 单位: Robbyant / LingBot(Hao Ouyang 等)
  4. 英文关键词: causal world model, long-horizon anti-drift, agentic harness
  5. 1段话总结论文干了什么
    开源交互世界模型升级版:因果 DiT 骨干拉长程不漂,再蒸馏出 720p@60fps 实时学生;动作从导航扩到攻击/弓箭/法术/射击与文本改环境;外挂 VLM Director + 视频 Pilot,让模型能持续规划角色行为并往世界里塞新事件;提供 14B 与单卡 1.3B。
  6. 存在问题
    自回归误差反馈,多数只能稳秒到分钟;高保真交互算力贵,常砍分辨率/帧率/控制;纯生成器不会"自己玩、自己补内容"。
  7. 解决方法
    组合清单:
  • 数据引擎: 第一人称 + 游戏/UE 合成 + 网页视频 → 技术分+VLM profiling → 全局 caption + chunk 多轨局部标注(运动/交互/环境),对齐推理时随时间变的条件。
  • 预训练(新骨干 trick): 因果 flow matching;相机 Plücker+AdaLN;chunk-wise prompt。MoBA mask:在 teacher forcing 上拼一块双向 attention,减轻"越看历史越偷懒、画质崩"的过拟合,同时保留 AR 能力;cross-attn 对应下三角防未来泄漏。
  • 后训练(实时+抗漂): consistency distillation 压步数;DMD 在长 self-rollout 分布上对齐,专门打累积漂移。
  • Agentic harness(组合创新点): VLM 当 Director 出 event proposal;DiT 当 Pilot 落地物理/像素;支持直接语义交互、SAM 跟踪物体交互、文本注入天气/实体。
  • 部署: 编译/并行/异步 VAE、时空 refiner、动态 KV、多玩家 UI。
  1. 相比其他方法的创新之处
    把"能生成"升级成"能长住 + 能实时 + 能被 agent 驱动续写";MoBA 与 self-rollout DMD 针对长程漂;在 world model 里系统引入 coding-agent 式 harness。宣称通用域 hour-level 且开源较稀缺。
  2. 基于前人的哪些方法
    LingBot-World 1.0:直接升级的前代开源交互世界系统(数据/因果生成/实时交互骨架)。
    Causal flow-matching DiT:作为可 action/prompt 条件的世界骨干训练范式。
    Consistency distillation:把多步教师压成少步实时学生。
    DMD:用分布匹配继续提保真,并在本文里接到长 self-rollout 上抑漂移。
  3. 实验
    exp1:
    设置:蒸馏实时模型与主流交互 WM 比画质、长程稳定、实时与交互丰富度;并做约 1 小时不间断会话
    数据:自建混合交互场景
    结论:画质达最强闭源量级且开源;720p@60fps 量级实时;小时级 rollout 无明显全程崩坏
  4. 提到的同类工作
    Genie 3(2025): 强闭源交互世界
    LingBot-World(2026): 前代
    Matrix-Game 3.0 / HY-World 1.5(2025/2026): 游戏或通用交互生成
    HappyOyster: 闭源对照
  5. 相关性最高的工作
    LingBot-World(2026)
    Genie 3(2025)
    Matrix-Game 3.0(2026)

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

类型判断:完整新模型结构(小规模配套数据)。该记清:视觉专家 + 状态专家 + joint attention;状态用回归而不是套 flow matching。

  1. 题目: StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation
  2. 时间: 2026.07
  3. 单位: Tencent; NTU; NUS; A*STAR
  4. 英文关键词: game mechanics, state-aware, Mixture-of-Transformers
  5. 1段话总结论文干了什么
    在 Street Fighter 3 上做 state-aware game world model:除画面外,显式预测 timer / 双方 HP / 气条,并用状态信息约束出画,减少 0 血还打、气不满放大招等规则违规。配套采了 state--frame--action 对齐的 1 万段 5s 数据。
  6. 存在问题
    现有 game WM 多在像素上学"看起来像",内部规则状态难从画面可靠推出,生成常违反 mechanics;缺公开的状态同步数据与耦合设计。
  7. 解决方法
    模型结构:
  • 底座 Wan2.2-TI2V-5B 视觉分支(~5B,flow matching)+ 轻量状态分支(~0.76B)。
  • 两侧各自 self-attn;中间 joint attention(MoT 式):画面 query 状态(用规则信息导生成),状态 query 画面(用视觉动态助状态推演)。
  • Action 投影后同时加进两支;文本(NPC 策略)进视觉 cross-attn。
  • 损失:视觉 flow matching + 状态 Smooth L1 回归(状态低维、规则硬,不适合乱加噪的 FM)再加权求和。
  • 推理:给首帧状态,后续状态从噪声预测并与帧联合去噪。
    数据亮点: emulator 读 5 维状态;Gemini 平衡 win/lose/macro success/fail/normal(状态关键样本占 40%);NPC 策略文本三类。
  1. 相比其他方法的创新之处
    把"内部状态"从评测旁路拉进生成主环;相对 shared 骨干与"状态也走 FM",MoT+回归在 mechanics fidelity 上明显更强(文中相对无状态最强基线约 +18.6%)。
  2. 基于前人的哪些方法
    Wan2.2:作为视觉生成骨干与 VAE/text encoder,提供画面分支。
    World Action Model(WAM)/ MoT 联合建模思路:借鉴「多模态分专家 + 交叉交互」来同时建模另一路信号(此处把 action 换成 game state)。
    ReactiveGWM:沿用其 SF 数据采集与 NPC 策略标注流水线,扩展为同步状态标注。
  3. 实验
    exp1:
    设置:在同一 state-aware 数据上,StatePlay vs 微调后的无状态 game WM;主看 mechanics fidelity、状态对齐、画质与控制
    数据:自建 SF3,10k 训练 / 100 测试 clips
    结论:state alignment≈0.947;mechanics 约 82%/78%(Gemini/GPT),相对最强无状态模型约 +18.6%;画质与控制不牺牲
  4. 提到的同类工作
    Genie(2024): 交互游戏环境
    ReactiveGWM(2026): 同域最强无状态基线
    LingBot-World 2.0(2026): 通用交互,零样本 mechanics 仍弱
    From Pixels to States(2026): 有状态标注,未闭环证明如何抬 mechanics
    WildWorld(2026): 带 action/state 的动态世界数据
  5. 相关性最高的工作
    ReactiveGWM(2026)
    Genie(2024)
    From Pixels to States(2026)
相关推荐
2601_9640098342 分钟前
商业活动全案策划维度:苏州实体企业与政企单位的选择侧重点
人工智能·润博企业营销策划
用户3028225306843 分钟前
Agent 慢一点没关系?错,尾延迟会把一次工作变成两次事故
人工智能
一次旅行44 分钟前
2026‑08‑25 AI产业深度解读|Groq 3量产、MetaRoCE开源、CopilotOS曝光、大模型安全监管升级
人工智能·开源
AI导出鸭1 小时前
ChatGPT的LaTeX生成PDF文件复制后数学公式乱码,怎样修改?苹果用户的底层逻辑与优雅解法
人工智能·chatgpt·pdf·ai导出鸭
故七月1 小时前
基于FAQ结构化开发的区域GEO排名提升技术方案——以四川成都服务商万域智瞰场景为例
大数据·人工智能
java1234_小锋1 小时前
Spring框架的创始人开发了一个Java AI智能体框架
java·人工智能·spring
魔镜er1 小时前
10-CNN案例-图像分类
人工智能·分类·cnn
晴天161 小时前
Hugging Face 白嫖指南-Day28
人工智能
、如果1 小时前
ima Skills 自进化实战:三层结构、反馈与版本验证
android·人工智能·ai编程