GAIA、Cosmos、Genie 等视频模型纷纷自称"世界模型",为什么说视觉逼真度不构成决策证据?

从视频模型到决策世界模型:进入 Agent 与机器人闭环前的证据门槛

TL;DR

  • 场景:视频模型能生成逼真、连贯、可控的画面,但要把它放进 Agent / 自动驾驶 / 机器人决策闭环并称为"可用于决策的世界模型",需要的是另一组证据。
  • 结论:本文提出 L0---L5 的工程证据梯子(视觉可接受 → 状态可读 → 动作敏感 → 持久与反事实一致 → 不确定性可用 → 闭环决策增益)+ 五项核心测试 + 校准与失效检测硬门槛 + 谨慎的公开写作表述。
  • 产出:三类世界模型(表示/预测/决策)的最低可检验要求表 + 6 级证据梯子 + 5 项核心测试(动作交换 / 实体持久 / 多步误差 / 反事实排序 / 闭环规划)+ Sora / GAIA-1 / GAIA-2 / Cosmos / Genie 证据阅读指南 + 4 类常见误判 + 7 行"避免 / 建议"表述对照。

版本矩阵

维度 状态 说明
经典世界模型定义(表示 / 预测 / 决策) ✅ 已验证 三类定义并不共享同一验收口径;只有决策型对本文问题必需动作条件化
L0 视觉可接受 ✅ 已验证 样本在目标分辨率、时长、场景下无明显崩坏;只证明可生成
L1 状态可读且非平凡 ✅ 已验证 需时间打乱 / 标签泄漏 / 浅层特征 / 等容量基线对照;探针强不等于状态完整
L2 动作敏感且方向正确 ✅ 已验证 固定历史与随机因素,只替换动作;定义动作影响比 I = d(ŝ) / (d(a) + ε)
L3 持久 / 多步 / 反事实一致 ✅ 已验证 实体保持率、状态事件 F1、Spearman / Kendall、Top-k 命中率、选择后悔值
L4 不确定性可用 ✅ 已验证 Brier Score / NLL / 可靠性曲线 / ECE / 预测区间覆盖率 / coverage-risk 曲线
L5 闭环决策增益 ✅ 已验证 固定预算下与无模型 / 规则 / 其他预测模型 A/B;多个随机种子与扰动下成立
OpenAI Sora 技术报告 ✅ 已验证 描述为"大规模视频模型通向物理世界模拟器的有前景路径";定性评估为主;列出基础物理 / 状态改变 / 长时一致性 / 物体凭空出现等限制
Sora 提供的能力证据 ✅ 已验证 三维一致性 / 遮挡后物体保持 / 简单状态变化 / Minecraft 控制
Wayve GAIA-1 ✅ 已验证 视频 + 文本 + 动作输入生成驾驶场景;报告对自车行为细粒度控制
Wayve GAIA-2 ✅ 已验证 多视角 / 多摄像头 / 多道路状况 / 极端案例;条件包括自车行为 / 环境 / 道路配置;视频标记器 + 潜变量扩散世界模型
NVIDIA Cosmos ✅ 已验证 定位为 World Foundation Model 平台;提供视频整理 / 预训练模型 / 后训练示例 / Tokenizer;可后训练适配 Physical AI
DeepMind Genie 2 ✅ 已验证 由图像 + 文本生成可交互 3D 世界;键盘 / 鼠标动作可控;可记忆视场外部分
Genie latent action ✅ 已验证 从无动作标签互联网视频学习潜动作;但 latent action 未必与真实执行器一一对应
"视频逼真 = 决策准确" ❌ 不成立 视觉分布与决策效用是两套证据;必须分别测候选排序与闭环收益
"支持相机控制 = 理解动作后果" ❌ 不成立 相机轨迹改变观察坐标,不一定改变环境状态;判定物理动作敏感性时必须固定或显式建模相机
"能生成一分钟长视频 = 持久世界状态" ❌ 不成立 长度只说明输出范围;必须验证遮挡后身份、不可逆事件和状态账本
"加入 Action Token = 模型使用了动作" ❌ 不成立 接口存在不代表信息被利用;动作交换 / 动作屏蔽 / 梯度归因对照才能验证
"多 Seed = 不确定性覆盖" ❌ 不成立 采样产生多个候选;候选频率是否校准、是否覆盖危险模式需要另测
"样片物理感强 = 可规划" ❌ 不成立 规划需要候选排序、概率校准和闭环增益;单条成功样片无法估计失败概率

摘要

视频模型能生成可控画面,只说明它学到部分视觉统计规律。要成为决策世界模型,还需证明动作会改变预测、任务状态可持续、反事实可比较、失效可校准,并在固定预算与安全约束下改善真实决策。

关键词

World Model、Video Model、Action Conditioning、Counterfactual、Decision Utility

目录

核心结论

视频模型能生成逼真、连贯、可控的画面,只能证明它学到了一部分视觉统计规律。要把它放进 Agent、自动驾驶或机器人决策闭环,并称为"可用于决策的世界模型",还需要另一组证据:模型对真实动作语义敏感,能维护与任务相关的持久状态,能在多步反事实中比较动作后果,知道预测何时不可靠,并且在固定资源与安全约束下确实改善规划或控制结果。

这不是给整个"世界模型"领域制定唯一词典。不同研究传统对 world model 的定义并不相同,有些关注内部状态表示,有些关注未来预测,有些直接服务强化学习。本文只解决一个更窄的工程问题:当团队准备让视频模型参与动作选择时,怎样避免把视觉能力误当成决策能力。

三类世界模型必须先分开

类型 最低可检验要求 动作是否必需 典型用途 不能由什么单独证明
表示型世界模型 网络内部存在可检验、非平凡的环境状态表示;计算确实经由该表示完成 不必需 表征分析、状态抽取、迁移 一段逼真视频或一个高探针分数
预测型世界模型 根据历史状态或观察,预测未来状态、观察或事件分布 不一定;被动环境也可无动作预测 预测、模拟、异常预警 单帧重建或只会复制最近帧
决策型世界模型 建模候选动作的后果,并使策略评估、规划或控制获得可测收益 对本文问题而言必需 Model-based RL、机器人规划、自动驾驶决策 仅有动作输入接口、相机控制或长视频生成

F-P01 Li、Viégas 与 Wattenberg 提出一组操作性标准,用来判断神经网络是否形成并使用了世界状态的潜表示;该工作明确把"动作效果"留给后续研究。这正好说明,不能断言所有世界模型定义都要求动作条件化。

F-P02 Ha 与 Schmidhuber 的 World Models 学习环境的压缩时空表示,并可让策略在模型生成的"梦境"中训练后迁回环境。这里的世界模型价值不只在生成画面,而在于它成为策略学习的环境接口。

F-P03 MuDreamer 进一步展示,像素重建并不等同于任务相关表征:重建目标可能迫使模型编码无关视觉信息,在干扰背景下反而遗漏任务关键要素。由此不能用"重建更清晰"直接推导"决策状态更完整"。

为什么视觉逼真度不构成决策证据

视频生成目标通常要求从条件分布中产生看起来合理的样本。对开放世界而言,同一历史之后可能有许多合理未来;一个样本只要视觉上成立,并不需要准确回答"动作 A 与动作 B 的后果差多少"。决策系统却必须比较候选动作,并在代价、风险和不确定性之间排序。

这里至少存在五个缺口。

第一,相关性不等于动作因果性。训练数据中方向盘左转常与画面左移共现,模型可能依赖背景、路线或相机信号,而没有学到可迁移的车辆动力学。

第二,局部连贯不等于持久状态。物体在十几帧内外观稳定,不代表它在遮挡、出画、碰撞或状态改变后仍保持身份、位置、库存、开关或损伤状态。

第三,一个合理样本不等于正确分布。规划器需要知道失败概率、尾部风险和多个可能结果,而不是只看到最顺眼的一条未来。

第四,生成可控不等于控制可执行。相机平移、文本指令或抽象 latent action 能改变画面,不代表条件与真实执行器命令具有稳定对应关系。

第五,离线预测分数不等于闭环收益。即使模型在数据集上预测准确,规划器也可能利用其系统性偏差,挑出在模型里得分高、现实中却失败的动作。

从视频质量到决策效用:本文的工程证据梯子

以下阶梯是本文提出的工程验收框架,不是对整个学术领域的唯一分类。每一级都回答一个不同问题,不能跨级替代。

L0:视觉可接受。 样本在目标分辨率、时长和场景中没有明显崩坏。它只证明模型可生成,不证明内部状态或动作语义。

L1:状态可读且非平凡。 从内部表示可恢复任务状态,如对象身份、姿态、可见性、接触、门是否打开。必须设置时间打乱、标签泄漏、浅层特征和等容量基线,避免"探针很强"只是探针自己完成任务。

L2:动作敏感且方向正确。 固定历史和随机因素,只替换动作,预测应在合理延迟后沿正确方向变化;无关动作维度不应制造大幅变化,动作也不能被模型忽略。

L3:持久、多步、反事实一致。 模型能维护实体状态,长 Rollout 的任务误差可测且增长受控,并能对多个候选动作给出稳定后果排序。

L4:不确定性可用。 预测概率经过校准,分布外输入能触发拒绝、降级或扩大安全裕度;模型知道"没有证据"与"确定安全"的差别。

L5:闭环决策增益。 在同等数据、计算、候选数、控制周期和安全门禁下,使用该模型的规划器比无模型或替代模型更成功、更安全或更高效,且收益在未见场景中保持。

团队若只通过 L0,应称"视频生成模型";通过 L1 或部分 L3,可以谨慎称"形成了某些世界状态表示"或"具有预测性";只有对目标动作空间完成 L2---L5,才有充分工程理由称其为"用于该任务决策的世界模型"。这个称呼必须绑定任务、动作接口和评测分布,不能写成无条件身份认证。

五项核心测试

一、动作交换测试

构造相同历史 (h_t)、相同随机噪声或采样轨迹,只替换候选动作 (a_t)。动作必须来自真实控制合同,例如转向角、末端位姿增量、关节目标或离散技能,而不是模糊文本"向左一点"。

对每对动作记录三类量:预测状态差是否出现、出现方向是否与动力学或真实数据一致、响应延迟是否合理。可以定义动作影响比:

I=\\frac{d(\\hat{s}*{t+k}\^{a_i},\\hat{s}*{t+k}\^{a_j})}{d(a_i,a_j)+\\epsilon}

但单一数值不足以判定好坏:影响过小可能表示动作被忽略,影响过大也可能表示模型对微小控制过敏。还要加入无效动作、相同动作不同历史、只改相机参数和只改执行器命令的对照,排除模型把视觉控制当物理控制。

二、实体持久测试

选择需要记忆的实体和属性:物体身份、相对位置、是否已抓取、容器内容、门锁状态、车辆损伤等。让实体短暂遮挡、离开视野或跨镜头后重新出现,比较预测与真实状态。

指标应包含身份保持率、状态事件 F1、重现位置误差、非法状态逆转率。例如杯子已被放入封闭抽屉后,模型不能因为画面看不见就让它在桌面重新出现。视觉相似度高但状态账本错误,对规划仍是致命失败。

三、多步误差曲线

从真实历史启动,连续 Rollout 多个决策步,分别在每一步使用真实观察纠正与完全开环两种模式。按预测步长绘制位置、姿态、接触、事件、占用和任务进度误差,而不只用像素指标。

需要报告平均误差之外的分位数、灾难事件率和误差增长形态。一个模型可能前三步准确、之后突然身份交换;另一个模型像素稍模糊,却能保持可用于规划的占用和接触状态。对决策而言,后者可能更有价值。

四、反事实排序测试

对同一状态给出候选动作集合,用模型预测成功率、代价或风险,再与真实执行、可信仿真或离线反事实近似比较。重点不是每条视频是否逼真,而是动作排序是否正确。

可报告 Spearman 或 Kendall 排名相关、Top-k 命中率、选择后悔值和危险动作漏判率。必须覆盖接近决策边界的候选,而不是"明显正确"对"明显错误"的简单样本。若模型能生成每个候选的漂亮视频,却把碰撞动作排在安全动作之前,它不能承担规划评分器。

五、闭环规划测试

把模型接入真实规划器或严格的闭环仿真,固定候选预算、规划频率、传感器输入、控制器、安全层和计算资源,与无模型策略、规则模型、其他预测模型进行 A/B 对比。

记录任务成功率、碰撞与近失、人工干预、超时、规划耗时、重规划次数、分布外拒绝率和恢复成功率。特别防止规划器"钻模型漏洞":候选在模型内得分持续升高,但真实回报下降。只有闭环收益在多个随机种子、场景和扰动下成立,才能把预测能力转化为决策证据。

校准与失效检测是硬门槛

决策模型必须输出或派生可检验的不确定性。对离散事件可用 Brier Score、NLL、可靠性曲线和 ECE;对连续状态可检查预测区间覆盖率;对风险选择可画 coverage-risk 曲线:随着模型拒绝更多低置信样本,剩余样本风险是否确实下降。

生成多个 Seed 不能自动视为概率校准。样本可能高度相关、漏掉关键模式,或因采样器温度产生与现实随机性无关的变化。需要验证样本频率是否对应真实事件频率,并区分数据随机性、模型无知与采样噪声。分布外检测也不能只用一个"置信度"字段,必须测试新对象、新动力学、新天气、传感器异常和动作越界时,系统是否可靠转入拒绝、保守规划或人工接管。

如何阅读 Sora、GAIA、Cosmos 与 Genie 的证据

F-O01 OpenAI 的 Sora 技术报告把结果描述为大规模视频模型通向物理世界模拟器的"有前景路径",并明确说明报告以定性评估为主、未给出完整模型与实现细节。报告展示了部分三维一致性、遮挡后的物体保持、简单状态变化和 Minecraft 控制,同时也列出基础物理、状态改变、长时一致性和物体凭空出现等限制。准确结论是:Sora 提供了"规模化视频学习可能产生模拟能力"的证据,不是面向机器人规划的决策世界模型验收。

F-P04 GAIA-1 使用视频、文本和动作输入生成驾驶场景,并报告对自车行为的细粒度控制;GAIA-2 进一步使用自车动力学、其他交通参与者、环境和道路语义等结构化条件生成多视角场景。F-P05 这些工作比纯文本视频模型更接近动作条件预测,但是否可用于具体规划,仍应按动作交换、反事实排序、校准和闭环收益逐项验证,不能仅凭论文自称 world model 就跳过验收。

F-P06 Cosmos 将 World Foundation Model 定位为可经后训练适配到具体 Physical AI 场景的平台,并同时提供视频整理、预训练模型、后训练示例和 Tokenizer。它说明"通用视频基础模型"与"下游定制世界模型"之间仍有适配层,而不是下载权重即可承担决策。

F-P07 Genie 从无动作标签的互联网视频中学习潜动作,并允许用户逐帧控制生成环境。这证明无监督视频中可以提取交互结构,但 latent action 未必与真实机器人的关节、力、速度或安全约束一一对应。把 latent action 映射到执行器仍是独立问题。

四类常见误判

"支持相机控制,所以理解动作后果。" 相机轨迹改变观察坐标,不一定改变环境状态。判定物理动作敏感性时必须固定或显式建模相机。

"能生成一分钟长视频,所以有持久世界状态。" 长度只说明输出范围;必须验证遮挡后的身份、不可逆事件和状态账本,而不是只看局部连贯。

"加入 Action Token,所以模型使用了动作。" 接口存在不代表信息被利用。动作交换、动作屏蔽和梯度/归因对照才能发现条件被忽略或被捷径替代。

"样片物理感很强,所以可以规划。" 规划需要候选排序、概率校准和闭环增益。单条成功样片无法估计失败概率,更无法说明模型不会被规划器利用。

结语

"世界模型"不应成为视频模型升级后的营销后缀。对表示研究,内部状态是否可检验是核心;对预测研究,未来分布是否准确是核心;对决策系统,唯一有工程意义的问题是:模型能否在真实动作合同下可靠比较后果,并让闭环系统做出更好的决定。

因此,视频质量只是起点。动作交换检验因果敏感性,实体持久检验状态账本,多步误差检验 Rollout 稳定性,反事实排序检验规划价值,闭环 A/B 检验最终收益,校准与失效检测决定系统是否知道何时退出。只有这些证据被限定在具体任务、动作空间和风险预算内,团队才有资格把"会生成世界的画面"升级为"能参与世界中的决策"。

FAQ

世界模型一定要有动作输入吗?

不一定;表示型和部分预测型定义可以不含动作,但面向决策的模型必须证明动作条件具有可用语义。

FVD 或视觉相似度高为什么还不够?

它们主要衡量视觉分布,不能证明模型保留了任务状态、反事实排序或控制收益。

先做哪组最小实验?

固定同一初态,只改变动作,并检查未来变化是否稳定、可解释且与真实环境一致。


错误速查卡

症状 根因 定位 修复
模型生成画面很逼真就宣布"可用于决策" 视觉分布与决策效用被等同;未做 L2---L5 验收 检查证据梯子:L0 通过,但 L1 探针、L2 动作交换、L3 持久、L4 校准、L5 闭环是否独立完成 按 L0---L5 逐级验收;通过 L0 只应称"视频生成模型"
加入 Action Token 后未做动作交换就直接用 接口存在 ≠ 信息被利用;模型可能把动作当捷径忽略 固定历史与随机因素只换动作;记录预测状态差、方向、响应延迟 增加无效动作、相同动作不同历史、只改相机参数对照;用动作影响比 I = d(ŝ) / (d(a) + ε) 配合
把"高 FVD / 高视觉相似度"当决策证据 FVD 主要衡量视觉分布;与任务状态、反事实排序、控制收益无直接关系 检查指标:FVD 高但 L1 状态保持、L3 反事实排序、L5 闭环增益是否独立通过 把指标拆为视觉分布 + 状态保持 + 反事实排序 + 闭环增益;按任务相关测
"支持相机控制 = 理解动作后果" 相机轨迹改变观察坐标,不一定改变环境状态 判定物理动作敏感性时是否固定或显式建模相机 固定相机参数重复动作交换测试;把相机控制与执行器命令分开对照
"能生成一分钟长视频 = 持久世界状态" 长度只说明输出范围;状态账本未验证 实体保持率、状态事件 F1、重现位置误差、非法状态逆转率 加入遮挡 / 出画 / 跨镜头重现;检查不可逆事件是否被覆盖
"样片物理感强 = 可规划" 单条成功样片无法估计失败概率;规划需排序、校准、闭环 模型能生成每个候选的漂亮视频,但 Spearman / Kendall 排名相关差、Top-k 命中率低、选择后悔值高 用反事实排序测试 + 闭环 A/B;不要只比较单条视频
"多 Seed = 不确定性覆盖" 采样产生多个候选;样本可能高度相关、漏掉关键模式、采样温度无关 验证样本频率是否对应真实事件频率;区分数据随机性、模型无知、采样噪声 用 Brier Score / NLL / 可靠性曲线 / ECE / 预测区间覆盖率 / coverage-risk 曲线
规划器挑出在模型里得分高、现实中失败的动作 离线预测分数 ≠ 闭环收益;规划器可能利用模型系统性偏差 闭环 A/B 任务成功率、碰撞与近失、人工干预、超时、重规划次数、分布外拒绝率 固定预算下多随机种子、场景、扰动 A/B;防"钻模型漏洞"
探针很强但状态完整度其实很差 "探针很强"只是探针自己完成任务;未设置时间打乱 / 标签泄漏 / 浅层特征 / 等容量基线 L1 状态可读是否设了对照 加入时间打乱、标签泄漏、浅层特征、等容量基线,避免探针自完成任务
模型前三步准确,之后突然身份交换 持久 / 多步误差增长未受控;分位数与灾难事件率未报告 多步误差曲线是否包含分位数、灾难事件率、误差增长形态 报告分位数 + 灾难率 + 增长曲线;必要时降任务或换模型
OOD 输入下模型仍给高置信预测 不确定性未被使用;分布外检测只用一个"置信度"字段 测试新对象 / 新动力学 / 新天气 / 传感器异常 / 动作越界时是否触发拒绝 失效门禁:OOD 识别 → 概率校准 → 不可靠时拒绝 → 退回真实观测或保守控制
反事实排序把碰撞动作排在安全动作之前 模型生成每个候选的漂亮视频,但动作排序错误 排名相关、Top-k 命中率、选择后悔值、危险动作漏判率 复盘是否覆盖接近决策边界的候选;不只测"明显正确"对"明显错误"
把 Sora / Genie 演示当作规划器验收依据 演示是定性评估,不证明动作合同下的稳定对应 报告是否给出完整模型 / 实现 / 量化指标 / 闭环 A/B 把演示当"规模化视频学习可能产生模拟能力"的证据,不是决策世界模型验收
把"加入动作接口"等同于"决策型世界模型" 表示型 / 预测型 / 决策型验收口径不同;只有决策型对本文问题必需动作 三类世界模型最低可检验要求是否分别通过 按表示 / 预测 / 决策三类分别验收;只通过表示型不应称"决策型"
Cosmos 等通用 WFM 被直接接入规划器 "通用视频基础模型"与"下游定制世界模型"之间仍有适配层 是否经过后训练适配具体 Physical AI 场景 适配层不能跳过;用业务数据后训练并按 L2---L5 逐级验收
latent action 被直接映射到执行器命令 latent action 未必与真实机器人关节、力、速度或安全约束对应 映射关系是否经过显式测试与安全门禁 把 latent action 映射视为独立问题;不能默认其可执行
闭环收益只在一个场景 / 随机种子下成立 闭环 A/B 未在多随机种子、场景和扰动下复测 闭环测试矩阵是否覆盖未见场景与扰动 在多个随机种子 + 场景 + 扰动下做闭环 A/B;不通过不能称"决策增益"
公开写作用"理解物理世界 / 通用世界模型" 视频质量 ≠ 决策效用;用词超出证据 是否引用证据梯子中具体证据 改用"在若干样例中表现出 X,范围仍需任务化评测" / "通过了哪些门槛" 等表述

作者:武子康的个人博客

相关推荐
chenyuhao20241 小时前
第一章_自动驾驶中的社会交互
人工智能·机器学习·自动驾驶
思考着亮1 小时前
12.Query改写
agent
洛阳泰山1 小时前
别再为做 AI 去学 Python 了!MaxKB4j:纯 Java 造的企业级 RAG + 工作流引擎,开箱即用
人工智能·开源·agent
fthux2 小时前
GitZip Pro:给GitHub仓库“瘦身”的魔法剪刀手
人工智能·chrome·ai·语言模型·开源·github·open source
武子康2 小时前
Video VAE 不是末端编解码器:5 维-潜网格-主模型 Token 的“表示合同“
人工智能·llm·agent
Sunlly2 小时前
Transcript 不是 Context:用五组实验拆解 OpenClaw 的上下文生命周期
人工智能
ttwuai2 小时前
AI 生成后台改数据后,操作日志别只记按钮:Go + MySQL 怎么验
数据库·人工智能·mysql·golang
糖果店的幽灵2 小时前
我用 Codex + Remotion,做了一条唐朝纸片分层动画
人工智能
KaMeidebaby2 小时前
卡梅德生物技术快报 | 核酸适配体文库测序:核酸适配体文库测序的技术原理、实验流程与数据解析
前端·网络·数据库·人工智能·算法