一、Motivation:模型不是"看不见",而是"不肯看"
Video-LLM 在通用视频理解上已经很强,但在细粒度物理推理 上系统性失效:悬浮、刚体穿透这类明显违反物理的现象都识别不出来。以往的解释是"模型只学到了视觉-文本相关性",本文进一步追问:这到底是感知不行 ,还是推理被劫持?
作者用一个"小球撞多米诺"的场景做了拆解,发现两类失败是成对出现的:

- 反物理(Anti-Physics)场景 :小球没接触多米诺,但骨牌倒了。GPT-4o 不但没识别异常,反而编造"初始动能传递"来强行自洽 → 这是 逻辑先验 ("世界必须符合常识")压倒了视觉证据,称为 强行合理化(Forced Rationalization)。
- 反直觉(Counter-Intuitive)场景 :小球擦过多米诺、根本没碰上(物理上完全合法)。模型无视那道明显的空隙,直接输出"金属球精准击中第一块骨牌,触发经典多米诺效应" → 这是 统计先验 ("球+多米诺 = 碰撞")压倒视觉证据,称为 刻板输出(Stereotypical Output) ,即 what-it-expects-is-what-it-sees。
两个 pilot study 排除了"知识/感知缺陷"这两个替代解释:
- 不是知识不够 :给 VideoLLaMA3 注入物理知识 QA 做 SFT 后,反物理场景的错误更严重了(知识反而成了编故事的素材)。
- 不是感知不行:单帧输入下问"球和骨牌的空间关系",模型能准确回答"两者未接触,中间有明显空隙"。
于是作者提出 Unified Attribution Theory(统一归因理论) :两类失败是同一个病因的两种表现形式 ------ Semantic Prior Dominance(语义先验支配) 。视觉编码器是好的,坏的是推理链路:它被内部的"叙事脚本"劫持,用主观预期覆写了客观视觉证据。
二、Related Work:三条已有路线各自的坑
2.1 Video-LLM 的物理推理
交互密集的 benchmark(PhysBench、MotionBench)放大了刚体动力学、空间接触上的缺陷。已有文献多把这种"视觉忽视"归入多模态幻觉(VideoHallucer、EventHallusion、Argus、NOAH)。作者的批评是:把它当成"故事续写缺陷"会错失物理缺陷的本质 ------ 评估物理推理要从宏观时序连贯性下移到即时的、低层的空间感知。
2.2 缓解手段的三种范式及其局限
| 范式 | 代表 | 局限 |
|---|---|---|
| 架构改造 | TRAVL、PhyVLLM、trajectory attention | 引入 tracker / Neural ODE,计算开销大,跨场景跨底座泛化极差 |
| 推理期干预 | SEASON(对比解码)、GAVIE | 只改 logits,是表面补丁,没动内部权重里的先验 |
| RL 对齐 | DPO/GRPO 系:VideoHallu、Video-R1、VideoChat-R1 | 高维多模态空间收敛不稳定 |
本文选的是第四条路:架构无关 + 轻量(VARC + 标准 LoRA)。
2.3 物理感知视频数据集
Impossible Videos、TRAVL、WorldModelBench 等的负样本,是从 T2V 模型(SVD / Sora / Kling / Veo)里被动捞取生成失败 。问题致命:把生成伪影(纹理闪烁、物体融化)和真正的物理谬误混在一起,模型学到的是"伪影检测器"这个 shortcut,而不是物理推理。
→ 这正是 PACC 要解决的:合成视觉上干净、物理上非法的成对视频("Visually Plausible, Physically Invalid")。
三、Method:PACC(数据) + VARC(推理格式) + 成对梯度抑制(训练)
3.1 PACC 数据集的分类体系:2 流 × 8 维

分类不是随便列 edge case,而是对齐发展心理学的 Core Knowledge 理论(Spelke、Baillargeon)和经典直觉物理 benchmark(IntPhys、CLEVRER),映射到三条基础原则:时空连续性(Temporal)、物体凝聚/永恒性(Permanence)、机械接触(Interaction)。
Stream 1: Anti-Physics(打击"强行合理化")
- Temporal Fallacies(时间线性与因果顺序)
- ① Coherence Violation:微观时序连续性被破坏(正常走路视频帧打乱 → 人随机传送)
- ② Causal Reversal:宏观因果倒置(花瓶先碎在地上,之后才看到它掉落)
- Permanence Fallacies(质量守恒与形态稳定)
- ③ Existence Violation:物体凭空出现/消失(小球被遮挡后消失;小布下掀出巨物)
- ④ Identity Violation:内在属性无外因突变(狗无缝变成羊;一个弹球分裂成多个)
- Interaction Fallacies(因果一致性)
- ⑤ Dynamic Violation:牛顿定律 / 力平衡 / 熵箭头(玩具鸭无外力自己动;抛物线消失走直线;跷跷板重端悬空;碎片自发重组)
- ⑥ Constraint Violation :因果量级失配 / 环境约束 / 刚体失效(水下燃烧;小石头掀巨浪;机械臂穿墙;强光下瓷杯没有影子)
Stream 2: Counter-Intuitive(打击"刻板输出") ------ 注意这一流物理上是完全合法的,是"陷阱样本":
- ⑦ Near-Miss:轨迹进入交互区但存在清晰空隙,接触没发生(球擦过多米诺;脚踢空)
- ⑧ Consequence Arrest:起始动作成立,但预期后果被阻断(锤子砸玻璃但玻璃完好;杯子倾斜但水没洒出)
成对设计(Positive / Negative pair) 是关键:每条负样本都有对应的正常正样本。这提供了对比信号,迫使模型定位具体的物理违背点,同时防止模型塌缩成"一律预测异常"的 shortcut。
3.2 PACC 构建流水线:HITL 四阶段

素材来自 SSv2、PhysBench、Panda-70M、ImplausiBench、ActivityNet、Physics-IQ 以及 Pexels。
- Stage 1 Selection & Clipping :人工筛选只含单一物理交互的高质量源视频,LLM 辅助映射到目标分类维度并标注目标谬误场景,裁掉冗余帧 → 得到"原子级"正样本。
- Stage 2 Visual Fact Anchoring :用多模态 LLM(Gemini 3.1 Preview)生成纯观察性 caption ,专家清洗:(a) 去幻觉,(b) 严禁物理推测(不许写"因重力而下落")→ 得到纯视觉事实锚点。
- Stage 3 Adversarial Generation & Label Synthesis :按"是否需要合成新像素"路由分流:
- Deterministic Manipulation(手工 CV 编辑):只需重排已有像素/时序操作的(帧打乱、mask 擦除),用 SAM2 + ProPainter。
- Generative Synthesis(AI 生成):需要新像素或改物理属性的(形态突变、轨迹偏移),用 Kling 等 prompt 驱动生成。
- 同时由 LLM 合成配对的 CoT 标签(Observation / Attribution / Verdict)。
- Stage 4 Final Verification :双重专家复核。Video Verification 确保负样本是无歧义的物理谬误(丢弃那些"看起来只是生成失败"的样本 ------ 这就是伪影解耦落地的地方);Logic Verification 审查标签归因逻辑的科学正确性。
统计 :758 对高保真对抗视频(1516 个独立 clip),平均时长 4.0 秒。分布:Dynamic 27.1%、Constraint 19.0%、Near-Miss 14.1%、Coherence 11.1%、Causal Reversal 11.1%、Identity 6.1%、Consequence Arrest 6.1%、Existence 5.4%。
3.3 VARC:Visual-Anchored Reasoning Chain

传统 Video-LLM 估计 P(y∣V,Q)P(y|V,Q)P(y∣V,Q),在先验支配下退化为视觉无关的捷径 P(y∣Q)P(y|Q)P(y∣Q)。VARC 把推理写成一条有向 Markov 链,插入中间的视觉观察 OOO 与模型内置物理知识 K\mathcal{K}K:
P(y∣V,Q)≈P(O∣V)⋅P(A∣O,K)⋅P(y∣O,A)P(y|V,Q) \approx P(O|V)\cdot P(A|O,\mathcal{K})\cdot P(y|O,A)P(y∣V,Q)≈P(O∣V)⋅P(A∣O,K)⋅P(y∣O,A)
- Step 1 Forced Observation ∼P(O∣V)\sim P(O|V)∼P(O∣V):只允许描述低层空间关系与状态变化(例如显式写出"存在空隙"),禁止提前下判断。
- Step 2 Causal Attribution ∼P(A∣O,K)\sim P(A|O,\mathcal{K})∼P(A∣O,K):在 OOO 条件下调用物理知识,靠 OOO 与 K\mathcal{K}K 的逻辑冲突去检测谬误(例如"水下燃烧在热力学上不可能"),而不是编造隐藏变量去圆场。
- Step 3 Evidence-Based Verdict ∼P(y∣O,A)\sim P(y|O,A)∼P(y∣O,A):最终判定被前两个节点严格约束。
3.4 对抗课程与成对梯度抑制
SFT 时把对齐的正负样本联合优化 :pair 间随机采样,pair 内顺序绑定 (梯度累积步数设为 4,保证一次反传里正负样本同时在)。这样产生 Gradient Suppression :来自共享视觉语义(背景、光照、静态外观)的梯度被相互抵消,优化自然绕过静态视觉分布,收敛到核心物理差异上。
由于 pilot study 已证明低层感知完好,视觉编码器冻结 ,LoRA 只加在视觉 projector + LLM backbone ,精准打击推理瓶颈。得到的模型叫 PhyAR(Physics-Anchored Reasoner)。
四、Experiments
4.1 设置
- 底座:VideoLLaMA3-7B;训练集 604 对(1208 视频),3 epoch,LoRA (r=16, α=32, dropout=0.1),lr 5e-5,cosine,8-bit AdamW,4-bit NF4 量化 + bf16 计算 + FlashAttention-2。
- 算力 :8 × RTX A6000,全程 SFT 约 4 小时(轻量确实是卖点)。
- 测试集 :154 对 / 308 视频。所有模型统一 16 帧、greedy decoding(
do_sample=False,temperature=0)、max_new_tokens=2048、统一 VARC prompt、baseline 零样本。 - 指标 :
- PCA(Pair-wise Consistency Accuracy) :正负样本都对才算这一对正确 ------ 直接掐死"一律答 Real"的 Yes-bias。
- RAS(Reasoning Alignment Score,1--5) :Gemini 2.5 Pro 做 LLM-as-a-Judge,且强制 accuracy 与 score 对齐(判定错 → 只能给 1--2;判定对但推理是幻觉 → 3)。
- RPB(Relative Prior Bias) :借 Michelson 对比度,RPB=Accpos−AccnegAccpos+AccnegRPB = \frac{Acc_{pos} - Acc_{neg}}{Acc_{pos} + Acc_{neg}}RPB=Accpos+AccnegAccpos−Accneg,直接量化先验支配程度。
4.2 主结果
PCA(Avg.) :PhyAR 41.56% > Gemini 2.5 Flash 40.91% > GPT-4o 38.31% >> Qwen3.5-35B 13.64% > VideoLLaMA3-7B 7.79%(底座);Video-ChatGPT / Flash-VStream 仅 0.65%。
几个值得注意的点:
- 反直觉流是碾压式提升:Near-Miss 68.20(GPT-4o 45.50 / Gemini 27.20)、Consequence Arrest 70.00(两家闭源都是 40.00)。这一流恰恰是"必须老实看画面"的地方。
- 反物理流里闭源模型仍有局部优势:Dynamic Violation 上 Gemini 45.20 / GPT-4o 35.70 > PhyAR 28.60;Existence 上 GPT-4o 55.60 > PhyAR 22.20。作者归因于闭源模型庞大的预训练世界知识。
- 小开源模型是系统性塌缩:默认全部预测"物理合理",所以负样本几乎全错,PCA 被 pair 约束直接打到接近 0。
RAS(Avg.) :Gemini 2.5 Flash 2.286 > GPT-4o 2.120 > PhyAR 2.036 >> Qwen3.5-35B 1.477 > 其余开源基本贴在 1.0 下界(VideoLLaMA3 1.237)。但在反直觉两类上 PhyAR 超过所有 baseline (N-Miss 2.523、C-Arrest 2.950)。作者的结论很有意思:生成能力(会写漂亮的物理解释)无法补偿反直觉场景下的"事实性失明"。
4.3 消融
| 方法 | PCA Avg. | RAS Avg. |
|---|---|---|
| Baseline SFT | 24.68 | 1.760 |
| w/o VARC | 28.57 | 1.802 |
| w/o Pair-wise | 29.22 | 1.763 |
| PhyAR (Full) | 41.56 | 2.036 |
两个组件缺一个都掉 12+ 个点,且存在明显的协同效应(28.57 和 29.22 都远小于 41.56,而 baseline SFT 是 24.68)------ 说明"格式约束"和"梯度层面的先验抑制"打的是同一个病的两个面。
4.4 先验偏置分析(RPB)
| 指标 | VideoLLaMA3 (base) | PhyAR |
|---|---|---|
| AccposAcc_{pos}Accpos (%) | 93.1 | 79.9 |
| AccnegAcc_{neg}Accneg (%) | 10.8 | 48.1 |
| Overall Acc (%) ↑ | 51.9 | 64.0 |
| RPB (%) ↓ | 79.1 | 24.9 |
底座 93.1 / 10.8 的巨大落差就是"先验支配"的量化证据:遇到熟悉的物理概念就默认点头。PhyAR 把 RPB 从 79.1 压到 24.9,同时整体准确率从 51.9 提到 64.0。注意 AccposAcc_{pos}Accpos 是下降的(93.1 → 79.9) ------ 这是"去 Yes-bias"必然付出的代价,好在净收益是正的。
4.5 定性
- 反物理(液体持续注入但杯中液面不上升):baseline 输出"无可见异常,Real";PhyAR 观察到"液面保持静止" → 归因"违反质量守恒" → Forged。
- 反直觉(杯子掉落但完好无损 ):baseline 直接编造出"碎裂"事件去迎合统计预期;PhyAR 锚定"杯子完好" → 归因"合理的弹性碰撞" → Real。
五、Conclusion & Limitations
- 提出 Unified Attribution Theory ,把反物理下的"强行合理化"与反直觉下的"刻板输出"统一归因为 Semantic Prior Dominance。
- 构建 PACC :首个基于物理定律程序化合成、严格解耦生成伪影与物理谬误的成对对抗视频数据集。
- 设计 VARC :强制"观察 → 归因 → 判定",机制性阻断先验劫持;配合成对梯度抑制 + 标准 LoRA,零架构改动取得显著提升。
- 局限 :受严格 HITL 专家验证限制,PACC 目前只有 758 对。作者主张这是"有意的取舍"------ 优先保真度与物理严谨性,把它定位成 CLEVRER / IntPhys 式的精准诊断 benchmark,未来探索自动化合成以扩规模。
- Broader Impact 里也坦诚了 dual-use 风险:合成高保真物理异常视频的管线可被用于 deepfake,建议强制水印;反过来 PACC 也能用于训练"基于物理不一致性而非像素伪影"的深度伪造检测器。