Two-Pass:监控视频中稀有交通事件的两阶段零样本时空定位

文章目录

一、前言

我们希望找到一个开源的、效果好的方法,但目前来看,连有发表论文的都不多。

二、ACCIDENT @ CVPR 2026

问题:有没有挑战ACCIDENT的baseline效果的论文,ACCIDENT的baseline是达到了什么水平?


一、Baseline 水平(来自基准论文 Picek et al., CVPRW 2026)

基准论文《ACCIDENT: A Benchmark Dataset for Vehicle Accident Detection from Traffic Surveillance Videos》提供了多组 baseline,综合得分( A C C S ACC^S ACCS,三个子任务的调和平均)如下 :

方法 A C C S ACC^S ACCS 得分 说明
Naive Baseline 0.289 最简单的启发式基线
Optical Flow (Kaggle 公开 baseline) 0.251 基于光流的官方公开 notebook
BBox Dynamics (Kaggle 公开 baseline) 0.270 基于边界框动态的官方公开 notebook
Molmo-7B (单 VLM) 0.396 最强单视觉语言模型基线;空间得分高 ( S = 0.596 S=0.596 S=0.596) 但分类弱 ( C = 0.271 C=0.271 C=0.271)
Best-of-Baselines Oracle 0.412 基准论文中所有基线的"最优组合"上限
Human Ceiling 0.843 人类表现天花板

关键结论 :该 benchmark 极具挑战性。即使是把各种 baseline 拼成"最优组合"也只能到 0.412 ,距离人类水平 0.843 仍有巨大差距。分类(Collision Type)是所有方法共同的瓶颈。


二、挑战/改进 Baseline 的顶级论文

1. 🏆 Two-Pass Zero-Shot Temporal-Spatial Grounding(目前最强论文方法)

  • 论文Two-Pass Zero-Shot Temporal-Spatial Grounding of Rare Traffic Events in Surveillance Video
  • arXiv2605.01512 (v2, 2026-05-23)
  • 得分A C C S = 0.539 ACC^S = 0.539 ACCS=0.539 (95% CI: 0.525, 0.553)

相比 baseline 的提升

  • 比 best-of-baselines oracle (0.412 ) 高出 +0.127
  • 比最强单 VLM (Molmo-7B, 0.396 ) 高出 +0.143
  • 比 naive baseline (0.289 ) 高出 +0.250

核心创新

  • 两阶段粗到细 (Coarse-to-Fine) :第一遍以 1 fps 全视频跑一遍,得到粗略的 ( t , x , y , c ) (t, x, y, c) (t,x,y,c);第二遍在 ± 3 \pm3 ±3 秒窗口内以 5 fps 精修时间和位置。
  • 专家分工 (Specialist Role Assignment):Qwen3-VL-Plus 负责时序+空间定位,Gemini 3.1 Flash-Lite 负责碰撞类型分类,各自发挥所长。
  • 全程无需微调 ,仅调用 API,处理全部 2,027 个测试视频成本约 $20

各子任务表现 : T = 0.497 T=0.497 T=0.497, S = 0.538 S=0.538 S=0.538, C = 0.591 C=0.591 C=0.591。其中分类 C = 0.591 C=0.591 C=0.591 是目前报告的最高值。


2. Kaggle 竞赛实际排名(比赛已结束)

ACCIDENT @ CVPR 2026 作为 Kaggle 竞赛,最终排名如下 :

排名 队伍 Private LB 得分 备注
🥇 第1名 GOOD DRIVE Team (GO Drive Inc) 0.57080 竞赛冠军,方法未公开为论文
🥈 第2名 Crocodiles 0.49515
第10名 binga (Agentic Multimodal Harness) 0.44718 开源方案,top ~9% (106队参赛)

注意:竞赛第1名 0.57080 是目前该 benchmark 上的最高分,但尚未见相关论文发表。已发表论文中的最高分是上述 Two-Pass VLM 的 0.539


3. 其他相关论文(零样本流水线)

  • Thakur & Talele (arXiv:2604.09685v1) :提出了模块化的零样本流水线(帧差 z-score + Farneback 光流 + CLIP),Public LB 得分 0.2523,基本与 Kaggle Optical Flow baseline (0.251) 持平。该论文的价值在于展示了完全不用微调、仅用传统 CV + CLIP 能做到什么程度。

三、总结对比图

复制代码
       Optical  | Naive | Molmo | Two-Pass | GOOD  | Human
       Flow     |       | -7B   | VLM      | DRIVE | Ceiling
       (0.251)  | (0.289| 0.396 | (0.539)  | (0.571| 0.843)
                |       |       |          |       |
       [Kaggle  | [基准 | [基准 | [论文    | [竞赛 | [基准
        公开]   |  论文]|  论文]|  已发表] |  冠军]|  论文]

一句话结论 :ACCIDENT 的 baseline 很低(官方公开 notebook 仅 0.25~0.27),但已有论文方法将其大幅提升至 0.539 (Two-Pass VLM),竞赛冠军更是达到 0.571 。当前最大的瓶颈仍然是碰撞类型分类 (C)和合成域到真实域的迁移(sim-to-real gap)。

三、监控视频中稀有交通事件的两阶段零样本时空定位

论文基本信息

项目 内容
论文标题 Two-Pass Zero-Shot Temporal-Spatial Grounding of Rare Traffic Events in Surveillance Video
作者 Jiantang Huang
机构 文中未明确标注,但从配图水印推测与 University of Virginia(弗吉尼亚大学) 相关
发表状态 arXiv 预印本 arXiv:2605.01512v1 cs.CV ,2026年5月2日发布;论文关联并评测于 CVPR 2026ACCIDENT 挑战赛

研究背景与问题

在交通监控视频中自动检测并定位稀有交通事故是一个极具价值但困难的任务:

  • 真实事故视频标注稀缺,且常因隐私/责任问题禁止在真实事故数据上训练
  • 需要同时输出三个维度:时间(t)空间位置(x, y)碰撞类型(c)
  • ACCIDENT@CVPR 2026 基准为此设立:允许在 2,211 段 CARLA 合成视频上开发,但测试集为 2,027 段真实 CCTV 视频且禁止在真实事故上训练

核心方法

论文提出了一种**无需微调(no-finetuning)**的零样本 VLM 管道,核心包含两大设计:

1. 两阶段粗到细(Coarse-to-Fine)分解
  • Pass 1(粗定位) :用 Qwen3-VL-Plus1fps 采样全视频(≤30帧,720px),输出粗略的 (t₁, x₁, y₁, c₁)
  • Pass 2(细定位) :在 t₁ ± 3s 窗口内以 5fps1024px 重新采样,再次用 Qwen3-VL-Plus 细化时间和空间到 (t₂, x₂, y₂)
  • 两个确定性置信门控
    • Gate 1(时间回退) :若 t₂ = -1 或靠近窗口边界(<0.3s),则回退到 t₁
    • Gate 2(空间合并) :若 x₂, y₂0,1000² 网格上被边缘截断(<10 或 >990),则回退到 (x₁, y₁)
2. 专家角色分配(Specialist Role Assignment)
  • Qwen3-VL-Plus 负责时空定位(T + S)
  • Gemini 3.1 Flash-Lite Preview 负责碰撞类型分类(C) :在 t* 时刻提取 5s 视频片段(以 Pass 1 中心点做 2.5× 裁剪)进行类型重分类
  • 原因:Qwen3-VL 的类型准确率(0.462)远低于其空间能力,而 Gemini 在分类上更强
3. 物理回退(Fallback)
  • 17% 的视频因 API 失败回退到 YOLO + ByteTrack + 基于规则的物理模块

实验结果(ACCIDENT@CVPR 2026,2,027 段真实 CCTV)

指标 本文方法 对比基线
ACCS(综合得分) 0.539 0.525, 0.553 最佳基线 oracle: 0.412;Molmo-7B: 0.396;人类上限: 0.843
时间 T 0.497 ---
空间 S 0.538 Molmo-7B: 0.596
类型 C 0.591 本文 Pass 1 仅 Qwen: 0.474
  • 提升幅度:+0.127 超过最佳基线 oracle,+0.143 超过最强单 VLM(Molmo-7B)
  • 成本 :完整测试约 **20**(约 0.01/视频),每视频最多 3 次 API 调用

关键发现与失败分析

  1. 时间滞后偏差 :VLM 平均偏向碰撞后 +1.55s(选中碰撞后的残骸帧而非接触瞬间)
  2. 视频长度退化:时间 MAE 从 ≤10s 视频的 0.94s 增长到 ≥20s 视频的 >4s
  3. 类型混淆
    • 79% 的 head-on(正面碰撞) 被误分为 t-bone(侧面碰撞)
    • 39% 的 sideswipe(刮擦) 被误分为 rear-end(追尾)
  4. 物理-VLM Oracle :若将 YOLO+物理模块(6.63s MAE)与 Qwen Pass 1(3.20s MAE)取最优组合,时间 MAE 可降至 2.13s

贡献总结

  1. 首个无需微调的粗到细两阶段 VLM 定位管道,带确定性置信门控
  2. 跨 VLM 专家角色分配,将类型准确率从 0.474 提升至 0.591(+25%)
  3. 系统的失败模式诊断(滞后偏差、长度退化、类型混淆)
  4. 在 ACCIDENT@CVPR 2026 上达到 ACCS = 0.539,显著超越所有零样本基线

摘要

在真实CCTV监控录像中定位交通事故是一个稀有事件问题 ------在标注的事故视频上进行训练通常是被禁止的,但同时又需要对时间、空间和碰撞类型 进行准确的联合定位。我们提出了一种无需微调的管道,通过两个核心思想从冻结的视觉-语言模型(VLM)中提取这种联合输出。

第一,由粗到细的两阶段分解: 以1帧/秒对全视频进行第一遍处理,生成一个粗略的 ( t , x , y , c ) (t, x, y, c) (t,x,y,c) 元组;然后在 ± 3 \pm 3 ±3 秒窗口内以5帧/秒进行第二遍处理,细化时间和位置。配有两个确定性的置信门控:当第二遍结果靠近窗口边界或坐标被边缘截断时,自动回退到第一遍的粗略估计。

第二,专家角色分配: Qwen3-VL-Plus 负责时空定位,Gemini 3.1 Flash-Lite 负责对居中裁剪的视频片段进行碰撞类型分类。

ACCIDENT@CVPR 2026 基准测试(2,027段真实CCTV视频)上,我们达到 A C C S = 0.539 ACC^S = 0.539 ACCS=0.539(95% 置信区间 0.525, 0.553):

  • 比基准论文的最佳基线组合 oracle (0.412)高出 +0.127
  • 比最强单VLM基线 (Molmo-7B,0.396)高出 +0.143
  • 朴素基线 (0.289)高出 +0.250

VLM路径每段视频最多调用三次API(17%在API失败时回退到基于物理的方法);完整运行成本约为 20美元 。我们进一步诊断出VLM时间定位存在 +1.55秒的滞后偏差 、随视频长度增长的性能退化,以及物理-VLM组合oracle可达到 2.13秒 的时间MAE,并指出了具体的后续改进方向。

1. 引言

交通事故是稀有的、安全关键的事件:从CCTV中自动检测事故的收益很高,但现代监督式识别所需的大规模标注事故视频难以获取,且隐私和责任问题通常禁止在真实事故数据上进行训练。ACCIDENT@CVPR 2026 基准 14 正是针对这一制度设计的------2,211段CARLA合成视频用于开发,2,027段真实CCTV片段用于测试,并全面禁止在真实事故视频上训练。每段视频必须在时间、空间和碰撞类型 三个维度上进行联合定位,系统得分由三个子任务得分的调和均值 A C C S ACC^S ACCS 计算。

调和均值协议会惩罚薄弱项。官方Kaggle公开基线笔记本 11(光流法、边界框动力学)得分分别为 A C C S = 0.251 ACC^S=0.251 ACCS=0.251 和 0.270------甚至低于朴素基线的 0.289 14。最强的单VLM方法(Molmo-7B 4,0.396)在空间定位上表现优异( S = 0.596 S=0.596 S=0.596),但在类型分类上失败( C = 0.271 C=0.271 C=0.271);基准论文的最佳基线组合 oracle 达到 0.412;人类上限为 0.843。要在不训练的情况下缩小这一差距,就必须超越手工设计的基元和单次VLM提示。

我们的出发点是:现代视觉-语言模型------Qwen3-VL-Plus 1 和 Gemini 3 7------已经原生支持时空定位功能:文本时间戳对齐、 0 , 1000 2 0, 1000^2 0,10002 坐标输出,以及长上下文视频窗口。然而,对这些模型进行朴素的零样本使用仍然表现不佳,数据中可以观察到两个原因。对整段视频的单一前向传播必须在粗略的时间覆盖精细的时间分辨率 之间做出权衡;而且任何单个VLM通常只在三个子任务中的某一个子集上最强。我们通过以下方式解决这两个问题:采用由粗到细的两阶段分解 ,仅对高显著性邻域进行细化;以及专家角色分配,将类型分类交给第二个VLM,其视频分类器在该维度上优于定位模型。

贡献。

(i) 一种无需微调 的由粗到细两阶段VLM定位管道,带有确定性时间和空间置信门控,与 9 中需要训练的层次化定位形成对比。

(ii) 一种专家角色拆分 ------Qwen3-VL 负责 T + S T+S T+S(时间+空间),Gemini 3.1 负责 C C C(类型)------将全测试集类型准确率从 0.474 提升至 0.591(相对提升 +25%)。

(iii) 一项系统的失败分析 :+1.55秒滞后偏差、随视频长度增长的性能退化,以及物理-VLM组合oracle达到 2.13秒 MAE(−33.5%)。

(iv) 在 ACCIDENT@CVPR 2026 上, A C C S = 0.539 ACC^S=0.539 ACCS=0.539(置信区间 0.525, 0.553):比基准论文的最佳基线组合 oracle 14 高出 +0.127,比最佳单VLM(Molmo-7B 4,0.396)高出 +0.143,API成本约 20美元

2. 相关工作

基于视频的交通事故检测 已有十余年的研究历史,涵盖监督式CCTV分类(CADP 15、TAD 21)、行车记录仪上的无监督检测(DoTA 22),以及基于时空注意力的事故预测(DSTA 12、CCD 2);近期的一篇综述对该领域进行了系统梳理 5。这些工作几乎无一例外地需要在标注的事故视频上进行训练。ACCIDENT@CVPR 2026 挑战赛 14 打破了这一假设:提供 2,211 段 CARLA 合成视频用于开发,但 2,027 段真实CCTV测试视频禁止在真实事故数据上训练。与我们的工作同期,Thakur 和 Talele 16 提出了一种模块化的零样本管道(帧差峰值用于时间定位、Farneback 光流质心用于空间定位、CLIP 相似度用于类型分类),达到 A C C S = 0.252 ACC^S=0.252 ACCS=0.252。

VLM 时间定位 随着经过训练的Video-LLM快速发展。VTimeLLM 10、TRACE 8 和 Grounded-VideoLLM 18 分别引入了时间戳令牌、因果事件建模或双流编码器------均在专门的视频-时间定位语料库上进行了微调。ReVisionLLM 9 在精神内核上与我们的方法最为接近,对长达数小时的视频应用递归的由粗到细定位,但其层次结构是通过层次化训练 实现的。Qwen3-VL 1 和 Gemini 3 7 则原生支持时空定位(对象级视频轨迹、文本时间戳对齐),为免训练使用打开了大门。

零样本 / 免训练稀有事件定位与异常检测 目前由 CLIP 风格的适配器主导------AnomalyCLIP 24、VadCLIP 20------它们仍需要辅助异常数据或弱标签。LAVAD 23 是首个完全免训练的视频异常检测管道,但依赖于逐帧VLM描述生成和LLM后聚合,丢失了空间定位能力。层次化视频系统如 VideoTree 19 和 VideoMiner 3 专注于长视频问答,而非精确的 T + S + C T+S+C T+S+C(时间+空间+类型)稀有事件输出。定位型VLM------Molmo 4、SigLIP 2 17、DINOv2 13------擅长指向定位,但通常隐式地处理时间维度。

我们的方法结合了三个选择:(i) 免训练 ,仅使用冻结的VLM;(ii) 两阶段由粗到细的VLM原生定位 ,而非独立的"描述生成→LLM"流程或需要训练的层次结构;(iii) 跨两个VLM的专家角色分配

相关推荐
D202020207 小时前
TikTok Shop禁止AI语音直播落地后,跨境卖家如何通过达秘合规调整带货内容
人工智能
像风一样自由20207 小时前
20.Milvus常见问题检索不到维度错误和数据一致性
人工智能·大模型·milvus
现代野蛮人7 小时前
【深度学习实验】—— 基于 LSTM 与 Optuna 调参的丙型肝炎预测
人工智能·深度学习·lstm
支支დ7 小时前
VO by Vercel 前端特定优势:为什么它是构建 AI 应用的新范式
前端·人工智能
ZGIAI8 小时前
ZGI 让那些"等你去处理"的事,真正跑起来
人工智能·架构
ZGIAI8 小时前
ZGI:别再做Agent Demo了,先问问它在业务里能不能撑过下周三
人工智能·架构
香芋芋圆8 小时前
AI 冲击内卷之下,普通前端如何破局?WebGIS—— 低门槛突围赛道
前端·javascript·人工智能·学习·职场发展
m0_614523558 小时前
完整教程|输入一句描述,能不能直接生成一段可以继续剪辑的视频:写结构化描述到生成短样片
人工智能·音视频
stormzhangV9 小时前
AGI 时代终于来了!
人工智能·openai
清风百草9 小时前
【05】AI辅助文档管理:开发者的效率革命
人工智能·ai辅助文档管理·开发者的效率革命