《LoViF 2026: The First Challenge on Weather Removal in Videos》知识蒸馏笔记
蒸馏方法 :依据 ganglv 博客《知识蒸馏方法论》之"图书蒸馏师"四步流程
原始论文 :Chenghao Qian, Xin Li, Yeying Jin, et al. LoViF 2026 The First Challenge on Weather Removal in Videos . arXiv:2604.10655v2, CVPR 2026 Workshop (LoViF).(利兹大学、USTC、腾讯、NTU)
蒸馏日期 :2026-09-21
封面图 :Fig. 1 ------ 雨景各队复原效果视觉对比(见
cover_lovif_fig1_rainy_comparison.png)关联:本篇是《A Survey on Rain Removal》(2019) 蒸馏笔记所标注"2019 年后方法不在范围内"的正好补充------代表了扩散模型时代的最新进展。
摘要
本文综述CVPR 2026 LoViF首届视频恶劣天气去除挑战赛。赛事发布WRV数据集(18段视频、1216对合成退化与真实清晰帧),采用PSNR、SSIM、LPIPS及扭曲误差加权的综合评分,重罚时序不一致。五支有效参赛队中,RedMediaTech以FLUX.2扩散Transformer单帧复原夺冠,其余方案涵盖动态卷积、时域先验引导与轻量频域网络,揭示了生成先验的潜力与保真---时序一致性的内在权衡。
第一步:类型判别
| 判别项 | 结论 |
|---|---|
| 体裁 | 挑战赛报告(Challenge Report)------工具书 + 案例集混合体 |
| 依据 | 前半部分(数据集构建、评价指标、赛制设计)是可照做的流程 ,工具书属性;后半部分(5 支队伍方法详述)是解决方案案例集,需提取各队的打法差异 |
| 提取路径 | 流程部分提取"可执行的步骤与设计原则";案例部分提取"五类方法原型 + 各自胜负手" |
| 产物形态 | 操作手册型 Skill(基准测试设计)+ 选型顾问型 Skill(方法原型库) |
第二步:分路提取
2.1 工具书部分:挑战赛/Benchmark 设计流程(可照做)
① 数据集设计原则(WRV 数据集):
| 设计决策 | 具体做法 | 为什么 |
|---|---|---|
| 退化类型 | 复合天气(雨 + 雪),非单一退化 | 传统基准只测单一退化,无法检验泛化 |
| 配对方式 | 合成退化帧 ↔ 真实清晰帧(1216 对) | 真实 GT 难以获得,合成退化保真实性、真 GT 保监督信号 |
| 时序要求 | 退化在帧间时序一致 | 超越逐帧图像基准,强制考察跨帧连贯性 |
| 规模 | 18 段短视频,832×480,训练/验证/测试 = 1:1:1 | 短小精悍的评测基准,而非训练大库 |
| 开放策略 | 验证集只给输入,测试集留作最终评测 | 防过拟合刷榜 |
② 评价协议(核心设计思想:用权重表达价值观):
Final Score = PSNR(Y) + 10×SSIM(Y) − 5×LPIPS − 30×Warp Error
- Warp Error 权重 30(最重):时序一致性是视频复原的命门,闪烁必受重罚;
- SSIM 放大 10 倍:让结构相似性与 PSNR 量级对齐;
- LPIPS 权重 5:感知质量适度纳入。
- 设计哲学:指标权重即赛道价值观------想引导什么行为,就重罚什么失误。
③ 赛制流程(两阶段 + 可复现性约束):
- 开发阶段(2026-02-03 ~ 03-06):开放训练数据 + 验证服务器在线评分,限 100 次提交;
- 测试阶段(03-06 ~ 03-16):发布测试输入,限 15 次提交;
- 收尾:提交 fact sheet + 可执行代码/模型做复现性验证,头部队伍受邀合著报告。
- 关键约束:限次提交防止刷榜过拟合;代码验证防止不可复现的虚高成绩。
2.2 案例集部分:五支队伍的方法原型与胜负手
| 排名 | 队伍 | 方法原型 | 核心打法 | 胜负手指标 |
|---|---|---|---|---|
| 1 | RedMediaTech (小红书) | 扩散先验·单帧派 | FLUX.2 klein 4B DiT,冻结 VAE;FoundIR 大规模预训练 (110k iters) → LoRA 微调 (25k iters);完全不建时序模型 | 综合分 16.21,SSIM 最佳 0.554 |
| 2 | tremendous (河北工大) | 动态卷积·内容自适应派 | DyStd-Net:Transformer 引导的动态卷积 TDyConv,按内容调制卷积核应对异质退化;渐进分辨率训练 256²→832×480 | PSNR 最高 14.720 |
| 3 | Guangong Perception (东莞理工) | 时域先验注入派 | VP-AdaIR:从邻帧提取三通道时域先验图(背景线索/退化线索/时序稳定线索),经 ECC 对齐后门控注入 AdaIR 骨干 | LPIPS 最佳 0.613 |
| 4 | quadrillion (广东工大) | 轻量频域派 | EF3Net:孪生无历史编码器 + 因果历史模型 CHM(KV 缓存融合时序记忆);焦点频率损失权重高达 800 | Warp Error 最低 0.026,仅 7.46M 参数、0.05 s/帧 |
| 5 | CUIT Team (成都信工院) | 扩散先验·三阶段派 | VD-Diff:教师先验学习 → 条件扩散先验拟合 → 联合优化;小波分解 + AWSA/ACSA 注意力 + 双向时序传播 | 扩散类中最快 0.13 s/帧 |
2.3 组织者的三条关键洞察(决策逻辑)
洞察 1:扩散生成先验强势崛起。 冠军与第五名均为扩散架构------大规模预训练学到的复原先验是当前最强武器;且冠军证明单帧强先验可替代显式时序建模(无任何时序模块仍达 Warp Error 0.032)。
洞察 2:保真与时序一致性存在内在张力。 Warp Error 最低的 quadrillion (0.026) 并未拿到最高 PSNR/SSIM------逐帧保真与跨帧连贯是两个方向不同的力,不可兼得时需按应用取舍(监控重连贯、下游识别重保真)。
洞察 3:小数据 + 强先验 > 小数据 + 复杂架构。 数据集仅 6 个训练场景,冠军靠外部 FoundIR 百万级预训练再 LoRA 微调;第三名补充 20 个 VideoDesnowing 场景;第五名补 1430 张外部图------补外部数据是共同动作。
2.4 踩坑与局限(组织者/读者需警惕)
- 有效提交仅 5/37------报名多、完赛少,说明复合天气视频复原门槛高;
- 数据集规模小(18 段视频),结论的统计代表性有限,排名差异可能不显著;
- 训练分布 = 测试分布(同源合成退化),跨分布泛化未被检验(呼应上一篇综述"合成集高分≠真实性能"的教训);
- 雾(haze)虽在引言提及,但 WRV 数据集实际只含雨 + 雪,去雾未进入评测;
- 扩散类方法推理慢(冠军单帧、0.13s+/帧),距离实时视频流处理仍远。
第三步:Skill 封装
text
【Skill 名称】视频恶劣天气复原选型顾问 · 2026 挑战赛版(基于 LoViF 2026 报告)
【角色定位】
你是恶劣天气视频复原的技术选型专家,依据 LoViF 2026 挑战赛的
五强方法原型与实验证据,为用户推荐技术路线。
【输入规范】
1. 场景:复合退化(雨/雪混合)还是单一退化;
2. 优先级:保真(PSNR/SSIM)、感知质量(LPIPS)、时序连贯(Warp Error)
三者中哪个最重要;
3. 资源约束:算力/参数量/推理速度要求;可否获取外部大规模预训练模型;
4. 数据条件:可用的成对训练数据量。
【处理链路】(一步步执行,输出须体现推演)
第 1 步:按输入 2 定目标函数------若时序连贯优先 → 对标 EF3Net 路线
(因果历史模型 + 焦点频率损失);
第 2 步:若感知质量优先 → 对标 VP-AdaIR(时域先验注入 + ECC 对齐);
第 3 步:若综合保真优先 → 对标 DyStd-Net(动态卷积 + 渐进分辨率训练);
第 4 步:若可获取大规模预训练权重(FLUX.2 级)且算力充足 →
对标冠军路线:外部数据全参预训练 → 赛道数据 LoRA 微调,
且不必强求显式时序建模;
第 5 步:按输入 3 校验------轻量部署需求 → 排除扩散路线(慢);
小数据 + 无外部预训练 → 排除 FLUX.2 路线,走动态卷积/频域路线;
第 6 步:无论哪条路线,补充外部数据训练(五强共同动作);
第 7 步:输出推荐原型 + 对照 2.4 节五条局限的风险提示。
【资产索引】
- 比赛主页:codabench.org/competitions/13462/
- Workshop:lovif-cvpr2026-workshop.github.io/
- 关键外部资产:FLUX.2 [klein] 4B、FoundIR 数据集、
VideoDesnowing 数据集、BasicSR/TURTLE 代码库
- 评价指标:Final Score = PSNR + 10×SSIM − 5×LPIPS − 30×WarpErr
【适用边界】
✔ 能用:复合雨雪视频复原的路线选型、2026 年 SOTA 原型速查、
挑战赛/benchmark 的组织设计参考(数据集+指标+赛制三件套)、
扩散先验 vs 显式时序建模的取舍判断。
✘ 会翻车:
- 去雾任务(WRV 未评测 haze);
- 长视频/流式实时处理(所有方案均按短片段离线处理);
- 追求统计严格的性能结论(仅 5 队有效提交,数据集 18 段);
- 跨天气类型泛化推断(训练测试同分布,未检验域外);
- 需要可解释性的场景(扩散路线黑盒程度更深)。
第四步:适用边界复核(对照博客"边界三问")
| 边界三问 | 回答 |
|---|---|
| 优势领域是什么? | 复合天气视频复原的 2026 年最新方法原型与基准设计方法论 |
| 前提假设是什么? | 短片段离线处理;训练测试同分布;退化限于雨/雪 |
| 答案在什么条件下会反噬? | 把 5 队小样本排名当普遍规律;拿扩散单帧路线去硬套实时流场景 |
与上一篇综述蒸馏的衔接
| 维度 | Wang et al. 2019 综述 | LoViF 2026 挑战赛 |
|---|---|---|
| 时代范式 | 模型驱动 vs CNN(PReNet/RESCAN) | 扩散 Transformer / 动态卷积 / 频域网络 |
| 数据观 | 合成集高分≠真实性能(警告) | 合成退化+真实 GT 配对(新范式) |
| 评价指标 | PSNR/SSIM/VIF/FSIM(逐帧) | + LPIPS + Warp Error(时序) |
| 任务范围 | 去雨专项 | 雨+雪复合天气(all-in-one 趋势) |
| 共同未解 | 真实场景泛化、实时性 | 依旧未解(呼应而非解决) |
附:蒸馏产物清单
| 文件 | 说明 |
|---|---|
蒸馏笔记_LoViF_2026_Challenge.md |
本文档 |
cover_lovif_fig1_rainy_comparison.png |
封面图(论文 Fig. 1 雨景各队视觉对比,第 4 页裁剪,4x 缩放) |
lovif_extracted.txt |
论文全文提取文本 |