《LoViF 2026: The First Challenge on Weather Removal in Videos》知识蒸馏笔记

《LoViF 2026: The First Challenge on Weather Removal in Videos》知识蒸馏笔记

蒸馏方法 :依据 ganglv 博客《知识蒸馏方法论》之"图书蒸馏师"四步流程

原始论文 :Chenghao Qian, Xin Li, Yeying Jin, et al. LoViF 2026 The First Challenge on Weather Removal in Videos . arXiv:2604.10655v2, CVPR 2026 Workshop (LoViF).(利兹大学、USTC、腾讯、NTU)

蒸馏日期 :2026-09-21

封面图 :Fig. 1 ------ 雨景各队复原效果视觉对比(见 cover_lovif_fig1_rainy_comparison.png

关联:本篇是《A Survey on Rain Removal》(2019) 蒸馏笔记所标注"2019 年后方法不在范围内"的正好补充------代表了扩散模型时代的最新进展。


摘要

本文综述CVPR 2026 LoViF首届视频恶劣天气去除挑战赛。赛事发布WRV数据集(18段视频、1216对合成退化与真实清晰帧),采用PSNR、SSIM、LPIPS及扭曲误差加权的综合评分,重罚时序不一致。五支有效参赛队中,RedMediaTech以FLUX.2扩散Transformer单帧复原夺冠,其余方案涵盖动态卷积、时域先验引导与轻量频域网络,揭示了生成先验的潜力与保真---时序一致性的内在权衡。


第一步:类型判别

判别项 结论
体裁 挑战赛报告(Challenge Report)------工具书 + 案例集混合体
依据 前半部分(数据集构建、评价指标、赛制设计)是可照做的流程 ,工具书属性;后半部分(5 支队伍方法详述)是解决方案案例集,需提取各队的打法差异
提取路径 流程部分提取"可执行的步骤与设计原则";案例部分提取"五类方法原型 + 各自胜负手"
产物形态 操作手册型 Skill(基准测试设计)+ 选型顾问型 Skill(方法原型库)

第二步:分路提取

2.1 工具书部分:挑战赛/Benchmark 设计流程(可照做)

① 数据集设计原则(WRV 数据集)

设计决策 具体做法 为什么
退化类型 复合天气(雨 + 雪),非单一退化 传统基准只测单一退化,无法检验泛化
配对方式 合成退化帧 ↔ 真实清晰帧(1216 对) 真实 GT 难以获得,合成退化保真实性、真 GT 保监督信号
时序要求 退化在帧间时序一致 超越逐帧图像基准,强制考察跨帧连贯性
规模 18 段短视频,832×480,训练/验证/测试 = 1:1:1 短小精悍的评测基准,而非训练大库
开放策略 验证集只给输入,测试集留作最终评测 防过拟合刷榜

② 评价协议(核心设计思想:用权重表达价值观)

复制代码
Final Score = PSNR(Y) + 10×SSIM(Y) − 5×LPIPS − 30×Warp Error
  • Warp Error 权重 30(最重):时序一致性是视频复原的命门,闪烁必受重罚;
  • SSIM 放大 10 倍:让结构相似性与 PSNR 量级对齐;
  • LPIPS 权重 5:感知质量适度纳入。
  • 设计哲学:指标权重即赛道价值观------想引导什么行为,就重罚什么失误。

③ 赛制流程(两阶段 + 可复现性约束)

  1. 开发阶段(2026-02-03 ~ 03-06):开放训练数据 + 验证服务器在线评分,限 100 次提交;
  2. 测试阶段(03-06 ~ 03-16):发布测试输入,限 15 次提交;
  3. 收尾:提交 fact sheet + 可执行代码/模型做复现性验证,头部队伍受邀合著报告。
  • 关键约束:限次提交防止刷榜过拟合;代码验证防止不可复现的虚高成绩

2.2 案例集部分:五支队伍的方法原型与胜负手

排名 队伍 方法原型 核心打法 胜负手指标
1 RedMediaTech (小红书) 扩散先验·单帧派 FLUX.2 klein 4B DiT,冻结 VAE;FoundIR 大规模预训练 (110k iters) → LoRA 微调 (25k iters);完全不建时序模型 综合分 16.21,SSIM 最佳 0.554
2 tremendous (河北工大) 动态卷积·内容自适应派 DyStd-Net:Transformer 引导的动态卷积 TDyConv,按内容调制卷积核应对异质退化;渐进分辨率训练 256²→832×480 PSNR 最高 14.720
3 Guangong Perception (东莞理工) 时域先验注入派 VP-AdaIR:从邻帧提取三通道时域先验图(背景线索/退化线索/时序稳定线索),经 ECC 对齐后门控注入 AdaIR 骨干 LPIPS 最佳 0.613
4 quadrillion (广东工大) 轻量频域派 EF3Net:孪生无历史编码器 + 因果历史模型 CHM(KV 缓存融合时序记忆);焦点频率损失权重高达 800 Warp Error 最低 0.026,仅 7.46M 参数、0.05 s/帧
5 CUIT Team (成都信工院) 扩散先验·三阶段派 VD-Diff:教师先验学习 → 条件扩散先验拟合 → 联合优化;小波分解 + AWSA/ACSA 注意力 + 双向时序传播 扩散类中最快 0.13 s/帧

2.3 组织者的三条关键洞察(决策逻辑)

洞察 1:扩散生成先验强势崛起。 冠军与第五名均为扩散架构------大规模预训练学到的复原先验是当前最强武器;且冠军证明单帧强先验可替代显式时序建模(无任何时序模块仍达 Warp Error 0.032)。

洞察 2:保真与时序一致性存在内在张力。 Warp Error 最低的 quadrillion (0.026) 并未拿到最高 PSNR/SSIM------逐帧保真与跨帧连贯是两个方向不同的力,不可兼得时需按应用取舍(监控重连贯、下游识别重保真)。

洞察 3:小数据 + 强先验 > 小数据 + 复杂架构。 数据集仅 6 个训练场景,冠军靠外部 FoundIR 百万级预训练再 LoRA 微调;第三名补充 20 个 VideoDesnowing 场景;第五名补 1430 张外部图------补外部数据是共同动作

2.4 踩坑与局限(组织者/读者需警惕)

  1. 有效提交仅 5/37------报名多、完赛少,说明复合天气视频复原门槛高;
  2. 数据集规模小(18 段视频),结论的统计代表性有限,排名差异可能不显著;
  3. 训练分布 = 测试分布(同源合成退化),跨分布泛化未被检验(呼应上一篇综述"合成集高分≠真实性能"的教训);
  4. 雾(haze)虽在引言提及,但 WRV 数据集实际只含雨 + 雪,去雾未进入评测
  5. 扩散类方法推理慢(冠军单帧、0.13s+/帧),距离实时视频流处理仍远

第三步:Skill 封装

text 复制代码
【Skill 名称】视频恶劣天气复原选型顾问 · 2026 挑战赛版(基于 LoViF 2026 报告)

【角色定位】
你是恶劣天气视频复原的技术选型专家,依据 LoViF 2026 挑战赛的
五强方法原型与实验证据,为用户推荐技术路线。

【输入规范】
1. 场景:复合退化(雨/雪混合)还是单一退化;
2. 优先级:保真(PSNR/SSIM)、感知质量(LPIPS)、时序连贯(Warp Error)
   三者中哪个最重要;
3. 资源约束:算力/参数量/推理速度要求;可否获取外部大规模预训练模型;
4. 数据条件:可用的成对训练数据量。

【处理链路】(一步步执行,输出须体现推演)
第 1 步:按输入 2 定目标函数------若时序连贯优先 → 对标 EF3Net 路线
         (因果历史模型 + 焦点频率损失);
第 2 步:若感知质量优先 → 对标 VP-AdaIR(时域先验注入 + ECC 对齐);
第 3 步:若综合保真优先 → 对标 DyStd-Net(动态卷积 + 渐进分辨率训练);
第 4 步:若可获取大规模预训练权重(FLUX.2 级)且算力充足 →
         对标冠军路线:外部数据全参预训练 → 赛道数据 LoRA 微调,
         且不必强求显式时序建模;
第 5 步:按输入 3 校验------轻量部署需求 → 排除扩散路线(慢);
         小数据 + 无外部预训练 → 排除 FLUX.2 路线,走动态卷积/频域路线;
第 6 步:无论哪条路线,补充外部数据训练(五强共同动作);
第 7 步:输出推荐原型 + 对照 2.4 节五条局限的风险提示。

【资产索引】
- 比赛主页:codabench.org/competitions/13462/
- Workshop:lovif-cvpr2026-workshop.github.io/
- 关键外部资产:FLUX.2 [klein] 4B、FoundIR 数据集、
  VideoDesnowing 数据集、BasicSR/TURTLE 代码库
- 评价指标:Final Score = PSNR + 10×SSIM − 5×LPIPS − 30×WarpErr

【适用边界】
✔ 能用:复合雨雪视频复原的路线选型、2026 年 SOTA 原型速查、
  挑战赛/benchmark 的组织设计参考(数据集+指标+赛制三件套)、
  扩散先验 vs 显式时序建模的取舍判断。
✘ 会翻车:
  - 去雾任务(WRV 未评测 haze);
  - 长视频/流式实时处理(所有方案均按短片段离线处理);
  - 追求统计严格的性能结论(仅 5 队有效提交,数据集 18 段);
  - 跨天气类型泛化推断(训练测试同分布,未检验域外);
  - 需要可解释性的场景(扩散路线黑盒程度更深)。

第四步:适用边界复核(对照博客"边界三问")

边界三问 回答
优势领域是什么? 复合天气视频复原的 2026 年最新方法原型与基准设计方法论
前提假设是什么? 短片段离线处理;训练测试同分布;退化限于雨/雪
答案在什么条件下会反噬? 把 5 队小样本排名当普遍规律;拿扩散单帧路线去硬套实时流场景

与上一篇综述蒸馏的衔接

维度 Wang et al. 2019 综述 LoViF 2026 挑战赛
时代范式 模型驱动 vs CNN(PReNet/RESCAN) 扩散 Transformer / 动态卷积 / 频域网络
数据观 合成集高分≠真实性能(警告) 合成退化+真实 GT 配对(新范式)
评价指标 PSNR/SSIM/VIF/FSIM(逐帧) + LPIPS + Warp Error(时序)
任务范围 去雨专项 雨+雪复合天气(all-in-one 趋势)
共同未解 真实场景泛化、实时性 依旧未解(呼应而非解决)

附:蒸馏产物清单

文件 说明
蒸馏笔记_LoViF_2026_Challenge.md 本文档
cover_lovif_fig1_rainy_comparison.png 封面图(论文 Fig. 1 雨景各队视觉对比,第 4 页裁剪,4x 缩放)
lovif_extracted.txt 论文全文提取文本
相关推荐
码流子5 小时前
高速公路安全监测实践:碰撞监测预警+物联网底座,从感知到处置的闭环
大数据·人工智能·物联网·算法·架构
一级新生5 小时前
Agent Skill 是什么?概念、架构与开发指南
人工智能·ai agent·ai工具·提示词工程·agent skill
AIGCmagic社区5 小时前
文档智能专题:小模型后训练怎么选样本?PaddleOCR-VL-1.6按三类弱点挖掘
人工智能·aigc·文档智能
汉堡大王95275 小时前
Jev:不是聊天机器人, 而是一个智能 if 语句
前端·人工智能·后端
55873 生态系统5 小时前
# 55873生态系统互联网四代演进研究:从 Web1.0 至第四代互联网的时代跃迁
人工智能·55873全域文明生态体系·55873操作系统·全域文明生态系统
AIGCmagic社区5 小时前
文档智能专题:HunyuanOCR-1.5用DFlash把整页解码压到1.4秒
人工智能·aigc·文档智能
7177775 小时前
研发平台选哪家比较好:2026年主流平台对比与Gitee选型指南
人工智能·gitee
u1301306 小时前
GitHub 热榜项目:日榜(2026-09-21)
人工智能·github