视频去雨·论文蒸馏笔记:从物理先验到状态空间模型

视频去雨·论文蒸馏笔记:从物理先验到状态空间模型

蒸馏对象 :四份本地材料 + 两个已复现项目

① 王红 et al.《A Survey on Rain Removal from Video and Single Image》(西安交大,arXiv:1909.08326,IEEE TCSVT 投稿版)

② LoViF 2026 Workshop 挑战赛报告《The First Challenge on Weather Removal in Videos》(CVPR 2026)

③ Wu et al.《RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining》(ACM MM 2024 Oral)

④ Sun et al.《Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining》(VDMamba,CVPR 2025 Oral)

蒸馏日期:2026-10-10 · 蒸馏方法:DeepLens 系列同款"正文 + 目录 + 封面"流程


目录

  • 一、四份材料是什么关系(导读)
  • [二、综述精读:王红 et al.《A Survey on Rain Removal from Video and Single Image》](#二、综述精读:王红 et al.《A Survey on Rain Removal from Video and Single Image》)
    • [2.1 论文档案](#2.1 论文档案)
    • [2.2 雨的物理模型(一切方法的根)](#2.2 雨的物理模型(一切方法的根))
    • [2.3 方法分类树(综述 Fig 1)](#2.3 方法分类树(综述 Fig 1))
    • [2.4 最重要的实验发现:泛化能力](#2.4 最重要的实验发现:泛化能力)
    • [2.5 综述自述的五大未解难题(2026 年回看,条条应验)](#2.5 综述自述的五大未解难题(2026 年回看,条条应验))
  • [三、LoViF 2026 挑战赛:视频天气去除的最新战况](#三、LoViF 2026 挑战赛:视频天气去除的最新战况)
    • [3.1 赛题设定(CVPR 2026 Workshop 首届)](#3.1 赛题设定(CVPR 2026 Workshop 首届))
    • [3.2 五强方案对比](#3.2 五强方案对比)
    • [3.3 三条关键观察](#3.3 三条关键观察)
  • [四、RainMamba 精读(ACM MM 2024 Oral)](#四、RainMamba 精读(ACM MM 2024 Oral))
    • [4.1 论文档案](#4.1 论文档案)
    • [4.2 要解决的问题:SSM 的"一维诅咒"](#4.2 要解决的问题:SSM 的"一维诅咒")
    • [4.3 两大创新](#4.3 两大创新)
    • [4.4 数据集与复现入口](#4.4 数据集与复现入口)
  • [五、VDMamba 精读(CVPR 2025 Oral)------已复现 ✅](#五、VDMamba 精读(CVPR 2025 Oral)——已复现 ✅)
    • [5.1 论文档案](#5.1 论文档案)
    • [5.2 三大创新](#5.2 三大创新)
    • [5.3 复现实测(2026-10-08,本机已验证)](#5.3 复现实测(2026-10-08,本机已验证))
  • 六、谱系总览:这批材料与你的复现/项目的关系
  • [七、AutoDL 复现清单(只租算力,按性价比排序)](#七、AutoDL 复现清单(只租算力,按性价比排序))
  • 八、相关综述与开源项目清单(按"只租算力可跑"筛选)
    • [8.1 综述 / 系统性文献(只给标题,自行检索下载)](#8.1 综述 / 系统性文献(只给标题,自行检索下载))
    • [8.2 开源项目(全部 3090/4090 单卡可跑或推理)](#8.2 开源项目(全部 3090/4090 单卡可跑或推理))
    • [8.3 值得追读的论文(只给标题)](#8.3 值得追读的论文(只给标题))
  • [附录 A:术语速查](#附录 A:术语速查)
  • [附录 B:本地材料索引](#附录 B:本地材料索引)

一、四份材料是什么关系(导读)

一句话概括这条技术演化线:

复制代码
物理先验(模型驱动)──→ 深度展开(可解释)──→ Transformer(全局建模)──→ Mamba/SSM(线性复杂度)──→ 扩散先验(生成式)
   王红2021综述             王红博论 RCDNet          RainMamba 前作            RainMamba / VDMamba        LoViF 2026 五强
   分类学+泛化评测          谭五小 HQSNet/MAHNet       JORDER-E/PReNet           两代 SSM 去雨             FLUX.2 DiT 夺冠
  • 王红 2021 综述 是"地图"------把 2019 年以前的所有方法编成分类树,并首次系统做了泛化能力横向评测(合成集刷分高 ≠ 真实场景好使);
  • RainMamba(港科大广珠)是"换引擎"------把视频时序建模从 CNN/Transformer 换成线性复杂度的状态空间模型,解决了 Transformer 二方复杂度跑不动视频的问题;
  • VDMamba (中科院+中山大学)是"接地气"------在 RainMamba 同样的 SSM 底座上,专攻真实世界雨 :半监督 + 动态堆叠滤波 + 下游检测/跟踪基准,并且已实测复现成功(NTURain PSNR 39.80,与论文值仅差 +0.06 dB,成本约 ¥5-10);
  • LoViF 2026 挑战赛是"最新战况"------CVPR 2026 Workshop 的首届视频天气去除赛题,冠军用 FLUX.2 扩散 Transformer 单帧修复,暗示生成式先验正在接管这条赛道。

与你手上 MG-TSKD 蒸馏项目(zj项目)的关系见第六节。


二、综述精读:王红 et al.《A Survey on Rain Removal from Video and Single Image》

2.1 论文档案

  • 机构:西安交通大学(孟德宇组),约 2019 成稿
  • 产出规模:74 篇论文直链 + 9 个视频去雨源码 + 20 个单图源码 + 19 个项目页 + 6 合成/4 真实数据集 + 4 种画质指标
  • 配套仓库:hongwang01/Video-and-Single-Image-Deraining(GitHub)

2.2 雨的物理模型(一切方法的根)

性质 核心结论 出处
几何 雨滴形状 r(θ) 可由球谐级数描述;末速度 v 与直径 d 满足三次多项式(Foote-Toit 拟合) Beard-Chuang; Foote-Toit
亮度 雨滴像小透镜,过境像素亮度瞬间高于背景 I_r > I_b;成像 = 曝光时间内雨滴辐照 + 背景辐照的积分 Garg-Nayar
色度 ΔR/ΔG/ΔB 增量近似相等(RGB 视场均约 165°)→ 雨纹近灰白 Zhang et al.
时空 像素并非每帧都被雨覆盖 → 受雨像素直方图双峰、无雨像素单峰(视频去雨最核心的统计线索) Zhang et al.

2.3 方法分类树(综述 Fig 1)

视频去雨(有时间冗余可用):

  1. 时域类:帧间差分假设雨只影响单帧 → Garg-Nayar 时空相关模型;Zhang K-means 聚类;Kalman 递归滤波;Bossu GMM 方向直方图
  2. 频域类:Barnum 时空频率 + 模糊高斯模型,可处理相机运动
  3. 低秩稀疏类:张量低秩(Chen)、SVM 基向量分解(Kim)、稀疏/稠密雨分层 MRF(Ren)、P-MoG 随机雨建模(Wei)、多尺度卷积稀疏编码 MS-CSC(Li)
  4. 深度学习类:超像素 CNN(Chen)、J4R-Net/D3R-Net 循环网络(Liu)

单图去雨(无时序信息,更病态):

  1. 引导滤波类:Xu 引导滤波、Zheng 多重引导、Kim 椭圆核检测
  2. 先验信息类(MAP 能量最小化框架):MCA 分解(Fu)、GMM 补丁先验(Li)、JCAS 联合分析-合成稀疏表示(Gu)
  3. 深度学习类:DerainNet(Fu)、DDN 深度细节网络、ResGuideNet、DID-MDN 雨密度分类、JORDER/JORDER-E 循环多任务、PReNet 递归 ResNet、SPANet 局部到全局注意力、SIRR 半监督

2.4 最重要的实验发现:泛化能力

综述用 SPA-Data(1000 对真实雨图)做了横向泛化测试,结论颠覆直觉:

  • 合成集上最强的 RESCAN(Rain100L 38.52 dB)在真实数据上输给模型驱动的 JCAS;
  • SPANet 合成集分数平平,真实集泛化反而第一梯队(35.24 dB)------真实雨图先验设计 > 合成集过拟合;
  • 半监督 SIRR 迁移效果优于其监督骨架 DDN。

这条结论是贯穿后文所有工作的主旋律:VDMamba 做半监督、LoViF 赛题用真实 GT 配对,都是对"合成-真实域差"的直接回应。

2.5 综述自述的五大未解难题(2026 年回看,条条应验)

  1. 雨纹与背景纹理本征重叠 → 去雨普遍过平滑;
  2. 雨成像模型不完备(雨积雾化效应未建模);
  3. 模型驱动先验只能覆盖特定雨型 + 迭代慢;
  4. 数据驱动依赖大量合成对,过拟合 + 黑箱;
  5. 视频方法难以实时流式处理。

三、LoViF 2026 挑战赛:视频天气去除的最新战况

3.1 赛题设定(CVPR 2026 Workshop 首届)

  • WRV 数据集 :18 段视频 / 1216 对帧(合成退化 + 真实世界 GT 配对),832×480,雨雪复合天气,训练:验证:测试 = 1:1:1

  • 复合评分(时间一致性权重最重):

    Final Score = PSNR_Y + 10×SSIM_Y − 5×LPIPS − 30×WarpError

Warp Error 权重 30:官方明确"宁要帧间稳定,不要单帧高分"------这是对逐帧处理闪烁问题的直接打压。

3.2 五强方案对比

名次 队伍 方法 核心思路 亮点指标
1 RedMediaTech FLUX.2 DiT + LoRA 微调 冻结 VAE,潜在空间扩散修复;单帧处理、无显式时序建模 Final 16.21,SSIM 0.554
2 tremendous DyStd-Net Transformer 引导动态卷积(TDyConv)+ 256²→832×480 渐进分辨率 PSNR 最高 14.720
3 Guangong Perception VP-AdaIR 图像修复骨干 + 相邻帧时序先验图(背景/伪影/稳定三路线索融合) LPIPS 最优 0.613
4 quadrillion EF³Net Siamese 无历史编码器 + 因果历史模型(CHM)+ 频域损失 Warp Error 最低 0.026,仅 7.46M 参数、0.05 s/帧
5 CUIT Team VD-Diff 三阶段扩散先验 + 小波分解骨干 + 双向时序传播,AWSA/ACSA 注意力 扩散系最快 0.13 s/帧

3.3 三条关键观察

  1. 扩散先验强势:冠军与第五名都是扩散架构,大规模预训练的生成先验可直接迁移到天气去除;
  2. 保真 vs 时序一致存在张力:Warp Error 最低的队 PSNR/SSIM 都不是最高;
  3. 显式时序建模不是必需品:冠军完全单帧处理,靠大规模预训练先验就拿到合格的时序稳定性------这动摇了"视频任务必须时序建模"的传统假设。

四、RainMamba 精读(ACM MM 2024 Oral)

4.1 论文档案

  • 作者:Wu Hongtao, Yang Yijun, Xu Huihui, Wang Weiming, Zhou Jinni, Zhu Lei(港科大广州 / 港科大 / 香港都会大学)
  • 接收:ACM MM 2024,AR 5.5,Oral(前 3.97%)
  • 代码:TonyHongtaoWu/RainMamba(MIT 协议,基于 MMEditing)

4.2 要解决的问题:SSM 的"一维诅咒"

雨的去雨需要长程时序建模:CNN 感受野不够,Transformer 二方复杂度跑不动视频。Mamba/SSM 线性复杂度看似完美------但 SSM 按一维序列扫描视频时,把相邻的时空像素推得很远,破坏了局部相关性。雨纹恰是高度局部化的退化。

4.3 两大创新

  1. Hilbert 扫描机制:用三维希尔伯特空间填充曲线替代传统逐行扫描,让序列上相邻的 token 在时空体中也相邻------局部信息不散架。全局块仍用传统扫描,局部块用 Hilbert 扫描,组成 Coarse-to-Fine Mamba(CFM)。
  2. 差异引导动态对比局部学习:雨帧与修复帧做差得 difference map,利用"同一帧内相邻 patch 相似 + 后续帧相邻 patch 相似"做 patch 级自相似对比学习,保语义。

4.4 数据集与复现入口

四个基准:VRDS(ACM MM 2023,雨纹+雨滴)、LWDDS(ICRA 2023,雨滴)、RainVID&SS(TIP 2023)、RainSynAll100(TPAMI 2021)。

AutoDL 复现要点 (已有专用 skill + 一键脚本 setup_rainmamba_autodl.sh):

  • 环境:Python 3.9 + PyTorch 2.1.1 + cu121 + mmcv-full 1.7.2 + mmedit
  • 两大坑:① 无卡模式只有 2G 内存,编译 mamba CUDA 扩展必被 Killed ,必须 GPU 模式 + MAX_JOBS=2;② numpy 1.26.4 + opencv 4.8.1.78 钉死
  • 训练用 4×GPU dist_train.sh;本地 H 盘已有 RainMamba-main 源码、VRDS.pth 权重和测试数据

五、VDMamba 精读(CVPR 2025 Oral)------已复现 ✅

5.1 论文档案

  • 作者:Sun Shangquan, Ren Wenqi, Zhou Juxiang, Wang Shu, Gan Jianhou, Cao Xiaochun(中科院 + 中山大学等)
  • 代码:sunshangquan/VDMamba(纯 PyTorch,不依赖 mmcv)
  • 定位:RainMamba 的"写实续作"------同为 SSM 底座,主攻真实世界雨

5.2 三大创新

  1. 双分支时空 SSM:空间分支(S3ML 层)提取单帧特征,时序分支(TSML 层)融合多帧;两支都走 U-Net 四级结构,光流一步多帧 warp 对齐。
  2. 动态堆叠滤波器:自适应逼近不同统计函数------中值/最小值滤波去雨、均值滤波抑噪、最大值滤波补错位像素,一个模块通吃。
  3. 半监督中值堆叠损失:利用"雨的稀疏先验"(多帧同一位置取中值大概率是干净像素),无 GT 的真实帧也能参与训练------直接回应综述指出的"合成-真实域差"。

附加贡献:RVDT 真实雨天检测/跟踪基准------去雨预处理使 mAP/MOTA/IDF1 全线提升,把"去雨为下游服务"做成了定量结论。

5.3 复现实测(2026-10-08,本机已验证)

项目 结果
NTURain 测试集 PSNR 39.80 / SSIM 0.9800(论文值 39.74 / 0.9791,偏差 +0.06 dB ✅)
推理速度 ~0.14 s/帧(4090),NTURain 全量 1634 帧约 10 分钟
成本 全程 ¥5-10(无卡模式装依赖下数据,GPU 模式只做编译+推理)
关键坑 setuptools 钉 69.5.1;mamba/causal-conv1d 走 GitHub Release 预编译 wheel 直链;transformers 钉 4.36.2;opts.pth 是死代码用空字典补;README 的 -epoch 25/82 是笔误,一律 -epoch 100

六、谱系总览:这批材料与你的复现/项目的关系

材料 年份 技术代际 算力门槛 与你工作的关系
王红 2021 博士论文 2021 RCDNet/DRCDNet/VRGNet------雨卷积字典+算法展开开山 1080Ti 可跑 谭五小硕论的前作;GTX 4060 可复现
谭五小 2025 硕士论文 2025 HQSNet/MAHNet------HQS 展开 + 记忆增强 4060 可训 最佳改造起点(1~5M 参数,代码规整)
王红 2021 综述 2019/2021 分类学 + 泛化评测 纯阅读 全领域的"地图",仓库含 29 份源码索引
RainMamba 2024 SSM + Hilbert 扫描 4×GPU 训练 / 单卡推理 H 盘已有源码 + 权重 + setup 脚本
VDMamba 2025 SSM + 半监督 + 动态堆叠滤波 单卡推理 ¥5-10 已复现成功(NTURain 39.80 dB)
LoViF 2026 挑战赛 2026 扩散 DiT / 动态卷积 / 时序先验 多卡(DiT 路线贵) 思路借鉴;FLUX 路线成本高
MG-TSKD(zj项目) 在研 多粒度师生蒸馏(MPRNet 教师→Pseudo3D 学生) 4090 重训约 ¥42-300 当前主线;student 收敛问题已有诊断报告

给zj项目的三条可行改造路线(沿用谭五小蒸馏笔记的结论):

  1. 把 MAHNet 的 PMM 残差块换成 LoViF 五强中的频域/动态卷积模块(quadrillion 的 EF³Net 仅 7.46M 参数,最合适做学生网络);
  2. 用 VDMamba 的中值堆叠半监督损失补 MG-TSKD 的真实域定量验证短板;
  3. 走 RainMamba 的 Hilbert 扫描 Mamba 块替换 Pseudo3D 卷积时序对齐------三个方向任选其一即是完整硕论级工作。

七、AutoDL 复现清单(只租算力,按性价比排序)

阶段 任务 数据/权重 成本 状态
L1 VDMamba 推理 + 指标验证(NTURain/RainSyn×2) 权重随仓库,数据走 SPAC 仓库稀疏检出 ¥5-10 ✅ 2026-10-08 已复现
L2 RainMamba 推理(4 数据集预训练) H 盘已有 VRDS.pth,其余在仓库 README 的 Google Drive ¥5-15(推理)/ ¥100-200(4 卡训练) 待跑
L3 VDMamba 半监督训练复现(RVDT 域) RVDT 在作者 Google Drive ¥50-120 选做
L4 LoViF 思路轻量化验证:EF³Net 式小模型 + 复合指标评测 WRV 数据集(codabench 赛题页) ¥20-50 选做

通用环境速查(两个 Mamba 项目共通):

  • GPU 必须sm_80+(3090/4090 均可;V100/T4 不可用)
  • numpy==1.26.4 + setuptools==69.5.1 + transformers==4.36.2 三钉
  • mamba/causal-conv1d 优先 GitHub Release wheel 直链,避免源码编译 OOM
  • 无卡模式(¥0.1/h)装依赖下数据,GPU 模式只做编译与推理

八、相关综述与开源项目清单(按"只租算力可跑"筛选)

8.1 综述 / 系统性文献(只给标题,自行检索下载)

  1. A Survey on Rain Removal from Video and Single Image(王红 et al.,本文综述②主体)
  2. Unlocking the Potential of Aerial Images: a Survey on Rain Removal Methods(2025)
  3. Rainy Image Restoration: A Survey(2023,含单图/视频全谱系)
  4. A Survey on All-in-One Image Restoration(2024-2025 间,低层视觉大一统方向)
  5. LoViF 2026 Workshop 系列赛题报告(含真实世界全能图像修复、4D 世界模型画质等姊妹赛题)

8.2 开源项目(全部 3090/4090 单卡可跑或推理)

仓库 对应论文 干什么
TonyHongtaoWu/RainMamba ACM MM 2024 SSM 视频去雨(Hilbert 扫描)
sunshangquan/VDMamba CVPR 2025 半监督 SSM 真实视频去雨(已复现)
sunshangquan/TransMamba arXiv 2025 Transformer-Mamba 混合单图去雨(频带自注意力 SBSA)
hongwang01/Video-and-Single-Image-Deraining 综述配套 29 份源码 + 数据集大合集索引
hotndy/SPAC-SupplementaryMaterials TPAMI 2021 NTURain 等视频去雨数据集官方源
codabench.org/competitions/13462 LoViF 2026 WRV 数据集与评测服务器
VDMamba 仓库内对比模型 --- SLDNet / S2VD / MFGAN / MPEVNet / VDMamva 预训练权重全家桶

8.3 值得追读的论文(只给标题)

  1. RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining
  2. Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining
  3. A Hybrid Transformer-Mamba Network for Single Image Deraining(TransMamba)
  4. PRISM: Progressive Rain removal with Integrated State-space Modeling
  5. NightRain: Nighttime Video Deraining via Adaptive-Rain-Removal and Adaptive-Correction
  6. Towards General and Fast Video Derain via Knowledge Distillation(与 MG-TSKD 蒸馏路线直接相关)
  7. Image Deraining with Frequency-Enhanced State Space Model
  8. Robust Video Content Alignment and Compensation for Clear Vision Through the Rain
  9. Removing Rain in Videos: A Large-scale Database and A Two-stream ConvLSTM Approach(NTURain 原始论文)
  10. FastDeRain: A Novel Video Rain Streak Removal Method Using Directional Gradient Priors

附录 A:术语速查

术语 含义
SSM / Mamba 状态空间模型;线性复杂度长序列建模器,选择性扫描机制
Hilbert 扫描 空间填充曲线把 2D/3D 体素排成一维序列,使序列相邻=空间相邻
S3ML / TSML VDMamba 的空间/时序状态空间模型层
动态堆叠滤波 自适应逼近 min/median/mean/max 统计的像素聚合滤波器
中值堆叠损失 利用雨的稀疏性,多帧同位置取中值≈干净像素的半监督约束
Warp Error 相邻帧经光流 warp 后的对齐误差,衡量时序一致性(闪烁惩罚)
JORDER-E 循环多任务单图去雨经典法(Yang et al.,雨纹+雨积联合建模)
HQS 展开 半二次分裂算法逐算子映射为网络模块(可解释去雨范式)

附录 B:本地材料索引

文件 位置
王红综述 PDF + 抽取文本 H:\zj\视频去雨综述论文\
LoViF 2026 挑战赛 PDF + 抽取文本 同上
谭五小硕论蒸馏笔记(已写好) 同上 蒸馏笔记_谭五小2025硕士论文.md
RainMamba 源码/权重/安装脚本 H:\zj\RainMamba\(含 setup_rainmamba_autodl.sh、setup_vdmamba_autodl.sh)
VDMamba 源码 + 预训练权重 H:\zj\RainMamba\VDMamba-main\
MG-TSKD 项目诊断报告 H:\zj\项目分析与投稿建议.md
相关推荐
小码哥0682 小时前
搭建短剧系统|海外短剧:从需求到上线的指南
网络·数据库·音视频·短剧小程序·短剧系统·短剧开发·短剧后台
HSunR2 小时前
ruoyi 若依 自定义注解 参数校验
java·前端·数据库
怪奇云呼军2 小时前
教育试听预约后没到课,闪电智能 Voice Agent 如何做分层回访?
人工智能·python·算法·云计算·音视频
禾小西3 小时前
06丨Redis 数据同步:主从库如何实现数据一致?
数据库·redis·php
AOI小白新手上路3 小时前
DRSformer·论文蒸馏笔记:可学习 Top-k 稀疏注意力去雨网络
网络·笔记·学习
前端 贾公子3 小时前
LangGraph == 图的状态(State)管理 (上)
java·开发语言·数据库
薛晓刚3 小时前
PGA 超限的一次应急处置:扩容、清游标、杀会话
数据库
CJi0NG3 小时前
【自用】MySQL-事务
数据库·mysql
AOI小白新手上路4 小时前
单幅图像去雨·论文蒸馏笔记:统一评测、方法谱系与 HQ-RAIN 新基准
笔记