视频去雨·论文蒸馏笔记:从物理先验到状态空间模型
蒸馏对象 :四份本地材料 + 两个已复现项目
① 王红 et al.《A Survey on Rain Removal from Video and Single Image》(西安交大,arXiv:1909.08326,IEEE TCSVT 投稿版)
② LoViF 2026 Workshop 挑战赛报告《The First Challenge on Weather Removal in Videos》(CVPR 2026)
③ Wu et al.《RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining》(ACM MM 2024 Oral)
④ Sun et al.《Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining》(VDMamba,CVPR 2025 Oral)
蒸馏日期:2026-10-10 · 蒸馏方法:DeepLens 系列同款"正文 + 目录 + 封面"流程
目录
- 一、四份材料是什么关系(导读)
- [二、综述精读:王红 et al.《A Survey on Rain Removal from Video and Single Image》](#二、综述精读:王红 et al.《A Survey on Rain Removal from Video and Single Image》)
- [2.1 论文档案](#2.1 论文档案)
- [2.2 雨的物理模型(一切方法的根)](#2.2 雨的物理模型(一切方法的根))
- [2.3 方法分类树(综述 Fig 1)](#2.3 方法分类树(综述 Fig 1))
- [2.4 最重要的实验发现:泛化能力](#2.4 最重要的实验发现:泛化能力)
- [2.5 综述自述的五大未解难题(2026 年回看,条条应验)](#2.5 综述自述的五大未解难题(2026 年回看,条条应验))
- [三、LoViF 2026 挑战赛:视频天气去除的最新战况](#三、LoViF 2026 挑战赛:视频天气去除的最新战况)
- [3.1 赛题设定(CVPR 2026 Workshop 首届)](#3.1 赛题设定(CVPR 2026 Workshop 首届))
- [3.2 五强方案对比](#3.2 五强方案对比)
- [3.3 三条关键观察](#3.3 三条关键观察)
- [四、RainMamba 精读(ACM MM 2024 Oral)](#四、RainMamba 精读(ACM MM 2024 Oral))
- [4.1 论文档案](#4.1 论文档案)
- [4.2 要解决的问题:SSM 的"一维诅咒"](#4.2 要解决的问题:SSM 的"一维诅咒")
- [4.3 两大创新](#4.3 两大创新)
- [4.4 数据集与复现入口](#4.4 数据集与复现入口)
- [五、VDMamba 精读(CVPR 2025 Oral)------已复现 ✅](#五、VDMamba 精读(CVPR 2025 Oral)——已复现 ✅)
- [5.1 论文档案](#5.1 论文档案)
- [5.2 三大创新](#5.2 三大创新)
- [5.3 复现实测(2026-10-08,本机已验证)](#5.3 复现实测(2026-10-08,本机已验证))
- 六、谱系总览:这批材料与你的复现/项目的关系
- [七、AutoDL 复现清单(只租算力,按性价比排序)](#七、AutoDL 复现清单(只租算力,按性价比排序))
- 八、相关综述与开源项目清单(按"只租算力可跑"筛选)
- [8.1 综述 / 系统性文献(只给标题,自行检索下载)](#8.1 综述 / 系统性文献(只给标题,自行检索下载))
- [8.2 开源项目(全部 3090/4090 单卡可跑或推理)](#8.2 开源项目(全部 3090/4090 单卡可跑或推理))
- [8.3 值得追读的论文(只给标题)](#8.3 值得追读的论文(只给标题))
- [附录 A:术语速查](#附录 A:术语速查)
- [附录 B:本地材料索引](#附录 B:本地材料索引)
一、四份材料是什么关系(导读)
一句话概括这条技术演化线:
物理先验(模型驱动)──→ 深度展开(可解释)──→ Transformer(全局建模)──→ Mamba/SSM(线性复杂度)──→ 扩散先验(生成式)
王红2021综述 王红博论 RCDNet RainMamba 前作 RainMamba / VDMamba LoViF 2026 五强
分类学+泛化评测 谭五小 HQSNet/MAHNet JORDER-E/PReNet 两代 SSM 去雨 FLUX.2 DiT 夺冠
- 王红 2021 综述 是"地图"------把 2019 年以前的所有方法编成分类树,并首次系统做了泛化能力横向评测(合成集刷分高 ≠ 真实场景好使);
- RainMamba(港科大广珠)是"换引擎"------把视频时序建模从 CNN/Transformer 换成线性复杂度的状态空间模型,解决了 Transformer 二方复杂度跑不动视频的问题;
- VDMamba (中科院+中山大学)是"接地气"------在 RainMamba 同样的 SSM 底座上,专攻真实世界雨 :半监督 + 动态堆叠滤波 + 下游检测/跟踪基准,并且已实测复现成功(NTURain PSNR 39.80,与论文值仅差 +0.06 dB,成本约 ¥5-10);
- LoViF 2026 挑战赛是"最新战况"------CVPR 2026 Workshop 的首届视频天气去除赛题,冠军用 FLUX.2 扩散 Transformer 单帧修复,暗示生成式先验正在接管这条赛道。
与你手上 MG-TSKD 蒸馏项目(zj项目)的关系见第六节。
二、综述精读:王红 et al.《A Survey on Rain Removal from Video and Single Image》
2.1 论文档案
- 机构:西安交通大学(孟德宇组),约 2019 成稿
- 产出规模:74 篇论文直链 + 9 个视频去雨源码 + 20 个单图源码 + 19 个项目页 + 6 合成/4 真实数据集 + 4 种画质指标
- 配套仓库:
hongwang01/Video-and-Single-Image-Deraining(GitHub)
2.2 雨的物理模型(一切方法的根)
| 性质 | 核心结论 | 出处 |
|---|---|---|
| 几何 | 雨滴形状 r(θ) 可由球谐级数描述;末速度 v 与直径 d 满足三次多项式(Foote-Toit 拟合) | Beard-Chuang; Foote-Toit |
| 亮度 | 雨滴像小透镜,过境像素亮度瞬间高于背景 I_r > I_b;成像 = 曝光时间内雨滴辐照 + 背景辐照的积分 | Garg-Nayar |
| 色度 | ΔR/ΔG/ΔB 增量近似相等(RGB 视场均约 165°)→ 雨纹近灰白 | Zhang et al. |
| 时空 | 像素并非每帧都被雨覆盖 → 受雨像素直方图双峰、无雨像素单峰(视频去雨最核心的统计线索) | Zhang et al. |
2.3 方法分类树(综述 Fig 1)
视频去雨(有时间冗余可用):
- 时域类:帧间差分假设雨只影响单帧 → Garg-Nayar 时空相关模型;Zhang K-means 聚类;Kalman 递归滤波;Bossu GMM 方向直方图
- 频域类:Barnum 时空频率 + 模糊高斯模型,可处理相机运动
- 低秩稀疏类:张量低秩(Chen)、SVM 基向量分解(Kim)、稀疏/稠密雨分层 MRF(Ren)、P-MoG 随机雨建模(Wei)、多尺度卷积稀疏编码 MS-CSC(Li)
- 深度学习类:超像素 CNN(Chen)、J4R-Net/D3R-Net 循环网络(Liu)
单图去雨(无时序信息,更病态):
- 引导滤波类:Xu 引导滤波、Zheng 多重引导、Kim 椭圆核检测
- 先验信息类(MAP 能量最小化框架):MCA 分解(Fu)、GMM 补丁先验(Li)、JCAS 联合分析-合成稀疏表示(Gu)
- 深度学习类:DerainNet(Fu)、DDN 深度细节网络、ResGuideNet、DID-MDN 雨密度分类、JORDER/JORDER-E 循环多任务、PReNet 递归 ResNet、SPANet 局部到全局注意力、SIRR 半监督
2.4 最重要的实验发现:泛化能力
综述用 SPA-Data(1000 对真实雨图)做了横向泛化测试,结论颠覆直觉:
- 合成集上最强的 RESCAN(Rain100L 38.52 dB)在真实数据上输给模型驱动的 JCAS;
- SPANet 合成集分数平平,真实集泛化反而第一梯队(35.24 dB)------真实雨图先验设计 > 合成集过拟合;
- 半监督 SIRR 迁移效果优于其监督骨架 DDN。
这条结论是贯穿后文所有工作的主旋律:VDMamba 做半监督、LoViF 赛题用真实 GT 配对,都是对"合成-真实域差"的直接回应。
2.5 综述自述的五大未解难题(2026 年回看,条条应验)
- 雨纹与背景纹理本征重叠 → 去雨普遍过平滑;
- 雨成像模型不完备(雨积雾化效应未建模);
- 模型驱动先验只能覆盖特定雨型 + 迭代慢;
- 数据驱动依赖大量合成对,过拟合 + 黑箱;
- 视频方法难以实时流式处理。
三、LoViF 2026 挑战赛:视频天气去除的最新战况
3.1 赛题设定(CVPR 2026 Workshop 首届)
-
WRV 数据集 :18 段视频 / 1216 对帧(合成退化 + 真实世界 GT 配对),832×480,雨雪复合天气,训练:验证:测试 = 1:1:1
-
复合评分(时间一致性权重最重):
Final Score = PSNR_Y + 10×SSIM_Y − 5×LPIPS − 30×WarpError
Warp Error 权重 30:官方明确"宁要帧间稳定,不要单帧高分"------这是对逐帧处理闪烁问题的直接打压。
3.2 五强方案对比
| 名次 | 队伍 | 方法 | 核心思路 | 亮点指标 |
|---|---|---|---|---|
| 1 | RedMediaTech | FLUX.2 DiT + LoRA 微调 | 冻结 VAE,潜在空间扩散修复;单帧处理、无显式时序建模 | Final 16.21,SSIM 0.554 |
| 2 | tremendous | DyStd-Net | Transformer 引导动态卷积(TDyConv)+ 256²→832×480 渐进分辨率 | PSNR 最高 14.720 |
| 3 | Guangong Perception | VP-AdaIR | 图像修复骨干 + 相邻帧时序先验图(背景/伪影/稳定三路线索融合) | LPIPS 最优 0.613 |
| 4 | quadrillion | EF³Net | Siamese 无历史编码器 + 因果历史模型(CHM)+ 频域损失 | Warp Error 最低 0.026,仅 7.46M 参数、0.05 s/帧 |
| 5 | CUIT Team | VD-Diff | 三阶段扩散先验 + 小波分解骨干 + 双向时序传播,AWSA/ACSA 注意力 | 扩散系最快 0.13 s/帧 |
3.3 三条关键观察
- 扩散先验强势:冠军与第五名都是扩散架构,大规模预训练的生成先验可直接迁移到天气去除;
- 保真 vs 时序一致存在张力:Warp Error 最低的队 PSNR/SSIM 都不是最高;
- 显式时序建模不是必需品:冠军完全单帧处理,靠大规模预训练先验就拿到合格的时序稳定性------这动摇了"视频任务必须时序建模"的传统假设。
四、RainMamba 精读(ACM MM 2024 Oral)
4.1 论文档案
- 作者:Wu Hongtao, Yang Yijun, Xu Huihui, Wang Weiming, Zhou Jinni, Zhu Lei(港科大广州 / 港科大 / 香港都会大学)
- 接收:ACM MM 2024,AR 5.5,Oral(前 3.97%)
- 代码:
TonyHongtaoWu/RainMamba(MIT 协议,基于 MMEditing)
4.2 要解决的问题:SSM 的"一维诅咒"
雨的去雨需要长程时序建模:CNN 感受野不够,Transformer 二方复杂度跑不动视频。Mamba/SSM 线性复杂度看似完美------但 SSM 按一维序列扫描视频时,把相邻的时空像素推得很远,破坏了局部相关性。雨纹恰是高度局部化的退化。
4.3 两大创新
- Hilbert 扫描机制:用三维希尔伯特空间填充曲线替代传统逐行扫描,让序列上相邻的 token 在时空体中也相邻------局部信息不散架。全局块仍用传统扫描,局部块用 Hilbert 扫描,组成 Coarse-to-Fine Mamba(CFM)。
- 差异引导动态对比局部学习:雨帧与修复帧做差得 difference map,利用"同一帧内相邻 patch 相似 + 后续帧相邻 patch 相似"做 patch 级自相似对比学习,保语义。
4.4 数据集与复现入口
四个基准:VRDS(ACM MM 2023,雨纹+雨滴)、LWDDS(ICRA 2023,雨滴)、RainVID&SS(TIP 2023)、RainSynAll100(TPAMI 2021)。
AutoDL 复现要点 (已有专用 skill + 一键脚本 setup_rainmamba_autodl.sh):
- 环境:Python 3.9 + PyTorch 2.1.1 + cu121 + mmcv-full 1.7.2 + mmedit
- 两大坑:① 无卡模式只有 2G 内存,编译 mamba CUDA 扩展必被 Killed ,必须 GPU 模式 +
MAX_JOBS=2;② numpy 1.26.4 + opencv 4.8.1.78 钉死 - 训练用 4×GPU
dist_train.sh;本地 H 盘已有RainMamba-main源码、VRDS.pth权重和测试数据
五、VDMamba 精读(CVPR 2025 Oral)------已复现 ✅
5.1 论文档案
- 作者:Sun Shangquan, Ren Wenqi, Zhou Juxiang, Wang Shu, Gan Jianhou, Cao Xiaochun(中科院 + 中山大学等)
- 代码:
sunshangquan/VDMamba(纯 PyTorch,不依赖 mmcv) - 定位:RainMamba 的"写实续作"------同为 SSM 底座,主攻真实世界雨
5.2 三大创新
- 双分支时空 SSM:空间分支(S3ML 层)提取单帧特征,时序分支(TSML 层)融合多帧;两支都走 U-Net 四级结构,光流一步多帧 warp 对齐。
- 动态堆叠滤波器:自适应逼近不同统计函数------中值/最小值滤波去雨、均值滤波抑噪、最大值滤波补错位像素,一个模块通吃。
- 半监督中值堆叠损失:利用"雨的稀疏先验"(多帧同一位置取中值大概率是干净像素),无 GT 的真实帧也能参与训练------直接回应综述指出的"合成-真实域差"。
附加贡献:RVDT 真实雨天检测/跟踪基准------去雨预处理使 mAP/MOTA/IDF1 全线提升,把"去雨为下游服务"做成了定量结论。
5.3 复现实测(2026-10-08,本机已验证)
| 项目 | 结果 |
|---|---|
| NTURain 测试集 | PSNR 39.80 / SSIM 0.9800(论文值 39.74 / 0.9791,偏差 +0.06 dB ✅) |
| 推理速度 | ~0.14 s/帧(4090),NTURain 全量 1634 帧约 10 分钟 |
| 成本 | 全程 ¥5-10(无卡模式装依赖下数据,GPU 模式只做编译+推理) |
| 关键坑 | setuptools 钉 69.5.1;mamba/causal-conv1d 走 GitHub Release 预编译 wheel 直链;transformers 钉 4.36.2;opts.pth 是死代码用空字典补;README 的 -epoch 25/82 是笔误,一律 -epoch 100 |
六、谱系总览:这批材料与你的复现/项目的关系
| 材料 | 年份 | 技术代际 | 算力门槛 | 与你工作的关系 |
|---|---|---|---|---|
| 王红 2021 博士论文 | 2021 | RCDNet/DRCDNet/VRGNet------雨卷积字典+算法展开开山 | 1080Ti 可跑 | 谭五小硕论的前作;GTX 4060 可复现 |
| 谭五小 2025 硕士论文 | 2025 | HQSNet/MAHNet------HQS 展开 + 记忆增强 | 4060 可训 | 最佳改造起点(1~5M 参数,代码规整) |
| 王红 2021 综述 | 2019/2021 | 分类学 + 泛化评测 | 纯阅读 | 全领域的"地图",仓库含 29 份源码索引 |
| RainMamba | 2024 | SSM + Hilbert 扫描 | 4×GPU 训练 / 单卡推理 | H 盘已有源码 + 权重 + setup 脚本 |
| VDMamba | 2025 | SSM + 半监督 + 动态堆叠滤波 | 单卡推理 ¥5-10 | 已复现成功(NTURain 39.80 dB) |
| LoViF 2026 挑战赛 | 2026 | 扩散 DiT / 动态卷积 / 时序先验 | 多卡(DiT 路线贵) | 思路借鉴;FLUX 路线成本高 |
| MG-TSKD(zj项目) | 在研 | 多粒度师生蒸馏(MPRNet 教师→Pseudo3D 学生) | 4090 重训约 ¥42-300 | 当前主线;student 收敛问题已有诊断报告 |
给zj项目的三条可行改造路线(沿用谭五小蒸馏笔记的结论):
- 把 MAHNet 的 PMM 残差块换成 LoViF 五强中的频域/动态卷积模块(quadrillion 的 EF³Net 仅 7.46M 参数,最合适做学生网络);
- 用 VDMamba 的中值堆叠半监督损失补 MG-TSKD 的真实域定量验证短板;
- 走 RainMamba 的 Hilbert 扫描 Mamba 块替换 Pseudo3D 卷积时序对齐------三个方向任选其一即是完整硕论级工作。
七、AutoDL 复现清单(只租算力,按性价比排序)
| 阶段 | 任务 | 数据/权重 | 成本 | 状态 |
|---|---|---|---|---|
| L1 | VDMamba 推理 + 指标验证(NTURain/RainSyn×2) | 权重随仓库,数据走 SPAC 仓库稀疏检出 | ¥5-10 | ✅ 2026-10-08 已复现 |
| L2 | RainMamba 推理(4 数据集预训练) | H 盘已有 VRDS.pth,其余在仓库 README 的 Google Drive |
¥5-15(推理)/ ¥100-200(4 卡训练) | 待跑 |
| L3 | VDMamba 半监督训练复现(RVDT 域) | RVDT 在作者 Google Drive | ¥50-120 | 选做 |
| L4 | LoViF 思路轻量化验证:EF³Net 式小模型 + 复合指标评测 | WRV 数据集(codabench 赛题页) | ¥20-50 | 选做 |
通用环境速查(两个 Mamba 项目共通):
- GPU 必须sm_80+(3090/4090 均可;V100/T4 不可用)
numpy==1.26.4 + setuptools==69.5.1 + transformers==4.36.2三钉- mamba/causal-conv1d 优先 GitHub Release wheel 直链,避免源码编译 OOM
- 无卡模式(¥0.1/h)装依赖下数据,GPU 模式只做编译与推理
八、相关综述与开源项目清单(按"只租算力可跑"筛选)
8.1 综述 / 系统性文献(只给标题,自行检索下载)
- A Survey on Rain Removal from Video and Single Image(王红 et al.,本文综述②主体)
- Unlocking the Potential of Aerial Images: a Survey on Rain Removal Methods(2025)
- Rainy Image Restoration: A Survey(2023,含单图/视频全谱系)
- A Survey on All-in-One Image Restoration(2024-2025 间,低层视觉大一统方向)
- LoViF 2026 Workshop 系列赛题报告(含真实世界全能图像修复、4D 世界模型画质等姊妹赛题)
8.2 开源项目(全部 3090/4090 单卡可跑或推理)
| 仓库 | 对应论文 | 干什么 |
|---|---|---|
TonyHongtaoWu/RainMamba |
ACM MM 2024 | SSM 视频去雨(Hilbert 扫描) |
sunshangquan/VDMamba |
CVPR 2025 | 半监督 SSM 真实视频去雨(已复现) |
sunshangquan/TransMamba |
arXiv 2025 | Transformer-Mamba 混合单图去雨(频带自注意力 SBSA) |
hongwang01/Video-and-Single-Image-Deraining |
综述配套 | 29 份源码 + 数据集大合集索引 |
hotndy/SPAC-SupplementaryMaterials |
TPAMI 2021 | NTURain 等视频去雨数据集官方源 |
codabench.org/competitions/13462 |
LoViF 2026 | WRV 数据集与评测服务器 |
| VDMamba 仓库内对比模型 | --- | SLDNet / S2VD / MFGAN / MPEVNet / VDMamva 预训练权重全家桶 |
8.3 值得追读的论文(只给标题)
- RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining
- Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining
- A Hybrid Transformer-Mamba Network for Single Image Deraining(TransMamba)
- PRISM: Progressive Rain removal with Integrated State-space Modeling
- NightRain: Nighttime Video Deraining via Adaptive-Rain-Removal and Adaptive-Correction
- Towards General and Fast Video Derain via Knowledge Distillation(与 MG-TSKD 蒸馏路线直接相关)
- Image Deraining with Frequency-Enhanced State Space Model
- Robust Video Content Alignment and Compensation for Clear Vision Through the Rain
- Removing Rain in Videos: A Large-scale Database and A Two-stream ConvLSTM Approach(NTURain 原始论文)
- FastDeRain: A Novel Video Rain Streak Removal Method Using Directional Gradient Priors
附录 A:术语速查
| 术语 | 含义 |
|---|---|
| SSM / Mamba | 状态空间模型;线性复杂度长序列建模器,选择性扫描机制 |
| Hilbert 扫描 | 空间填充曲线把 2D/3D 体素排成一维序列,使序列相邻=空间相邻 |
| S3ML / TSML | VDMamba 的空间/时序状态空间模型层 |
| 动态堆叠滤波 | 自适应逼近 min/median/mean/max 统计的像素聚合滤波器 |
| 中值堆叠损失 | 利用雨的稀疏性,多帧同位置取中值≈干净像素的半监督约束 |
| Warp Error | 相邻帧经光流 warp 后的对齐误差,衡量时序一致性(闪烁惩罚) |
| JORDER-E | 循环多任务单图去雨经典法(Yang et al.,雨纹+雨积联合建模) |
| HQS 展开 | 半二次分裂算法逐算子映射为网络模块(可解释去雨范式) |
附录 B:本地材料索引
| 文件 | 位置 |
|---|---|
| 王红综述 PDF + 抽取文本 | H:\zj\视频去雨综述论文\ |
| LoViF 2026 挑战赛 PDF + 抽取文本 | 同上 |
| 谭五小硕论蒸馏笔记(已写好) | 同上 蒸馏笔记_谭五小2025硕士论文.md |
| RainMamba 源码/权重/安装脚本 | H:\zj\RainMamba\(含 setup_rainmamba_autodl.sh、setup_vdmamba_autodl.sh) |
| VDMamba 源码 + 预训练权重 | H:\zj\RainMamba\VDMamba-main\ |
| MG-TSKD 项目诊断报告 | H:\zj\项目分析与投稿建议.md |