NTIRE2024×4图像超分竞赛综述|Mamba崛起、数据缩放、频域增强成为新趋势

NTIRE2024×4图像超分竞赛综述|Mamba崛起、数据缩放、频域增强成为新趋势

论文信息

标题:NTIRE 2024 Challenge on Image Super‑Resolution (×4): Methods and Results

会议:CVPR 2024 Workshops(CCF C类)

单位:上海交通大学、维尔茨堡大学、ETH苏黎世等;20支海内外参赛队伍(小米、快手、国科大、中山大学等)

代码:https://github.com/zhengchen1999/NTIRE2024_ImageSR_x4

论文:https://arxiv.org/abs/2404.09790

🎯趣味小案例:老照片修复、工业X光图像放大、监控画面增强,背后都离不开图像超分。NTIRE就是超分领域一年一度"武林大会",各路队伍比拼如何从模糊低分辨率图片,还原出锐利高清细节。2024年最大看点:Mamba状态空间模型正式杀入图像超分赛道,干掉一众Transformer拿到冠军。

一、研究背景

单图像超分(Single Image Super‑Resolution, SR)任务:给定一张低分辨率LR图像,恢复4倍放大的高分辨率HR图像。本竞赛使用双三次下采样bicubic退化生成LR图,是超分领域标准基准任务。

发展历程:

  1. 早期:插值、重建类传统算法,只能恢复简单边缘,复杂纹理表现差;
  2. CNN时代:SRCNN、RCAN依靠卷积残差学习;
  3. Transformer时代:SwinIR、HAT依靠窗口自注意力捕捉全局上下文,成为主流基线;
  4. 2024年:Mamba状态空间模型、大数据集缩放、频域损失成为新的技术风口。

现存痛点:

  1. Transformer长序列计算开销大;长距离依赖建模成本高;
  2. 很多模型只在小数据集训练,泛化能力弱;
  3. 重建容易丢失高频细节,出现模糊、涂抹伪影;
  4. 训练‑测试分布不一致,真实图像上效果掉点严重。

通俗备注:bicubic退化就是把高清图用双三次算法缩小4倍当做输入;这个退化很干净,方便公平对比各个算法的上限,现实工业场景退化会更加复杂(噪声、模糊混在一起)。

竞赛基础条件:

  • 数据集:DIV2K、Flickr2K、LSDIR,允许额外使用外部训练数据;测试集HR真值全程不对外公开;
  • 评价指标:Y通道(YCbCr)计算PSNR为主指标,SSIM为辅;计算时裁掉图像4像素边缘;
  • 规则:禁止使用DIV2K测试集HR参与训练;允许数据增强、自集成TTA、模型集成。

二、研究目的

  1. 举办×4图像超分竞赛,收集学术界工业界各类解决方案,横向对比方法性能;
  2. 梳理2024图像超分领域新兴技术趋势;
  3. 提供开源代码仓库,给社区提供基线、参考实现;
  4. 探索:Mamba、大数据集、频域约束、预训练Transformer等技术在超分任务的潜力。

三、实验结果与图表解读

表1(原文Table1)竞赛最终测试集结果,DIV2K测试集100张图像

Team Rank PSNR↑ SSIM↑
XiaomiMM 1 31.94 0.8778
SUPSR 2 31.41 0.8711
UCAS‑SCST 3 31.28 0.8666
SYSU‑SR 4 31.19 0.8660
Jasmine 5 31.18 0.8665
ACVLAB 6 31.18 0.8655
mandalinadagi 7 31.13 0.8648
SKDADDYS 8 31.11 0.8643
KLETech‑CEVI 9 31.03 0.8633
SVNIT‑NTNU 10 31.03 0.8633

解读:

  1. 冠军XiaomiMM(小米MM)PSNR达到31.94dB ,相比第二名高出0.53dB,拉开明显差距,也是本届最大亮点:Mamba状态空间模型在图像超分上效果显著优于传统Transformer基线
  2. 前6名PSNR全部大于31.18dB;参赛一共20支有效提交队伍。
  3. PSNR:峰值信噪比,数值越高,重建图像像素和真实HR越接近;SSIM结构相似度衡量图像结构保持能力。

通俗备注:dB是分贝单位,PSNR每提升0.3‑0.5dB人眼就可以明显感知清晰度差异。

图1(原文Figure1)Team XiaomiMM MambaSR核心SSFormer Block

解析:把SS2D(2D‑Mamba状态空间模块)和Channel Attention通道注意力并行,之后LN归一化(+)MLP,残差连接。Mamba擅长长序列建模,Transformer擅长双向特征交互,二者互补,构成MambaSR的基础块,在HAT骨干上替换混合注意力块得到完整网络。

符号释义:

  • XinX_{in}Xin:输入特征图;
  • SS2DSS2DSS2D:二维Mamba状态空间模块,捕捉长距离序列依赖;
  • CACACA:Channel Attention通道注意力模块;
  • LNLNLN:LayerNorm层归一化;通俗:对特征做标准化,稳定训练;
  • MLPMLPMLP:多层感知机;
  • +++:残差相加;通俗:残差连接缓解深度网络梯度消失。

图2(原文Figure2)Team SUPSR数据集构建与训练流水线

解析:第二名SUPSR(快手团队)不走修改网络,走大数据缩放路线。收集海量开源图片,通过分辨率、bpp压缩率、无参考图像质量评估IQA、频谱高频占比、CLIP语义聚类层层筛选,构建SUP‑25M两千五百万张高质量数据集。训练分三阶段逐步提升patch尺寸,由大batch小patch过渡小batch大patch,充分利用海量数据红利。

图3(原文Figure3)Team UCAS‑SCST HFT网络训练流程

解析:第三名国科大HFT模型,基于HAT预训练模型微调,引入高频损失LHFL_{HF}LHF、DCT离散余弦变换频域损失LDCTL_{DCT}LDCT,组合Charbonnier损失联合训练。

LHF=∥(IHR−B(IHR))−(ISR−B(ISR))∥1 L_{HF}=\left\| \left( I_{HR}-B(I_{HR})\right) -\left( I_{SR}-B(I_{SR})\right) \right\| _{1} LHF=∥(IHR−B(IHR))−(ISR−B(ISR))∥1

  • IHRI_{HR}IHR:真实高清图;ISRI_{SR}ISR:超分输出图像;
  • B(⋅)B(\cdot)B(⋅):5×5高斯模糊;通俗:原图减去模糊版本,等价提取图像高频细节纹理;
  • ∥⋅∥1\|\cdot\|_1∥⋅∥1:L1损失,逐像素绝对值误差。

LDCT=∥DCT(IHR)−DCT(ISR)∥1 L_{DCT}=\left\| DCT\left(I_{HR}\right)-DCT\left(I_{SR}\right)\right\| _{1} LDCT=∥DCT(IHR)−DCT(ISR)∥1

  • DCT(⋅)DCT(\cdot)DCT(⋅):离散余弦变换,转到频域,约束频域分量对齐,减少压缩伪影。

总损失:

L=LCharbonnier+αLHF+βLDCT L=L_{Charbonnier}+\alpha L_{HF}+\beta L_{DCT} L=LCharbonnier+αLHF+βLDCT

  • LCharbonnierL_{Charbonnier}LCharbonnier:Charbonnier鲁棒损失,比L1对异常值更平滑;
  • α=1,β=0.001\alpha=1,\beta=0.001α=1,β=0.001:两项损失权重超参数。

图7(原文Figure7)Team mandalinadagi 小波损失SWT示意图

解析:将SR输出、GT转为YCbCr,对Y通道做静态小波SWT分解,得到LL低频,LH、HL、HH多组高频子带,每个子带分别计算L1损失,也就是LSWTL_{SWT}LSWT小波域损失。

LSWT=E∑jλj∥SWT(G(x))j−SWT(y)j∥1 L_{SWT}=\mathbb {E}\left \\sum _{j}\\lambda _{j}\\left\\\| SWT(G(x))_{j}-SWT(y)_{j}\\right\\\| _{1}\\right LSWT=Ej∑λj∥SWT(G(x))j−SWT(y)j∥1

  • G(x)G(x)G(x):模型输出SR图像;yyy:GT高清图像;
  • SWT(⋅)jSWT(\cdot)_jSWT(⋅)j:第jjj个小波子带;
  • λj\lambda_jλj:各个子带的平衡权重;
  • E\mathbb{E}\\cdotE:mini‑batch样本求期望;通俗:对一批样本求平均损失。

图4(原文Figure4)Team SYSU‑SR训练(+)双集成策略流程图

解析:中山大学团队,使用预训练HAT‑L;训练端使用GW梯度加权损失;推理端同时使用Self‑ensemble自集成 (+) Model‑ensemble多模型集成,融合HAT‑L、DAT、GRL多个模型输出进一步抬升指标。

四、研究主要结论

  1. Mamba状态空间模型在图像超分展现巨大潜力:冠军XiaomiMM的MambaSR,将Mamba与注意力融合,相比纯Transformer基线获得显著性能增益,开辟超分新架构路线。
  2. 数据缩放是重要提分手段:不一定改网络,大规模高质量筛选数据集(SUPSR SUP‑25M)同样可以拿到很高名次,证明高质量数据对图像恢复任务至关重要。
  3. Transformer依旧是强基线,HAT、SwinIR仍然被绝大多数参赛队伍作为backbone;大量队伍使用ImageNet预训练权重做迁移微调。
  4. 频域约束成为热门改进方向:DCT、离散小波SWT损失,专门约束高频细节,有效抑制压缩伪影、提升纹理重建质量。
  5. 工程trick依旧有效:渐进式训练(逐步增大patch尺寸)、自集成TTA、多模型集成、精细的数据增强,都可以稳定带来PSNR收益。
  6. 训练阶段大batch、多阶段微调策略对最终性能帮助很大。

五、论文创新点(综述论文创新点,不是单支队伍)

✅1. 完整汇总NTIRE2024 ×4超分赛道全部20支参赛队伍方案,归纳2024图像超分四大主流技术路线:Mamba状态空间架构、大数据集缩放、预训练Transformer微调、频域损失增强。

✅2. 公开全部参赛代码、测试脚本,构建可复现的基准体系,方便后续研究者对比。

✅3. 横向对比不同网络、损失、数据策略在标准bicubic×4退化任务上的收益,总结各技术的优缺点。

✅4. 揭示Mamba在图像超分任务上的潜力,给后续低层视觉任务提供新方向。

注意:这是竞赛综述报告,不是一篇提出全新网络的研究论文;创新点在于大规模横向评测、趋势归纳、开源基准。各个队伍自己的创新看各自队伍短文。

六、个人思考

优势

  1. NTIRE竞赛的基准非常干净,bicubic退化隔离掉噪声、模糊等复杂干扰,可以纯粹对比"细节重建能力",适合做算法 ablation。
  2. 本届最大信号:Mamba不再只做NLP,二维Mamba(SS2D/Vmamba)在图像恢复任务已经可以打胜过SwinIR/HAT,未来会成为图像复原热门骨干。
  3. 证明"数据"和"网络架构"同等重要,很多研究者把全部精力砸网络,忽略数据集质量筛选;SUPSR的25M数据集给了很好启示。
  4. 频域损失(DCT、小波SWT)是低成本提分trick,不需要改动主干网络,只修改loss就可以改善高频细节,非常适合工业X光、遥感这类注重纹理细节的场景。

局限

  1. 本竞赛只是bicubic理想退化;现实工业图像往往混合噪声、运动模糊、压缩伪影,在竞赛数据集刷出来高PSNR,迁移到真实X光、监控图像很容易掉性能。
  2. 很多高分方案计算代价巨大,MambaSR、25M数据集训练需要巨大算力,嵌入式设备部署压力大。
  3. 竞赛只看重PSNR指标,PSNR高不等于人眼视觉一定好看,部分模型存在过度平滑/过拟合测试集的风险。
  4. 集成(ensemble)可以大量刷分,但实际工程部署几乎不会允许同时跑好几个大模型。

七、可创新点

  1. Mamba‑SR适配X光灰度单通道图像:把MambaSR(SSFormer块)迁移到工业X光图像超分;针对X光特有横纹噪声,在模块中增加频域约束,避免超分放大噪声。
  2. 轻量化Mamba超分网络:现在MambaSR参数量、算力开销大;做轻量化改造,面向工业设备在线推理。
  3. 频域混合损失应用X光超分:借鉴UCAS‑SCST的DCT损失、mandalinadagi的SWT小波损失,用于X光,强化极片线条边缘,抑制噪声高频分量。
  4. 面向X光领域做高质量数据集筛选策略:参考SUPSR的多维度筛选流水线,构建X光专用高质量配对超分数据集。
  5. 混合架构Mamba‑Transformer:Mamba擅长长距离全局依赖,Transformer擅长局部精细纹理;针对极片长平行线条设计混合块,适配软包锂电池极片长条状结构。
  6. 退化域自适应:竞赛是bicubic退化;X光图像退化是复合退化(模糊(+)噪声),可以设计退化感知模块,把NTIRE竞赛的模型迁移到真实工业退化。

小提示:做超分的时候,不要只看PSNR指标,必须增加线条关键点误差、极片骨架IoU这类工业结构指标,防止PSNR很高但是极片线条结构被模型破坏。

相关推荐
Raas1001 小时前
AI网关和大模型网关区别?MAI Gateway(魔芋企业级AI网关)如何实现AI流量统一治理
大数据·人工智能·gateway·ai网关·mai gateway·企业级产品
聚美智数1 小时前
网安查询-备案查询-网络安全查询API接口介绍
网络·数据库·web安全
APSandafa1 小时前
安达发|灯具制造数字化:靠APS自动排程跑出交付优势
人工智能·制造·aps系统·aps自动排产·aps自动排单·aps智能排产排程排单软件
动物园猫1 小时前
道路设施目标检测数据集:4类别、5,000张图像 | 目标检测
人工智能·目标检测·计算机视觉
HIT_Weston1 小时前
203、【Agent】【OpenCode】JS 语法:作用域链与 var 循环陷阱
人工智能·agent·opencode
腾视科技-AI1 小时前
腾视科技TS-SG-SM7系列AI算力模组:32TOPS算力引擎,开启边缘智能新纪元
人工智能·ai·ai算力·ai算力模组·ai模组·腾视科技·ai算力盒
代码方舟1 小时前
O2O二手车交易平台B端车商管理后台:基于天远车信盟出险构建自动化车况评估网关
java·运维·人工智能·自动化
一眸情感与认知智能平台1 小时前
当AI开始读懂人: 一眸科技亮相HICOOL 2026,探索人类身心情智世界模型
人工智能·科技
木圭的AI时代指南1 小时前
AI江湖录②·池鱼
人工智能·ai·语言模型