NTIRE2024×4图像超分竞赛综述|Mamba崛起、数据缩放、频域增强成为新趋势
论文信息
标题:NTIRE 2024 Challenge on Image Super‑Resolution (×4): Methods and Results
会议:CVPR 2024 Workshops(CCF C类)
单位:上海交通大学、维尔茨堡大学、ETH苏黎世等;20支海内外参赛队伍(小米、快手、国科大、中山大学等)
代码:https://github.com/zhengchen1999/NTIRE2024_ImageSR_x4
论文:https://arxiv.org/abs/2404.09790
🎯趣味小案例:老照片修复、工业X光图像放大、监控画面增强,背后都离不开图像超分。NTIRE就是超分领域一年一度"武林大会",各路队伍比拼如何从模糊低分辨率图片,还原出锐利高清细节。2024年最大看点:Mamba状态空间模型正式杀入图像超分赛道,干掉一众Transformer拿到冠军。
一、研究背景
单图像超分(Single Image Super‑Resolution, SR)任务:给定一张低分辨率LR图像,恢复4倍放大的高分辨率HR图像。本竞赛使用双三次下采样bicubic退化生成LR图,是超分领域标准基准任务。
发展历程:
- 早期:插值、重建类传统算法,只能恢复简单边缘,复杂纹理表现差;
- CNN时代:SRCNN、RCAN依靠卷积残差学习;
- Transformer时代:SwinIR、HAT依靠窗口自注意力捕捉全局上下文,成为主流基线;
- 2024年:Mamba状态空间模型、大数据集缩放、频域损失成为新的技术风口。
现存痛点:
- Transformer长序列计算开销大;长距离依赖建模成本高;
- 很多模型只在小数据集训练,泛化能力弱;
- 重建容易丢失高频细节,出现模糊、涂抹伪影;
- 训练‑测试分布不一致,真实图像上效果掉点严重。
通俗备注:bicubic退化就是把高清图用双三次算法缩小4倍当做输入;这个退化很干净,方便公平对比各个算法的上限,现实工业场景退化会更加复杂(噪声、模糊混在一起)。
竞赛基础条件:
- 数据集:DIV2K、Flickr2K、LSDIR,允许额外使用外部训练数据;测试集HR真值全程不对外公开;
- 评价指标:Y通道(YCbCr)计算PSNR为主指标,SSIM为辅;计算时裁掉图像4像素边缘;
- 规则:禁止使用DIV2K测试集HR参与训练;允许数据增强、自集成TTA、模型集成。
二、研究目的
- 举办×4图像超分竞赛,收集学术界工业界各类解决方案,横向对比方法性能;
- 梳理2024图像超分领域新兴技术趋势;
- 提供开源代码仓库,给社区提供基线、参考实现;
- 探索:Mamba、大数据集、频域约束、预训练Transformer等技术在超分任务的潜力。
三、实验结果与图表解读
表1(原文Table1)竞赛最终测试集结果,DIV2K测试集100张图像
| Team | Rank | PSNR↑ | SSIM↑ |
|---|---|---|---|
| XiaomiMM | 1 | 31.94 | 0.8778 |
| SUPSR | 2 | 31.41 | 0.8711 |
| UCAS‑SCST | 3 | 31.28 | 0.8666 |
| SYSU‑SR | 4 | 31.19 | 0.8660 |
| Jasmine | 5 | 31.18 | 0.8665 |
| ACVLAB | 6 | 31.18 | 0.8655 |
| mandalinadagi | 7 | 31.13 | 0.8648 |
| SKDADDYS | 8 | 31.11 | 0.8643 |
| KLETech‑CEVI | 9 | 31.03 | 0.8633 |
| SVNIT‑NTNU | 10 | 31.03 | 0.8633 |
解读:
- 冠军XiaomiMM(小米MM)PSNR达到31.94dB ,相比第二名高出0.53dB,拉开明显差距,也是本届最大亮点:Mamba状态空间模型在图像超分上效果显著优于传统Transformer基线。
- 前6名PSNR全部大于31.18dB;参赛一共20支有效提交队伍。
- PSNR:峰值信噪比,数值越高,重建图像像素和真实HR越接近;SSIM结构相似度衡量图像结构保持能力。
通俗备注:dB是分贝单位,PSNR每提升0.3‑0.5dB人眼就可以明显感知清晰度差异。

图1(原文Figure1)Team XiaomiMM MambaSR核心SSFormer Block
解析:把SS2D(2D‑Mamba状态空间模块)和Channel Attention通道注意力并行,之后LN归一化(+)MLP,残差连接。Mamba擅长长序列建模,Transformer擅长双向特征交互,二者互补,构成MambaSR的基础块,在HAT骨干上替换混合注意力块得到完整网络。

符号释义:
- XinX_{in}Xin:输入特征图;
- SS2DSS2DSS2D:二维Mamba状态空间模块,捕捉长距离序列依赖;
- CACACA:Channel Attention通道注意力模块;
- LNLNLN:LayerNorm层归一化;通俗:对特征做标准化,稳定训练;
- MLPMLPMLP:多层感知机;
- +++:残差相加;通俗:残差连接缓解深度网络梯度消失。

图2(原文Figure2)Team SUPSR数据集构建与训练流水线
解析:第二名SUPSR(快手团队)不走修改网络,走大数据缩放路线。收集海量开源图片,通过分辨率、bpp压缩率、无参考图像质量评估IQA、频谱高频占比、CLIP语义聚类层层筛选,构建SUP‑25M两千五百万张高质量数据集。训练分三阶段逐步提升patch尺寸,由大batch小patch过渡小batch大patch,充分利用海量数据红利。

图3(原文Figure3)Team UCAS‑SCST HFT网络训练流程
解析:第三名国科大HFT模型,基于HAT预训练模型微调,引入高频损失LHFL_{HF}LHF、DCT离散余弦变换频域损失LDCTL_{DCT}LDCT,组合Charbonnier损失联合训练。
LHF=∥(IHR−B(IHR))−(ISR−B(ISR))∥1 L_{HF}=\left\| \left( I_{HR}-B(I_{HR})\right) -\left( I_{SR}-B(I_{SR})\right) \right\| _{1} LHF=∥(IHR−B(IHR))−(ISR−B(ISR))∥1
- IHRI_{HR}IHR:真实高清图;ISRI_{SR}ISR:超分输出图像;
- B(⋅)B(\cdot)B(⋅):5×5高斯模糊;通俗:原图减去模糊版本,等价提取图像高频细节纹理;
- ∥⋅∥1\|\cdot\|_1∥⋅∥1:L1损失,逐像素绝对值误差。
LDCT=∥DCT(IHR)−DCT(ISR)∥1 L_{DCT}=\left\| DCT\left(I_{HR}\right)-DCT\left(I_{SR}\right)\right\| _{1} LDCT=∥DCT(IHR)−DCT(ISR)∥1
- DCT(⋅)DCT(\cdot)DCT(⋅):离散余弦变换,转到频域,约束频域分量对齐,减少压缩伪影。
总损失:
L=LCharbonnier+αLHF+βLDCT L=L_{Charbonnier}+\alpha L_{HF}+\beta L_{DCT} L=LCharbonnier+αLHF+βLDCT
- LCharbonnierL_{Charbonnier}LCharbonnier:Charbonnier鲁棒损失,比L1对异常值更平滑;
- α=1,β=0.001\alpha=1,\beta=0.001α=1,β=0.001:两项损失权重超参数。

图7(原文Figure7)Team mandalinadagi 小波损失SWT示意图
解析:将SR输出、GT转为YCbCr,对Y通道做静态小波SWT分解,得到LL低频,LH、HL、HH多组高频子带,每个子带分别计算L1损失,也就是LSWTL_{SWT}LSWT小波域损失。
LSWT=E∑jλj∥SWT(G(x))j−SWT(y)j∥1 L_{SWT}=\mathbb {E}\left \\sum _{j}\\lambda _{j}\\left\\\| SWT(G(x))_{j}-SWT(y)_{j}\\right\\\| _{1}\\right LSWT=Ej∑λj∥SWT(G(x))j−SWT(y)j∥1
- G(x)G(x)G(x):模型输出SR图像;yyy:GT高清图像;
- SWT(⋅)jSWT(\cdot)_jSWT(⋅)j:第jjj个小波子带;
- λj\lambda_jλj:各个子带的平衡权重;
- E⋅\mathbb{E}\\cdotE⋅:mini‑batch样本求期望;通俗:对一批样本求平均损失。

图4(原文Figure4)Team SYSU‑SR训练(+)双集成策略流程图
解析:中山大学团队,使用预训练HAT‑L;训练端使用GW梯度加权损失;推理端同时使用Self‑ensemble自集成 (+) Model‑ensemble多模型集成,融合HAT‑L、DAT、GRL多个模型输出进一步抬升指标。
四、研究主要结论
- Mamba状态空间模型在图像超分展现巨大潜力:冠军XiaomiMM的MambaSR,将Mamba与注意力融合,相比纯Transformer基线获得显著性能增益,开辟超分新架构路线。
- 数据缩放是重要提分手段:不一定改网络,大规模高质量筛选数据集(SUPSR SUP‑25M)同样可以拿到很高名次,证明高质量数据对图像恢复任务至关重要。
- Transformer依旧是强基线,HAT、SwinIR仍然被绝大多数参赛队伍作为backbone;大量队伍使用ImageNet预训练权重做迁移微调。
- 频域约束成为热门改进方向:DCT、离散小波SWT损失,专门约束高频细节,有效抑制压缩伪影、提升纹理重建质量。
- 工程trick依旧有效:渐进式训练(逐步增大patch尺寸)、自集成TTA、多模型集成、精细的数据增强,都可以稳定带来PSNR收益。
- 训练阶段大batch、多阶段微调策略对最终性能帮助很大。
五、论文创新点(综述论文创新点,不是单支队伍)
✅1. 完整汇总NTIRE2024 ×4超分赛道全部20支参赛队伍方案,归纳2024图像超分四大主流技术路线:Mamba状态空间架构、大数据集缩放、预训练Transformer微调、频域损失增强。
✅2. 公开全部参赛代码、测试脚本,构建可复现的基准体系,方便后续研究者对比。
✅3. 横向对比不同网络、损失、数据策略在标准bicubic×4退化任务上的收益,总结各技术的优缺点。
✅4. 揭示Mamba在图像超分任务上的潜力,给后续低层视觉任务提供新方向。
注意:这是竞赛综述报告,不是一篇提出全新网络的研究论文;创新点在于大规模横向评测、趋势归纳、开源基准。各个队伍自己的创新看各自队伍短文。
六、个人思考
优势
- NTIRE竞赛的基准非常干净,bicubic退化隔离掉噪声、模糊等复杂干扰,可以纯粹对比"细节重建能力",适合做算法 ablation。
- 本届最大信号:Mamba不再只做NLP,二维Mamba(SS2D/Vmamba)在图像恢复任务已经可以打胜过SwinIR/HAT,未来会成为图像复原热门骨干。
- 证明"数据"和"网络架构"同等重要,很多研究者把全部精力砸网络,忽略数据集质量筛选;SUPSR的25M数据集给了很好启示。
- 频域损失(DCT、小波SWT)是低成本提分trick,不需要改动主干网络,只修改loss就可以改善高频细节,非常适合工业X光、遥感这类注重纹理细节的场景。
局限
- 本竞赛只是bicubic理想退化;现实工业图像往往混合噪声、运动模糊、压缩伪影,在竞赛数据集刷出来高PSNR,迁移到真实X光、监控图像很容易掉性能。
- 很多高分方案计算代价巨大,MambaSR、25M数据集训练需要巨大算力,嵌入式设备部署压力大。
- 竞赛只看重PSNR指标,PSNR高不等于人眼视觉一定好看,部分模型存在过度平滑/过拟合测试集的风险。
- 集成(ensemble)可以大量刷分,但实际工程部署几乎不会允许同时跑好几个大模型。
七、可创新点
- Mamba‑SR适配X光灰度单通道图像:把MambaSR(SSFormer块)迁移到工业X光图像超分;针对X光特有横纹噪声,在模块中增加频域约束,避免超分放大噪声。
- 轻量化Mamba超分网络:现在MambaSR参数量、算力开销大;做轻量化改造,面向工业设备在线推理。
- 频域混合损失应用X光超分:借鉴UCAS‑SCST的DCT损失、mandalinadagi的SWT小波损失,用于X光,强化极片线条边缘,抑制噪声高频分量。
- 面向X光领域做高质量数据集筛选策略:参考SUPSR的多维度筛选流水线,构建X光专用高质量配对超分数据集。
- 混合架构Mamba‑Transformer:Mamba擅长长距离全局依赖,Transformer擅长局部精细纹理;针对极片长平行线条设计混合块,适配软包锂电池极片长条状结构。
- 退化域自适应:竞赛是bicubic退化;X光图像退化是复合退化(模糊(+)噪声),可以设计退化感知模块,把NTIRE竞赛的模型迁移到真实工业退化。
小提示:做超分的时候,不要只看PSNR指标,必须增加线条关键点误差、极片骨架IoU这类工业结构指标,防止PSNR很高但是极片线条结构被模型破坏。