2026 TPAMI | StarIR:空间-频域融合的高效图像复原

1. 论文信息与代码链接

项目 内容
题名 StarIR: Convolutional Image Restoration With Spatial-Frequency Fusion
作者 Yuning Cui, Syed Waqas Zamir, Ming-Hsuan Yang, Alois Knoll, Fahad Shahbaz Khan, Salman Khan
年份 2026
出处 IEEE Transactions on Pattern Analysis and Machine Intelligence
DOI/链接 10.1109/tpami.2026.3672465https://doi.org/10.1109/tpami.2026.3672465

  代码链接:https://github.com/c-yn/StarIR

2. 论文摘要

  论文的核心是:用空间---频率双域表示学习 替代单一空间建模,让CNN 在保持效率的同时获得更强的全局与中尺度表达能力。作者提出 StarIR ,通过 Star operation 将空间分支与频率分支进行高阶交互,再嵌入编码器---解码器骨架中,用较轻的结构提升图像复原质量。 实验结果表明,StarIR21 个数据集、6 类单退化任务上取得最先进 表现;同时在 2 个 all-in-one 场景和 2 个复合退化数据集上也保持稳定优势,并能扩展到 UHD、遥感、医疗、underwater 等应用场景。

3. 方法介绍

  (1)整体思路

输入退化图像 I 后,模型先提取浅层特征,再进入 3 层编码器3 层解码器 。核心计算单元是 Star Block ,它把空间分支频率分支 并行建模,再用乘法融合强化互补信息。

图 1:图像复原网络结构

StarIR 的整体框架,主干是编码器---解码器结构,内部堆叠 Star Block,并通过空间与频率两条支路完成双域融合。

  (2)Star Block 结构

每个 Star BlockStar 模块DFFN 组成:前者负责双域特征交互,后者继续做通道混合与特征重整。

|---|---------------------------------------------|-----|
| | X̂ = DFFN(LN(X̃)) + X̃,X̃ = Star(LN(X)) + X | (1) |

  其中 X 是输入特征,Star 模块输出, 是整个 Star Block 的输出。这里的设计重点不是堆叠更深层数,而是提升单个块内部的特征交互能力。

  (3)频率调制分支(FMB)

频率分支先通过卷积提取中间特征,再按 k×k 窗口做 FFT,利用可学习滤波器在频域进行调制,最后回到空间域。

|---|--------------------------------------------|-----|
| | X′ᵢ = A ⊛ F(Rk×k(Xᵢ)),X(f) = R⁻¹(F⁻¹(X′ᵢ)) | (2) |

  其中 A 是频域可学习滤波器,F / F⁻¹ 表示 FFT / IFFT 。这一路主要补足对中尺度结构和较大范围退化模式的建模能力。

  (4)空间调制分支(SMB)与融合方式

空间分支通过卷积和空间权重生成显式关注区域,再与频率分支输出做逐元素乘法融合。

|---|---------------------------|-----|
| | Xₛ = σ(Wdw₃×₃X(j)) ⊛ X(j) | (3) |

  其中 X(j) 是空间分支中间特征,σ 后得到的权重用于突出边缘和纹理细节。随后两路特征再做高维交互:

|---|------------------------------------------------|-----|
| | X(c) = X(f) ⊛ Xₛ;X̂ = Wfinal₁×₁(dscale ⊛ X(c)) | (4) |

  其中 X(c) 是融合特征,dscale 来自全局平均池化后的通道描述。作者的关键观点是:逐元素乘法 比简单拼接或相加更能形成高阶交互,同时不会显著增加网络宽度和深度。

4. 实验设置和结果

  (1)实验设置

单退化任务训练使用 dual-domain L1 lossAdam ,初始学习率为 1e−3 ,采用 cosine annealing 退到 1e−7 ,窗口大小为 8×8

all-in-one 场景下,作者使用 128×128 patch、100 个 epoch、batch size 32 、学习率 2×10−4 训练。

评价指标主要是 PSNRSSIM ,医疗任务还使用 RMSE

  (2)单退化任务结果

模型在多类复原任务上都取得了稳定优势,代表性结果如下:

任务 数据集 结果要点
去散焦 DPDD 单图去散焦比第二名高 0.28 dB ,比 Mamba 系方法高 0.53 dB
去雨 AGAN-Data AST-B1.12 dB ,比 FPro1.48 dB
去雨 Rain100H / Rain100L Rain100H 上比 MambaIR1.38 dB ;在 Rain100L 上比 Restormer0.14 dB
去雾 SOTS / Haze4k / RESIDE-6K SOTS 室内比 C2PNet0.39 dB ;室外比 MTFormer-B V21.17 dB ;在 Haze4k 上比 DEA-Net-CR1.58 dB
去雪 SRRS / CSD SRRS 上比 MTFormer-L V20.54 dB ;在 CSD 上比 ConvIR-B0.4 dB
去模糊 GoPro / HIDE / RealBlur-J GoPro 上比 LoFormer-L62% 参数;HIDE 上比 X-Restormer0.25 dBRealBlur-J 上比 LoFormer-B0.77 dB ,参数少 33%
低照度增强 LOL-v2-syn MambaLLIE0.37 dB ,仅用 22% 参数

单退化任务中的视觉对比,StarIR 在去模糊、去雨、去雾时更容易保住边缘和结构,伪影更少。

  (3)统一模型与复合退化结果

在更复杂的统一建模场景下,StarIR 仍保持优势:

设置 数据集/任务 结果要点
5-task all-in-one 多任务复原 相比 InstructIR 平均提升 0.96 dB
3-task 统一复原 Rain100L 达到 38.50 dB ,比 DyNet-S0.48 dB ,平均也比 InstructIR0.24 dB
复合退化 CDD-11 OneRestore 提升 2.89 dB PSNR0.015 SSIM ,参数减少 41%
复合退化 LOL-Blur VQCNIR0.57 dB ,参数少 82

实验结果汇总,说明 StarIR 在统一模型、复合退化和单任务场景中都能保持稳定领先。

  (4)消融结果

消融表明,性能提升主要来自 Star operation 和双分支协同,而不是单纯堆模块。

配置 结果要点
基础版 ResBlocks GoPro 上为 32.46 dB
仅加 SMB 提升 0.17 dB
仅加 FMB 提升 0.16 dB
SMB + FMB 继续提升,说明双域互补有效
再加入 Star operation 增益更明显,说明乘法交互是关键
再加入 CMU 达到最好结果

图 2:图像复原对比结果

图 3:实验对比结果

5. 结论

  StarIR 的核心贡献是用空间---频率双域分工乘法融合 ,在不依赖更深更宽网络的前提下增强了 CNN 的表达能力。它在单退化、统一模型、复合退化和跨场景任务上都表现稳定。论文也指出,真实去雾 仍与真值存在差距,说明真实域适配仍是后续需要继续突破的方向。

6. 可借鉴的思想

  (1)当任务同时依赖局部纹理和中尺度结构时,可以把空间分支频率分支 并行设计,再用逐元素乘法做融合。

  (2)如果希望提升表达力但不想盲目加深加宽网络,可以把重点放在高阶交互上,让特征在块内完成更强的互补融合。

  (3)做多退化或跨域复原时,可以优先考虑统一骨干 ,再用编码器---解码器兼顾不同退化尺度,而不是为每种任务单独堆一套结构。

  (4)频域分支不一定要做得很重,像 StarIR 这种"单次傅里叶投影 + 轻量可学习调制"的思路,更容易控制额外开销。

启示: 先做轻量的双域分工,再用乘法交互放大互补信息,往往比堆叠更复杂模块更划算。

相关推荐
inquisiter39 分钟前
从反向传播看 QKV:注意力只是计算图里的几个节点
深度学习
爱吃火鸡面呀1 小时前
图片拼接与答题卡判断对错:从图像处理到自动判卷的完整实践
图像处理·人工智能
磁场转动100万匹1 小时前
深度学习入门:从神经网络到反向传播的完整解析
人工智能·深度学习·神经网络
欧特克_Glodon1 小时前
OpenCV计算机视觉开发入门与实践<二十四>:几何变换之平移、缩放、旋转
c++·人工智能·opencv·计算机视觉
qq_25294131681 小时前
建筑物缺陷目标检测数据集 | 建筑裂缝检测 房屋缺陷 结构损伤 目标检测9022期
人工智能·yolo·目标检测·计算机视觉·视觉检测·建筑裂缝·建筑外立面
啥都想学点的研究生1 小时前
一篇文章讲清楚:超参数的选择方法——交叉验证和网格搜索
人工智能·深度学习·机器学习
格林威2 小时前
C# 相机图像配合频闪光源:实现高速稳定拍摄的几个方法
开发语言·网络·人工智能·数码相机·计算机视觉·c#·视觉检测
点PY2 小时前
《一种基于深度学习的超分辨率重建方法及系统》专利精读
人工智能·深度学习·超分辨率重建
慢云智慧空间2 小时前
空间智能与计算机视觉的本质差异:不止于识别,更是空间决策能力
人工智能·python·计算机视觉