1. 论文信息与代码链接
| 项目 | 内容 |
|---|---|
| 题名 | StarIR: Convolutional Image Restoration With Spatial-Frequency Fusion |
| 作者 | Yuning Cui, Syed Waqas Zamir, Ming-Hsuan Yang, Alois Knoll, Fahad Shahbaz Khan, Salman Khan |
| 年份 | 2026 |
| 出处 | IEEE Transactions on Pattern Analysis and Machine Intelligence |
| DOI/链接 | 10.1109/tpami.2026.3672465;https://doi.org/10.1109/tpami.2026.3672465 |
代码链接:https://github.com/c-yn/StarIR
2. 论文摘要
论文的核心是:用空间---频率双域表示学习 替代单一空间建模,让CNN 在保持效率的同时获得更强的全局与中尺度表达能力。作者提出 StarIR ,通过 Star operation 将空间分支与频率分支进行高阶交互,再嵌入编码器---解码器骨架中,用较轻的结构提升图像复原质量。 实验结果表明,StarIR 在 21 个数据集、6 类单退化任务上取得最先进 表现;同时在 2 个 all-in-one 场景和 2 个复合退化数据集上也保持稳定优势,并能扩展到 UHD、遥感、医疗、underwater 等应用场景。
3. 方法介绍
(1)整体思路
输入退化图像 I 后,模型先提取浅层特征,再进入 3 层编码器 和 3 层解码器 。核心计算单元是 Star Block ,它把空间分支 和频率分支 并行建模,再用乘法融合强化互补信息。

图 1:图像复原网络结构
StarIR 的整体框架,主干是编码器---解码器结构,内部堆叠 Star Block,并通过空间与频率两条支路完成双域融合。
(2)Star Block 结构
每个 Star Block 由 Star 模块 和 DFFN 组成:前者负责双域特征交互,后者继续做通道混合与特征重整。
|---|---------------------------------------------|-----|
| | X̂ = DFFN(LN(X̃)) + X̃,X̃ = Star(LN(X)) + X | (1) |
其中 X 是输入特征,X̃ 是 Star 模块输出,X̂ 是整个 Star Block 的输出。这里的设计重点不是堆叠更深层数,而是提升单个块内部的特征交互能力。
(3)频率调制分支(FMB)
频率分支先通过卷积提取中间特征,再按 k×k 窗口做 FFT,利用可学习滤波器在频域进行调制,最后回到空间域。
|---|--------------------------------------------|-----|
| | X′ᵢ = A ⊛ F(Rk×k(Xᵢ)),X(f) = R⁻¹(F⁻¹(X′ᵢ)) | (2) |
其中 A 是频域可学习滤波器,F / F⁻¹ 表示 FFT / IFFT 。这一路主要补足对中尺度结构和较大范围退化模式的建模能力。
(4)空间调制分支(SMB)与融合方式
空间分支通过卷积和空间权重生成显式关注区域,再与频率分支输出做逐元素乘法融合。
|---|---------------------------|-----|
| | Xₛ = σ(Wdw₃×₃X(j)) ⊛ X(j) | (3) |
其中 X(j) 是空间分支中间特征,σ 后得到的权重用于突出边缘和纹理细节。随后两路特征再做高维交互:
|---|------------------------------------------------|-----|
| | X(c) = X(f) ⊛ Xₛ;X̂ = Wfinal₁×₁(dscale ⊛ X(c)) | (4) |
其中 X(c) 是融合特征,dscale 来自全局平均池化后的通道描述。作者的关键观点是:逐元素乘法 比简单拼接或相加更能形成高阶交互,同时不会显著增加网络宽度和深度。
4. 实验设置和结果
(1)实验设置
单退化任务训练使用 dual-domain L1 loss 和 Adam ,初始学习率为 1e−3 ,采用 cosine annealing 退到 1e−7 ,窗口大小为 8×8 。
all-in-one 场景下,作者使用 128×128 patch、100 个 epoch、batch size 32 、学习率 2×10−4 训练。
评价指标主要是 PSNR 、SSIM ,医疗任务还使用 RMSE。
(2)单退化任务结果
模型在多类复原任务上都取得了稳定优势,代表性结果如下:
| 任务 | 数据集 | 结果要点 |
|---|---|---|
| 去散焦 | DPDD | 单图去散焦比第二名高 0.28 dB ,比 Mamba 系方法高 0.53 dB |
| 去雨 | AGAN-Data | 比 AST-B 高 1.12 dB ,比 FPro 高 1.48 dB |
| 去雨 | Rain100H / Rain100L | 在 Rain100H 上比 MambaIR 高 1.38 dB ;在 Rain100L 上比 Restormer 高 0.14 dB |
| 去雾 | SOTS / Haze4k / RESIDE-6K | SOTS 室内比 C2PNet 高 0.39 dB ;室外比 MTFormer-B V2 高 1.17 dB ;在 Haze4k 上比 DEA-Net-CR 高 1.58 dB |
| 去雪 | SRRS / CSD | 在 SRRS 上比 MTFormer-L V2 高 0.54 dB ;在 CSD 上比 ConvIR-B 高 0.4 dB |
| 去模糊 | GoPro / HIDE / RealBlur-J | GoPro 上比 LoFormer-L 少 62% 参数;HIDE 上比 X-Restormer 高 0.25 dB ;RealBlur-J 上比 LoFormer-B 高 0.77 dB ,参数少 33% |
| 低照度增强 | LOL-v2-syn | 比 MambaLLIE 高 0.37 dB ,仅用 22% 参数 |
单退化任务中的视觉对比,StarIR 在去模糊、去雨、去雾时更容易保住边缘和结构,伪影更少。
(3)统一模型与复合退化结果
在更复杂的统一建模场景下,StarIR 仍保持优势:
| 设置 | 数据集/任务 | 结果要点 |
|---|---|---|
| 5-task all-in-one | 多任务复原 | 相比 InstructIR 平均提升 0.96 dB |
| 3-task | 统一复原 | Rain100L 达到 38.50 dB ,比 DyNet-S 高 0.48 dB ,平均也比 InstructIR 高 0.24 dB |
| 复合退化 | CDD-11 | 比 OneRestore 提升 2.89 dB PSNR 和 0.015 SSIM ,参数减少 41% |
| 复合退化 | LOL-Blur | 比 VQCNIR 高 0.57 dB ,参数少 82 |
实验结果汇总,说明 StarIR 在统一模型、复合退化和单任务场景中都能保持稳定领先。
(4)消融结果
消融表明,性能提升主要来自 Star operation 和双分支协同,而不是单纯堆模块。
| 配置 | 结果要点 |
|---|---|
| 基础版 ResBlocks | 在 GoPro 上为 32.46 dB |
| 仅加 SMB | 提升 0.17 dB |
| 仅加 FMB | 提升 0.16 dB |
| SMB + FMB | 继续提升,说明双域互补有效 |
| 再加入 Star operation | 增益更明显,说明乘法交互是关键 |
| 再加入 CMU | 达到最好结果 |

图 2:图像复原对比结果

图 3:实验对比结果
5. 结论
StarIR 的核心贡献是用空间---频率双域分工 和乘法融合 ,在不依赖更深更宽网络的前提下增强了 CNN 的表达能力。它在单退化、统一模型、复合退化和跨场景任务上都表现稳定。论文也指出,真实去雾 仍与真值存在差距,说明真实域适配仍是后续需要继续突破的方向。
6. 可借鉴的思想
(1)当任务同时依赖局部纹理和中尺度结构时,可以把空间分支 与频率分支 并行设计,再用逐元素乘法做融合。
(2)如果希望提升表达力但不想盲目加深加宽网络,可以把重点放在高阶交互上,让特征在块内完成更强的互补融合。
(3)做多退化或跨域复原时,可以优先考虑统一骨干 ,再用编码器---解码器兼顾不同退化尺度,而不是为每种任务单独堆一套结构。
(4)频域分支不一定要做得很重,像 StarIR 这种"单次傅里叶投影 + 轻量可学习调制"的思路,更容易控制额外开销。
启示: 先做轻量的双域分工,再用乘法交互放大互补信息,往往比堆叠更复杂模块更划算。