2026 TPAMI | StarIR:空间-频域融合的高效图像复原

1. 论文信息与代码链接

项目 内容
题名 StarIR: Convolutional Image Restoration With Spatial-Frequency Fusion
作者 Yuning Cui, Syed Waqas Zamir, Ming-Hsuan Yang, Alois Knoll, Fahad Shahbaz Khan, Salman Khan
年份 2026
出处 IEEE Transactions on Pattern Analysis and Machine Intelligence
DOI/链接 10.1109/tpami.2026.3672465;https://doi.org/10.1109/tpami.2026.3672465

  代码链接:https://github.com/c-yn/StarIR

2. 论文摘要

  论文的核心是:用空间---频率双域表示学习 替代单一空间建模,让CNN 在保持效率的同时获得更强的全局与中尺度表达能力。作者提出 StarIR ,通过 Star operation 将空间分支与频率分支进行高阶交互,再嵌入编码器---解码器骨架中,用较轻的结构提升图像复原质量。 实验结果表明,StarIR 在 21 个数据集、6 类单退化任务上取得最先进 表现;同时在 2 个 all-in-one 场景和 2 个复合退化数据集上也保持稳定优势,并能扩展到 UHD、遥感、医疗、underwater 等应用场景。

3. 方法介绍

  (1)整体思路

输入退化图像 I 后,模型先提取浅层特征,再进入 3 层编码器 和 3 层解码器 。核心计算单元是 Star Block ,它把空间分支 和频率分支 并行建模,再用乘法融合强化互补信息。

图 1:图像复原网络结构

StarIR 的整体框架,主干是编码器---解码器结构,内部堆叠 Star Block,并通过空间与频率两条支路完成双域融合。

  (2)Star Block 结构

每个 Star Block 由 Star 模块 和 DFFN 组成:前者负责双域特征交互,后者继续做通道混合与特征重整。

|---|---------------------------------------------|-----|
| | X̂ = DFFN(LN(X̃)) + X̃,X̃ = Star(LN(X)) + X | (1) |

  其中 X 是输入特征,X̃ 是 Star 模块输出,X̂ 是整个 Star Block 的输出。这里的设计重点不是堆叠更深层数,而是提升单个块内部的特征交互能力。

  (3)频率调制分支(FMB)

频率分支先通过卷积提取中间特征,再按 k×k 窗口做 FFT,利用可学习滤波器在频域进行调制,最后回到空间域。

|---|--------------------------------------------|-----|
| | X′ᵢ = A ⊛ F(Rk×k(Xᵢ)),X(f) = R⁻¹(F⁻¹(X′ᵢ)) | (2) |

  其中 A 是频域可学习滤波器,F / F⁻¹ 表示 FFT / IFFT 。这一路主要补足对中尺度结构和较大范围退化模式的建模能力。

  (4)空间调制分支(SMB)与融合方式

空间分支通过卷积和空间权重生成显式关注区域,再与频率分支输出做逐元素乘法融合。

|---|---------------------------|-----|
| | Xₛ = σ(Wdw₃×₃X(j)) ⊛ X(j) | (3) |

  其中 X(j) 是空间分支中间特征,σ 后得到的权重用于突出边缘和纹理细节。随后两路特征再做高维交互:

|---|------------------------------------------------|-----|
| | X(c) = X(f) ⊛ Xₛ;X̂ = Wfinal₁×₁(dscale ⊛ X(c)) | (4) |

  其中 X(c) 是融合特征,dscale 来自全局平均池化后的通道描述。作者的关键观点是:逐元素乘法 比简单拼接或相加更能形成高阶交互,同时不会显著增加网络宽度和深度。

4. 实验设置和结果

  (1)实验设置

单退化任务训练使用 dual-domain L1 loss 和 Adam ,初始学习率为 1e−3 ,采用 cosine annealing 退到 1e−7 ,窗口大小为 8×8 。

all-in-one 场景下,作者使用 128×128 patch、100 个 epoch、batch size 32 、学习率 2×10−4 训练。

评价指标主要是 PSNR 、SSIM ,医疗任务还使用 RMSE。

  (2)单退化任务结果

模型在多类复原任务上都取得了稳定优势,代表性结果如下:

任务 数据集 结果要点
去散焦 DPDD 单图去散焦比第二名高 0.28 dB ,比 Mamba 系方法高 0.53 dB
去雨 AGAN-Data 比 AST-B 高 1.12 dB ,比 FPro 高 1.48 dB
去雨 Rain100H / Rain100L 在 Rain100H 上比 MambaIR 高 1.38 dB ;在 Rain100L 上比 Restormer 高 0.14 dB
去雾 SOTS / Haze4k / RESIDE-6K SOTS 室内比 C2PNet 高 0.39 dB ;室外比 MTFormer-B V2 高 1.17 dB ;在 Haze4k 上比 DEA-Net-CR 高 1.58 dB
去雪 SRRS / CSD 在 SRRS 上比 MTFormer-L V2 高 0.54 dB ;在 CSD 上比 ConvIR-B 高 0.4 dB
去模糊 GoPro / HIDE / RealBlur-J GoPro 上比 LoFormer-L 少 62% 参数;HIDE 上比 X-Restormer 高 0.25 dB ;RealBlur-J 上比 LoFormer-B 高 0.77 dB ,参数少 33%
低照度增强 LOL-v2-syn 比 MambaLLIE 高 0.37 dB ,仅用 22% 参数

单退化任务中的视觉对比,StarIR 在去模糊、去雨、去雾时更容易保住边缘和结构,伪影更少。

  (3)统一模型与复合退化结果

在更复杂的统一建模场景下,StarIR 仍保持优势:

设置 数据集/任务 结果要点
5-task all-in-one 多任务复原 相比 InstructIR 平均提升 0.96 dB
3-task 统一复原 Rain100L 达到 38.50 dB ,比 DyNet-S 高 0.48 dB ,平均也比 InstructIR 高 0.24 dB
复合退化 CDD-11 比 OneRestore 提升 2.89 dB PSNR 和 0.015 SSIM ,参数减少 41%
复合退化 LOL-Blur 比 VQCNIR 高 0.57 dB ,参数少 82

实验结果汇总,说明 StarIR 在统一模型、复合退化和单任务场景中都能保持稳定领先。

  (4)消融结果

消融表明,性能提升主要来自 Star operation 和双分支协同,而不是单纯堆模块。

配置 结果要点
基础版 ResBlocks 在 GoPro 上为 32.46 dB
仅加 SMB 提升 0.17 dB
仅加 FMB 提升 0.16 dB
SMB + FMB 继续提升,说明双域互补有效
再加入 Star operation 增益更明显,说明乘法交互是关键
再加入 CMU 达到最好结果

图 2:图像复原对比结果

图 3:实验对比结果

5. 结论

  StarIR 的核心贡献是用空间---频率双域分工 和乘法融合 ,在不依赖更深更宽网络的前提下增强了 CNN 的表达能力。它在单退化、统一模型、复合退化和跨场景任务上都表现稳定。论文也指出,真实去雾 仍与真值存在差距,说明真实域适配仍是后续需要继续突破的方向。

6. 可借鉴的思想

  (1)当任务同时依赖局部纹理和中尺度结构时,可以把空间分支 与频率分支 并行设计,再用逐元素乘法做融合。

  (2)如果希望提升表达力但不想盲目加深加宽网络,可以把重点放在高阶交互上,让特征在块内完成更强的互补融合。

  (3)做多退化或跨域复原时,可以优先考虑统一骨干 ,再用编码器---解码器兼顾不同退化尺度,而不是为每种任务单独堆一套结构。

  (4)频域分支不一定要做得很重,像 StarIR 这种"单次傅里叶投影 + 轻量可学习调制"的思路,更容易控制额外开销。

启示: 先做轻量的双域分工,再用乘法交互放大互补信息,往往比堆叠更复杂模块更划算。

相关推荐
LaughingZhu8 小时前
Product Hunt 每日热榜 | 2026-10-06
人工智能·深度学习·神经网络·搜索引擎·百度
AOI小白新手上路8 小时前
AOI 缺陷检测复现实操指南:Anomalib + MVTec AD(glass)与 YOLOv8 + NEU-DET 两条路线
人工智能·深度学习·yolo
高洁019 小时前
具身智能中的世界模型训练
人工智能·python·深度学习·机器学习·transformer
朝朝辞暮i9 小时前
VLA 系统学习第 1 课:VLA 到底在干什么?
人工智能·python·计算机视觉·vla
空奈qwq13 小时前
ANN 全连接神经网络进阶:从反向传播到完整实战
人工智能·深度学习·神经网络
看浪的路人14 小时前
第6讲:敏感数据检测与脱敏
人工智能·深度学习
一木 之林15 小时前
提示词工程学习总结:用 Few-shot 把大模型调教成金融文本分类、抽取与匹配的自动化流水线
人工智能·学习·计算机视觉·金融·分类
小蒋观天下16 小时前
端侧大模型在安防摄像头部署实操(上)|行业痛点、架构选型、落地思路解析
大数据·人工智能·安全·计算机视觉·ai大模型
具身AGI17 小时前
物理AI 空间理解:空间物理 信息的三条注入路线
人工智能·深度学习
黑妹天下第一乖18 小时前
第 08 讲:阿加犀 AidGenSE 端侧大模型服务化与 OpenAI 兼容接口
人工智能·嵌入式硬件·深度学习·机器人·iot