2026 TPAMI | StarIR:空间-频域融合的高效图像复原

1. 论文信息与代码链接

项目 内容
题名 StarIR: Convolutional Image Restoration With Spatial-Frequency Fusion
作者 Yuning Cui, Syed Waqas Zamir, Ming-Hsuan Yang, Alois Knoll, Fahad Shahbaz Khan, Salman Khan
年份 2026
出处 IEEE Transactions on Pattern Analysis and Machine Intelligence
DOI/链接 10.1109/tpami.2026.3672465https://doi.org/10.1109/tpami.2026.3672465

  代码链接:https://github.com/c-yn/StarIR

2. 论文摘要

  论文的核心是:用空间---频率双域表示学习 替代单一空间建模,让CNN 在保持效率的同时获得更强的全局与中尺度表达能力。作者提出 StarIR ,通过 Star operation 将空间分支与频率分支进行高阶交互,再嵌入编码器---解码器骨架中,用较轻的结构提升图像复原质量。 实验结果表明,StarIR21 个数据集、6 类单退化任务上取得最先进 表现;同时在 2 个 all-in-one 场景和 2 个复合退化数据集上也保持稳定优势,并能扩展到 UHD、遥感、医疗、underwater 等应用场景。

3. 方法介绍

  (1)整体思路

输入退化图像 I 后,模型先提取浅层特征,再进入 3 层编码器3 层解码器 。核心计算单元是 Star Block ,它把空间分支频率分支 并行建模,再用乘法融合强化互补信息。

图 1:图像复原网络结构

StarIR 的整体框架,主干是编码器---解码器结构,内部堆叠 Star Block,并通过空间与频率两条支路完成双域融合。

  (2)Star Block 结构

每个 Star BlockStar 模块DFFN 组成:前者负责双域特征交互,后者继续做通道混合与特征重整。

|---|---------------------------------------------|-----|
| | X̂ = DFFN(LN(X̃)) + X̃,X̃ = Star(LN(X)) + X | (1) |

  其中 X 是输入特征,Star 模块输出, 是整个 Star Block 的输出。这里的设计重点不是堆叠更深层数,而是提升单个块内部的特征交互能力。

  (3)频率调制分支(FMB)

频率分支先通过卷积提取中间特征,再按 k×k 窗口做 FFT,利用可学习滤波器在频域进行调制,最后回到空间域。

|---|--------------------------------------------|-----|
| | X′ᵢ = A ⊛ F(Rk×k(Xᵢ)),X(f) = R⁻¹(F⁻¹(X′ᵢ)) | (2) |

  其中 A 是频域可学习滤波器,F / F⁻¹ 表示 FFT / IFFT 。这一路主要补足对中尺度结构和较大范围退化模式的建模能力。

  (4)空间调制分支(SMB)与融合方式

空间分支通过卷积和空间权重生成显式关注区域,再与频率分支输出做逐元素乘法融合。

|---|---------------------------|-----|
| | Xₛ = σ(Wdw₃×₃X(j)) ⊛ X(j) | (3) |

  其中 X(j) 是空间分支中间特征,σ 后得到的权重用于突出边缘和纹理细节。随后两路特征再做高维交互:

|---|------------------------------------------------|-----|
| | X(c) = X(f) ⊛ Xₛ;X̂ = Wfinal₁×₁(dscale ⊛ X(c)) | (4) |

  其中 X(c) 是融合特征,dscale 来自全局平均池化后的通道描述。作者的关键观点是:逐元素乘法 比简单拼接或相加更能形成高阶交互,同时不会显著增加网络宽度和深度。

4. 实验设置和结果

  (1)实验设置

单退化任务训练使用 dual-domain L1 lossAdam ,初始学习率为 1e−3 ,采用 cosine annealing 退到 1e−7 ,窗口大小为 8×8

all-in-one 场景下,作者使用 128×128 patch、100 个 epoch、batch size 32 、学习率 2×10−4 训练。

评价指标主要是 PSNRSSIM ,医疗任务还使用 RMSE

  (2)单退化任务结果

模型在多类复原任务上都取得了稳定优势,代表性结果如下:

任务 数据集 结果要点
去散焦 DPDD 单图去散焦比第二名高 0.28 dB ,比 Mamba 系方法高 0.53 dB
去雨 AGAN-Data AST-B1.12 dB ,比 FPro1.48 dB
去雨 Rain100H / Rain100L Rain100H 上比 MambaIR1.38 dB ;在 Rain100L 上比 Restormer0.14 dB
去雾 SOTS / Haze4k / RESIDE-6K SOTS 室内比 C2PNet0.39 dB ;室外比 MTFormer-B V21.17 dB ;在 Haze4k 上比 DEA-Net-CR1.58 dB
去雪 SRRS / CSD SRRS 上比 MTFormer-L V20.54 dB ;在 CSD 上比 ConvIR-B0.4 dB
去模糊 GoPro / HIDE / RealBlur-J GoPro 上比 LoFormer-L62% 参数;HIDE 上比 X-Restormer0.25 dBRealBlur-J 上比 LoFormer-B0.77 dB ,参数少 33%
低照度增强 LOL-v2-syn MambaLLIE0.37 dB ,仅用 22% 参数

单退化任务中的视觉对比,StarIR 在去模糊、去雨、去雾时更容易保住边缘和结构,伪影更少。

  (3)统一模型与复合退化结果

在更复杂的统一建模场景下,StarIR 仍保持优势:

设置 数据集/任务 结果要点
5-task all-in-one 多任务复原 相比 InstructIR 平均提升 0.96 dB
3-task 统一复原 Rain100L 达到 38.50 dB ,比 DyNet-S0.48 dB ,平均也比 InstructIR0.24 dB
复合退化 CDD-11 OneRestore 提升 2.89 dB PSNR0.015 SSIM ,参数减少 41%
复合退化 LOL-Blur VQCNIR0.57 dB ,参数少 82

实验结果汇总,说明 StarIR 在统一模型、复合退化和单任务场景中都能保持稳定领先。

  (4)消融结果

消融表明,性能提升主要来自 Star operation 和双分支协同,而不是单纯堆模块。

配置 结果要点
基础版 ResBlocks GoPro 上为 32.46 dB
仅加 SMB 提升 0.17 dB
仅加 FMB 提升 0.16 dB
SMB + FMB 继续提升,说明双域互补有效
再加入 Star operation 增益更明显,说明乘法交互是关键
再加入 CMU 达到最好结果

图 2:图像复原对比结果

图 3:实验对比结果

5. 结论

  StarIR 的核心贡献是用空间---频率双域分工乘法融合 ,在不依赖更深更宽网络的前提下增强了 CNN 的表达能力。它在单退化、统一模型、复合退化和跨场景任务上都表现稳定。论文也指出,真实去雾 仍与真值存在差距,说明真实域适配仍是后续需要继续突破的方向。

6. 可借鉴的思想

  (1)当任务同时依赖局部纹理和中尺度结构时,可以把空间分支频率分支 并行设计,再用逐元素乘法做融合。

  (2)如果希望提升表达力但不想盲目加深加宽网络,可以把重点放在高阶交互上,让特征在块内完成更强的互补融合。

  (3)做多退化或跨域复原时,可以优先考虑统一骨干 ,再用编码器---解码器兼顾不同退化尺度,而不是为每种任务单独堆一套结构。

  (4)频域分支不一定要做得很重,像 StarIR 这种"单次傅里叶投影 + 轻量可学习调制"的思路,更容易控制额外开销。

启示: 先做轻量的双域分工,再用乘法交互放大互补信息,往往比堆叠更复杂模块更划算。

相关推荐
Evand J3 小时前
【MATLAB例程|图像滤波降噪13】局部噪声方差自适应滤波(LNR)图像降噪与效果展示。附完整例程的下载链接
图像处理·计算机视觉·matlab·滤波·代码·降噪
高洁013 小时前
孪生不止在工厂:能源、医疗与农业
人工智能·深度学习·transformer·知识图谱·tornado
布吉岛的石头5 小时前
Java 程序员第 48 阶段15:Transformer 架构总览与自注意力直觉,注意力权重可视化:用 Java 打印注意力矩阵理解模型在看什么
人工智能·深度学习·transformer
泡干脆面就番茄9 小时前
深度学习:PyTorch框架初识——MNIST手写数字识别
python·深度学习
richard_first9 小时前
第3章 PTQ:不用重新训练也能量化 LLM
人工智能·深度学习·语言模型·自然语言处理·transformer
萌新小码农‍9 小时前
KL散度的介绍
人工智能·深度学习·机器学习
星野云联AIoT技术洞察10 小时前
RK3588 边缘 AI 盒子适合什么工业视觉场景
计算机视觉·边缘计算·rk3588·语音识别·图像识别·边缘网关·边缘计算盒子
这张生成的图像能检测吗11 小时前
(论文速读)Cylinder3D:面向室外 LiDAR 分割的柱面划分与非对称 3D 卷积
计算机视觉·点云·3d视觉·三维感知
面包狗AI4S11 小时前
GitHub AI4S 项目观察(2026-09-07—2026-09-13)
人工智能·深度学习·机器学习
贾伟康12 小时前
【HarmonyOS 7新能力|028】Core Vision Kit工程封装:把接入逻辑放进可维护的分层结构
计算机视觉·harmonyos·arkts·端侧ai·harmonyos 7