ICPR 2022 多教师知识蒸馏技术应用于图像超分辨率重建------MTKDSR
1. 摘要
在单张图像超分辨率(SISR)任务中,基于深度神经网络的方法取得了显著成果。然而,庞大的模型参数量和高昂的计算成本限制了其落地应用。同时,在超分重建中,高重建保真度(如 PSNR)与优异的感知质量(如视觉逼真度)之间始终存在权衡折中(Trade-off)。
针对这一难题,作者提出了用于超分辨率的多教师知识蒸馏框架(MTKDSR)。该框架通过同时引入精通"重建保真度"与精通"感知质量"的两类教师模型,指导并训练出一个兼顾性能、轻量且高效的学生网络。此外,为了生成更真实且易于学习的纹理,作者提出了一种基于边缘引导的非 GAN 教师网络------EdgeSRN。在知识迁移过程中,EdgeSRN 相比传统的生成对抗网络(GAN)能够提供更稳定且少伪影的知识指导。
实验表明,MTKDSR 训练出的轻量级学生模型在极小参数量和计算量下,感知质量显著优于现有最先进的轻量级超分网络。
2. 引言
在单张图像超分辨率任务中,网络通常分为两类:
- 以重建为导向(Reconstruction-oriented):模型通常使用 MSE 或 MAE 损失优化,重建保真度(PSNR/SSIM)高,但生成的图像往往过于平滑,缺乏高频纹理细节。
- 以感知为导向(Perception-driven):通常基于生成对抗网络(GAN),生成的图像细节丰富、边缘清晰,但容易引入不自然的伪影(Artifacts),且计算量极大。
为了让轻量级模型同时吸收两者的优势,作者提出了 MTKDSR ,这是首个用于 SISR 任务的多教师知识蒸馏方法 。此外,针对传统 GAN 教师模型参数量庞大、易产生伪影导致知识转移困难的问题,作者设计了 EdgeSRN------一种通过边缘损失引导的非 GAN 感知教师模型。
作者的主要贡献总结如下:
- 提出了 MTKDSR 框架,通过引入多个侧重点不同的教师模型,训练出性能超越单教师蒸馏或传统 LR-HR 配对训练的轻量级 SR 学生网络。
- 提出了非 GAN 架构的 EdgeSRN 作为感知教师,利用边缘引导生成逼真且可学习的纹理,减少了伪影并降低了计算负担。
3. 相关工作
相关工作主要从三个维度进行回顾:
3.1 以重建为导向的超分方法
- SRCNN:Dong 等人提出的首个基于 CNN 的超分方法。
- IMDN:Hui 等人提出的信息多重蒸馏网络,通过特征通道切分实现了轻量化与高性能。
- RFDN:Liu 等人基于 IMDN 改进的残差特征蒸馏网络,进一步降低了参数量并提升了重建效果。
- 其他包括 A 2 N A^2N A2N 等注意力机制超分网络。这类方法虽 PSNR 表现好,但边缘容易模糊。
3.2 以感知为导向的超分方法
- SRGAN / ESRGAN:Ledig 和 Wang 等人通过引入 VGG 感知损失和判别器对抗损失,极大地提升了重建图像的视觉质量。
- SPSR:Cheng 等人提出的结合梯度引导的结构保持超分方法。这类方法视觉效果优异,但参数量高且容易产生虚假伪影。
3.3 知识蒸馏用于图像超分
- KDSR:Gao 等人首次将知识蒸馏技术引入 SISR 任务。
- FAKD:He 等人利用空间特征关联矩阵对齐教师与学生的特征图。
- CSD:Wu 等人提出的对比自蒸馏框架。
- 现有超分蒸馏方法多为单教师架构且主要在特征图上进行约束,难以有效兼顾高频细节恢复与视觉真实感。
4. 方法
作者提出的多教师知识蒸馏框架(MTKDSR)包含两个核心部分:
- 多教师知识蒸馏(MTKDSR Framework);
- 边缘引导感知教师网络(EdgeSRN)。
4.1 多教师知识蒸馏框架(MTKDSR)
MTKDSR 框架同时接收两个预训练好的教师模型输入:
- T P S N R T_{PSNR} TPSNR:精通高重建保真度的教师(如 IMDN);
- T P I T_{PI} TPI:精通高感知质量的教师(如 EdgeSRN)。

对于输入的低分辨率图像 I L R I_{LR} ILR,分别获得三者的超分重建结果:
I S R _ P S N R = T P S N R ( I L R ) I_{SR\PSNR} = T{PSNR}(I_{LR}) ISR_PSNR=TPSNR(ILR)
I S R _ P I = T P I ( I L R ) I_{SR\PI} = T{PI}(I_{LR}) ISR_PI=TPI(ILR)
I S R = S M T ( I L R ) I_{SR} = S_{MT}(I_{LR}) ISR=SMT(ILR)
训练学生模型 S M T S_{MT} SMT 时,损失函数由两部分组成:
- 像素级重建损失(MAE Loss) :约束学生模型向 T P S N R T_{PSNR} TPSNR 的输出对齐。
L 1 ( I S R , I S R _ P S N R ) = ∣ ∣ I S R − I S R _ P S N R ∣ ∣ 1 L_{1}(I_{SR}, I_{SR\PSNR}) = ||I{SR} - I_{SR\_PSNR}||_1 L1(ISR,ISR_PSNR)=∣∣ISR−ISR_PSNR∣∣1 - 感知损失(Perceptual Loss) :利用预训练的 VGG19 提取特征,约束学生模型向 T P I T_{PI} TPI 的输出对齐。
L p ( I S R , I S R _ P I ) = ∣ ∣ V G G ( I S R ) − V G G ( I S R _ P I ) ∣ ∣ 1 L_{p}(I_{SR}, I_{SR\PI}) = ||VGG(I{SR}) - VGG(I_{SR\_PI})||_1 Lp(ISR,ISR_PI)=∣∣VGG(ISR)−VGG(ISR_PI)∣∣1
总损失函数为:
L M T K D S R = λ 1 L 1 ( I S R , I S R _ P S N R ) + λ 2 L p ( I S R , I S R _ P I ) L_{MTKDSR} = \lambda_1 L_1(I_{SR}, I_{SR\PSNR}) + \lambda_2 L_p(I{SR}, I_{SR\_PI}) LMTKDSR=λ1L1(ISR,ISR_PSNR)+λ2Lp(ISR,ISR_PI)
(论文中实验设定 λ 1 = 1 , λ 2 = 0.1 \lambda_1 = 1, \lambda_2 = 0.1 λ1=1,λ2=0.1)。
4.2 边缘引导感知教师网络(EdgeSRN)
为了避免传统 GAN 教师(如 ESRGAN)产生伪影干扰蒸馏,EdgeSRN 采用了无判别器(Non-GAN)的轻量架构(将 ESRGAN 生成器的 RRDB 块由 23 个精简至 10 个)。
EdgeSRN 的训练引入了边缘损失(Edge Loss) ,通过拉普拉斯算子提取 Y 通道上的边缘图进行约束:
L e ( I S R _ P I , I H R ) = ∣ ∣ L a p l a c e ( Y ( I S R _ P I ) ) − L a p l a c e ( Y ( I H R ) ) ∣ ∣ 1 L_{e}(I_{SR\PI}, I{HR}) = ||Laplace(Y(I_{SR\PI})) - Laplace(Y(I{HR}))||_1 Le(ISR_PI,IHR)=∣∣Laplace(Y(ISR_PI))−Laplace(Y(IHR))∣∣1
EdgeSRN 的总训练损失为:
L E d g e S R N = L p ( I S R _ P I , I H R ) + η 1 L 1 ( I S R _ P I , I H R ) + η 2 L e ( I S R _ P I , I H R ) L_{EdgeSRN} = L_p(I_{SR\PI}, I{HR}) + \eta_1 L_1(I_{SR\PI}, I{HR}) + \eta_2 L_e(I_{SR\PI}, I{HR}) LEdgeSRN=Lp(ISR_PI,IHR)+η1L1(ISR_PI,IHR)+η2Le(ISR_PI,IHR)
(设定 η 1 = 0.01 , η 2 = 0.01 \eta_1 = 0.01, \eta_2 = 0.01 η1=0.01,η2=0.01)。
5. 实验
5.1 实验设置与细节
- 训练集:DIV2K(800张高分辨率图像)。
- 测试集:Set5、Set14、BSD100、Urban100、Manga109。
- 评估指标 :
- 重建保真度:PSNR、SSIM;
- 感知质量:LPIPS、PI(Perceptual Index,非参考指标,越低越好)。
- 对比算法 :SRCNN、IMDN、RFDN、 A 2 N A^2N A2N、FAKD、CSD 等。
- 学生模型:通道数扩展至 64 的 RFDN 变体(参数量约 2.84MB)。
- 训练细节 :使用 Adam 优化器,Patch 大小 192 × 192 192 \times 192 192×192,初始学习率 10 − 3 10^{-3} 10−3,每 100 epoch 减半。
5.2 客观量化比较
在 × 4 \times 4 ×4 超分任务下的测试结果显示:
- 感知指标大幅领先 :MTKDSR 训练的学生模型在所有测试集上的 LPIPS 和 PI 指标均达到了轻量级网络中的最优表现(Lowest Value)。
- 轻量高效 :MTKDSR 的学生模型参数量仅为 2.84 MB ,计算量仅为 0.687 GFLOPs,极具落地优势。
- 超越 GAN 蒸馏:相比于使用 ESRGAN 或 SPSR 作为感知教师,使用 EdgeSRN 蒸馏出的学生在 PSNR 和 PI 上均表现更佳,证明了 EdgeSRN 能够提供更干净、无伪影的纹理知识。

5.3 消融实验
- 单教师 vs 多教师:单教师蒸馏(仅 IMDN 或仅 EdgeSRN)会导致模型偏科。MTKDSR 多教师蒸馏使学生模型在保持高 PSNR 的同时,获得了极佳的感知质量。

- 超越配对数据训练(HR_RFDN):直接使用 LR-HR 真值配对训练的学生模型(HR_RFDN),其综合表现甚至不如 MTKDSR 训练的学生。这说明多教师转移的"软知识"提供了比原始真值图像更丰富、更容易学习的信息。

6. 结论
本文针对图像超分辨率重建中的"保真度与感知质量折中"问题,提出了首个多教师知识蒸馏框架 MTKDSR 。通过结合重建型教师与感知型教师的优势,成功训练出了极轻量且视觉效果优异的学生模型。同时提出的 EdgeSRN 克服了传统 GAN 教师易产生伪影的弊端,为超分任务中的感知蒸馏提供了全新的思路。未来的研究可将此多教师蒸馏思想进一步扩展至图像去雾、去噪等更多低阶视觉恢复任务中。