即插即用模块 + 改进思路汇总目录
📚 卷积|注意力|Transformer|分割|扩散模型|训练优化
本专栏主要整理能够直接嵌入各类深度学习模型中的即插即用模块,以及来自顶会、顶刊论文中的网络结构设计与改进思路。
内容涵盖卷积模块、注意力机制、Transformer、图像分割、图像恢复、扩散模型、视频生成、损失函数、长尾学习、不确定性估计等方向。
在复现论文原始模块的基础上,也会结合实际网络结构给出一些二次创新与改进思路,方便用于目标检测、图像分类、语义分割、医学图像、遥感图像、低层视觉、生成模型等任务。
⭐ 标记说明
-
🔥:顶会 / 顶刊相关工作
-
✅:文章中提供源码、代码链接或可运行实现
-
🧩:即插即用实现 / 模块代码 / 改进思路
-
📖:论文原理与结构解析
📑 总目录
一、🧱 卷积模块与轻量化网络
-
Ego:内容相似度驱动的卷积神经网络
-
PFGNet:频率制导外围门控网络
-
MSCK-Net:多尺度中国结卷积网络
-
SCNet:自校准卷积
-
SCConv1d & SCConv2d:即插即用自校准卷积
-
PartialNet:PATConv 与动态部分卷积
-
FDConv:频率动态卷积
-
LSNet:从人类视觉系统学习的轻量级网络
-
ARConv:自适应矩形卷积
-
OverLoCK:上下文混合动态核卷积
-
DCNv4:高效可变形卷积
-
InceptionNeXt Block 改进思路
二、🧠 注意力机制与 Transformer
-
Attention Surgery:视频扩散 Transformer 线性化
-
DSFormer:双选择融合 Transformer
-
MALA:幅度感知线性注意力
-
Synthesizer:无需标准 Q-K 交互的注意力
-
AST:自适应稀疏 Transformer
-
注意力计算中的 Shape / 尺寸记录
-
ECA 注意力机制改进思路
-
CBAM 注意力机制改进思路
三、🎯 图像分割、解码与上下采样模块
-
SMMM:结构感知多尺度掩蔽模块
-
EMCAD:高效多尺度卷积注意解码器
-
MPD:Mask-aware Pixel-Shuffle Down-Sampling
四、🎨 生成模型、扩散模型与视频生成
-
ControlNet-XS:轻量化可控图像生成
-
AttriDiffuser:KL 正则化自动编码器
-
AttriDiffuser:余弦相似度模块
-
StreamingT2V:条件注意模块 CAM
-
CLR-GAN:一致潜在表征与重建
-
ByTheWay:无需训练提升文本生成视频质量
五、📉 损失函数、不确定性与训练优化
-
两步保形预测:自适应边界框不确定性
-
DBM Loss:困难感知长尾识别平衡边际损失
-
卷积层谱范数的紧凑高效上界
-
长尾数据集蒸馏
一、🧱 卷积模块与轻量化网络
1. Ego:内容相似度驱动的卷积神经网络 🔥 ✅
关键词: CNN、内容相似度、长程依赖、动态特征建模
通过内容相似度重新思考传统卷积固定局部连接方式,为卷积神经网络引入更加灵活的特征交互机制。
👉 点击查看:Ego------内容相似度驱动的卷积神经网络
2. PFGNet:高效时空预测学习的频率制导外围门控网络 🔥
关键词: 时空预测、频率建模、外围卷积、动态门控
面向时空预测任务,将频率信息与大范围空间信息建模结合起来,适合研究大感受野卷积和时空特征交互。
3. MSCK-Net:基于多尺度中国结卷积网络的微光红外舰船检测 🔥 ✅
关键词: 红外小目标、多尺度特征、CKConv、舰船检测
针对微光红外图像中的舰船检测问题设计多尺度卷积结构,对红外小目标、遥感目标检测具有较好的借鉴意义。
👉 点击查看:MSCK-Net------多尺度中国结卷积网络
4. SCNet:用自校准卷积改进卷积网络 🔥 ✅
关键词: Self-Calibrated Convolution、SCConv、跨尺度信息、自校准
SCConv 通过特征内部的信息交互扩大有效感受野,并增强卷积特征的判别能力,是非常经典的即插即用卷积改进模块。
👉 点击查看:SCNet------用自校准卷积改进卷积网络
5. SCConv1d & SCConv2d:即插即用自校准卷积模块 🧩
关键词: SCConv1d、SCConv2d、PyTorch、模块替换
在 SCConv 原理基础上进一步整理一维与二维版本,可用于时序数据、图像任务以及现有卷积层的直接替换。
👉 点击查看:SCConv1d & SCConv2d 使用指南
6. PartialNet:PATConv 与动态部分卷积
关键词: Partial Convolution、PATConv、DPConv、轻量化
通过局部特征计算和动态部分卷积减少冗余计算,为轻量级网络设计和高效特征提取提供新的结构思路。
👉 点击查看:PartialNet------PATConv 与动态部分卷积
7. FDConv:用于密集图像预测的频率动态卷积 🔥
关键词: FDConv、Frequency、Dynamic Convolution、密集预测
从频率域角度重新设计动态卷积,让卷积核具备更加灵活的频率响应能力,可用于检测、分割等密集预测任务。
8. LSNet:从人类视觉系统中学到的轻量级网络设计 🔥
关键词: Lightweight Network、视觉感知、大核卷积、动态特征
从人类视觉系统的感知机制出发设计轻量级网络,对轻量化 Backbone 和高效卷积结构设计具有参考价值。
👉 点击查看:LSNet------从人类视觉系统中学习轻量级网络设计
9. ARConv:自适应矩形卷积 🔥
关键词: ARConv、矩形卷积、自适应采样、遥感
突破传统固定正方形卷积核的限制,使卷积能够根据目标形状自适应调整采样区域。
10. OverLoCK:上下文混合动态核卷积
关键词: Dynamic Kernel、Context Mixing、ConvNet、上下文建模
利用上下文信息动态调节卷积特征提取过程,适合用于探索卷积网络中的动态感受野与上下文交互。
👉 点击查看:OverLoCK------上下文混合动态核卷积
11. DCNv4:高效可变形卷积算子 🔥
关键词: DCNv4、Deformable Convolution、动态采样、算子优化
DCNv4 对可变形卷积进行进一步简化和优化,在保持动态空间建模能力的同时提升计算效率。
12. InceptionNeXt Block 改进思路 🔥 🧩
关键词: InceptionNeXt、ConvNeXt、DWConv、多尺度卷积
围绕 InceptionNeXt Block 的多分支卷积结构展开,可进一步尝试动态卷积、不同尺度卷积以及注意力机制融合。
👉 点击查看:InceptionNeXt Block 改进思路
二、🧠 注意力机制与 Transformer
1. Attention Surgery:让视频扩散 Transformer 线性化 🔥
关键词: Video Diffusion、Linear Attention、Transformer、推理加速
针对视频扩散 Transformer 中注意力计算复杂度较高的问题,对注意力结构进行重新设计,为长视频生成和高效注意力提供新思路。
2. DSFormer:高光谱图像分类的双选择融合 Transformer
关键词: Hyperspectral、Transformer、Token Selection、多尺度融合
针对高光谱图像丰富的空间---光谱信息设计双选择融合结构,对遥感分类及多维特征建模具有参考价值。
👉 点击查看:DSFormer------双选择融合 Transformer
3. MALA:修正线性注意中的幅度忽略 🔥
关键词: Linear Attention、Magnitude、Softmax、Attention
从"幅度信息被忽略"的角度分析传统线性注意力,并提出相应改进机制,对高效 Transformer 的设计很有启发。
4. Synthesizer 的大致代码 🔥 🧩
关键词: Synthesizer、Self-Attention、Transformer、随机注意力
Synthesizer 探索不依赖传统 Query-Key 点积的注意力生成方式,可用于理解 Self-Attention 中真正重要的组成部分。
5. AST:关注特征细化的图像恢复自适应稀疏变换 🔥 ✅
关键词: Image Restoration、Sparse Attention、Transformer、FRFN
通过自适应稀疏注意力和特征细化机制增强图像恢复能力,对去雨、去模糊、去噪等低层视觉任务具有较强参考价值。
6. 注意力计算的形状尺寸记录 🧩
关键词: Q、K、V、Multi-Head Attention、Tensor Shape
记录注意力机制在实际代码实现过程中各阶段 Tensor 的 Shape 变化,适合排查维度错误和理解多头注意力计算过程。
7. ECA 注意力机制改进思路 🧩
关键词: ECA、Channel Attention、1D Convolution、通道交互
围绕 ECA 高效通道注意力机制进行二次改进,可尝试多尺度卷积、自适应卷积核以及空间注意力融合。
8. CBAM 注意力机制改进思路 🔥 🧩
关键词: CBAM、Channel Attention、Spatial Attention、注意力改进
经典的通道注意力 + 空间注意力组合模块,结构简单,适合嵌入 CNN、YOLO、U-Net 等模型中继续进行改进。
三、🎯 图像分割、解码与上下采样模块
1. SMMM:结构感知多尺度掩蔽模块 🔥 ✅
关键词: Medical Segmentation、多尺度、Mask、结构感知
面向医学图像分割设计的多尺度掩蔽结构,通过不同尺度和结构信息增强目标边界与区域表征。
2. EMCAD:高效多尺度卷积注意解码模块 🧩
关键词: Decoder、Multi-Scale Convolution、Attention、医学图像分割
采用多尺度卷积和注意力机制构建高效解码器,可直接借鉴到 U-Net、Encoder-Decoder 等分割框架中。
👉 点击查看:EMCAD------高效多尺度卷积注意解码模块
3. MPD:Mask-aware Pixel-Shuffle Down-Sampling 🧩
关键词: PixelUnshuffle、Down-Sampling、Mask-aware、特征保留
从传统下采样容易损失空间细节的问题出发,通过 Pixel-Shuffle / Pixel-Unshuffle 思路进行信息重排。
四、🎨 生成模型、扩散模型与视频生成
1. ControlNet-XS:从反馈控制系统重新思考图像生成控制机制 🔥
关键词: ControlNet、Diffusion、反馈控制、可控生成
从反馈控制系统角度重新分析条件生成机制,以更加轻量的控制分支实现扩散模型的可控生成。
2. AttriDiffuser:KL 正则化自动编码器 🔥 ✅
关键词: AutoencoderKL、VAE、Latent Space、Diffusion
围绕 AttriDiffuser 中的 KL 正则化自动编码器展开,适合理解潜空间扩散模型中的编码与重建机制。
👉 点击查看:AttriDiffuser------KL 正则化自动编码器
3. AttriDiffuser:余弦相似度 🔥 ✅
关键词: Cosine Similarity、Feature Matching、DeepFace、属性保持
主要整理 AttriDiffuser 中基于余弦相似度的特征约束与匹配思想。
👉 点击查看:AttriDiffuser------余弦相似度
4. StreamingT2V:条件注意模块 CAM 🧩
关键词: Text-to-Video、CAM、Conditional Attention、Video Diffusion
整理 StreamingT2V 中条件注意模块的结构,可用于研究长视频生成中的条件信息注入与跨帧建模。
👉 点击查看:StreamingT2V------条件注意模块 CAM
5. CLR-GAN:一致潜在表征与重建
关键词: GAN、Latent Representation、Reconstruction、训练稳定性
通过潜在空间一致性和重建约束提升 GAN 的训练稳定性与生成质量。
6. ByTheWay:无需训练提升文本生成视频质量 🔥 ✅
关键词: Text-to-Video、Training-Free、Temporal Attention、视频生成
一种无需额外训练即可增强已有文本生成视频模型的方法,为低成本视频生成增强提供了新的插件化思路。
👉 点击查看:ByTheWay------无需训练提升文本生成视频质量
五、📉 损失函数、不确定性与训练优化
1. 基于两步保形预测的自适应边界框不确定性 🔥
关键词: Conformal Prediction、Uncertainty、Bounding Box、目标检测
利用保形预测对目标检测边界框的不确定性进行估计,对高可靠目标检测和置信区间预测具有参考意义。
2. DBM Loss:困难感知的长尾识别平衡边际损失 🔥
关键词: Long-Tailed Recognition、Hard Sample、Margin Loss、类别不平衡
针对长尾识别中的类别不平衡和困难样本问题设计新的 Margin 调整机制,可作为分类网络中的即插即用损失函数。
👉 点击查看:DBM Loss------困难感知长尾识别平衡边际损失
3. 卷积层谱范数的紧凑高效上界
关键词: Spectral Norm、Convolution、Lipschitz、Regularization
研究卷积层谱范数的高效估计方法,可用于网络稳定性、鲁棒性以及 Lipschitz 约束相关研究。
4. 长尾数据集蒸馏 🔥 ✅
关键词: Dataset Distillation、Long-Tailed Learning、类别不平衡、知识蒸馏
将数据集蒸馏思想应用到长尾学习场景,通过更紧凑、更具代表性的训练样本缓解类别不平衡问题。
🔎 按模块类型快速检索
🧱 想改进卷积 / Backbone
推荐优先阅读:
Ego → SCConv → PartialNet → FDConv → LSNet → ARConv → OverLoCK → DCNv4 → InceptionNeXt
适合:
YOLO / ResNet / ConvNeXt / U-Net / 遥感检测 / 图像分类 / 轻量化网络
🧠 想改进注意力机制
推荐优先阅读:
MALA → AST → ECA → CBAM → Synthesizer → DSFormer → Attention Surgery
适合:
Transformer / ViT / CNN-Attention / 图像恢复 / 高光谱分类 / 视频扩散
🎯 想改进分割网络
推荐优先阅读:
SMMM → EMCAD → MPD
适合:
U-Net / 医学图像分割 / 语义分割 / 小目标分割 / Encoder-Decoder
🎨 想改进扩散模型 / 视频生成
推荐优先阅读:
ControlNet-XS → AttriDiffuser → StreamingT2V → ByTheWay → Attention Surgery
适合:
Stable Diffusion / ControlNet / Text-to-Video / Video Diffusion / 可控生成
📉 想改进训练策略 / Loss
推荐优先阅读:
DBM Loss → 两步保形预测 → 长尾数据集蒸馏 → 卷积层谱范数
适合:
长尾分类 / 目标检测 / 不确定性估计 / 网络正则化 / 鲁棒训练
🔥 顶会论文方向快速索引
CVPR / ICCV / ECCV / AAAI / ICML 等方向
-
Attention Surgery
-
Ego
-
PFGNet
-
MALA
-
FDConv
-
LSNet
-
ARConv
-
ByTheWay
-
长尾数据集蒸馏
-
DCNv4
-
AST
-
InceptionNeXt
-
ControlNet-XS
-
两步保形预测
-
SMMM
-
DBM Loss
-
SCNet
-
Synthesizer
-
CBAM
💻 代码实现 / 即插即用优先阅读
如果目标是直接拿模块改网络,建议优先阅读:
SCConv1d & SCConv2d
→ 适合直接替换普通卷积。
ECA / CBAM
→ 适合快速加入通道或空间注意力。
DCNv4 / ARConv / FDConv
→ 适合从卷积采样方式、动态卷积核方向进行创新。
PartialNet / InceptionNeXt
→ 适合轻量化 Backbone 与多尺度卷积设计。
EMCAD / SMMM / MPD
→ 适合分割网络 Decoder 与上下采样结构创新。
MALA / Synthesizer / AST
→ 适合 Transformer 与 Attention 结构创新。
ControlNet-XS / StreamingT2V CAM / ByTheWay
→ 适合扩散模型和视频生成模型的插件式改进。
📝 后续更新
本目录将持续更新。
后续主要补充:
① 顶会 / 顶刊中的即插即用模块
② 卷积、注意力、Transformer 的最新结构
③ YOLO、U-Net、ResNet 等模型的模块替换方案
④ 图像恢复、医学分割、遥感检测、生成模型等任务中的改进模块
⑤ 各类模块的二次创新与组合改进思路
如果对某个模块感兴趣,可以直接通过本文目录跳转到对应文章。
持续更新中...... 🚀