即插即用模块 + 改进思路汇总目录

即插即用模块 + 改进思路汇总目录

📚 卷积|注意力|Transformer|分割|扩散模型|训练优化

本专栏主要整理能够直接嵌入各类深度学习模型中的即插即用模块,以及来自顶会、顶刊论文中的网络结构设计与改进思路。

内容涵盖卷积模块、注意力机制、Transformer、图像分割、图像恢复、扩散模型、视频生成、损失函数、长尾学习、不确定性估计等方向。

在复现论文原始模块的基础上,也会结合实际网络结构给出一些二次创新与改进思路,方便用于目标检测、图像分类、语义分割、医学图像、遥感图像、低层视觉、生成模型等任务。


⭐ 标记说明

  • 🔥:顶会 / 顶刊相关工作

  • ✅:文章中提供源码、代码链接或可运行实现

  • 🧩:即插即用实现 / 模块代码 / 改进思路

  • 📖:论文原理与结构解析


📑 总目录

一、🧱 卷积模块与轻量化网络

  1. Ego:内容相似度驱动的卷积神经网络

  2. PFGNet:频率制导外围门控网络

  3. MSCK-Net:多尺度中国结卷积网络

  4. SCNet:自校准卷积

  5. SCConv1d & SCConv2d:即插即用自校准卷积

  6. PartialNet:PATConv 与动态部分卷积

  7. FDConv:频率动态卷积

  8. LSNet:从人类视觉系统学习的轻量级网络

  9. ARConv:自适应矩形卷积

  10. OverLoCK:上下文混合动态核卷积

  11. DCNv4:高效可变形卷积

  12. InceptionNeXt Block 改进思路


二、🧠 注意力机制与 Transformer

  1. Attention Surgery:视频扩散 Transformer 线性化

  2. DSFormer:双选择融合 Transformer

  3. MALA:幅度感知线性注意力

  4. Synthesizer:无需标准 Q-K 交互的注意力

  5. AST:自适应稀疏 Transformer

  6. 注意力计算中的 Shape / 尺寸记录

  7. ECA 注意力机制改进思路

  8. CBAM 注意力机制改进思路


三、🎯 图像分割、解码与上下采样模块

  1. SMMM:结构感知多尺度掩蔽模块

  2. EMCAD:高效多尺度卷积注意解码器

  3. MPD:Mask-aware Pixel-Shuffle Down-Sampling


四、🎨 生成模型、扩散模型与视频生成

  1. ControlNet-XS:轻量化可控图像生成

  2. AttriDiffuser:KL 正则化自动编码器

  3. AttriDiffuser:余弦相似度模块

  4. StreamingT2V:条件注意模块 CAM

  5. CLR-GAN:一致潜在表征与重建

  6. ByTheWay:无需训练提升文本生成视频质量


五、📉 损失函数、不确定性与训练优化

  1. 两步保形预测:自适应边界框不确定性

  2. DBM Loss:困难感知长尾识别平衡边际损失

  3. 卷积层谱范数的紧凑高效上界

  4. 长尾数据集蒸馏


一、🧱 卷积模块与轻量化网络

1. Ego:内容相似度驱动的卷积神经网络 🔥 ✅

关键词: CNN、内容相似度、长程依赖、动态特征建模

通过内容相似度重新思考传统卷积固定局部连接方式,为卷积神经网络引入更加灵活的特征交互机制。

👉 点击查看:Ego------内容相似度驱动的卷积神经网络


2. PFGNet:高效时空预测学习的频率制导外围门控网络 🔥

关键词: 时空预测、频率建模、外围卷积、动态门控

面向时空预测任务,将频率信息与大范围空间信息建模结合起来,适合研究大感受野卷积和时空特征交互。

👉 点击查看:PFGNet------频率制导外围门控网络


3. MSCK-Net:基于多尺度中国结卷积网络的微光红外舰船检测 🔥 ✅

关键词: 红外小目标、多尺度特征、CKConv、舰船检测

针对微光红外图像中的舰船检测问题设计多尺度卷积结构,对红外小目标、遥感目标检测具有较好的借鉴意义。

👉 点击查看:MSCK-Net------多尺度中国结卷积网络


4. SCNet:用自校准卷积改进卷积网络 🔥 ✅

关键词: Self-Calibrated Convolution、SCConv、跨尺度信息、自校准

SCConv 通过特征内部的信息交互扩大有效感受野,并增强卷积特征的判别能力,是非常经典的即插即用卷积改进模块。

👉 点击查看:SCNet------用自校准卷积改进卷积网络


5. SCConv1d & SCConv2d:即插即用自校准卷积模块 🧩

关键词: SCConv1d、SCConv2d、PyTorch、模块替换

在 SCConv 原理基础上进一步整理一维与二维版本,可用于时序数据、图像任务以及现有卷积层的直接替换。

👉 点击查看:SCConv1d & SCConv2d 使用指南


6. PartialNet:PATConv 与动态部分卷积

关键词: Partial Convolution、PATConv、DPConv、轻量化

通过局部特征计算和动态部分卷积减少冗余计算,为轻量级网络设计和高效特征提取提供新的结构思路。

👉 点击查看:PartialNet------PATConv 与动态部分卷积


7. FDConv:用于密集图像预测的频率动态卷积 🔥

关键词: FDConv、Frequency、Dynamic Convolution、密集预测

从频率域角度重新设计动态卷积,让卷积核具备更加灵活的频率响应能力,可用于检测、分割等密集预测任务。

👉 点击查看:FDConv------频率动态卷积


8. LSNet:从人类视觉系统中学到的轻量级网络设计 🔥

关键词: Lightweight Network、视觉感知、大核卷积、动态特征

从人类视觉系统的感知机制出发设计轻量级网络,对轻量化 Backbone 和高效卷积结构设计具有参考价值。

👉 点击查看:LSNet------从人类视觉系统中学习轻量级网络设计


9. ARConv:自适应矩形卷积 🔥

关键词: ARConv、矩形卷积、自适应采样、遥感

突破传统固定正方形卷积核的限制,使卷积能够根据目标形状自适应调整采样区域。

👉 点击查看:ARConv------自适应矩形卷积


10. OverLoCK:上下文混合动态核卷积

关键词: Dynamic Kernel、Context Mixing、ConvNet、上下文建模

利用上下文信息动态调节卷积特征提取过程,适合用于探索卷积网络中的动态感受野与上下文交互。

👉 点击查看:OverLoCK------上下文混合动态核卷积


11. DCNv4:高效可变形卷积算子 🔥

关键词: DCNv4、Deformable Convolution、动态采样、算子优化

DCNv4 对可变形卷积进行进一步简化和优化,在保持动态空间建模能力的同时提升计算效率。

👉 点击查看:DCNv4------高效可变形卷积算子


12. InceptionNeXt Block 改进思路 🔥 🧩

关键词: InceptionNeXt、ConvNeXt、DWConv、多尺度卷积

围绕 InceptionNeXt Block 的多分支卷积结构展开,可进一步尝试动态卷积、不同尺度卷积以及注意力机制融合。

👉 点击查看:InceptionNeXt Block 改进思路


二、🧠 注意力机制与 Transformer

1. Attention Surgery:让视频扩散 Transformer 线性化 🔥

关键词: Video Diffusion、Linear Attention、Transformer、推理加速

针对视频扩散 Transformer 中注意力计算复杂度较高的问题,对注意力结构进行重新设计,为长视频生成和高效注意力提供新思路。

👉 点击查看:Attention Surgery


2. DSFormer:高光谱图像分类的双选择融合 Transformer

关键词: Hyperspectral、Transformer、Token Selection、多尺度融合

针对高光谱图像丰富的空间---光谱信息设计双选择融合结构,对遥感分类及多维特征建模具有参考价值。

👉 点击查看:DSFormer------双选择融合 Transformer


3. MALA:修正线性注意中的幅度忽略 🔥

关键词: Linear Attention、Magnitude、Softmax、Attention

从"幅度信息被忽略"的角度分析传统线性注意力,并提出相应改进机制,对高效 Transformer 的设计很有启发。

👉 点击查看:MALA------幅度感知线性注意力


4. Synthesizer 的大致代码 🔥 🧩

关键词: Synthesizer、Self-Attention、Transformer、随机注意力

Synthesizer 探索不依赖传统 Query-Key 点积的注意力生成方式,可用于理解 Self-Attention 中真正重要的组成部分。

👉 点击查看:Synthesizer 的大致代码


5. AST:关注特征细化的图像恢复自适应稀疏变换 🔥 ✅

关键词: Image Restoration、Sparse Attention、Transformer、FRFN

通过自适应稀疏注意力和特征细化机制增强图像恢复能力,对去雨、去模糊、去噪等低层视觉任务具有较强参考价值。

👉 点击查看:AST------自适应稀疏变换


6. 注意力计算的形状尺寸记录 🧩

关键词: Q、K、V、Multi-Head Attention、Tensor Shape

记录注意力机制在实际代码实现过程中各阶段 Tensor 的 Shape 变化,适合排查维度错误和理解多头注意力计算过程。

👉 点击查看:注意力计算的形状尺寸记录


7. ECA 注意力机制改进思路 🧩

关键词: ECA、Channel Attention、1D Convolution、通道交互

围绕 ECA 高效通道注意力机制进行二次改进,可尝试多尺度卷积、自适应卷积核以及空间注意力融合。

👉 点击查看:ECA 注意力机制改进思路


8. CBAM 注意力机制改进思路 🔥 🧩

关键词: CBAM、Channel Attention、Spatial Attention、注意力改进

经典的通道注意力 + 空间注意力组合模块,结构简单,适合嵌入 CNN、YOLO、U-Net 等模型中继续进行改进。

👉 点击查看:CBAM 改进思路


三、🎯 图像分割、解码与上下采样模块

1. SMMM:结构感知多尺度掩蔽模块 🔥 ✅

关键词: Medical Segmentation、多尺度、Mask、结构感知

面向医学图像分割设计的多尺度掩蔽结构,通过不同尺度和结构信息增强目标边界与区域表征。

👉 点击查看:SMMM------结构感知多尺度掩蔽模块


2. EMCAD:高效多尺度卷积注意解码模块 🧩

关键词: Decoder、Multi-Scale Convolution、Attention、医学图像分割

采用多尺度卷积和注意力机制构建高效解码器,可直接借鉴到 U-Net、Encoder-Decoder 等分割框架中。

👉 点击查看:EMCAD------高效多尺度卷积注意解码模块


3. MPD:Mask-aware Pixel-Shuffle Down-Sampling 🧩

关键词: PixelUnshuffle、Down-Sampling、Mask-aware、特征保留

从传统下采样容易损失空间细节的问题出发,通过 Pixel-Shuffle / Pixel-Unshuffle 思路进行信息重排。

👉 点击查看:MPD 下采样模块


四、🎨 生成模型、扩散模型与视频生成

1. ControlNet-XS:从反馈控制系统重新思考图像生成控制机制 🔥

关键词: ControlNet、Diffusion、反馈控制、可控生成

从反馈控制系统角度重新分析条件生成机制,以更加轻量的控制分支实现扩散模型的可控生成。

👉 点击查看:ControlNet-XS


2. AttriDiffuser:KL 正则化自动编码器 🔥 ✅

关键词: AutoencoderKL、VAE、Latent Space、Diffusion

围绕 AttriDiffuser 中的 KL 正则化自动编码器展开,适合理解潜空间扩散模型中的编码与重建机制。

👉 点击查看:AttriDiffuser------KL 正则化自动编码器


3. AttriDiffuser:余弦相似度 🔥 ✅

关键词: Cosine Similarity、Feature Matching、DeepFace、属性保持

主要整理 AttriDiffuser 中基于余弦相似度的特征约束与匹配思想。

👉 点击查看:AttriDiffuser------余弦相似度


4. StreamingT2V:条件注意模块 CAM 🧩

关键词: Text-to-Video、CAM、Conditional Attention、Video Diffusion

整理 StreamingT2V 中条件注意模块的结构,可用于研究长视频生成中的条件信息注入与跨帧建模。

👉 点击查看:StreamingT2V------条件注意模块 CAM


5. CLR-GAN:一致潜在表征与重建

关键词: GAN、Latent Representation、Reconstruction、训练稳定性

通过潜在空间一致性和重建约束提升 GAN 的训练稳定性与生成质量。

👉 点击查看:CLR-GAN


6. ByTheWay:无需训练提升文本生成视频质量 🔥 ✅

关键词: Text-to-Video、Training-Free、Temporal Attention、视频生成

一种无需额外训练即可增强已有文本生成视频模型的方法,为低成本视频生成增强提供了新的插件化思路。

👉 点击查看:ByTheWay------无需训练提升文本生成视频质量


五、📉 损失函数、不确定性与训练优化

1. 基于两步保形预测的自适应边界框不确定性 🔥

关键词: Conformal Prediction、Uncertainty、Bounding Box、目标检测

利用保形预测对目标检测边界框的不确定性进行估计,对高可靠目标检测和置信区间预测具有参考意义。

👉 点击查看:两步保形预测与自适应边界框不确定性


2. DBM Loss:困难感知的长尾识别平衡边际损失 🔥

关键词: Long-Tailed Recognition、Hard Sample、Margin Loss、类别不平衡

针对长尾识别中的类别不平衡和困难样本问题设计新的 Margin 调整机制,可作为分类网络中的即插即用损失函数。

👉 点击查看:DBM Loss------困难感知长尾识别平衡边际损失


3. 卷积层谱范数的紧凑高效上界

关键词: Spectral Norm、Convolution、Lipschitz、Regularization

研究卷积层谱范数的高效估计方法,可用于网络稳定性、鲁棒性以及 Lipschitz 约束相关研究。

👉 点击查看:卷积层谱范数的紧凑高效上界


4. 长尾数据集蒸馏 🔥 ✅

关键词: Dataset Distillation、Long-Tailed Learning、类别不平衡、知识蒸馏

将数据集蒸馏思想应用到长尾学习场景,通过更紧凑、更具代表性的训练样本缓解类别不平衡问题。

👉 点击查看:长尾数据集蒸馏


🔎 按模块类型快速检索

🧱 想改进卷积 / Backbone

推荐优先阅读:

Ego → SCConv → PartialNet → FDConv → LSNet → ARConv → OverLoCK → DCNv4 → InceptionNeXt

适合:

YOLO / ResNet / ConvNeXt / U-Net / 遥感检测 / 图像分类 / 轻量化网络


🧠 想改进注意力机制

推荐优先阅读:

MALA → AST → ECA → CBAM → Synthesizer → DSFormer → Attention Surgery

适合:

Transformer / ViT / CNN-Attention / 图像恢复 / 高光谱分类 / 视频扩散


🎯 想改进分割网络

推荐优先阅读:

SMMM → EMCAD → MPD

适合:

U-Net / 医学图像分割 / 语义分割 / 小目标分割 / Encoder-Decoder


🎨 想改进扩散模型 / 视频生成

推荐优先阅读:

ControlNet-XS → AttriDiffuser → StreamingT2V → ByTheWay → Attention Surgery

适合:

Stable Diffusion / ControlNet / Text-to-Video / Video Diffusion / 可控生成


📉 想改进训练策略 / Loss

推荐优先阅读:

DBM Loss → 两步保形预测 → 长尾数据集蒸馏 → 卷积层谱范数

适合:

长尾分类 / 目标检测 / 不确定性估计 / 网络正则化 / 鲁棒训练


🔥 顶会论文方向快速索引

CVPR / ICCV / ECCV / AAAI / ICML 等方向

  • Attention Surgery

  • Ego

  • PFGNet

  • MALA

  • FDConv

  • LSNet

  • ARConv

  • ByTheWay

  • 长尾数据集蒸馏

  • DCNv4

  • AST

  • InceptionNeXt

  • ControlNet-XS

  • 两步保形预测

  • SMMM

  • DBM Loss

  • SCNet

  • Synthesizer

  • CBAM


💻 代码实现 / 即插即用优先阅读

如果目标是直接拿模块改网络,建议优先阅读:

SCConv1d & SCConv2d

→ 适合直接替换普通卷积。

ECA / CBAM

→ 适合快速加入通道或空间注意力。

DCNv4 / ARConv / FDConv

→ 适合从卷积采样方式、动态卷积核方向进行创新。

PartialNet / InceptionNeXt

→ 适合轻量化 Backbone 与多尺度卷积设计。

EMCAD / SMMM / MPD

→ 适合分割网络 Decoder 与上下采样结构创新。

MALA / Synthesizer / AST

→ 适合 Transformer 与 Attention 结构创新。

ControlNet-XS / StreamingT2V CAM / ByTheWay

→ 适合扩散模型和视频生成模型的插件式改进。


📝 后续更新

本目录将持续更新。

后续主要补充:

① 顶会 / 顶刊中的即插即用模块

② 卷积、注意力、Transformer 的最新结构

③ YOLO、U-Net、ResNet 等模型的模块替换方案

④ 图像恢复、医学分割、遥感检测、生成模型等任务中的改进模块

⑤ 各类模块的二次创新与组合改进思路

如果对某个模块感兴趣,可以直接通过本文目录跳转到对应文章。

持续更新中...... 🚀

相关推荐
Geek-Chow1 小时前
12 开源 vs 闭源:同一份权重,两种交付
人工智能·llm·大语言模型
一个处女座的程序猿1 小时前
Agent之Tool:MoneyPrinterTurbo(一站式 AI 短视频生成工具)的简介、安装和使用方法、案例应用之详细攻略
人工智能·音视频·moneyprinter
港股研究社1 小时前
物理AI临界点:智驾Tier 1越过规模效应拐点
人工智能
m4Rk_1 小时前
【论文阅读】Agent 记忆机制(48):Fine-Mem——用细粒度奖励解决长期记忆管理中的奖励稀疏与信用分配
论文阅读·人工智能·学习·开源·github
IanSkunk1 小时前
眼视光设备全周期台账:从验收入库到使用效果数据化的管理闭环
大数据·网络·人工智能
拓人间精准客2 小时前
2025–2026 ToB 精准拓客实战手册:用“企业数据画像 + 动态筛选“击穿七大行业获客内卷
大数据·数据库·人工智能
北京GEO服务商余小铁2 小时前
北京建材行业怎么通过 GEO 推广实现获客
人工智能
txg6662 小时前
Less Is More:如何用半监督学习提升漏洞检测能力
人工智能·深度学习·学习·安全·开源软件
天涯明月19932 小时前
Ray 架构解析——以动态任务图统一 AI 计算的分布式框架
大数据·人工智能·分布式·架构·ray