YOLO26最新创新改进系列:融合 MVIGGraphFusionBlock,构建互视信息图注意力 Neck,嘎嘎创新!
截止目前,YOLO26最新创新改进系列已更新100+种,排列组合后可达到上万种创新模型!极大节省科研时间!!! 仍在持续更新中...
畅享持续更新且可大幅度提升文章档次的纯干货工具!


写在前面:为什么这个改进值得做
YOLO 系列模型的检测能力很大程度来自 Backbone、Neck、Head 三部分的协同。Backbone 负责提取不同层级的视觉表征;Head 负责分类和定位;Neck 则承担一个关键任务:把深层语义和浅层细节重新组织,交给检测头做多尺度预测。
但是,原始 YOLO26 的 FPN/PAN Neck 仍然延续了较典型的融合方式:
Y=Concat(Resize(Xi),Xj) Y = Concat(Resize(X_i), X_j) Y=Concat(Resize(Xi),Xj)
其中 XiX_iXi 与 XjX_jXj 是来自不同尺度或不同路径的特征。这个过程有三个结构性不足:
-
融合前不判断分支可靠性
深层特征语义更强,但空间细节更弱;浅层特征定位更细,但更容易携带纹理噪声。直接拼接相当于默认二者同等可信。
-
跨尺度冲突没有显式建模
小目标、遮挡目标、密集目标常会在不同尺度上呈现不一致响应。原结构把冲突交给后续卷积被动消化,缺少先验约束。
-
局部不确定区域缺少抑制机制
当某个分支的空间响应接近 0.5,说明该区域既不像明确前景,也不像明确背景。原始 Concat 不会主动识别这种高熵区域。
MVIGGraphFusionBlock 的核心目的就是解决这个痛点:让 Neck 在拼接前先"看一眼"两个分支之间是否互相支持、是否存在不确定区域、哪一支更值得被增强。对于希望写 SCI/中文核心/工程创新说明的改进工作,这一点非常关键,因为它把创新点放在 YOLO 原始结构的内在缺陷上,而不是把提升原因归咎于数据集或训练技巧。
1. 原文来源、摘要翻译与介绍提炼
原文信息:
- 论文题目:Learning Mutual View Information Graph for Adaptive Adversarial Collaborative Perception
- 会议状态:CVPR 2026
- arXiv 链接:https://arxiv.org/abs/2602.19596
- GitHub 链接:https://github.com/yihangtao/MVIG
MVIG 开源仓库说明该工作面向自适应对抗协作感知,支持 spoof 与 remove 两类攻击,并在默认脚本中使用 pointpillar_intermediate 作为感知后端。也就是说,原始 MVIG 并不是为 YOLO 直接设计的模块;本文的工作是提取其独有思想,将"互视信息图"重构为适配 YOLO26 Neck 的跨尺度分支图融合模块。
1.1 摘要翻译提炼
原文摘要的核心含义可以概括为:
协作感知通过多智能体共享感知信息来扩大感知范围,但攻击者如何以较小代价破坏协作感知系统,仍是一个值得研究的问题。已有攻击方法往往依赖固定策略或贪心搜索,难以充分适应遮挡、可见性和多视角信息差异带来的不确定性。MVIG 提出学习 Mutual View Information Graph,通过建模不同视角之间的信息交互关系,生成更具针对性的风险区域,并配合熵感知搜索策略完成自适应攻击或安全分析。
1.2 介绍部分的总结提炼
介绍部分的思想可以进一步提炼为三点:
-
不是所有视角都同等可靠
在协作感知中,不同车辆、不同传感器、不同空间区域对同一目标的可见程度并不一致。某些视角能提供清晰证据,某些视角只提供弱证据甚至误导性证据。
-
视角之间的关系比单个视角本身更重要
目标是否稳定存在,不仅取决于单个视角的响应强弱,还取决于多个视角之间是否互相支持。MVIG 将这种关系显式表示为图。
-
不确定性应该参与决策
高熵区域意味着模型判断模糊。MVIG 使用熵感知思想,把不确定性作为搜索和决策的重要依据。
迁移到 YOLO26 后,可以得到一个非常自然的创新切入点:FPN/PAN 中的不同尺度分支,本质上也是对同一目标的不同"view"。P3 关注细粒度定位,P4 关注中尺度语义,P5 关注高层上下文。既然这些分支存在信息互补和可靠性差异,就不应该只用静态 Concat 完成融合。
2. 为什么要把 MVIG 融合到 YOLO26 Neck
本次融合不是把协作感知代码原封不动塞进 YOLO,而是做了一次任务适配:
| MVIG 原始概念 | YOLO26 中的对应解释 | 融合价值 |
|---|---|---|
| 多智能体视角 | FPN/PAN 中不同尺度或不同路径的分支 | 将"多视角互补"迁移为"跨尺度互补" |
| Mutual View Information Graph | 分支间互信息图 | 建模不同融合分支之间的支持或冲突 |
| 熵感知搜索 | 空间响应熵可靠度 | 抑制模糊区域,增强确定区域 |
| 风险图/可信区域 | Neck 内部注意力权重 | 拼接前先完成可靠性重标定 |
| 图消息传播 | 分支上下文注入 | 让每个分支获得来自另一分支的互证信息 |
原始 YOLO26 的 Neck 融合路径是:
Xi,Xj→Resize→Concat→C3k2 X_i, X_j \rightarrow Resize \rightarrow Concat \rightarrow C3k2 Xi,Xj→Resize→Concat→C3k2
本文改进后的路径是:
Xi,Xj→MVIGGraphFusionBlock→Concat(X^i,X^j)→C3k2 X_i, X_j \rightarrow MVIGGraphFusionBlock \rightarrow Concat(\hat{X}_i,\hat{X}_j) \rightarrow C3k2 Xi,Xj→MVIGGraphFusionBlock→Concat(X^i,X^j)→C3k2
也就是说,后续 C3k2、Detect Head、损失函数、数据读取和训练入口都不需要改变。改动集中在 Neck 的四个融合节点,结构清晰,适合做消融实验,也适合在论文中作为独立模块描述。
3. MVIGGraphFusionBlock 核心结构

设一次 Neck 融合中有两个输入分支:
X1∈RB×C1×H×W,X2∈RB×C2×H×W X_1 \in \mathbb{R}^{B \times C_1 \times H \times W}, \quad X_2 \in \mathbb{R}^{B \times C_2 \times H \times W} X1∈RB×C1×H×W,X2∈RB×C2×H×W
如果两个分支分辨率不同,先将其对齐到当前融合节点的参考分辨率。然后分别通过 1×11 \times 11×1 投影到统一隐空间:
Ei=ϕi(Xi),i∈{1,2} E_i = \phi_i(X_i), \quad i \in \{1,2\} Ei=ϕi(Xi),i∈{1,2}
其中 ϕi\phi_iϕi 表示轻量投影层,作用是让不同通道宽度的分支可以进入同一个图空间。
3.1 空间响应概率
对每个分支生成空间响应概率:
Pi=σ(Si(Ei)) P_i = \sigma(S_i(E_i)) Pi=σ(Si(Ei))
这里 SiS_iSi 是由深度卷积和 1×11 \times 11×1 卷积组成的空间评分层,σ\sigmaσ 是 Sigmoid 函数。PiP_iPi 可以理解为该分支对当前位置是否具有有效目标证据的概率响应。
3.2 熵可靠度建模
原始 Concat 不关心某个位置是否"犹豫"。本文使用二元熵度量响应不确定性:
H(Pi)=−Pilog(Pi)−(1−Pi)log(1−Pi) H(P_i) = - P_i \log(P_i) - (1-P_i)\log(1-P_i) H(Pi)=−Pilog(Pi)−(1−Pi)log(1−Pi)
将其归一化后得到可靠度:
Ri=1−H(Pi) R_i = 1 - H(P_i) Ri=1−H(Pi)
当 PiP_iPi 接近 0 或 1 时,熵低,说明模型判断更确定,RiR_iRi 更高;当 PiP_iPi 接近 0.5 时,熵高,说明该区域更模糊,RiR_iRi 更低。
这一步对应 MVIG 原文中的熵感知思想:不确定性不应该被忽略,而应该参与信息选择。
3.3 分支 token 构建
利用可靠度对空间特征做加权池化:
vi=Normalize(∑h,wRi(h,w)Ei(h,w)∑h,wRi(h,w)+ϵ) v_i = Normalize\left(\frac{\sum_{h,w} R_i(h,w) E_i(h,w)}{\sum_{h,w} R_i(h,w) + \epsilon}\right) vi=Normalize(∑h,wRi(h,w)+ϵ∑h,wRi(h,w)Ei(h,w))
viv_ivi 是第 iii 个分支的图节点表示。它不是普通全局平均池化,而是更关注低熵、高可靠区域。
3.4 互视信息图构建
分支之间的互视关系由三部分组成:
M_{ij} = \\frac{v_i\^\\top v_j}{\\sqrt{d}} * \\left(1 - \\frac{1}{HW}\\sum_{h,w}\|P_i(h,w)-P_j(h,w)\|\\right) * \\lambda \\cdot \\frac{\\bar{R_i}+\\bar{R_j}}{2}
其中:
- 第一项表示两个分支 token 的语义相似度;
- 第二项表示两个分支空间响应的一致性;
- 第三项表示两个分支整体可靠度的联合约束。
然后通过 Softmax 得到图传播权重:
Aij=exp(Mij/τ)∑kexp(Mik/τ) A_{ij} = \frac{\exp(M_{ij}/\tau)}{\sum_k \exp(M_{ik}/\tau)} Aij=∑kexp(Mik/τ)exp(Mij/τ)
τ\tauτ 是温度系数,用来控制图注意力分布的锐度。
3.5 图消息传播与分支增强
图消息聚合为:
zi=∑jAijvj z_i = \sum_j A_{ij}v_j zi=j∑Aijvj
再将 ziz_izi 映射回对应分支的通道维度,并注入到原特征中:
Xi^=Xi⊙(1+αRi)+γiGi(zi)+βRi⊙(Xi−AvgPool(Xi)) \hat{X_i} = X_i \odot (1+\alpha R_i) + \gamma_i G_i(z_i) + \beta R_i \odot (X_i - AvgPool(X_i)) Xi^=Xi⊙(1+αRi)+γiGi(zi)+βRi⊙(Xi−AvgPool(Xi))
这个公式包含三条信息路径:
-
熵可靠度增强路径 :Xi⊙(1+αRi)X_i \odot (1+\alpha R_i)Xi⊙(1+αRi)
可靠区域被增强,不可靠区域不会被盲目放大。
-
图消息注入路径 :γiGi(zi)\gamma_i G_i(z_i)γiGi(zi)
分支接收来自互视图的上下文信息。
-
局部细节补偿路径 :βRi⊙(Xi−AvgPool(Xi))\beta R_i \odot (X_i - AvgPool(X_i))βRi⊙(Xi−AvgPool(Xi))
保留边缘、纹理和定位细节,避免图全局信息过度平滑。
最终输出为:
Y=Concat(X1^,X2^) Y = Concat(\hat{X_1}, \hat{X_2}) Y=Concat(X1^,X2^)
与原始 YOLO26 相比,输出通道宽度保持一致,因此后续 C3k2 不需要任何额外适配。
4. 改进前后结构对比
| 对比项 | 原始 YOLO26 Neck | MVIG-YOLO26 Neck |
|---|---|---|
| 融合方式 | 静态 Concat | MVIGGraphFusionBlock + Concat |
| 分支关系 | 默认同权 | 动态互视图建模 |
| 不确定性处理 | 无显式建模 | 使用熵可靠度 R=1−H(P)R=1-H(P)R=1−H(P) |
| 跨尺度冲突 | 交给后续卷积隐式学习 | 拼接前显式计算空间一致性 |
| 细节保持 | 依赖 C3k2 | 增加局部残差补偿 |
| 结构侵入性 | 原始结构 | 仅替换 Neck 融合节点 |
原始融合公式:
Ybase=Concat(Resize(Xi),Xj) Y_{base} = Concat(Resize(X_i), X_j) Ybase=Concat(Resize(Xi),Xj)
改进融合公式:
Ymvig=Concat(Fmvig(Resize(Xi)),Fmvig(Xj)) Y_{mvig} = Concat(F_{mvig}(Resize(X_i)), F_{mvig}(X_j)) Ymvig=Concat(Fmvig(Resize(Xi)),Fmvig(Xj))
核心区别在于,原始方法在融合前没有判断"谁更可信",而改进方法先构建分支间的互视图,再将图上下文和熵可靠度注入分支。
5. 融合方法总览
围绕 MVIG 思想与 YOLO26 的结合,常见可选方案如下:
| 融合位置 | 方法描述 | 优势 | 代价 | 本文是否采用 |
|---|---|---|---|---|
| Concat 前 | 将每个 FPN/PAN 融合节点替换为 MVIGGraphFusionBlock | 最干净,输出通道不变,便于消融 | 需要增加少量图计算 | 采用 |
| C3k2 后 | 在每个 C3k2 输出后加入图注意力增强 | 直接作用于检测尺度特征 | 更容易改变 Head 输入分布 | 不采用 |
| Detect 前 | 对 P3/P4/P5 三个检测尺度做全局图融合 | 全局上下文更强 | 结构耦合更大,计算更重 | 不采用 |
| 后处理阶段 | 利用互视可靠度重排置信度或 NMS | 工程简单 | 无法端到端训练 | 不采用 |
本文选择 Concat 前融合,是因为它最符合"中等版 MVIG Attention Neck"的定位:保留 YOLO26 主体框架,只把静态拼接升级为动态图融合。
6. 适合写进论文的创新点表述
可以将本文改进写成如下创新点:
-
提出一种面向 YOLO26 颈部融合的 Mutual View Information Graph Fusion 模块,将 FPN/PAN 中的相邻尺度分支建模为互视图节点,在特征拼接前完成可靠性评估与图消息传播。
-
设计熵感知分支可靠度估计机制,通过空间响应概率的二元熵刻画不确定区域,使 Neck 能够增强低熵、高可信目标证据,并抑制模糊响应。
-
构建由语义相似度、空间响应一致性和可靠度约束共同组成的互视邻接矩阵,使跨尺度融合从静态通道堆叠转变为动态关系建模。
-
在不改变 YOLO26 Backbone、Detect Head 和训练损失的前提下,仅替换 FPN/PAN 中的 Concat 节点,实现结构级增强,并保持良好的可复现性和消融清晰度。
7 总结
这次改进的重点不是"再加一个注意力",而是围绕 YOLO26 原始 Neck 的静态融合缺陷,构建一个有明确理论动机的动态图融合模块。MVIGGraphFusionBlock 将 MVIG 的互视信息图思想迁移到 YOLO26 的 FPN/PAN 融合节点,把跨尺度分支看作不同 view,通过熵可靠度、空间一致性和图消息传播完成拼接前增强。
写在最后
学术因方向、个人实验和写作能力以及具体创新内容的不同而无法做到一通百通,关注UP:Ai学术叫叫兽
在所有资料中留下联系方式以便在科研之余为家人们答疑解惑,本up主获得过国奖,发表多篇SCI,擅长目标检测领域,拥有多项竞赛经历,拥有软件著作权,核心期刊等经历。
因为经历过所以更懂小白的痛苦!
因为经历过所以更具有指向性的指导!
祝所有科研工作者都能够在自己的领域上更上一层楼!