**中文名:**形状‑尺度协同感知网络:面向三维脑肿瘤分割(S²CA‑Net)(TMI 2024)
论文代码链接:
github.com
https://github.com/jiangyu945/S2CA-Net
Abstract
The accurate segmentation of brain tumor is significant in clinical practice. Convolutional Neural Network (CNN)-based methods have made great progress in brain tumor segmentation due to powerful local modeling ability. However, brain tumors are frequently pattern‑agnostic, i.e. variable in shape, size and location, which can not be effectively matched by traditional CNN‑based methods with local and regular receptive fields. To address the above issues, we propose a shape‑scale co‑awareness network (S²CA‑Net) for brain tumor segmentation, which can efficiently learn shape‑aware and scale‑aware features simultaneously to enhance pattern‑agnostic representations. Primarily, three key components are proposed to accomplish the co‑awareness of shape and scale. The Local‑Global Scale Mixer (LGSM) decouples the extraction of local and global context by adopting the CNN‑Former parallel structure, which contributes to obtaining finer hierarchical features. The Multi‑level Context Aggregator (MCA) enriches the scale diversity of input patches by modeling global features across multiple receptive fields. The Multi‑Scale Attentive Deformable Convolution (MS‑ADC) learns the target deformation based on the multiscale inputs, which motivates the network to enforce feature constraints both in terms of scale and shape for optimal feature matching. Overall, LGSM and MCA focus on enhancing the scale‑awareness of the network to cope with the size and location variations, while MS‑ADC focuses on capturing deformation information for optimal shape matching. Finally, their effective integration prompts the network to perceive variations in shape and scale simultaneously, which can robustly tackle the variations in patterns of brain tumors. The experimental results on BraTS 2019, BraTS 2020, MSD BTS Task and BraTS2023‑MEN show that S²CA‑Net has superior overall performance in accuracy and efficiency compared to other state‑of‑the‑art methods.
翻译:
脑肿瘤的精准分割在临床工作中具有重要意义。卷积神经网络(CNN)凭借强大的局部建模能力,在脑肿瘤分割任务上取得长足进展。但脑肿瘤存在模式不可知(pattern‑agnostic)的特点,即肿瘤的形状、尺寸、发病位置变化极大,传统 CNN 采用局部固定规则感受野,难以适配这类多变目标。
针对上述问题,本文提出一种形状‑尺度协同感知网络 S²CA‑Net 用于脑肿瘤分割,该网络能够同时高效学习形状感知与尺度感知特征,提升对多变肿瘤模式的特征表达能力。为实现形状与尺度的协同感知,本文设计三个核心模块:局部‑全局尺度混合模块 LGSM 采用 CNN‑Former 并行架构,对局部、全局上下文的特征提取过程进行解耦,获取更精细的分层特征;多级上下文聚合器 MCA 在多感受野下对全局特征建模,丰富输入块的尺度多样性;多尺度注意力可变形卷积 MS‑ADC 基于多尺度输入学习目标形变信息,促使网络从尺度、形状两个维度施加特征约束,实现最优特征匹配。总体而言,LGSM 与 MCA 侧重提升网络的尺度感知能力,应对肿瘤大小与位置的变化;MS‑ADC 则专注捕获形变信息,完成形状匹配。三者有效融合,让网络可以同时感知肿瘤形状与尺度的变化,稳健处理脑肿瘤多样的形态模式。在 BraTS 2019、BraTS 2020、MSD 脑肿瘤分割任务以及 BraTS2023‑MEN 数据集上的实验结果表明,S²CA‑Net 对比现有主流算法,在分割精度与计算效率上均具备更优的综合性能。
创新点
(1)提出LGSM(Local‑Global Scale Mixer,局部‑全局尺度混合器)并行 CNN‑Transformer 双分支结构,解耦局部纹理特征与长距离全局上下文特征的提取,同时学习多尺度表征,解决单一卷积感受野受限、Transformer 计算开销过大的问题。
(2)设计MS‑ADC(Multi‑scale Attentive Deformable Convolution,多尺度注意力可变形卷积)模块,在跳跃连接路径引入可变形卷积,自适应学习不规则脑肿瘤的形状偏移,增强网络对任意形态肿瘤的形状感知能力。
(3)构建MCA(Multi‑level Contextual Aggregator,多级上下文聚合器),融合编码器多条不同分辨率层级的特征,从多个感受野维度建模全局依赖,充分利用浅层解剖细节与深层语义信息。
(4)引入带权深度监督(Weighted Deep Supervision)策略,在解码器的 4 个不同上采样层级输出辅助分割结果,设置权重系数alpha_0,alpha_1,alpha_2,alpha_3共同参与损失计算,缓解脑肿瘤不同子区域样本不均衡问题,加速深层梯度回传。
框架解析
本文以改进版 3D‑UNet 作为基础骨干网络,面向 BraTS 脑肿瘤分割任务,针对脑肿瘤形状、尺寸、位置高度多变,传统固定卷积核的 CNN 感受野规则、难以适配无固定形态肿瘤的痛点,搭建了编码器‑解码器 U 型结构的 S2CA‑Net 网络。网络输入为脑磁共振 4 模态图像 T2、T1ce、T1、Flair,输入张量维度为(4, H, W, D),代表 4 个通道的 3D 容积数据,随后编码器阶段通过四次下采样逐步降低空间分辨率、提升通道维度,依次得到 (16, H,W,D)、(32, H/2,W/2,D/2)、(64, H/4,W/4,D/4)、(128, H/8,W/8,D/8) 四组多尺度特征图,每一步下采样均采用`3D Conv + 实例归一化IN + PReLU`的基础卷积块完成特征初步提取。

在编码器的特征提取链路中,文章提出的 LGSM 模块被嵌入在第三、四层下采样之后,该模块采用 CNN 分支与 Transformer 分支并行的双通路设计。卷积分支负责捕捉肿瘤边界、纹理、局部解剖细节等短距离依赖特征;Transformer 分支则通过自注意力机制建模整个容积内像素之间的长距离全局关联。两条分支提取得到的特征经过融合操作,实现局部‑全局特征的混合,以此同时学习尺度感知特征,为后续多级上下文建模打下基础。编码器最深层输出的特征送入 MCA 多级上下文聚合器模块,MCA 接收来自编码器不同层级分辨率的跳跃连接特征,将浅层高分辨率细节特征和深层低分辨率语义特征进行聚合,在多感受野空间内建模肿瘤区域与周围正常脑组织之间的全局上下文依赖关系,有效扩大模型的上下文建模范围。
跳跃连接路径是本模型实现形状感知的关键创新位置,原始 3D‑UNet 直接将编码器浅层特征拼接至解码器,浅层特征中包含大量无关背景噪声。而 S2CA‑Net 将四层编码器输出的多尺度特征送入 MS‑ADC 多尺度注意力可变形卷积模块。可变形卷积会在标准卷积采样网格上学习一组偏移量 Delta p_n,卷积采样位置计算公式为:

式中 R 代表卷积采样区域,p_0为当前像素坐标,Delta p_n为学习得到的偏移量。通过自适应偏移采样,卷积核可以不规则地贴合脑肿瘤的任意轮廓,摆脱固定方形采样区域的限制;再搭配通道注意力分支对特征通道施加权重筛选,完成形状感知特征的增强。经过 MS‑ADC 增强后的特征,再经过门控注意力(Gate Attention)模块过滤冗余背景信息之后,送入解码器进行特征融合。
解码器部分采用逐级上采样的结构,每次上采样后与经过门控筛选的跳跃特征拼接融合,并且在解码器的每一个层级都再次嵌入 LGSM 模块,在解码恢复分辨率的过程中继续同步提取局部‑全局特征。网络采用带权深度监督策略,从解码器 4 个不同深度位置引出分割头,分别输出辅助预测图,四个分支分配权重 alpha_0,alpha_1,alpha_2,alpha_3 ,总损失函数定义为:

L_main为最终输出的主分割损失,L_aux,i代表三层辅助分支损失。带权深度监督能够将分割损失直接施加到解码器中层,缓解深度网络梯度消失问题,同时对肿瘤核心、增强肿瘤、水肿等体积差异悬殊的子区域起到样本均衡的效果,最终最顶层输出头得到脑肿瘤三区域分割的最终预测结果。
整体来看 S2CA‑Net 通过 LGSM 实现尺度感知、MS‑ADC 实现形状感知、MCA 完成多阶上下文聚合、加权深度监督优化训练过程,四大组件协同完成形状‑尺度协同表征学习,以此提升模型对形状多变脑肿瘤的分割泛化能力。
LGSM(Local‑Global Scale Mixer,局部‑全局尺度混合器)模块
LGSM 是 S2CA‑Net 网络最核心的基础特征提取单元,模块采用双分支并行解耦架构,将局部细节特征提取与长距离全局上下文建模划分至两条独立通路,以此实现尺度解耦,让网络可以分开学习不同感受野下的特征表征,最终完成局部‑全局特征的融合。模块整体输入来自编码器经过下采样后的 3D 容积特征图,输入特征会同时送入上方的Local Branch(局部分支)和下方的Global Branch(全局分支),两条分支独立运算后,输出特征逐元素相加融合,得到 LGSM 模块最终输出。

上方的局部分支以残差卷积堆叠为主体结构。输入特征经过 M 个连续的 3×3×3 三维卷积单元,每一个卷积后依次执行实例归一化(IN)与 PReLU 激活函数。整条通路属于典型的 CNN 特征提取链路,3×3×3 卷积具备较小、固定的感受野,擅长捕捉肿瘤边缘纹理、局部灰度突变、肿瘤与周围脑组织交界等细粒度的局部空间信息。分支末尾设置残差跳跃连接,将模块最原始的输入直接加到卷积堆叠之后的特征上,既可以缓解深层堆叠卷积带来的梯度退化问题,又能够保留浅层原始细节特征。局部分支全程不执行全局注意力运算,专注于小尺度局部特征学习。
MCA(Multi‑level Context Aggregator,多级上下文聚合器)模块
MCA 是 S²CA‑Net 编码器末端的全局上下文建模单元,专门用来聚合编码器全部四个层级不同分辨率的特征,从多个感受野维度建模全局依赖关系,是网络实现尺度感知的核心组件之一。图 4 上半部分展示 MCA 整体结构,下半部分放大展示其内部核心子模块 VAS‑MLP(Volumetric Axial Shift MLP,体轴向移位 MLP)的详细设计。
MCA 整体结构与多尺度特征对齐

MCA 的输入是编码器四个阶段输出的多分辨率特征(x_1, x_2, x_3, x_4),其中(x_1)分辨率最高、通道数最少,(x_4)分辨率最低、通道数最多,四组特征空间尺寸依次相差 2 倍。为了将不同层级特征融合,MCA 首先对浅层高分辨率特征执行下采样对齐:(x_1)下采样 8 倍、(x_2)下采样 4 倍、(x_3)下采样 2 倍,(x_4)保持原始分辨率不变,使四组特征最终统一到相同的空间尺寸H/8*W/8*D/8。对齐后的四组特征沿着通道维度执行拼接(Channel Concatenation),得到融合了浅层解剖细节与深层语义信息的多尺度特征张量。这种多尺度统一对齐的设计,让网络可以同时感知大体积水肿区域、中等尺寸肿瘤核心、微小增强肿瘤子区域等不同尺度目标,从根源上提升对肿瘤尺寸变化的鲁棒性。
拼接之后的多尺度特征首先送入CA(Channel Attention,通道注意力)模块。通道注意力通过全局平均池化压缩空间维度,经过两层全连接层与 Sigmoid 激活生成通道权重向量,对不同通道特征进行自适应重标定,强化与肿瘤分割相关的判别性通道、抑制无关背景通道。经过通道注意力加权之后,特征被送入后续的双分支并行建模通路。
双分支并行:局部分支与全局分支
MCA 采用双分支并行结构,分别建模局部空间约束与全局长距离依赖。上方分支为局部分支,由 CB(Conv Block,卷积块,即 Conv+IN+PReLU)与 SA(Spatial Attention,空间注意力)串联组成。卷积块负责在局部邻域内提取空间纹理特征,空间注意力则沿着通道维度压缩,生成逐体素的空间权重图,突出肿瘤区域、抑制正常脑组织背景。局部分支输出的空间注意力权重图,本质上是一张肿瘤区域的显著性概率图,用来对全局分支输出做空间约束。
下方分支为全局分支,核心是 VAS‑MLP 体轴向移位 MLP 模块,负责在整个三维容积范围内建模长距离依赖关系。VAS‑MLP 不使用自注意力机制,而是通过轴向移位操作将远距离空间信息引入 MLP 计算,实现线性复杂度的全局建模,避免了 3D 自注意力平方级显存开销。两个分支输出之后,通过矩阵乘法(Matrix Multiplication)完成融合:局部分支生成的空间注意力权重对 VAS‑MLP 的全局特征做逐体素加权,让全局长距离特征被约束在肿瘤显著区域内,防止全局建模引入过多背景噪声。这种 "全局特征 × 局部空间约束" 的融合策略,既保留了长距离上下文,又避免了背景区域的干扰。
VAS‑MLP 内部结构:三轴向分解
图 4 下半部分详细展示 VAS‑MLP 的内部设计。输入特征Z^(l)被并行拆分为三条独立的轴向处理通路,分别对应三维空间的三个正交轴:
第一条通路将维度重排为(B,D,C,H,W),把深度D维度移至批次维度,在 H*W 平面上做二维移位 MLP;
第二条通路重排为(B,H,C,W,D),把高度H移至批次维度,在 W*D 平面上处理。
每一条通路都送入一个独立的EAS‑MLP(Enhanced Axial Shift MLP,增强轴向移位 MLP)单元。EAS‑MLP 是对传统轴向移位 MLP 的改进:传统 AS‑MLP 仅在两个方向上做特征移位,形成十字形感受野;EAS‑MLP 扩展为四个方向的移位操作(上、下、左、右),将感受野从十字形拓展为完整的正方形邻域,从而捕获更加全面的二维平面空间信息。移位操作的数学形式可以表示为:将输入特征沿某一空间方向平移固定步数后与原始特征拼接,再经过 MLP 完成特征融合,这样每个位置的输出都能感知到移位方向上远距离位置的特征,从而在不使用注意力的情况下实现长距离建模。
三条轴向通路分别完成各自平面内的长距离建模之后,输出特征重新恢复原始维度排列,并沿着通道维度拼接,得到维度为\((B,3C,H,W,D)\)的融合特征。三路正交轴向的特征信息相互补充,冠状、矢状、轴状三个平面内的长距离依赖被同时捕获,最终覆盖整个三维容积的全局上下文。拼接之后的特征再次经过 CA 通道注意力模块,对三路轴向特征做通道维度的自适应加权融合,最终输出Z^(l+1),完成 VAS‑MLP 的一次前向计算。
设计动机与模块优势
从整体设计逻辑来看,MCA 解决了三个关键问题。第一,多尺度特征统一对齐与拼接,让网络同时利用编码器全部层级的信息,而不是仅依赖最深层特征,丰富了输入特征的尺度多样性。第二,VAS‑MLP 通过三轴向分解 + EAS‑MLP 四方向移位,以线性复杂度实现了三维容积的全局长距离建模,规避了 3D 自注意力在高维体数据上的显存爆炸问题,同时移位 MLP 相比纯通道 MLP 具备了空间建模能力。第三,局部分支生成的空间注意力权重对全局特征做矩阵乘法约束,实现了 "全局上下文 + 局部空间先验" 的协同,避免纯全局建模被背景区域干扰。
在 S²CA‑Net 整体架构中,MCA 与 LGSM 共同承担尺度感知的职责:LGSM 在每个编码 / 解码阶段内部做局部‑全局尺度解耦,MCA 则在编码器末端跨层级聚合多尺度全局上下文,二者形成 "阶段内 + 阶段间" 的双层尺度感知体系,最终让网络能够稳健应对脑肿瘤在尺寸、位置上的剧烈变化。消融实验也验证了 MCA 的有效性:移除 MCA 之后,肿瘤核心(TC)与全肿瘤(WT)区域的 Dice 指标下降最为明显,说明多尺度全局上下文聚合对大尺寸、位置多变的肿瘤区域贡献突出。
EAS‑MLP(Enhanced Axial‑Shift MLP,增强轴向移位 MLP)
EAS‑MLP 是 MCA 模块中 VAS‑MLP 单元内部的核心计算子模块,属于一种无注意力、纯移位‑MLP的全局建模算子。它在传统轴向移位 MLP 的基础上进行改进,利用四个不同方向的特征移位操作,在二维特征平面上将远距离相邻体素对齐至同一通道位置,再通过 MLP 完成跨距离的特征交互,以线性时间复杂度实现二维平面内的长距离依赖捕获。图 5 左侧展示 EAS‑MLP 整体残差结构,右侧可视化拆解了四方向移位操作与感受野的生成过程。

整体数据流(左侧框图)
模块整体采用经典 Transformer 式的两层残差子结构,包含轴向移位计算支路与 MLP 支路,全程残差连接保障梯度流通。输入的二维特征图首先经过第一层归一化`Norm`,随后送入`Axial Shift`轴向移位运算单元;移位之后的特征与原始输入执行第一次残差相加。相加后的特征再次送入归一化层`Norm`,之后经过 MLP 通道非线性变换,最后执行第二次残差相加得到 EAS‑MLP 模块的输出结果。
整个模块的核心创新集中在`Axial Shift`运算单元,其内部详细逻辑为:输入特征分成两条通路,一条直通作为原始特征;另一条送入由Vertical Shift‑Horizontal Shift‑Horizontal Shift‑Vertical Shift串联组成的移位链,依次执行四次方向不同的空间移位。每一路移位后的特征分别送入独立的`Channel Projection`(通道投影即 1×1 卷积)完成通道维度变换;四路移位特征与直通原始特征的通道投影结果逐元素相加融合,最终得到经过移位交互后的特征张量。
四方向移位与感受野生成(右侧可视化图)
右侧子图直观展示二维特征平面\((C\times H\times W)\)上四个移位方向,W 代表宽度轴,H 代表高度轴;移位参数`(-1, 0, 1)`代表沿着对应坐标轴执行左移、无偏移、右移。模块将移位运算拆分为上下两个并行子路径。
上分支路径(W 轴优先)
第一步:沿着宽度 W 方向执行三组移位偏移量(-1,0,1),也就是向左、原位、向右移动。
第二步:生成两组子移位:子路径 a 继续沿 W 方向移位;子路径 b 切换至高度 H 方向执行上下移位。
两条子移位特征分别经过通道投影得到对应的特征图,两幅特征逐元素相加。
下分支路径(H 轴优先)
第一步:沿着高度 H 方向执行三组移位偏移量(-1,0,1),向上、原位、向下移动。
第二步:拆分为两个子路径:子路径 a 继续沿 H 轴移位;子路径 b 切换至宽度 W 方向,采用反向移位偏移量(1,0,-1),向右、原位、向左移动。
两路移位特征经过通道投影之后相加融合。
最后上下两条大分支输出结果再次相加融合,最终形成右下角所示完整 3×3 正方形感受野。对比原始轴向移位 MLP 只能生成十字形(上下左右四条线)稀疏感受野,EAS‑MLP 通过四个方向互补移位,把感受野补齐为正方形邻域,让中心像素可以和周围 8 邻域全部像素完成特征交互,空间信息利用更加充分。
工作原理与移位交互的本质
轴向移位操作的核心思想:通过空间偏移,把空间上远距离的像素挪到同一个通道维度,之后依靠 1×1 卷积(通道投影)完成跨像素信息交换。
常规 MLP 仅能做通道之间的特征融合,没有跨空间位置交互的能力。移位操作改变特征图体素的空间坐标,将相距较远的体素移动至同一个通道索引位置,通道投影卷积就可以把远距离体素的信息融合进中心像素。不需要计算注意力分数矩阵,因此计算复杂度从自注意力的\(O(N^2)\)降低至O(N)。
在 S2CA‑Net 三维框架下的作用
在 MCA 的 VAS‑MLP 当中,三维容积特征(B,C,H,W,D)会分别在 H‑W 平面、H‑D 平面、W‑D 平面三个正交二维切片上,各自运行一份 EAS‑MLP。三个平面捕获三个解剖切面(轴状面、冠状面、矢状面)的长距离依赖,三路结果再拼接融合,最终完成整个 3D 脑肿瘤容积的全局上下文建模。
EAS‑MLP 补齐了普通轴向 MLP 感受野残缺的缺陷,让全局建模可以充分覆盖肿瘤周围各个方位的脑组织区域,对形状不规则、边界弥散的脑肿瘤水肿区域分割性能带来明显增益。
MS‑ADC(Multi‑scale Attentive Deformable Convolution,多尺度注意力可变形卷积)模块
MS‑ADC 是 S²CA‑Net 解码器端实现形状感知的核心模块,专门用来适配脑肿瘤不规则、非固定形态的空间特征。传统三维卷积采用固定矩形网格采样,对于形状多变的肿瘤容易出现采样点落在背景脑组织的问题;而 MS‑ADC 借助空间注意力引导可变形卷积生成自适应偏移量,动态调整采样网格位置,同时引入多尺度三路输入‑输出分支,在不同分辨率层级同步捕获肿瘤的形状特征。图中橙色虚线包围的整体区域即为完整 MS‑ADC 模块,内部浅绿色虚线框是它的核心子单元 ADC(Attentive Deformable Convolution,注意力可变形卷积)。

MS‑ADC 多尺度输入预处理(模块最左侧)
模块一共有三路来自解码器跳跃连接的多尺度输入特征:(x_0、x_1、x_2),三路特征原始分辨率依次相差一倍。为实现特征空间尺寸对齐:
(x_0)执行两倍下采样(DS×2),降低分辨率;
(x_2)执行两倍上采样(US×2),提升分辨率;
(x_1)保持原有分辨率不变。
三路特征对齐到统一分辨率后,沿通道维度执行拼接(Channel Concatenation,符号 C)。拼接后的多尺度混合特征送入CA 通道注意力模块。通道注意力自适应地重标定不同通道权重,筛选出和肿瘤形状、轮廓高度相关的特征通道,抑制无关背景通道的干扰,预处理完成后的特征送入内部 ADC 单元。
ADC 注意力可变形卷积核心单元
ADC 是对标准 3D 可变形卷积的改进创新。标准可变形卷积只依靠普通卷积学习偏移量,偏移场的学习缺少空间区域引导;ADC 引入SA 空间注意力 (Spatial Attention)作为先验约束,指导偏移场的生成,让采样点优先向肿瘤所在区域偏移。
-
输入特征张量维度为 C*H*W*D。图中浅绿色立方体代表普通卷积固定不变的原始网格采样位置;深绿色立方体代表经过偏移之后、动态调整得到的新采样位置,也就是可变形采样点。
-
输入特征同时分两条通路:一条送入 3D 卷积层生成基础偏移预测图;另一条通路生成空间注意力图 SA,空间注意力图会高亮肿瘤所在区域。基础偏移特征与空间注意力图执行矩阵乘法,用空间注意力权重调制偏移量,完成 "注意力引导"。
-
经过调制后输出最终三维偏移场`offset field`。偏移场维度为 3K^3*H*W*D:K代表 3D 卷积核尺寸,每个采样点在三维空间拥有 X、Y、Z 共 3 个方向上的偏移量,因此通道维度为3K^3。
-
将生成的偏移量施加到原始采样网格上,完成可变形采样操作,从输入特征图中采样得到自适应形状的特征,输出经过形状感知调制后的特征图。同时设置一条直连残差路径,原始输入特征直接加到输出特征上,缓解深层模块梯度消失。
MS‑ADC 多尺度输出分支(模块最右侧)
ADC 输出的特征张量,再映射回三路不同分辨率的输出(y_0、y_1、y_2),对应解码器三个层级:
(y_0)分支:ADC 输出特征两倍上采样(US×2)后与输入(x_0)残差相加;
(y_1)分支:特征分辨率保持不变,直接和输入(x_1)相加;
(y_2)分支:ADC 输出特征两倍下采样(DS×2)后和输入(x_2)残差相加。
三路输出特征分别传回解码器对应的层级,完成多尺度形状特征的传递。
模块设计目的,以及在 S2CA‑Net 中的作用
LGSM+MCA 负责网络尺度感知能力;而 MS‑ADC 专门负责形状感知能力。
脑肿瘤水肿、肿瘤核心区域形态极不规则,固定网格的三维卷积采样框经常覆盖到周围正常脑组织,造成边界分割模糊。MS‑ADC 依靠空间注意力引导偏移场,让卷积采样网格主动贴合肿瘤不规则轮廓,自适应调整采样位置。同时多尺度输入输出结构,使得形状感知特征能够在解码器的高、中、低三个分辨率层级传播,大小不同的肿瘤目标都可以获得自适应的形状建模。
消融实验中移除 MS‑ADC 模块后,肿瘤边界分割精度出现明显下降,尤其不规则的水肿区域分割性能损失最为显著。