【技术追踪】CAA-Seg:面向多序列 CMR 心肌病灶分割的复合对齐感知框架(MICCAI-2025)

  多序列 CMR 分割!


论文:A Composite Alignment-Aware Framework for Myocardial Lesion Segmentation in Multi-sequence CMR Images

代码:https://github.com/yifangao112/CAA-Seg


0、摘要

  从多序列心脏磁共振图像中精准分割心肌病灶,对心脏病诊断与治疗方案制定至关重要(临床意义)。然而,受不同模态间灰度差异切片采集协议不一致 引发的空间错位等因素影响,很难实现最优的特征匹配。(当前挑战)

  本文提出了 CAA‑Seg,一种复合对齐感知框架,采用两阶段策略解决上述难题。

  (1)通过选择性切片对齐(Selective Slice Alignment, SSA) 动态寻找可靠的跨序列切片对应关系,避免对不匹配切片进行强制配准;

  (2)通过层次化对齐网络(Hierarchical Alignment Network, HA-Net) 在不同语义层级上进行特征融合:低层使用局部形变校正,高层使用全局语义交叉注意力。

  本文在包含397名患者的大规模数据集上开展方法验证。实验结果表明,所提 CAA‑Seg 在绝大多数评价指标上均取得更优性能,尤其在心肌梗死分割任务上提升效果显著,较现有前沿方法性能提升 5.54 %。


1、引言

1.1、研究意义与当前挑战

  (1)心肌梗死和心肌水肿的准确量化对于疾病诊断、疗效评估和治疗规划具有重要价值;(研究意义)

  (2)人工勾画不仅耗时,而且容易受到观察者经验和主观判断的影响,自动分割方法因心肌梗死区域范围微小且影像学表现隐匿而面临重大挑战;(分割挑战)

  (3)多序列 CMR 的优势在于不同序列具有互补信息:LGE 对病灶区域通常具有更明显的对比度,T1 和 T2 mapping 则能够提供组织参数层面的病理提示。将这些序列联合输入网络,理论上可以提高分割的完整性和鲁棒性。

  但多序列融合并不是简单的通道拼接,主要存在以下两个问题(图 1):

  (a)采样数量不同: LGE 通常采集 6--8 张切片,而 T1/T2 mapping 可能只有 2--3 张切片。把少量切片重采样到 LGE 的切片数,会在大间隔之间引入虚假的结构连续性。

  (b)解剖位置不一致: 即使切片数量相同,不同序列的切片也可能处于不同的心脏层面。强行一一对应会将不相关的组织区域送入融合模块。

  因此,核心问题可以概括为:如何只利用可靠的跨序列对应关系,同时在特征层面补偿剩余的局部形变和强度差异?

  

Figure 1 | :

(a) 多序列 CMR 图像的空间错位问题可视化。

(b.1) 重采样畸变: 对 T1/T2 mapping 图像进行高强度重采样(由 3 层切片重采样至 8 层切片)会引入插值伪影与结构畸变。

(b.2) 解剖位置不匹配: LGE 序列与 T1/T2 mapping 序列的切片在不同解剖位置采集,进而造成图像错位。

  上述难点促使本文提出选择性切片对齐策略:仅保留可靠的切片对应关系,不对不兼容切片进行强制匹配。所提切片级对齐方法能够显著降低重采样造成的配准误差;此外,该方法仅采用复制后的 LGE 切片,以此规避解剖位置不匹配问题。

1.2、本文贡献

  (1)本文提出一种面向多序列 CMR 分割的全新框架,通过复合对齐机制有效融合异质性心脏成像序列;

  (2)提出选择性切片对齐方法,通过动态切片匹配与互信息优化,建立序列间可靠的对应关系;

  (3)构建分层对齐网络,融合局部形变校正与全局语义融合模块,实现多序列特征的有效融合;


2、方法

  本文提出一种用于**多序列 CMR 图像心肌病灶分割的两阶段框架。**第一阶段采用选择性切片对齐方法,通过动态切片匹配建立 LGE 序列与 mapping 序列之间的解剖对应关系;完成对齐后的序列输入分层对齐网络 ( H A - N e t ) \mathrm{(HA\text{-}Net)} (HA-Net),该网络在执行多尺度特征融合的同时修正残余空间与灰度差异,最终实现高精度病灶分割。

  

Figure 2 | 本文所提 H A - N e t \mathrm{HA\text{-}Net} HA-Net 网络整体结构:该框架包含用于多序列 CMR 图像处理的双编码器 ,并在不同特征层级设置专用对齐模块局部形变校正模块 用于解决低层特征的空间错位问题,级联交叉注意力模块 实现高层特征的语义融合;bottleneck 处的任务感知控制器可根据不同输入图像自适应调节特征权重。

2.1、选择性切片对齐

  多序列心脏磁共振 CMR 采集得到的各序列切片数量与位置互不相同,难以直接对 LGE 序列与 mapping 序列进行配准。强制对齐全部切片会引入伪影与错误信息,为此本文提出 SSA 方法,仅动态筛选并对齐可信度最高的切片对。

  给定一组二维切片,令 I f k ∈ R H × W I_{f}^{k} \in \mathbb{R}^{H \times W} Ifk∈RH×W 表示第 k k k 张固定 LGE 切片, I m j ∈ R H × W I_{m}^{j} \in \mathbb{R}^{H \times W} Imj∈RH×W 代表来自 T1 mapping 或 T2 mapping 序列的第 j j j 张浮动切片。将逐切片配准构造为如下优化问题:

ϕ k ∗ = arg ⁡ min ⁡ ϕ k L M M I ( I f k , I m j ∘ ϕ k ) ⏟ 多序列相似度 + λ R ( ϕ k ) ⏟ 正则项 , k ∈ 1 , K (1) \phi_{k}^{*}=\arg \min {\phi{k}} \underbrace{\mathcal{L}{M M I}\left(I{f}^{k}, I_{m}^{j} \circ \phi_{k}\right)}{\text{多序列相似度}}+\lambda \underbrace{\mathcal{R}\left(\phi{k}\right)}_{\text{正则项}},\quad k \in1,K \tag{1} ϕk∗=argϕkmin多序列相似度 LMMI(Ifk,Imj∘ϕk)+λ正则项 R(ϕk),k∈1,K(1)式中, K K K 为切片总数量。为实现鲁棒的多模态对齐,采用 Mattes 互信息( M M I \mathrm{MMI} MMI)作为相似度度量:

L M M I ( I f k , I m j ∘ ϕ k ) = − ∑ x , y p k ( x , y ) log ⁡ ( p k ( x , y ) p f k ( x ) p m j ( y ) ) (2) \mathcal{L}{M M I}\left(I{f}^{k}, I_{m}^{j} \circ \phi_{k}\right)=-\sum_{x, y} p_{k}(x, y) \log \left(\frac{p_{k}(x, y)}{p_{f}^{k}(x) p_{m}^{j}(y)}\right) \tag{2} LMMI(Ifk,Imj∘ϕk)=−x,y∑pk(x,y)log(pfk(x)pmj(y)pk(x,y))(2)式中 p k ( x , y ) p_{k}(x,y) pk(x,y) 代表联合灰度分布。本文变换模型通过层级复合方式同时实现全局与局部形变,表达式如下:

ϕ k = ϕ k , r i g i d ∘ ϕ k , a f f i n e ∘ ϕ k , d i f f (3) \phi_{k}=\phi_{k,\mathrm{rigid}} \circ \phi_{k,\mathrm{affine}} \circ \phi_{k,\mathrm{diff}} \tag{3} ϕk=ϕk,rigid∘ϕk,affine∘ϕk,diff(3)  本文方法的核心创新在于选择性切片匹配策略 。该策略不采用固定搜索窗口,而是通过自适应搜索为每一切片寻找最合理的解剖对应关系。首先,计算全部候选切片对的相似度得分:

S ( k , j ) = M M I ( I L G E k , ϕ k ( I T 1 m j ) ) + M M I ( I L G E k , ϕ k ( I T 2 m j ) ) (4) S(k, j)=M M I\left(I_{L G E}^{k}, \phi_{k}\left(I_{T 1 m}^{j}\right)\right)+M M I\left(I_{L G E}^{k}, \phi_{k}\left(I_{T 2 m}^{j}\right)\right) \tag{4} S(k,j)=MMI(ILGEk,ϕk(IT1mj))+MMI(ILGEk,ϕk(IT2mj))(4)  对于第 k k k 层 LGE 切片,本文在动态划定的搜索范围内,确定最佳匹配的浮动切片 j k ∗ j_k^* jk∗。该搜索范围受前一次匹配切片位置 j k − 1 j_{k-1} jk−1 约束,用以保持切片的先后顺序,并预留充足的后续切片供后续匹配使用:

j k ∗ = arg ⁡ min ⁡ j ∈ j k − 1 , N − M + k S ( k , j ) (5) j_k^* = \underset{j\in j_{k-1},N-M+k}{\arg\min} S(k,j) \tag{5} jk∗=j∈jk−1,N−M+kargminS(k,j)(5)式中, j k − 1 j_{k-1} jk−1 为上一层切片的匹配位置, N N N 代表浮动图像的切片总数量, M M M 表示从当前位置 k k k 至 LGE 序列末尾的剩余切片数。该约束可保证:

{ j k ∗ > j k − 1 维持序列顺序 j k ∗ ≤ N − M + k 预留足够切片 (6) \begin{cases} j_k^* > j_{k-1} & \text{维持序列顺序} \\ j_k^* \le N-M+k & \text{预留足够切片} \end{cases} \tag{6} {jk∗>jk−1jk∗≤N−M+k维持序列顺序预留足够切片(6)该选择机制可自适应处理层间运动,同时保证每个二维切片内的解剖结构一致性。最终配准体仅由匹配可靠且经过空间变换的切片对重建得到:

V r e g = { I m j k ∗ ∘ ϕ k ∗ } k = 1 K (7) V_{reg} = \left\{ I_m^{j_k^*} \circ \phi_k^* \right\}_{k=1}^{K} \tag{7} Vreg={Imjk∗∘ϕk∗}k=1K(7)该策略能够让本框架优先完成高质量配准,同时避免因强制匹配不兼容切片而造成的误差传递。

2.2、分层对齐网络

  尽管序列切片对齐(SSA)能够实现可靠的跨序列配准,但特征层面仍会残留微小的局部形变与灰度变化。低层特征主要编码局部组织纹理信息,几何错位会对其结构细节造成影响;而高层特征用于提取语义模式,该层面的灰度差异相对更小。 为此,本文进一步提出分层对齐网络(HA‑Net),在不同语义层级逐步优化并融合多序列特征。该网络采用残差 UNet 主干结构,并在各个尺度配置专用的融合模块。

  设 F m l ∈ R H l × W l × C l F_{m}^{l} \in \mathbb{R}^{H_{l} \times W_{l} \times C_{l}} Fml∈RHl×Wl×Cl 表示模态 m ∈ { L G E , T 1 m , T 2 m } m \in \{LGE,T1m,T2m\} m∈{LGE,T1m,T2m}、层级 l ∈ { s t e m , l o w , h i g h , b n } l \in \{stem,low,high,bn\} l∈{stem,low,high,bn} 下编码器输出的特征,其中 H l H_{l} Hl、 W l W_{l} Wl、 C l C_{l} Cl 分别代表特征图的空间高、宽与通道数。网络通过主干层提取初始特征,该阶段不执行跨模态融合,以此保留各模态独有的特征属性。

局部形变校正

  在浅层网络中,本文通过可变形卷积逐像素调制 实现特征对齐。针对每一组模态对,偏移场 Δ p \Delta p Δp 与对齐后特征 F a l i g n e d F_{aligned} Faligned 的计算方式如下:

Δ p = f o f f s e t ( F L G E l o w ) (8) \Delta p = f_{offset}(F_{LGE}^{low}) \tag{8} Δp=foffset(FLGElow)(8) F a l i g n e d = D e f o r m C o n v ( F T 1 m / T 2 m l o w , Δ p ) F_{aligned} = \mathrm{DeformConv}(F_{T1m/T2m}^{low}, \Delta p) Faligned=DeformConv(FT1m/T2mlow,Δp)随后通过可学习参数对特征执行调制操作:

γ , β = f m o d ( G l o b a l P o o l ( F L G E l o w , F a l i g n e d ) ) (9) \\gamma, \\beta = f_{mod}\big(\mathrm{GlobalPool}\big(F_{LGE}\^{low}, F_{aligned}\big)\big) \tag{9} γ,β=fmod(GlobalPool(FLGElow,Faligned))(9) F o u t l o w = γ ⋅ F L G E l o w + β F_{out}^{low} = \gamma \cdot F_{LGE}^{low} + \beta Foutlow=γ⋅FLGElow+β式中, f m o d f_{mod} fmod 将全局上下文信息映射为调制参数 γ \gamma γ 与 β \beta β,用于逐像素特征调整。

全局语义融合

  高层特征通过级联交叉注意力 完成语义对齐,该过程包含两个依次执行的注意力模块:

F 1 h i g h = A t t n ( Q = F L G E h i g h , K , V = F T 1 m h i g h ) (10) F_1^{high} = \mathrm{Attn}(Q = F_{LGE}^{high}, K, V = F_{T1m}^{high}) \tag{10} F1high=Attn(Q=FLGEhigh,K,V=FT1mhigh)(10) F o u t h i g h = A t t n ( Q = F 1 h i g h , K , V = F T 2 m h i g h ) F_{out}^{high} = \mathrm{Attn}(Q = F_1^{high}, K, V = F_{T2m}^{high}) Fouthigh=Attn(Q=F1high,K,V=FT2mhigh)其中注意力运算采用带有多头投影的标准缩放点积机制。

任务感知控制器

  文引入任务感知控制器,可根据不同输入自适应完成特征处理。在 bottleneck 层,通过可学习提示向量 P t a s k P_{task} Ptask 融入任务信息:

F o u t b n = M L P ( L a y e r N o r m ( F L G E b n ; P t a s k ) ) (11) F_{out}^{bn} = \mathrm{MLP}\big(\mathrm{LayerNorm}\big(F_{LGE}\^{bn}; P_{task}\big)\big) \tag{11} Foutbn=MLP(LayerNorm(FLGEbn;Ptask))(11)式中 ⋅ ; ⋅ \\cdot ; \\cdot ⋅;⋅ 代表通道维度拼接操作。该控制器能够依据不同模态的输入特征,自适应调整特征处理方式。


3、实验与结果

3.1、数据集与实验设置

  (1)本文在一个经过伦理审批的大规模院内数据集上进行实验,共包含 397 名患者。其中 278 例用于训练,39 例用于验证,80 例用于测试;所有病例均包含心肌(Myo)和心肌水肿(ME)标注,另有 208 例包含心肌梗死(MI)标注。

  (2)网络采用七个编码阶段,通道数为 { 32 , 64 , 128 , 256 , 512 , 512 , 512 } \{32,64,128,256,512,512,512\} {32,64,128,256,512,512,512}。输入图像经过裁剪或填充后统一为 384 × 384 384\times384 384×384。可变形卷积使用 3 × 3 3\times3 3×3 卷积核和 18 个采样点;交叉注意力使用 8 个头,隐藏维度为 256;任务控制器生成 128 维任务嵌入。

  (3)训练 200 个 epoch,初始学习率为 0.01,使用余弦衰减调度器,batch size 为 16,并采用 Dice loss 与交叉熵损失的组合。实验在 NVIDIA RTX 4090 GPU 上完成。

3.2、对比方法与评价指标

  (1)评价指标包括 Dice 系数和 95% Hausdorff 距离(HD95)。Dice 越高越好,HD95 越低越好。

  (2)对比方法包括 nnU-Net、UNet++、TransUNet、Swin UNETR、UTNet、UMamba,以及 MFU-Net、AWSNet 和 MyoPS-Net 等心脏专用方法。

3.3、实验结果

  

**Table 1 | 不同方法在心肌病变分割数据集上的定量评估结果:**最佳及次佳结果分别以粗体和下划线标出。Myo:心肌;ME:心肌水肿;MI:心肌梗死。

  

**Figure 3 | 不同方法所得心肌病变分割结果的可视化对比:**心肌部分以红色标示,心肌水肿以绿色标示,心肌梗死以蓝色标示。

  

**Table 2 | CAA-Seg 的消融研究:**分析不同配准方法、网络架构及输入序列对分割性能的影响。


  图 3 感觉少一个原图呢,看不太清晰(●'◡'●)

相关推荐
阿_旭1 个月前
【分割实战】三种图像分割方法实战对比:Mask R-CNN + GrabCut + OpenCV【附源码】
opencv·图像分割
思陌Ai算法定制2 个月前
【心血管影像AI预测预后】心肌梗死后心脏MRI如何更早识别高风险患者?
人工智能·影像组学·心血管影像·心脏mri·心肌梗死·stemi·微循环阻塞
Ricky05532 个月前
基于作物特性的语义分割技术用于高效农业病害评估(西班牙德国2025年联合研究)
人工智能·目标检测·图像分割
weixin_468466853 个月前
图像处理之亚像素边缘检测新手教程
图像处理·人工智能·自动化·图像分割·机器视觉·亚像素·光学系统
feasibility.3 个月前
Qwen3-VL-Seg 深度解读:当多模态大模型学会“像素级精准手术“
人工智能·深度学习·计算机视觉·llm·图像分割·多模态·vlm
还是叫明3 个月前
OpenCV静态图像分割(抠图)
opencv·计算机视觉·图像分割·抠图
极智视界3 个月前
无人机场景 - 图像分割数据集 - 无人机视角场景图像分割数据集下载
数据集·图像分割·无人机视角·算法训练·低空经济·yolo格式·无人机场景
极智视界3 个月前
分割数据集 - 自动驾驶场景分割数据集下载
自动驾驶·数据集·图像分割·分割算法·算法训练·yolo格式
这张生成的图像能检测吗4 个月前
(论文速读)HAFNet:用于红外小目标检测的分层注意力融合网络
人工智能·神经网络·目标检测·计算机视觉·图像分割