ARSeg
Towards Robust Medical Image Referring Segmentation with Incomplete Textual Prompts
MICCAI 2025
ARSeg:面向不完整文本提示的鲁棒医学图像指代表达分割
-
它研究的核心问题是:医学图像的文本提示经常不完整,模型不能默认每张图都具有完整、统一的文本属性
-
LViT 一类方法通常输入结构化文本,例如:"双侧肺部感染,两个感染区域,位于左肺下部和右肺下部。"
这类文本可拆成三种属性:
范围/侧别:单侧或双侧感染 数量:一个、两个、多个感染区域 位置:左/右肺,上/中/下肺但真实临床记录中,可能只写:"双侧肺部感染"
而没有病灶数量和位置;或者只知道位置,不知道数量。
如果模型训练时总是看到完整文本,测试时突然缺少某些短语,容易出现:
-
分割性能明显下降;
-
模型过度依赖最常出现的属性;
-
少见或高缺失率属性没有被充分学习。
ARSeg 就是为了让模型在文本属性缺失且不同属性缺失率不均衡时,仍能稳定分割。
-
-
ARSeg 的思路不是把整句话编码成一个统一向量,而是:
把文本拆成多个属性 ↓ 每个属性单独建模、单独和图像交互 ↓ 再让各属性分支与完整文本分支保持一致 ↓ 对学习不足的属性施加更强约束例如:
完整提示: [双侧感染] + [两个区域] + [左下肺、右下肺] 不完整提示: [双侧感染] + [缺失] + [左下肺、右下肺]模型不能因为"数量"缺失,就完全失去对位置和范围的利用能力。
-
整体结构是:
图像 → U-Net 风格 CNN 编码器 文本 → BERT + 1D Conv 文本编码器 ↓ Attribute-specific Cross-modal Interaction(ACI) ↓ CNN 解码器 → 分割 maskACI:属性特异跨模态交互。这是 ARSeg 的主要模块。
对每个文本属性,模型分别建立一个特征分支:
范围属性 → 特征 F1 数量属性 → 特征 F2 位置属性 → 特征 F3 完整文本 → 特征 Ft它使用:
-
图像特征;
-
各属性的 BERT 文本特征;
-
表示属性是否存在的标记向量 (V);
-
每个属性对应的可学习 meta vector;
-
多轮 cross-attention。
这样做的目的是让"位置""数量""范围"各自从图像中寻找对应证据,而不是所有文本信息混在一起。
例如数量属性缺失时,位置属性分支仍可继续引导模型关注左/右肺区域。
-
-
两个训练损失
-
属性一致性损失 (L_C)
对于当前存在的每个属性,让该属性分支的解码特征接近完整文本分支的解码特征:

"位置"分支单独分割出的结果应当与"完整文本"分支的结果保持语义一致。
即使其他属性缺失,已有属性也应足以产生合理分割
-
属性平衡损失 (L_B)
不同属性可能缺失率不同。例如:
范围:很少缺失 数量:中等缺失 位置:经常缺失如果不处理,模型会优先学习"范围"这种经常出现的容易属性,而忽略"位置"。
ARSeg 会根据每个属性分支与完整文本分支之间的差距,自适应提高"当前学得不好"的属性的权重:
差距大 → 说明该属性还没有学好 → 给该属性更大的训练权重因此它防止低缺失率属性主导训练。
总损失为:

-
-
怎样模拟"不完整文本"
论文没有直接使用真实不完整临床报告,而是从已有的完整结构化文本中,按设定概率随机遮掉属性短语。
例如 QaTa-COV19 的缺失率设置:

可以理解为:
属性 1:20% 概率缺失 属性 2:50% 概率缺失 属性 3:80% 概率缺失这样可以模拟"位置记录最不完整、范围记录最完整"等临床情况。
-
数据集与结果
使用两个公开数据集,沿用 LViT 的文本标注与数据划分:
-
QaTa-COV19:9258 张胸部 X-ray;
-
MosMedData+:2729 张 CT 切片。
完整文本条件下,ARSeg 已经优于 LViT
在不均衡缺失提示下,优势更明显
说明 LViT 对文本缺失比较敏感,而 ARSeg 能维持更稳定的表现。
-
-
消融实验结果
ACI 有效:属性分别建模比混合处理更鲁棒;
ACBL 有效:平衡不同属性学习很重要;
两者结合最好。
-
ARSeg 的创新不是更强的开放词汇能力,而是属性级缺失鲁棒性。
摘要
医学视觉-语言模型领域的最新进展日益凸显了整合文本信息对提升医学图像分割性能的巨大潜力。然而,现有的基于语言的分割模型均基于"文本提示中的属性/从句在所有图像中均完全一致"的假设开发,忽视了临床应用中文本/报告不可避免的不完整性 ,从而降低了其可行性。为解决这一问题,我们首次在医学图像参考分割(MIRS)任务中识别此类不完整的文本提示 ,并通过构建属性特异性特征 并优化属性学习过程 ,提出了一种属性鲁棒分割器(ARSeg)。具体而言,该模型基于U型CNN网络和基于BERT的文本编码器,引入了属性特异性跨模态交互模块 以生成属性特异性特征,从而消除解码特征对完整属性的依赖性 ;同时设计了属性一致性损失和属性不平衡损失函数 以实现特征学习的平衡性。在两个公开数据集上的实验结果表明,ARSeg相较于 SOTA 方法具有显著优势,尤其在处理不完整或不平衡的文本提示时表现突出。相关代码可访问GitHub - w7jie/ARSeg · GitHub获取。
图一
图1:文本信息示例。描述同一属性的短语均用相同颜色标出。从上至下依次为:LViT10、 MIU -VL15和 LSMS 13分别采用的文本提示。

医学文本提示通常由若干个"属性短语"组成,而不是一段不可拆分的自然语言
不同颜色表示不同类型的属性;同色短语属于同一个属性类别
-
第一行:LViT 的文本
Bilateral pulmonary infection → 范围属性:双侧肺部感染 two infected areas → 数量属性:两个感染区域 upper left lung and upper right lung → 位置属性:左、右肺上部本质上是三个结构化属性:范围 + 数量 + 位置
-
第二行:MIU-VL 的文本
oval bump → 形状:椭圆形隆起 pink color → 颜色:粉色 in rectum → 位置:直肠这里文本重点描述息肉的形状、颜色与解剖位置
-
第三行:LSMS 的文本
in the VI segment of the liver → 位置:肝脏第 VI 段 diameter of 7.5 mm → 直径 irregular shape → 形状不规则 clear boundary → 边界清晰 no ring enhancement → 无环形强化它的属性更丰富,包含位置、大小、形状、边界和增强特征
-
ARSeg 的核心观察是:
文本提示通常有固定属性集合 但临床中并非每张图都记录全部属性传统语言引导分割方法通常把整句话当成一个整体向量,默认所有属性都存在;ARSeg 则把它们拆开,分别建模"范围、数量、位置"等属性,即使一部分缺失,剩余属性仍能继续指导分割。
图二
图 2:所提出的 ARSeg 的概述

ARSeg 从"图像 + 不完整文本"到最终分割结果的完整流程
它的关键思想是:不要把整句不完整文本直接当成一个整体使用,而是把不同医学属性拆开分别理解,再与完整文本结果互相约束
-
输入
-
图像 (X):一张 CT 图像。
-
文本提示 (L):例如"双侧肺部感染,XXXXXX,XXXXXX"。 其中
XXXXXX表示某些描述缺失,例如"病灶数量"或"具体位置"没有提供。
-
-
图像编码器
CT 图像经过 CNN Image Encoder,提取多尺度视觉特征 (F^k)。 可以理解为:浅层特征保留边缘、纹理,深层特征理解肺部感染的大体区域。
-
文本编码器
不完整的文本送入 BERT,得到两类表示:
-
(T):整句话的文本特征;
-
(V_1,V_2,......,V_m):每个医学属性对应的特征。
-
-
属性专属跨模态交互模块 ACI
图中央绿色框是核心模块。它让图像特征分别与每个属性文本特征交互:
-
图像特征 + "双侧肺部感染" → (F_1)
-
图像特征 + "两个感染区域" → (F_2)
-
图像特征 + "左下肺、右下肺" → (F_3)
-
图像特征 + 整句文本 → (F_t)
即使"数量"或"位置"这类属性缺失,模型仍能利用没有缺失的属性;而不是让缺失信息破坏整句文本的表示
-
-
解码与分割
这些属性对应的多尺度特征送入 CNN Decoder,输出分割预测。右下角黑底白色区域就是最终预测的肺部感染掩膜。
-
两种关键训练约束
-
属性一致性损失 (L_C) 让"各属性分支"的特征与"整句文本分支"的特征保持一致。 含义是:属性分支不能各自随意关注,合起来应该仍然表达同一个病灶。
-
属性平衡损失 (L_B) 当文本不完整时,模型会自动更重视那些"较可靠、未缺失、确实有帮助"的属性,避免某一个属性过度主导。 图最右侧不同颜色方块表示各属性分支的特征被加权后再参与训练。
最终总损失是:

-
表一
表1:在不同属性缺失率条件下,QaTa-COV19数据集上基于Dice值(%)和mIoU值(%)的定量比较

当文本提示里的不同属性以不同概率缺失时,各种模型还能否准确分割肺部感染区域
表二
表2:在不同属性缺失率条件下,基于MosMedData+数据集的Dice值(%)与mIoU值(%)定量比较

表 2 和前面的表 1 做的是同一种鲁棒性实验,只是把数据集从 QaTa-COV19 换成了 MosMedData+,用来验证 ARSeg 的结论不是只在一个数据集上成立。
图三
图3:不同方法在QaTa-COV19(第1-2行)和MosMedData+(第3-4行)数据集上,针对完整文本提示(上图)与不完整文本提示(下图)所得的典型定性结果示例。

表三
表3:ARSeg不同组件组合的消融效果研究。实验分别在QaTa-COV19数据集(R值分别为0.2、0.5、0.8)和MosMedData+数据集(R值分别为0.1、0.4、0.7)上进行,结果以Dice系数(%)和mIoU值(%)表示。

三列组件分别是:
-
Baseline:基础的图像---文本分割网络;
-
ACI:Attribute-specific Cross-modal Interaction,属性专属跨模态交互模块;
-
ACBL:Attribute Consistency and Balancing Loss,属性一致性与平衡损失。
表四
表4:基于MosMedData+验证的V消融研究

不同文本属性可用时,模型表现如何
只在 MosMedData+ 上进行,目的是分析三类医学文本属性各自以及组合起来的价值
三种属性为:
-
Scope:病灶范围/侧别,例如"单侧"或"双侧肺部感染"
-
Regions:病灶区域数量,例如"一个感染区域、两个感染区域"
-
Location:病灶位置,例如"左肺下叶、右肺上段"
这个实验是在回答:当"范围、数量、位置"三类文本信息分别缺失或保留时,哪类信息更有帮助?ARSeg 能否有效利用剩余信息?
结论是:三类属性都重要,联合使用最好;ARSeg 对属性组合的利用更充分,因此整体性能最佳
表五
表5:在QaTa-COV19数据集(R值分别为0.2、0.5、0.8)及MosMedData+数据集(R值分别为0.1、0.4、0.7)上验证的P值消融研究结果

P是 ARSeg 的一个模型超参数:每个文本属性在 ACI 模块中使用的可学习元向量(meta vectors)数量
ARSeg 不会只用一个固定向量来表示"范围""数量""位置"这类属性,而是给每个属性配置 (P) 个可学习的"属性查询/原型",从图像中提取与该属性相关的不同信息
(P=5) 最合适:既能捕获属性相关的多样化图像信息,又不过度复杂