RoSIS
Rethinking Text-Promptable Surgical Instrument Segmentation with Robust Framework
arxiv 2024
RoSIS:基于鲁棒框架重新审视文本提示式手术器械分割
过去的方法默认"文本里提到的器械一定存在于图像中";RoSIS 则要求模型先判断文本所描述的器械是否真的存在,存在才分割,不存在就输出空掩码,从而避免被错误提示诱导产生虚假分割
假设一张手术图像中只有:
-
双极电凝钳 Bipolar Forceps
-
ProGrasp 抓钳
传统的文本提示模型在测试时,通常只会收到这两个正确提示。这实际上等于提前告诉模型:"这两种器械肯定存在。"论文把它称为 Oracle Information(先验真值信息)。
但是在真实应用中,系统并不知道当前画面里到底有什么器械。它可能同时收到:
-
"双极电凝钳"------存在
-
"ProGrasp 抓钳"------存在
-
"剪刀"------不存在
-
"施夹器"------不存在
-
"超声刀"------不存在
旧模型面对不存在的器械提示时,仍可能在图中错误地分割出一块区域,也就是产生文本诱导的假阳性。
因此,作者提出新的任务:R-SIS:鲁棒文本提示式手术器械分割
测试时,对每张图像输入所有候选器械的提示,模型需要同时完成:
-
判断提示器械是否存在;
-
如果存在,分割器械;
-
如果不存在,输出空掩码。
RoSIS的整体结构:
RoSIS主要有两条输入:
-
图像输入:由 Swin Transformer 编码;
-
文本输入:由 BERT 编码。
经过图文融合后,模型产生两个结果:
-
器械分割掩码
-
器械存在概率
文本:“图中有剪刀”
↓
图文特征匹配
↓
剪刀是否真的存在?
├─ 存在 → 输出剪刀分割掩码
└─ 不存在 → 抑制分割结果,输出空掩码
MMFB:多模态融合模块
MMFB负责让视觉特征和语言特征进行双向交互。
它不是简单拼接图像与文本,而是利用交叉注意力:
-
让文本去查询图像中与器械有关的区域;
-
再利用视觉信息更新文本表示;
-
最后将语言信息融合回视觉特征。
其中还加入了一个可学习的 language token,用来聚合与当前图像相关的语言信息。
SGB:选择性门控模块
SGB控制文本信息进入视觉分支的强度。
它的作用相当于一个"语言开关":
-
文本与图像一致时,允许文本增强视觉特征;
-
文本不可靠或对应器械不存在时,减弱语言对视觉特征的影响。
这可以防止语言特征过度主导分割结果。
器械存在性预测分支
这是论文实现鲁棒性的关键部分。
模型综合:
-
最深层视觉特征;
-
解码器特征;
-
BERT输出的原始语言特征;
预测当前文本对应器械的存在概率。
推理时,如果存在概率较低,即使分割解码器产生了一些响应,也会将这些虚假区域抑制掉。
作者设计了三类提示:
-
类别名称提示:"The bipolar forceps."也就是只告诉模型器械名称。
-
GPT-4外观描述提示:描述器械的:
-
外形;
-
颜色;
-
夹头结构;
-
视觉特征。
这类提示比单独的类别名称包含更多视觉语义。
-
-
位置提示:告诉模型器械大致位于图像哪个区域。
但推理阶段没有真实掩码,无法直接获得准确位置。因此作者采用迭代细化:
-
先利用名称或外观描述生成初始掩码;
-
根据初始掩码估计器械位置;
-
自动构造位置提示;
-
再进行一次分割,细化结果。
-
实验使用:
-
EndoVis2017
-
EndoVis2018
除了常规IoU,还重点测量:
-
FPR:假阳性率,越低越好;
-
Precision:查准率;
-
Recall:召回率;
-
F1:综合性能。
在EndoVis2018的鲁棒测试中:
| 方法 | FPR↓ | F1↑ |
|---|---|---|
| LAVT | 0.6155 | 0.3364 |
| RefSegformer | 0.2688 | 0.6420 |
| TP-SIS | 0.4008 | 0.4957 |
| RoSIS不含存在性分支 | 0.1804 | 0.6847 |
| 完整RoSIS | 0.0892 | 0.7611 |
摘要
手术器械分割是计算机辅助手术和机器人手术系统的重要组成部分。基于视觉的分割模型通常只能输出预先定义的器械类别,这限制了它们在交互式系统和机器人任务自动化中的应用。
可提示分割方法能够根据文本提示,有选择地预测并分割指定目标。然而,这些方法通常假设当前场景中存在哪些器械是已知的,并据此生成相应的文本提示。这种假设限制了模型对未见过的器械或动态出现器械的泛化能力。在真实的手术环境中,系统通常无法预先获得器械是否存在的信息,因此上述假设并不总是成立,进而可能导致假阳性分割。
为了解决这些局限,本文提出了一项新任务,称为鲁棒文本提示式手术器械分割(Robust Text-Promptable Surgical Instrument Segmentation,R-SIS)。在该任务设定下,模型无法获取器械是否存在的先验信息,而是需要对所有候选器械类别分别输入文本提示。R-SIS要求模型判断哪些文本提示所描述的器械确实出现在图像中,并且只有在确认该器械存在时,才生成相应的分割掩码。
这种任务设定更符合实际应用场景,因为在真实手术过程中,器械是否存在本身就具有不确定性。本文使用手术视频数据集,在R-SIS评估协议下对现有分割方法进行了测试。实验发现,当文本提示对应的真实器械不存在时,现有方法会产生大量假阳性分割。
这些结果表明,现有评估协议与真实应用场景之间存在明显差距,同时说明有必要建立一种能够明确考虑文本提示不确定性 以及目标器械缺失情况的评估基准。
图一
图1:SIS方法评估流程的对比分析:(1)基于视觉的分割模型1,30,31,2仅利用图像数据即可生成所有类别的分割图;(2)先前提出的可提示式分割模型9,10,11借助"先验信息"识别图像中的类别,并仅针对这些类别生成分割图,这意味着其设置缺乏稳健性条件;(3)我们的R-SIS方法则对所有类别均使用提示信息,在稳健条件下为所有类别生成分割图。

-
纯视觉分割方法:
只输入手术图像,不输入文本
手术图像 ↓ 纯视觉分割模型 ↓ 所有类别的分割结果模型没有人提前告诉它图中有什么器械,必须自己根据视觉信息完成:
-
判断器械是否存在;
-
识别器械类别;
-
分割器械区域。
-
-
过去的文本提示分割方法:
需要针对某个器械输入文本,例如:
-
"The bipolar forceps"
-
"The ProGrasp forceps"
问题在于,研究人员只给模型输入了图中确实存在的BF和PF提示。
这相当于在测试前就告诉模型:这张图中只有BF和PF,你只需要分割它们。
论文将这种信息称为 Oracle Information,即"先验真值信息"或"上帝信息"。
其流程是:
先查看真实标注 ↓ 确定图中存在BF和PF ↓ 只输入BF和PF的文本提示 ↓ 模型分割BF和PF问题在于,真实应用中并没有人提前告诉模型图中有哪些器械。只有看过真实标注,才可能准确知道应该输入哪些提示。
因此,这种评估方式绕开了一个重要问题:如果输入了一个图中不存在的器械名称,模型会怎么办?
很多旧方法即使收到不存在器械的提示,也会在图像中强行找出一块区域,产生假阳性分割。
-
-
R-SIS鲁棒文本提示分割
第三行不再提前知道器械是否存在,而是把所有候选类别都作为提示输入:
-
双极电凝钳;
-
ProGrasp抓钳;
-
大号持针器;
-
单极弯剪;
-
吸引器;
-
超声探头;
-
施夹器。
RoSIS需要自己判断:
BF:存在 PF:存在 LND:不存在 MCS:不存在 SI:不存在 UP:不存在 CA:不存在然后:
-
对存在的BF和PF生成分割掩码;
-
对其他不存在的器械输出空掩码。
所以它的流程是:
图像+所有类别提示 ↓ 判断每个器械是否存在 ↓ 只分割真正存在的器械 -
图二
图2:RoSIS模型架构,包括(a)整体结构、(b)多模态融合模块以及(c)选择性门模块

RoSIS整体结构:
-
文本输入
同一种器械可以使用不同形式的文本提示,例如:
-
类别名称:"The bipolar forceps";
-
类别+位置:"The bipolar forceps on the right bottom";
-
外观描述:"Bipolar forceps feature slim handles..." 。
文本经过BERT编码,转换成语言特征。
-
-
图像输入
手术图像输入Swin Transformer,经过多个Stage逐层提取视觉特征:
-
浅层特征:边缘、纹理和器械轮廓;
-
深层特征:器械类别和高级语义。
在每个Swin Transformer阶段之间,作者加入:
-
MMFB:多模态融合模块;
-
SGB:选择性门控模块。
图中"×N"表示这套结构会在多个编码阶段重复使用。
-
-
图文特征融合
每个阶段的处理过程可以概括为:
当前视觉特征 ↓ MMFB:把文本信息融合进视觉特征 ↓ SGB:控制融合信息的强度 ↓ 与原视觉特征进行残差连接 ↓ 送入下一个Swin阶段残差连接保证即使文本不够可靠,原始视觉信息也不会完全丢失。
-
分割解码器
编码后的多尺度特征先经过FPN进行多尺度融合,再进入Deformable Pixel Decoder。
可变形像素解码器会重点关注少量关键采样位置,恢复器械的空间轮廓。最后经过1x1卷积,输出当前类别的二值分割掩码
-
存在性预测分支
除了生成分割掩码,RoSIS还有一条并行分支预测:

它利用MHCA融合:
-
文本特征;
-
深层视觉特征;
-
解码器输出特征。
推理时:
-
(p_c)较高:保留器械掩码;
-
(p_c)较低:认为器械不存在,抑制或清空对应掩码。
因此,即使解码器错误地产生了一小块区域,存在性分支也有机会将其过滤掉。
-
MMFB多模态融合模块:
-
特征投影
视觉特征和语言特征的维度不同,因此先分别经过projection,将二者映射到可以进行注意力计算的共同特征空间。
-
语言特征增强
下方的第一个MHCA使用:
-
BERT语言特征;
-
一个可学习的Language Token。
Language Token可以理解为一个可训练的语言信息汇总向量。它帮助模型从整段提示中提取最重要的信息,例如:
-
器械名称;
-
外观特征;
-
所在位置。
-
-
图像查询文本
上方第二个MHCA以视觉特征作为Query,以增强后的语言特征作为Key和Value。
其含义是:图像中的每个区域,都去查询自己与文本描述的相关程度。
-
输出融合特征
融合结果继续经过:
-
Instance Normalization;
-
Projection。
然后送入SGB,进一步控制语言信息的影响
-
SGB选择性门控模块:
-
与任务相关的信息:门控值较大,得到保留或增强;
-
不相关的信息:门控值接近0,被抑制;
-
部分具有冲突的信息:可能被反向或减弱调节。
图像+某个器械的文本提示
↓
MMFB寻找图文对应区域
↓
SGB过滤无关融合信息
↓
分割解码器生成器械掩码
↓
存在性分支判断该器械是否存在
↓
存在:保留掩码
不存在:输出空掩码