【论文学习】arxiv 2024 || RoSIS:基于鲁棒框架重新审视文本提示式手术器械分割

RoSIS

Rethinking Text-Promptable Surgical Instrument Segmentation with Robust Framework

arxiv 2024

RoSIS:基于鲁棒框架重新审视文本提示式手术器械分割

过去的方法默认"文本里提到的器械一定存在于图像中";RoSIS 则要求模型先判断文本所描述的器械是否真的存在,存在才分割,不存在就输出空掩码,从而避免被错误提示诱导产生虚假分割

假设一张手术图像中只有:

  • 双极电凝钳 Bipolar Forceps

  • ProGrasp 抓钳

传统的文本提示模型在测试时,通常只会收到这两个正确提示。这实际上等于提前告诉模型:"这两种器械肯定存在。"论文把它称为 Oracle Information(先验真值信息)

但是在真实应用中,系统并不知道当前画面里到底有什么器械。它可能同时收到:

  • "双极电凝钳"------存在

  • "ProGrasp 抓钳"------存在

  • "剪刀"------不存在

  • "施夹器"------不存在

  • "超声刀"------不存在

旧模型面对不存在的器械提示时,仍可能在图中错误地分割出一块区域,也就是产生文本诱导的假阳性。

因此,作者提出新的任务:R-SIS:鲁棒文本提示式手术器械分割

测试时,对每张图像输入所有候选器械的提示,模型需要同时完成:

  1. 判断提示器械是否存在;

  2. 如果存在,分割器械;

  3. 如果不存在,输出空掩码。

RoSIS的整体结构:

RoSIS主要有两条输入:

  • 图像输入:由 Swin Transformer 编码;

  • 文本输入:由 BERT 编码。

经过图文融合后,模型产生两个结果:

  • 器械分割掩码

  • 器械存在概率

复制代码
文本:“图中有剪刀”
        ↓
图文特征匹配
        ↓
剪刀是否真的存在?
    ├─ 存在 → 输出剪刀分割掩码
    └─ 不存在 → 抑制分割结果,输出空掩码

MMFB:多模态融合模块

MMFB负责让视觉特征和语言特征进行双向交互。

它不是简单拼接图像与文本,而是利用交叉注意力:

  • 让文本去查询图像中与器械有关的区域;

  • 再利用视觉信息更新文本表示;

  • 最后将语言信息融合回视觉特征。

其中还加入了一个可学习的 language token,用来聚合与当前图像相关的语言信息。

SGB:选择性门控模块

SGB控制文本信息进入视觉分支的强度。

它的作用相当于一个"语言开关":

  • 文本与图像一致时,允许文本增强视觉特征;

  • 文本不可靠或对应器械不存在时,减弱语言对视觉特征的影响。

这可以防止语言特征过度主导分割结果。

器械存在性预测分支

这是论文实现鲁棒性的关键部分。

模型综合:

  • 最深层视觉特征;

  • 解码器特征;

  • BERT输出的原始语言特征;

预测当前文本对应器械的存在概率。

推理时,如果存在概率较低,即使分割解码器产生了一些响应,也会将这些虚假区域抑制掉。

作者设计了三类提示:

  1. 类别名称提示:"The bipolar forceps."也就是只告诉模型器械名称。

  2. GPT-4外观描述提示:描述器械的:

    1. 外形;

    2. 颜色;

    3. 夹头结构;

    4. 视觉特征。

    这类提示比单独的类别名称包含更多视觉语义。

  3. 位置提示:告诉模型器械大致位于图像哪个区域。

    但推理阶段没有真实掩码,无法直接获得准确位置。因此作者采用迭代细化:

    1. 先利用名称或外观描述生成初始掩码;

    2. 根据初始掩码估计器械位置;

    3. 自动构造位置提示;

    4. 再进行一次分割,细化结果。

实验使用:

  • EndoVis2017

  • EndoVis2018

除了常规IoU,还重点测量:

  • FPR:假阳性率,越低越好;

  • Precision:查准率;

  • Recall:召回率;

  • F1:综合性能。

在EndoVis2018的鲁棒测试中:

方法 FPR↓ F1↑
LAVT 0.6155 0.3364
RefSegformer 0.2688 0.6420
TP-SIS 0.4008 0.4957
RoSIS不含存在性分支 0.1804 0.6847
完整RoSIS 0.0892 0.7611

摘要

手术器械分割是计算机辅助手术和机器人手术系统的重要组成部分。基于视觉的分割模型通常只能输出预先定义的器械类别,这限制了它们在交互式系统和机器人任务自动化中的应用。

可提示分割方法能够根据文本提示,有选择地预测并分割指定目标。然而,这些方法通常假设当前场景中存在哪些器械是已知的,并据此生成相应的文本提示。这种假设限制了模型对未见过的器械或动态出现器械的泛化能力。在真实的手术环境中,系统通常无法预先获得器械是否存在的信息,因此上述假设并不总是成立,进而可能导致假阳性分割。

为了解决这些局限,本文提出了一项新任务,称为鲁棒文本提示式手术器械分割(Robust Text-Promptable Surgical Instrument Segmentation,R-SIS)。在该任务设定下,模型无法获取器械是否存在的先验信息,而是需要对所有候选器械类别分别输入文本提示。R-SIS要求模型判断哪些文本提示所描述的器械确实出现在图像中,并且只有在确认该器械存在时,才生成相应的分割掩码。

这种任务设定更符合实际应用场景,因为在真实手术过程中,器械是否存在本身就具有不确定性。本文使用手术视频数据集,在R-SIS评估协议下对现有分割方法进行了测试。实验发现,当文本提示对应的真实器械不存在时,现有方法会产生大量假阳性分割。

这些结果表明,现有评估协议与真实应用场景之间存在明显差距,同时说明有必要建立一种能够明确考虑文本提示不确定性 以及目标器械缺失情况的评估基准。

图一

图1:SIS方法评估流程的对比分析:(1)基于视觉的分割模型1,30,31,2仅利用图像数据即可生成所有类别的分割图;(2)先前提出的可提示式分割模型9,10,11借助"先验信息"识别图像中的类别,并仅针对这些类别生成分割图,这意味着其设置缺乏稳健性条件;(3)我们的R-SIS方法则对所有类别均使用提示信息,在稳健条件下为所有类别生成分割图。

  1. 纯视觉分割方法:

    只输入手术图像,不输入文本

    复制代码
    手术图像
       ↓
    纯视觉分割模型
       ↓
    所有类别的分割结果

    模型没有人提前告诉它图中有什么器械,必须自己根据视觉信息完成:

    1. 判断器械是否存在;

    2. 识别器械类别;

    3. 分割器械区域。

  2. 过去的文本提示分割方法:

    需要针对某个器械输入文本,例如:

    • "The bipolar forceps"

    • "The ProGrasp forceps"

    问题在于,研究人员只给模型输入了图中确实存在的BF和PF提示。

    这相当于在测试前就告诉模型:这张图中只有BF和PF,你只需要分割它们。

    论文将这种信息称为 Oracle Information,即"先验真值信息"或"上帝信息"。

    其流程是:

    复制代码
    先查看真实标注
       ↓
    确定图中存在BF和PF
       ↓
    只输入BF和PF的文本提示
       ↓
    模型分割BF和PF

    问题在于,真实应用中并没有人提前告诉模型图中有哪些器械。只有看过真实标注,才可能准确知道应该输入哪些提示。

    因此,这种评估方式绕开了一个重要问题:如果输入了一个图中不存在的器械名称,模型会怎么办?

    很多旧方法即使收到不存在器械的提示,也会在图像中强行找出一块区域,产生假阳性分割。

  3. R-SIS鲁棒文本提示分割

    第三行不再提前知道器械是否存在,而是把所有候选类别都作为提示输入:

    • 双极电凝钳;

    • ProGrasp抓钳;

    • 大号持针器;

    • 单极弯剪;

    • 吸引器;

    • 超声探头;

    • 施夹器。

    RoSIS需要自己判断:

    复制代码
    BF:存在
    PF:存在
    LND:不存在
    MCS:不存在
    SI:不存在
    UP:不存在
    CA:不存在

    然后:

    • 对存在的BF和PF生成分割掩码;

    • 对其他不存在的器械输出空掩码。

    所以它的流程是:

    复制代码
    图像+所有类别提示
              ↓
    判断每个器械是否存在
              ↓
    只分割真正存在的器械

图二

图2:RoSIS模型架构,包括(a)整体结构、(b)多模态融合模块以及(c)选择性门模块

RoSIS整体结构:

  1. 文本输入

    同一种器械可以使用不同形式的文本提示,例如:

    • 类别名称:"The bipolar forceps";

    • 类别+位置:"The bipolar forceps on the right bottom";

    • 外观描述:"Bipolar forceps feature slim handles..." 。

    文本经过BERT编码,转换成语言特征。

  2. 图像输入

    手术图像输入Swin Transformer,经过多个Stage逐层提取视觉特征:

    • 浅层特征:边缘、纹理和器械轮廓;

    • 深层特征:器械类别和高级语义。

    在每个Swin Transformer阶段之间,作者加入:

    • MMFB:多模态融合模块;

    • SGB:选择性门控模块。

    图中"×N"表示这套结构会在多个编码阶段重复使用。

  3. 图文特征融合

    每个阶段的处理过程可以概括为:

    复制代码
    当前视觉特征
         ↓
    MMFB:把文本信息融合进视觉特征
         ↓
    SGB:控制融合信息的强度
         ↓
    与原视觉特征进行残差连接
         ↓
    送入下一个Swin阶段

    残差连接保证即使文本不够可靠,原始视觉信息也不会完全丢失。

  4. 分割解码器

    编码后的多尺度特征先经过FPN进行多尺度融合,再进入Deformable Pixel Decoder。

    可变形像素解码器会重点关注少量关键采样位置,恢复器械的空间轮廓。最后经过1x1卷积,输出当前类别的二值分割掩码

  5. 存在性预测分支

    除了生成分割掩码,RoSIS还有一条并行分支预测:

    它利用MHCA融合:

    • 文本特征;

    • 深层视觉特征;

    • 解码器输出特征。

    推理时:

    • (p_c)较高:保留器械掩码;

    • (p_c)较低:认为器械不存在,抑制或清空对应掩码。

    因此,即使解码器错误地产生了一小块区域,存在性分支也有机会将其过滤掉。

MMFB多模态融合模块:

  1. 特征投影

    视觉特征和语言特征的维度不同,因此先分别经过projection,将二者映射到可以进行注意力计算的共同特征空间。

  2. 语言特征增强

    下方的第一个MHCA使用:

    • BERT语言特征;

    • 一个可学习的Language Token。

    Language Token可以理解为一个可训练的语言信息汇总向量。它帮助模型从整段提示中提取最重要的信息,例如:

    • 器械名称;

    • 外观特征;

    • 所在位置。

  3. 图像查询文本

    上方第二个MHCA以视觉特征作为Query,以增强后的语言特征作为Key和Value。

    其含义是:图像中的每个区域,都去查询自己与文本描述的相关程度。

  4. 输出融合特征

    融合结果继续经过:

    • Instance Normalization;

    • Projection。

    然后送入SGB,进一步控制语言信息的影响

SGB选择性门控模块:

  1. 与任务相关的信息:门控值较大,得到保留或增强;

  2. 不相关的信息:门控值接近0,被抑制;

  3. 部分具有冲突的信息:可能被反向或减弱调节。

复制代码
图像+某个器械的文本提示
            ↓
MMFB寻找图文对应区域
            ↓
SGB过滤无关融合信息
            ↓
分割解码器生成器械掩码
            ↓
存在性分支判断该器械是否存在
            ↓
存在:保留掩码
不存在:输出空掩码
相关推荐
带娃的IT创业者1 小时前
中国开源大模型策略:正在赢得全球AI竞赛
人工智能·开源·qwen·开源大模型·deepseek·ai竞赛·开源策略
lichenyang4531 小时前
从 Vite 空项目到 AIGC 图片工作台:我如何打通生图、任务轮询、生成库与 Canvas 动态特效
前端·人工智能
黄啊码1 小时前
【黄啊码】省下美工钱,抢到搜索位,这个电商作图工具真香
人工智能
Freak嵌入式2 小时前
MCU 低功耗模式解析:时钟门控、电源门控、深度休眠
人工智能·python·单片机·嵌入式硬件·开源·依赖倒置原则·micropython
Shockang2 小时前
AI Harness 工程学:用 Claude Agent SDK 把缺陷调查封装成专属智能体驭具的 18 节实战
人工智能
zhangfeng11332 小时前
K3 + 自建 Ascend C 算子专用微调模型 方案技术审核报告
人工智能·算子开发
阿里云大数据AI技术2 小时前
莫刻机器人LJM登榜WorldArena第二!阿里云PAI提供全流程训练支撑
人工智能·机器人
栈底拾遗2 小时前
AtomGit:国内唯一开源 + AI 一体化自主基础设施
人工智能·开源
Akir.weiwen2 小时前
AI 总把红色用错地方?你需要一张“颜色使用说明书“
人工智能·设计规范