摘要:
之前的视觉语言模型在执行视觉识别任务前都要求有明确的人类指令或者预先定义的类别来识别目标图像,无法主动理解推理人类意图。本文中,作者提出了一个新的分割任务--推理分割,这项任务要求给定一个复杂且隐式的查询,输出一个对应的分割掩码 。提出了LISA,对原始词汇进行了标记扩展,提出了嵌入掩蔽范式来解锁分割能力;可以处理涉及复杂推理和世界知识的案例。此外,当仅在无推理的数据集上训练时,它表现出稳健的零样本能力。
贡献:
提出了推理分割任务,主要基于人类的隐式指令进行推理。
提出了文本模型--LISA,具有推理分割能力。
建立了一个包含超过一千个图像指令掩码数据样本的推理分割基准- - ReasonSeg。
方法:

Embedding as Mask,这是本文提出的一种范式,为多模态LLM注入新的分割能力。具体流程如上图所示,为词表中加入<SEG>这个token,表示要求输出分割。给定一个文本和图片,将其输入到多模套LLM中,输出一个文本响应,当想要输出分割掩码时,可以让这个文本响应包含<SEG>这个Token。然后取出<SEG>对应的最后一层的高维特征向量,这包含这个词完整语义,也就是要分割物体的语义信息;得到的语义信息经过映射后与SAM编码器得到的图片的语义信息一起输入解码器,得到最终的分割掩码。
损失函数包含两个,一个是文本的损失函数,一个是mask的损失。
训练:
训练数据包含两类:一种是普通数据,语义分割、参考分割、VQA,用来第一阶段训练;另一种是推理数据,也就是作者自己做的ReasonSeg,仅 239 张,第二阶段微调用;
把第一类数据全部改为对话格式,

第一阶段训练就是方法阶段介绍的步骤,只用普通分割 + VQA 数据训练完成,没见过任何推理类指令,但模型已经拥有零样本推理分割能力,能处理 "维 C 食物" 这类隐含提问。
之后是推理数据微调,ReasonSeg 一共 1218 条,只取 train 子集 239 条用来微调; 每条样本是:原图 + 推理问句(长短两种)+ 真值掩码;同时依旧混入少量 VQA 数据,保住对话能力;经过少量推理样本微调后,模型在复杂长推理问句上分割 gIoU 提升 10 个点左右,效果远超只做第一阶段训练。
实验:
推理分割任务与其他模型对比
参照分割
消融实验(调节主干)

消融实验(训练数据)

总结:
这篇的结构和UniBiomed很像很像,应该是UniBiomed参考的论文之一,不过UniBiomed额外加入了文本解码器来输出诊断。
此外,seg token是一个非常不同的点,LISA将其作为目标语义的集中体现,而UniBiomed更多的是是否进行分割的开关。UniBiomed对SAM进行prompt的是用户指令和MLLM 生成的所有新 token embeddings,LISA的是seg token对应的经过映射最后一层的高位向量。