学习日记46:LISA: Reasoning Segmentation via Large Language Model

摘要:

之前的视觉语言模型在执行视觉识别任务前都要求有明确的人类指令或者预先定义的类别来识别目标图像,无法主动理解推理人类意图。本文中,作者提出了一个新的分割任务--推理分割,这项任务要求给定一个复杂且隐式的查询,输出一个对应的分割掩码 。提出了LISA,对原始词汇进行了标记扩展,提出了嵌入掩蔽范式来解锁分割能力;可以处理涉及复杂推理和世界知识的案例。此外,当仅在无推理的数据集上训练时,它表现出稳健的零样本能力。

贡献:

提出了推理分割任务,主要基于人类的隐式指令进行推理。

提出了文本模型--LISA,具有推理分割能力。

建立了一个包含超过一千个图像指令掩码数据样本的推理分割基准- - ReasonSeg。

方法:

Embedding as Mask,这是本文提出的一种范式,为多模态LLM注入新的分割能力。具体流程如上图所示,为词表中加入<SEG>这个token,表示要求输出分割。给定一个文本和图片,将其输入到多模套LLM中,输出一个文本响应,当想要输出分割掩码时,可以让这个文本响应包含<SEG>这个Token。然后取出<SEG>对应的最后一层的高维特征向量,这包含这个词完整语义,也就是要分割物体的语义信息;得到的语义信息经过映射后与SAM编码器得到的图片的语义信息一起输入解码器,得到最终的分割掩码

损失函数包含两个,一个是文本的损失函数,一个是mask的损失。

训练:

训练数据包含两类:一种是普通数据,语义分割、参考分割、VQA,用来第一阶段训练;另一种是推理数据,也就是作者自己做的ReasonSeg,仅 239 张,第二阶段微调用;

把第一类数据全部改为对话格式,

第一阶段训练就是方法阶段介绍的步骤,只用普通分割 + VQA 数据训练完成,没见过任何推理类指令,但模型已经拥有零样本推理分割能力,能处理 "维 C 食物" 这类隐含提问。

之后是推理数据微调,ReasonSeg 一共 1218 条,只取 train 子集 239 条用来微调; 每条样本是:原图 + 推理问句(长短两种)+ 真值掩码;同时依旧混入少量 VQA 数据,保住对话能力;经过少量推理样本微调后,模型在复杂长推理问句上分割 gIoU 提升 10 个点左右,效果远超只做第一阶段训练。

实验:

推理分割任务与其他模型对比

参照分割

消融实验(调节主干)

消融实验(训练数据)

总结:

这篇的结构和UniBiomed很像很像,应该是UniBiomed参考的论文之一,不过UniBiomed额外加入了文本解码器来输出诊断。

此外,seg token是一个非常不同的点,LISA将其作为目标语义的集中体现,而UniBiomed更多的是是否进行分割的开关。UniBiomed对SAM进行prompt的是用户指令和MLLM 生成的所有新 token embeddings,LISA的是seg token对应的经过映射最后一层的高位向量。

相关推荐
vibecoding775 小时前
一文搞懂企业级 API 网关选型:12 个维度、4 类企业、7 步落地
人工智能·大模型·ai编程
Rocktech_ruixun6 小时前
机器人本地跑LLM大模型对主板硬件有什么要求?瑞迅科技RK3588/3568方案选型解析
人工智能·科技·嵌入式硬件·机器人·边缘计算
yxlalm6 小时前
Spring AI+RAG 01-项目背景与技术选型
java·人工智能·spring
tedcloud1236 小时前
Wand-Enhancer 怎么搭建?开源 Wand 客户端增强与远程控制工具介绍
大数据·服务器·人工智能·开源·音视频
传奇开心果编程6 小时前
【xilem0.4基础语法学与练】第13课:Xilem 0.4 最简短代码体现“一切皆设计图“
学习·rust·前端框架
科技苑6 小时前
如何用Python编程实现一个简单的Web爬虫?
人工智能·python
小雪崩6 小时前
嵌入式学习 day45:51单片机基础
学习·51单片机
迅利科技6 小时前
新能源汽车零部件研发,SIMULIA一站式仿真解决方案如何缩短研发周期
人工智能·汽车
Databuff7 小时前
AI SSH工具,集齐SSH、SFTP、知识库RAG、AI助手
网络·人工智能·ssh
Blockchina7 小时前
从一篇文章到一条完整视频:用 Codex 搭建可复用的 AI 视频生产线
人工智能