论文解读-VISTA3D: A Unified Segmentation Foundation Model For 3D Medical Imaging

论文代码链接:

GitHub - Project-MONAI/VISTA: MONAI Versatile Imaging Segmentation and Annotation · GitHubMONAI Versatile Imaging Segmentation and Annotation - Project-MONAI/VISTAhttps://github.com/Project-MONAI/VISTA

摘要

Foundation models for interactive segmentation in 2D natural images and videos have sparked significant interest in building 3D foundation models for medical imaging. However, the domain gaps and clinical use‑cases for 3D medical imaging demand dedicated models that depart from existing 2D‑based solutions. Specifically, such foundation models should support a complete workflow that genuinely reduces human labor. Treating 3D medical images as sequences of 2D slices and reusing interactive 2D foundation models may appear straightforward, yet 2D‑based annotation is excessively time‑consuming for 3D tasks. Furthermore, for large‑cohort analysis, highly accurate automatic segmentation models deliver the greatest reduction in manual workload. Nevertheless, these automatic models lack support for interactive correction and possess limited zero‑shot capability for unseen structures, which is an essential characteristic of foundation models. Although transplanting pre‑trained 2D backbones into 3D frameworks can improve zero‑shot potential, their performance on complex 3D anatomical structures still falls behind state‑of‑the‑art pure‑3D models. To tackle these challenges, we present VISTA3D (Versatile Imaging SegmenTation and Annotation model), a unified foundation model designed to address the above requirements within a single framework. Built upon a mature 3D segmentation pipeline, VISTA3D is the first model to achieve state‑of‑the‑art results on both 3D automatic segmentation (covering 127 classes) and 3D interactive segmentation. It outperforms specialized top‑tier 3D expert models across large‑scale diverse benchmarks. In addition, VISTA3D enables efficient manual correction via its native 3D interactive design. A novel 3D supervoxel module, which distills knowledge from 2D pre‑trained backbones, endows VISTA3D with strong 3D zero‑shot performance. We believe the proposed model, training recipe, and empirical insights constitute a promising step toward clinically‑applicable 3D medical foundation models.

翻译

面向二维自然图像与视频的交互式分割基础模型,激发了研究人员构建三维医学影像基础模型的浓厚兴趣。但三维医学影像存在显著域差异与独特临床应用场景 ,需要脱离现有二维方案的专用模型。具体而言,这类基础模型应当能够支撑完整工作流,切实降低人工工作量。将三维医学图像拆解为二维切片序列、复用二维交互式基础模型看似简单,但基于二维的标注对于三维任务耗时严重。此外,针对大队列数据分析,高精度自动分割模型才能够最大程度减少人工负担。然而传统自动分割模型不支持交互式修正,同时对未知结构缺少零样本能力,而这恰恰是基础模型的关键特质。虽然把预训练二维主干迁移到三维框架可以提升零样本能力,但面对复杂三维解剖结构,其性能依旧落后于顶尖原生三维模型。

为解决上述问题,本文提出 VISTA3D(Versatile Imaging SegmenTation and Annotation),一款统一的基础模型,在同一框架下应对全部上述挑战。VISTA3D 基于成熟的三维分割流水线搭建,是首个在三维自动分割(支持 127 类目标)与三维交互式分割两项任务上同时取得 SOTA 性能的模型,在大规模、多样化测试基准上优于顶尖专用三维专家模型。与此同时,VISTA3D 原生三维交互机制支持高效人工修正;本文提出的新型三维超体素模块,蒸馏二维预训练主干的知识,赋予模型优秀的三维零样本分割能力。我们认为该模型、训练方案以及实验见解,向着可落地临床使用的三维医学基础模型迈出了重要一步。

VISTA3D 架构与工作流

图分为 (a)(b) 两个子图,(a) 展示 VISTA3D 完整的人在回路(human‑in‑the‑loop)临床工作流,(b) 为模型内部网络架构。VISTA3D 是基于原生 3D SegResNet 卷积骨干构建的三维医学分割基础模型,区别于 MedSAM 系列由 2D 模型切片模拟 3D、SegVol 基于 3D‑ViT 提示交互的路线,该模型设计两套共享图像编码器的并行分支,一套用于全自动分割,一套用于三维点交互式分割,能够同时处理已知类别自动分割与未知类别零样本交互分割,形成完整的临床标注与修正闭环。

图 (a) 的左侧绿色环路对应模型处理127 个已支持解剖 / 病灶类别的工作流程。输入 CT 三维体数据与类别提示 class X,VISTA3D 直接输出全自动分割结果;医生审阅分割掩码,若存在分割缺陷,可输入三维空间点提示对已有结果做交互式编辑修正,迭代优化直至输出满足临床要求的分割结果。图 1 (a) 右侧蓝色环路面向未见新类别(novel class)零样本场景,目标不在 127 类预定义集合内,此时无法使用自动分支,仅依靠用户提供的三维点提示,触发零样本交互式分割,反复打点迭代得到目标掩码。该套双模式工作流覆盖大队列批量自动处理、已有结果人工修正、全新未知结构零样本标注三类典型临床场景,真正实现 "自动分割 + 交互编辑" 一体化。

图 (b) 为 VISTA3D 网络架构,3D patch 三维体块输入共享的 3D Encoder 骨干提取体特征,骨干输出特征分别送入两条独立解码器分支:上方 auto‑head 自动分割分支下方 point‑head 交互式分割分支,图像编码器权重两条分支完全共享。自动分支接收 class prompt 类别提示,通过可学习类别嵌入表取出对应类别的嵌入向量,经过 MLP 映射后与 3D 图像特征做相乘交互,最后通过 sigmoid 激活输出该类别的自动分割概率图。交互式分支接收三维点坐标提 x_1,y_1,z_1,对点提示做嵌入编码后送入 Transformer 模块完成点提示与体图像特征的交互,再经过 MLP、上采样与 sigmoid,输出交互式分割概率图。当两个分支同时被激活时,Merger 融合模块会使用交互式分支的预测结果对自动分割结果做编辑修正,把用户打点修正的区域融合进自动分割掩码,得到最终输出。

模型训练分为多任务联合训练,同时优化自动分割损失与交互式分割损失。自动分割部分针对 127 类多类别分割,采用 Dice 损失与二元交叉熵损失加权:

式中 P_auto 为 auto‑head 输出自动分割概率图,Y为金标准标签。交互式分支训练时模拟用户随机点击正负三维点提示,监督交互式输出 P_inter 与标签之间的误差:

模型整体联合损失为:

lambda为平衡两个任务损失权重超参数。

论文提出的3D supervoxel 三维超体素蒸馏模块是保障零样本交互性能的关键组件。原生 3D 卷积模型拥有很强三维解剖拟合能力,但零样本泛化偏弱;2D 预训练模型零样本泛化更好,但缺少三维空间感知。该模块借助预训练 2D SAM 模型提取切片层面特征,将 2D 知识蒸馏到 VISTA3D 的 3D 骨干内部,在不改变 3D 卷积网络主体结构前提下,引入二维基础模型的泛化先验,以此提升未见解剖结构的零样本交互分割性能,解决原生 3D 模型零样本能力不足的痛点。

Merger 融合模块承担自动结果与交互编辑结果的融合逻辑,算法核心逻辑为:用户打点交互得到的掩码,优先覆盖对应空间位置的自动分割输出。设自动分支输出掩码为M_A,交互分支输出掩码为M_I,融合后最终掩码M_final:

Omega_prompt代表受点提示影响的空间体素区域;在用户交互作用区域,使用交互式预测覆盖原有自动分割结果,其余位置保留自动分割输出,以此实现对自动分割结果的局部编辑修正。

将 VISTA3D 和前面系列工作横向对比,可以更加清晰定位其优缺点。MedSAM、MedSAM‑2、Medical‑SAM3 全部基于 2D SAM 系列,依靠切片处理 3D Volume,没有原生全自动分割分支,完全依赖提示输入;SegVol 为原生 3D‑ViT 架构,同时支持文本与空间提示,交互能力强,但全自动分割能力弱。VISTA3D 采用原生 3D 卷积 SegResNet 双分支架构,一套模型同时实现大规模多类自动分割与 3D 点交互式编辑,兼顾大队列批量处理与人工修正;依靠 3D supervoxel 蒸馏策略弥补 3D 模型零样本短板。但模型同样存在局限:训练数据以 CT 为主,对 MRI、超声模态泛化有限;不支持文本提示,交互仅支持三维点,缺少包围框、文本输入能力。

相关推荐
罗小罗同学18 天前
Nat. Biomed. Eng最新发表的医学AI基础模型CLEAR,可以将诊断决策与临床概念一一匹配,不再是传统黑箱模型
人工智能·医学图像处理·医工交叉·医学ai
罗小罗同学1 个月前
安德森癌症中心发表SCOPE IO模型,实现了对罕见肿瘤帕博利珠单抗疗效的精准预测,在患者早期即可预判药效
人工智能·算法·医学图像处理·医学ai
罗小罗同学2 个月前
哈佛团队在Nat Med发表医学AI模型,可以在任务推理阶段实时调整推理方式,无需重新训练
人工智能·医学图像处理·医工交叉·医学ai
alfred_torres2 个月前
[CVPR 2026]R2-Seg: Training-Free OOD Medical Tumor Segmentation
医学图像分割
罗小罗同学3 个月前
Nat Med发表SPARK智能体框架,可以自主思考、提出假设、设计实验并验证结果,让AI也能主动发现肿瘤生物学规律
大数据·人工智能·spark·医学图像处理
医学AI望远镜4 个月前
公开数据集整理:心脏CMR分割、心肌瘢痕、肋骨骨折、骨关节炎等
人工智能·数据集·医学图像分割
医学AI望远镜4 个月前
两篇CVPR 2025的方法对比:从损失函数到LoRA微调!
人工智能·计算机视觉·医学图像分割
alfred_torres5 个月前
[AAAI 2026] OFL-SAM2:通过在线少样本学习为SAM2提供提示
医学图像分割
罗小罗同学5 个月前
首个病理AI领域的扩散基础模型CytoSyn开源,可生成高度逼真、符合生物学规律的H&E染色病理切片
人工智能·开源·医学图像处理·医工交叉·医学ai