[CVPR 2026] PromptMoE

CVPR 2026|提示点也要"因图制宜":PromptMoE 用混合专家让 SAM 学会动态选择提示策略

论文题目 :PromptMoE: A Segmentation Refinement Framework Leveraging Mixture of Experts for Improved Prompting

发表出处 :CVPR 2026

作者 :Stephen Price、Danielle L. Cote、Elke A. Rundensteiner

作者机构 :Worcester Polytechnic Institute

关键词:Segmentation Refinement、Segment Anything Model、Mixture of Experts、Prompt Generation、Dynamic Expert Selection


1. 🚀 省流版摘要

PromptMoE 研究的不是如何重新设计一个更强的分割网络,而是一个更具体的问题:

给定图像和一个质量不高的粗分割结果,应该在什么位置、以什么组合,向 SAM 提供提示,才能得到更准确的精细分割?

现有 SAM-based refinement 方法大多采用固定提示规则,例如:

  • 在粗分割中心放置一个正点;
  • 根据距离变换选择正负点;
  • 尽可能让多个点彼此分散;
  • 始终使用相同的 box、mask 和 point 组合。

问题在于,不同图像和不同粗分割结果的错误类型并不相同。固定规则可能在某些样本上有效,却会在另一些样本上放大错误。

为此,PromptMoE 构建了一个由多种图像处理策略组成的"专家池",再通过轻量级路由器:

  1. 判断当前图像应该使用哪些专家;
  2. 预测不同专家组合是否互补;
  3. 只激活最有价值的两个专家;
  4. 根据融合后的 guidance map,生成高置信度且空间分散的正负点;
  5. 将这些点与 coarse mask、bounding box 一起输入 SAM。

在 BIG、VOC、DAVIS585、ECSSD 和 MSRA-B 五个数据集上,PromptMoE 相对于原始粗分割结果,平均提升 6.24 IoU 和 8.99 Boundary IoU,优于 SAMRefiner、DualSight、CascadePSP 和 SegRefiner。


2. 🧐 背景与痛点

2.1 为什么需要 segmentation refinement?

许多分割模型已经可以较快地得到目标的大致区域,但输出结果往往存在:

  • 边界不准确;
  • 细小结构丢失;
  • 内部空洞;
  • 前景区域缺失;
  • 背景泄漏;
  • 相邻目标粘连。

在普通视觉任务中,这些问题可能影响抠图质量;在医学影像中,边界偏差还可能影响病灶体积、手术范围和放疗靶区估计。

因此,一类常见方案是:

先由基础模型生成 coarse mask,再由另一个 refinement framework 对其进行修正。

传统 refinement 方法通常需要针对特定任务、数据集或基础网络重新训练。SAM 的出现则带来了另一种思路:不再训练新的 refinement backbone,而是把粗分割转化为 point、box 和 mask prompt,让 SAM 完成精细化。论文将这种变化概括为:分割细化正在从"网络结构设计问题"转变为"提示生成问题"


2.2 固定提示策略为什么不够?

论文总结了四个核心挑战。

挑战一:Semantic Ambiguity

SAM 更关注提示与输出 mask 之间的匹配关系,而不一定真正理解类别语义。

论文在 Figure 2 中展示:位置非常接近的提示点,可能分别得到整个人、外套、衬衫或领带。也就是说,一个位置合理的正点,并不能保证 SAM 分割出用户真正需要的语义层级

挑战二:Intra-Prompt Interaction

提示不是越多越好。

若多个点集中在同一个局部区域,SAM 可能过度关注该区域,反而压制目标的其他部分。论文 Figure 3 中,多个单独有效的提示组合后,模型只关注汽车前部,导致完整目标结构受到破坏。

挑战三:Noisy Inputs

粗分割本身可能存在空洞、错误前景或缺失区域。

固定的距离变换策略通常默认 coarse mask 大体正确。一旦 coarse mask 中包含错误结构,生成的提示点也会被带偏。论文 Figure 4 中,甜甜圈中心被错误预测为前景,导致基于距离的策略把正点放在错误区域。

挑战四:Diverse Image Characteristics

颜色、纹理、深度、形状和边界等线索的有效性高度依赖具体图像。

例如:

  • 对颜色均匀的物体,颜色相似性可能很有效;
  • 对光照变化明显的图像,亮度可能不可靠;
  • 对细长结构,中心距离可能产生误导;
  • 对遮挡场景,region proposal 或深度信息可能更重要。

因此,不存在一种提示生成规则能够稳定适应所有图像。


3. 💡 核心方法

3.1 整体架构

Figure 5 给出了完整流程。模型输入包括:

  • 原始图像 (x);
  • 任意基础分割模型产生的 coarse mask (M_0)。

图像和 mask 分别经过编码器,形成联合上下文特征 (h)。随后依次经过三个核心模块:

  1. Image-Informed Prompting,IIP:构建多种像素级专家线索;
  2. Dynamic Expert Selector,DES:根据当前图像和 mask 动态选择专家;
  3. Prompt-Placement Explorer,PPE:将融合后的 guidance map 转化为具体提示点。

最终提示包含:

  • 多个 inclusion points;
  • 一个 exclusion point;
  • coarse mask 对应的 bounding box;
  • 软编码后的 coarse mask。

这些提示进入 SAM 的 prompt encoder 和 mask decoder,生成最终 refined mask。

从数据流上看,它不是直接预测最终 mask,而是学习:

当前样本最适合使用什么提示依据,以及这些依据应该如何转化为空间提示。


3.2 Image-Informed Prompting:建立提示专家池

PromptMoE 不再只依赖一个距离变换图,而是构建了一组互补的像素级专家:

re=fe(x,M0),re∈0,1H×W r_e=f_e(x,M_0),\qquad r_e\in0,1^{H\times W} re=fe(x,M0),re∈0,1H×W

其中,每个专家 fef_efe根据图像和 coarse mask 产生一个 score map。分数越高,表示该像素越可能属于目标。

论文正文将这些专家概括为四类:

  • Appearance cues:颜色、亮度和纹理;
  • Geometry cues:到边界的距离等几何信息;
  • Depth consistency:由单目深度模型获得的深度一致性;
  • Region-level structure:基于区域或候选 proposal 的结构信息。

它们同时包含传统图像处理算子和学习型模型,例如颜色线索、距离变换、Marigold 深度估计以及 SAM-based region proposal。

需要注意的是,论文主文没有完整列出十个专家的具体实现,而是将细节放在 Supplementary Section F。因此,仅根据当前上传的主文,不能进一步准确还原全部专家名称和参数。

这一模块的关键不是某一个专家本身多么强,而是:

承认不同图像需要不同线索,并把"选择提示依据"本身变成一个可学习问题。


3.3 Dynamic Expert Selector:不仅选择专家,还判断专家是否互补

最简单的方法是计算全部专家的 score map,再进行平均。但作者认为这样存在两个问题:

  • 所有专家都运行,计算开销较高;
  • 无效甚至错误的专家会稀释有效信号。

因此,DES 采用 sparse MoE 思路,只为每个样本激活少量专家。

3.3.1 单专家效用预测

对于每个专家 eie_iei,模型学习一个专家 embedding veiv_{e_i}vei,并与图像---mask 上下文hhh 进行组合:

ωei=h⊙vei,h,vei \omega_{e_i}=h\\odot v_{e_i},h,v_{e_i} ωei=h⊙vei,h,vei

随后通过一个 MLP 预测专家效用:

Uei=MLPU(ωei) U_{e_i}=\mathrm{MLP}U(\omega{e_i}) Uei=MLPU(ωei)

这里的 UeiU_{e_i}Uei 可以理解为:

在当前图像和 coarse mask 上,使用专家 eie_iei 预计能够带来多大的 refinement 收益。

因此,模型不需要先真正运行全部专家,就可以对它们进行排序。

3.3.2 专家间交互预测

仅选择单个分数最高的专家仍然不够。

两个各自表现较好的专家,组合起来可能:

  • 提供互补线索;
  • 信息高度重复;
  • 甚至相互冲突。

为此,作者增加 Pairwise-Interaction Head,将两个专家 embedding 的:

  • 元素相加;
  • Hadamard product;
  • 绝对差值;
  • 当前上下文 hhh

进行拼接,预测二者的交互收益:

Iei,ej=MLPI(vei+vej,vei⊙vej,∣vei−vej∣,h) I_{e_i,e_j}=\mathrm{MLP}_I (v_{e_i}+v_{e_j}, v_{e_i}\\odot v_{e_j}, \|v_{e_i}-v_{e_j}\|, h) Iei,ej=MLPI(vei+vej,vei⊙vej,∣vei−vej∣,h)

最终专家对的评分为:

Sei,ej=Uei+Uej+Iei,ej S_{e_i,e_j}=U_{e_i}+U_{e_j}+I_{e_i,e_j} Sei,ej=Uei+Uej+Iei,ej

模型选择评分最高的一对专家,再利用其单专家效用经过 softmax 得到融合权重。

这部分是 PromptMoE 最值得关注的设计。

它关注的并不是简单的"哪个提示最好",而是:

哪些提示依据组合起来最有效,以及某种组合是否会产生负面交互。


3.4 DES 如何训练?

DES 采用三阶段训练。

Stage 1:学习单专家效用

作者实际运行每个专家产生提示,并计算 refinement 后的:

qe=12(IoUe+BIoUe) q_e=\frac{1}{2}(\mathrm{IoU}_e+\mathrm{BIoU}_e) qe=21(IoUe+BIoUe)

随后以最佳专家为基准,计算其他专家的 regret,训练 utility head 预测这种效用差距。

Stage 2:学习专家交互

冻结单专家效用头,训练 interaction head 预测:

Δei,ej=qei,ej−max⁡(qei,qej) \Delta_{e_i,e_j} = q_{e_i,e_j} - \max(q_{e_i},q_{e_j}) Δei,ej=qei,ej−max(qei,qej)

也就是:两个专家联合使用,相比其中更好的单专家,究竟能额外提升多少。

Stage 3:联合微调

最后联合微调 utility head 和 interaction head。

此外,作者加入:

  • gating entropy regularization,防止所有样本都选择同一专家;
  • expert embedding orthogonality regularization,促使专家表示保持差异。

这里需要看到一个实际成本:虽然推理时只激活两个专家,但训练 router 时需要离线获得大量单专家和专家组合的真实表现,才能构建监督信号。


3.5 Prompt-Placement Explorer:点要可靠,也要覆盖完整目标

得到融合后的 guidance map 后,最直接的方法是选择 top-kkk 像素作为正点。

但这些高分像素往往集中在同一个区域,导致提示高度冗余。

PPE 首先选择全局最高分位置,然后在每次选点后,抑制其周围区域,再选择下一个点。

与固定半径抑制不同,PPE 根据 coarse mask 中剩余区域的形状,动态计算 suppression radius:

  • 对细长结构,抑制区域沿结构方向扩大;
  • 对紧凑结构,抑制范围相对收缩;
  • 前期鼓励大范围覆盖;
  • 后期保留局部细节提示。

论文将其称为 shape-aware suppression

因此,PPE 实际解决的是两个相互冲突的目标:

Point Confidencevs.Spatial Coverage \text{Point Confidence} \quad \text{vs.} \quad \text{Spatial Coverage} Point Confidencevs.Spatial Coverage

它既不完全采用最高置信度点,也不单纯追求最大距离,而是在二者之间进行平衡。


4. 📊 实验与结果

4.1 数据集与实验设置

DES 只在 VOC 2012 训练集上训练,使用来自 DeepLabV3、FCN-ResNet-50 和 LR-ASPP-MobileNetV3 的 coarse masks。

测试覆盖五个数据集:

数据集 主要任务或特点
VOC 2012 Val 同分布语义分割
BIG 高分辨率与精细边界
DAVIS585 实例分割及预设失败案例
ECSSD 显著目标分割
MSRA-B 多尺度及复杂背景显著目标

评价指标包括:

  • IoU:衡量整体区域重叠;
  • Boundary IoU:重点衡量边界附近的准确性。

所有 refinement 方法使用提前缓存的相同 coarse masks;SAM-based 方法使用相同的 ViT-H backbone,保证输入和基础模型尽可能一致。


4.2 与 SOTA 方法比较

PromptMoE 在五个数据集上的平均提升为:

ΔIoU=+6.24ΔBIoU=+8.99 \Delta\mathrm{IoU}=+6.24\\ \Delta\mathrm{BIoU}=+8.99 ΔIoU=+6.24ΔBIoU=+8.99

主要结果如下:

方法 平均 ΔIoU 平均 ΔBIoU
CascadePSP-Slow +1.39 +1.85
SegRefiner-HR -6.17 -7.43
DualSight +2.55 +4.33
SAMRefiner +5.40 +8.26
PromptMoE +6.24 +8.99

PromptMoE 在五个数据集中的四个取得最佳结果,仅在专门针对高分辨率图像优化的 BIG 数据集上落后于 SegRefiner-HR。即便如此,它在 BIG 上仍将粗分割提升了 8.54 IoU 和 11.01 BIoU

相对于最相关的 SAMRefiner,PromptMoE 平均额外提升:

  • +0.84 IoU
  • +0.73 BIoU

这说明 PromptMoE 的绝对提升并非数量级变化,但在一个已经较强的 SAM-based refiner 上,取得了稳定且具有统计显著性的增益。


4.3 可视化结果

Figure 6 展示了四类代表性案例。PromptMoE 的主要优势体现在:

  • 恢复被遮挡或漏分的目标区域;
  • 去除粗分割中的伪前景;
  • 重新打开错误粘连的间隙;
  • 保留椅背孔洞等内部结构;
  • 改善前景和背景之间的边界。

例如在人与自行车重叠的案例中,PromptMoE 恢复了更多被遮挡的腿部;在动物实例中,它既删除了错误的第二个目标,又恢复了双腿之间的间隙。


4.4 消融实验

消融结果非常值得仔细分析:

Prompt 配置 ΔIoU ΔBIoU
1 Positive Point -18.82 -15.14
+ Bounding Box -0.71 +3.62
+ Coarse Mask +4.71 +7.81
+ Negative Point +5.48 +8.42
5 Positive Points +5.63 +8.50
+ PPE +6.00 +8.83
+ DES +6.24 +8.99

这里可以得到三个重要结论。

第一,bounding box 和 coarse mask 才是基础

只使用一个正点会严重降低结果。加入 bounding box 后性能大幅恢复,加入 coarse mask 后才真正超过原始输入。

这说明 PromptMoE 的效果并不是单纯来自"更聪明的点",而是依赖:

box + mask 提供主体范围,point prompts 在此基础上进一步纠错。

第二,多放几个点的收益有限

从一个正点、一个负点增加到五个正点、一个负点,IoU 仅从 5.48 提升到 5.63。

因此,提示点数量本身并不是关键,点的位置和组合方式更加重要

第三,DES 的纯精度贡献较小

加入 PPE 后,结果已经达到:

  • +6.00 IoU;
  • +8.83 BIoU。

再加入 DES 后提升到:

  • +6.24 IoU;
  • +8.99 BIoU。

也就是说,DES 的直接增益为:

  • +0.24 IoU;
  • +0.16 BIoU。

因此,DES 的核心价值不仅是精度,还包括避免运行全部专家和降低推理成本


4.5 为什么只选择两个专家?

论文比较了不同 expert routing 策略:

路由方式 ΔIoU ΔBIoU
Dense,全部专家 +6.01 +8.80
DES,单专家 +5.90 +8.80
DES,双专家 +6.24 +8.99
DES,三个专家 +5.92 +8.68
DES,四个专家 +5.87 +8.66
最佳单专家 Oracle +7.90 +11.13

结果说明:

  • 专家不是越多越好;
  • 两个专家可以提供适度互补;
  • 加入更多专家后,错误或重复信号开始稀释有效线索;
  • 当前 router 与理论最佳选择之间仍存在明显差距。

尤其是 Best Single-Expert Oracle 达到 +7.90 IoU,而实际 DES Pair 只有 +6.24,说明:

专家池本身具有潜力,但如何准确预测当前样本最适合的专家,仍然是方法的主要瓶颈。


4.6 计算效率与可迁移性

DES 只运行被选中的专家,相比执行全部专家:

  • 推理时间减少约 59.9%
  • 同时精度略有提高。

作者还提出 PromptMoE-Lite,只保留六个效率较高的专家:

  • IoU 提升从 +6.24 略降至 +6.16;
  • 延迟进一步降低 37.9%。

结合 SAM-HQ 后,平均提升可达到:

  • +7.20 IoU;
  • +9.74 BIoU。

这表明 PromptMoE 可以迁移到不同 SAM backbone,但其性能仍会受到底层 promptable model 能力的影响。


5. 🧠 笔者思考与总结

5.1 这篇文章真正的创新是什么?

表面上看,论文由几个相对常见的组件构成:

  • 多种图像处理线索;
  • MoE router;
  • utility prediction;
  • pairwise interaction;
  • 多点采样与空间抑制;
  • SAM refinement。

单独看每个模块,都不是完全陌生的技术。

但论文比较聪明的一点,是把问题重新定义为:

提示生成不是一条固定规则,而是一个依赖图像、粗分割错误类型和提示间交互关系的动态决策过程。

传统方法通常研究:

  • 正点应该放在哪里;
  • 负点应该放在哪里;
  • 应该放几个点。

PromptMoE 进一步提出:

  • 当前样本应该相信哪一种视觉线索?
  • 哪些线索能够互补?
  • 哪些提示组合可能相互干扰?
  • 是否有必要运行所有提示专家?

因此,它的主要贡献更偏向问题建模和系统设计,而不是提出一种全新的基础网络。


5.2 为什么方法增益不大,但论文仍然完整?

相对于 SAMRefiner,PromptMoE 的平均增益不到 1 个 IoU,但论文提供了较完整的证据链:

  • 五个不同任务和数据分布的数据集;
  • 相同 coarse masks 和相同 SAM backbone;
  • IoU 与边界指标;
  • bootstrap 统计显著性;
  • 组件消融;
  • 专家数量消融;
  • 参数敏感性;
  • backbone portability;
  • latency 分析;
  • expert selection frequency 分析;
  • 典型失败案例。

因此,这篇文章的优势不是单个结果特别惊人,而是:

围绕"动态提示策略"这一核心论点,建立了相对完整的实验闭环。

这也是很多 CVPR 论文值得学习的地方:方法创新未必非常激进,但问题定义、实验设计和故事组织足够清晰。


5.3 "Model-agnostic"需要谨慎理解

作者将 PromptMoE 称为 model-agnostic,主要是因为它可以接受任意基础分割模型生成的 coarse mask。

但从完整系统来看,它仍然依赖 SAM 或类似的 promptable segmentation backbone:

  • 专家输出最终需要转化为 SAM prompts;
  • refinement 上限受到 SAM mask decoder 限制;
  • 不同 SAM backbone 会带来不同性能。

因此,更准确的描述可能是:

PromptMoE 对 coarse-mask predictor 相对独立,但并非完全独立于 promptable segmentation model。


5.4 当前最明显的局限

第一,没有医学图像实验

论文在动机中提到医学诊断和病灶边界,但实验全部来自自然图像的语义、实例和显著目标分割。

医学图像中通常存在:

  • 灰度对比度低;
  • 目标语义高度依赖解剖位置;
  • 三维连续性要求;
  • 小目标和细长结构;
  • 多类别邻接关系;
  • 各向异性体素;
  • 极端类别不平衡。

这些问题并不能由自然图像实验充分验证。

第二,专家池仍较依赖人工设计

PromptMoE 的专家由颜色、亮度、纹理、深度、距离和 region proposal 等预定义线索组成。

这种设计具有可解释性,但也意味着:

  • 专家类型需要人工构建;
  • 新领域可能需要重新设计专家;
  • 部分专家在医学灰度图像上可能失效;
  • 深度估计等自然图像先验难以直接迁移到 CT 或 MRI。
第三,训练 router 的离线成本较高

为了得到单专家效用和专家组合收益,训练阶段需要:

  • 分别运行不同专家;
  • 生成提示;
  • 调用 SAM refinement;
  • 与 ground truth 计算 IoU 和 BIoU;
  • 再将结果作为 router 的监督信号。

因此,它把推理阶段的计算节省,部分转移到了训练标签构建阶段。

第四,仍受 SAM decoder 上限约束

论文明确指出,在自行车等细薄、多孔结构上,SAM 的 mask decoder 本身存在困难。即使提示更合理,也只能部分缓解,无法完全解决。


6. 总结

PromptMoE 的核心思想可以概括为一句话:

高质量提示不存在统一规则,应该根据图像内容、粗分割错误和提示间交互,动态选择提示依据与提示位置。

论文的主要贡献包括:

  1. 利用多种图像处理专家生成像素级 guidance maps;
  2. 通过 DES 同时建模单专家效用和双专家交互;
  3. 利用 PPE 平衡提示点置信度和空间覆盖范围;
  4. 在五个自然图像 benchmark 上取得稳定提升;
  5. 通过 sparse expert routing 同时改善精度和效率。

它的技术增益并不巨大,但问题定义清晰、实验闭环完整,对"自动提示生成与选择"研究具有较强启发。

对于医学图像,更值得进一步发展的不是普通视觉专家池,而是:

面向具体解剖目标,联合 atlas 先验、配准可靠性、FM 不确定性和结构约束,学习目标相关的提示决策策略。


本文由 AI 辅助解读,仅供参考,详细内容请以原论文为准。