CVPR 2026|提示点也要"因图制宜":PromptMoE 用混合专家让 SAM 学会动态选择提示策略
论文题目 :PromptMoE: A Segmentation Refinement Framework Leveraging Mixture of Experts for Improved Prompting
发表出处 :CVPR 2026
作者 :Stephen Price、Danielle L. Cote、Elke A. Rundensteiner
作者机构 :Worcester Polytechnic Institute
关键词:Segmentation Refinement、Segment Anything Model、Mixture of Experts、Prompt Generation、Dynamic Expert Selection
1. 🚀 省流版摘要
PromptMoE 研究的不是如何重新设计一个更强的分割网络,而是一个更具体的问题:
给定图像和一个质量不高的粗分割结果,应该在什么位置、以什么组合,向 SAM 提供提示,才能得到更准确的精细分割?
现有 SAM-based refinement 方法大多采用固定提示规则,例如:
- 在粗分割中心放置一个正点;
- 根据距离变换选择正负点;
- 尽可能让多个点彼此分散;
- 始终使用相同的 box、mask 和 point 组合。
问题在于,不同图像和不同粗分割结果的错误类型并不相同。固定规则可能在某些样本上有效,却会在另一些样本上放大错误。
为此,PromptMoE 构建了一个由多种图像处理策略组成的"专家池",再通过轻量级路由器:
- 判断当前图像应该使用哪些专家;
- 预测不同专家组合是否互补;
- 只激活最有价值的两个专家;
- 根据融合后的 guidance map,生成高置信度且空间分散的正负点;
- 将这些点与 coarse mask、bounding box 一起输入 SAM。
在 BIG、VOC、DAVIS585、ECSSD 和 MSRA-B 五个数据集上,PromptMoE 相对于原始粗分割结果,平均提升 6.24 IoU 和 8.99 Boundary IoU,优于 SAMRefiner、DualSight、CascadePSP 和 SegRefiner。
2. 🧐 背景与痛点
2.1 为什么需要 segmentation refinement?
许多分割模型已经可以较快地得到目标的大致区域,但输出结果往往存在:
- 边界不准确;
- 细小结构丢失;
- 内部空洞;
- 前景区域缺失;
- 背景泄漏;
- 相邻目标粘连。
在普通视觉任务中,这些问题可能影响抠图质量;在医学影像中,边界偏差还可能影响病灶体积、手术范围和放疗靶区估计。
因此,一类常见方案是:
先由基础模型生成 coarse mask,再由另一个 refinement framework 对其进行修正。
传统 refinement 方法通常需要针对特定任务、数据集或基础网络重新训练。SAM 的出现则带来了另一种思路:不再训练新的 refinement backbone,而是把粗分割转化为 point、box 和 mask prompt,让 SAM 完成精细化。论文将这种变化概括为:分割细化正在从"网络结构设计问题"转变为"提示生成问题"。
2.2 固定提示策略为什么不够?
论文总结了四个核心挑战。
挑战一:Semantic Ambiguity
SAM 更关注提示与输出 mask 之间的匹配关系,而不一定真正理解类别语义。
论文在 Figure 2 中展示:位置非常接近的提示点,可能分别得到整个人、外套、衬衫或领带。也就是说,一个位置合理的正点,并不能保证 SAM 分割出用户真正需要的语义层级。
挑战二:Intra-Prompt Interaction
提示不是越多越好。
若多个点集中在同一个局部区域,SAM 可能过度关注该区域,反而压制目标的其他部分。论文 Figure 3 中,多个单独有效的提示组合后,模型只关注汽车前部,导致完整目标结构受到破坏。
挑战三:Noisy Inputs
粗分割本身可能存在空洞、错误前景或缺失区域。
固定的距离变换策略通常默认 coarse mask 大体正确。一旦 coarse mask 中包含错误结构,生成的提示点也会被带偏。论文 Figure 4 中,甜甜圈中心被错误预测为前景,导致基于距离的策略把正点放在错误区域。
挑战四:Diverse Image Characteristics
颜色、纹理、深度、形状和边界等线索的有效性高度依赖具体图像。
例如:
- 对颜色均匀的物体,颜色相似性可能很有效;
- 对光照变化明显的图像,亮度可能不可靠;
- 对细长结构,中心距离可能产生误导;
- 对遮挡场景,region proposal 或深度信息可能更重要。
因此,不存在一种提示生成规则能够稳定适应所有图像。
3. 💡 核心方法
3.1 整体架构

Figure 5 给出了完整流程。模型输入包括:
- 原始图像 (x);
- 任意基础分割模型产生的 coarse mask (M_0)。
图像和 mask 分别经过编码器,形成联合上下文特征 (h)。随后依次经过三个核心模块:
- Image-Informed Prompting,IIP:构建多种像素级专家线索;
- Dynamic Expert Selector,DES:根据当前图像和 mask 动态选择专家;
- Prompt-Placement Explorer,PPE:将融合后的 guidance map 转化为具体提示点。
最终提示包含:
- 多个 inclusion points;
- 一个 exclusion point;
- coarse mask 对应的 bounding box;
- 软编码后的 coarse mask。
这些提示进入 SAM 的 prompt encoder 和 mask decoder,生成最终 refined mask。
从数据流上看,它不是直接预测最终 mask,而是学习:
当前样本最适合使用什么提示依据,以及这些依据应该如何转化为空间提示。
3.2 Image-Informed Prompting:建立提示专家池
PromptMoE 不再只依赖一个距离变换图,而是构建了一组互补的像素级专家:
re=fe(x,M0),re∈0,1H×W r_e=f_e(x,M_0),\qquad r_e\in0,1^{H\times W} re=fe(x,M0),re∈0,1H×W
其中,每个专家 fef_efe根据图像和 coarse mask 产生一个 score map。分数越高,表示该像素越可能属于目标。
论文正文将这些专家概括为四类:
- Appearance cues:颜色、亮度和纹理;
- Geometry cues:到边界的距离等几何信息;
- Depth consistency:由单目深度模型获得的深度一致性;
- Region-level structure:基于区域或候选 proposal 的结构信息。
它们同时包含传统图像处理算子和学习型模型,例如颜色线索、距离变换、Marigold 深度估计以及 SAM-based region proposal。
需要注意的是,论文主文没有完整列出十个专家的具体实现,而是将细节放在 Supplementary Section F。因此,仅根据当前上传的主文,不能进一步准确还原全部专家名称和参数。
这一模块的关键不是某一个专家本身多么强,而是:
承认不同图像需要不同线索,并把"选择提示依据"本身变成一个可学习问题。
3.3 Dynamic Expert Selector:不仅选择专家,还判断专家是否互补
最简单的方法是计算全部专家的 score map,再进行平均。但作者认为这样存在两个问题:
- 所有专家都运行,计算开销较高;
- 无效甚至错误的专家会稀释有效信号。
因此,DES 采用 sparse MoE 思路,只为每个样本激活少量专家。
3.3.1 单专家效用预测
对于每个专家 eie_iei,模型学习一个专家 embedding veiv_{e_i}vei,并与图像---mask 上下文hhh 进行组合:
ωei=h⊙vei,h,vei \omega_{e_i}=h\\odot v_{e_i},h,v_{e_i} ωei=h⊙vei,h,vei
随后通过一个 MLP 预测专家效用:
Uei=MLPU(ωei) U_{e_i}=\mathrm{MLP}U(\omega{e_i}) Uei=MLPU(ωei)
这里的 UeiU_{e_i}Uei 可以理解为:
在当前图像和 coarse mask 上,使用专家 eie_iei 预计能够带来多大的 refinement 收益。
因此,模型不需要先真正运行全部专家,就可以对它们进行排序。
3.3.2 专家间交互预测
仅选择单个分数最高的专家仍然不够。
两个各自表现较好的专家,组合起来可能:
- 提供互补线索;
- 信息高度重复;
- 甚至相互冲突。
为此,作者增加 Pairwise-Interaction Head,将两个专家 embedding 的:
- 元素相加;
- Hadamard product;
- 绝对差值;
- 当前上下文 hhh
进行拼接,预测二者的交互收益:
Iei,ej=MLPI(vei+vej,vei⊙vej,∣vei−vej∣,h) I_{e_i,e_j}=\mathrm{MLP}_I (v_{e_i}+v_{e_j}, v_{e_i}\\odot v_{e_j}, \|v_{e_i}-v_{e_j}\|, h) Iei,ej=MLPI(vei+vej,vei⊙vej,∣vei−vej∣,h)
最终专家对的评分为:
Sei,ej=Uei+Uej+Iei,ej S_{e_i,e_j}=U_{e_i}+U_{e_j}+I_{e_i,e_j} Sei,ej=Uei+Uej+Iei,ej
模型选择评分最高的一对专家,再利用其单专家效用经过 softmax 得到融合权重。
这部分是 PromptMoE 最值得关注的设计。
它关注的并不是简单的"哪个提示最好",而是:
哪些提示依据组合起来最有效,以及某种组合是否会产生负面交互。
3.4 DES 如何训练?
DES 采用三阶段训练。
Stage 1:学习单专家效用
作者实际运行每个专家产生提示,并计算 refinement 后的:
qe=12(IoUe+BIoUe) q_e=\frac{1}{2}(\mathrm{IoU}_e+\mathrm{BIoU}_e) qe=21(IoUe+BIoUe)
随后以最佳专家为基准,计算其他专家的 regret,训练 utility head 预测这种效用差距。
Stage 2:学习专家交互
冻结单专家效用头,训练 interaction head 预测:
Δei,ej=qei,ej−max(qei,qej) \Delta_{e_i,e_j} = q_{e_i,e_j} - \max(q_{e_i},q_{e_j}) Δei,ej=qei,ej−max(qei,qej)
也就是:两个专家联合使用,相比其中更好的单专家,究竟能额外提升多少。
Stage 3:联合微调
最后联合微调 utility head 和 interaction head。
此外,作者加入:
- gating entropy regularization,防止所有样本都选择同一专家;
- expert embedding orthogonality regularization,促使专家表示保持差异。
这里需要看到一个实际成本:虽然推理时只激活两个专家,但训练 router 时需要离线获得大量单专家和专家组合的真实表现,才能构建监督信号。
3.5 Prompt-Placement Explorer:点要可靠,也要覆盖完整目标
得到融合后的 guidance map 后,最直接的方法是选择 top-kkk 像素作为正点。
但这些高分像素往往集中在同一个区域,导致提示高度冗余。
PPE 首先选择全局最高分位置,然后在每次选点后,抑制其周围区域,再选择下一个点。
与固定半径抑制不同,PPE 根据 coarse mask 中剩余区域的形状,动态计算 suppression radius:
- 对细长结构,抑制区域沿结构方向扩大;
- 对紧凑结构,抑制范围相对收缩;
- 前期鼓励大范围覆盖;
- 后期保留局部细节提示。
论文将其称为 shape-aware suppression。
因此,PPE 实际解决的是两个相互冲突的目标:
Point Confidencevs.Spatial Coverage \text{Point Confidence} \quad \text{vs.} \quad \text{Spatial Coverage} Point Confidencevs.Spatial Coverage
它既不完全采用最高置信度点,也不单纯追求最大距离,而是在二者之间进行平衡。
4. 📊 实验与结果
4.1 数据集与实验设置
DES 只在 VOC 2012 训练集上训练,使用来自 DeepLabV3、FCN-ResNet-50 和 LR-ASPP-MobileNetV3 的 coarse masks。
测试覆盖五个数据集:
| 数据集 | 主要任务或特点 |
|---|---|
| VOC 2012 Val | 同分布语义分割 |
| BIG | 高分辨率与精细边界 |
| DAVIS585 | 实例分割及预设失败案例 |
| ECSSD | 显著目标分割 |
| MSRA-B | 多尺度及复杂背景显著目标 |
评价指标包括:
- IoU:衡量整体区域重叠;
- Boundary IoU:重点衡量边界附近的准确性。
所有 refinement 方法使用提前缓存的相同 coarse masks;SAM-based 方法使用相同的 ViT-H backbone,保证输入和基础模型尽可能一致。
4.2 与 SOTA 方法比较
PromptMoE 在五个数据集上的平均提升为:
ΔIoU=+6.24ΔBIoU=+8.99 \Delta\mathrm{IoU}=+6.24\\ \Delta\mathrm{BIoU}=+8.99 ΔIoU=+6.24ΔBIoU=+8.99
主要结果如下:
| 方法 | 平均 ΔIoU | 平均 ΔBIoU |
|---|---|---|
| CascadePSP-Slow | +1.39 | +1.85 |
| SegRefiner-HR | -6.17 | -7.43 |
| DualSight | +2.55 | +4.33 |
| SAMRefiner | +5.40 | +8.26 |
| PromptMoE | +6.24 | +8.99 |
PromptMoE 在五个数据集中的四个取得最佳结果,仅在专门针对高分辨率图像优化的 BIG 数据集上落后于 SegRefiner-HR。即便如此,它在 BIG 上仍将粗分割提升了 8.54 IoU 和 11.01 BIoU。
相对于最相关的 SAMRefiner,PromptMoE 平均额外提升:
- +0.84 IoU
- +0.73 BIoU
这说明 PromptMoE 的绝对提升并非数量级变化,但在一个已经较强的 SAM-based refiner 上,取得了稳定且具有统计显著性的增益。
4.3 可视化结果

Figure 6 展示了四类代表性案例。PromptMoE 的主要优势体现在:
- 恢复被遮挡或漏分的目标区域;
- 去除粗分割中的伪前景;
- 重新打开错误粘连的间隙;
- 保留椅背孔洞等内部结构;
- 改善前景和背景之间的边界。
例如在人与自行车重叠的案例中,PromptMoE 恢复了更多被遮挡的腿部;在动物实例中,它既删除了错误的第二个目标,又恢复了双腿之间的间隙。
4.4 消融实验
消融结果非常值得仔细分析:
| Prompt 配置 | ΔIoU | ΔBIoU |
|---|---|---|
| 1 Positive Point | -18.82 | -15.14 |
| + Bounding Box | -0.71 | +3.62 |
| + Coarse Mask | +4.71 | +7.81 |
| + Negative Point | +5.48 | +8.42 |
| 5 Positive Points | +5.63 | +8.50 |
| + PPE | +6.00 | +8.83 |
| + DES | +6.24 | +8.99 |
这里可以得到三个重要结论。
第一,bounding box 和 coarse mask 才是基础
只使用一个正点会严重降低结果。加入 bounding box 后性能大幅恢复,加入 coarse mask 后才真正超过原始输入。
这说明 PromptMoE 的效果并不是单纯来自"更聪明的点",而是依赖:
box + mask 提供主体范围,point prompts 在此基础上进一步纠错。
第二,多放几个点的收益有限
从一个正点、一个负点增加到五个正点、一个负点,IoU 仅从 5.48 提升到 5.63。
因此,提示点数量本身并不是关键,点的位置和组合方式更加重要。
第三,DES 的纯精度贡献较小
加入 PPE 后,结果已经达到:
- +6.00 IoU;
- +8.83 BIoU。
再加入 DES 后提升到:
- +6.24 IoU;
- +8.99 BIoU。
也就是说,DES 的直接增益为:
- +0.24 IoU;
- +0.16 BIoU。
因此,DES 的核心价值不仅是精度,还包括避免运行全部专家和降低推理成本。
4.5 为什么只选择两个专家?
论文比较了不同 expert routing 策略:
| 路由方式 | ΔIoU | ΔBIoU |
|---|---|---|
| Dense,全部专家 | +6.01 | +8.80 |
| DES,单专家 | +5.90 | +8.80 |
| DES,双专家 | +6.24 | +8.99 |
| DES,三个专家 | +5.92 | +8.68 |
| DES,四个专家 | +5.87 | +8.66 |
| 最佳单专家 Oracle | +7.90 | +11.13 |
结果说明:
- 专家不是越多越好;
- 两个专家可以提供适度互补;
- 加入更多专家后,错误或重复信号开始稀释有效线索;
- 当前 router 与理论最佳选择之间仍存在明显差距。
尤其是 Best Single-Expert Oracle 达到 +7.90 IoU,而实际 DES Pair 只有 +6.24,说明:
专家池本身具有潜力,但如何准确预测当前样本最适合的专家,仍然是方法的主要瓶颈。
4.6 计算效率与可迁移性
DES 只运行被选中的专家,相比执行全部专家:
- 推理时间减少约 59.9%;
- 同时精度略有提高。
作者还提出 PromptMoE-Lite,只保留六个效率较高的专家:
- IoU 提升从 +6.24 略降至 +6.16;
- 延迟进一步降低 37.9%。
结合 SAM-HQ 后,平均提升可达到:
- +7.20 IoU;
- +9.74 BIoU。
这表明 PromptMoE 可以迁移到不同 SAM backbone,但其性能仍会受到底层 promptable model 能力的影响。
5. 🧠 笔者思考与总结
5.1 这篇文章真正的创新是什么?
表面上看,论文由几个相对常见的组件构成:
- 多种图像处理线索;
- MoE router;
- utility prediction;
- pairwise interaction;
- 多点采样与空间抑制;
- SAM refinement。
单独看每个模块,都不是完全陌生的技术。
但论文比较聪明的一点,是把问题重新定义为:
提示生成不是一条固定规则,而是一个依赖图像、粗分割错误类型和提示间交互关系的动态决策过程。
传统方法通常研究:
- 正点应该放在哪里;
- 负点应该放在哪里;
- 应该放几个点。
PromptMoE 进一步提出:
- 当前样本应该相信哪一种视觉线索?
- 哪些线索能够互补?
- 哪些提示组合可能相互干扰?
- 是否有必要运行所有提示专家?
因此,它的主要贡献更偏向问题建模和系统设计,而不是提出一种全新的基础网络。
5.2 为什么方法增益不大,但论文仍然完整?
相对于 SAMRefiner,PromptMoE 的平均增益不到 1 个 IoU,但论文提供了较完整的证据链:
- 五个不同任务和数据分布的数据集;
- 相同 coarse masks 和相同 SAM backbone;
- IoU 与边界指标;
- bootstrap 统计显著性;
- 组件消融;
- 专家数量消融;
- 参数敏感性;
- backbone portability;
- latency 分析;
- expert selection frequency 分析;
- 典型失败案例。
因此,这篇文章的优势不是单个结果特别惊人,而是:
围绕"动态提示策略"这一核心论点,建立了相对完整的实验闭环。
这也是很多 CVPR 论文值得学习的地方:方法创新未必非常激进,但问题定义、实验设计和故事组织足够清晰。
5.3 "Model-agnostic"需要谨慎理解
作者将 PromptMoE 称为 model-agnostic,主要是因为它可以接受任意基础分割模型生成的 coarse mask。
但从完整系统来看,它仍然依赖 SAM 或类似的 promptable segmentation backbone:
- 专家输出最终需要转化为 SAM prompts;
- refinement 上限受到 SAM mask decoder 限制;
- 不同 SAM backbone 会带来不同性能。
因此,更准确的描述可能是:
PromptMoE 对 coarse-mask predictor 相对独立,但并非完全独立于 promptable segmentation model。
5.4 当前最明显的局限
第一,没有医学图像实验
论文在动机中提到医学诊断和病灶边界,但实验全部来自自然图像的语义、实例和显著目标分割。
医学图像中通常存在:
- 灰度对比度低;
- 目标语义高度依赖解剖位置;
- 三维连续性要求;
- 小目标和细长结构;
- 多类别邻接关系;
- 各向异性体素;
- 极端类别不平衡。
这些问题并不能由自然图像实验充分验证。
第二,专家池仍较依赖人工设计
PromptMoE 的专家由颜色、亮度、纹理、深度、距离和 region proposal 等预定义线索组成。
这种设计具有可解释性,但也意味着:
- 专家类型需要人工构建;
- 新领域可能需要重新设计专家;
- 部分专家在医学灰度图像上可能失效;
- 深度估计等自然图像先验难以直接迁移到 CT 或 MRI。
第三,训练 router 的离线成本较高
为了得到单专家效用和专家组合收益,训练阶段需要:
- 分别运行不同专家;
- 生成提示;
- 调用 SAM refinement;
- 与 ground truth 计算 IoU 和 BIoU;
- 再将结果作为 router 的监督信号。
因此,它把推理阶段的计算节省,部分转移到了训练标签构建阶段。
第四,仍受 SAM decoder 上限约束
论文明确指出,在自行车等细薄、多孔结构上,SAM 的 mask decoder 本身存在困难。即使提示更合理,也只能部分缓解,无法完全解决。
6. 总结
PromptMoE 的核心思想可以概括为一句话:
高质量提示不存在统一规则,应该根据图像内容、粗分割错误和提示间交互,动态选择提示依据与提示位置。
论文的主要贡献包括:
- 利用多种图像处理专家生成像素级 guidance maps;
- 通过 DES 同时建模单专家效用和双专家交互;
- 利用 PPE 平衡提示点置信度和空间覆盖范围;
- 在五个自然图像 benchmark 上取得稳定提升;
- 通过 sparse expert routing 同时改善精度和效率。
它的技术增益并不巨大,但问题定义清晰、实验闭环完整,对"自动提示生成与选择"研究具有较强启发。
对于医学图像,更值得进一步发展的不是普通视觉专家池,而是:
面向具体解剖目标,联合 atlas 先验、配准可靠性、FM 不确定性和结构约束,学习目标相关的提示决策策略。
本文由 AI 辅助解读,仅供参考,详细内容请以原论文为准。