【CVPR 2025】3D VLM 稠密知识 × 少样本精准校准:广义少样本三维点云分割框架 GFS-VL|从三维场景理解视角

摘要

本文解读 CVPR 2025 论文《Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model》(GFS-VL)。该论文提出GFS-VL 广义少样本三维点云分割框架 ,通过融合3D 视觉语言模型(VLM)的稠密伪标签少样本原型校准保留上下文的场景混合 ,让分割模型在只见过每类 1--5 个支持样本后,同时分割基类与新类。其特别之处在于用精准的 few-shot 原型把 VLM 有噪的开放词汇预测转化为可靠监督,并配套两个包含 45 与 18 个新类的挑战性新基准。实验表明ScanNet200 上 5-shot 调和平均(HM)达 43.12,比最强基线 GW 高 28.57 个百分点,跨 2 种骨干、2 种 3D VLM、4 个数据集全面领先,为少样本三维场景理解提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model
标题(中文) 3D VLM 稠密知识 × 少样本精准校准:广义少样本三维点云分割框架 GFS-VL
作者 Zhaochong An, Guolei Sun, Yun Liu, Runjia Li, Junlin Han, Ender Konukoglu, Serge Belongie
机构 University of Copenhagen · ETH Zürich · Nankai University · University of Oxford
会议 CVPR 2025
arXiv https://arxiv.org/abs/2503.16282
项目网站 https://github.com/ZhaochongAn/GFS-VL

背景与动机

广义少样本三维点云分割(GFS-PCS)要求模型先在基类上训练,再仅凭每类 1--5 个新类样本完成注册,推理时同时分割基类与新类,比传统 few-shot 设定(只预测新类、推理还需要支持样本)更贴近真实部署。

现有方法的共同短板是知识来源稀疏:CAPL(CVPR 2022)用支持样本的共现先验精炼基类原型,GW(ICCV 2023)把共享几何结构编码为几何原型来增强语义原型,但它们都只在 few-shot 样本内部做文章,每类 1--5 个样本能提供的信息量天然有限。与此同时,3D VLM(如 OpenScene、RegionPLC)在开放词汇识别上泛化能力强,能为任意类名生成稠密的场景级预测,但预测含噪、会引入错误累积。

评测侧同样存在问题:旧基准 ScanNet 与 S3DIS 的新类都只有 6 个(13/7 个基类),类别多样性严重不足,无法区分"在新类上过拟合"与"真正泛化"。论文实测发现:最强基线 GW 在旧 ScanNet 上 1-shot HM 为 25.39,而换到 45 个新类的 ScanNet200 新基准后暴跌到 14.55------旧基准存在明显的乐观偏差。GFS-VL 的思路因此是双轨的:方法上让 VLM 稠密知识 × 少样本精准校准互补;评测上建立 45/18 新类的两个新基准。

从历史脉络看,原型少样本分割由 Prototypical Networks(2017)奠基,2021 年 attMPTI 与 PIFS 把设定引入点云与二维分割,2023--2024 年 GW 确立三维 GFS-PCS 设定、COSeg 重思 FS-PCS 设定,同时 3D VLM(OpenScene、RegionPLC)快速崛起;GFS-VL(2025)第一次把 VLM 开放词汇知识接入 GFS-PCS,三维分割的知识来源正在从样本内部走向样本外的开放词汇。

研究主线:从问题到结论

图 6:研究主线(Mermaid 流程图)。 新类知识稀疏问题 → 3D VLM 稠密但有噪的动机 → 伪标签 + 少样本协同设计 → PS/AI/NB-Mix 方法 → 4 数据集全场景实验 → HM 43.12 的结论。

基准/方法设计

GFS-VL 采用骨干 + 双线性分类头 的最简分割器结构(默认骨干 Point Transformer V3),基类头 \\mathcal{H}*b 与新类头 \\mathcal{H}_n 的预测拼接后覆盖全部 N_c 个类别。支持样本先用 3D VLM 的视觉编码器做掩码平均池化得到支持原型 \\mathbf{p}_c = \\mathcal{F}* {\\mathrm{pool}}(\\mathbf{X}\^n_c, \\mathbf{Y}\^n_c);训练时 3D VLM 以全部类名作为提示词对场景预测,得到稠密但有噪的原始伪标签,再经过**伪标签选择(PS)→ 自适应填充(AI)**两步精炼为可靠监督,微调分割器。

图 1:与以往工作的对比。 上方------CAPL/GW 仅靠支持/查询特征交互精炼原型,受限于 few-shot 稀疏知识;下方------GFS-VL 利用 3D VLM 的开集知识生成伪标签,并用精准 few-shot 样本校准其噪声,扩大新类知识的同时保证可靠性。

分类全景

图 7:方法分类全景(Mermaid 流程图)。 GFS-PCS 方法谱系:原型交互增强(CAPL/GW)、设定重思(attMPTI/COSeg)、3D VLM 开集知识(OpenScene/RegionPLC)与本文 GFS-VL。

方法细节

框架流程(见框架图):先对新类支持样本执行**新类-基类混合(NB-Mix)**嵌入训练场景并保留上下文,3D VLM 以所有类名 prompting 得到原始预测 \\hat{\\mathbf{Y}},随后用支持原型集 {\\mathbf{p}_c} 完成伪标签选择与自适应填充,产出精炼监督 \\mathbf{Y}'' 训练分割器。

图 2:GFS-VL 总览。 (a)(b) 新类支持样本经 NB-Mix 嵌入训练场景;3D VLM 以全部类名生成原始预测;支持原型 {\\mathbf{p}_c} 驱动伪标签选择过滤噪声,自适应填充标记未标注区域,得到精炼监督 \\mathbf{Y}''。(c)(d) 为 PS 与 AI 细节。

模块 1:伪标签选择(PS)。 对每个新类,计算 VLM 预测区域的预测原型 \\mathbf{u}_c,与支持原型 \\mathbf{p}_c 的余弦相似度 \\mathrm{sim}(\\mathbf{u}_c, \\mathbf{p}_c) \< \\tau 的点被置为背景 -1;基类预测直接丢弃。掩码索引实现、无需逐点迭代,只保留高置信新类区域。阈值消融显示 \\tau = 0.6 最优且鲁棒。

模块 2:自适应填充(AI)。 被过滤的区域可能对应漏检或残缺的新类物体。AI 构建自适应原型集:当前标签中出现的类用标签原型 \\mathbf{v}_c,缺失的类回退到支持原型 \\mathbf{p}_c;未标注点与自适应原型的最大相似度 \\geq \\delta 才赋予对应新类(\\delta = 0.9 最优),兼顾掩码补全与漏检类发现。

模块 3:新类-基类混合(NB-Mix)。 裁剪新类局部区域,在 XY 平面上随机选取一对对角角点(top/bottom/left/right)计算平移向量对齐嵌入场景,再做 Z 轴接地使其贴合地面。与 Mix3D 等丢弃上下文的增强不同,NB-Mix 保留新类与场景的上下文关系,默认每场景嵌入 n = 3 个新类块。

训练细节:PTv3 基类预训练 800 epoch(SCN 为 600--800),注册新类后整体微调仅 20 epoch;4 张 RTX 4090,0.02m 体素化,评测在整场景上进行(旧方法用小 block)。

实验设计与结果

评测协议。 支持样本取 1-shot 与 5-shot 两种设定,各在 5 个随机种子上取平均;指标为基类 mIoU-B、新类 mIoU-N、全类 mIoU-A 与调和平均 HM;基线 attMPTI、PIFS、CAPL、COSeg、GW 全部用相同骨干重训,另设全监督上界。

ScanNet200 新基准主结果(12 基类 + 45 新类):

方法 mIoU-N (5-shot) HM (5-shot) mIoU-N (1-shot) HM (1-shot)
Fully Supervised 39.32 50.02 39.32 50.02
PIFS 3.82 6.71 2.87 4.88
attMPTI 4.99 8.79 3.28 6.17
COSeg 5.21 9.54 4.03 7.42
GW 8.30 14.55 6.47 11.56
GFS-VL 31.67 43.12 29.18 40.92

图 3:定性对比。 GW 对垃圾桶、抱枕、窗帘等新类存在漏分与错分,GFS-VL 分割更完整、边界更准确。

ScanNet++ 新基准(12 基类 + 18 新类,含鼠标、百叶窗、烟雾探测器等小物体):

方法 mIoU-N (5-shot) HM (5-shot) mIoU-N (1-shot) HM (1-shot)
Fully Supervised 37.24 47.47 37.24 47.47
PIFS 5.74 10.03 4.95 8.71
attMPTI 4.19 7.78 3.55 6.66
COSeg 6.96 12.45 6.24 11.26
GW 11.03 18.15 6.63 11.59
GFS-VL 21.66 31.82 19.42 29.47

旧 ScanNet 基准(13 基类 + 6 新类,1-shot): GFS-VL 新类 mIoU 49.72(GW 14.78,+34.94 )、HM 60.88(GW 21.55,+39.33),已逼近全监督上界(新类 mIoU 60.37)。

图 4:伪标签精炼过程。 原始 VLM 预测存在漏检与错标;PS 过滤低质量区域后,AI 发现红圈中漏检的新类并补全绿圈中的部分分割区域。

消融(ScanNet200,5-shot 单种子): 原始 VLM 伪标签 HM 33.28 → +PS 38.35 → +AI 39.39 → +NB-Mix 43.22,三个组件独立可叠加。换用不同 3D VLM:RegionPLC 31.56 → 43.22,OpenScene 23.58 → 31.07,框架与 VLM 解耦;骨干 PTv3(HM 43.22)与 SCN(42.13)一致稳定;混合策略对比中保留上下文的 NB-Mix(39.36)优于实例混合(35.44)与 Mix3D(36.42)。

图 5:混合策略对比。 实例混合随机插入前景对象、Mix3D 整场景叠加均破坏上下文;NB-Mix 按角点对齐嵌入并保留局部上下文(红/绿框为嵌入的新类样本)。

结果对比总结

图 8:结果对比总结(Mermaid 流程图)。 GW 5-shot HM 14.55 → GFS-VL 43.12(+28.57pp),并在 ScanNet++、旧 ScanNet 与双 3D VLM 设定下全面领先。

关键发现

  • ScanNet200 5-shot 全面领先 :HM 43.12 vs GW 14.55(+28.57pp),新类 mIoU 31.67 vs 8.30(+23.37)。
  • ScanNet++ 1-shot 提升 17.88pp:HM 29.47 vs GW 11.59,新类 mIoU 19.42 vs 6.63(+12.79)。
  • 旧 ScanNet 1-shot 新类 mIoU 49.72:比 GW 高 34.94,HM 60.88 比 GW 高 39.33,接近全监督上界。
  • 消融验证三模块缺一不可:HM 33.28 → 43.22,PS/AI/NB-Mix 各自独立贡献 5.07/1.04/3.83。
  • 与 3D VLM 解耦:RegionPLC 提升 11.66pp(HM 31.56→43.22),OpenScene 提升 7.49pp(23.58→31.07)。
  • 新基准暴露旧评测乐观偏差:GW 在 45 新类基准上 HM 仅 14.55,旧 ScanNet 上却有 25.39。
  • 创新模式分析(Oral 信号):本文同时命中"制造监督信号"(消融 HM 33.28→43.22)、"异构分解差异化处理"(1-shot 基类 mIoU-B 68.48 与新类 mIoU-N 29.18 同时保持)与"混淆隔离诊断工具"(新基准量化暴露旧评测偏差)三种模式,方法执行质量与评测基础设施兼备。

局限性

  • 依赖 3D VLM 特征空间:PS/AI 均在 VLM 视觉编码器特征上计算相似度,VLM 能力决定性能天花板。
  • 小/薄/复杂背景物体仍易错:垃圾桶、窗帘、浴室台盆等难例的分割质量欠佳。
  • 场景覆盖有限:新基准仍基于室内扫描数据集(ScanNet 系),缺少室外与动态场景。
  • 权衡依赖 HM 指标:双线性头 + 20 epoch 微调下,基类-新类平衡以调和平均为导向。

常见问题(FAQ)

GFS-VL 解决什么问题?

广义少样本三维点云分割(GFS-PCS):模型在基类上训练后,仅凭每类 1--5 个新类样本注册新类,推理时同时分割基类与新类。GFS-VL 用 3D VLM 的稠密伪标签弥补 few-shot 样本的信息稀疏。

伪标签选择(PS)和自适应填充(AI)有什么区别?

PS 负责"去噪":预测原型与支持原型相似度低于阈值 τ 的 VLM 预测被滤除;AI 负责"补全":对过滤后留下的未标注区域,用自适应原型集按相似度 δ 重新赋新类,发现漏检类并补全残缺掩码。

为什么 NB-Mix 要保留上下文?

Mix3D 等传统混合会把新类物体从场景中剥离,破坏"物体-环境"的共现关系;而难识别的新类恰恰依赖上下文线索。NB-Mix 按角点对齐把新类样本嵌入场景边缘并做 Z 轴接地,在保留上下文的同时增加训练样本,消融中比实例混合高 3.92pp(HM)。

新基准和旧基准有什么不同?

旧基准(ScanNet/S3DIS)只有 6 个新类;新基准基于 ScanNet200(12 基类 + 45 新类)与 ScanNet++(12 基类 + 18 新类),新类更多样,且评测在整场景而非小 block 上进行。

换一个 3D VLM 或骨干还有效吗?

有效。RegionPLC 与 OpenScene 两种 3D VLM 下框架都显著提升(HM 分别 +11.66 与 +7.49pp);PTv3 与 SCN 两种骨干下 HM 分别 43.22 与 42.13,方法不依赖特定模型。

代码开源吗?

开源,见 https://github.com/ZhaochongAn/GFS-VL,包含方法实现与新基准的构建与评测代码。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
白拾2 天前
【CVPR 2025】UNEM:展开广义EM,让少样本推理超参数自动学习|从少样本学习算法设计视角
少样本学习·cvpr 2025·unem 论文分享·转导推理·算法展开
白拾2 天前
【CVPR 2025】2SFS:重新思考视觉语言模型的少样本适配,两阶段方案|从少样本泛化视角
少样本学习·视觉语言模型·参数高效微调·cvpr 2025·2sfs 论文分享
叶舟2 个月前
SCASeg: 条形交叉注意力 for 高效语义分割
语义分割·解码器·sca·clb·scaseg·条形注意力·lpm
科研小刘带你玩学术2 个月前
【学术干货】多机器人协同与视觉-语言模型机器人操作:Science Robotics前沿论文解读
检索增强·多机器人协同·人机协作·意图对齐·视觉-语言模型·机器人空间感知
_Meilinger_2 个月前
碎片笔记|样本少不等于欠拟合:从 Few-shot 任务理解过拟合与欠拟合
机器学习基础·少样本学习·过拟合·欠拟合·模型泛化·高方差·bias-variance
weixin_468466853 个月前
DeepLab 语义分割模型新手部署与实战指南
人工智能·深度学习·机器学习·语义分割·机器视觉·deeplab
君为先-bey3 个月前
GaussianAnything—— 交互式点云潜在扩散的3D生成
深度学习·3d·扩散模型·三维点云
君为先-bey3 个月前
DiffusionGS: 将3D高斯溅射嵌入扩散模型的单阶段图像到三维生成
深度学习·计算机视觉·3d·扩散模型·三维点云
爱听歌的周童鞋3 个月前
YOLO26-Sem推理详解及部署实现
tensorrt·cuda·语义分割·高性能·yolo26-sem