摘要
本文解读 CVPR 2025 论文《Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model》(GFS-VL)。该论文提出GFS-VL 广义少样本三维点云分割框架 ,通过融合3D 视觉语言模型(VLM)的稠密伪标签 、少样本原型校准 与保留上下文的场景混合 ,让分割模型在只见过每类 1--5 个支持样本后,同时分割基类与新类。其特别之处在于用精准的 few-shot 原型把 VLM 有噪的开放词汇预测转化为可靠监督,并配套两个包含 45 与 18 个新类的挑战性新基准。实验表明ScanNet200 上 5-shot 调和平均(HM)达 43.12,比最强基线 GW 高 28.57 个百分点,跨 2 种骨干、2 种 3D VLM、4 个数据集全面领先,为少样本三维场景理解提供了重要借鉴。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [GFS-VL 解决什么问题?](#GFS-VL 解决什么问题?)
- 伪标签选择(PS)和自适应填充(AI)有什么区别?
- [为什么 NB-Mix 要保留上下文?](#为什么 NB-Mix 要保留上下文?)
- 新基准和旧基准有什么不同?
- [换一个 3D VLM 或骨干还有效吗?](#换一个 3D VLM 或骨干还有效吗?)
- 代码开源吗?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model |
| 标题(中文) | 3D VLM 稠密知识 × 少样本精准校准:广义少样本三维点云分割框架 GFS-VL |
| 作者 | Zhaochong An, Guolei Sun, Yun Liu, Runjia Li, Junlin Han, Ender Konukoglu, Serge Belongie |
| 机构 | University of Copenhagen · ETH Zürich · Nankai University · University of Oxford |
| 会议 | CVPR 2025 |
| arXiv | https://arxiv.org/abs/2503.16282 |
| 项目网站 | https://github.com/ZhaochongAn/GFS-VL |
背景与动机
广义少样本三维点云分割(GFS-PCS)要求模型先在基类上训练,再仅凭每类 1--5 个新类样本完成注册,推理时同时分割基类与新类,比传统 few-shot 设定(只预测新类、推理还需要支持样本)更贴近真实部署。
现有方法的共同短板是知识来源稀疏:CAPL(CVPR 2022)用支持样本的共现先验精炼基类原型,GW(ICCV 2023)把共享几何结构编码为几何原型来增强语义原型,但它们都只在 few-shot 样本内部做文章,每类 1--5 个样本能提供的信息量天然有限。与此同时,3D VLM(如 OpenScene、RegionPLC)在开放词汇识别上泛化能力强,能为任意类名生成稠密的场景级预测,但预测含噪、会引入错误累积。
评测侧同样存在问题:旧基准 ScanNet 与 S3DIS 的新类都只有 6 个(13/7 个基类),类别多样性严重不足,无法区分"在新类上过拟合"与"真正泛化"。论文实测发现:最强基线 GW 在旧 ScanNet 上 1-shot HM 为 25.39,而换到 45 个新类的 ScanNet200 新基准后暴跌到 14.55------旧基准存在明显的乐观偏差。GFS-VL 的思路因此是双轨的:方法上让 VLM 稠密知识 × 少样本精准校准互补;评测上建立 45/18 新类的两个新基准。
从历史脉络看,原型少样本分割由 Prototypical Networks(2017)奠基,2021 年 attMPTI 与 PIFS 把设定引入点云与二维分割,2023--2024 年 GW 确立三维 GFS-PCS 设定、COSeg 重思 FS-PCS 设定,同时 3D VLM(OpenScene、RegionPLC)快速崛起;GFS-VL(2025)第一次把 VLM 开放词汇知识接入 GFS-PCS,三维分割的知识来源正在从样本内部走向样本外的开放词汇。
研究主线:从问题到结论

图 6:研究主线(Mermaid 流程图)。 新类知识稀疏问题 → 3D VLM 稠密但有噪的动机 → 伪标签 + 少样本协同设计 → PS/AI/NB-Mix 方法 → 4 数据集全场景实验 → HM 43.12 的结论。
基准/方法设计
GFS-VL 采用骨干 + 双线性分类头 的最简分割器结构(默认骨干 Point Transformer V3),基类头 \\mathcal{H}*b 与新类头 \\mathcal{H}_n 的预测拼接后覆盖全部 N_c 个类别。支持样本先用 3D VLM 的视觉编码器做掩码平均池化得到支持原型 \\mathbf{p}_c = \\mathcal{F}* {\\mathrm{pool}}(\\mathbf{X}\^n_c, \\mathbf{Y}\^n_c);训练时 3D VLM 以全部类名作为提示词对场景预测,得到稠密但有噪的原始伪标签,再经过**伪标签选择(PS)→ 自适应填充(AI)**两步精炼为可靠监督,微调分割器。

图 1:与以往工作的对比。 上方------CAPL/GW 仅靠支持/查询特征交互精炼原型,受限于 few-shot 稀疏知识;下方------GFS-VL 利用 3D VLM 的开集知识生成伪标签,并用精准 few-shot 样本校准其噪声,扩大新类知识的同时保证可靠性。
分类全景

图 7:方法分类全景(Mermaid 流程图)。 GFS-PCS 方法谱系:原型交互增强(CAPL/GW)、设定重思(attMPTI/COSeg)、3D VLM 开集知识(OpenScene/RegionPLC)与本文 GFS-VL。
方法细节
框架流程(见框架图):先对新类支持样本执行**新类-基类混合(NB-Mix)**嵌入训练场景并保留上下文,3D VLM 以所有类名 prompting 得到原始预测 \\hat{\\mathbf{Y}},随后用支持原型集 {\\mathbf{p}_c} 完成伪标签选择与自适应填充,产出精炼监督 \\mathbf{Y}'' 训练分割器。

图 2:GFS-VL 总览。 (a)(b) 新类支持样本经 NB-Mix 嵌入训练场景;3D VLM 以全部类名生成原始预测;支持原型 {\\mathbf{p}_c} 驱动伪标签选择过滤噪声,自适应填充标记未标注区域,得到精炼监督 \\mathbf{Y}''。(c)(d) 为 PS 与 AI 细节。
模块 1:伪标签选择(PS)。 对每个新类,计算 VLM 预测区域的预测原型 \\mathbf{u}_c,与支持原型 \\mathbf{p}_c 的余弦相似度 \\mathrm{sim}(\\mathbf{u}_c, \\mathbf{p}_c) \< \\tau 的点被置为背景 -1;基类预测直接丢弃。掩码索引实现、无需逐点迭代,只保留高置信新类区域。阈值消融显示 \\tau = 0.6 最优且鲁棒。
模块 2:自适应填充(AI)。 被过滤的区域可能对应漏检或残缺的新类物体。AI 构建自适应原型集:当前标签中出现的类用标签原型 \\mathbf{v}_c,缺失的类回退到支持原型 \\mathbf{p}_c;未标注点与自适应原型的最大相似度 \\geq \\delta 才赋予对应新类(\\delta = 0.9 最优),兼顾掩码补全与漏检类发现。
模块 3:新类-基类混合(NB-Mix)。 裁剪新类局部区域,在 XY 平面上随机选取一对对角角点(top/bottom/left/right)计算平移向量对齐嵌入场景,再做 Z 轴接地使其贴合地面。与 Mix3D 等丢弃上下文的增强不同,NB-Mix 保留新类与场景的上下文关系,默认每场景嵌入 n = 3 个新类块。
训练细节:PTv3 基类预训练 800 epoch(SCN 为 600--800),注册新类后整体微调仅 20 epoch;4 张 RTX 4090,0.02m 体素化,评测在整场景上进行(旧方法用小 block)。
实验设计与结果
评测协议。 支持样本取 1-shot 与 5-shot 两种设定,各在 5 个随机种子上取平均;指标为基类 mIoU-B、新类 mIoU-N、全类 mIoU-A 与调和平均 HM;基线 attMPTI、PIFS、CAPL、COSeg、GW 全部用相同骨干重训,另设全监督上界。
ScanNet200 新基准主结果(12 基类 + 45 新类):
| 方法 | mIoU-N (5-shot) | HM (5-shot) | mIoU-N (1-shot) | HM (1-shot) |
|---|---|---|---|---|
| Fully Supervised | 39.32 | 50.02 | 39.32 | 50.02 |
| PIFS | 3.82 | 6.71 | 2.87 | 4.88 |
| attMPTI | 4.99 | 8.79 | 3.28 | 6.17 |
| COSeg | 5.21 | 9.54 | 4.03 | 7.42 |
| GW | 8.30 | 14.55 | 6.47 | 11.56 |
| GFS-VL | 31.67 | 43.12 | 29.18 | 40.92 |

图 3:定性对比。 GW 对垃圾桶、抱枕、窗帘等新类存在漏分与错分,GFS-VL 分割更完整、边界更准确。
ScanNet++ 新基准(12 基类 + 18 新类,含鼠标、百叶窗、烟雾探测器等小物体):
| 方法 | mIoU-N (5-shot) | HM (5-shot) | mIoU-N (1-shot) | HM (1-shot) |
|---|---|---|---|---|
| Fully Supervised | 37.24 | 47.47 | 37.24 | 47.47 |
| PIFS | 5.74 | 10.03 | 4.95 | 8.71 |
| attMPTI | 4.19 | 7.78 | 3.55 | 6.66 |
| COSeg | 6.96 | 12.45 | 6.24 | 11.26 |
| GW | 11.03 | 18.15 | 6.63 | 11.59 |
| GFS-VL | 21.66 | 31.82 | 19.42 | 29.47 |
旧 ScanNet 基准(13 基类 + 6 新类,1-shot): GFS-VL 新类 mIoU 49.72(GW 14.78,+34.94 )、HM 60.88(GW 21.55,+39.33),已逼近全监督上界(新类 mIoU 60.37)。

图 4:伪标签精炼过程。 原始 VLM 预测存在漏检与错标;PS 过滤低质量区域后,AI 发现红圈中漏检的新类并补全绿圈中的部分分割区域。
消融(ScanNet200,5-shot 单种子): 原始 VLM 伪标签 HM 33.28 → +PS 38.35 → +AI 39.39 → +NB-Mix 43.22,三个组件独立可叠加。换用不同 3D VLM:RegionPLC 31.56 → 43.22,OpenScene 23.58 → 31.07,框架与 VLM 解耦;骨干 PTv3(HM 43.22)与 SCN(42.13)一致稳定;混合策略对比中保留上下文的 NB-Mix(39.36)优于实例混合(35.44)与 Mix3D(36.42)。

图 5:混合策略对比。 实例混合随机插入前景对象、Mix3D 整场景叠加均破坏上下文;NB-Mix 按角点对齐嵌入并保留局部上下文(红/绿框为嵌入的新类样本)。
结果对比总结

图 8:结果对比总结(Mermaid 流程图)。 GW 5-shot HM 14.55 → GFS-VL 43.12(+28.57pp),并在 ScanNet++、旧 ScanNet 与双 3D VLM 设定下全面领先。
关键发现
- ScanNet200 5-shot 全面领先 :HM 43.12 vs GW 14.55(+28.57pp),新类 mIoU 31.67 vs 8.30(+23.37)。
- ScanNet++ 1-shot 提升 17.88pp:HM 29.47 vs GW 11.59,新类 mIoU 19.42 vs 6.63(+12.79)。
- 旧 ScanNet 1-shot 新类 mIoU 49.72:比 GW 高 34.94,HM 60.88 比 GW 高 39.33,接近全监督上界。
- 消融验证三模块缺一不可:HM 33.28 → 43.22,PS/AI/NB-Mix 各自独立贡献 5.07/1.04/3.83。
- 与 3D VLM 解耦:RegionPLC 提升 11.66pp(HM 31.56→43.22),OpenScene 提升 7.49pp(23.58→31.07)。
- 新基准暴露旧评测乐观偏差:GW 在 45 新类基准上 HM 仅 14.55,旧 ScanNet 上却有 25.39。
- 创新模式分析(Oral 信号):本文同时命中"制造监督信号"(消融 HM 33.28→43.22)、"异构分解差异化处理"(1-shot 基类 mIoU-B 68.48 与新类 mIoU-N 29.18 同时保持)与"混淆隔离诊断工具"(新基准量化暴露旧评测偏差)三种模式,方法执行质量与评测基础设施兼备。
局限性
- 依赖 3D VLM 特征空间:PS/AI 均在 VLM 视觉编码器特征上计算相似度,VLM 能力决定性能天花板。
- 小/薄/复杂背景物体仍易错:垃圾桶、窗帘、浴室台盆等难例的分割质量欠佳。
- 场景覆盖有限:新基准仍基于室内扫描数据集(ScanNet 系),缺少室外与动态场景。
- 权衡依赖 HM 指标:双线性头 + 20 epoch 微调下,基类-新类平衡以调和平均为导向。
常见问题(FAQ)
GFS-VL 解决什么问题?
广义少样本三维点云分割(GFS-PCS):模型在基类上训练后,仅凭每类 1--5 个新类样本注册新类,推理时同时分割基类与新类。GFS-VL 用 3D VLM 的稠密伪标签弥补 few-shot 样本的信息稀疏。
伪标签选择(PS)和自适应填充(AI)有什么区别?
PS 负责"去噪":预测原型与支持原型相似度低于阈值 τ 的 VLM 预测被滤除;AI 负责"补全":对过滤后留下的未标注区域,用自适应原型集按相似度 δ 重新赋新类,发现漏检类并补全残缺掩码。
为什么 NB-Mix 要保留上下文?
Mix3D 等传统混合会把新类物体从场景中剥离,破坏"物体-环境"的共现关系;而难识别的新类恰恰依赖上下文线索。NB-Mix 按角点对齐把新类样本嵌入场景边缘并做 Z 轴接地,在保留上下文的同时增加训练样本,消融中比实例混合高 3.92pp(HM)。
新基准和旧基准有什么不同?
旧基准(ScanNet/S3DIS)只有 6 个新类;新基准基于 ScanNet200(12 基类 + 45 新类)与 ScanNet++(12 基类 + 18 新类),新类更多样,且评测在整场景而非小 block 上进行。
换一个 3D VLM 或骨干还有效吗?
有效。RegionPLC 与 OpenScene 两种 3D VLM 下框架都显著提升(HM 分别 +11.66 与 +7.49pp);PTv3 与 SCN 两种骨干下 HM 分别 43.22 与 42.13,方法不依赖特定模型。
代码开源吗?
开源,见 https://github.com/ZhaochongAn/GFS-VL,包含方法实现与新基准的构建与评测代码。
参考链接
- 论文 arXiv 页面:https://arxiv.org/abs/2503.16282
- 项目代码(GFS-VL):https://github.com/ZhaochongAn/GFS-VL
- 前作 COSeg(CVPR 2024):https://github.com/ZhaochongAn/COSeg
- RegionPLC(CVPR 2024):https://github.com/zyang-ur/RegionPLC
- OpenScene(CVPR 2023):https://pengsongyou.github.io/openscene
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)