导读:
在汉斯出版社《人工智能与机器人研究》期刊上,有文章提出一种面向对象的三维场景语义理解框架,旨在从无标签数据中学习以对象为中心的连续场景表达。
作者信息:
高 丽:沈阳城市学院生命与健康管理学院,辽宁 沈阳;王一可, 尹竞瑶:沈阳城市学院智能与工程学院,辽宁 沈阳
论文详情
方法
本文方法的整体框架如图 1 所示,包含三个核心模块:场景感知模块、场景理解模块与模型优化模块。

本文将场景表达为高斯混合模型的层次化扩展。
初始分组:空间邻近性聚类。
精细分组:二维语义线索引导。
对象组分的形成与优化。
本文设计了三类自监督信号,充分利用无标签数据中蕴含的物理约束:
几何一致性约束
光度一致性约束
物理合理性约束
上述三类约束组合为统一的自监督损失函数:

本方法引入多模态先验知识作为对抗学习的判别依据。
实验与分析
实验在三个室内场景数据集上进行评估:
-
ScanNet:包含 1513 个真实室内场景的 RGB-D 扫描数据,提供三维重建与语义标注基准;
-
Replica:高保真合成室内场景数据集,具有完美的几何与外观真值;
-
InteriorGS:最新发布的基于 3DGS 的语义场景数据集,包含 80 余种室内环境类型。
如表 1 所示,本文方法在三个数据集上的渲染质量均优于基线 3DGS 方法。

表 2 展示了各模块对最终性能的贡献。


结论
实验结果表明,本文方法在无需人工标注的条件下,在三维重建质量和语义理解能力两个维度均取得了有竞争力的性能,验证了面向对象表达与无标签学习相结合的有效性。该方法为降低三维场景理解对标注数据的依赖、提升模型的泛化能力与可解释性提供了可行的技术路径。
未来工作将聚焦于三个方向:
-
将方法扩展至动态场景,引入时序建模能力;
-
探索更轻量化的模型设计,降低训练开销;
-
将学习到的面向对象表达应用于机器人交互与场景编辑等下游任务,验证其实际应用价值。
基金项目:
辽宁省教育厅 2025 年度高校基本科研项目,项目编号:LJ212513220003