人工智能与机器人研究|面向无标签数据的三维场景语义理解方法研究

导读:

在汉斯出版社《人工智能与机器人研究》期刊上,有文章提出一种面向对象的三维场景语义理解框架,旨在从无标签数据中学习以对象为中心的连续场景表达。

作者信息:

高 丽:沈阳城市学院生命与健康管理学院,辽宁 沈阳;王一可, 尹竞瑶:沈阳城市学院智能与工程学院,辽宁 沈阳

论文详情

方法

本文方法的整体框架如图 1 所示,包含三个核心模块:场景感知模块、场景理解模块与模型优化模块。

本文将场景表达为高斯混合模型的层次化扩展。

初始分组:空间邻近性聚类。

精细分组:二维语义线索引导。

对象组分的形成与优化。

本文设计了三类自监督信号,充分利用无标签数据中蕴含的物理约束:

几何一致性约束

光度一致性约束

物理合理性约束

上述三类约束组合为统一的自监督损失函数:

本方法引入多模态先验知识作为对抗学习的判别依据。

实验与分析

实验在三个室内场景数据集上进行评估:

  1. ScanNet:包含 1513 个真实室内场景的 RGB-D 扫描数据,提供三维重建与语义标注基准;

  2. Replica:高保真合成室内场景数据集,具有完美的几何与外观真值;

  3. InteriorGS:最新发布的基于 3DGS 的语义场景数据集,包含 80 余种室内环境类型。

如表 1 所示,本文方法在三个数据集上的渲染质量均优于基线 3DGS 方法。

表 2 展示了各模块对最终性能的贡献。

结论

实验结果表明,本文方法在无需人工标注的条件下,在三维重建质量和语义理解能力两个维度均取得了有竞争力的性能,验证了面向对象表达与无标签学习相结合的有效性。该方法为降低三维场景理解对标注数据的依赖、提升模型的泛化能力与可解释性提供了可行的技术路径。

未来工作将聚焦于三个方向:

  1. 将方法扩展至动态场景,引入时序建模能力;

  2. 探索更轻量化的模型设计,降低训练开销;

  3. 将学习到的面向对象表达应用于机器人交互与场景编辑等下游任务,验证其实际应用价值。

基金项目:

辽宁省教育厅 2025 年度高校基本科研项目,项目编号:LJ212513220003

原文链接:

https://doi.org/10.12677/airr.2026.154099

相关推荐
Web3_Daisy1 小时前
Robinhood Chain Launchpad:链上资产发行进入新阶段
大数据·人工智能·区块链
weixin_495248401 小时前
带硬字幕的老视频也能出海:短剧出海翻译服务商如何擦除重制?
人工智能·音视频
鲲穹AI种草1 小时前
演示文稿制作工具记录:多款 PPT 工具能力边界整理
人工智能·powerpoint·演示文稿制作工具
leoZ2319 小时前
本地跑大模型实战(七):llama.cpp 性能调优,让推理更快更省
java·人工智能·spring·生成对抗网络·语言模型·自然语言处理·llama
To_OC9 小时前
我把《天龙八部》塞进向量数据库后,终于搞懂了 RAG 到底是个啥
人工智能·llm·agent
蜡台10 小时前
AI Agent(智能体)入门基础教程
人工智能
Akir.weiwen10 小时前
Token 层差异:从颜色值到语义状态的三层跃迁
人工智能·设计规范
迷迭香yy10 小时前
集合竞价数据挖掘实战:用Python构建开盘信号识别系统
人工智能·python·数据挖掘