人工智能与机器人研究|面向无标签数据的三维场景语义理解方法研究

导读:

在汉斯出版社《人工智能与机器人研究》期刊上,有文章提出一种面向对象的三维场景语义理解框架,旨在从无标签数据中学习以对象为中心的连续场景表达。

作者信息:

高 丽:沈阳城市学院生命与健康管理学院,辽宁 沈阳;王一可, 尹竞瑶:沈阳城市学院智能与工程学院,辽宁 沈阳

论文详情

方法

本文方法的整体框架如图 1 所示,包含三个核心模块:场景感知模块、场景理解模块与模型优化模块。

本文将场景表达为高斯混合模型的层次化扩展。

初始分组:空间邻近性聚类。

精细分组:二维语义线索引导。

对象组分的形成与优化。

本文设计了三类自监督信号,充分利用无标签数据中蕴含的物理约束:

几何一致性约束

光度一致性约束

物理合理性约束

上述三类约束组合为统一的自监督损失函数:

本方法引入多模态先验知识作为对抗学习的判别依据。

实验与分析

实验在三个室内场景数据集上进行评估:

  1. ScanNet:包含 1513 个真实室内场景的 RGB-D 扫描数据,提供三维重建与语义标注基准;

  2. Replica:高保真合成室内场景数据集,具有完美的几何与外观真值;

  3. InteriorGS:最新发布的基于 3DGS 的语义场景数据集,包含 80 余种室内环境类型。

如表 1 所示,本文方法在三个数据集上的渲染质量均优于基线 3DGS 方法。

表 2 展示了各模块对最终性能的贡献。

结论

实验结果表明,本文方法在无需人工标注的条件下,在三维重建质量和语义理解能力两个维度均取得了有竞争力的性能,验证了面向对象表达与无标签学习相结合的有效性。该方法为降低三维场景理解对标注数据的依赖、提升模型的泛化能力与可解释性提供了可行的技术路径。

未来工作将聚焦于三个方向:

  1. 将方法扩展至动态场景,引入时序建模能力;

  2. 探索更轻量化的模型设计,降低训练开销;

  3. 将学习到的面向对象表达应用于机器人交互与场景编辑等下游任务,验证其实际应用价值。

基金项目:

辽宁省教育厅 2025 年度高校基本科研项目,项目编号:LJ212513220003

原文链接:

https://doi.org/10.12677/airr.2026.154099

相关推荐
库拉镜像AI牛牛8 小时前
工作室标准化出片体系:知漫剧小说转漫剧落地应用
人工智能
正在走向自律8 小时前
AI数据分析与可视化:从基础到应用实践
服务器·人工智能·python·机器学习·数据分析·pandas
小师兄吃牛肉8 小时前
C语言中的nullptr有必要吗
c语言·c++·算法
空堂与归8 小时前
Hinton 首篇 RSI 论文:AI 自我进化怎么闭环?
人工智能·ai
2601_956743688 小时前
上海GEO营销工程实践:知识库构建、AI内容生产、官网承接与监测优化闭环评估
人工智能·ai·geo·上海
盟接之桥8 小时前
当大模型遇见线束制造:不是通用AI,而是行业AI
大数据·网络·人工智能·安全·制造
归秋1429 小时前
2026 企业 AI 办公工具选型指南:从评估框架到产品适配
大数据·运维·人工智能
冬奇Lab9 小时前
开源项目第229期:e2e — 用自然语言写 E2E 测试,还能把 Agent 跑过的操作录成‘回放缓存‘免模型调用
人工智能·测试
东风破_9 小时前
从 Neo4j 到 GraphRAG:用 Text-to-Cypher 构建图检索 RAG
人工智能·后端
冬奇Lab9 小时前
LLM 自动化测试系列(05):移动端自动化(一)——ARTEMIS 的双模式架构拆解
人工智能·测试