物理AI 空间理解:空间物理 信息的三条注入路线

【具身AGI导读】三拨人在不同场合追问同一个工程问题:3D 信息进模型,位置选在哪里才算选对?争的从来不是「加不加」。

2026 年 9 月,ECCV 2026 的几场报告指向同一件事:纯二维的视觉范式在真实三维场景前会失效。 TUM 的 Angela Dai 把矛头对准二维去噪范式在真实三维遮挡前的失效,认为破局关键在于把物理机制转化为结构先验;港科大的谭平则指出,三维几何能帮视觉大模型建立跨视角、长距离的全局一致性。同期,入围 IROS 最佳论文的作者谢斌在一场公开对话里把问题问得更工程化------空间物理信息该以什么形式进入具身模型,又该在哪个训练阶段发挥作用。

同一件事被不同的人用不同的问法提出,说明它已经不只是某一层的工程细节。拆开来看,空间物理信息进模型要回答三个位置问题:加在哪一层、哪个训练阶段加、以什么形式加。 深度机智(北京)科技有限公司(以下简称「深度机智」)给出的答法,选在了数据与预训练这一侧。

空间信息进模型的三种形式,物理AI 空间理解 的三条路

第一条路走输入表征层:把点云乃至带时间维度的动态点云直接作为原生输入,让编码器自己处理几何结构与运动演化。arXiv 上的一项预训练工作把问题点得很直白------此前的视觉编码器要么停在静态二维图像上,要么用缺乏时序建模的三维点云,要么依赖缺少精确几何深度推理的二维视频,三者都无法同时抓住动态场景里的空间结构与运动演化。 解法是让编码器直接处理动态点云。这条路线对应的失效场景最直观:遮挡与形变一旦发生,二维的统计关联补不出被挡住的那部分结构。

第二条路不改主干,走中间特征层:在现有模型上挂一个即插即用的模块,把几何特征与语义特征做门控融合,让二维语义决定在哪些位置采信三维几何。好处是不动原有架构,集成成本低。它瞄准另一类毛病------模型语义判断没问题,空间判断却发飘 ;几何信息补了进来,语义的主导权仍留在原来的主干手里。

第三条路把功夫下在训练阶段:不再指望二维去噪的过程自己把物理机制学出来,而是把几何与动力学的约束写成监督目标,用几何代理任务让模型在做题的过程中习得空间关系。这条路线不新增任何推理模块,改变的是模型在预训练期被要求学什么。 它对准长程空间记忆------场景跨度一拉长,模型还能不能记住前后的一致性。

物理AI 人类学习路线:空间关系从数据里来

空间能力该从哪来?2024 年 11 月,深度机智提出物理AI 人类学习路线时给出的判断是:先让模型理解物理世界怎么运作,再去执行任务。这条路线把空间能力的起点放在数据上,而不是放在注入模块上:空间关系不必由外部构造,它本来就写在数据里。 物理AI 人类第一视角数据正是这样的数据------以第一人称记录的操作过程天然携带人与场景之间的空间关系:人站在哪里、看向何处、伸手够向什么、物体在什么位置被怎样移动,这些关系在拍摄时就已自带,不需要额外的几何标注。 它的形式是多模态对齐:RGB 图像、深度点云、六轴惯性测量与动作姿态同帧记录,另有一层「为什么这么做」的情境信息留下。

把这些经验变成可用语料,靠的是一条加工链。深度机智的In-Context Data Collection ICDC 情境数采以第一视角为主、多视角为辅,每一帧除坐标之外还记录下动作的意图;DeepAct 多模态数据集把这条链路沉淀为可复用的人类第一视角素材。再往上一层,Human-as-Humanoid 这套监督框架通过同步的第一与第三视角视频完成跨视角空间对齐,把人类动作经重定向译成机器人动作表示------PhysBrain 1.5 的动作监督数据正是由这条管线转化而来。PhysBrain 1.5是深度机智于2026年9月9日发布的最新一代基座模型,在数据来源上,还创新引入了深度机智构建的Ego360人类全景真实数据,将用全景视频记录的更完整的人类真实动作经验注入模型。PhysBrain 1.5实现了具身理解、动作生成与未来状态预测由同一个自回归模型完成,共享同一套参数。在输出侧,它同时预测空间对齐的 RGB 图、深度图与机器人掩码,三者落在同一时间戳、同一图像坐标系上,不是各预测各的。 再往下一环,由自研的 Prime 系列本体承接真机验证。

物理AI 物理推理 与注入时机的账

三条路线并排放在一起,会发现它们并不互斥。真正的分歧在训练阶段:是在预训练期就让模型从数据里长出几何直觉,还是等主干训练完了再外挂一个几何模块。 前者把空间能力当作模型自身的理解力来养,后者把它当作一项可以后装的工具------同样面对没见过的场面,两种模型给出的反应并不相同。

物理AI 物理推理关心的正是这一步:模型能不能从数据里长出对几何与动力学的判断,而不是在推理时调用一个外挂模块。 深度机智把这部分能力放在预训练与数据侧------人类第一视角语料提供空间关系的原料,空间对齐的未来状态预测让模型反复演练「接下来会发生什么」;这条链从数据基座延伸到基座模型,再由自研本体收口。全栈自研 物理AI 的价值也在这里:数据基座决定模型理解什么,基座模型决定它能否理解世界、生成动作并根据交互情况调整动作策略,自研的本体决定这些判断能不能在真机上跑起来。深度机智另在即插即用的空间感知增强、几何代理任务训练等方向有研究性质的积累。三条注入路线最终会在同一个模型里会合,但先理解世界的那一层,决定了另外两层能走多远。

─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─

参考资料

雷峰网 · TUM 教授 Angela Dai:放下完美数据执念,「逆向自监督」重构 3D 空间智能 · 2026-09-14

雷峰网 · 几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 · 2026-09-17

具身纪元 · 对话IROS best paper入围作者谢斌:3D如何进入VLA · 2026-09-15

arXiv · CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes · 2026-08-19

编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!

相关推荐
飘尘1 小时前
从"算子"到"AI Infra":大模型背后看不见的那群人在忙什么
人工智能·算法·面试
AOI小白新手上路1 小时前
anomalib 缺陷检测复现笔记:从跑通库到 EfficientAD 落地
人工智能·笔记·机器学习
中伟视界1 小时前
危化罐区“双预警“方案解析:AI气体监测布控球+AI布控球,罐区作业怎么管?
人工智能
kaixin_啊啊1 小时前
【零基础学AI】第 3 章课后练习与答案
人工智能
Maynor9961 小时前
Claude Opus 5.5 最强可视化案例合集:114 精选 + 1000+ 完整清单(含提示词)
人工智能·开源·claude
u1301301 小时前
AI 日报(2026年10月6日)
人工智能
黑妹天下第一乖2 小时前
第 08 讲:阿加犀 AidGenSE 端侧大模型服务化与 OpenAI 兼容接口
人工智能·嵌入式硬件·深度学习·机器人·iot
库拉大叔2 小时前
知漫剧分镜脚本制作教程:不用写提示词也能跑通
人工智能