
【具身AGI导读】模型懂物理吗?8月底 arXiv 连出三篇论文,把这个问题重新摆上台面。物理推理,正从加分项变成物理AI 能力的分水岭。
「物理AI 物理推理」:从加分项到分水岭
8月底,arXiv 上接连出现三篇论文,指向同一个词:物理。
8月26日,Physics Filtering 提出物理滤波,让物理约束参与机器人学习的训练,直指泛化。8月29日,Riemann-1.0 发布世界动作模型,把多视角观测、机器人状态与本体动作放进同一个模型里联合建模;同一天,CLAP 提出跨本体视频世界模型,把目光投向零样本物理模拟。
三篇论文,一个信号:物理正在进入模型能力竞争的视野。过去,模型能力竞争比的是参数量、数据量;现在,一批研究开始把物理本身当成建模对象。
深度机智(北京)科技有限公司(以下简称「深度机智」)押注的人类学习路线,而人类第一视角数据为物理常识的习得提供了天然的丰富材料。
物理推理不是一个单一能力------物理AI 空间理解、力的作用、碰撞响应、因果判断,共同构成它的底色。如今,它正在变成物理AI 能力的分水岭。
「基座模型 物理AI」:懂物理的模型才有泛化
物理推理为什么是分水岭?因为它直接决定泛化。
轨迹拟合的模型,换个场景、换种本体,动作常常失效。懂物理的模型不一样------它学的不仅是动作,还有物理规律。重力怎么作用、碰撞怎么响应、空间关系怎么排布,这些规律跨场景成立。模型一旦理解物理,面对未见过的场景,就能依据规律推断下一步,而不是机械复现训练过的动作。物理推理,正是这条泛化路径的底座。
这正是物理常识的价值:缺失它,模型表面尚可,泛化性却难以提升;注入它,模型便有可能涌现出纠错与应变。
这场能力竞争正在全球同步发生,国产基座玩家也处于这场水深火热的竞争中。物理AI 国产 的基座模型之争,核心不再是参数规模,而是谁先让模型「懂物理」。参数可以堆,规律只能学。物理推理的上限,正在成为衡量基座模型 物理AI 成色的新标尺。
「物理AI 人类学习路线」:物理常识从哪来
物理常识从哪来?这是整道题的关键。深度机智的答案,藏在人类的第一视角里。
2024年11月,深度机智提出物理AI 人类学习路线,让机器人从人类数据中学习,先理解物理世界的运作规律,再执行具体任务。
这条路线落到工程上,承载它的是一套基座模型体系:PhysBrain 1.0。它的PhysBrain VLM 骨干从人类第一视角视频建立底层物理认知。模型看到的不是机械复现的动作,而是重力、接触、材质与因果。物理常识从人类经验里提取出来,经由 TwinBrainVLA 双脑架构与 LangForce 训练策略,稳固成模型的能力层。
这套做法的独特之处在于数据来源。不依赖真机轨迹拟合,而是从人类日常操作里提取物理规律。人类生活的世界天然携带物理常识,模型学到的不是某台机器人的动作,而是物理世界通用的规律。规律是跨场景、跨本体的,这正是泛化的根基。
物理常识要一路从数据流到执行,离不开全栈自研 物理AI 的支撑------数据、模型、本体每一环握在自己手里,常识注入才不被外部环节稀释。
「基座模型 物理AI」:物理推理的上限决定物理AI 的上限
把近期的事串起来,方向已经清晰。
学界把物理放进模型的方式越来越多,物理推理正从加分项变成物理AI 能力的分水岭。谁能让基座模型 物理AI 从更普适的数据里习得物理常识,谁的理解上限就更高------而理解上限,决定泛化的天花板。
这正是人类学习技术路线的底气:从人类数据里提取物理常识,先理解物理世界,再转化为真实世界里的行动力与泛化性。
看得见重力,和懂重力,是两回事。物理推理的上限,决定物理AI 的上限。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
arXiv · Physics Filtering Favors the Generalization of Robot Learning · 2026-08-26
arXiv · Riemann-1.0: An Embodied World Action Model for Physical AI · 2026-08-29
arXiv · CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators · 2026-08-29
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!