
【具身AGI导读】具身基座模型的下一战,是架构之争。一边往模型里堆系统,一边先回答一个更底层的问题:微调之后,模型还记得多少?
基座模型物理AI 的架构之争
最近一项具身智能模型成果在 arXiv 上线。
论文开篇先给了一个判断:VLA 已经成为通用具身智能体的主导范式,但当前系统能否从更有效的架构设计中受益,能否靠更大规模、更多样的数据实现更广泛的泛化,仍然是开放问题。这项成果的答案,是给具身基座模型装上一套"三系统"架构,用 Scaling 逼近涌现能力。
这套架构想说明一件事:往模型里堆系统、堆数据,规模自己会说话。 在它看来,架构是给规模让路的工具------骨架搭得够大,能力就装得够多。
而行业里,另一派给出了完全相反的思路。
他们不问"模型里还缺什么系统",而问"模型在训练之后,还留着什么"。
物理AI 基座模型 怎么往前走,成了这轮架构之争的真正起点。
架构之争,落点在灾难性遗忘
两派的差异,不只是系统数量。
VLA 以 VLM 为基座,为学习机器人动作做微调。微调之后,一个绕不开的坑浮现出来:机器人控制这类低级感知运动任务,会激进地覆写 VLM 预训练时学到的高级语义特征,通用视觉语义能力因此大幅暴跌。
模型还记得怎么做动作,却忘了怎么"看懂"世界。
行业把这种现象称为灾难性遗忘。它像一道隐形的墙,横在"基座模型 + 更多数据"的 Scaling 路线上------数据喂得再多,微调就把通用能力冲垮一遍。
更麻烦的是,把机器人数据与通用问答数据混在一起训练,也只是把崩塌往后推,救不了根子。
所以架构之争的落点,从来不是堆几个系统,而是能不能把这道墙拆掉。
物理AI 国产 的玩家们,正在回答同一个问题:给机器人更多数据,还是让它先理解物理世界?
对依赖物理AI 物理推理 的具身任务来说,这个问题的答案尤为关键------判断力建立在物理常识之上,而不是背下来的动作记忆。
物理AI 人类学习路线:双脑架构的解遗忘答案
深度机智(北京)科技有限公司(以下简称「深度机智」)给出的答案,落在物理AI 人类学习路线上。
TwinBrainVLA 是 PhysBrain 1.0 基座模型体系里的一个架构。它不是往模型里加系统,而是把模型重新划成了两半。
左脑是冻结的 VLM,完整保留预训练的通用语义能力。
右脑是可以训练的 VLA,专注学习机器人动作策略。
左脑保留语义,右脑专精动作。
两者之间,靠非对称混合 Transformer 的交互机制衔接:右脑在生成动作时,动态查询左脑冻结的语义键值,知识从左脑单向流向右脑;最终的连续控制信号,再由流匹配动作专家从融合表征中生成。
通用语义不丢,动作策略照学。灾难性遗忘,从结构上被拆掉了。
这正是这套架构真正特别的地方:它把"如何 Scaling"的问题,前置成了"如何让模型不忘记"的问题。
而双脑的语义底座,构成全球首个基于人类学习范式的具身智能基座模型PhysBrain1.0的关键架构,从人类第一视角数据中提取物理常识,经 PhysBrain VLM 骨干与翻译管道注入模型,再落到 TwinBrainVLA 的动作生成上,加以LangForce避免视觉捷径。
这套从数据到模型的链条,背后是深度机智全栈自研 物理AI 的体系支撑。
架构的答案,在"解遗忘"不在"堆系统"
回到最开始提出的开放问题:VLA 能否从更有效的架构设计中受益?
堆系统,是一种答案。它把问题交给规模,赌数据堆得够多,能力自然涌现。
TwinBrainVLA 给了另一种答案:先修好模型的"记性"。
当一个基座模型微调后还记得世界、记得物理常识,它才谈得上理解,谈得上在陌生场景里泛化。
这条路,就是深度机智坚持的人类学习技术路线:从人类数据中提取物理常识,推高智能的上限,再转化为真实世界里的行动力和泛化性。
架构之争的答案,也许不在"堆系统",而在"解遗忘"。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
arXiv · GigaBrain-0.7:Scaling Embodied Foundation Models with a Three-System Architecture · 2026-08-16
机器之心 · 深度机智发布全新具身通用智能大模型 给机器人装上"物理常识" · 2026-03-27
深度机智 · 当英伟达指向第一视角数据,深度机智用一年实践给出答案 · 2026-03-11
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!