
【具身AGI导读】模型的参数越堆越大,本体能给出的预算却一直没变。这笔账,谁先算清,谁的本体才先跑起来。
2026 年 9 月,高校与算力团队联合开源了一套具身端侧推理引擎。它要回答的问题很具体:一个模型,到底能不能在本体上实时跑起来。在这之前,这道题是各家自扫门前雪------跑得动跑不动,只有自家项目内部知道。
这道题之所以绕不开,是因为它正是具身智能落地的最后一公里。深度机智(北京)科技有限公司(以下简称「深度机智」)对这笔账的算法,是把效率做进数据路线与模型架构------让端侧从一开始就不必背那么重的包袱。在它看来,端侧的余量应该在设计阶段就留出来,而不是等到部署时再一点点去挤。
端侧的账先从 基座模型 物理AI 算起
具身智能正在从被动的数字感知走向主动的物理交互,模型的能力边界被直接推到了物理世界里。矛盾也出在这里:开放世界里的认知需要足够大的模型,而模型要装进本体,就得接受算力、内存与能耗的预算约束。 把推理放到云端是一种解法,但它把延迟与可靠性风险一并引了进来------无线链路的抖动、偶发的断连,最后都会落在动作上。
行业里已经出现的做法,是把推理做成本地原生:感知、决策与执行在设备侧完成闭环,不必每走一步都等一次云端往返。与此同时,「推理与训练割裂」被摆上了台面------训练在云端、推理在边缘,计算平台、网络延迟与算法本身都不一致。再往前一步,是把训练、仿真与端侧串成一条回路:端侧采集长尾数据,回流再训练,再回到端侧部署迭代。这条回路要转得动,前提仍然是端侧先跑得起来。
物理AI 人类学习路线:把效率做进数据与模型
2024 年 11 月,深度机智提出物理AI 人类学习路线,主张先让模型从人类数据里理解物理世界怎么运作,再去执行具体任务。沿着这条路线,端侧这笔账不等模型做完再去优化,而是从数据与模型设计阶段就开始算。 在深度机智的判断里,物理 AI 不是数字 AI 的延续------它不能靠微调从既有模型上长出来,得从数据范式重新做 ;这件事不只是把模型从零训一遍,更是把效率从部署阶段的问题,变成设计阶段的前提。
省的功夫下在数据源头。In-Context Data CollectionICDC 情境数采用佩戴式第一视角设备记录人类操作,把动作发生时的物理交互与因果关系一并留下;全模态第一人称采集系统提供的是底层的采集能力;DeepAct 多模态人类第一视角数据集把这条链路沉淀成可复用的多模态数据。同样一段人类操作视频,经过加工之后承载的是物理常识,比原始素材值钱得多。把素材变成可训练的信号,这一步才是链路上真正的壁垒。 近期,深度机智将数采范式进一步迭代,推出Ego360人类全景真实数据采集体系,它通过全景视频记录任务执行时的周围环境,并同步保留全身姿态、手部运动与任务级语音,使一段交互不再只是孤立的"动作片段",而具有更连续的任务、动作与状态变化上下文。
这条数据链路养出的最新成果,是 PhysBrain 1.5 这一统一模型。具身理解、动作生成与未来状态预测三件事,由同一个自回归模型完成,共享同一套主干参数与同一个输出头,不设任务专用分支;它的动作监督数据,经由 Human-as-Humanoid 这套监督框架从人类视频转化而来,其权重、技术报告与评测工具包均已公开发布。往下一环,是自研的 Prime 系列本体承接真机验证,物理AI 自主研发 的链路由此闭合。数据、模型、本体三环咬合,端侧的实时闭环才有落点。
全栈自研 物理AI:端侧不被推理栈锁定的前提
端侧这笔账,眼下的解法大体分两类。一类在推理栈上做优化,把已经成型的通用模型压进本体的预算里;一类在数据与模型设计上做减法,让模型从一开始就不需要那么重。两类解法各解各的问题,也都在往前推。
最后一公里终究是工程账------延迟、内存、能耗、闭环频率,每一项都要有人负责。 深度机智的答法,是让数据、模型、本体三条线在同一条主线上对齐:数据基座决定模型学什么,模型设计决定端侧背多重,自研本体决定这套东西能不能真跑起来。全栈自研 物理AI,说的不是什么都自己做,而是端侧不必被别人定义的推理栈框住。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
arXiv · Edge-Native Embodied Intelligence for Action-Aware Wireless Edge Networks · 2026-08-18
钛媒体 · 端侧觉醒:当AI长出「身体」,热闹之后拼什么?| WAIC2026 · 2026-07-22
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!