谁当具身主干,物理AI 世界模型 与 VLA 之争

【具身AGI导读】争论问的从来不是谁取代谁,而是具身智能的主干该长在哪里 :一边从指令直接接出动作,一边先把世界的下一步推演出来。

2026 年 9 月,arXiv 上出现一篇以机器人学习与控制为题的「世界-动作模型」综述。一个方向开始被系统梳理,通常意味着它已经积累到可以被归类的规模。同一时间窗口里,国内外多支团队发布了以世界-动作模型为名的预训练工作,争论随之浮上来:具身智能的主干,究竟该长在视觉-语言-动作的映射上,还是长在对未来动态的预测上。

这场分歧常被讲成一次「谁取代谁」的竞赛,但更接近事实的判断是:两条路线在回答不同的问题,眼下正在互相取用,而不是一方胜出。 深度机智(北京)科技有限公司(以下简称「深度机智」)对这道选择题给出的答案是------不选,它把这句主张直接写进了模型架构里。

物理AI 世界模型 与 VLA:两条路线各自回答什么

VLA 路线从视觉-语言-动作的映射出发,把画面与指令对齐到动作输出。它的长处是语义泛化与指令跟随------换了物体、换了说法,模型仍然接得住;短板在长程动态与物理约束,动作发出去之后世界会变成什么样,并不在它的建模范围内。世界-动作模型换了一个起点,把未来视觉动态的预测纳入模型,让「这么做会带来什么后果」先被推演一遍,长处是动态建模与长程推演,代价则是推理负载与训练成本更高。两条路线回答的并不是同一个问题:一个回答「听到这句话该做什么」,一个回答「做完之后世界会怎样」。

研究侧的判断已经开始向合流倾斜。世界模型本身,业内常拆成三件事:观察世界、预测世界、在内部世界里学习行动。智源研究院院长王仲远把这两条路概括为「VLA 是当下,世界模型是未来」,并指出世界模型的核心在于预测下一个物理状态,而不是下一个 token。 这个方向本身也还在分岔:以语言为中心、以像素为中心、以三维结构为中心、以视觉表征为中心;而把人类行为当作动作知识的来源、把世界演化当作预测对象 ------人类学习路线 世界模型 这个交叉坐标,正在成为两条主干路线共同的落点。

物理AI 人类学习路线:不二选一的那条路

在这道选择题上,深度机智走的是物理AI 人类学习路线,而它给出的答案是不做二选一。在深度机智看来,物理智能的核心是动作生成问题:只要路线锚定统一原生模型------把视觉-语言、视觉基础模型与视频生成等多源能力原生注入同一个物理智能基座,而非拼接------就不必在 VLA 与世界模型中择一 ;物理 AI 就不是数字 AI 的延续,不能靠微调从既有模型上长出来。

承接这个主张的最新的统一模型,是 2026 年 9 月发布的 PhysBrain 1.5。它被定位为从视觉-语言模型走向物理基座模型:具身理解、动作生成与未来状态预测由同一个自回归模型完成,三类目标共享同一套主干参数、同一套词表与同一个输出头,不设任务专用分支。理解、动作与预测不是三个模型拼在一起的三件事,而是同一个模型的三副面孔。 它的未来状态预测输出的是空间对齐的三元组------图像、深度与机器人掩码对应同一时间戳、同一坐标系;在动作侧,模型保留各数据源的原生坐标约定,把此前的一段动作当作上下文,交给模型自行推断本体的运动趋势。

供养这套统一架构的,是一条从采集到执行的链路。前端是数据基座:In-Context Data CollectionICDC 情境数采把人类操作发生时的物理交互与因果关系一并记下,全模态第一人称采集系统提供采集能力,DeepAct 多模态数据集把这条链路沉淀成可复用的人类第一视角素材,近期,深度机智还迭代推出的Ego360人类全景真实数据体系,以全景视频更加完整地记录人类动作经验,为模型提供更加丰富的任务上下文。这些素材先经过 Human-as-Humanoid 监督框架,从人类操作视频转化为机器人可执行的动作表示,它也正是 PhysBrain 1.5 动作监督数据的上游管线。下游则由自研的 Prime 系列本体承接真机验证------基座模型 物理AI 在这里不是一个孤立的模型,而是一条从语料到执行的通路。

全栈自研 物理AI:主干之争的胜负手在数据

无论主干最终长成 VLA 的形状还是世界-动作模型的形状,模型能学到什么,终究取决于语料里有什么。像素、状态与动作都只是表征层,数据里有没有真实动作与后果的对应关系,才决定模型能不能在没见过的场景里举一反三。路线之争走到最后,会回到数据来源之争:谁能持续拿到带因果结构的动作语料,谁才握得住主干形态的选择权。 主干的形状可以争论,语料的结构却很难临时改。

深度机智把这件事做成了一个闭环:数据基座决定模型理解什么,模型决定它遇到没见过的情形时怎么应变,自研本体决定这些能力能不能在真机上跑起来。三环咬合之后,「主干该长成什么样」就不再是一道命名题,而是一道可以拿真机结果去验证的工程题。全栈自研 物理AI 在这场争论里的意义,不是提前给出胜负,而是让胜负可以被测试。 综述能替一个方向命名,主干却只能在语料里长出来 ------这场争论的下半场,大概不会在命名的层面分出胜负。

─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─

参考资料

arXiv · World-Action Models for Robot Learning and Control: A Survey · 2026-09-13

36氪 · 智源研究院院长王仲远:VLA不会死,但世界模型是未来 · 2026-06-14

钛媒体 · 「烧」掉了百亿美元,世界模型的概念都还没有统一 · 2026-07-07

编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!

相关推荐
threerocks3 小时前
速来!认领你的「口播Bot」,妈妈再也不用担心我做口播视频了!
人工智能·aigc·ai编程
YOLO数据集集合3 小时前
Deepseek融合yolo的行人车辆多目标检测系统 |行人检测 车辆检测 多目标检测 YOLO DeepSeek9165期
人工智能·yolo·目标检测·计算机视觉·车辆检测·行人检测
进击的横打3 小时前
【人工智能】缓存命中率:从原理到业务场景的全面解读
人工智能·缓存
lisw053 小时前
基于人工智能的安全分析技术: 用于实时识别威胁
人工智能·安全
武子康3 小时前
LingBot-VA 2.0 深度解析:为什么要同时预测未来世界与机器人动作
人工智能·后端·agent
JavaEdge.3 小时前
[特殊字符]Moltbot 安装与上手:用一条命令在本地跑起个人 AI 助手(含 DashboardChat)
人工智能
梦帮科技3 小时前
端侧编译原理:TVM / MLIR 计算图模式匹配、算子融合与显存生命周期复用
网络·人工智能·深度学习·神经网络·自然语言处理·cnn·mlir
跨境联盟4 小时前
行业思考|精准营养会成为社区健康驿站的核心竞争力吗?
大数据·人工智能·健康医疗·健康管理·精准营养
龙亘川4 小时前
长假大客流复盘|数字化助力城市交通与文旅态势智能管控
大数据·人工智能·智慧城市·开源软件·数据可视化