【PNP具身解读】GPT6 Astra:具身智能新范式,大模型 + Franka机器人快速落地验证一、GPT6 Astra 背后的布局、数据与具身方向

GPT6 Astra 依托分层具身架构,以高层空间推理与任务规划能力为核心,在 Franka 机械臂平台完成真机验证,成为物理智能机器人领域重要的大模型基座。它无需从零训练专用视觉动作策略,仅通过 API 接入即可快速完成原型搭建,显著降低机器人开发门槛,带动斯坦福、CMU 及生命科学类实验室开展机器人操作实验部署。

OpenAI 的 GPT-6 Astra 在物理操作基准测试中达到了 95% 的准确率,但精确度任务暴露了熟悉的瓶颈

【PNP具身解读】GPT6 Astra:具身智能新范式,大模型 + Franka机器人快速落地验证

一、GPT6 Astra 背后的布局、数据与具身方向

OpenAI 将 GPT-6 Astra 正式归入 OpenAI Robotics(原 World Model)整体具身智能战略框架。据披露,Astra 的核心定位为空间推理与任务规划基座,项目与独立机器人硬件团队并行研发,该模型并不用于直接替代底层机器人运动控制模型。

在数据体系建设层面,OpenAI 持续搭建真机交互数据工厂,一方面采集机器人视觉 - 动作轨迹数据,另一方面依托世界模型批量生成仿真物理场景样本。项目融合互联网多模态视频、真机操作轨迹共同完成基座模型训练,重点补强模型对空间关系、物体操作常识的理解能力。不过目前整套方案仍存在短板,力觉感知、接触动力学相关的真机实测数据储备相对不足,仍是物理智能落地过程中需要攻克的关键环节。

在机器人方向上,公开信息显示 OpenAI 实验室展示了使用Franka机器人开展原型验证,采集操作轨迹,测试 Astra 高层规划输出映射到机械臂末端目标位姿。整套技术路线采用分层架构:Astra 负责高层任务拆解、场景理解、世界预测,下层保留机器人专用运动控制栈,传统控制器处理关节运动、力控与安全边界。

Astra 在非接触抓取、物体排序等开放场景任务表现突出,能够理解自然语言指令、完成场景解析与多步任务拆解;同时也暴露了精细接触装配、力觉交互上的固有短板。这套 "大模型认知大脑 + 机器人底层力控" 的组合范式,大幅缩短科研机构具身智能原型的开发周期,加速物理世界 AI 智能体的落地探索,推动整个机器人行业从固定编程作业,走向开放环境通用物理智能的新阶段。

二、斯坦福、CMU 等高校基于 GPT6 Astra,在 Franka 机器人上完成验证与快速部署

Franka 一直是全球机器人顶校的标准实验平台,斯坦福、CMU 等高校机器人实验室近期基于 GPT6 Astra,在 Franka 机械臂上完成了具身任务验证,实现低成本快速部署。依托 Franka FCI 高速控制接口与 ROS 生态,研究团队不需要从零开发复杂视觉动作策略,仅通过 API 接入 Astra,由 Astra 读取相机流与机器人本体状态,接收自然语言指令完成场景理解、任务拆解,输出笛卡尔空间末端目标点,再交由 Franka 底层力控控制器执行动作。

这套方案大幅降低具身智能原型落地门槛,过去需要数月开发调试的机器人操作 Agent,现在仅需数天就能完成原型搭建与真机测试。高校团队在 Franka机器人 平台上完成抓取、物体排序、简易装配等开放场景实验,验证了 Astra 把自然语言指令转化为物理动作的能力;同时也在实验中发现,这套快速部署方案的短板集中在毫米级接触类精细操作,模型缺少触觉反馈,面对紧密插接、柔性物体操作场景稳定性不足。这种 "大模型高层认知 + Franka 底层力控" 的组合,正在重塑高校机器人实验范式,让更多团队不用投入海量算力做策略预训练,就可以快速验证物理世界的 AI 智能体思路。

三、GPT6 Astra 本身不做端到端具身策略,它在具身智能体系里的角色

GPT6 Astra 本质是通用前沿多模态基座模型,不是端到端机器人具身策略模型,不会直接输出电机扭矩、实时关节控制指令,底层精密接触控制依旧交给传统机器人控制模块与专用视觉动作网络。

在 OpenAI 整套具身体系中,Astra 承担物理世界的 "任务大脑":接收自然语言指令与流式多传感器输入,完成场景理解、长时序多步任务规划、异常判断,还能把单张静态图像重建为可交互仿真 3D 场景,输出笛卡尔空间下的末端执行器目标位姿。它的核心目标,是解决传统机器人最大痛点 ------ 开放环境下自然语言指令理解、陌生场景泛化、长时序任务拆解,把数字 Agent 的自主操作能力迁移到物理 Agent。简单来说,Astra 不负责精细接触控制,它的价值是降低物理机器人的 "认知门槛",为机械臂、移动机器人等硬件注入通用物理世界常识。

四、GPT6 Astra 已展示的具身能力与第三方测评

第三方 RoboCurve 基于 Inspect Robots 框架完成真机测评,在方块入碗这类宽松抓取放置任务上,Astra 成功率达到 95%,大幅优于 Claude Fable 5.1(40%),同时 token 消耗下降 6.2 倍,单次任务成本显著降低。

效率大幅提升:

RoboCurve 的基准测试对比显示,GPT-6 Astra 在"碗中方块"任务中以低于 1 美元的单次运行成本实现了 95% 的完成率,在成本和任务速度方面均显著超越了 Claude Fable 5.1 和 Fable 5。在 RoboCurve 进行的物理硬件试验中,OpenAI 的GPT-6 Astra在 20 次运行中完成了 19 次(95%)的积木放置任务,而 Claude Fable 5.1 的完成率为 40%。Astra 将代币生成量减少了 6.2 倍,并将运行成本降低至0.94 美元,这得益于 OpenAI 在其旗舰版本中展示的架构和空间推理方面的进步。

毫米级操作瓶颈:

但到毫米级精密插入任务(拼图插槽),Astra 成功率仅 10%,和竞品卡在同一技术瓶颈:模型可以识别目标位置、将工件移动到目标上方,但缺少接触力反馈和接触动力学感知,无法完成最后的装配插入动作。公开 Demo 还验证了 Astra 单图重建可交互 3D 仿真场景、无人机导航与人跟随能力;在 Drone-Bench 基准上,Astra 在全部 5 个子任务上超越人机基线。综合测评结论:Astra 强在高层空间推理、非接触类操作;短板同样突出,模型学习的是视觉与动作范式,缺少真实物理接触、摩擦、形变的体感经验,遇到遮挡、材质变化、微小姿态扰动容易产生物理幻觉。精细力控、高确定性安全控制,无法单独依靠 Astra 完成,必须搭配底层机器人控制栈。

OpenAI 准备构建内部人形机器人硬件之际,研究结果出炉,这既突显了 LLM 驱动的运动学的快速发展,也凸显了物理接触动力学的持续挑战。

OpenAI 发布GPT-6 Astra时,该实验室重点介绍了其在抽象推理、软件工程和计算机应用方面的突破性进展。其中一项基准测试记录是其在 BenchCAD 测试中取得了 95.9% 的几何重叠率------BenchCAD 是一项直接从多视图渲染生成 3D CAD 结构的测试。

现在,独立的硬件测试表明,Astra 的空间推理能力可以直接转化为物理操作能力。

根据公益机构RoboCurve发布的评估数据,GPT-6 Astra在控制实体机械臂的任务中展现出显著的空间效率提升。在开源的Inspect Robots框架下,Astra 在双 I2RT YAM 机械臂上进行了测试,其抓取放置任务的成功率高达 95%,远远领先于 Anthropic 的 Claude Fable 5.1(40%)和 Claude Fable 5(5%)。

然而,同样的试验也暴露了零样本物理推理的局限性:一旦任务要求亚毫米级的插入公差,Astra 就遇到了与之前基础模型所遇到的完全相同的障碍。

总之GPT-6 Astra 在机器人控制任务中得分 95%,比 Fable 5.1 的 40% 大幅提升,同时输出令牌数量减少了 6.2 倍,成本降低了 2.3 倍。

更快的决策,更少的token

RoboCurve 在两种物理设置下测试了这些模型:将一个红色方块放入碗中,以及抓住圆形木制拼图块的中心旋钮,将其放入匹配的凹槽中。

在两个基准测试中,这些模型都作为 Inspect Robots 下的高级代理策略。在每个回合中,模型接收三个摄像头画面(一个俯视视角和两个腕部视角)以及本体感受状态数据,并输出 6 自由度末端执行器目标姿态,这些姿态被传递给逆运动学(IK) 求解器。

在碗放置任务中,Astra 在 20 次试验中成功放置了 19 次积木。除了可靠性的显著提升外,Astra 的推理开销也明显降低:

token效率: Astra 每次试验平均需要 2,100 个输出token------与 Fable 5.1 的 12,900 个token相比减少了 6.2 倍,与 Fable 5 的 19,200 个代币相比减少了 89%。

执行延迟:在 Astra 下平均运行时间为 2.5 分钟,低于 Fable 5.1 的 6.8 分钟和 Fable 5 的 8.2 分钟。

API 成本:按标准定价(每百万个输入代币 10 美元,每百万个输出代币 50 美元),Astra 每次完成运行的平均成本为 0.94 美元,而 Fable 5.1 的成本为 2.12 美元。

这种简洁性与 OpenAI 在知识工作领域的研究结果相呼应,Astra 完成任务所需的输出标记数量比 Claude Opus 5 少约 65%。应用于物理运动学领域,这种效率可以转化为快速的决策循环。RoboCurve 的 Jay Chooi 指出,如果目前的性能曲线保持不变,LLM 有望在两到三年内实现对机械臂的实时控制。

毫米瓶颈

在精准解谜任务中,情况发生了彻底改变。该任务要求机械臂抓住一个细长的旋钮,并将一个圆形部件压入一个狭窄的圆形凹槽中。Astra 在 20 次尝试中仅完成了 2 次(10%),与 Claude Fable 5.1 的完成率相同,均为 10%,而 Fable 5 则完全失败(0/20)。

根据 RoboCurve 的人工评分五阶段规则(从 0 阶段表示没有接近到 4 阶段表示成功放置),Astra 始终能达到 3 阶段,将拼图块直接放在凹槽上方,然后犹豫或错位进行最后的按压。

尽管 Astra 完成尝试的速度更快(3.4 分钟,而 Fable 5.1 为 5.9 分钟),成本也更低(1.36 美元,而 Fable 5.1 为 2.18 美元),但未能完成插入反映了整个行业面临的挑战。

人形机器人为何尚未应用于工厂,数字模型在无损矢量空间中运行,而物理操作则会在每一次动作中累积微小的物理误差。如果没有高频触觉反馈和顺应性,模型很难在接触的最后几毫米内修正这些微小的偏差。

利用 Inspect Robots 进行标准化审核

该基准测试也标志着Inspect Robots(RoboCurve 的开源物理 AI 评估框架)的一个重要里程碑。

该库以英国人工智能安全研究所的 Inspect AI 平台为蓝本,提供了一个统一的接口,用于测试基础策略,包括前沿的 LLM、代码即策略代理以及服务型视觉-语言-动作(VLA) 模型,测试平台可以是 Isaac Lab 等模拟器,也可以是 Franka、Unitree 和 AgiBot 等公司的物理设备。该系统会记录同步的多摄像头视频流、关节轨迹和工具调用记录,并通过 Rerun 生成可重放的可视化效果。

RoboCurve 在其初始试用版中指出了一些方法论上的局限性:

硬件分配:虽然所有谜题试验都在相同的物理设置(rig-4)上运行,但由于 rig-3(Fable 运行的场地)正在维护,碗评估将 Astra 放在 rig-1 上。

非交错运行: Astra 的试验是在 Anthropic 试验两天后进行的,而不是按顺序交错进行的。

操作员评分:人类观察员根据哪个模型处于活动状态来对阶段进展进行评分,这可能导致评分偏差。

提示缓存:计算采用标准列表价格;OpenAI 自动缓存了 Astra 约 20% 的输入提示,这意味着 Astra 的实际运营费用可能低于报告的费用。

五、GPT6 Astra 具身方向运动规划,人形机器人?OPENAI剑指什么?

闭合物理回路

Astra作为一款功能强大的运动学规划器,其出现对OpenAI而言意义非凡。首席执行官Sam Altman近日证实,公司"肯定"会打造自己的人形机器人,从而终结了此前数月围绕其内部机器人部门成立的种种猜测。

OpenAI的硬件雄心已经扰乱了其之前的联盟关系。像Figure AI这样的初创公司终止了联合开发合作,转而追求自主研发的基础架构,例如Helix,并借助Index等众包真实世界数据平台来支持其研发成果。与此同时,像NVIDIA这样的硬件巨头继续主导着开源流程,最近斥资129亿美元收购了Hugging Face,旨在连接物理模拟和开放模型中心。

RoboCurve 的评估表明,为什么前沿人工智能开发者渴望涉足物理机器人领域。当标准推理模型能够开箱即用地处理 95% 的粗略操作时,构建物理实体就成了顺理成章的下一个前沿领域。

然而,在基础模型能够感知触觉阻力并适应动态接触之前,最后一毫米仍将是实验台上最难解决的问题。

PNP机器人具身智能,开发基于GPT6解决方案,利用GPT-6 Astra 具身接口层:搭建任务解析与状态反馈中间件,将自然语言指令转为 PNP 平台可执行的任务图(Task Graph),支持 "识别→规划→执行→反馈→修正" 循环。

文章参考:

https://robocurve.github.io/stationerybench/

https://note.com/npaka/n/n8aeb9b3e2714?hl=en

相关推荐
一木 之林1 小时前
手搓家庭服务器:二手装机、Docker部署、端口映射与frp内网穿透
服务器·人工智能·git·编辑器
咖啡星人k1 小时前
MCP 协议入门:从 tools/list 到一次真实调用
人工智能·mcp·ai工程
YOLO数据集集合1 小时前
光伏板红外-可见光配对缺陷检测数据集 | 光伏板缺陷 红外可见光配准 多模态检测 无人机巡检 目标检测 YOLO格式9094期
人工智能·目标检测·计算机视觉·目标跟踪·红外·无人机视角·太阳能板
知几蜗牛1 小时前
Agent会互相调用了,但A2A 1.0真正解决的是协作边界
人工智能
掘金泥石流1 小时前
从 Palantir AI FDE 到我们的实践:企业交付如何变成产品?
人工智能·架构·agent
HIT_Weston1 小时前
227、【AI】【模型部署】基座模型研究:RoPE 旋转位置编码
人工智能·模型部署
小李不想当小白1 小时前
PCB结构与组成(PCB设计入门学习笔记)
经验分享·笔记·单片机·嵌入式硬件·学习·pcb工艺·pcb
那年窗外下的雪.1 小时前
第 02 天:Linux 权限、inode、目录项与链接
学习·http
Omics Pro1 小时前
1个月2轮融资!长寿虚拟细胞
数据库·人工智能·算法·机器学习·自然语言处理