机器人的“最后一毫米”: 新加坡南洋理工大学Facet-0如何教会基础模型“感受”自己的动作?

导语:在制造业的真实场景中,机器人能否完成一次完美的精密装配,不取决于它"认不认识零件",而取决于它在接触瞬间"有没有感受到那一点点偏差"。在0.1毫米的间隙里,视觉上几乎一样的两条轨迹,一条能让零件平滑入位,另一条则可能造成卡滞甚至损坏。新加坡南洋理工大学PINE Lab研发的Facet-0,用"预测接触后果"的思路,让精密装配的平均成功率从最强基线的15%冲到了82%。这不是简单的"加了力传感器",而是一次从感知到决策的范式重构。

一、当"会做"不再是标准:精密装配的终极考验

机器人正在变得越来越"通用"。

从抓取日常物品到根据语言指令完成多步骤操作,视觉-语言-动作(VLA)模型让机器人摆脱了"一项任务、一套程序"的开发方式。但当机器人真正走向制造现场,问题变了:会不会做已经不是唯一标准;能不能在毫米甚至亚毫米级接触中稳定完成,并在出错后自己恢复,才决定它能否进入生产环节。

精密装配恰恰是这道门槛最集中的地方。

现代VLA策略在标准操作任务上表现优异,但一旦进入0.1-0.3毫米的间隙,成功率就会断崖式下跌。零件可能已经"看起来对齐",却在最后几毫米发生偏斜、卡滞。视觉擅长提供语义和几何信息,却看不见被夹具、机械臂遮挡的微小偏差------一个零件位置几乎没有变化,但力持续增大,这本身就是视觉无法提供的失败信号。

传统方法部分有效:力感知策略提供了交互信号,柔顺控制器稳定了接触,真实机器人强化学习从部署经验中改善行为。但问题在于:接触通常被当作"已经发生的事"或"底层反馈",而非"未来动作的预期后果"。

Facet-0的核心问题由此而生:一个通用机器人,能否在保持语义广度的同时,预判、评估并适应自己动作的物理后果?

二、核心洞察:让模型"预判自己将产生什么样的力"

Facet-0的答案是:把接触当作动作的预测后果,并让这个后果在部署中获得价值。

具体来说,基于PaliGemma视觉-语言骨干和流匹配动作专家,Facet-0将多视角图像、任务指令与运动学状态以及腕部力/力矩的因果历史对齐,形成一种语义-接触表征。从这个表征出发,策略联合生成两个东西:

  • 一个笛卡尔动作分块(7维:末端位姿+夹爪开合),这是实际执行的;

  • 一个未来腕部力/力矩预测(6维),这是模型预期这些动作会引发的接触后果。

只有动作被执行,力/力矩预测不参与控制------它是一个"预测性后果",用来让模型在动作之前就"知道"这个动作会产生什么样的接触。

这种设计的精妙之处在于:它改变了模型的学习目标。以前模型只学"怎么动",现在它必须学会"这样动会产生什么样的力"。要把力预测准,模型就必须理解接触物理------就像一个人要预测自己拧螺丝的力度,就必须理解螺丝的松紧一样。

为什么"力矩预测"比"力矩输入"更有价值?

这是Facet-0最具启发性的设计选择之一。

当力矩只作为输入时,它提供给策略的是"过去动作已经产生的接触记录"------这个信息来得太晚,无法影响导致它的那个动作。在行为克隆损失中,也没有任何机制奖励模型去关注那六个力维度。

把力矩变成解码目标,就彻底改变了学习信号。只有当模型真正表征了它提议动作的接触后果时,力矩预测误差才会下降。力矩变量因此成为一种在执行前就可用的预测性变量,而非执行后的被动记录。

消融实验证实:π0.5+F(把力矩作为额外输入token)和TA-VLA(力矩感知VLA)的成功率都在9-16%区间,与π0.5几乎一样。"提供接触反馈"和"利用部署价值区分动作后果"是两件完全不同的事。仅把力矩作为输入,并不能让模型学会"什么样的动作会导致什么样的接触"------它只是多了一个观测,却没有改变学习的本质。

三、ManuFacet-1K:1000小时的"力同步"数据基础

要让模型学会这种能力,首先需要数据本身包含"接触是如何发生的"。

ManuFacet-1K包含约1000小时的力同步示范与闭环运行数据,覆盖UR7e、xArm、Franka三种机械臂、两类服务器机箱,以及GPU、RAM、CPU、Disk四类安装任务。

数据集的特色在于围绕精密操作进行统一设计:每一帧同步记录多视角图像、语言指令、末端位姿、夹爪状态和六维力/力矩,并按照接近、对齐、插入、压合、就位、紧固、撤离等技能阶段进行标注。

更关键的是,数据并没有只保留"正确答案"。真实部署中的失败、人工接管以及随后发生的恢复过程也被保留下来。

这意味着,模型学习的不再只是"成功轨迹长什么样",而是:一个动作如何产生接触,一次正常接触和一次卡滞有什么区别,以及错误发生后,怎样重新回到可完成任务的状态。

四、从"预测接触"到"评估接触":部署经验教会模型什么是有价值的

仅仅预测力还不够。可靠部署还需要区分有用的交互和代价高昂的交互。

Facet-0引入了一个动作-力矩评论家(Action-Wrench Critic),在部署回放中学习评估每个"动作+预测力矩"组合的价值。核心创新在于:这个价值分布能区分几何进度相同但接触结果不同的动作------一条干净的插入和一次同样深度的卡滞,在几何上可能无法区分,但在力/力矩维度上截然不同。

论文中的图4生动地展示了这一点:仅基于视觉和状态的价值估计对精细接触不敏感,而基于动作-力矩提案的价值估计则能清晰地将干净的GPU插入与一个视觉上难以区分的失败模式分开。

接触选择性信用分配:让关键帧不再被淹没

真正决定装配成败的接触片段,在整条轨迹里往往只占很小一部分。如果把所有时刻放在一起排序,大量自由空间运动会淹没那些短暂但关键的接触动作。

Facet-0的解决方案是:分别在接触阶段和自由空间阶段进行信用筛选,把学习重点重新拉回对齐、插入、卡滞和恢复这些真正决定结果的瞬间。那些稀缺的接触恢复帧------在演示中很少出现但极其宝贵------就不会被淹没在海量的自由空间帧中。

与AWR的对比:学习长尾,而非平均

与AWR(优势加权行为克隆)的对比很有说服力:在相同部署数据上,Facet-0将成功率从20%提升到65%,人类干预率从47%降到24%,失败恢复率从44%提升到81%。

价值引导学习从部署分布的长尾中学习,而不是从平均轨迹中学习。AWR用标量优势重新加权部署语料,而Facet-0的接触选择性信用在交互状态内排序样本------因此能保留高信用的接触恢复帧,这些帧在演示中极其稀缺。

五、当零件变了:有界局部自适应让迁移便宜10倍

真实制造中,零件规格会变,材料会变,卡扣特性会变。如果每次换零件都要重新训练整个模型,成本无法接受。

Facet-0给出了一个轻量解决方案:冻结已学到的语义-接触表征,只训练一个"有界局部动作器"。这个动作器接收压缩后的FACET令牌、运动学状态、当前力/力矩和冻结策略的参考动作,输出一个绝对笛卡尔目标(而非残差)。关键设计是:

有界输出:通过tanh压缩到任务特定的动作范围内,保证任何输出都在安全边界内------这比残差方法更安全,因为残差的安全性依赖于"修正幅度小",而小修正恰恰无法修复失败模式。

辅助力矩预测头保持非指令性:力矩头继续被监督用于预测下一步的接触后果,但不进入批评家的动作空间,也不是力控指令。它只负责维持"动作-接触耦合"的一致性。

只更新6.6%的参数:在只给10个演示和3小时训练的情况下,面对一个全新的内存模块(质量、刚度、卡扣特性都不同),Facet-0达到45%成功率,而最强基线只有5%。

这个设计体现了一个深刻的洞察:语言语义、场景理解和粗粒度任务进度可以跨零件复用,而局部质量、刚度、卡扣响应和接触几何才决定了哪条修正轨迹能成功。冻结上游表征,正是为了防止微小的在线数据集重写那些可复用的知识。

六、实验结果:82% vs 15%的碾压式差距

研究团队在5个亚毫米级计算机组装任务上进行了系统验证:RAM安装、CPU安装、磁盘安装、GPU安装,以及一个纯接触的LEVER锁扣任务。这些任务包含23个子目标,其中14个是接触关键型。

主要结果令人印象深刻:

  • Facet-0平均成功率82%,最强基线(π0.5+RECAP风格)仅15%,5.5倍提升;

  • 放置精度0.5毫米,指令延迟50毫秒(π0.5为150毫秒);

  • 峰值离轴力仅为无接触方案的0.2倍,接触力控制质量极佳。

消融实验揭示了每个组件的贡献:语义-接触对齐16%,价值引导强化学习38%,加上局部自适应达到82%。没有任何一个组件是多余的。

在17个报告的子目标中,13个接触关键型的未加权平均成功率为87%,而端到端均值为82%------差距来自链式完成准则:每一个环节都必须成功。这也解释了为什么在一个限制接触状态的局部修正,能在装配完成率上产生大得多的增益。

七、从"看见并执行"到"接触、判断、修正和积累经验"

Facet-0的贡献不止于82%的数字。它重新定义了机器人基础模型在精密操作中的学习对象:不只是"做什么",而是"这样做会产生什么物理后果"。

在制造业的真实世界里,真正难以规模化的,从来不是做出一次漂亮的Demo。

生产现场更关心的是:第100次遇到微小偏差时,它是否仍能完成;出现一个训练集中没有覆盖的卡滞时,它能否自己退回来;更换零件、工装乃至机器人平台之后,需要付出多少重新调试的成本。

Facet-0给出的并不是所有精密制造问题的最终答案,而是一条值得关注的技术路径:以力同步的高精度数据建立接触基础,以多模态模型连接语义与物理交互,再通过真实部署中的强化学习,把失败从"异常"变成能够被持续利用的训练信号。

这背后对应着机器人基础模型从通用操作走向工业落地时的一次能力迁移------从"看见并执行",进一步走向"接触、判断、修正和积累经验"。

结语:最后一毫米的物理真相

对于制造机器人而言,视觉和语言模型可以教它"知道",但只有接触预测和价值学习,才能教它"做到"。

82%的成功率不是一个终点,而是一个起点。它证明了一条路是通的:让机器人在动作之前预判接触后果,在执行之中感受接触状态,在失败之后利用接触经验改进自己。这条路,比生成逼真的视频难得多,也比任何单一模型的胜利都重要得多。

因为在精密制造中,决定机器人能否真正进入生产线的,可能并不是它在理想情况下成功了多少次,而是当那一次不可避免的失败到来时,它能不能自己把任务继续做下去。

论文信息

标题:Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation

作者:Haoyuan Deng, Haichao Liu, Wenkai Guo 等

机构:新加坡南洋理工大学 PINE Lab

项目页:https://pine-lab-ntu.github.io/facet-0/

论文链接:https://arxiv.org/abs/2609.01596

相关推荐
今天AI了吗1 小时前
DeepSeek Harness 深度解析:从评测架构到实战落地
java·网络·数据库·人工智能·架构·java-ee
腾视科技-AI1 小时前
腾视科技AIBOX双版本重磅发布!本地安全与全球适配,解锁视频智能新可能
大数据·人工智能·科技·安全·大模型·腾视科技·ai算力盒
a1117761 小时前
基于 ROS 2 的 Franka Panda 机械臂视觉分拣系统
人工智能·开源
逍遥~1422 小时前
什么是工业级算力?算盘科技的核心能力解析
网络·人工智能·科技
硅谷秋水2 小时前
JEPA-WAM:基于联合嵌入世界建模的VLA策略学习
人工智能·机器学习·计算机视觉·语言模型·机器人
新知图书2 小时前
第10章 云上MCP服务的部署与使用
人工智能·智能体
姜穆澜2 小时前
OneID 从 0 到 1 完整生产案例(五)
大数据·notepad++
程序员无隅2 小时前
从 Vibe Coding 到可控交付:用 Spec-Driven Development 驾驭 AI 编程 Agent
人工智能·驱动开发
VIP_CQCRE2 小时前
用 Ace Data Cloud 快速接入 Google Veo:让 AI 视频生成从 Demo 走向生产
人工智能·api·ai视频·acedatacloud·veo