上海启智研究院、卡内基梅隆大学等机构合作推出的 RL-100 强化学习框架相关研究正式刊发于机器人领域顶刊《Science Robotics》。
该研究不同于多数仅在仿真环境验证算法的工作,聚焦现实无规整场景下的机械操作难题,希望让机器人的作业稳定度、执行速度与抗干扰能力达到乃至优于熟练操作人员。
为充分佐证这套框架的实际性能,研究人员没有只做少量演示测试,而是在Franka Research3实体机器人平台完成九百组独立测试,全程全部顺利完成任务,以此直观证明该系统具备高可靠的实操能力。
folding_execution_time
RL-100框架下FR3任务体系设计
基于FR3硬件特性,研究搭建多模态真实机器人操作任务集,覆盖刚性物体、流体、可变形物体三类典型交互场景。
单臂FR3典型任务
-
倾倒作业:抓取盛装颗粒物料的容器,通过手腕可控倾斜完成物料转移,核心考验 FR3 手腕力矩控制与稳定抓取;
-
动态拧螺丝:FR3 搭载灵巧手完成螺母旋取,作业中需要持续调整接触力,应对螺纹摩擦变化;
-
橙子榨取:分取果、取出残渣两步子任务,在狭小空间内完成柔性水果的抓取与推送。

图1真实机器人各类任务实拍图,展示本研究整套任务集的多样类型。
双臂协同FR3任务 软毛巾折叠、纸盒折叠两类任务采用双FR3协同架构,依靠双臂同步位姿调整处理布料、纸板等半刚性变形物体,长时序折叠流程对 FR3 双臂时空协同控制提出要求。
任务数据采集方式FR3演示数据通过Apple Vision Pro手部追踪远程遥操作采集,操作人员手部动作映射至FR3关节空间,同步记录点云视觉、机械本体本体感知、动作三元组数据,为扩散视觉运动策略提供训练素材。
FR3配套RL-100训练流程与优化方案
RL-100设计三段式训练流程,全部实验均以FR3实体机械臂作为执行载体,分阶段优化机器人操作策略。
模仿学习预训练阶段
使用FR3遥操作采集的人类演示数据初始化扩散策略,学习基础抓取、转运、旋转等原生操作行为,规避纯强化学习初期硬件无效探索带来的碰撞风险,降低FR3设备损耗。
迭代离线强化学习
在预训练模型基础上,复用FR3自主执行产生的轨迹扩充数据集,采用统一裁剪PPO优化目标微调扩散降噪流程,不占用大量实体FR3机时,仅通过历史轨迹完成策略迭代。
在线强化学习微调
使用少量FR3实体交互数据消除剩余故障模式,针对FR3作业时抓取滑落、轨迹碰撞、姿态错位等高频问题进行修正,大幅提升任务完成稳定性。
推理延迟优化
为适配FR3高频控制需求,引入一致性模型蒸馏,将多步扩散采样压缩为单步推理,缩短FR3控制回路延迟,提升动态场景下实时调整能力。

图2RL-100 与各类对比算法、人工操作者在实际部署场景下的任务完成效率对比。
FR3平台实验结果与应用价值
多维度实验指标
在FR3执行的全部评估任务中,经过RL-100完整流程训练的策略,相比仅依靠模仿学习的基线,任务成功率显著提升;面对表面摩擦变更、物体外形未知、人为外力干扰等分布偏移场景,FR3仍可维持稳定操作表现。在商场公开场景中,搭载训练策略的FR3榨取机器人可连续数小时稳定服务访客,未出现硬件故障或操作失效。
结语:
该项目中,Franka机械臂与LeapHand、Robotiq灵巧手的组合,以及xArm与Franka构成的双臂协同系统,均在各项任务中发挥了重要作用。上述硬件设备均可通过BFT机器人平台采购,欢迎咨询,我们将为您提供详细的产品信息、技术参数及配套服务方案。
原项目链接: