Point-and-Grasp:ZED视觉+Kinova双臂落地验证,助力MR共享控制如何构建数据闭环

一、行业痛点:机器人的 "物理经验缺口"

ChatGPT 可以流畅读写、大模型能看懂图文,但通用机器人拿起桌上水杯却频频失败。

根本原因在于:大模型生长在符号世界,依托海量文本、图像完成学习;而机器人身处真实物理空间,极度缺少人类空间判断、抓取避障的多模态示范数据,也就是「物理经验断层」。

同时,当前两条路线均存在明显短板:传统编程机器人只能固定场景复用;纯自主抓取算法在杂乱、薄件场景容错率极低。

论文视频:MR双臂遥操作 + Point-and-Grasp

针对这一双重痛点,西班牙瓦拉多利德大学联合 CARTIF 发布《Intuitive bimanual teleoperation in mixed reality with assisted grasp autonomy》MR 双臂遥操作框架,搭建人机共享控制体系,同时解决两大核心需求:

  1. 操作侧 :降低普通人遥操作门槛,零基础人员也能远程操控双臂机器人;
  2. 算法侧 :构建标准化示教数据链路,每次操控自动生成 VLA、模仿学习可用的完整操作数据,打通「人类意图 - 3D 感知 - 自主抓取 - 真机执行」完整 Physical AI 闭环。

二、系统核心架构:三层虚实协同链路

整套 MR 共享控制框架总图

整套平台由交互层、感知层、机器人控制层双向联动,依靠 TCP/IP 实现 Unity 与 ROS 实时数据互通:

1、交互层(Meta Quest 3 MR 头显)

捕捉人手六维运动,映射机械臂末端速度;提供三种可视化反馈,实测双目立体视觉综合效果最优
2D/点云/立体视觉三组视觉模态对比图

  • 2D 视频:画面直观,但缺少深度,易误判距离;
  • 点云重建:具备三维几何,但噪点多、轮廓破碎;
  • 双目立体视觉:保留真实纹理 + 原生深度感知,任务耗时减少 40%,操作负荷最低,可用性评分 87.25。

2、感知层(ZED Mini RGB-D 相机)

同步输出 RGB 图像与深度图,完成场景稠密点云重建,配合 SAM 模型实现目标物体实例分割,为抓取规划提供完整三维几何信息。

3、执行层(Kinova Gen3 双臂协作机器人)

ROS+MoveIt 负责运动解算、轨迹规划;支持双臂物体传递、精细堆叠、取放等复合操作,适配各类平行夹爪。

三、核心创新:Point-and-Grasp 一键自主抓取管线

本论文最大亮点是几何驱动的辅助抓取模式,操作员仅需在 MR 视野射线点选物体,系统全自动完成抓取全流程:
Point-and-Grasp 抓取全流程示意图

  1. 射线交点 3D 反投影,生成分割种子点;
  2. SAM 分割目标,提取独立物体点云 + 全局场景点云(用于碰撞检测);
  3. 围绕物体几何采样 525 组抓取候选姿态,自动旋转、后退规避碰撞;
  4. 六维可解释几何准则加权打分,优先匹配物体主轴、抓取深度、夹持均衡度;
  5. 坐标转换至机器人基坐标系,机械臂自主执行无碰撞抓取。
算法真机实测对比(40 组杂乱桌面场景)

|-----------------------|-------------|--------------|------------------|
| 抓取方案 | 成功率 | 算力需求 | 核心优势 |
| 本文 Point-and-Grasp | 92.5% | 仅 CPU | 无域偏移,薄小件稳定性强 |
| GPD | 87.5% | 可选 GPU | 成熟采样,但窄间隙易失效 |
| Contact-GraspNet/HGGD | 70%~80% | 强制 GPU | 遮挡场景缺少可行 3D 抓取位姿 |

启用辅助抓取后,四类标准操作任务(取放 / 旋转 / 堆叠 / 双臂传递)完成时长平均缩短 30%,抓取尝试次数、主观操作负荷显著下降。
四大标准化实操任务实拍

四、为什么这套系统是 Physical AI 优质 基础设施

1. 搭建「人类经验→机器人数据→AI 模型」闭环
  • 旧方案:固定代码驱动机器人,仅适配单一标准化场景,无泛化数据产出;
  • 新方案:MR 示教同步录制 RGB-D、点云、关节轨迹、抓取决策全量数据,直接用于模仿学习、VLA 视觉动作模型训练;
  • 未来方向:海量人类示范数据训练具身基础模型,机器人自主理解语言指令完成复杂操作。
2. 标准化硬件平台三位一体组合
  • **ZED Mini双目3D相机:**机器人三维感知 "眼睛",近距高精度 RGB-D 输出,低延迟支撑 MR 虚实融合与抓取几何计算;
  • **Kinova Gen3双臂机器人:**高精度执行本体,7 轴冗余自由度,原生适配 ROS,安全轻量化,支撑双臂协同精细操作;
  • **MR 遥操作系统:**人类经验输入入口,低成本批量生成高质量示教数据。

三者组合适配高校实验室、具身 AI 创业公司算法迭代、工业机器人预研场景。

五、现存局限与未来研发方向

论文客观标注系统边界,也是行业通用突破点:

  1. 仅单 RGB-D 视角,物体遮挡 / 背面无几何信息,少数姿态抓取失效;
  2. 纯视觉规划,未接入力觉、触觉反馈,无法自适应柔性物体、防滑抓取;
  3. 仅抓取环节自动化,放置、工具连续操作仍依赖人工引导。

后续优化路线:多视角主动补全三维模型、集成六维力 / 指尖触觉、接入视觉语言大模型实现全流程任务自主规划。

结尾总结

未来机器人赛道的核心壁垒不再是硬件参数,而是高质量人类操作数据集储备。

MR 人机共享控制平衡了人类高层意图与机器底层自主运算,依托双目 3D 视觉 + 双臂协作机器人,构建低成本、高稳定的 Physical AI 数据工厂,是人形、协作机器人研发的新一代虚实融合操作底座。

参考文献

论文原文:https://www.sciencedirect.com/science/article/pii/S0262885626002179

抓取开源代码:https://github.com/MiguelGarciaUVa/PointAndGrasp

欢迎关注 "欣佰特科技 " ,持续为大家带来 "具身智能领域 "前沿技术及应用!详情可邮件咨询++++sales@cnbestec.com++++

相关推荐
cnbestec2 个月前
工业视觉开发实战:ZED 双目 + 单目相机组合如何解决料箱拣选与高速上下料难题
工业相机·工业自动化·视觉感知·zed相机·stereolabs·zed双目3d相机
cnbestec4 个月前
体积缩减40%:Stereolabs 推出 ZED X Nano 腕部微型双目3D相机
zed相机·stereolabs·zed双目3d相机
cnbestec5 个月前
SEW-Mimic:基于Kinova机械臂的3kHz闭式几何重定向求解器技术解析
kinova gen3·kinova
cnbestec1 年前
Stereolabs ZED系列与ZED X立体相机系列对比:如何根据项目需求选择?
zed相机·机器人视觉相机·zed立体相机·zed双目3d相机
BFT白芙堂1 年前
涂胶协作机器人解决方案 | Kinova Link 6 Cobot在涂胶工业的方案应用与价值
人工智能·协作机器人·机器人解决方案·kinova·kinovalink6·bft机器人·工业涂胶
cnbestec1 年前
手术机器人行业新趋势:Kinova多机械臂协同系统如何突破复杂场景适应性瓶颈?
机械臂·手术机器人·kinova
cnbestec1 年前
在微创手术中使用Kinova轻型机械臂进行多视图图像采集和3D重建
gen2·kinova·机器人机械臂·轻型机械臂·kinova机械臂·gen3