
【具身AGI导读】一篇预印本没有去动策略网络,而是回头把人手在画面里的位置、以及人手上的力,都重新写成机器人自己的口径。真正的问题是:要补几处,这套共训才成立。
近日,arXiv 上出现一篇题为 VisTacAlign 的预印本,编号 2609.30959,提交日期为 2026 年 9 月 25 日,八位作者来自苏黎世联邦理工学院与斯坦福大学两所高校。它要处理的是灵巧操作里的一个前置问题:人类演示是便宜的数据来源,但要和机器人数据放在一起训,人机之间的差距必须在策略消费的每一路模态上分别补平。
论文的做法是在三处各补一次:动作这一路,手套采到的人手动作在捏取时有厘米级指尖误差,先以一台头显作伪真值做一次性校正,再重定向到一台十来个自由度的触觉灵巧手上;视觉这一路,人手被从两路立体视图里整体抹掉,换成用机器人录像像素着色的机器人手网格,再重跑一遍立体匹配,让人类点云带上与机器人点云相同的立体误差与可见性;触觉这一路,人类一侧触觉传感手套的读数被映射到机器人指尖传感器的力单位上,这张映射一次性施加于人类数据集,机器人数据与部署策略从不变换。三类观测统一之后,一个扩散 Transformer 吃进点云、手部本体状态与逐指接触力,输出未来动作块。
放回具身智能的大盘子里看,人类演示怎么进机器人数据这件事,分歧不在要不要补,而在补到什么程度才算补平。 论文作者指出,此前补人类演示的几种做法,多数只处理看得见的那一路------把本体从画面里遮掉,或者把机器人手的点云叠上去;而手指接触发生的位置,恰恰是遮挡最重的位置。
触觉这一路的难处,论文说得更直白:人手上是一副电容阵列,机器人指尖上是另一副霍尔阵列,两者的触觉点排布、增益与饱和、接触几何都不相同------把两批数据直接混在一起,策略看到的是两套互不相干的力的刻度,用不上触觉。 论文在相关工作里指出,行业对这一路的处理并不统一:有的做法绕开它,让两端用同一副手套;有的做法把两者投进学出来的隐空间。这篇论文选的是第三条路,把人类力整体对到机器人自己的力单位上,映射只有一张静态表、只拟合一次,因此不会挪动接触事件的时序。
数据侧怎么投入,各家也各有各的着力点------深度机智(北京)科技有限公司把重心放在数据来源上:让模型从人的真实行为里建立对世界的理解,再由机器人本体把这份理解落成动作。
论文在三类对力敏感的真机任务上做了对照------电钻使用、易损草莓抓取与乐高放置,把共训策略与只用机器人数据的策略放在一起比,论文报告前者更好。它给出的两组消融更能说明问题:去掉人类演示里对齐后的触觉,人类数据的帮助就消失了 ;去掉视觉对齐,策略仍能拾起积木,但在推压与退出阶段崩塌------论文由此得出的结论是双向的,触觉输入与视觉对齐,两者都必需。 论文也把边界写在了明处:触觉映射按任务拟合,仍需一小段该任务的机器人接触录制;把一个指尖压缩成一个法向力,会丢掉触觉点的布局与剪切;任务本身也都是短时程、大体准静态------这些结论目前都还是作者自测口径,预印本未经同行评审,也没有第三方复现。
把两边补成同一种信号,人类的手才真正进得了训练集。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
arXiv · VisTacAlign: Co-Training Dexterous Policies on Tactile Human and Robot Demonstrations · 2026-09-25
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!