
给VLA加触觉后,就越加越差了。
------回答触觉进入模型后的四个问题
目录
[01 触觉是有用,问题是模型未必知道该怎么用](#01 触觉是有用,问题是模型未必知道该怎么用)
[02 触觉不是"另一台相机",它和视觉连工作节奏都不一样](#02 触觉不是“另一台相机”,它和视觉连工作节奏都不一样)
[03 第一个问题:什么时候应该听触觉的?](#03 第一个问题:什么时候应该听触觉的?)
[04 第二个问题:模型一定要重新学一门"触觉语言"吗?](#04 第二个问题:模型一定要重新学一门“触觉语言”吗?)
[05 第三个问题:谁真的需要触觉?](#05 第三个问题:谁真的需要触觉?)
[06 最后一个问题:触觉究竟应该有多大的话语权?](#06 最后一个问题:触觉究竟应该有多大的话语权?)
[07 从"多模态融合"到"感知分工"](#07 从“多模态融合”到“感知分工”)
[08 那么,为什么给机器人加上触觉,反而可能更差?](#08 那么,为什么给机器人加上触觉,反而可能更差?)
具身智能很"吵"。
翻开任何一个议程,排在最前面的必然是世界模型、VLA 、灵巧手、数据采集。
同时,质疑泡沫的声音越来越大,几乎每个热门方向都被业内人喷过一遍。
所有人都在同一条没铺完的路上跑,摸索期的特征就是没有权威。
既然谁都没法证明自己对,公开质疑就成了这套系统唯一的纠错机制。
再加上,钱到位的速度快过技术兑现的速度,中间那段真空只能靠话语(吹)填。
牛皮一膨胀,反噬就来了。
一边拿钱,一边骂。在这个行业里,不是什么新鲜事,是常态。

吵归吵,还能被骂,说明至少都还在牌桌上。
但「触觉」不在。
一年前,"触觉"还称为是"最后一块拼图",如今几乎退成了一个零部件位了。你甚至很难在最近的行业论坛议题里找到单独属于它的一节。
它不再拥有自己的名字。
但两年前,触觉被寄予的期望可不是这样的。
不过好在,话题度虽然在退,但钱可一分没少投进去。(触觉在2024-2025年经历了一轮密集的融资造势。)
原因是触觉开始进入的不只是机器人的手,而是机器人的「模型」。
这源于堪称业内最害人的一句话共识:模态越多,模型越强。
所以,此前触觉基座模型、视触融合VLA、灵巧手触觉赋能的赛道热度空前,所有人都在扎堆给机器人"加装触觉"。
传感器配齐、信号打通、token 接入,一套流程走完,看似完成了技术升级,但真机跑起来的结果是,更烂了。
粗暴给模型堆叠触觉模态,不仅没有增效,反而会污染原有感知体系。这种无效升级,不如不加。
最典型的就是今年六月,以李飞飞为代表的三十四个作者联名发布的一篇名为 T-Rex 的工作。他们在 π0.5 这个行业基座上,将触觉 token 简单拼接进原有模型的 Transformer 输入。
然后,平均任务成功率从 17% 反干到了 6%。
而在同一套机器人硬件、同一组评测任务与评估标准下,换一种接法就提高到了65%。
本质上现在的问题,不是如何让机器人「拥有」触觉认知。
而是,如何让模型真正「用好」触觉?
01 触觉是有用,问题是模型未必知道该怎么用
先把最容易混淆的两件事拆开。
第一件事是:机器人需不需要触觉?
答案几乎没有悬念。越是精细的操作,越需要。
视觉擅长告诉机器人"东西在哪里"、"大概是什么"、"下一步往哪走"。但真正接触以后,很多决定成败的信息反而会从画面里消失。
插头是不是轻微卡住了,夹爪是不是快滑了,擦拭时压力够不够,瓶盖到底拧紧没有。
这些状态在 RGB 图像里可能几乎没有变化,可对机器人来说,动作结果已经完全不同。
于是过去两年里,把触觉、力觉接进 VLA,逐渐成了一条很自然的路线。
一些工作已经证明,在接触密集型任务里,如果机器人能获得力、形变、滑移等反馈,确实可能做得更稳。
但第二件事是:只要把触觉加进模型,模型就会变强吗?
这里的答案就没那么"简单"了。
今天的 VLA 并不是一块等待添加新传感器的空白海绵。
它已经在大量视觉、语言和机器人数据上学会了一套相对稳定的表示方式。模型知道什么样的图像意味着"杯子在左边",什么样的语言意味着"把它拿起来",也逐渐建立了某种"看到什么就怎么动"的对应关系。
触觉却完全不是同一种数据:
有的传感器输出形变图,有的输出 marker 位移,有的是六维力和力矩,还有的是密集的 taxel 数值。更关键的是,这些信号在主流 VLA 的大规模预训练阶段几乎没有出现过。
于是,一个看起来很基础的问题出现了:
模型真的会因为多看到一种数据,就自然知道怎么使用它吗?
- CVPR 2026 的 AT-VLA 是这个方向里一个很有代表性的研究。
在拉拉链、盖章、擦花瓶和拧瓶盖等真实机器人任务上做了一组非常直接的实验。
完全不用触觉时,原始 VLA 的平均成功率是 22%。
但是,
如果把 6D 力信号持续输入模型,成功率反而降到 13%;
换成二维 marker 位移,只剩 5%;
直接把视觉触觉图像作为 token 输入时,甚至只有 2%。
也就是说,在这组实验里,三种不同形式的触觉,直接加进去以后都比不加「更差」。

▲图1 | 这四类任务的共同难点并不是"看不见目标",而是进入最后的接触阶段后,画面变化可能很小,物理状态却在快速变化。
当然,这并不能推出:"给 VLA 加触觉普遍有害"。不同模型、传感器和任务的结果都可能不同。
但这个实验把一个过去很容易被忽略的问题摊到了桌面上:
"触觉有信息"与"模型会使用这些信息",从来不是一回事。
而要理解为什么会出现这种差距,还得先看清视觉 和触觉本身到底有什么不同。
02 触觉不是"另一台相机",它和视觉连工作节奏都不一样
视觉和触觉都叫"感知",很容易让人下意识地把它们当成两种并列的信息源。
但放到机器人身上,它们承担的工作其实非常不同。
视觉是一种很"提前"的感知。
机械臂还没碰到杯子时,相机已经能判断杯子在哪里、把手朝哪边、周围有没有障碍物。它看到的是一个相对完整的场景,主要处理的是目标、位置、语义和全局关系。
触觉几乎相反。
它通常是局部的,只来自手指、夹爪或某个接触面附近;很多时候,只有真正碰上以后才开始有意义。在大量自由空间运动阶段,它甚至什么都不需要说。
两者需要的反应速度也不一样。
理解一句指令、识别一个物体、判断下一步往哪走,并不需要每几毫秒重新算一遍。
但如果一个插头已经顶在插孔边缘,或者手里夹着的物体突然开始滑动,机器人如果再等几百毫秒重新"思考一次",可能已经晚了。
所以如果把两类信息的角色说得简单一点:
- 视觉更多是在回答:"我现在要做什么,目标在哪里?"
- 触觉经常是在回答:"刚才这一下对不对,现在要不要立刻修一点?"
一旦把这层差异说清楚,最近一批工作里那些看起来各不相同的设计,就开始连成一条线了。
它们并不是单纯在发明更多"触觉模型",而是在依次回答四个问题:
"
什么时候应该听触觉的?
触觉应该以什么形式进入模型?
模型里的谁需要听?
以及,触觉究竟应该有多大的话语权?
03 第一个问题:什么时候应该听触觉的?
如果触觉真正有价值的时刻主要发生在接触之后,那么最直接的想法就是:
没碰到的时候,先别让它一直'说话'。
这也是近来一类代表性方法的核心。
模型仍然依靠原来的视觉和语言去理解任务、找到目标、靠近物体;只有检测到接触真正发生以后,触觉通道才被打开,开始影响后续动作。
这看起来似乎只是多了一个"开关",但它改变的其实是触觉在整个系统里的身份:到了真正需要它的时候,它才介入。
更进一步,既然视觉和触觉需要的反应速度不同,那它们也未必要走完全相同的计算路径。
一种典型的做法,是把视觉语言理解和触觉反应拆成快慢两条流:
- 慢流继续负责看场景、理解任务;
- 快流则不断读取最新的触觉反馈,在接触过程中快速修正动作。
在前面提到的代表性研究 AT-VLA 里,这条触觉反应路径可以在约 0.04 秒内完成一次闭环更新。

▲图2 | 这张框架图对应全文的第一个问题:什么时候应该听触觉?上方的 Slow Stream 继续处理视觉、语言和机器人状态,负责较低频的场景理解与动作意图;下方的 Fast Stream 持续编码触觉,只有当 Tactile Gate 判断它真正有用时,才把触觉送进 Action Expert。这里的关键并不是"多接一根传感器",而是把两类感知按职责和频率拆开:视觉负责把手送到正确的位置,触觉负责接触发生后的快速纠偏。
这和人手的工作方式其实很接近。
拧瓶盖时,我们不会每感觉到一次轻微滑动,就重新思考"这是一只瓶子,我的目标是打开它"。
高层目标根本没有变,真正需要快速变化的,只是手指应该再用多少力、往哪个方向多拧一点。
同样是 6D 力信号,直接持续注入模型时,平均成功率只有 13%;而当触觉只在合适阶段介入,并配合更快的反应路径后,平均成功率提高到了 50%。
所以第一层答案已经很清楚:触觉什么时候进来,可能比"有没有触觉"本身更重要。
但这只解决了"时间"上的问题。
即便我们知道什么时候需要触觉,模型仍然要面对第二个麻烦:
一种在预训练阶段从没见过的新模态,到底应该以什么形式进来?
04 第二个问题:模型一定要重新学一门"触觉语言"吗?
今天的大多数 VLA,几乎都生长在视觉和语言的预训练世界里。
这意味着,当我们增加触觉时,常见做法往往是再加一个触觉编码器,把新特征和原来的视觉、语言 token 放在一起。
从架构上看,这很"正统"。
但从数据上看,它有一个现实问题:视觉语言模型见过海量图片和文本,触觉编码器却只能依赖规模小得多、而且高度依赖具体传感器的机器人数据来学习。
于是另一类研究开始反过来想:既然 VLA 已经很会看图,为什么一定要逼它重新学一套触觉表示?
- TAP-VLA 是这种思路里很直观的一篇代表性工作。
它没有额外增加一套复杂的触觉输入接口,而是先从 GelSight 里提取接触面的剪切方向,再把这些受力变化画成箭头,直接叠到普通 RGB 图像上。
对模型来说,它还是在"看图"。
只不过这张图现在多了一些明确的提示:哪一侧正在受力、力往哪里变化、左右手指的剪切是否对称。

▲图3 | 这张图对应第二个问题:触觉应该以什么形式进入模型?左侧并没有把原始触觉图像直接塞进 VLA,而是先根据触觉表面的 marker 位移估计剪切方向,再把这些方向画成箭头叠加到正常 RGB 画面中。这样一来,模型输入仍然是它最熟悉的"图像",但画面里被显式补上了原本看不见的接触信息。这个设计想解决的并不是触觉本身够不够丰富,而是如何尽量复用已有视觉预训练能力,避免用少量下游数据重新学一门陌生的"触觉语言"。
这个方法可能听起来有一点"笨"。
但它恰好避开了"用少量数据重新学习一种新模态"的难题。
在四类真实机器人任务中,这种做法一共完成了 120 次测试里的 94 次,整体成功率约为 78%;而纯视觉微调、直接输入原始触觉图像、额外训练触觉编码器等几种方案,总体成功率都没有超过 50%。
这里真正值得讨论的,并不是"'画箭头'比加 encoder 更聪明"。
而是一个更一般的问题:
对于预训练大模型来说,一种信息"以什么形式"进入模型,可能和这项信息"本身有多重要"一样关键。
可即使我们把触觉"翻译"成模型容易理解的形式,问题仍然没有结束。
因为还有第三层:是不是模型里的所有部分,都需要知道这些触觉信息呢?
05 第三个问题:谁真的需要触觉?
这个问题到了 World Action Model 上会变得尤其明显。
世界动作模型不只是输出动作,它还试图预测"接下来世界会变成什么样"。
那么一个自然的想法是:既然接触任务需要触觉,不如把未来触觉也一起预测,让模型同时想象"接下来会看到什么"和"接下来会摸到什么"。
逻辑上没有问题。
但近期 Tactile-WAM 的研究发现,当局部、稀疏、事件驱动的触觉 token 无约束地进入一个以视觉动态为核心的世界模型后,反而可能干扰原本的视觉预测。
研究把这种现象称为:Tactile Pollution,触觉污染。
问题并不是触觉没有价值,而是"动作需要触觉"和"整个视觉世界模型都需要触觉"根本不是同一回事。
于是,解决办法反而不是让两种模态融合得更彻底,而是开始主动限制信息流。
- 负责预测未来画面的部分不读取触觉,尽量保护原本的视觉动态;
- 负责生成机器人动作的部分仍然可以使用触觉,因为它确实需要知道有没有滑、有没有卡、接触方向发生了什么变化。
换句话说:触觉可以告诉手该怎么改,但没必要让它重新解释整个世界。

▲图4 | 这张图对应第三个问题:模型里的谁真正需要看到触觉?左侧模型仍然联合预测未来视频、未来触觉和动作,但右侧的 TAAM 并没有让所有 token 无限制互相访问。Video Query 被阻止读取 Tactile Key,而 Action Query 仍然可以在接触变化时利用触觉信息。背后的逻辑是:局部接触信号确实应该影响"手接下来怎么动",却未必需要改写整个视觉世界的预测。这里体现的不是更彻底的多模态融合,而是一种更克制的信息路由。
在最新版实验里,这种视觉路径隔离让模型的视觉轨迹更接近原始 RGB-only 模型;完整方法则把 ManiFeel 上的平均成功率从 15.6% 提高到 32.7%,并在五类真实机器人任务上取得 49.2% 的成功率。
这里比具体数字更值得注意的是设计思想的变化。
在很多通用多模态模型里,让所有 token 充分交流通常被视为一种能力。
到了机器人控制里,这件事却不再那么理所当然。
因为信息越多,不一定意味着每个模块都应该知道得越多。
而当研究者开始主动限制"谁能看见触觉"之后,下一个问题自然就出现了:
即使动作模块需要触觉,触觉就一定应该拥有和视觉相同的决策权吗?
06 最后一个问题:触觉究竟应该有多大的话语权?
这是最近另一类思路更进一步的地方:它们开始把触觉从"动作生成的一部分",改成"动作执行的调节器"。
- ViTaR 是这里一个很有代表性的例子。
它直接冻结原本的 VLA。
视觉、语言和机器人状态继续照常生成一个基础动作;触觉不去推翻这个动作,也不重新规划整个轨迹,而只负责判断:当前这个动作,在眼下的接触状态里,要不要小幅修一下?
比如 VLA 说"继续往下压"。
触觉可以回答:"方向大体没错,但现在太用力了,少一点。"
或者:"再往左挪一点。"

▲图5 | 这张图对应第四个问题:触觉究竟应该拥有多大的决策权?左侧被冻结的 VLA 仍然根据语言、RGB 和机器人状态生成 Reference Action;触觉特征与一组有限的 Residual Options 随后进入 Effect-Guided Modeling,判断哪一种微调更适合当前接触状态,再由 Residual Action Modulation 选择并缩放这次修正。换句话说,触觉不再重新决定"机器人要做什么",而是负责判断"原来的动作还要不要往左一点、轻一点、稳一点"。它从共同决策者变成了执行阶段的调节器。
这样一来,触觉的身份又发生了一次变化。
它不再是和视觉平起平坐的"决策者",更像一个执行阶段的监督员。
高层方向没问题,就别乱改;只有接触状态明显不对时,再有限度地介入。
在七类接触任务上,这类方法的平均成功率达到 61.3%,相比冻结的基础 VLA 高出 30.6 个百分点,并且在真实机器人实验中也保持了明显优势。
这类方法当然有自己的边界。
如果基础 VLA 连高层动作方向都搞错了,小幅 residual correction 不可能把一个完全错误的决策救回来。
但也正因为如此,它把一个很重要的问题说得更清楚了:
一个模态重不重要,不看它有没有同等的决策权,而看它能不能在关键环节补上别人补不了的信息。
07 从"多模态融合"到"感知分工"
走到这里,前面看起来分散的几种方法,其实已经可以放回到同一条逻辑线上了。
简单总结一下,它们分别在回答"触觉进入机器人基础模型之后"的四个问题:
第一个问题是什么时候听。
不是从任务开始到结束一直听,而可能只在接触真正发生以后,触觉才开始有价值。
第二个问题是以什么形式进来。
如果一种模态在预训练中几乎不存在,那么直接新增 token 未必是唯一办法。先把它转成模型熟悉的表示,有时反而更容易利用原本的预训练能力。
第三个问题是谁应该听。
动作控制需要局部接触信息,并不代表负责全局视觉预测和语义理解的所有模块都需要共享这份信息。
第四个问题则是听到什么程度。
触觉可以参与完整决策,也可以只做局部修正。它是否应该拥有和视觉一样的"话语权",本身就是一个需要设计的问题。

▲图6 | 这张总览图把全文讨论的"角色变化"压缩在了一起。A 展示了更直接的做法:把触觉编码后一起送进 VLA;B 则保留冻结的视觉语言动作模型,只让触觉参与后续的 Residual Action 修正。右侧 C 展示了不同接触密集型任务,D 则给出这种受限纠偏思路在仿真和真实机器人上的整体结果。它想表达的并不是"触觉应该更弱",而是触觉越重要,越需要被放到真正擅长的位置:不去抢视觉和语言的全局决策工作,而是在接触发生后对执行进行更精确的物理校正。
把这四件事放在一起,一个更大的变化就浮了出来:
机器人多模态学习正在从"把更多信息放进同一个模型",转向"给不同信息安排不同的角色"。
这和过去常见的"多模态融合"直觉其实不太一样。
我们很容易把多模态理解成一个加法题:视觉 + 语言 + 触觉 + 力觉 + 声音
但,信息越来越多,机器人自然越来越聪明吗?
真实的物理系统可能更像一个分工问题。
- 视觉和语言拥有海量预训练数据,适合处理目标、语义和全局空间关系;
- 触觉的数据少得多,却离真实物理交互最近。它最擅长的也许不是告诉机器人"这是什么",而是在真正接触之后告诉它:刚才那一下到底对不对。
所以,多模态机器人未必应该追求完全对称。
08 那么,为什么给机器人加上触觉,反而可能更差?
当下的触觉赛道,充斥着大量伪创新。
很多团队看似完成了视触融合的技术迭代,配齐了传感器、做完了数据集、打通了模型输入,却始终跳不出"加触觉就降级"的怪圈。本质上,都是在做没有用的工程堆砌,毕竟上面催进度,下面要交付。
但,这样会搞坏这个行业的名声。
因为这并不是「触觉没用」导致的结果。
恰恰相反,机器人越走向精细操作,越离不开触觉。
真正的问题是:
"触觉有用"和"触觉 token 越多越好",从来不是一回事。
今天的大多数 VLA,都生长在一个视觉和语言占绝对主导的预训练世界里。而触觉是局部的、稀疏的、传感器高度异构的,还经常要求远高于大模型推理频率的实时响应。
如果只是把它当成"第三种输入"塞进去,模型不仅要在很少的数据里重新学一套表示,还可能让这套新表示反过来干扰原本已经训练好的能力。
所以,触觉进入 VLA 之后,真正困难的问题已经不再只是"怎么融合"。
而是更细,也更像机器人本身的问题:
什么时候应该听手指?
手指应该怎么说,谁来听?
以及,当眼睛和手指意见不同时,到底谁说了算?
这些问题现在都还没有标准答案。
现有研究覆盖的任务仍然有限,不同工作使用的 GelSight、Xense、力传感器等硬件也很难直接比较。
和视觉相比,触觉数据的规模依然小得多。
如果未来真的出现足够大、足够多样的触觉预训练数据,今天这种"新模态会干扰预训练能力"的问题,也可能再次被改写。

和还在躬身入局的朋友,聊聊行业
历史上每一次硬件 + 软件交叉的新兴技术浪潮,都经历过同款质疑。
泡沫不是赛道的原罪,分不清 "技术瓶颈" 和 "商业骗局",才是最大的陷阱。
2011 到 2013 年,整个光伏行业被定性为"产能过剩、全靠补贴"。当时骂它的话,比今天骂具身智能的难听得多。后来一堆公司倒了,但工艺留下来了。今天中国光伏在全球是什么地位,不用多说。
不是所有新兴方向都能熬过质疑。2021 年火爆的元宇宙便是一例:宏大预言铺天盖地,却缺少刚性需求与落地闭环,热潮转瞬消散。
说英雄,谁是英雄,还得由结果评说。
现在做研究的人怎么办?
站在质疑外面跟着骂,站在叙事里面帮着吹。这两个位置都不产出真东西。
判断标准很简单:假设三年后你这个问题被彻底证伪了,积累的下来东西还剩什么?
对近三年触觉研究变化感兴趣的读者朋友,可以阅读这篇文章:++《"foundation model" 热潮终于轮到触觉了?》++
Ref
1. AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models, CVPR 2026
2. TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models
3. Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention
4. ViTaR: Visuo-Tactile Residual Adaptation for Foundation VLA Manipulation
5. ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation, NeurIPS 2025.
6. Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
7. VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback, IEEE RA-L, 2025.