灵巧手VLA真机均分71%,北大DeCAL用接触门控接入触觉

(1)《三年面试五年模拟》AIGC / LLM / AI Agent 算法工程师与开发工程师求职面试秘籍,独家资源见 WeThinkIn/AIGC-Interview-Book,欢迎 Star!

(2)AIGC / LLM / AI Agent 算法岗与开发岗求职面试内推学习社群 ,涵盖 AIGC、LLM 大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI 等方向的最新面试干货与核心知识,欢迎加入(https://t.zsxq.com/33pJ0)!


论文标题:DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

论文作者:北京大学与北京智源人工智能研究院

发表时间:2026年9月8日


本文要点

(1)DeCAL是北京大学和北京智源2026年9月放出的灵巧手VLA,权重从InternVLA-A1-3B初始化,GitHub标明CoRL 2026官方实现。

(2)六项真机任务平均成功率71% ,进度成功率83.4% ,摘要写比最强基线高出15个百分点以上。

(3)做法上两点最值得看,接触感知门控按接触状态放进触觉,以及视触潜在协同想象去联合预测未来画面和力。

(4)短板在拧灯泡,成功率只有40%,进度成功率还低于InternVLA-A1,也没有大规模视触预训练。

(5)文末附官方README的训练和离线评估命令。


北京大学和北京智源人工智能研究院在2026年9月8日把DeCAL挂上arXiv。GitHub仓库标明这是CoRL 2026的官方实现。

我把HTML版报告、项目页和README对着读了一遍。触觉进VLA现在还少见,这篇想讲一件具体的事。为什么触觉不能像多视角图像那样直接拼进模型。

六项接触密集的真机任务上,平均成功率71% ,进度成功率83.4%。摘要写比最强基线高出15个百分点以上。

手把镜头挡住以后

灵巧操作和夹爪抓取不一样。五指手一合上,手腕相机经常只能看见手背。接触力、打滑、物体变形,画面里都没有。

现有VLA多半靠视觉和语言。报告点名π0.5、GR00T N1.6、InternVLA-A1这一路,语义理解强,接触动力学没有单独建模。

DeCAL的实验平台是一对6自由度UR5机械臂,加上两只22自由度的SharpaWave五指手,动作空间一共56 维。视觉来自头顶和两个腕部的Intel RealSense D435,每个指尖有一块320乘240的视觉触觉传感器,整机30Hz采集。

指尖给出三种信号。原始触觉图、6维力与力矩、形变深度图。进策略的主要是形变图,力用来做潜变量监督。

触觉为什么不能直接拼进去

接触是一阵一阵的。手在空中够物体的时候,指尖传感器几乎没信息,硬灌进去会搅视觉注意力。报告把这种做法叫做同质多模态融合。

他们做了一个对照。InternVLA-A1触觉版把十指形变图和6维力,用额外的交叉注意力接到理解专家上,别的设置和原版一样。

吸管移液成功率从35%掉到20%。擦白板从50%掉到45%,拧灯泡从30%掉到25%。装配零件从15%升到45%,拧瓶盖从5%升到25%。有的任务升,有的任务掉。

DeCAL的办法是接触感知门控。共享ResNet从各指形变图抽出局部token和一个全局token。局部token当交叉注意力的K和V,全局token算出一个门控值σ,接触强的时候把触觉残差放大,没接触时压下去。

图6画了装配和拧瓶盖两个测试回合。没碰到物体时σ一直很低,碰到以后才抬起来。消融里去掉门控,装配成功率从65%掉到50%,拧瓶盖从80%掉到70%。

三个专家和一次共想象

骨架是混合Transformer,三个专家单向传信息。理解专家看懂当前场景,生成专家想象下一步的视触状态,动作专家再出动作。后面的专家能看见前面的token,反向看过去不行。

理解专家底座是Qwen3-VL,生成专家和动作专家用Qwen3。权重从InternVLA-A1-3B初始化。论文没有另报DeCAL自己的总参数量。

生成专家干的是世界模型那类活,预测接触之后画面和力会怎么变。视频生成模型像素级往前滚,跟不上高频控制。他们把多视角图像用Cosmos VAE编成潜变量,32乘32的特征再压到4乘4,平行解码。

触觉潜变量从当前6维力编进去,训练时还要重建未来的原始图、形变图和力。推理时重建解码器关掉,只把潜变量传给动作专家。论文把这套训练叫视触潜在协同想象。

装配任务上,未来画面和InternVLA-A1比,Cosmos特征相似度0.946对0.913,LPIPS 0.222对0.243。这项评测在验证集上做,不是真机执行。

手臂和手指动力学差得很远。动作专家用分解式流匹配,两套噪声分别初始化,再在同一个Transformer里一起去噪。去掉这一项,装配成功率只剩25%,拧瓶盖只剩35%。两项生成也全关的话,分别掉到20%和30%。

成绩单,挑几个要紧的数

六项任务各采100条遥操作示范,默认评20次。示范用Manus Metagloves Pro加VIVE定位器,手套重定向到灵巧手,定位器控臂。遥操作没有把指尖力反馈给操作员,报告自己把这件事写成了限制。

对照表里DeCAL的71和83.4来自摘要。其余模型的六项SR均分由表1逐项平均后四舍五入。进度成功率基线没有给总表,写未报告。

模型 路线 擦花瓶 擦白板 装配零件 拧瓶盖 吸管移液 拧灯泡 六项SR均分 六项PSR均分
DeCAL 门控视触VLA 100 80 65 80 60 40 71 83.4
DECO 触觉专家策略 90 60 35 70 45 35 56 未报告
ViTacFormer 触觉专家策略 80 45 15 65 55 25 48 未报告
InternVLA-A1触觉版 触觉直接接入VLM 75 45 45 25 20 25 39 未报告
InternVLA-A1 视觉VLA 65 50 15 5 35 30 33 未报告
GR00T N1.6 视觉VLA 30 50 30 10 60 10 32 未报告

拧灯泡是全场最难看的一项。DeCAL成功率40%,进度成功率48.8%,进度这项还低于InternVLA-A1的53.8%。吸管移液上GR00T N1.6也到了60%,和DeCAL持平。论文说多数任务进度成功率最高,没有说每一项都第一。

分布外只在拧瓶盖上测了四种扰动。表6第三阶段成功率,未见背景60%,杂乱场景70%,未见光照65%,未见物体75%。未见物体比最强基线高出30个百分点,报告把原因归于视触动力学,外观变了还能靠接触模式迁移。

项目页把未见光照写成70%,和论文表6的65%对不上,本文以表6为准。

本地跑一遍

下面命令抄自官方README,环境要求写的是Python3.10和CUDA12.8。

bash 复制代码
conda create -y -n decal python=3.10
conda activate decal
pip install --upgrade pip
conda install -c conda-forge ffmpeg=7.1.1 svt-av1 -y
pip install torch==2.7.1 torchvision==0.22.1 torchaudio==2.7.1 \
  --index-url https://download.pytorch.org/whl/cu128
pip install -e .

初始化权重下载的是InternRobotics/InternVLA-A1-3B,指定commit 19e953fb2d4b49d2b181c0b55981f2bd3444d546。装完还要把仓库里的transformers_replace拷进当前环境的transformers目录,README写明改过DeCAL和π0相关模块。

微调入口是launch/decal_finetune.sh。离线评估入口如下,checkpoint路径要自己填。

bash 复制代码
python src/lerobot/datasets/v30/convert_unitree_json_to_lerobot_v30.py \
  --raw_dir "${RAW_DATA_DIR}" \
  --repo_id "${DATASET_REPO_ID}" \
  --robot_type Ur5_Sharpa \
  --custom_task_description "${LANGUAGE_INSTRUCTION}"

python util_scripts/compute_norm_stats_single.py \
  --action_mode abs \
  --chunk_size 50 \
  --repo_id "${DATASET_REPO_ID}"

bash launch/decal_finetune.sh "${DATASET_REPO_ID}" abs true

python tests/policies/decal/deploy_policy_tactile.py \
  --checkpoint /path/to/checkpoint

转换脚本目前只实现了Ur5_Sharpa这一种特征表,别的本体直接NotImplementedError。数据在ModelScope的Aureleo/DeCAL_dataset,转成了Open-X-Tactile统一格式。

我没有找到单独托管的DeCAL权重链接。附录写单张RTX 4090上每个动作块平均0.27 秒,动作块长度50。历史观测15帧,按30Hz大约0.5秒。这些数字来自报告,不是我实测。

几点看法

接触门控是我觉得最该被别的视触VLA抄的一块。InternVLA-A1触觉版已经说明,触觉接进去不等于变强,吸管这种任务会被噪声拖下水。门控把此刻有没有接触从特征里拆成一个开关,比再堆一个融合层实在。

潜在协同想象和世界模型是同一类监督。差别在推理时不把像素解码出来,只把未来视触潜变量送给动作专家。装配验证集上的Cosmos相似度和LPIPS比InternVLA-A1好一截,可这仍然是离线帧预测,不能直接等同于真机里的规划能力。

短板也很硬。拧灯泡成功率40% ,进度成功率48.8%,还输给纯视觉的InternVLA-A1。附录失败案例写了两类,双手交接对不齐,以及头部相机视野不够,物体出画以后状态估计会漂。

遥操作没有力反馈,示范质量本身就有上限。再加上没有大规模视触预训练,这套方法目前还是在六项自采任务上微调出来的专家策略。换到别的平台或传感器上,报告没有给出证据。


参考链接

相关推荐
LONGZETECH1 小时前
深入拆解无人机组装四大技术难关:焊接、接线、调参、转向校验
大数据·人工智能·系统架构·无人机
九章云极DataCanvas1 小时前
让大模型少做重复计算 九章云极开源分布式KV Cache系统DingoCache
人工智能·开源·token·九章智算云
gravity_w1 小时前
【CS336】Lecture 2 PyTorch 与资源核算(Resource Accounting)
人工智能·深度学习·语言模型·llm·nlp·flops·cs336
GlobalInfo1 小时前
机器人力控采集芯片全球市场深度分析:人形机器人分布式力感知下的24位Delta-Sigma与多通道同步博弈
大数据·人工智能·ai·机器人
智购科技自动贩卖机1 小时前
自动售货机嵌入式系统时钟同步与时间管理实战:从RTC校准到断网时间保持的工程实践
大数据·linux·数据库·人工智能·yolo
俊哥V1 小时前
每日 AI 研究简报 · 2026-09-17
人工智能·ai
第六种自由1 小时前
给 AI Agent 一台云主机:基于 noVNC 的云桌面架构与最小实现
人工智能·架构·云计算
XM_jhxx1 小时前
机械图纸质检标注的自动化趋势:AI识图如何重塑气泡标注与报表编制流程
人工智能
AI深栈1 小时前
第 12 章 · AI智能体的结构化输出与流式响应
java·人工智能