【arXiv preprint 2026】JEPA-VLA:视频预测嵌入,为 VLA 补上缺失的视觉知识|从具身智能世界模型视角

摘要

本文解读 arXiv preprint 2026 论文《JEPA-VLA: Video Predictive Embedding is Needed for VLA Models 》(清华大学 THUML × 华为诺亚方舟实验室,通讯作者龙明盛)。该论文提出JEPA-VLA ,通过把冻结的视频预测嵌入 V-JEPA2 接入现有视觉语言动作模型(VLA),同时补上环境理解策略先验 两种关键视觉知识,其特别之处在于只加一个线性投影或几个门控交叉注意力层、无需任何世界模型训练数据。实验表明LIBERO 平均成功率 +7.4 个百分点、RoboTwin2.0 干净场景 +18.7 个百分点、真实机械臂 80% 成功率(1/5 数据即达 60%),为具身智能的视觉表示选择提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) JEPA-VLA: Video Predictive Embedding is Needed for VLA Models
标题(中文) 视频预测嵌入:为 VLA 补上缺失的视觉知识
作者 Shangchen Miao · Ningya Feng · Jialong Wu · Ye Lin · Xu He · Dong Li · Mingsheng Long
机构 清华大学软件学院 THUML · 华为诺亚方舟实验室
会议 arXiv preprint 2026
arXiv https://arxiv.org/abs/2602.11832
项目网站 暂无公开项目页(并发工作 VLA-JEPA 已开源:https://vla-jepa.github.io/)

背景与动机:VLA 的视觉表示到底缺了什么?

当前基于预训练 VLM 的 VLA 模型(RT-2、OpenVLA、RDT 等)虽然指令跟随能力突飞猛进,仍普遍面临低样本效率有限泛化 两大痛点------即便在数百万条轨迹上训练也只覆盖几十个任务。本文把矛头指向一个被长期忽视的组件:预训练视觉表示。作者论证,机器人操作需要两种视觉知识:

  1. 环境理解:精确捕捉任务相关物体属性(如目标坐标),同时灵活丢弃任务无关因素(如光照、背景纹理);
  2. 策略先验:内化"成功执行时环境如何演化"的预期知识,引导动作学习走向有利的未来状态。

为了严格验证"现有表示是否提供这两种知识",作者设计了三类探针实验(冻结编码器 + 轻量 ViT 回归头,8:1:1 划分 + 早停,只隔离"表示"这一个变量):

  • 任务相关状态回归 (LIBERO-10):回归机械臂与目标物体状态,V-JEPA2 的 MSE 最低 → Finding 1:环境理解更精确;
  • 任务无关状态回归 (LIBERO-plus):回归光照/背景扰动,V-JEPA2 误差最高 → Finding 2:编码扰动信息最少,泛化更稳;
  • 策略先验预测 (LIBERO-10):预测 10 步后的状态残差,V-JEPA2 依然最优 → Finding 3:内化时间规律,诱导策略先验。

图 1:三类常见视觉表示的对比------(a) 图像自监督(DINO 家族):精确但保留任务无关细节;(b) 图文对比(CLIP/SigLIP 家族):强调指令对齐语义、缺低层任务信息;(c) 视频预测(V-JEPA2):状态中心表示 + 时间规律(策略先验)。

图 2:探针实验------任务相关状态回归/预测上 V-JEPA2 一致最低(左、中),任务无关(光照/背景)回归误差最高(右),同时证明环境理解与策略先验。

形式上,操作轨迹建模为部分可观测马尔可夫决策过程(POMDP)\\langle \\mathcal{S}, \\mathcal{O}, \\phi, \\mathcal{A}, p \\rangle:机器人只通过观测函数 \\phi 看到底层状态 s_t 的投影 o_t,因此有效操作依赖学习内部状态估计器 q_\\theta(s_t \\mid o_{1:t}) 与策略对齐的演化模型 p_\\theta(s_{t+1} \\mid s_t, a_t\^{\*})------这正是"视频生成模型作为策略"(UniPi、Vidar 等)一脉相承的视角,但本文不需要生成任何像素。

从历史脉络看,JEPA 家族走过了完整的技术迁移:2022 年 LeCun 提出联合嵌入预测架构(层次化规划 + 高维表示自监督预测)→ 2023 年 I-JEPA(图像)→ 2024 年 V-JEPA(视频)→ 2025 年 V-JEPA2(互联网规模视频预训练)→ 2026 年本文把 V-JEPA2 系统落地到 VLA 机器人,同期工作 VLA-JEPA 独立验证同一方向。

研究主线:从问题到结论

图 6:研究主线(Mermaid 流程图)------从 VLA 低样本效率问题出发,经两类视觉知识缺失的动机与探针诊断,到 JEPA-VLA 两种融合方法与 5 基准一致提升的结论。

基准/方法设计:JEPA-VLA 的两种融合策略

方法哲学是"极简 + 即插即用":V-JEPA2 编码器全程冻结 (ViT 骨干,输入最近 T 帧视频片段输出状态中心表示 h_t),动作模型的条件化为 a_t \\sim \\pi_\\theta(a_t \\mid l, o_{1:t}, s_t, h_t)------语言指令、多视角观测、本体感知与预测嵌入共同决定动作。关键设计在于按 VLA 的预训练程度选择融合方式

  • Early Fusion(早期拼接) :V-JEPA2 表示经线性投影对齐维度后,作为额外输入嵌入直接拼接进 token 序列。轻量有效,适合没有大规模机器人预训练的 VLA(策略基本从零学习,共享 VLM 先验);
  • Gated Fusion(门控交叉注意力) :受 Flamingo 启发,原 VLA token 作查询、V-JEPA2 表示作键值,门控机制让模型选择性吸收 预测信息------直接拼接会偏移输入分布、干扰大规模机器人预训练学到的表示。配合每 8 层 decoder 稀疏插入 一个门控层(平衡性能/显存/延迟)与低学习率保护(融合层 1\\times10\^{-5}\\sim1\\times10\^{-4},远低于主干 5\\times10\^{-4})。

图 3:JEPA-VLA 融合架构------(a) 早期拼接(Early Fusion);(b) 门控交叉注意力(Gated Fusion),保留预训练先验。

分类全景:三种视觉表示范式

图 7:VLA 视觉表示分类全景(Mermaid 流程图)------图像自监督(DINO)、图文对比(CLIP/SigLIP)与视频预测(V-JEPA2)各自的优缺点。

方法细节:探针实验与训练协议

探针实验设置 (附录 A):所有模型共用同一套轻量 ViT 头(16 注意力头、12 层、前馈维度 3072、dropout 0.1),训练/验证/测试按 8:1:1 划分,验证损失 10 轮不降即早停。任务相关回归使用最近两帧表示 + CLS token 输出、标签归一化(零均值单位方差);任务无关回归只用首帧(扰动轨迹内恒定),光照参数直接回归、背景用 MAE 重建;策略先验预测预测 10 步后的状态残差且不归一化,以保留残差语义。

训练协议 :基础 VLA 使用 Chameleon 骨干 + 256 动作 token(WorldVLA 架构参照),仅用 1/10 LIBERO 数据训练 40 epochs;主流 VLA 复现 OpenVLA-OFT 配置(L1 回归、动作分块、并行解码)训练 150k steps,批大小 16(LIBERO)与 8(RoboTwin2.0)。

实验设计与结果

评测覆盖 5 个场景:LIBERO(4 套件 ×10 任务 ×50 演示)、LIBERO-plus(7 维扰动:相机/语言/光照/背景/噪声/布局)、RoboTwin2.0(双臂 50 任务、731 物体实例、域随机化)、真实世界 Piper 单臂拾放(100 条人工轨迹)与 CortexBench(10 任务 vs VC-1)。

图 4:评测基准------(a) LIBERO、(b) LIBERO-plus、(c) RoboTwin、(d) 真实世界任务、(e) CortexBench。

基础 VLA 设置(1/10 数据)

LIBERO 套件 基线 JEPA-VLA Δ
Spatial 58.2 69.2 +11.0
Object 74.8 78.2 +3.4
Goal 87.8 87.8 0.0
Long 25.8 41.0 +15.2
平均 61.65 69.05 +7.40

LIBERO-plus 上本文 25.6% 平均成功率,在仅用 1/10 数据、无世界模型训练数据的条件下超过官方 WorldVLA(25.0%);其中语言扰动 43.9→54.4(+10.5)、光照 26.3→38.0(+11.7)、背景 10.1→23.9(+13.8)、布局 26.9→32.8(+5.9)。

主流 VLA 设置(OpenVLA-OFT)

LIBERO 套件 基线 JEPA-VLA Δ
Spatial 84.4 97.2 +12.8
Object 91.8 98.0 +6.2
Goal 95.2 95.6 +0.4
Long 89.8 94.8 +5.0
平均 90.30 96.40 +6.10

平均 96.40% 甚至超过官方 OpenVLA-OFT 报告的 95.35%。RoboTwin2.0 上干净场景平均 54.8→73.5(+18.7),域随机场景 9.3→17.7(+8.4),六任务中 Beat Block Hammer 干净场景从 18.0% 飙至 65.0%(+47.0)。

真实世界实验(附录 B)

真实拾放任务(黄色碗 → 盘子)人工采集 100 条轨迹,30 epochs、动作块 10、LR 5\\times10\^{-6}、batch 32,WorldVLA 式注意力掩码 + 并行解码,每模型 10 次独立试验:

模型 平均 布局泛化 光照泛化
基线 50.0 0.0 0.0
JEPA-VLA(1/5 数据,22 条) 60.0 33.3 66.7
JEPA-VLA(全量) 80.0 100.0 100.0

图 5:真实世界测试------标准、变换布局与不同亮度三类设置下的执行画面,布局与光照变化下仍稳定完成任务。

表示替换消融与 CortexBench

LIBERO-Long 上直接替换表示:基线 25.8%、+DINOv2 26.0%/31.2%、+SigLIP 33.6%、+V-JEPA2 41.0%------视频预测目标不可替代。CortexBench 10 任务上 V-JEPA2 全面超越强基线 VC-1:MetaWorld 平均 90.4 vs 88.8(bin picking 80.0 vs 84.0 外全部领先),DMControl 平均 583.8 vs 536.0(reacher easy 821 vs 836 外全部领先)。

结果对比总结

图 8:结果对比总结(Mermaid 流程图)------基础 VLA 基线接入冻结 V-JEPA2 嵌入后,LIBERO +7.4pp、LIBERO-plus +6.7pp、RoboTwin2.0 +18.7pp、真机全量 80%。

关键发现

  1. 静态图像表示两者皆缺:DINO 类图像自监督表示"精确但任务不敏感",CLIP/SigLIP 类图文对比表示"只捕捉文本明示实体"------环境理解与策略先验都无法提供。
  2. 探针证据链完整:V-JEPA2 任务相关状态回归 MSE 最低、任务无关(光照/背景)回归误差最高、10 步状态残差预测最优,三条 Finding 相互印证。
  3. 样本效率显著提升:基础 VLA 仅用 1/10 LIBERO 数据,LIBERO-plus 平均 25.6% 反超官方 WorldVLA 25.0%;真实机械臂 1/5 轨迹(22 条)即达 60% 成功率。
  4. 域随机化最见功力:RoboTwin2.0 域随机平均 +8.4pp,LIBERO-plus 背景/光照扰动分别 +13.8、+11.7pp。
  5. 即插即用通用性:同一冻结表示在基础 VLA(Early Fusion)与 OpenVLA-OFT(Gated Fusion)上一致生效,CortexBench 10 任务平均超越 VC-1(90.4 vs 88.8)。
  6. Oral 信号分析(ResearchStudio-Idea 框架):命中 P4 混淆隔离诊断(RL 领域 Oral 率 93% 模式)、P15 属性定向预训练目标、P6 重新表述为可解对象三个创新模式,证据为隔离探针 + 跨域一致增益。

局限性

  • 融合机制仍属启发式:早期拼接会干扰大规模预训练 VLA(必须换门控),更原则性的预测嵌入融合方式未探索;
  • CortexBench 覆盖受限:VC-1 官方结果在公开代码上不可复现,仅评估 17 个任务中的 10 个,且以奖励而非成功率报告;
  • 真实世界验证规模小:单机械臂、单任务(拾放);
  • 时序窗口浅:表示主要从最近两帧提取,更长时序窗口的收益未系统研究。

作者展望:大规模视频预训练是推进机器人视觉理解的关键成分,希望引发更多"视觉中心"的具身智能研究。

常见问题(FAQ)

JEPA-VLA 的核心思想是什么?

把冻结的视频预测嵌入 V-JEPA2 作为额外条件信号接入 VLA,同时补上环境理解(任务相关状态)与策略先验(时间规律)两种视觉知识;编码器不训练,只加线性投影或门控交叉注意力层。

为什么 DINOv2、CLIP 等静态图像表示不够用?

DINO 的图像自监督目标鼓励对增强不变,保留了任务无关细节、对任务相关性不敏感;CLIP/SigLIP 只强调文本中明确提到的实体,漏掉未在语言中显式出现的低层任务信息。探针实验证明两者在任务相关状态回归/预测上均弱于 V-JEPA2。

V-JEPA2 与视频生成世界模型有什么区别?

视频生成模型(Sora、UniPi 等)在像素/潜在空间生成未来帧,成本高且需世界模型训练数据;V-JEPA2 在语义空间做掩码预测,本文直接注入其冻结嵌入,无需任何世界模型训练。

Early Fusion 和 Gated Fusion 分别在什么时候用?

无大规模机器人预训练的 VLA(策略从零学习)用 Early Fusion------线性投影拼接即可;大规模机器人预训练的 VLA 用 Gated Fusion------门控交叉注意力保护预训练先验,防止拼接破坏已学表示。

JEPA-VLA 与 VLA-JEPA 是什么关系?

两个独立并发工作:JEPA-VLA(清华 THUML,本文)以冻结 V-JEPA2 嵌入 + 两种融合为主;VLA-JEPA 是已开源(GitHub/HuggingFace LeRobot)的潜在世界模型路线。二者共同验证了"JEPA 预测表示 → VLA"这一方向。

论文是否已被顶会接收?

截至 2026 年 8 月仍是 arXiv preprint(arXiv:2602.11832),使用 ICML 2026 模板但无公开接收证据;请以 arXiv 版本为准追踪更新。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
新新学长搞科研1 天前
【IEEE出版】2026年计算机视觉与具身智能国际学术会议(CVEI 2026)
计算机视觉·具身智能
_张一凡1 天前
【论文解读】一篇读懂LAWM-3D:从 DreamDojo 的 2D 潜动作到 3D 感知,关键不是加多视角而是三道防泄漏设计
3d·具身智能·世界模型
Bright Data2 天前
小米新发布的 Robotics-1 在向市场传递什么信息?
训练数据·具身智能·视频数据
m0_547486662 天前
《机器人学与具身智能》全套课件PDF2026
机器人·具身智能
白拾4 天前
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角
扩散模型·世界模型·模仿学习·rss 2025·uwm 论文分享·机器人预训练
带娃的IT创业者4 天前
Spec-Kit 与物理智能的范式跃迁:当 GitHub 成为世界模型的协作基础设施
github·世界模型·规范驱动开发·机器人开发·开源协作·物理智能
猫先生Mr.Mao4 天前
世界模型之HY-World 2.0详解:生成完还能走进去——如何把文本、照片和视频变成可探索的 3D 世界
多模态·论文解读·3dgs·世界模型
白拾5 天前
【ICML 2026 (Oral)】RoboMME 论文解读:首个大规模具身记忆评测基准,系统评估 VLA 长程记忆
人工智能·机器人·具身智能·vla·icml·记忆·基准评测
TsingtaoAI6 天前
基于MyCobot Pro 450机器人的VLA多模态具身智能实训建设方案
机器人·大模型·具身智能