摘要
本文解读 arXiv preprint 2026 论文《JEPA-VLA: Video Predictive Embedding is Needed for VLA Models 》(清华大学 THUML × 华为诺亚方舟实验室,通讯作者龙明盛)。该论文提出JEPA-VLA ,通过把冻结的视频预测嵌入 V-JEPA2 接入现有视觉语言动作模型(VLA),同时补上环境理解 与策略先验 两种关键视觉知识,其特别之处在于只加一个线性投影或几个门控交叉注意力层、无需任何世界模型训练数据。实验表明LIBERO 平均成功率 +7.4 个百分点、RoboTwin2.0 干净场景 +18.7 个百分点、真实机械臂 80% 成功率(1/5 数据即达 60%),为具身智能的视觉表示选择提供了重要借鉴。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- [背景与动机:VLA 的视觉表示到底缺了什么?](#背景与动机:VLA 的视觉表示到底缺了什么?)
- 研究主线:从问题到结论
- [基准/方法设计:JEPA-VLA 的两种融合策略](#基准/方法设计:JEPA-VLA 的两种融合策略)
- 分类全景:三种视觉表示范式
- 方法细节:探针实验与训练协议
- 实验设计与结果
- [基础 VLA 设置(1/10 数据)](#基础 VLA 设置(1/10 数据))
- [主流 VLA 设置(OpenVLA-OFT)](#主流 VLA 设置(OpenVLA-OFT))
- [真实世界实验(附录 B)](#真实世界实验(附录 B))
- [表示替换消融与 CortexBench](#表示替换消融与 CortexBench)
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [JEPA-VLA 的核心思想是什么?](#JEPA-VLA 的核心思想是什么?)
- [为什么 DINOv2、CLIP 等静态图像表示不够用?](#为什么 DINOv2、CLIP 等静态图像表示不够用?)
- [V-JEPA2 与视频生成世界模型有什么区别?](#V-JEPA2 与视频生成世界模型有什么区别?)
- [Early Fusion 和 Gated Fusion 分别在什么时候用?](#Early Fusion 和 Gated Fusion 分别在什么时候用?)
- [JEPA-VLA 与 VLA-JEPA 是什么关系?](#JEPA-VLA 与 VLA-JEPA 是什么关系?)
- 论文是否已被顶会接收?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | JEPA-VLA: Video Predictive Embedding is Needed for VLA Models |
| 标题(中文) | 视频预测嵌入:为 VLA 补上缺失的视觉知识 |
| 作者 | Shangchen Miao · Ningya Feng · Jialong Wu · Ye Lin · Xu He · Dong Li · Mingsheng Long |
| 机构 | 清华大学软件学院 THUML · 华为诺亚方舟实验室 |
| 会议 | arXiv preprint 2026 |
| arXiv | https://arxiv.org/abs/2602.11832 |
| 项目网站 | 暂无公开项目页(并发工作 VLA-JEPA 已开源:https://vla-jepa.github.io/) |
背景与动机:VLA 的视觉表示到底缺了什么?
当前基于预训练 VLM 的 VLA 模型(RT-2、OpenVLA、RDT 等)虽然指令跟随能力突飞猛进,仍普遍面临低样本效率 与有限泛化 两大痛点------即便在数百万条轨迹上训练也只覆盖几十个任务。本文把矛头指向一个被长期忽视的组件:预训练视觉表示。作者论证,机器人操作需要两种视觉知识:
- 环境理解:精确捕捉任务相关物体属性(如目标坐标),同时灵活丢弃任务无关因素(如光照、背景纹理);
- 策略先验:内化"成功执行时环境如何演化"的预期知识,引导动作学习走向有利的未来状态。
为了严格验证"现有表示是否提供这两种知识",作者设计了三类探针实验(冻结编码器 + 轻量 ViT 回归头,8:1:1 划分 + 早停,只隔离"表示"这一个变量):
- 任务相关状态回归 (LIBERO-10):回归机械臂与目标物体状态,V-JEPA2 的 MSE 最低 → Finding 1:环境理解更精确;
- 任务无关状态回归 (LIBERO-plus):回归光照/背景扰动,V-JEPA2 误差最高 → Finding 2:编码扰动信息最少,泛化更稳;
- 策略先验预测 (LIBERO-10):预测 10 步后的状态残差,V-JEPA2 依然最优 → Finding 3:内化时间规律,诱导策略先验。

图 1:三类常见视觉表示的对比------(a) 图像自监督(DINO 家族):精确但保留任务无关细节;(b) 图文对比(CLIP/SigLIP 家族):强调指令对齐语义、缺低层任务信息;(c) 视频预测(V-JEPA2):状态中心表示 + 时间规律(策略先验)。

图 2:探针实验------任务相关状态回归/预测上 V-JEPA2 一致最低(左、中),任务无关(光照/背景)回归误差最高(右),同时证明环境理解与策略先验。
形式上,操作轨迹建模为部分可观测马尔可夫决策过程(POMDP)\\langle \\mathcal{S}, \\mathcal{O}, \\phi, \\mathcal{A}, p \\rangle:机器人只通过观测函数 \\phi 看到底层状态 s_t 的投影 o_t,因此有效操作依赖学习内部状态估计器 q_\\theta(s_t \\mid o_{1:t}) 与策略对齐的演化模型 p_\\theta(s_{t+1} \\mid s_t, a_t\^{\*})------这正是"视频生成模型作为策略"(UniPi、Vidar 等)一脉相承的视角,但本文不需要生成任何像素。
从历史脉络看,JEPA 家族走过了完整的技术迁移:2022 年 LeCun 提出联合嵌入预测架构(层次化规划 + 高维表示自监督预测)→ 2023 年 I-JEPA(图像)→ 2024 年 V-JEPA(视频)→ 2025 年 V-JEPA2(互联网规模视频预训练)→ 2026 年本文把 V-JEPA2 系统落地到 VLA 机器人,同期工作 VLA-JEPA 独立验证同一方向。
研究主线:从问题到结论

图 6:研究主线(Mermaid 流程图)------从 VLA 低样本效率问题出发,经两类视觉知识缺失的动机与探针诊断,到 JEPA-VLA 两种融合方法与 5 基准一致提升的结论。
基准/方法设计:JEPA-VLA 的两种融合策略
方法哲学是"极简 + 即插即用":V-JEPA2 编码器全程冻结 (ViT 骨干,输入最近 T 帧视频片段输出状态中心表示 h_t),动作模型的条件化为 a_t \\sim \\pi_\\theta(a_t \\mid l, o_{1:t}, s_t, h_t)------语言指令、多视角观测、本体感知与预测嵌入共同决定动作。关键设计在于按 VLA 的预训练程度选择融合方式:
- Early Fusion(早期拼接) :V-JEPA2 表示经线性投影对齐维度后,作为额外输入嵌入直接拼接进 token 序列。轻量有效,适合没有大规模机器人预训练的 VLA(策略基本从零学习,共享 VLM 先验);
- Gated Fusion(门控交叉注意力) :受 Flamingo 启发,原 VLA token 作查询、V-JEPA2 表示作键值,门控机制让模型选择性吸收 预测信息------直接拼接会偏移输入分布、干扰大规模机器人预训练学到的表示。配合每 8 层 decoder 稀疏插入 一个门控层(平衡性能/显存/延迟)与低学习率保护(融合层 1\\times10\^{-5}\\sim1\\times10\^{-4},远低于主干 5\\times10\^{-4})。

图 3:JEPA-VLA 融合架构------(a) 早期拼接(Early Fusion);(b) 门控交叉注意力(Gated Fusion),保留预训练先验。
分类全景:三种视觉表示范式

图 7:VLA 视觉表示分类全景(Mermaid 流程图)------图像自监督(DINO)、图文对比(CLIP/SigLIP)与视频预测(V-JEPA2)各自的优缺点。
方法细节:探针实验与训练协议
探针实验设置 (附录 A):所有模型共用同一套轻量 ViT 头(16 注意力头、12 层、前馈维度 3072、dropout 0.1),训练/验证/测试按 8:1:1 划分,验证损失 10 轮不降即早停。任务相关回归使用最近两帧表示 + CLS token 输出、标签归一化(零均值单位方差);任务无关回归只用首帧(扰动轨迹内恒定),光照参数直接回归、背景用 MAE 重建;策略先验预测预测 10 步后的状态残差且不归一化,以保留残差语义。
训练协议 :基础 VLA 使用 Chameleon 骨干 + 256 动作 token(WorldVLA 架构参照),仅用 1/10 LIBERO 数据训练 40 epochs;主流 VLA 复现 OpenVLA-OFT 配置(L1 回归、动作分块、并行解码)训练 150k steps,批大小 16(LIBERO)与 8(RoboTwin2.0)。
实验设计与结果
评测覆盖 5 个场景:LIBERO(4 套件 ×10 任务 ×50 演示)、LIBERO-plus(7 维扰动:相机/语言/光照/背景/噪声/布局)、RoboTwin2.0(双臂 50 任务、731 物体实例、域随机化)、真实世界 Piper 单臂拾放(100 条人工轨迹)与 CortexBench(10 任务 vs VC-1)。

图 4:评测基准------(a) LIBERO、(b) LIBERO-plus、(c) RoboTwin、(d) 真实世界任务、(e) CortexBench。
基础 VLA 设置(1/10 数据)
| LIBERO 套件 | 基线 | JEPA-VLA | Δ |
|---|---|---|---|
| Spatial | 58.2 | 69.2 | +11.0 |
| Object | 74.8 | 78.2 | +3.4 |
| Goal | 87.8 | 87.8 | 0.0 |
| Long | 25.8 | 41.0 | +15.2 |
| 平均 | 61.65 | 69.05 | +7.40 |
LIBERO-plus 上本文 25.6% 平均成功率,在仅用 1/10 数据、无世界模型训练数据的条件下超过官方 WorldVLA(25.0%);其中语言扰动 43.9→54.4(+10.5)、光照 26.3→38.0(+11.7)、背景 10.1→23.9(+13.8)、布局 26.9→32.8(+5.9)。
主流 VLA 设置(OpenVLA-OFT)
| LIBERO 套件 | 基线 | JEPA-VLA | Δ |
|---|---|---|---|
| Spatial | 84.4 | 97.2 | +12.8 |
| Object | 91.8 | 98.0 | +6.2 |
| Goal | 95.2 | 95.6 | +0.4 |
| Long | 89.8 | 94.8 | +5.0 |
| 平均 | 90.30 | 96.40 | +6.10 |
平均 96.40% 甚至超过官方 OpenVLA-OFT 报告的 95.35%。RoboTwin2.0 上干净场景平均 54.8→73.5(+18.7),域随机场景 9.3→17.7(+8.4),六任务中 Beat Block Hammer 干净场景从 18.0% 飙至 65.0%(+47.0)。
真实世界实验(附录 B)
真实拾放任务(黄色碗 → 盘子)人工采集 100 条轨迹,30 epochs、动作块 10、LR 5\\times10\^{-6}、batch 32,WorldVLA 式注意力掩码 + 并行解码,每模型 10 次独立试验:
| 模型 | 平均 | 布局泛化 | 光照泛化 |
|---|---|---|---|
| 基线 | 50.0 | 0.0 | 0.0 |
| JEPA-VLA(1/5 数据,22 条) | 60.0 | 33.3 | 66.7 |
| JEPA-VLA(全量) | 80.0 | 100.0 | 100.0 |

图 5:真实世界测试------标准、变换布局与不同亮度三类设置下的执行画面,布局与光照变化下仍稳定完成任务。
表示替换消融与 CortexBench
LIBERO-Long 上直接替换表示:基线 25.8%、+DINOv2 26.0%/31.2%、+SigLIP 33.6%、+V-JEPA2 41.0%------视频预测目标不可替代。CortexBench 10 任务上 V-JEPA2 全面超越强基线 VC-1:MetaWorld 平均 90.4 vs 88.8(bin picking 80.0 vs 84.0 外全部领先),DMControl 平均 583.8 vs 536.0(reacher easy 821 vs 836 外全部领先)。
结果对比总结

图 8:结果对比总结(Mermaid 流程图)------基础 VLA 基线接入冻结 V-JEPA2 嵌入后,LIBERO +7.4pp、LIBERO-plus +6.7pp、RoboTwin2.0 +18.7pp、真机全量 80%。
关键发现
- 静态图像表示两者皆缺:DINO 类图像自监督表示"精确但任务不敏感",CLIP/SigLIP 类图文对比表示"只捕捉文本明示实体"------环境理解与策略先验都无法提供。
- 探针证据链完整:V-JEPA2 任务相关状态回归 MSE 最低、任务无关(光照/背景)回归误差最高、10 步状态残差预测最优,三条 Finding 相互印证。
- 样本效率显著提升:基础 VLA 仅用 1/10 LIBERO 数据,LIBERO-plus 平均 25.6% 反超官方 WorldVLA 25.0%;真实机械臂 1/5 轨迹(22 条)即达 60% 成功率。
- 域随机化最见功力:RoboTwin2.0 域随机平均 +8.4pp,LIBERO-plus 背景/光照扰动分别 +13.8、+11.7pp。
- 即插即用通用性:同一冻结表示在基础 VLA(Early Fusion)与 OpenVLA-OFT(Gated Fusion)上一致生效,CortexBench 10 任务平均超越 VC-1(90.4 vs 88.8)。
- Oral 信号分析(ResearchStudio-Idea 框架):命中 P4 混淆隔离诊断(RL 领域 Oral 率 93% 模式)、P15 属性定向预训练目标、P6 重新表述为可解对象三个创新模式,证据为隔离探针 + 跨域一致增益。
局限性
- 融合机制仍属启发式:早期拼接会干扰大规模预训练 VLA(必须换门控),更原则性的预测嵌入融合方式未探索;
- CortexBench 覆盖受限:VC-1 官方结果在公开代码上不可复现,仅评估 17 个任务中的 10 个,且以奖励而非成功率报告;
- 真实世界验证规模小:单机械臂、单任务(拾放);
- 时序窗口浅:表示主要从最近两帧提取,更长时序窗口的收益未系统研究。
作者展望:大规模视频预训练是推进机器人视觉理解的关键成分,希望引发更多"视觉中心"的具身智能研究。
常见问题(FAQ)
JEPA-VLA 的核心思想是什么?
把冻结的视频预测嵌入 V-JEPA2 作为额外条件信号接入 VLA,同时补上环境理解(任务相关状态)与策略先验(时间规律)两种视觉知识;编码器不训练,只加线性投影或门控交叉注意力层。
为什么 DINOv2、CLIP 等静态图像表示不够用?
DINO 的图像自监督目标鼓励对增强不变,保留了任务无关细节、对任务相关性不敏感;CLIP/SigLIP 只强调文本中明确提到的实体,漏掉未在语言中显式出现的低层任务信息。探针实验证明两者在任务相关状态回归/预测上均弱于 V-JEPA2。
V-JEPA2 与视频生成世界模型有什么区别?
视频生成模型(Sora、UniPi 等)在像素/潜在空间生成未来帧,成本高且需世界模型训练数据;V-JEPA2 在语义空间做掩码预测,本文直接注入其冻结嵌入,无需任何世界模型训练。
Early Fusion 和 Gated Fusion 分别在什么时候用?
无大规模机器人预训练的 VLA(策略从零学习)用 Early Fusion------线性投影拼接即可;大规模机器人预训练的 VLA 用 Gated Fusion------门控交叉注意力保护预训练先验,防止拼接破坏已学表示。
JEPA-VLA 与 VLA-JEPA 是什么关系?
两个独立并发工作:JEPA-VLA(清华 THUML,本文)以冻结 V-JEPA2 嵌入 + 两种融合为主;VLA-JEPA 是已开源(GitHub/HuggingFace LeRobot)的潜在世界模型路线。二者共同验证了"JEPA 预测表示 → VLA"这一方向。
论文是否已被顶会接收?
截至 2026 年 8 月仍是 arXiv preprint(arXiv:2602.11832),使用 ICML 2026 模板但无公开接收证据;请以 arXiv 版本为准追踪更新。
参考链接
- JEPA-VLA 论文(arXiv:2602.11832):https://arxiv.org/abs/2602.11832
- B 站视频讲解:https://www.bilibili.com/video/BV1qxuE66EbD
- V-JEPA 2(Meta,视频预测嵌入来源):https://arxiv.org/abs/2505.24148
- LeCun,A Path Towards Autonomous Machine Intelligence(JEPA 提案):https://openreview.net/forum?id=BZ5a1r-kV2
- OpenVLA-OFT(主流实验设置基线):https://arxiv.org/abs/2503.19645
- LIBERO 基准(CoRL 2023):https://arxiv.org/abs/2306.05707
- CortexBench / VC-1(ICLR 2023):https://arxiv.org/abs/2303.18240
- VLA-JEPA(并发工作,已开源):https://vla-jepa.github.io/
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)