1.Physical Intelligence Pi0
- 核心特色:首个通用型机器人基础模型、高频灵巧控制。
- 技术亮点:Pi0 是首个将自然语言命令直接转化为物理动作的 VLA 模型,能够以每秒 50 次的频率直接输出低级电机命令,实现高频灵巧控制。其模型架构基于预训练的视觉语言模型(如 PaliGemma),并加入了独立的"动作专家(Action Expert)"模块,通过流匹配(Flow Matching)技术生成连续动作。在针对复杂任务(如折叠衣物)时,可通过高质量数据进行后训练微调。
开源获取:其迭代版本 Pi0.5 已全面开源,验证了"VLA+开源"的工程化路径。
2.NVIDIA GR00T N1
- 核心特色:专为人形机器人设计的开放基座模型、双系统架构。
- 技术亮点:GR00T N1 采用了紧密耦合的"双系统架构":System 2(视觉-语言模块)负责通过视觉和语言指令解释环境;System 1(扩散 Transformer 模块)负责实时生成流畅的运动动作。该模型使用真实机器人轨迹、人类视频和合成数据集进行异构混合训练,在标准仿真基准测试中超越了现有的模仿学习基线,并已在傅利叶 GR-1 等人形机器人上成功部署。
- 开源获取:作为 NVIDIA Isaac GR00T 生态的核心,模型已开源,并配合 Isaac Sim 仿真平台支持大规模并行仿真。
- 论文地址 :2503.14734 GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- 开源地址 :https://github.com/NVIDIA/Isaac-GR00T
3.斯坦福/伯克利 OpenVLA
- 核心特色:VLA 领域的经典开源标杆、跨形态泛化。
- 技术亮点:OpenVLA 是一个 7B 参数的开源 VLA 模型,基于 Llama 2 结合 DINOv2 与 SigLIP 双视觉编码器架构。在 97 万条真实机器人轨迹上预训练后,其在 29 项机器人操作任务中的成功率比谷歌 DeepMind 的 RT-2-X 高出 16.5%。它支持 LoRA 微调与量化部署,可在消费级 GPU 上快速适配。
- 开源获取:全面开源了模型权重、PyTorch 代码库及微调 Notebook。
- 论文地址 :https://arxiv.org/pdf/2406.09246
- 开源地址 :https://github.com/openvla/openvla
4.智元机器人 ACoT-VLA
- 核心特色:动作思维链(Action Chain-of-Thought)、打破语义-运动鸿沟。
- 技术亮点:ACoT-VLA 首次提出在"动作空间"进行推理的思维链范式。它改变了传统 VLA 模型"边看边做"的模式,通过显式动作推理(EAR)生成粗粒度参考轨迹,结合隐式动作推理(IAR)挖掘潜在直觉,实现了"先想后做"。该模型在 LIBERO Benchmark 上取得了 98.5% 的平均成功率,并在包含多种环境扰动的 LIBERO-Plus 测试中显著领先于 Pi0 和 GR00T。
- 开源获取:已作为 AGIBOT WORLD CHALLENGE(全球具身智能挑战赛)的官方基线模型正式开源,供全球开发者进行二次开发与创新。
- 论文地址 :https://arxiv.org/pdf/2406.09246
-
- (作为 AGIBOT WORLD CHALLENGE 挑战赛官方基线模型开源)
5.蚂蚁灵波 LingBot-VLA 2.0
- 核心特色:跨构型泛化、海量真实数据驱动。
- 技术亮点:作为新一代具身基座模型,LingBot-VLA 2.0 在预训练阶段整合了 6 万小时真实物理环境数据,覆盖了 17 个主流机器人品牌的 20 多种构型(包括单臂/双臂、双足/轮式等)。它显著扩展了对头部、腰部、末端执行器及移动底盘等关键自由度的支持,开发者无需为特定形态单独训练模型即可实现快速适配。
- 开源获取:开发者可通过 Hugging Face、魔搭社区获取模型权重,并在 GitHub 下载完整开源代码。
- 论文地址 :暂无独立论文,技术报告见 GitHub 仓库内
assets/LingBot_VLA_2_0.pdf - 代码地址 :https://github.com/robbyant/lingbot-v2
- 模型下载:Hugging Face / 魔搭社区搜索 "LingBot-VLA-V2"
6.智平方 NeuroVLA
- 核心特色:类脑架构、毫秒级安全反射。
- 技术亮点:全球首个开源的类脑 VLA 模型,构建了"大脑-小脑-脊髓"三层协同体系。其"脊髓"层实现了 20 毫秒的安全反射速度(传统模型大于 200 毫秒),且功耗极低(仅 0.4 瓦),有效抑制了动作抖动并具备碰撞恢复能力。
- 开源获取:通过 AlphaBrain Platform(全球首个一站式具身智能模型开源社区)进行开源。
- 论文地址 :https://arxiv.org/pdf/2601.14628v1
- 代码地址 :通过 AlphaBrain Platform 开源,入口为 https://github.com/AlphaBrainPlatform/AlphaBrain(含 NeuroVLA 模块)
7.优艾智合 FabriVLA
- 核心特色:极致轻量化、工业级精密多任务操作。.
- **技术亮点:**FabriVLA 参数量仅为 0.89B,却在全球权威榜单 Evo-SOTA 的 Meta-World MT50 基准测试中登顶第一,整体任务成功率高达 92.0%。它通过引入"门控自注意力机制"和"深浅层视觉特征融合"两项创新架构,在未依赖大规模预训练的情况下,仅靠单阶段联合训练就超越了 π0(3.5B)等数倍于己的模型,在紧密插装、精密放置等高频次工业产线需求中表现突出。
- 开源获取:已在 GitHub 与 Hugging Face 平台开源训练评测代码与模型权重(论文见 arXiv:2607.08575)。
- 论文地址 :2607.08575 FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty
- 代码地址 :https://github.com/Youi-FabriX/FabriVLA
- 模型下载:Hugging Face 搜索 "Youi-FabriX/FabriVLA"
8.小米 Xiaomi-Robotics-0
- 核心特色:感知-决策-执行闭环、高频动作控制。
- 技术亮点:该模型拥有 47 亿参数,采用 Mixture-of-Transformers (MoT) 混合架构。由负责解析模糊指令的视觉语言大脑(VLM)和负责高频动作控制的动作执行小脑(Action Expert)构成。通过创新的异步推理模式与特殊的注意力掩码机制,有效解决了推理延迟导致的动作断层问题。
- 开源获取:已开放技术文档、源代码及模型权重供全球开发者使用。
- 论文地址:暂无独立论文,技术文档见 GitHub 仓库
- 代码地址 :https://github.com/XiaomiRobotics/Xiaomi-Robotics-0
9.港科大 StarVLA
- 核心特色:乐高式架构、跨形态混合训练、极低复现成本。
- 技术亮点:StarVLA 刻意避免了复杂的数据工程,采用内置的双数据流协同机制(交替执行 VLA 动作前向与 VLM 语言建模前向),有效解决了纯动作微调导致的"灾难性遗忘"问题。它支持跨形态混合训练,用户只需在 YAML 文件中声明数据集组合,即可自动处理动作空间对齐。其 Server-Client 架构打通了 Sim2Real,真实机器人部署无需修改任何代码。
- 开源获取:已开源,并附带完整的 benchmark-specific adapter 实现。
- 论文地址:暂无独立论文,技术说明见 GitHub README
- 代码地址 :https://github.com/HKUST-Aerial-Robotics/StarVLA
10.深蓝具身智能 Dexora
- 核心特色:首个开源的双臂36自由度灵巧操作 VLA 模型。
- 技术亮点:Dexora 旨在填补高自由度双臂灵巧操作 VLA 模型在开源领域的空白。其硬件平台由两台六自由度机械臂和两只十二自由度灵巧手组成(总计36个关节自由度)。模型采用 ViT-H/14 视觉编码器与 Llama-3-8B 语言编码器,结合 Diffusion Transformer 动作解码,在灵巧操作基准测试中平均成功率达到 66.7%。
- 开源获取:于 2026 年 6 月在 ICRA 维也纳现场由深蓝具身智能团队正式宣布开源。
开源地址
- GitHub :https://github.com/zzongzheng0918/dexora
- Hugging Face(数据集) :https://huggingface.co/dexmal/dexora
开源内容
- 代码与模型:包含完整的训练流程(training pipeline)、真机推理栈(real-robot inference stack)、模型架构(扩散Transformer+质量判别器)及推理代码,均托管在GitHub。
- 数据集:包含10万条仿真轨迹(Mujoco)与1万条真实遥操作轨迹,数据以LeRobot v2.1格式开源,并提供了数据处理代码。
- 工具链:包含Apple Vision Pro无标记手部追踪遥操作工具等配套工具。
11.自变量机器人 WALL-OSS
- 核心特色:世界统一模型、原生多模态融合。
- 技术亮点:WALL-OSS 是一个拥有 42 亿参数(4.2B)的开源模型,采用"大小脑统一"的端到端路线。在 RoboChallenge 评测中,它位列全球开源模型第二名(46.43分),并已率先进入真实家庭场景进行验证。
- 开源获取:完全开源,采用宽松的 Apache 2.0 许可证。
- 论文地址 :2605.14734 Denoising for Neuromorphic Cameras Based on Graph Spectral Features(技术报告,标题为《Wall-OSS-0.5 Technical Report: Pretrain Once, Act Anywhere》)
- 代码地址 :https://github.com/X-Square-Robot/wall-x(含模型权重、训练代码、消融实验等完整开源内容)
- 模型下载:Hugging Face 搜索 "wall-oss-*" 或通过 LeRobot 框架调用
12.X-VLA (LeRobot)
- 核心特色:软提示(Soft-Prompted)机制、极简参数微调。
- 技术亮点:X-VLA 将每种硬件配置视为一个"任务",通过少量的可学习嵌入(软提示)来吸收不同机器人本体和传感器带来的异构性差异。其 0.9B 版本仅需调整 1% 的参数(约 900 万参数),即可在保持主干网络冻结的情况下高效适应新机器人,并在极少量演示下展现出强大的现实世界灵活性。
- 开源获取 :作为 Hugging Face LeRobot 框架的一部分开源,提供预训练检查点(如
lerobot/xvla-base)。 - 论文地址:暂无独立论文,技术文档见 LeRobot 仓库
- 代码地址 :https://github.com/huggingface/lerobot(X-VLA 为 LeRobot 框架内支持的模型之一)
- 模型下载:Hugging Face Hub 搜索 "lerobot/xvla-base"
13.宇树科技 UnifoLM-VLA-0
- 核心特色:强大的基准测试表现。
- 技术亮点:宇树科技于 2026 年初开源了该模型,其在 LIBERO 基准测试中取得了高达 98.7 分的优异成绩,展现了极强的任务执行与泛化能力。
- 开源获取:模型已正式开源。
- 论文地址:暂无独立论文,技术说明见 GitHub README 或官方公告
- 代码地址 :https://github.com/unitreerobotics/unifolm-vla-0(注:部分资料称其开源,但需确认仓库是否仍活跃)
- 模型下载:Hugging Face 搜索 "unitree/unifolm-vla-0"
14.WCM (World Critic Model)
- 核心特色:VLA 强化学习价值评估、性能飞跃。
- 技术亮点:WCM 作为一个世界评论家模型,专门用于引导 VLA 模型的强化学习。它解决了传统 Critic 容易看走眼的问题,在 WCM 引导下,VLA 模型在 ManiSkill 任务中的成功率可从 0.78% 飙升至 98.7%。
- 开源获取:代码、数据、权重全开源,且仅需 15 分钟训练即可得到真机价值曲线。
- 论文地址 :https://arxiv.org/pdf/2607.29613
- 代码地址 :https://github.com/sylvestf/WCM
- 数据与权重 :https://huggingface.co/collections/Sylvest/wcm
该模型专为引导 VLA 模型的强化学习设计,通过预测动作执行后的下一时刻潜在状态,显著提升价值评估准确性。在 ManiSkill 任务中,可使初始成功率仅 0.78% 的模型飙升至 98.7%,且分布外(OOD)成功率提升 72.7%。代码、数据、权重全开源,仅需 15 分钟训练即可获得真机价值曲线。
15.地平线 HoloBrain-0
- 核心特色:显式注入"具身先验"、全栈基础设施开源。
- 技术亮点:HoloBrain-0 首创性地在架构中显式融入了多视角相机参数与机器人运动学结构等本体先验信息,大幅提升了三维空间理解能力。它不仅能灵活适配单/双臂、移动机器人等多种形态,还同步发布了仅 0.2B 参数的端侧友好版本。
- 开源获取:不仅开源了核心算法,还同步开放了包含数据采集、标准化规范、真机部署方案在内的全栈基础设施框架 RoboOrchard,提供"开箱即用"的交钥匙方案。
- 论文地址 :2602.12062 HoloBrain-0 Technical Report
- 核心算法代码库 :https://github.com/HorizonRobotics/RoboOrchardLab
- 真机部署基础设施 :https://github.com/HorizonRobotics/RoboOrchard
- 项目主页 :HoloBrain - A Foundation Model for General Embodied Manipulation
HoloBrain-0 首创性地在架构中显式注入"具身先验"(如多视角相机参数、机器人运动学结构),大幅提升三维空间理解能力。同步开源了仅 0.2B 参数的端侧友好版本及全栈基础设施 RoboOrchard,提供从数据采集、标准化规范到真机部署的"开箱即用"方案,适配单/双臂、移动机器人等多种形态。
"从Physical Intelligence的Pi0到地平线的HoloBrain-0,这15个模型不仅代表了当前VLA技术的水平,更展示了具身智能从'单一任务'向'通用操作'迈进的坚定步伐。无论是追求极致的灵巧控制,还是探索类脑架构的安全性,开源社区正在以前所未有的速度缩小仿真与现实的差距。未来,随着更多高质量真实数据的注入,我们有理由相信,通用机器人走进千家万户的时间表将被再次提前。"