摘要
当下具身智能赛道爆火,VLA(视觉-语言-动作)、WLA(世界-语言-动作)无本体训练技术成为机器人算法迭代的核心方向。很多开发者、从业者困惑:主流开源模型怎么选、机器人数据集如何专业采集、家用通用机器人何时能真正落地、为何一众机器人企业扎堆上市?
本文从模型选型、数据采集、技术瓶颈、落地周期、资本市场逻辑五个维度,系统性拆解具身智能行业现状,理清「算法能力、工程落地、产业趋势」的完整逻辑链,适合机器人算法开发者、行业从业者、入行新人阅读收藏。
一、核心概念:什么是无本体训练VLA?WLA和VLA有什么区别?
1.1 无本体(跨本体)训练定义
无本体训练,也叫跨本体预训练,是指模型训练阶段混合数十种不同机器人本体的轨迹数据,主干网络不绑定特定机器人硬件参数、关节构型。
核心价值:新机器人无需从零预训练,仅通过少量演示、LoRA微调、软提示适配即可快速迁移,彻底解决传统机器人模型"一机一训、无法通用"的行业痛点。
⚠️ 重要误区:无本体训练 ≠ 全场景零样本万能适配。硬件动作空间、相机外参、物理限位的客观差异无法消除,只能降低适配成本,不能完全消除适配工作。
1.2 VLA与WLA核心差异
目前行业主流以VLA模型为主,WLA是下一代进阶范式,两者差距极大:
-
VLA(视觉-语言-动作):输入图像+语言指令,直接输出机器人动作,无显式世界建模,依赖轨迹模仿学习,泛化能力有限,开源生态成熟。
-
WLA(世界-语言-动作):新增世界动力学建模,训练阶段通过未来帧预测学习物理规律,可利用无动作人类视频预训练,推理可关闭世界分支降延迟,是解决真实场景泛化的核心方案。
行业现状:VLA可工程落地,WLA仅科研阶段,目前无完整开源商用预训练权重,仅有论文和训练框架。
二、主流开源无本体VLA模型全方位选型指南
目前开源生态成熟、可落地的跨本体VLA模型共5款,适配科研、仿真、真机部署不同场景,杜绝盲目选型。
2.1 模型横向对比
| 模型 | 参数量 | 核心优势 | 短板 | 适用场景 |
|---|---|---|---|---|
| Wall-OSS-0.5 | 4B | 零样本真机能力最强,20+本体预训练,柔性操作优秀,可直接部署真机少微调 | 长时序复杂任务成功率有限 | 真机快速落地、少数据适配、柔性操作任务 |
| OpenVLA | 7B | 社区最成熟,OpenX数据集适配,LoRA微调生态完善,科研基线首选 | 原生权重零样本真机效果差,需大量微调数据 | 算法科研、消融实验、仿真 benchmark |
| Octo | 93M | 超轻量、低算力、迭代速度快 | 泛化能力弱,真机落地能力差 | 仿真快速验证、低成本原型测试 |
| X-VLA | 0.9B | 软提示适配、冻结主干、极小改动快速跨本体迁移 | 复杂真机任务能力不足 | 仿真适配、新本体快速基线搭建 |
| SmolVLA | 450M | 消费级GPU可跑,LeRobot生态完整,低成本部署 | 高阶操作泛化有限 | 边缘端原型、低成本机器人项目 |
2.2 极简选型决策树
-
真机落地、尽量少微调:首选 Wall-OSS-0.5
-
科研实验、论文复现、OpenX数据集:首选 OpenVLA
-
低算力、快速迭代、仿真验证:X-VLA / SmolVLA / Octo
三、WLA开源项目现状:前景可期,落地尚早
作为下一代具身智能范式,WLA 通过世界建模弥补了 VLA 缺乏物理因果的短板,但目前开源生态极不成熟。
3.1 唯一原生开源WLA:上交WLA-0
开源训练、推理代码与配置脚本,无公开预训练权重,仅支持从零训练,算力与数据成本极高,仅适合学术研究,完全不适合工程落地。
3.2 类WLA开源替代(VLA+世界建模)
WorldVLA、UniVLA、Flex-π 等项目具备世界预测能力,但均无成熟真机预训练权重,仅可用于仿真实验。
核心结论:现阶段所有商用、真机落地项目,一律优先VLA,WLA仍是未来3-5年的技术迭代方向。
四、VLA机器人数据集采集:决定模型上限的核心工程环节
VLA模型效果,70%取决于数据集质量,尤其是跨本体无本体训练,对数据采集有严苛的专属要求,绝非简单录视频、录关节角。
4.1 必须采集的核心数据项
多视角同步RGB图像、末端6D位姿+夹爪状态、时间戳、自然语言指令、任务成功标签、机器人本体元信息。
✅ 跨本体训练核心原则:优先使用末端Delta位姿,拒绝原始关节角,不同机器人关节构型不通用,仅末端位姿具备通用性。
4.2 主流采集方案选型
-
LeRobot(首选):开箱即用、时间同步、格式规范,原生适配X-VLA/SmolVLA,可一键转RLDS供给OpenVLA训练,低成本、高效率。
-
ALOHA:适合双臂复杂任务,HDF5格式,需自行转换格式,适配成本高。
-
仿真采集:RoboTwin、VLA-Arena,无硬件成本,但存在仿真虚实 gap,仅适合基线验证。
4.3 采集与清洗核心避坑点
-
严格多相机时间同步,帧动作错位直接导致模型训练崩坏;
-
增加环境、光照、杂物多样性,拒绝固定场景采集;
-
混合成功+少量失败样本,提升模型鲁棒性;
-
统一动作归一化,保留统计参数,适配跨本体训练。
五、行业终局判断:通用家用机器人,至少还要5-10年普及
市面上各类机器人发布会样机百花齐放,但实验室演示 ≠ 家庭可用,样机成熟 ≠ 产业落地。
真正能走进普通家庭、稳定完成各类开放式家务的通用机器人,中性预判需要 5-10年,甚至更久。核心瓶颈并非模型,而是四大硬约束:
5.1 算法瓶颈:VLA只有统计模仿,无物理理解
当前VLA是数据驱动的行为克隆,只会模仿轨迹,不懂物理因果,面对家庭非结构化场景(杂物、光照变化、柔性物体)性能断崖下跌。WLA世界模型可解决该问题,但尚未产业化。
5.2 硬件瓶颈:成本、可靠性、安全无法落地
灵巧手、高精度传感器、高安全力矩驱动成本高昂;人机混住的家庭场景,对碰撞安全、续航、容错率要求远超工业场景,当前硬件无法满足民用标准。
5.3 场景瓶颈:家庭是极致开放的非结构化环境
工业场景固定、可控、标准化;家庭户型、物品、习惯千差万别,任务开放式无固定流程,是机器人领域难度最高的场景。
5.4 成本瓶颈:产业鸡生蛋循环未打破
当前人形机器人单价10万+,远高于民用接受度;无大规模销量就无法降本,无成熟产品就无法起量,产业闭环尚未形成。
六、深度解读:机器人公司扎堆上市,只为储备未来弹药
当下所有机器人企业上市,都不是因为现在能赚钱,而是为5-10年后的万亿市场提前备战。
行业现状非常清晰:绝大多数机器人公司无规模化C端收入,营收依赖B端科研、工业订单,持续亏损、高强度烧钱。一级市场融资收缩后,上市是唯一的长期输血通道。
6.1 上市募资的核心用途
-
持续投入VLA/WLA大模型、数据集、仿真平台研发;
-
自研核心零部件,搭建产线,为未来量产降本;
-
储备巨额现金,熬过5-10年的技术爬坡周期。
6.2 资本市场的核心逻辑
现在的行业是产品端停留在样机阶段,资本市场交易的是5-10年后的终局。
上市不是商业成功,只是拿到参赛资格。谁能储备足够弹药、熬到技术成熟、成本下探、场景爆发的节点,谁才能瓜分未来家用机器人市场。
6.3 行业风险
若未来5-10年具身智能技术落地不及预期,大量企业会烧完弹药出局,行业将迎来一轮大洗牌。
七、全文总结(行业核心逻辑闭环)
-
无本体VLA是当前唯一可落地的通用机器人算法方案,WLA是未来迭代方向,短期无法商用;
-
数据集质量是VLA模型落地的核心,跨本体训练必须统一动作范式、严格对齐多模态数据;
-
通用家用机器人不存在短期爆发可能,5-10年是客观落地周期,算法、硬件、成本、场景四大瓶颈亟待突破;
-
机器人企业集中上市,本质是储备弹药、熬过周期、卡位未来终局,是赛道长跑的必经之路。
附:核心开源仓库汇总
Wall-OSS-0.5:https://github.com/X-Square-Robot/wall-x
OpenVLA:https://github.com/openvla/openvla
LeRobot:https://github.com/huggingface/lerobot