本篇位置 :本批第 9 篇,也是今天三篇里信息密度最高的一篇,是主样本。它把第 8 篇提出的问题(缺什么数据、谁会成为主流)用一次行业深度访谈做了解答,而且给了具体的时间线、成本账和人物名单。第 10 篇(知乎技术综述)则是理解本篇所有设备名词的底图。
阅读提示 :本文的主要访谈对象是灵初智能技术负责人陈源培,另有智在无界、无问智科、宇泛智能、优宝特、云松鼠智能、联想之星等多家机构人士发声,信源比第 8 篇均衡得多。但涉及成本、算力、筛选比例的数字多为受访方自报,原文未附独立来源,已在数字表中逐条标注。
一、亮点速读(一段话看懂这篇)
具身智能的竞争重心正在从「本体」转向「数据」。真机遥操作数据是质量最高的数据,但算一笔账就知道它撑不起规模:一条 30 秒的真机操作数据采集成本 10 到 15 元,1 小时约 1000 元,凑够 20 万小时要两亿元以上------而这对于大模型预训练而言不过沧海一粟。仿真数据便宜但撞上 Sim-to-Real Gap 的天花板。于是行业在 2025 到 2026 年完成了一次路线切换:人类数据(第一人称视频、 外骨骼 触觉手套)成为预训练主流,真机数据退居精细微调 。与这次"换锚"同步发生的还有模型范式的迁移------从 VLA 转向隐式世界模型,因为显式预测下一帧画面的成本高出两到三个数量级。但在所有进展之下,本文最锋利的一句话反而是否定式的:"10 万小时的人类数据,有些时候可能还不如 1000 个小时"------真正的瓶颈不是采集,是消化。
二、阅读笔记
1. 一次"瓶颈认知切换":从本体到数据
作者开篇给了一个判断:过去两年行业角逐焦点是本体 (谁能造出更能跑、更能跳的机器人),进入 2026 年重心正在从硬件转向数据。
这个转向的必要性来自一个不对称:
-
大语言模型有互联网文本,自动驾驶有海量路测数据;
-
具身智能面对的问题更棘手------机器人需要学会操作物理世界,但物理世界的数据不会天然存在。
先算那笔成本账(这是全文最有说服力的一段):
| 项 | 数字 |
|---|---|
| 一条 30 秒真机操作数据 | 10~15 元 |
| 采集 1 小时 | 约 1000 元 |
| 凑够 20 万小时 | 两亿元以上 |
| 对比参照:V-JEPA 训练用视频量 | 超过 100 万小时 |
作者由此点出困局:**成本高到无法规模化,而 Scaling 需要的数据量近乎无底洞。**行业里"缺数据"的声音此起彼伏,但很少有人认真算过这笔账------用真机数采填数据缺口,成本上几乎看不到出路。
2. 那条"被逐一验证的路":一个排除法论证
本节的论证方式我很欣赏,是一个干净的排除法。灵初智能技术负责人陈源培逐条否掉三条路:
| 路线 | 优势 | 被否掉的理由 |
|---|---|---|
| 互联网视频 | 数据量足够大 | "太脏了"------清洗互联网数据的成本远远大于现采 |
| 真机遥操作 | 质量最高 | 不可能把世界上所有场景、所有物体的所有操作都搬到一个素材厂里来 |
| 仿真数据 | 成本几乎为零 | Sim-to-Real 先天 gap;且仿真自身的 Scaling 也是问题 |
| 人类数据 | 成本可控、采集灵活 | 结论:"看来看去,唯一一个能够 Scaling 的数据,其实就是人类数据。" |
3. 人类数据的两条支线:纯视觉 vs 主动传感
两家公司殊途同归,但对"人类数据"的定义并不相同------这是本节最容易被读漏的地方。
智在无界:纯视觉路线
-
用第一人称视频训练模型理解人的行为语义,不记录关节角度和触觉信号;
-
成本极低、易于规模化,已做到 20 万小时规模;
-
局限:这种数据"缺一个 duty pose 信息,不能很好地恢复接触状态",因此无法直接驱动机器人,只能用于预训练阶段的表征学习。
灵初智能:主动传感路线
-
自研 62+ 自由度 外骨骼 触觉手套采集人手操作数据,同时记录关节角度和指尖触觉信号;
-
精度达到亚毫米级 ,处理后可等同于真机数据直接驱动机器人;
-
代价:采集需要专用硬件,规模扩张速度不如纯视频路线。
这就是全篇的核心张力:能规模化的(纯视觉)驱不动机器人;能驱动机器人的(主动传感)扩不快。两条支线目前并行,尚未分高下。
4. 一条完整的时间线(很有存档价值)
作者梳理了人类数据路线从边缘走到聚光灯下的过程:
| 时间 | 事件 |
|---|---|
| 2024 年底 | 中关村学院孵化的深度机智率先提出"人类学习"(AnthroLearning)路线,主张用人类第一人称视频训练机器人理解物理世界,创始人陈凯出自微软亚洲研究院。此时这条路线几乎没有关注者。 |
| 2025 年 7 月 | 智在无界发布 Being-H0,用 1000 小时人类第一人称视频做具身预训练 |
| 2025 年 12 月 | 灵初智能发布 Psi-SynEngine 外骨骼触觉手套数采方案,走主动传感路线 |
| 2026 年 1 月 | Being-H0.5 发布,人类视频规模推到近 2 万小时 。据智在无界 BeingBeyond 合伙人郑思鹏回忆,这个路线"也还不是主流" |
| 2026 年 2~3 月 | 转折点 。英伟达接连发布 EgoScale 和 DreamDojo,分别使用 1 到 3 万小时不等的人类视频数据。英伟达并非这条路线的最早探索者,但它的入场是关键的验证信号。 |
| 2026 年 4~5 月 | 深度机智发布 PhysBrain 1.0;灵初智能 Psi-R2 基于近 10 万小时人类数据在 MolmoSpaces 登顶;智在无界 Being-H0.7 扩展到 20 万小时 |
| 2025 年底(海外) | 由前 Google DeepMind 研究员创立的 Generalist AI 用 27 万小时人类操作数据训练 GEN-0,首次在机器人领域观察到 Scaling Law |
| 2026 年 4 月 | 宇树科技开源真机数据集 |
| 2026 年 6 月 | 智元机器人发布"具身智能数采 2.0"体系并开源 AGIBOT WORLD 数据集 |
校准 :Generalist 的 GEN-0 我核对了官方博客,发布时间是 2025-11-04 ,"2025 年底"准确。但"27 万小时""首次在机器人领域观察到 Scaling Law"是厂商自述 + 中文媒体转述口径,官方博客的表述是模型性能随数据规模提升。
注意路线分野 :并非所有公司都押注人类数据。智元机器人(6 月)和宇树科技(4 月)走的是更传统的路线------以真机遥操作和仿真数据为主 ,更侧重本体自身的数据闭环,而非人类数据的规模化预训练。两条路线目前 并行 ,尚未到分出高下的时候。
5. 为什么真机数据走不通 Scaling:一个理论解释
文中引郑思鹏的分析给出了原理层面的解释,这是我认为全文理论价值最高的一段:
真机数据是 监督学习 的产物。 监督学习训练出来的模型只有"背板能力",泛化能力很差,一旦遇到 out-of-distribution 的场景和任务,效果急剧下降。而人类视频天然覆盖了更广阔的动作空间分布,与预训练的逻辑天然匹配。
也就是说:真机数据的缺陷不是"少",而是它的分布太窄------它只覆盖了人类全部可行操作空间里的一小块。
6. 范式迁移:从 VLA 到隐式世界模型
与数据路线转向同步发生的,是模型范式的迁移。
VLA(Vision-Language-Action) 是过去一年的通用范式,本质是一套 监督学习 框架。它的天花板受限于高质量真机数据的稀缺------VLA 模型无法像大语言模型那样遍历所有可行的动作空间。郑思鹏的说法是:真机数据能覆盖的动作空间,"只占全部可行空间的很小一部分"。
行业因此转向世界模型,但世界模型内部也有路线之分:
显式路线(英伟达 Cosmos Policy) :通过预测视频的下一帧画面来预测状态变化。理论上可行,但成本极高------模型需要"关注画面中皮肤纹理、衣服褶皱等等元素",而这些对机器人决策来说大部分是无关信息。
隐式路线(Latent World Action Model,智在无界选择):只建模必要的状态变化,不预测完整画面。
效率差异是数量级的 :据郑思鹏给的数据,同样 50 小时的数据量,显式训练需要约 4000 小时 GPU ,隐式大约只有前者的 1/80。他的推论是:"如果扩展到 20 万小时去训练一个模型,显式的投入是千亿级别的。"
智在无界并非唯一押注隐式的公司:
-
2026 年 3 月 :星海图发表 LeWM 隐式世界模型论文,多个操作与导航任务上性能与基础模型相当但成本大幅降低;
-
2026 年 6 月 :无界动力发布 MWA™ 隐空间世界模型,在斯坦福等机构发起的 RoboCasa 榜单上超越了英伟达的 GR00T-N1.6。
作者的总结很到位:这是一场从监督学习到自监督/半监督学习的范式迁移,正在重演 计算机视觉 领域曾经走过的路------先有监督学习起步,然后转向自监督实现 Scaling 突破。
7. 商业化:路线在迭代,节奏判断在分化
一个基本共识正在形成:2B(工业制造、物流等可控场景)比 2C(家庭服务)快 3 到 5 年。
在联想控股微空间、联想之星和融科资讯中心共同发起的"硅基进化论"沙龙上,几位产业人士给出了实操导向的判断:
宇泛智能 CFO 戴恺:三个衡量具身智能公司落地质量的务实指标
-
复购率------客户愿不愿意再次买单;
-
ROI ≥ 30%------替代人效要有可量化的提升;
-
经营性现金流------收入不能全挂在应收账款上。
他的原话很直接:"如果你看现在市场上很多具身智能公司,他有收入,但其实全在应收帐款上,过一段时间可能又要归集为坏帐。"
优宝特机器人创始人范永:一个"3 岁小孩"的比喻
"人形机器人现在就是一个 3 岁的小孩,不要指望他现在去打工挣钱。但如果你相信他是个健康的孩子,他一定能长到 18 岁。"
云松鼠智能创始人黄骏达:一个更激进的判断
认为五指灵巧手的 收敛速度 会比行业预期的快得多------"不是三到五年,更不是五到十年,未来两年内就能见分晓。"如果成立,操作端的瓶颈可能比很多人预期中更早被打破。
这个判断值得单独标出来。它和第 8 篇(缺灵巧手末端数据)、本篇第 9 节(数据优先级里"精准 3D 位姿"排第一)指向的是同一个瓶颈------手。
8. 钱往哪流:资本的分水岭
**2026 年上半年,具身智能赛道融资额达到约 460 亿元人民币。**拆开看:
-
其中 170 亿是早期轮次;
-
而这 170 亿里的 70% 集中在头部 10 家公司。
资本盛宴之下,资金实际高度集中。
口径核对(重要):460 亿这个数字我做了交叉检索。2026 年 6 月中旬的钛媒体、投资界(PEdaily)报道均使用"460 亿"口径;而 2026 年 7 月 10 日中国证券报、经济日报(中国经济网)、东方财富等报道使用的是"具身智能融资半年破 900 亿"。两个数字差了近一倍,且都出自正规财经媒体。差异大概来自统计口径(全球/中国、是否含战略投资与上市相关融资、披露口径宽窄),但原文没有说明自己用的是什么口径。对外引用时务必选一个并注明来源,不要把两者混用。
宇树科技的 IPO 被视为行业的一个分水岭节点。
-
联想之星合伙人高天垚的判断:宇树在二级市场"千亿问题不大";
-
但戴恺提出了一个微妙的反论:"人形机器人最核心的竞争力在大脑层面,但宇树目前在这方面的投入和展现出的认知,还没有到那么高的层面。"他补充:"从整个产业的发展来说,我希望宇树能够在资本市场取得更大的成功。但同时,估值会越来越趋于理性。"
-
范永从产业链角度给出另一个框架:"这个产业链很长,关键模组、本体、小脑、大脑,每一个环节都能深耕出优秀的企业。如果要做一个全栈且每个环节都强的公司,短期内很难。"他认为未来三五年能把营收跑起来的更可能是本体企业 ,因为"大脑最终要附生到本体上才有落地的市场"。
高天垚对投资逻辑变化的概括是:"大家都在看,共识的东西还比较多,所以我们希望项目的差异化要突出。"
9. 量不等于质:全文最有价值的一节
这一节作者用了一句"捅破窗户纸"的引语作标题,我认为这是全篇最该被记住的部分。
先是一个类比(无问智科创始人刘盛翔):
-
行业里大家都在喊"缺数据",但即使把一千万小时的数据摆在面前,能不能用起来也是个大问题;
-
"就像英伟达的算力基座,如果没有 CUDA 生态,再好的 GPU 也用不起来。数据同理,缺的不仅是数据,更是整套的工具链和测评体系。"
-
他给出三层框架:一套好用的物理 AI 数据基座,至少应包括数据本身、配套的工具链、相应的测评体系------"就像人一样,要边学习边考试,边做模仿学习边做强化学习,螺旋式成长。"
这把这个问题的坐标从"数据够不够多"推到了"数据能不能被有效利用 "。数据生产的瓶颈正在被人类视频路线打破,但数据"消化"的能力------清洗、标注、增强、评测------还没跟上,而后者可能才是未来一段时间真正的瓶颈。
然后是陈源培那个反直觉的例子:
给素材方下发一个任务,要求采 1000 个任务,每个任务采 100 小时,凑出 10 万小时。同样的 1000 个任务,每个任务只采 1 小时,只有 1000 小时。"它们在训练上的作用是差不多等效的。"
换句话说:**数据的价值主要来自任务和场景的覆盖面,而不是同一件事被重复多少遍。**盲目堆时长,很可能只是在采集成本上做了无用功。
他描述的管线有多复杂(这部分解释了"为什么处理比采集难"):
-
视觉端:调 SAM 模型把操作者的手从画面中分割出来 → 用 inpainting 模型把背景补上 → 调用仿真器把机器人的模型渲染贴上去;
-
动作端:调世界模型对动作做修正 → 再调强化学习做策略优化。
"每一个环节在单次执行时都没有问题,但全部堆上去放量的时候,每个地方都是卡点。"
他给出的优先级排序(这是本批材料里少见的、可操作的判据):
-
数据集构建层面:任务多样性 > 物体多样性 > 场景多样性
-
感知模态层面:精准 3D 位姿 > 触觉模态 > 2D 图像特征
而他自己也说,这套标准本身还在"研发状态"。
最后是一个数字,比任何论断都更有说服力 :灵初智能虽然采集了 10 万小时人类数据,却只从中筛选出约 5417 小时真机等效数据用于模型训练。
10. 收束:一次"重新锚定"
作者的总结:从数据路线的全面换锚,到模型范式的隐式迁移,从商业化节奏的分层判断,到资本流向的结构性分化,具身智能行业正在经历一次深层的"重新锚定"。
真机数采仍然是精细微调阶段不可替代的黄金标准,但在预训练层面,人类数据正在成为主流。这不是一场零和博弈,而是一次行业分工的重新划定。
三、重点名词解析
VLA(Vision-Language-Action 模型) 一句话:一个模型同时看懂画面、听懂指令、然后直接输出机器人该做的动作。 准确定义:把视觉编码器、语言模型与动作生成头联合训练的端到端机器人策略模型。输入是图像与自然语言指令,输出是关节指令或末端位姿序列。本文的要点是:VLA 本质是 监督学习 框架,天花板受限于高质量真机数据的稀缺------它无法像大语言模型那样遍历所有可行动作空间。
世界模型(World Model) 一句话:让 AI 在"脑子里"预演"如果我这么做,接下来会发生什么",不用真去试。 准确定义:对环境动态的压缩表示与预测模型,学习状态如何在动作作用下演化,从而支持规划与想象式训练。本文把世界模型分成两大流派------显式 (预测画面的下一帧)和隐式(只建模必要的状态变化)。
显式世界模型 vs 隐式世界模型 一句话:显式的是把下一帧画面整个画出来给你看,隐式的是只记住"变了什么",不画细节。 准确定义:显式路线(如英伟达 Cosmos Policy)在像素空间预测未来帧,能保留全部视觉信息但计算成本极高,且需要建模大量对决策无关的细节(皮肤纹理、衣服褶皱等)。隐式路线(如 Latent World Action Model)在隐空间建模状态转移,效率可高出两到三个数量级。本文引用的对比是:同样 50 小时数据,显式需约 4000 小时 GPU,隐式约为其 1/80。
Latent World Action Model(隐式世界-动作模型) 一句话:不画图,只在"压缩后的理解空间"里推演状态怎么变、动作该怎么给。 准确定义:智在无界采用的路线,把世界模型的状态建模与动作生成放在隐空间进行,避开像素级重建的高昂成本。郑思鹏的说法是"只建模必要的状态变化,不预测完整画面"。
外骨骼 触觉手套(Psi-SynEngine 路线) 一句话:戴上带传感器的手套干活,手的每个关节角度、指尖使了多大力,全被记下来。 准确定义:通过可穿戴外骨骼机构直接测量人手关节运动与触觉信号的采集设备。本文提到灵初智能的自研版本为 62+ 自由度 ,精度亚毫米级 ,处理后数据可等同真机数据直接驱动机器人使用------这是它相对纯视觉人类视频的关键优势。代价是需专用硬件,规模扩张慢。
人类第一人称视频数据(Ego-centric data) 一句话:以人的视角拍下来的干活视频,机器从中学"人是怎么操作的"。 准确定义:以第一人称视角采集的人类操作视频,用于具身模型的预训练表征学习。优势是成本低、天然覆盖广阔的动作空间分布;局限是缺少 duty pose(手部姿态)信息,无法很好地恢复接触状态,因此无法直接驱动机器人。
out-of-distribution(OOD,分布外) 一句话:遇到训练时没见过的场景和任务,模型就露馅。 准确定义:测试数据的分布与训练数据分布不一致的情形。本文用它解释真机数据路线的根本局限------监督学习出来的模型只有"背板能力",一旦遇到 OOD 场景和任务,效果急剧下降。
duty pose 一句话:手在干活那一刻的精确姿态,是判断"接触有没有发生、怎么发生"的关键信息。 准确定义:本文引语中出现的术语,指操作瞬间末端执行器(手)的位姿状态。缺少这个信息就无法还原接触状态,这也是纯视频数据无法直接驱动机器人的核心原因。(该词在原文中未作定义,属直接引用,建议以后续一手资料为准。)
MolmoSpaces 一句话:一个公开的机器人能力评测榜单/测试环境,模型在上面刷分。 准确定义:本文提到灵初智能 Psi-R2 基于近 10 万小时人类数据在其上"登顶"。属第三方评测环境,具体评测维度原文未展开。
RoboCasa 一句话:斯坦福等机构做的家庭场景机器人操作基准测试。 准确定义:本文提到无界动力的 MWA™ 隐空间世界模型在其榜单上超越英伟达 GR00T-N1.6。属第三方基准。
Sim-to-Real Gap 一句话:在模拟器里学会的本事,搬到真机上经常失灵。 准确定义:仿真环境与真实物理世界在视觉外观、材质属性、接触动力学、传感器噪声等方面的系统性偏差。本文的定位是:仿真更适合做预验证和补充增强,但担不起主力数据的角色。
复购率 / ROI ≥ 30% / 经营性现金流 (本文的三个落地指标) 一句话:别看融资新闻,看客户会不会再来买、省下的人力能不能算得清、钱有没有真到手。 准确定义:宇泛智能 CFO 戴恺提出的三个衡量具身智能公司落地质量的指标,分别对应客户黏性、投资回报可量化程度、以及收入质量(是否有真实现金流入而非挂账应收)。
四、数字速查表
| 数字 | 含义 | 口径与我的核对 |
|---|---|---|
| 10~15 元 | 一条 30 秒真机操作数据的采集成本 | 受访方/行业估算,原文未附独立来源 |
| 约 1000 元 | 采集 1 小时的折算成本 | 同上 |
| 2 亿元以上 | 凑够 20 万小时的成本 | 基于上两项的推算,非实测 |
| 100 万小时以上 | V-JEPA 训练所用视频量 | Meta 团队论文口径,原文未注出处,需回原文确认 |
| 1000 小时 | 智在无界 Being-H0 用的人类第一人称视频量(2025-07) | 公司披露 |
| 近 2 万小时 | Being-H0.5 规模(2026-01) | 公司披露 |
| 20 万小时 | Being-H0.7 规模(2026-04/05) | 公司披露 |
| 1~3 万小时 | 英伟达 EgoScale/DreamDojo 使用的人类视频量 | 公司公开资料,原文表述为"分别使用 1 到 3 万小时不等" |
| 近 10 万小时 | 灵初智能 Psi-R2 的训练数据规模 | 公司披露 |
| 27 万小时 | Generalist GEN-0 训练数据量 | 厂商自述。官方博客发布 2025-11-04,"首次观察到机器人领域 Scaling Law"为中文媒体转述口径 |
| 62+ 自由度 | 灵初智能外骨骼触觉手套的自由度 | 公司披露,自由度指可独立测量的关节运动维度 |
| 亚毫米级 | 该手套的采集精度 | 公司披露 |
| 4000 小时 GPU | 50 小时数据用显式世界模型训练所需的算力 | 受访方自报,无第三方验证 |
| 1/80 | 隐式相对显式的成本比 | 受访方自报 |
| 千亿级 | 扩展到 20 万小时时显式路线的推算投入 | 受访方推算,非实测 |
| 3~5 年 | 2B 比 2C 快的时间差 | 行业共识性质判断,原文称"一个基本共识正在形成" |
| 30% | ROI 门槛(替代人效的可量化提升) | 宇泛智能 CFO 提出的标准,非行业统计 |
| 约 460 亿元 | 2026 上半年具身智能融资额 | 媒体统计 (钛媒体 2026-06、投资界 2026-06)。⚠️ 另有 900 亿 口径(中证报等,2026-07-10),差异未说明,引用需择一并标源 |
| 170 亿 / 70% | 早期轮次金额;其中集中在头部 10 家的比例 | 媒体统计,口径同 460 亿 |
| 10 万小时 → 约 5417 小时 | 灵初智能采集的人类数据量 → 筛出的真机等效数据量 | 公司披露 。折算比例约 5.4%,是全文最能说明"量不等于质"的数字 |
| 2 年 | 云松鼠智能黄骏达预测五指灵巧手收敛的时间 | 个人判断,属最激进的一档看法 |
五、我的追问
1. 全文最有价值的一句话,其实没有对照实验撑腰。
"10 万小时可能不如 1000 小时"------陈源培给的是"差不多等效 "的定性比较,没有公开的对照实验数据。如果这个结论成立,它意味着当前数据管线的"有效信息密度"低到惊人,那么优化管线的边际收益会远高于扩大采集。这是个如果为真就足以改变行业资源配置的判断,值得追后续有没有论文或评测把它做实。
2. 论证链条里有一个明显的缺席:人类数据自己的成本账。
文章开头用真机遥操的成本(30 秒 10~15 元、20 万小时 2 亿元)证明了"真机路走不通"。但整个论证的落点是"人类数据更便宜",这个替代方案自己的成本却从头到尾没有给数字:
-
62+ 自由度外骨骼触觉手套,一套多少钱?
-
采 10 万小时要多少人、多少套设备、多长时间?
-
换算到"每有效小时"的成本是多少?
**这是本篇最关键的论证缺口。**没有这个数字,"人类数据更便宜"就还是定性判断。
3. 第 9 节和第 1 节其实在打自己的脸------但这是个健康的打脸。
第 1 节的逻辑是"成本太高 → 撑不起 Scaling";第 9 节却告诉你,就算把 10 万小时摆在面前,筛完只剩 5417 小时(约 5.4%)能用 。这两个事实叠加起来的含义是:真正的成本瓶颈不只在采集端,更在处理端的转化效率。 如果转化率只有 5%,那么"采集成本 × 20"才是真实的数据成本。原文把这两件事放在同一篇里但没有把它们乘起来------这是我认为读者可以自己往前推一步的地方。
4. "稀缺的是精准 3D 位姿"这个排序,和第 10 篇的观察正好对上。
陈源培给的感知模态优先级是"**精准 3D 位姿 > 触觉模态 > 2D 图像特征**"。而第 10 篇(知乎,2024 年 12 月)在盘点学术界数据集时指出,最稀缺的三样正是"** 末端力传感器、Depth 信息和手眼标定位姿**"。**两篇相隔约一年半、立场和体裁完全不同,却在"缺什么"上高度一致。**这种独立信源的收敛,比任何单篇的论断都更可信。
5. 宇树的分歧是今天最有意思的"未定论"。
高天垚说宇树二级市场"千亿问题不大",戴恺说它大脑层面的投入"还没有到那么高的层面"、估值会趋于理性,范永说未来三五年能跑营收的更可能是本体企业(因为大脑要附生到本体)。三个判断互相不完全兼容,而且分别来自投资人、产业 CFO、本体创业者------立场各自成立。宇树 IPO 之后的表现,会是检验哪一方判断更准的第一个公开样本。
6. 一个需要打问号的转述。
"据灵初智能方面透露,OpenAI、英伟达、Meta 等也在大规模采购人类数据"------这条没有出处、没有数字、无法核实,且来自利益相关方(灵初自己就在卖人类数据采集方案)。文中其他引用多数能对上人,这一条属于最弱的一环,建议标记为传闻。
六、原文
原文入口
-
标题:《具身智能的真机数采,到了分水岭》
-
来源:钛媒体 APP(AGI-Signal 出品)
-
作者:AGI-Signal;编辑:秦聪慧
-
发布时间:2026-07-17 11:06
关键摘录(以下为原文引语,已标注出处,仅作评述引用)
"看来看去,唯一一个能够 Scaling 的数据,其实就是人类数据。"------灵初智能技术负责人陈源培
"10 万小时的人类数据,有些时候可能还不如 1000 个小时。"------同上
"就像英伟达的算力基座,如果没有 CUDA 生态,再好的 GPU 也用不起来。数据同理,缺的不仅是数据,更是整套的工具链和测评体系。"------无问智科创始人刘盛翔
"人形机器人现在就是一个 3 岁的小孩,不要指望他现在去打工挣钱。但如果你相信他是个健康的孩子,他一定能长到 18 岁。"------优宝特机器人创始人范永
"如果你看现在市场上很多具身智能公司,他有收入,但其实全在应收帐款上,过一段时间可能又要归集为坏帐。"------宇泛智能 CFO 戴恺
"不是三到五年,更不是五到十年,未来两年内就能见分晓。"------云松鼠智能创始人黄骏达,谈五指灵巧手的收敛速度
"每一个环节在单次执行时都没有问题,但全部堆上去放量的时候,每个地方都是卡点。"------陈源培,谈数据管线
版权提示:以上仅为短句评述性引用,请勿转贴原文全文;如需引用请回到原链接并注明出处。
七、延伸阅读与横向关系
与本批三篇的关系
| 第 8 篇(36 氪) | 第 9 篇(本篇) | 第 10 篇(知乎) | |
|---|---|---|---|
| 体裁 | 产业媒体评论(带厂商案例) | 深度访谈 + 行业观察 | 技术综述博客 |
| 时间 | 约 2025 年末~2026 年初 | 2026-07-17 | 2024-12-23(2025-01-17 更新) |
| 角色 | 问题清单 | 现场访谈/主样本 | 技术底图 |
| 主要信源 | 灵巧智能(外骨骼) | 灵初智能、智在无界、无问智科、宇泛、优宝特、云松鼠、联想之星等 | 学术论文 + 特斯拉/PI/智元公开资料 |
| 回答"缺什么数据" | 缺灵巧手末端操作数据 | 任务多样性 > 物体多样性 > 场景多样性;精准 3D 位姿 > 触觉 > 2D 特征 | 末端力传感器、Depth、手眼标定位姿最稀缺 |
| 回答"谁会成为主流" | 协同论:设备互补不取代 | 分工论:人类数据占预训练、真机退到精细微调 | 记录 2024 年答案:机械臂遥操数据质量最高 |
三条主线(与第 8 篇共用,此处只补充本篇特有的观察)
主线一补充|两年内答案翻转的完整证据链,本篇提供得最完整。
第 10 篇(2024 年 12 月)记的是:机械臂遥操数据质量最高 ,Physical Intelligence 明确不采用仿真与视频数据。第 9 篇(2026 年 7 月)记的是:人类数据在预训练层面成为主流,真机数据退到精细微调 。中间的关键转折点在本篇的时间线里非常清楚------2026 年 2 到 3 月,英伟达发布 EgoScale 与 DreamDojo,被作者点名为"关键的验证信号"。记住这个时间节点,它很可能是将来回看这段历史时的分水岭。
主线二补充|"采集容易消化难"这条线,本篇给了最硬的证据。
第 9 节的三个事实组成一条完整链条:数据管线在放量时"每个地方都是卡点" → 10 万小时筛完只剩约 5417 小时 → 而无问智科说就算有一千万小时也可能"用不起来"。三篇各自独立指向"瓶颈在消化端",这是本批材料里最可靠的结论。
主线三补充|本批的信源已经在本篇得到部分平衡。
第 8 篇的案例方和本篇的主要访谈对象都偏外骨骼路线。本篇额外的价值是它同时引了纯视觉路线(智在无界郑思鹏)和传统路线(智元、宇树) ,还引了投资方(联想之星高天垚)和本体创业者(范永)的不同判断。金句密度最高的是外骨骼阵营,但分歧本身也被完整保留了------这是本篇写作上比第 8 篇更扎实的地方。
需要后续核实的事项
-
"10 万小时不如 1000 小时"的对照实验 ------ 目前只是定性说法,建议追踪灵初智能是否有后续论文或评测发布。
-
人类数据采集自身的成本 ------ 外骨骼手套单价、单位有效小时成本,本篇完全缺失,是最大的论证缺口。
-
OpenAI/英伟达/Meta"大规模采购人类数据" ------ 单方转述、无出处、来源方有利益相关,建议按传闻处理。
-
460 亿 vs 900 亿两个融资口径 ------ 需确认统计范围差异,对外引用必须择一并标源。
-
V-JEPA 的"100 万小时以上视频" ------ 回 Meta 原论文确认口径(是训练数据总量还是某一阶段)。
-
RoboCasa 榜单上 MWA™ 超越 GR00T-N1.6 ------ 建议核对榜单快照日期,榜单排名具有时效性。
-
MolmoSpaces 的评测维度 ------ 原文未展开,Psi-R2"登顶"的具体项目需回原榜确认。