小米新发布的 Robotics-1 在向市场传递什么信息?

小米科技刚刚发布的Xiaomi-Robotics-1(XR-1)机械臂,是一个基于两个阶段训练的视觉-语言-动作(VLA)基础模型的具身智能硬件:

|----------|----------------------------------------------------------|-----------------------------------------------------|
| 阶段 | 所需数据 | 小米已有的规模 |
| 预训练 | 无具身形态(UMI)视频------人类/手部在多样真实场景中操作物体的录像,经 VLM 自动标注为状态转移文本 | 10万小时,覆盖1,700+场景(家庭、商业场所、工业场地、户外空间) |
| 后训练 | 高质量、带指令标注的真实机器人数据 + 跨具身形态数据,用于将动作与语言指令对齐 | 7,200小时自有机器人数据 + 经筛选的开源数据 + 部分UMI数据 |
| 应用落地 | 每项任务仅需数小时的针对性数据,用于快速适配 + 基准评测 | 手机装箱、打印机加墨、洗衣装载、箱子打包,以及RoboCasa/VLABench/RoboDojo基准 |

根据小米产品发布网页上的介绍:"大规模、高质量的数据难以获取,而这种稀缺性------比其他任何因素都更------限制了策略模型能够扩展的上限。" 他们明确地将数据------而非算力、也非架构------定位为下一代机器人基础模型发展的核心瓶颈。

而这正是 Bright Data 的核心业务。

"小米已经用UMI打破过一次数据壁垒。Bright Data 能让你以互联网级规模、持续不断、且合规地再次打破这道壁垒。"

XR-1整个扩展(scaling)叙事的核心,依赖于向模型持续输入更多样化、真实世界的操作轨迹数据,以及更丰富的语言标注。Bright Data 是唯一能够在合法合规的前提下,以互联网级规模持续供应这类数据的基础设施------把小米现有的"一次性10万小时数据集",转变为一条持续刷新的数据管道。

亮数据为具身智能领域打造专属的数据管道

  1. 预训练数据护城河 → Media Data API + Web Archive(网络存档)

小米的预训练语料本质上是"第一人称/人类操作视频 + 语言标注"的组合。这恰恰正是 YouTube、TikTok、B站(Bilibili)、Vimeo 上大量存在的内容类型------教程视频、家居整理内容、工业/商业流程录像、户外任务视频------其规模是任何内部爬虫团队都无法企及的。Bright Data 的 Media Data API 可从这些平台提取视频、音频、字幕、缩略图和故事板,且不会遇到诸如 yt-dlp 等工具常见的限流、地域封锁和反爬检测问题。再结合 Web Archive(PB级历史网络/视频数据)可以补充长尾场景覆盖,突破当前1,700个场景的限制------新场景意味着新的扩展收益,这正符合他们自己展示的scaling曲线。

  1. 自动标注与指令对齐 → Datasets Marketplace + Search/Crawl API

小米的VLM自动标注器需要有依据的语言描述来标注场景/物体(如"整理沙发"、"分类鞋柜"、"收纳厨具")。Bright Data 结构化的电商与家居/产品数据集(Amazon、Wayfair、Home Depot等零售商)可提供机器人操作对象的精确产品分类、属性和图像------从而提升物体定位与指令-动作对齐的准确度。Search API(SERP) 和 Crawl API 还可以大规模抓取操作教程类文章和任务说明,丰富指令对齐所需的语言侧数据。

  1. 场景多样性与全球泛化能力 → 住宅代理网络(Residential Proxy Network)+ 地域定向采集

XR-1的scaling曲线显示,成功率会随着数据量/多样性的增加持续攀升,尚未出现饱和迹象。Bright Data 的住宅IP网络几乎覆盖全球所有国家,能让小米采集到具有地区差异的家居布局、家电类型、零售环境和文化相关的任务变体------这对于要从中国家庭场景推广到众多打算布局的全球市场的厂商来说,至关重要。

  1. 后训练与任务适配的数据新鲜度 → 定制采集 API(Custom Collection API)

新任务(打印机加墨、洗衣装载、箱子打包)的数据显示,XR-1仅需数小时示范数据即可达到较高成功率。Bright Data 的定制数据集/采集API能让具身智能厂商按需、可编程地为任何新任务类别抓取新鲜、有针对性的网络数据------加速演示中提到的"新任务高效适配"流程,而不必依赖人工数据采集活动。

  1. 竞争与基准情报 → 监控/Discover API

Bright Data 可以为具身智能厂商搭建自动化监控系统,追踪竞争对手在RoboCasa365、RoboDojo、VLABench排行榜上的位置。排行榜动态、arXiv/GitHub机器人领域的最新发布,以及竞品基础模型的动态(如Physical Intelligence的π0.5、Google RT-X等)------让厂商的研究团队获得持续的竞争情报,而非依靠人工追踪。

  1. 大规模合规保障 → KYC 与信任中心(Trust Center)

视频/媒体类训练数据具有敏感性------Bright Data 已经将其纳入KYC(了解你的客户)审核流程。对于身处全球监管高度关注下的小米而言,这不是阻碍,而是差异化优势:它能让注重合规跨国企业或大型科技公司的法务/合规团队对数据来源进行可审计的合规审批(仅限公开可用数据),而非依赖临时性抓取。

总结

小米用产品证明了:扩展无具身形态数据能可预测地提升真实机器人性能,且目前尚未看到饱和迹象。现在的瓶颈已经不再是模型------而是取决于具身智能厂商能以多快的速度持续为模型提供多样化、新鲜的真实世界视频与语言标注上下文。

Bright Data 是数据基础设施层,能将整个公开互联网------YouTube、TikTok、电商目录、教程内容、全球住宅环境------转化为合规、持续刷新的数据管道,正是这类UMI预训练和指令对齐数据才能让像XR-1的具身智能设备达到了业界领先水平。与其拥有一次性的10万小时数据集,不如想象一条能与你们共同持续扩展的数据管道。"

点击面向 VLA 流水线的视频信息流通过面向 VLA 流水线的 Web 规模视频信息流,打破远程操作瓶颈。按任务族定向的视频片段 + 元数据,开箱即用,可用于人形机器人策略训练。https://www.bright.cn/ai/video-data/vla?utm_source=organic-social-cn&utm_campaign=csdn进入亮数据相关主页了解更多产品服务细节,并预约数据产品演示!


复制链接https://robotics.xiaomi.com/xiaomi-robotics-1.html,进入小米机械臂Robotics-1新品发布网页!

相关推荐
m0_547486668 小时前
《机器人学与具身智能》全套课件PDF2026
机器人·具身智能
白拾3 天前
【ICML 2026 (Oral)】RoboMME 论文解读:首个大规模具身记忆评测基准,系统评估 VLA 长程记忆
人工智能·机器人·具身智能·vla·icml·记忆·基准评测
TsingtaoAI4 天前
基于MyCobot Pro 450机器人的VLA多模态具身智能实训建设方案
机器人·大模型·具身智能
科研小刘带你玩学术6 天前
【科研快讯】从自动执行到自主决策:具身智能正在推动AI进入机器人智能时代
人工智能·机器学习·具身智能·未来趋势·ai机器人·智能系统
HyperAI超神经7 天前
15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge
人工智能·深度学习·机器人·多模态·图像生成·具身智能·智能体
iiiiii117 天前
【论文阅读笔记】Reparameterization Proximal Policy Optimization (RPO):将PPO的稳定性引入可微分强化学习
论文阅读·人工智能·笔记·深度学习·机器学习·机器人·具身智能
才鲸嵌入式8 天前
JEPA具身智能或自动驾驶路线的公司
人工智能·机器学习·大模型·自动驾驶·具身智能·通用人工智能·jepa
深蓝学院10 天前
苏黎世联邦理工提出 EgoHTR:野外 4D 人体-地形对齐,把人类动作重新放回真实地形
具身智能