vla

白拾3 天前
人工智能·机器人·具身智能·vla·icml·记忆·基准评测
【ICML 2026 (Oral)】RoboMME 论文解读:首个大规模具身记忆评测基准,系统评估 VLA 长程记忆本文解读 ICML 2026(Oral)论文《RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies》。该论文提出大规模具身记忆评测基准 RoboMME,通过融合认知心理学记忆分类框架与非马尔可夫任务设计,系统性评测 VLA 模型的长程记忆能力,其特别之处在于首次同时覆盖时序、空间、对象、程序四种记忆维度,并在统一 π0.5 基座上构建 14 种记忆增强变体进行公平对比。实验表明感知记忆 + Modula
ergevv7 天前
机器人·vla·世界模型·空间智能·认知地图
从大模型到空间智能:未来机器人的终极架构畅想过去几十年,机器人技术一直在追求一个目标:让机器像人一样感知世界、理解世界,并在世界中自主行动。然而,传统机器人距离这个目标始终存在巨大鸿沟。
Cx330_FCQ11 天前
具身智能·vla·lerobot
LeRobot SO-101 机械臂从底层控制到 VLA 视觉语言动作模型完整实操复盘本次任务主要学习 SO-101 机械臂的运动学基础,包括:实验代码:Task2 目录主要包含:本题采用改进型 DH,也就是 Craig 约定。相邻坐标系之间的变换为:
一颗小树x12 天前
机器人·指南·操作·vla·世界模型
机器人世界模型:2026 技术全景与工程选型指南前言:2026 年的机器人世界模型已分化成四条技术路线——视频生成、潜空间预测(JEPA)、3D 空间智能与具身操作。闭源旗舰(Sora 2、Genie 3、Marble、GR-2)定义能力上限,开源栈(Cosmos、V-JEPA 2、RynnVLA-002、HunyuanWorld)已覆盖绝大多数工程环节。物理保真是全行业短板,而工程终局不是单一路线胜出,而是「神经仿真器 + 显式物理引擎 + 潜空间规划」的分层混合架构。
一只空白格18 天前
具身智能·vla
pi0.6论文笔记一种从经验中学习的 VLA 模型图 1:RECAP 使得能够利用奖励反馈和干预数据来训练 VLA(视觉-语言-动作)模型。 我们的系统从一个结合了优势条件化(advantage conditioning)的预训练 VLA 模型开始,这使得模型能够有效地从真实世界的经验中学习。对于每项任务,我们部署该模型并收集自主执行数据(autonomous rollouts)以及在线的人类纠错数据。然后,我们利用这些在线数据微调价值函数,从而改进它对动作如何影响任务表现的估计。在这些更新后的优势估计之上对 VLA 进行
猫先生Mr.Mao18 天前
ai·机器人·具身智能·vla·π0.7
一文梳理 RT-2 到 π0.7:通用机器人策略的技术演进【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
猫先生Mr.Mao19 天前
ai·论文解读·具身智能·vla·onetwovla
具身智能之OneTwoVLA详解:如何统一推理与行动【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
一颗小树x20 天前
机器人·强化学习·amp·vla·复现
《VLA 系列》AMP 代码复现 | 强化训练 | 行走 跌倒 恢复本博客是基于 mjlab + rsl_rl 的 G1/H2 AMP 运动控制,同时支持走/跑、跌倒恢复 🚀
_张一凡23 天前
具身智能·vla
【论文解读】Native Video-Action Pretraining for Generalizable Robot Control论文:Native Video-Action Pretraining for Generalizable Robot Control(Robbyant,arXiv 2026) 发布时间:2026 年 7 月 9 日(arXiv v1) 作者:Qihang Zhang、Lin Li、Luyao Zhang、Shuai Yang、Yiming Luo、Shuaiting Li、…、Yujun Shen、Yinghao Xu(共 29 人) 核心一句话:用从零预训练的因果 video-action 基座(13B
猫先生Mr.Mao24 天前
ai·论文解读·具身智能·vla·机器人泛化
具身智能之π0.5:如何用异构数据训练开放世界 VLA【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
_张一凡24 天前
机器人·机械臂·具身智能·vla·机械臂数据集
【数据集汇总】机器人抓取与操作领域核心数据集汇总梳理在机器人具身智能与机械臂操控技术的发展进程中,高质量、大规模的数据集是算法迭代与模型泛化的核心基础。从早期的平面抓取检测,到如今的 6 自由度抓取、跨类别部件操作、双手灵巧操控,每一步技术突破都离不开对应基准数据集的支撑。
_张一凡25 天前
具身智能·vla·kairos
【论文解读】Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI论文:Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI(Kairos Team,arXiv 2026) 发布时间:2026 年 6 月 15 日(arXiv v1,v3 修订于 2026 年 7 月 3 日) 作者:Fei Wang、Shan You、Qiming Zhang、Tao Huang、Zuoyi Fu、Zhisheng Zheng、Yunlong Xi、Feng Lv、Xiaoming Wu、Zeyu
猫先生Mr.Mao25 天前
ai·论文解读·具身智能·vla·机器人基础模型
具身智能之 π0.7 详解:可控提示让机器人学会组合——如何把 VLA 推向通用泛化【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://ai-mzq.github.io/From-Zero-to-AGI/
一只空白格1 个月前
具身智能·vla
pi0.5面试题Fig. 3: Model overview. π0.5 is trained in two stages. First, a pre-training stage combines all of the different data sources to produce an initial VLA with discrete tokens. This stage uses data from diverse robotic platforms, high-level semantic action p
Agilex松灵机器人1 个月前
人工智能·3d·机器人·ros·slam·vla·松灵机器人
UMR × NAVIS:移动机器人行业级通用一体化底盘与3D导航解决方案在移动机器人逐渐进入智能制造、仓储物流、巡检运维及具身智能等行业应用的今天,越来越多开发者开始关注行业级通用一体化底盘与3D导航能力。相比传统需要分别选型底盘、导航系统和感知设备的开发模式,松灵机器人(AgileX Robotics)推出的 UMR 行业级通用一体化底盘结合 NAVIS 3D导航平台,能够帮助用户快速构建自主移动机器人,大幅降低开发与部署成本。
选与握2 个月前
机器人·vla·pi07
$\pi_{0.7}$: 一个具备涌现能力的可引导的通用机器人基础模型π0.7\pi_{0.7}π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
chen_zn952 个月前
人工智能·深度学习·具身智能·vla
VLA 的 Co-training:通过多源数据提升机器人泛化能力存在问题:机器人数据和互联网视觉语言数据教给模型的东西并不相同。一条常见的机器人轨迹通常包含以下信息:
万俟淋曦2 个月前
人工智能·ai·机器人·大模型·llm·具身智能·vla
【论文速递】2026年第04周(Jan-18-24)(Robotics/Embodied AI/LLM)中文使用 googletrans 翻译,翻译不对的地方以英文为准标题: Agentic Reasoning for Large Language Models
chen_zn952 个月前
人工智能·深度学习·具身智能·vla
OpenPi、GR00T的视觉语言模型与动作模型连接方式差异分析总结VLA模型通常可以拆成两个逻辑模块:视觉语言模型和动作生成模型,前者用于生成视觉语言语义特征,后者用于生成连续动作序列。