vla

猫先生Mr.Mao3 天前
论文解读·rt-x·具身智能·vla·机器人学习
具身智能跨本体学习之Open X-Embodiment详解:让22种机器人共享同一套操作经验【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
chen_zn954 天前
人工智能·具身智能·vla
《VLA 系列》MemoryVLA++ | 感知-认知记忆 | 潜空间未来想象 | 论文与源码边界解析单帧 VLA 容易遇到两类时间问题:它既不知道当前画面之前发生了什么,也无法判断正在运动的场景接下来会怎样变化。按钮按下前后几乎一样,需要过去记忆;传送带上的物体仍在移动,需要对未来位置做预判。MemoryVLA++ 的核心思路是把时间建模拆成过去、现在、未来三部分:当前观测形成工作记忆,感知-认知记忆库保存并检索历史,视频世界模型在潜空间提取未来动态,最后由扩散动作专家统一生成连续动作。
xiaobobo33304 天前
柔性数组·vla·宏定义·数组描述
c语言中的“柔性数组成员”(Flexible Array Member, FAM)我最近在研究我同事写的具有特定格式的一系列命令行,例如:指令格式:55 AA LL(包含命令字节+整个数据) MM(命令字节) DD ... 0A
zh路西法6 天前
c++·机械臂·路径规划·vla·planner·moveit2
【玩转VLA具身智能机械臂】(二):MoveIt2 运动规划——架构、配置与 C++ 上手说人话:MoveIt2 就是机械臂界的"全家桶"——第一期我们手写的 IK、碰撞、规划,官方都写好了,还打包成一个叫 move_group 的"中央调度器"。你只要告诉它"我要去哪",它自己会算 IK、查碰撞、调规划器、发轨迹
thesky1234567 天前
机器人·导航·操作·具身智能·智能体·vla·视觉语言动作
智能体面试准备(四十三):具身智能体与机器人实操——从 VLA 到 Sim2RealB24 讲智能体怎么操控图形界面(Computer Use),B40 讲自主智能体前沿里点到过具身与世界模型。本篇站到机器人视角,把那套"感知—决策—执行"落进真实物理世界:一个具身智能体(Embodied Agent)要能看、能想、能动手,在三维空间里抓取、移动、导航。这是大模型从"屏幕里的文字世界"走向"真实物理世界"的关键一跃,也是华为这类做多模态 + 机器人/终端岗位最看重的硬方向。本篇讲清具身智能的栈、VLA 模型、操作与导航、Sim2Real,以及它和普通 LLM Agent 的根本不同。
猫先生Mr.Mao8 天前
论文解读·具身智能·vla·机器人学习·世界模型
具身智能之UniJEPA详解:让机器人同时“听懂、预见、动起来”的统一表征学习【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
chen_zn9512 天前
具身智能·vla·世界模型·记忆机制·子任务
《VLA 系列》π0.7 | 多模态提示可控机器人基座模型 | 组合泛化与跨本体迁移 | 论文与复现思路π0.7 想解决的不是再做一个更大的 VLA,而是一个更棘手的数据问题:机器人数据一旦扩展到不同机器人、不同操作者、自动执行轨迹甚至失败样本,同一个任务会同时出现快慢不同、质量不同、策略不同的多种行为。若只给模型一句任务指令,模型很容易把这些模式平均在一起,学到一个哪种都不像的折中策略。
_张一凡12 天前
具身智能·vla
【论文解读】视觉语言导航 VLN:用 Matterport3D 真实全景和 R2R 众包指令,把“听懂人话再走路“做成首个可打分的具身基准论文:Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments(Australian National University / University of Adelaide / Queensland University of Technology / Macquarie University,CVPR 2018 Spotlight) 发布时间:2
还不秃顶的计科生12 天前
人工智能·深度学习·算法·机器学习·语言模型·vla·vlm
具身智能论文学习10:π0: A Vision-Language-Action Flow Model for General Robot Control如何在保留预训练 VLM 强大视觉语言知识的同时,直接生成高频、连续、精细的机器人 Action Chunk,从而实现通用且灵巧的机器人控制?
_张一凡12 天前
机器人·具身智能·vla·世界模型
【论文解读】VLN-R1:让大视觉语言模型直接吃第一人称视频走出连续动作,用 GRPO 强化微调和时间衰减奖励把“导航“做成 LVLM 的可验证后训练任务论文:VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning(The University of Hong Kong / Shanghai AI Lab,arXiv 预印本,cs.CV) 发布时间:2025 年 6 月 20 日(arXiv v1) 作者:Zhangyang Qi、Zhixiong Zhang、Yizhou Yu、Jiaqi Wang、Hengshuang Zhao(共 5 人;Jiaqi Wang、Hengshua
chen_zn9512 天前
人工智能·深度学习·transformer·具身智能·vla
《VLA 系列》Human-to-Robot Transfer | 人类视频共训练 | 跨本体涌现迁移 | 论文解析人类视频数量大、场景丰富,采集成本也比机器人遥操作低得多,但人和机器人长得不一样、运动方式不一样,动作空间更不一样。过去的方法通常要做视觉域对齐、手部重定向或专门的跨本体模块。这篇论文给出的结论反而很简单:当 VLA 已经在足够多的场景、任务和机器人本体上预训练后,不需要额外设计显式对齐损失,仅通过人类数据与机器人数据共微调,人类示范中的新场景、新物体和新任务知识就能迁移到机器人。
还不秃顶的计科生12 天前
人工智能·深度学习·学习·机器学习·语言模型·vla·vlm
具身智能论文学习8:Octo: An Open-Source Generalist Robot PolicyOpen X-Embodiment→多机器人、大规模数据Diffusion Policy→连续动作序列与扩散动作生成
chen_zn9513 天前
人工智能·强化学习·具身智能·vla
《VLA 系列》RLT | RL Token | 轻量 Actor-Critic | 在线强化学习与源码解析RLT(RL Token)解决的是一个很具体的问题:通用 VLA 已经会做任务,但到了插孔、拧螺丝、穿扎带这类最后一毫米的接触阶段,动作往往不够快,也不够稳。直接用在线强化学习更新数十亿参数的 VLA,真实机器人数据和算力都承受不起;完全绕开 VLA 训练一个小策略,又会丢掉大模型已经学到的视觉和操作知识。RLT 的做法是在两者之间加一个紧凑接口:先把 VLA 内部表征压缩成一个 RL token,再冻结 VLA,用小型 actor-critic 在真实机器人上做在线强化学习。
chen_zn9514 天前
人工智能·深度学习·注意力机制·vla
《VLA 系列》π0.5 + KI | 知识隔离 | 离散与连续动作联合训练 | 论文与源码解析π0.5 已经能把多种机器人、任务和通用视觉语言数据放进同一个训练体系,但继续扩大数据并没有消除一个很现实的矛盾:自回归动作 token 训练得快,却要逐 token 解码;Flow Matching 动作专家推理快,却可能让一个随机初始化的机器人模块通过反向传播破坏预训练 VLM 的语言知识。Physical Intelligence 在 Knowledge Insulation(KI,知识隔离) 中给出的答案,不是冻结 VLM,而是把两种动作表示放到同一个模型里训练,并只隔离有害的梯度路径。
chen_zn9514 天前
人工智能·具身智能·vla
《VLA 系列》π0 | Flow Matching 动作专家 | 跨本体机器人策略 | 论文与源码解析π0 要解决的核心矛盾很直接:视觉语言模型擅长理解图像和指令,却只能输出离散文本;机器人控制需要连续、高频、精细的动作。Physical Intelligence 的做法不是把动作粗暴地离散成 token,而是在 PaliGemma 旁边增加一个约 3 亿参数的动作专家,用 Flow Matching 一次生成 50 步连续动作块,再用跨机器人数据完成预训练和任务后训练。
chen_zn9515 天前
人工智能·具身智能·vla·世界模型·世界动作模型
《WAM 系列》Fast-WAM|视频共训练|跳过未来想象|实时WAMFast-WAM 基于 Wan2.2-5B 视频模型改造,采用 Video DiT + Action DiT 的双专家结构。核心思路是:训练时保留未来视频预测,推理时不再生成未来视频。论文用受控实验说明,WAM 的主要收益更可能来自训练阶段的视频共训练,而不是测试阶段显式生成未来画面。
self-motivation15 天前
vlan·vla·视觉语言导航·internvla-n1
InternVLA-N1:面向可学习潜在规划的开放双系统视觉-语言导航基础模型机构: Intern Robotics,上海人工智能实验室(Shanghai AI Laboratory) 日期: 2025-09-11 原文 PDF: InternVLA_N1.pdf 代码 / 模型 / 数据 / 主页: InternNav · InternVLA-N1 · InternData-N1 · Homepage
白拾24 天前
人工智能·机器人·具身智能·vla·icml·记忆·基准评测
【ICML 2026 (Oral)】RoboMME 论文解读:首个大规模具身记忆评测基准,系统评估 VLA 长程记忆本文解读 ICML 2026(Oral)论文《RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies》。该论文提出大规模具身记忆评测基准 RoboMME,通过融合认知心理学记忆分类框架与非马尔可夫任务设计,系统性评测 VLA 模型的长程记忆能力,其特别之处在于首次同时覆盖时序、空间、对象、程序四种记忆维度,并在统一 π0.5 基座上构建 14 种记忆增强变体进行公平对比。实验表明感知记忆 + Modula
ergevv1 个月前
机器人·vla·世界模型·空间智能·认知地图
从大模型到空间智能:未来机器人的终极架构畅想过去几十年,机器人技术一直在追求一个目标:让机器像人一样感知世界、理解世界,并在世界中自主行动。然而,传统机器人距离这个目标始终存在巨大鸿沟。