vla

Robot_Nav2 天前
具身智能·vla·vlm
前沿 | VLA 演进:从动作 Token 到分层具身智能体论文:Zitkovich et al., RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control, CoRL 2023。 论文:Black et al., π₀: A Vision-Language-Action Flow Model for General Robot Control, RSS 2025。 论文:Pertsch et al., FAST: Efficient Action Tokeniza
zh路西法3 天前
c++·机械臂·pca·vla·planner·obb·moveit2
【玩转VLA具身智能机械臂】(四):点云分割与 OBB 夹取——从 PCA 失效到主动扫描说人话:它不再依赖摩擦系数,而是确认"两指确实同时从两侧顶住了物体"之后,把物体固定到手上说人话:我们要把桌子和物料分开,桌子和地板交给 MoveIt 的 octomap 让它规划时躲开,物料则不要送进 octomap,交给 Object Pose 计算去求夹取位姿
一直在努力的小宁3 天前
agent·vla·vlm·vln·harness
[特殊字符] 具身智能Agent开发调研|零基础超详细笔记(万字长文)老师发了一份智能体开发调研文件,零基础看完全懵。花了一整天查资料、拆概念、整理成这份笔记。既是科普,也是自己的完整学习记录。全文包含所有细节、数据、例子、设计动机,建议收藏慢慢看。 具身智能Agent开发调研|零基础超详细笔记 - 小红书
feasibility.4 天前
ai·机器人·无人机·导航·具身智能·vla·vln
当“给机器人指路“成为一门数据工程学——SimpleNav 拆解:导航大模型的标准化之争一个场景:你想让无人机听懂"飞到那座红色屋顶的左边,绕过塔吊,停在空地上"。 三年前,这需要为一个数据集写一套数据解析、为一个仿真器写一套接口、为一个模型写一套评测脚本。2026 年,清华 THUNLP 联合 OpenBMB 等机构开源的 SimpleNav 说:这套东西应该只需要写一次。
_张一凡5 天前
机器人·具身智能·vla
【论文解读】 一篇读懂VLA具身推理诊断基准RoboSPA:从细粒度空间消歧到长程程序规划,五级难度把VLA量到“不如随机猜“写在前面: 社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~ AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设! AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智
deepseek238 天前
具身智能·vla·世界模型·机器人基础模型·多机器人协作
芝诺 Zeno-1 去中心化协作具身基础模型拆解:3B 参数把多机器人协作写进单一策略,CPI 闭环训练与行动条件世界模型如何预警接触失败给两台工业机械臂设计协作系统,最直觉的思路是先让它们互相商量。谁先抬哪头,谁后发力,顺序写进通信协议里,两台照章执行就行。可机械车间里根本没有这么干净的剧本,钢珠会在托盘上滑动。光源会让相机偏转,协议里写死的理想状态,一到真实环境就全部失效。
VL——MOESR8 天前
论文阅读·机器学习·vla·pi0
【具身智能】π0论文阅读随笔本文是在阅读《π0: A Vision-Language-Action Flow Model for General Robot Control》时记录的笔记,带有很强个人主观性,仅供参考。
_张一凡10 天前
具身智能·vla
【论文解读】一篇读懂 VLA 模态纠缠:从证据打分到双铰链一致性损失,零推理开销让策略只信该信的传感器写在前面: 社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~ AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设! AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智
chen_zn9510 天前
人工智能·具身智能·vla
《WAM 系列》Zero-WAM | 人类视频上下文学习 | 未来片段预测 | 零样本跨任务泛化机器人面对一个训练中从未出现的任务时,真正缺少的往往不是一句更长的语言指令,而是一份能展示目标对象、操作过程和执行顺序的任务说明。Zero-WAM 把人类示范视频当作部署时的上下文提示:模型不更新参数,也不要求为新任务采集机器人演示,而是先根据人类视频生成下一段机器人视频,再把预测的视觉变化解码为可执行动作。
VL——MOESR11 天前
论文阅读·机器学习·具身智能·vla·openvla
【具身智能】OpenVLA论文阅读随笔本文是在阅读《OpenVLA:An Open-Source Vision-Language-Action Model》时记录的笔记,带有很强个人主观性,仅供参考。
VL——MOESR13 天前
论文阅读·机器学习·turbo·具身智能·vla
【具身智能】TurboVLA阅读随笔本文是在阅读《TURBOVLA: REAL-TIME VISION-LANGUAGE-ACTION MODEL AT 32 HZ ON AN RTX 4090 WITH <1 GB VRAM》时记录的笔记,带有很强个人主观性,仅供参考。
VL——MOESR15 天前
论文阅读·人工智能·机器学习·具身智能·vla
【具身智能】VLA论文阅读随笔本文中部分模型仅仅作简要介绍而不会详细研究。一些经典的模型可能会单独写文章介绍。《A Survey on Vision-Language-Action Models for Embodied AI》
chansonzhang20 天前
ai·vla·π0
[2024] [π0] [π0: A Vision-Language-Action Flow Model for General Robot Control]π0: A Vision-Language-Action Flow Model for General Robot Control, 2024 RT-2 中将动作离散化为 256 个离散 token
猫先生Mr.Mao24 天前
论文解读·rt-x·具身智能·vla·机器人学习
具身智能跨本体学习之Open X-Embodiment详解:让22种机器人共享同一套操作经验【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
chen_zn9524 天前
人工智能·具身智能·vla
《VLA 系列》MemoryVLA++ | 感知-认知记忆 | 潜空间未来想象 | 论文与源码边界解析单帧 VLA 容易遇到两类时间问题:它既不知道当前画面之前发生了什么,也无法判断正在运动的场景接下来会怎样变化。按钮按下前后几乎一样,需要过去记忆;传送带上的物体仍在移动,需要对未来位置做预判。MemoryVLA++ 的核心思路是把时间建模拆成过去、现在、未来三部分:当前观测形成工作记忆,感知-认知记忆库保存并检索历史,视频世界模型在潜空间提取未来动态,最后由扩散动作专家统一生成连续动作。
xiaobobo333025 天前
柔性数组·vla·宏定义·数组描述
c语言中的“柔性数组成员”(Flexible Array Member, FAM)我最近在研究我同事写的具有特定格式的一系列命令行,例如:指令格式:55 AA LL(包含命令字节+整个数据) MM(命令字节) DD ... 0A
zh路西法1 个月前
c++·机械臂·路径规划·vla·planner·moveit2
【玩转VLA具身智能机械臂】(二):MoveIt2 运动规划——架构、配置与 C++ 上手说人话:MoveIt2 就是机械臂界的"全家桶"——第一期我们手写的 IK、碰撞、规划,官方都写好了,还打包成一个叫 move_group 的"中央调度器"。你只要告诉它"我要去哪",它自己会算 IK、查碰撞、调规划器、发轨迹
thesky1234561 个月前
机器人·导航·操作·具身智能·智能体·vla·视觉语言动作
智能体面试准备(四十三):具身智能体与机器人实操——从 VLA 到 Sim2RealB24 讲智能体怎么操控图形界面(Computer Use),B40 讲自主智能体前沿里点到过具身与世界模型。本篇站到机器人视角,把那套"感知—决策—执行"落进真实物理世界:一个具身智能体(Embodied Agent)要能看、能想、能动手,在三维空间里抓取、移动、导航。这是大模型从"屏幕里的文字世界"走向"真实物理世界"的关键一跃,也是华为这类做多模态 + 机器人/终端岗位最看重的硬方向。本篇讲清具身智能的栈、VLA 模型、操作与导航、Sim2Real,以及它和普通 LLM Agent 的根本不同。
猫先生Mr.Mao1 个月前
论文解读·具身智能·vla·机器人学习·世界模型
具身智能之UniJEPA详解:让机器人同时“听懂、预见、动起来”的统一表征学习【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
chen_zn951 个月前
具身智能·vla·世界模型·记忆机制·子任务
《VLA 系列》π0.7 | 多模态提示可控机器人基座模型 | 组合泛化与跨本体迁移 | 论文与复现思路π0.7 想解决的不是再做一个更大的 VLA,而是一个更棘手的数据问题:机器人数据一旦扩展到不同机器人、不同操作者、自动执行轨迹甚至失败样本,同一个任务会同时出现快慢不同、质量不同、策略不同的多种行为。若只给模型一句任务指令,模型很容易把这些模式平均在一起,学到一个哪种都不像的折中策略。