vla

朝朝辞暮i38 分钟前
人工智能·python·深度学习·神经网络·vla
VLA 系统学习第 12 课:为什么机器人不能只看一帧?——时间序列、Observation History 与 Action Chunk上一课真正要建立的是一个判断习惯:看到 Robot Learning / VLA 的测试结果,先不要急着看 Success Rate,先看它到底怎么切数据、测试了什么“没见过的东西”。
朝朝辞暮i41 分钟前
人工智能·python·深度学习·神经网络·vla
VLA 系统学习第 8 课:Optimizer 到底在干什么?——从 Learning Rate 到 SGD、Momentum 和 Adam先把上一课的 9 个问题完整收掉,然后直接进入第 8 课。今天的主线会继续沿着同一条训练链往后走:\[ \text{Gradient} \rightarrow \text{Learning Rate} \rightarrow \text{Optimizer} \rightarrow \text{Parameter Update} \]
朝朝辞暮i12 小时前
人工智能·python·计算机视觉·vla
VLA 系统学习第 1 课:VLA 到底在干什么?第一课先不碰 ACT、Diffusion Policy、OpenVLA、π0 这些具体模型,而是只解决最基础的一条链:
飞猫的边缘AI1 天前
人工智能·自动驾驶·辅助驾驶·vla·noa·边缘ai·ai场景
边缘AI为什么加速上车了?如果说家用摄像头是边缘AI的走量场景,自动驾驶就是边缘AI的制高点。但2026年正在发生一个关键转折:边缘AI上车不再只是制高点上的技术验证,而是在变成一场规模化标配。
朝朝辞暮i1 天前
人工智能·python·vla
VLA 系统学习第 2 课:Behavior Cloning——机器人究竟怎么从示范中学动作?从这一课开始,我们第一次真正进入 Robot Learning。今天只解决一个核心问题:如果我已经有很多“正确操作示范”,能不能让神经网络直接学会:
山顶夕景2 天前
机器人·多模态·扩散模型·具身智能·vla·dit·vlm
【VLA】Qwen-VLA:VLM+DiT统一多模态理解与连续机器人动作生成Qwen-VLA 的做法,不是声称"把所有机器人统一成一种动作",而是用 Qwen3.5-4B 视觉—语言骨干 + 约 1.15B 参数的 DiT 流匹配动作专家 + 一套 H×K 张量/前缀掩码/具身提示的接口,把操作、导航、人本动作、轨迹预测接进同一个条件生成框架。
、达西先生3 天前
vla·模仿学习
【pi05_fast_tokenizer】将连续动作变成离散的tokenFAST 的全称是 Frequency-space Action Sequence Tokenization。 目的:把一段连续的机器人动作轨迹压缩成离散 token,使视觉-语言模型能够像预测文字一样预测动作。 为什么要变成离散 token? 因为VLM就是prefix token 预测下一句话,前人有很多相关经验。所以把动作输出VLA变成类似预测文字一样预测动作能更快,准确输出。
feasibility.5 天前
人工智能·大模型·嵌入式·无人机·vla
把城市压缩成 2067 个盒子:CosFly 无人机跟踪数据管线论文解剖TL;DR:CosFly 用"把 3D 世界抽象成 2,067 个障碍物盒子 → 在连续空间做 9 目标梯度优化 → 反投影渲染多模态数据"的管线,构建了面向无人机动态目标跟踪的大规模多模态数据集。它既不是这个任务的第一个数据集(城市 UAV 跟踪的"首个"已被早六周的 UAV-Track VLA 占去,具身视觉跟踪任务本身更早一年就有 TrackVLA 做了真机验证),它的差异化也不靠"早",而靠三件具体的事:七通道对齐标注(深度/分割/位姿/双语)、由显式多约束优化(MuCO)生成的专家轨迹、覆盖 7
技术狂人1686 天前
具身智能·vla·任务调度器·jetson thor·多任务机器人
OmniBot-System多任务机器人:任务调度器路由设计与Jetson Thor端侧部署实践最近把OmniBot-System这个多任务机器人系统从训练到端侧部署完整跑了一遍,把过程中的关键设计和代码片段记录下来。这个系统的核心思路是用一个任务调度器把Manip(操作)、Nav(导航)、World(世界模型)三个子模型路由起来,而不是三个独立机器人硬拼。下面按模块拆开讲。
一直在努力的小宁8 天前
后端·json·restful·具身智能·vla·vlm
【阅读笔记】具身操作的数采方案概览本篇位置:本批第 10 篇。它是今天三篇里唯一的非新闻稿——一篇写于 2024 年 12 月、2025 年 1 月更新的技术综述,作者本人就在这个行业里做数采。前两篇(36 氪的行业评论、钛媒体的深度访谈)讨论的所有设备名词——ALOHA、UMI、Ego、外骨骼、动捕手套——这一篇是它们的技术底图。
做cv的小昊9 天前
人工智能·算法·机器学习·大模型·多模态·vla·世界模型
【World Model】π0.5:a Vision-Language-Action Model with Open-World Generalization图1: π 0.5 \pi_{0.5} π0.5 模型从多种异质数据源中迁移知识,包括其他机器人、高层子任务预测、口头指令和网络数据,从而实现跨环境和物体的广泛泛化。 π 0.5 \pi_{0.5} π0.5 能够控制移动操作机器人,在训练数据未覆盖的新家庭中清洁厨房和卧室,并执行持续10至15分钟的复杂多阶段行为。
风合星语16 天前
pytorch·机器人·具身智能·vla·lerobot·smolvla
2026 具身智能技术实战(一):VLA 到底怎么控制机器人?——用 LeRobot 跑通 SmolVLA 推理给机器人一张桌面图片,再说一句“把红色方块放到蓝色托盘里”,接下来会发生什么?普通聊天模型通常给你一句回答。机器人需要的却是可以被控制系统使用的动作表示。两者之间,不是把一段自然语言直接发给电机那么简单。
深蓝学院16 天前
机器人·具身智能·vla·世界模型
六大具身路线详解:模块化、技能编排、IL、RL、VLA、世界模型,到底在“吵”什么。。。目录01 模块化规划:先弄明白,机器人为什么总喜欢“拆开做”🚩2021年 MIT 团队发表的 Integrated Task and Motion Planning(TAMP),就是理解这类问题非常好的入口。
一颗小树x18 天前
机器人·实时·轻量化·vla
《VLA 系列》五篇 VLA 轻量化与实时化 | 开源文章摘要视觉-语言-动作(VLA)模型正在从"云端大模型"走向"机器人本体"。本文系统解读 2026 年五篇代表性的高效 VLA 工作,它们分别从不同层面回答同一个问题——如何让 VLA 在消费级/嵌入式硬件上实时运行:
音视频牛哥18 天前
人工智能·llm·机器人视觉·slam·vla·多模态感知·机器人音视频
从 LLM、VLA、LLA、SLIM 到实时音视频感知底座:具身智能真正需要的不只是大模型过去十几年,音视频行业解决的问题,大多可以归结为一个核心目标:怎样把声音和画面更稳定、更清晰、更低延迟地送到另一个人面前。摄像头采集、H.264/H.265 编码、RTSP/RTMP 推流、播放器解码、GB28181 接入、录像与转发,这些技术最终服务的主要对象仍然是“人”。
Robot_Nav22 天前
具身智能·vla·vlm
前沿 | VLA 演进:从动作 Token 到分层具身智能体论文:Zitkovich et al., RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control, CoRL 2023。 论文:Black et al., π₀: A Vision-Language-Action Flow Model for General Robot Control, RSS 2025。 论文:Pertsch et al., FAST: Efficient Action Tokeniza
zh路西法23 天前
c++·机械臂·pca·vla·planner·obb·moveit2
【玩转VLA具身智能机械臂】(四):点云分割与 OBB 夹取——从 PCA 失效到主动扫描说人话:它不再依赖摩擦系数,而是确认"两指确实同时从两侧顶住了物体"之后,把物体固定到手上说人话:我们要把桌子和物料分开,桌子和地板交给 MoveIt 的 octomap 让它规划时躲开,物料则不要送进 octomap,交给 Object Pose 计算去求夹取位姿
一直在努力的小宁23 天前
agent·vla·vlm·vln·harness
[特殊字符] 具身智能Agent开发调研|零基础超详细笔记(万字长文)老师发了一份智能体开发调研文件,零基础看完全懵。花了一整天查资料、拆概念、整理成这份笔记。既是科普,也是自己的完整学习记录。全文包含所有细节、数据、例子、设计动机,建议收藏慢慢看。 具身智能Agent开发调研|零基础超详细笔记 - 小红书
feasibility.24 天前
ai·机器人·无人机·导航·具身智能·vla·vln
当“给机器人指路“成为一门数据工程学——SimpleNav 拆解:导航大模型的标准化之争一个场景:你想让无人机听懂"飞到那座红色屋顶的左边,绕过塔吊,停在空地上"。 三年前,这需要为一个数据集写一套数据解析、为一个仿真器写一套接口、为一个模型写一套评测脚本。2026 年,清华 THUNLP 联合 OpenBMB 等机构开源的 SimpleNav 说:这套东西应该只需要写一次。
_张一凡25 天前
机器人·具身智能·vla
【论文解读】 一篇读懂VLA具身推理诊断基准RoboSPA:从细粒度空间消歧到长程程序规划,五级难度把VLA量到“不如随机猜“写在前面: 社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~ AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设! AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智