【智能体系统AgentOS】核心21:VLA和WMA

VLA 模型其核心目标是让机器人像大模型理解文本一样理解环境,并直接输出可执行动作,实现"看懂世界 → 理解指令 → 完成操作"的闭环。

VLA=输入(图像/视频、语言指令、机器人状态)+视觉编码器,多模态大模型,动作解码器+机器人控制指令。其中cross attention是将Q(text)、K(image)、V(image)嵌入实现attention(Q,K,V)。动作解码器主要是文本语义映射到三维空间位置坐标和执行器在三维空间的姿态(偏航角、俯仰角、滚转角)。

WMA 是VLA进一步演化出来的新一代具身智能架构。VLA主要是看到+理解+动作,WMA主要是看到+预测未来世界+动作规划+动作执行。VLA缺乏对未来环境变化的显式预测能力。

WMA=输入(视觉编码器)+潜在状态+世界模型编解码器+未来状态预测+未来状态反馈+动作指令+机器执行

WMA=输入(图像、深度、语言、机器人状态)+世界模型学习(当前状态+动作分析未来状态)+输出(图像、视频、潜在状态)+输出动作解码执行

模块 VLA WMA
Vision
Language
Action
World Model
Future Prediction
Long-horizon Planning 一般
Simulation Capability

VLA关注"现在该做什么",而WMA关注"做完之后世界会变成什么样,再决定该做什么"。

因此,WMA本质上是在 VLA + World Model + Future Prediction + Planning 的基础上构建的新一代机器人基础模型架构,被许多研究者视为通向通用机器人(AGI Robot)的关键路线。

相关推荐
leoZ23120 分钟前
本地跑大模型实战(七):llama.cpp 性能调优,让推理更快更省
java·人工智能·spring·生成对抗网络·语言模型·自然语言处理·llama
To_OC29 分钟前
我把《天龙八部》塞进向量数据库后,终于搞懂了 RAG 到底是个啥
人工智能·llm·agent
蜡台1 小时前
AI Agent(智能体)入门基础教程
人工智能
Akir.weiwen1 小时前
Token 层差异:从颜色值到语义状态的三层跃迁
人工智能·设计规范
迷迭香yy1 小时前
集合竞价数据挖掘实战:用Python构建开盘信号识别系统
人工智能·python·数据挖掘
大模型momo2 小时前
Spring AI 实战:多 Agent 协作实战 —— 分工拆解复杂旅游行程任务
人工智能·spring·ai·agent·旅游
小程故事多_802 小时前
从A2C、TRPO、PPO到GRPO,强化学习策略梯度算法完整演进与大模型落地实战解析
人工智能·算法
冬奇Lab2 小时前
开源项目第176期:Better Harness — 不审查 diff,审查工作流本身,给 AI 编程 Agent 的五维评估框架
人工智能·开源·agent
冬奇Lab2 小时前
代码库知识库系列(07):混合检索 BM25 + 向量——Q8 还是失败,而且总分退步了
人工智能
ajassi20003 小时前
AI语音智能体开发日记(十一)为智能设备“声”临其境——详解音频资源自动化生成流程
人工智能·ai·ai编程