Openvla的原理学习

qq_359716232026-01-09 14:08

一.由预训练的VLM到VLA

Openvla是基于Prismatic-7B的预训练VLM模型进行训练的。其将动作进行离散化。将训练数据中每个维度动作范围的1%~99%区间的长度（如我dx范围为-10cm~20cm），那么将这个区间以256等分为小区间（1-256）对应了分割后的离散值。那么就可以把连续动作离散后进行训练。

二.VLM的理解

VLM是VLA的框架主干。这里用的是Prismatic-7B，如图1所示。VLM由视觉编码器（DinoV2和SigLIP组成），投影器和LLM（大预言模型）组成

各部分的作用如下：

其中视觉编码器利用了SinLIP-DinoV2的网络，空间理解能力更强，导致Prismatic-7B的VLM相较于其他VLM有更好的效果

三.Token令牌的理解

上一篇：将mysql数据库的内容备份至阿里云 oss归档存储

下一篇：鸿蒙5、6用户h5页面使用schemeURL跳转小程序失败

热门推荐

01GitHub 镜像站点 02AI科技热点日报 | 2026年07月01日 032026年7月AI圈大地震：GPT-5.6被政府限制、Claude入驻Slack、Anthropic自研芯片 04幻兽帕鲁 - 服务器管理员权限与 GM 命令完全指南 05GPT-5.5 对比 GPT-5.6 Sol、Terra、Luna：官方性能数据与选型分析 062026 国产 AI 大模型横评：DeepSeek、通义千问、Kimi、文心一言、星火、豆包谁更能打？07AI 编程 IDE 全景解析 2026：Agent 全面接管开发链路 082026 年 AI 编程工具终极横评：Cursor vs Claude Code vs Copilot vs Windsurf 092026 AI 编程工具终极实战指南：Cursor vs Claude Code vs Copilot，开发者该怎么选？102026 年 AI 大模型 & AI 编程工具实战全总结