NVFP4 量化 × 具身智能:ModelScope 模型生态调研

目的 :了解当前行业模型情况,"机器人/具身智能方向有哪些模型可用?其中有没有 NVFP4 量化版?"

适合读者:正在做机器人端侧部署、或关注具身智能模型选型的工程师与研究者。

摘要

  • NVFP4 侧 :ModelScope 上 NVFP4 量化的视觉多模态模型共 133 个 (调研时查找到的数量),全部是 QwenGLMGemmaKimi 等通用大模型的量化版,++很少具身智能专用模型++。
  • 具身侧 :ModelScope 的"具身智能"分类下有 621 个模型 (调研时点快照),主力是 VLA 操作模型π0/π0.5GR00TOpenVLALingBot小米 Robotics腾讯混元 Hy-Embodied 等),外加具身大脑、导航、世界模型几条支线;国产厂商 2026 年发布密集
  • 交叉结论 :调研时点未发现具身模型提供 NVFP4 版本,均为原版 BF16/FP 权重。"NVFP4 + 具身智能"目前基本是个空白 ,而主流 VLA 只有 0.45B~14B,自行量化的门槛并不高------想在 Blackwell 显卡上跑机器人模型,只能自己动手,但这条路走得通。
  • 选型速查 :上手选 SmolVLAπ0;端侧中文选 MiniCPM-RobotManip;人形选 GR00T(N1.7 已 Apache-2.0,可商用)。

一、调研思路与流程

本次调研从"NVFP4 量化模型"出发,逐步扩大到整个具身智能模型生态,流程如下:
#mermaid-svg-nUcnblpBIEkNptPr{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-nUcnblpBIEkNptPr .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-nUcnblpBIEkNptPr .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-nUcnblpBIEkNptPr .error-icon{fill:#552222;}#mermaid-svg-nUcnblpBIEkNptPr .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-nUcnblpBIEkNptPr .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-nUcnblpBIEkNptPr .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-nUcnblpBIEkNptPr .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-nUcnblpBIEkNptPr .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-nUcnblpBIEkNptPr .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-nUcnblpBIEkNptPr .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-nUcnblpBIEkNptPr .marker{fill:#333333;stroke:#333333;}#mermaid-svg-nUcnblpBIEkNptPr .marker.cross{stroke:#333333;}#mermaid-svg-nUcnblpBIEkNptPr svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-nUcnblpBIEkNptPr p{margin:0;}#mermaid-svg-nUcnblpBIEkNptPr .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-nUcnblpBIEkNptPr .cluster-label text{fill:#333;}#mermaid-svg-nUcnblpBIEkNptPr .cluster-label span{color:#333;}#mermaid-svg-nUcnblpBIEkNptPr .cluster-label span p{background-color:transparent;}#mermaid-svg-nUcnblpBIEkNptPr .label text,#mermaid-svg-nUcnblpBIEkNptPr span{fill:#333;color:#333;}#mermaid-svg-nUcnblpBIEkNptPr .node rect,#mermaid-svg-nUcnblpBIEkNptPr .node circle,#mermaid-svg-nUcnblpBIEkNptPr .node ellipse,#mermaid-svg-nUcnblpBIEkNptPr .node polygon,#mermaid-svg-nUcnblpBIEkNptPr .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-nUcnblpBIEkNptPr .rough-node .label text,#mermaid-svg-nUcnblpBIEkNptPr .node .label text,#mermaid-svg-nUcnblpBIEkNptPr .image-shape .label,#mermaid-svg-nUcnblpBIEkNptPr .icon-shape .label{text-anchor:middle;}#mermaid-svg-nUcnblpBIEkNptPr .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-nUcnblpBIEkNptPr .rough-node .label,#mermaid-svg-nUcnblpBIEkNptPr .node .label,#mermaid-svg-nUcnblpBIEkNptPr .image-shape .label,#mermaid-svg-nUcnblpBIEkNptPr .icon-shape .label{text-align:center;}#mermaid-svg-nUcnblpBIEkNptPr .node.clickable{cursor:pointer;}#mermaid-svg-nUcnblpBIEkNptPr .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-nUcnblpBIEkNptPr .arrowheadPath{fill:#333333;}#mermaid-svg-nUcnblpBIEkNptPr .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-nUcnblpBIEkNptPr .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-nUcnblpBIEkNptPr .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-nUcnblpBIEkNptPr .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-nUcnblpBIEkNptPr .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-nUcnblpBIEkNptPr .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-nUcnblpBIEkNptPr .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-nUcnblpBIEkNptPr .cluster text{fill:#333;}#mermaid-svg-nUcnblpBIEkNptPr .cluster span{color:#333;}#mermaid-svg-nUcnblpBIEkNptPr div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-nUcnblpBIEkNptPr .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-nUcnblpBIEkNptPr rect.text{fill:none;stroke-width:0;}#mermaid-svg-nUcnblpBIEkNptPr .icon-shape,#mermaid-svg-nUcnblpBIEkNptPr .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-nUcnblpBIEkNptPr .icon-shape p,#mermaid-svg-nUcnblpBIEkNptPr .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-nUcnblpBIEkNptPr .icon-shape .label rect,#mermaid-svg-nUcnblpBIEkNptPr .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-nUcnblpBIEkNptPr .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-nUcnblpBIEkNptPr .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-nUcnblpBIEkNptPr :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 没有
沾边候选
起点:NVFP4 + 视觉多模态理解筛选页

共 133 个结果
其中有机器人/

具身智能模型吗?
切换检索口径:

具身智能 robotics 任务分类

共 621 个模型
视觉定位 / 指向 / 空间感知类

Qwen3-VL 底座等
按技术路线分类梳理

VLA / 具身大脑 / 导航 / 世界模型
行业公开资料

附件文档
全球代表模型全景表

含未上架 ModelScope 的模型
交叉分析:

NVFP4 × 具身智能的空白与机会
结论与选型建议

三步走:

  1. 第一站 :分析指定筛选页(NVFP4 + image-text-to-text + multi-modal133 个模型,调研时点快照)------回答"NVFP4 量化模型里有没有具身方向的";
  2. 第二站 :转向 ModelScope 的"具身智能(robotics) "任务分类(621 个模型,调研时点快照)------回答"平台上有哪些具身模型可用";
  3. 第三站:结合附件行业资料------把视野放大到全球(含未上架 ModelScope 的模型),形成完整行业图景。

二、第一站:NVFP4 量化有哪些?

从 ModelScope 开源的模型库中,查看页面:https://www.modelscope.cn/models/unsloth/gemma-4-26B-A4B-it-NVFP4,共 133 个结果(调研时点快照)。

2.1 结果构成:全是通用多模态大模型的量化版

底座系列 代表模型(命名空间/模型名) 数量级 说明
Qwen3.x 系(绝对主力) RadixArkInferactunslothRedHatAImlx-community 等发布的 Qwen3.5/3.6/3.8 NVFP4 约 70+ 27B / 35B-A3B / Flash-Next 等规格,Safetensors / GGUF / MLX 格式
GLM 系 LibertAIDAI/GLM-5.3-Flash-NVFP4baseten/GLM-5.2-Vision-NVFP4hf/GadflyII-GLM-4.6V-NVFP4 10+ 智谱视觉模型量化版
Gemma 4 系 unslothRedHatAImlx-communityr0b0tlab 15+ E2B / E4B / 26B MoE / 31B Dense 全规格(Gemma 4 官方无 12B 规格)
NVIDIA 官方 nv-community/Qwen3.8-Flash-Next-NVFP4NVIDIA-Nemotron-Nano-12B-v2-VL-NVFP4-QAD 若干 NV 社区官方量化
其他 Kimi-K2.5/K2.6-NVFP4MiniMax-M3-NVFP4Step-3.7-Flash-NVFP4dots.ocr-nvfp4、Muse-Glimmer、Inkling 等 若干 大模型 + OCR 专用模型

结论:++这个筛选页里没有专门的机器人/具身智能模型++。

NVFP4 量化目前只做到通用 VLM 这一层,还没延伸到 VLA 和具身模型。

这些"沾边"模型虽然不直接输出机器人动作,但它们作为 VLA 的视觉底座(如 Qwen3-VL),其 NVFP4 量化经验可直接迁移到具身模型上------这正是第五节交叉分析中"底座复用"机会的来源。

2.2 页面中"沾边"具身方向的候选

模型 与具身智能的关联 局限
sahilchachra/LocateAnything-3B-NVFP4A16 通用视觉定位(grounding),具身感知的基础能力 非具身专用
mlx-community/MolmoPoint-8B-nvfp4 指向(pointing)能力,可用于机器人目标指示 同上
timepal/Qwen3-VL-8B-Instruct-NVFP4cpadyun/Qwen3-VL-8B-FlashRT-NVFP4hf/GadflyII-Qwen3-VL-235B-A22B-*-NVFP4 Qwen3-VL 具备空间感知 / 3D grounding,常被用作具身智能的 VLM 底座(国内多个 VLA 基于它构建) 本身不输出机器人动作
sahilchachra/Agents-A1-NVFP4A16 智能体方向(InternScience Agents-A1 量化版) 偏科研 agent,非具身

三、第二站:ModelScope"具身智能"分类全景(621 个模型)

入口:模型库 → 多模态 → 具身智能tasks=robotics)。以下为综合排序靠前的代表性模型,按技术路线分类。下载量为调研时点快照。

3.1 VLA(视觉-语言-动作)操作模型 · 国际

模型 机构 规模 协议 下载量 说明
lerobot/pi0 Physical Intelligence / LeRobot 3.3B Apache-2.0 2.2k π0,通用机器人操作基础模型(PaliGemma 骨干 + 动作专家)
lerobot/pi05_base 及 LIBERO 微调系列 同上 3.6B 级 Gemma 许可 2.3k π0.5 升级系列
lerobot/pi0fast_basepi0fast-libero 同上 2.9~3.5B Apache-2.0 574 π0-FAST token 化加速版
lerobot/smolvla_basesmolvla_libero HuggingFace 450M Apache-2.0 2.4k SmolVLA,轻量端侧 VLA
nv-community/GR00T-N1.5-3B / N1.6-3B / N1.7-LIBERO NVIDIA 3B 级(N1 约 2.2B,N1.7 为 3B) Apache-2.0(N1.7 已并入 LeRobot,明确支持商业部署) 65~697 GR00T 人形机器人基础模型
a11111ad/openvla-7b-oft-finetuned-libero-object 斯坦福系(社区上传) 7B 级 MIT 87 OpenVLA-OFT 微调版
VLA-Adapter/LIBERO-Goal OpenHelix 1.25B MIT 100 轻量化改造 OpenVLA
LLM-Research/Magma-8B 微软 8B 级 MIT 1.7k UI 操作 + 机器人通用 agent
allenai/GraspMolmo AI2 8B MIT 315 基于 Molmo 的抓取专用模型

3.2 VLA 操作模型 · 国内

模型 机构 规模 协议 下载量 说明
OpenBMB/MiniCPM-RobotManip 面壁智能 1.5B Apache-2.0 663 端侧 VLA 操作;另有 MiniCPM-RobotTrack0.9B,跟踪导航)
Robbyant/lingbot-va-baselingbot-vla-v2-6blingbot-va-posttrain-libero-long 蚂蚁灵波 v2 官方口径为 1.6B 稀疏 MoE(0.6B 激活);其余版本规模以官方为准 Apache-2.0 941~1.5k LingBot 系列,真机后训练版本齐全
Tencent-Hunyuan/Hy-Embodied-0.5-VLA-RoboTwin / -UMI 腾讯混元 4B 级(骨干 Hy-Embodied-0.5-MoT,约 4B;"0.5"为版本号) Apache-2.0 163~181 混元具身 0.5,UMI 预训练 + RoboTwin 2.0 SFT 两种数据配置
XiaomiRobotics/Xiaomi-Robotics-0-LIBERO-1-5B-1-RoboCasa365 小米机器人 4.7~5B 级 Apache-2.0 34~119 小米 Robotics-0(4.7B 实时 VLA)/ Robotics-1 系列
LimXDynamics/FluxVLAEngine 逐际动力 ---(工程框架,非单一权重模型) Apache-2.0 2.8k 开源 VLA 工程底座:覆盖数据→训练→真机部署链路
LET全尺寸机器人VLA1.0模型 乐聚机器人 --- Apache-2.0(++申请制++) 4 全尺寸人形机器人 VLA
DAMO_Academy/RynnVLA-001-7B-Trajectory 阿里达摩院 7B 级 Apache-2.0 152 轨迹预测式 VLA;另有 RynnValue-4B/8B 价值模型
Galaxea/G0-VLA 星海图 --- CC-BY-NC-SA(++非商用++) 49 星海图 G0
Dexmal/DM05-LerobotDM05-SO101-Pick-Cube Dexmal 0.3~5.2B --- 11~50 基于 Gemma/SO-101 机械臂
starVLA/Qwen3VL-PI_v3-Bridge-RT_1 StarVLA --- MIT 24 基于 Qwen3-VL 的新一代 VLA 栈
seeklhy/ZR-0 系列、YuzeZhu/BridgeVLA++huixiAI/RhinoVLA 学术/社区 2.1~3.2B Apache-2.0 45~78 学术改进版 VLA

3.3 具身"大脑"(空间推理 / 任务规划 MLLM)

模型 机构 规模 协议 下载量 说明
BAAI/RoboBrain2.0-7B-3B 北京智源 3B/7B Apache-2.0(++申请制++) 1.1k / 755 具身大脑,空间感知 + 任务规划
FlagRelease/RoboBrain2.5-8B-ascend-FlagOS 智源 / FlagOS 8B 级 --- 407 RoboBrain 2.5,基于 Qwen3-VL,昇腾适配
X-Humanoid/Pelican1.0-VL-7B / 72B 北京人形机器人创新中心 7B / 72B(官方仅发布此两档) Apache-2.0 110~270 "天工"配套具身 MLLM,目前最大规模的开源具身多模态脑模型
openmoss/RoboOmni 复旦 OpenMOSS 4.7B CC-BY-NC-4.0 146 语音+视觉+动作全模态

3.4 导航(VLN)与空间智能

模型 机构 规模 协议 下载量 说明
InternRobotics/InternVLA-N1 上海 AI Lab 8B 级 CC-BY-NC-SA 306 导航专用双系统 VLA
misstl/JanusVLN_Base / _Extra 学术 9B 级 Apache-2.0 632 / 1.2k 基于 Qwen2.5-VL 的视觉语言导航
amap_cvlab/FantasyVLNABot-M0-PretrainABot-ReconABot-World-0-5B-LF 高德视觉技术 8B 级 等 Apache-2.0 75~130 导航 + 重建 + 世界模型系列(高德 ABot / ABot-WorldStudio 技术栈)
admagic/ETPNav 学术 --- Apache-2.0 219 经典层级式 VLN
valyentine/IndoorUAV-Agent 社区 --- --- 119 室内无人机导航

3.5 世界模型 / RL 后训练 / 感知组件

模型 机构 规模 下载量 说明
极佳视界/Giga-World-1 极佳科技 47B 级(官方口径以模型页为准) 533 通用世界模型
lerobot/fastwam_base LeRobot 6B 35 FastWAM 世界-动作模型
THU4Spiderman/Semantic_Temporal_World_Action_Model 清华 --- 2 语义时序世界动作模型
RLinf/RLinf-Pi05-SFTRLinf-Gr00t-N1.6-SFT-SpatialRLinf-DreamZero-* 清华 RLinf 3.3~12.6B 12~310 π0.5 / GR00T / DreamZero 的 RL 后训练权重
Sunjian520/SDPose-Wholebody 社区 1.3B 4.1k 全身姿态估计(感知前端,全分类下载量最高之一
Twang2026/HumanoidArena_models 社区 229B 3.3k 人形机器人评测基准模型集
lerobot/act_aloha_*diffusion_pusht LeRobot 52M~263M 868 / 896 ACT / Diffusion Policy 经典基线

3.6 自动驾驶 VLA(归入具身智能分类)

模型 机构 规模 下载量 说明
nv-community/Alpamayo-R1-10BAlpamayo-1.5-10BAlpamayo2-Super NVIDIA 10B ~ 约 34B 68~471 Alpamayo 自动驾驶 VLA,带推理链;2 Super 为 32B Cosmos 3 骨干 + 2.3B 扩散动作专家

四、第三站:全球行业代表模型全景(含未上架 ModelScope)

以下综合附件行业资料整理,覆盖 VLA、VLM、世界模型、专用架构四条主线。标注 ✅ 的表示已在 ModelScope 可下载。

4.1 代表模型一览

模型 发布机构 类型 参数规模 核心特点 / 定位 ModelScope
RynnBrain 1.1 阿里巴巴达摩院 VLA 2B / 9B / 122B-A10B 首个 122B 级稀疏 MoE 具身脑模型,支持 3D 空间定位与真实机器人控制(宇树 G1、Astribot 等) 可搜索相关 checkpoint
Hy-Embodied-VLA-0.5 腾讯 Robotics X VLA 4B 级(骨干 Hy-Embodied-0.5-MoT) 连接"小脑"与身体,将高层目标转化为连续可纠错动作;"0.5"为版本号 Hy-Embodied-0.5-VLA-UMI / -RoboTwin
Hy-Embodied-VLM-1.0 腾讯 Robotics X VLM --- "右脑":理解图像、空间和场景 ---
Hy-Embodied-RxBrain-1.0 腾讯 Robotics X 具身大脑 --- 统一认知、规划与未来状态想象 ---
GO-2 智元机器人 具身基座 --- 融合大小脑(2026 年 4 月发布);2026 被视为"具身智能部署元年" ---
GR00T N1 系列 NVIDIA VLA 2.2B(N1)起,N1.7 为 3B 双系统架构(System-2 推理 + System-1 扩散策略),首个开源人形机器人基础模型;N1.7 已 Apache-2.0 并入 LeRobot N1.5-3BN1.6-3BN1.7-LIBERO
π0(pi-0) Physical Intelligence VLA 3.3B 基于 PaliGemma,10,000+ 小时跨本体遥操作数据 lerobot/pi0
π0.5 / π0.7 Physical Intelligence VLA π0.5 为 3.6B 级;π0.7 未公开 π0.5:开放世界泛化至未见过的家庭环境;π0.7(2026 年 4 月):主打可操纵性(子目标图像 / episode metadata)与组合泛化 部分(pi05_base 系列在架)
OpenVLA Stanford / Berkeley VLA 7B RT-2 开源复现,学术界广泛微调 社区微调版
RT-2 Google DeepMind VLA 55B 首个 VLM-to-Action Transformer,开创 VLA 类别 ❌ 闭源
Octo Berkeley AI Research VLA 93M / 27M 轻量通用策略,800K 条 Open X-Embodiment 轨迹 ---
InternVLA-A1 / A1.5 上海 AI Lab VLA 2.7B 级 统一理解、生成与行动的操作模型 InternVLA-A1.5-base
LingBotVLA 蚂蚁集团(灵波) VLA v2 为 1.6B 稀疏 MoE(0.6B 激活) 开源具身基座模型 lingbot-va-base
LingBot-Video 蚂蚁集团(灵波) 视频预训练 --- 首个面向具身智能的大规模视频预训练模型 GitHub 项目
Qwen-RobotManip / RobotNav / RobotWorld 阿里 Qwen VLA / 世界模型 --- 标准化状态-动作空间 / 移动控制 / 世界动态预测 ---
MiniCPM-RobotManip 面壁智能 VLA 1.5B 端侧机器人操作 OpenBMB/MiniCPM-RobotManip
RoboBrain 2.5 北京大学 / 智源 具身基础模型 8B 级 深度感知坐标预测 + 密集时序价值评估 FlagOS 版(RoboBrain2.0 为++申请制++)
Pelican-VL 1.0 北京人形机器人创新中心 具身 VLM 7B / 72B 目前最大规模的开源具身多模态脑模型,配套 RoboMIND 2.0 数据集 7B / 72B
WALL-OSS / WALL-A 自变量机器人 具身基础模型 --- 中国最早落地的具身基础大模型之一 ---
ERA-42 星动纪元 具身大模型 --- 通用具身大模型 ---
UnifoLM-VLA-0 宇树科技 VLA --- 开源 VLA ---
Thinker 优必选 具身大模型 --- 开源具身大模型 ---
盘古具身智能大模型 华为 具身大模型 --- 盘古系列具身方向 ---
MiMo-Embodied 小米 具身大模型 --- 开源具身大模型(与 Xiaomi-Robotics-0/1 为不同模型线) ---
GigaWorld 系列 极佳视界 世界模型 47B 级 世界模型 + GigaBrain 具身基模 Giga-World-1
GOVLA 智平方 具身大模型 --- 全域全身具身大模型 ---
RoboMamba 智平方 & 北京大学 VLA --- 视觉编码器 + Mamba 状态空间模型,++仅调 0.1% 参数++ ---
Brain-Si 0.5 CasiaHand 灵巧操作 --- 类人灵巧操作模型,三层架构(待确认,未检索到公开资料) ---
AstraBrain-WBC 0.5 GalaxyBot 小脑基模 80M 全身实时人形控制(待确认 ---
SAM-6D 跨维智能 姿态估计 --- 零样本 6D 姿态估计 ---
PaLM-E Google & TU Berlin VLM 562B 全球最大视觉语言模型之一,融入连续传感器模态 ❌ 闭源
VLM-3R UT Austin VLM --- 单目视频隐式 3D Token,无需深度传感器 ---
Kairos ACE Robotics WAM --- 世界-语言-行动模型(待确认 ---

4.2 四条技术主线解读

  1. VLA :端到端融合视觉、语言与动作,是目前具身智能做得最多的一条路线。当前的难点在于++推理能力和动作精度难以兼顾++ 。开源梯队已经比较完整(RT-2 → OpenVLA → π0 → GR00T),国产模型发布也很密集;GR00T N1 用的双系统架构(慢思考推理 + 快反应策略)正被越来越多模型采用。
  2. VLM :具身场景要求模型理解 3D 空间结构 ,而不只是看懂二维图像。代表工作:VLM-3R(从单目视频提取隐式 3D Token)、RoboBrain 2.5(深度感知坐标预测,直接输出 3D 操作轨迹)。
  3. 世界模型 / WAM :世界模型负责预测物理世界的下一状态,2026 年起开始与动作生成融合,形成世界-语言-行动模型(WAM) 。代表:蚂蚁 LingbotVA、NVIDIA DreamZero、极佳 GigaWorld(智源相关世界模型项目待确认)。
  4. 专用架构:面向灵巧操作和全身控制的专用模型,如灵巧操作三层架构模型、80M 级全身实时控制"小脑"基模等(部分厂商项目公开资料有限,待确认)。

五、交叉分析:NVFP4 × 具身智能的空白与机会

维度 现状 含义
NVFP4 量化覆盖 133 个模型(调研时点快照)全部是通用 VLM/LLM(QwenGLMGemmaKimi 等) NVFP4 已经比较普及,但只覆盖通用对话/理解场景
具身模型量化 调研时点未发现具身智能分类下的模型提供 NVFP4 版本,均为原版 BF16/FP safetensors Blackwell(RTX 50 系/B200)上部署 VLA ++需自行量化++
模型规模 主流 VLA 在 0.45B~14B 之间(SmolVLA 450M、MiniCPM-RobotManip 1.5B、π0 3.3B、GR00T N1.7 3B) 小模型量化到 NVFP4 的可行性和收益都很高
底座复用 多个 VLA 直接基于 Qwen2.5-VL / Qwen3-VL / Gemma 构建 这些底座的 NVFP4 量化经验(本站已有)可直接迁移

这意味着一个实际的工程机会:在端侧/边缘部署场景(Jetson、机器人本体上的 RTX 5090),用 TensorRT Model OptimizerSmolVLAMiniCPM-RobotManipπ0 这类 0.5~3.5B 的 VLA 量化到 NVFP4,路径是通的,而++调研时点尚未发现有人公开发布这类权重++。

SmolVLA(450M)为例,量化思路大致如下:

bash 复制代码
# 1. 导出 ONNX 或 TensorRT 引擎
# 2. 使用 TensorRT Model Optimizer 进行 NVFP4 量化
# 3. 在 Jetson / RTX 5090 上验证精度与延迟

配合 LeRobot 框架,可在 30 分钟内跑通一个简单的抓取仿真任务:安装 lerobot → 加载 smolvla_base → 运行 LIBERO 仿真环境。


六、结论与选型建议

需求 推荐
快速上手机器人操作(仿真/真机) lerobot/smolvla_base450M,最轻 )或 lerobot/pi05_baseπ0.5,3.6B 级,生态最好
端侧中文场景 OpenBMB/MiniCPM-RobotManip(1.5B,Apache-2.0
人形机器人 nv-community/GR00T-N1.7-LIBEROApache-2.0,已并入 LeRobot,可商用
具身大脑 / 空间推理 X-Humanoid/Pelican1.0-VL-7B(开源可商用);RoboBrain2.0 需申请
视觉语言导航 misstl/JanusVLN_BaseApache-2.0,下载量高)
商用项目 优先 Apache-2.0 / MIT 模型;++避开 CC-BY-NC 系列(InternVLA-A1.5、G0-VLA 等)和申请制模型++
想要 NVFP4 部署 现成模型不存在;建议自行量化小体量 VLA,或先用 Qwen3-VL 系 NVFP4 版做具身感知层

总的来说:2026 年的具身智能模型数量已经很可观,仅 ModelScope 上就有 600 多个(调研时点快照)可直接下载,国产厂商占了不小比例。

但 NVFP4 量化还停在通用 VLM 层面,"NVFP4 + 具身智能"这块暂时没人做,需要用的人得自己量化。

数据来源:ModelScope(魔搭社区)模型库 + 行业公开资料整理

分享完成~

相关推荐
s1ckrain11 小时前
【论文阅读】A Survey on Vision–Language–Action Models for Embodied AI
论文阅读·人工智能·多模态·具身智能
VL——MOESR1 天前
【具身智能】TurboVLA阅读随笔
论文阅读·机器学习·turbo·具身智能·vla
张星河zen1 天前
端侧AI芯片暗战,苹果华为小米新一代手机芯片技术路线详解
华为·小米·苹果·端侧·韬定律·玄戒
大唐荣华2 天前
模型训练显卡选型深度指南:价格、数量、性能与自建租赁抉择
人工智能·机器人·模型训练·具身智能·avida·navida
音视频牛哥3 天前
世界模型如何重塑具身智能:从VLA到预测式机器人控制
人工智能·具身智能·世界模型·world model·vla模型·多模态感知·机器人决策
VL——MOESR3 天前
【具身智能】VLA论文阅读随笔
论文阅读·人工智能·机器学习·具身智能·vla
DQQzero4 天前
量产机器人 18 金双榜第一:智元灵巧手 OmniHand 拆解
具身智能·人形机器人·灵巧手·智元·omnihand
JoannaJuanCV6 天前
VLM学习-SFT(监督微调)
深度学习·学习·机器学习·大模型·视觉大模型·vlm·视觉编码器
机器人猎头David8 天前
机器人猎头公司(倍利福猎头公司)案例分享
人工智能·机器人·招聘·具身智能·人形机器人·猎头公司·机器人猎头公司