最近几个月,VLA(Vision-Language-Action,视觉-语言-动作)模型在自动驾驶和机器人圈子里的讨论热度明显上来了。身边不少做感知或规控的朋友都在补这方面的知识,我自己也因为项目需要,把主流的几篇工作系统看了一遍,并动手做了一些端侧部署的实验。这篇文章算是一份阶段性笔记,主要聊聊 VLA 模型在端到端智驾场景下的技术挑战、架构选择以及量化部署的实践经验。也顺便分享一个行业观察:目前同时具备 VLA 训练和端侧量化部署经验的人确实不多,这个方向的人才缺口正在显现。
为什么 VLA 在端到端智驾里被寄予厚望
传统的自动驾驶系统通常是模块化的:感知、预测、规划、控制各司其职,中间通过显式接口传递信息。这种架构虽然可解释性强,但存在误差累积、规则维护成本高等问题。端到端方案试图用一个统一的模型直接从传感器输入映射到控制指令,减少中间环节。而 VLA 模型进一步引入了语言模态,让模型不仅能"看"和"动",还能"理解"自然语言指令或场景描述,从而提升泛化能力和人机交互的自然度。
在实车部署时,VLA 模型面临的最大矛盾是:模型规模通常很大(动辄数十亿参数),而车端芯片的算力和内存预算又极其有限。因此,除了模型结构设计本身,量化和推理优化就成了决定方案能否落地的关键。
主流 VLA 架构的快速对比
我主要关注了 RT-1、RT-2、Octo、π0 和 OpenVLA 这几条线,它们在设计思路上各有侧重:
RT-1 / RT-2:Google 提出的早期代表性工作,RT-1 偏向低层动作策略,RT-2 则把动作 token 化,与视觉和文本 token 一起送入大语言模型,实现了更强的语义理解和指令跟随能力。但原生模型规模较大,直接上车不太现实。
Octo:一个开源的 transformer 策略模型,强调模块化和易用性,适合快速实验。它证明了小规模模型也可以在特定任务上取得不错效果,为后续的端侧优化提供了基础。
π0(pi-zero):采用流匹配(flow matching)生成连续动作,动作平滑性更好。但连续生成过程在推理时计算量较高,需要配合轻量化设计。
OpenVLA:一个 7B 参数的开源 VLA,基于 Llama 2 和视觉编码器。它的价值在于提供了一个完整的训练和评估框架,很多团队会以它为基座进行剪枝和蒸馏。
从部署角度看,目前业界更倾向于以 Octo 或轻量化后的 OpenVLA 为起点,结合任务需求进行结构调整和压缩,而不是直接使用原始大模型。
量化部署:QAT 与 PTQ 的取舍
端侧部署的核心是模型量化。我自己的实践体会是:PTQ(训练后量化)上手快,但精度损失不可控;QAT(量化感知训练)能保住精度,但需要重新训练,周期更长。
对于 VLA 这类对时序动作精度很敏感的模型,直接做 PTQ 到 INT8 往往会出现明显的动作抖动或错误。所以更稳妥的路线是:
先做 QAT,把量化误差纳入训练目标,让模型在训练阶段就适应低精度表示。
再结合蒸馏,用原始高精度模型作为 teacher,指导量化后的 student 模型,进一步弥补精度损失。
最后使用混合精度策略:对视觉编码器和动作解码器等敏感层保留 FP16 或 INT8,对语言部分的大矩阵乘使用 INT4,在精度和速度之间找平衡。
推理框架方面,TensorRT 和 ONNX Runtime 是目前最常用的,TensorRT-LLM 则在语言模型部分有优势。在 Orin 这类平台上,经过 INT8 量化后,一个 1~2B 参数的轻量 VLA 模型基本可以做到 20~30ms 的端到端延迟,满足实时性要求。高通的芯片则需要更细致的算子适配,尤其是 attention 部分的优化。
边缘芯片上的实战经验
我在 NVIDIA Orin 上做的主要优化点包括:
使用 TensorRT 的 FP16 + INT8 混合精度,并对 attention 的 KV cache 做量化,大幅降低显存占用。
算子融合:把 LayerNorm 和后续的线性层合并,减少 kernel 启动次数。
动态 shape 处理:VLA 的输入序列长度不固定,需要确保推理图支持动态 batch 和序列长度,避免频繁重建引擎。
高通的 NPU(Hexagon DSP)上,关键是要把模型拆解成适合 NPU 执行的子图,避免频繁在主 CPU 和 NPU 之间切换。我目前还在验证 QAT 后的 INT4 模型在 NPU 上的表现,初步看精度损失在可接受范围内,但延迟收益没有 Orin 上那么明显。
数据飞轮与多模态对齐
VLA 模型的另一个隐性成本是数据。视觉-语言-动作三元组数据的采集和标注非常昂贵,尤其是高质量的动作标签。目前比较可行的做法是:
用大语言模型生成多样化的指令文本,配合真实驾驶数据进行语义增强。
利用仿真环境批量生成动作标签,再通过域随机化迁移到真实场景。
建立在线学习机制:把量产车回传的接管数据作为负样本,持续优化策略。
这一块也是很多团队正在投入的方向,谁的数据飞轮转得快,谁就能在模型迭代上占据优势。
一个值得关注的行业观察
在最近几次技术交流中,我注意到一个比较明显的趋势:同时熟悉 VLA 模型训练和端侧量化部署的工程师非常稀缺。 很多人要么只做过大模型训练,要么只做过传统模型部署,两者之间的沟壑比想象中大。一些正在推进端到端智驾方案的团队,都在为找不到合适的人发愁。
如果你恰好在这个交叉领域有积累,或者正在规划自己的技能树,我个人的建议是:优先补齐量化部署这一环。 因为 VLA 架构本身还在快速演进,而量化部署的工程经验是可以迁移的,且当前能真正把模型压到车端芯片上稳定跑起来的人,价值会越来越大。
这个方向短期内不会凉,值得投入时间深入。敲敲门哈