我自己的原文哦~ https://blog.51cto.com/whaosoft143/14936187
#xxx
.....
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
.....
#xxx
.....
#xxx
.....
#xxx
.....
#xxx
.....
#xxx
.....
#xxx
.....
#xxx
.....
#xxx
.....
#xxx
.....
#xxx
.....
#第二代VLA蒸馏
刘先明谈小鹏第二代VLA蒸馏:重构视觉计算,尽可能保留模型容量
车端 VLA 蒸馏面临的直接矛盾,是在更有限的算力、内存、功耗与推理时延预算下,尽可能保留教师模型的能力和驾驶风格。
简单缩小模型、砍半或剪枝,可以用于适配部署条件,但学生模型能否承接教师能力、能否在目标芯片上高效执行,仍需要解决。
今日,小鹏通用智能中心负责人刘先明撰写长文,系统回顾了这次第二代 VLA 升级背后的技术路径,也进一步阐明了小鹏为什么要从"真实物理世界的客观约束"出发,重新思考模型架构。
小鹏第二代 VLA 引入了长时序理解、未来预测和多种行动轨迹表达,这些能力进一步增加了模型容量与计算效率的要求。
刘先明在介绍 XOS 6.3.0 底层架构时,将 Max 蒸馏归纳为四项工作:针对芯片重做架构、持续增强教师模型、提高学生模型的基础能力,以及优化训练数据的质量与分布。
01 .
先重构视觉计算,尽可能保留大脑容量
Max 蒸馏从学生模型的架构开始。
按照刘先明的介绍,团队围绕 Max 车型的计算瓶颈,重新分配模型中的计算资源。其中,计算量最重的 ViT 部分进行了彻底重构。
具体做法包括:
以 HybridViT、TuringViT 等视觉架构工作为基础,重构视觉部分。

使用学习式压缩降低有效计算量。结合编译器与部署优化,提高硬件利用效率。
在上述优化基础上,尽可能保留模型大脑容量。
这几项工作的关系很明确:视觉架构与学习式压缩用于降低有效计算量,编译器和部署优化用于提高硬件执行效率,资源分配则尽量保留承载模型能力的容量。
刘先明强调,这样做可以让学生模型在143aiwh消防通信安全二总线can总线接受蒸馏之前,就具备更高的能力起点。学生架构的硬件适配,是这套蒸馏方案的前置工作。
02 .
能力迁移依赖教师、
学生与数据分布的匹配
完成学生架构设计后,蒸馏还依赖两个条件:足够强的教师模型,以及合适的数据分布。
教师模型提供更丰富的学习信号;数据分布决定学生在哪些问题上学习,以及训练能否覆盖目标使用场景。小鹏依托数据基础设施组织高质量、分布合理的样本,把教师能力、学生容量与训练重点结合起来。
数据工作的重点是数量 × 质量 × 分布。
数量提供覆盖基础,质量影响学习效果,分布决定哪些场景被充分学习。统一存储、多模态检索与规模化挖掘,则用于从海量数据中找到有价值的样本,补齐常见场景与长尾问题的覆盖。
Max 的数据选择还受到产品目标约束。按照刘先明的介绍,Ultra 以向 L4 能力演进为长期研发目标,持续拓展场景覆盖、长尾问题处理和跨区域泛化能力;Max 聚焦通勤与日常使用,在数据选择和训练中,将有限资源优先投入这些高频场景。
因此,Max 蒸馏同时包含架构层面的资源分配和训练层面的场景取舍。
03 .
第二代 VLA 的能力结构,
构成蒸馏的迁移背景
小鹏希望尽可能保留的第二代 VLA 原始能力,来自四项相互配合的架构设计。
InfiniVLA 负责历史信息。 本次车端部署选择 30 秒历史上下文,通过缓存机制控制长时序处理的计算开销,配合流式自回归推理,持续接收观察、进行推理并输出行动。

X-Foresight 负责未来预测。 根据车辆位置、速度和环境等信息的变化预测未来场景,车端方案选择 6 秒预测范围,使当前决策能够参考后续变化。
Flow Matching Head 负责动作轨迹生成。 以融合视觉、导航和车辆状态的长时序驾驶表征为条件,通过学习的向量场将噪声转化为动作轨迹,拟合多峰分布,表达不同驾驶意图与轨迹选择。训练阶段结合安全、效率、舒适和合规反馈,通过强化学习优化策略。
MoT 负责容量与专家分工。 通过视觉与文本信息指导场景切换,选择相应专家,同时复用视觉信息、保持长时记忆连续。
这几项技术共同建立了第二代VLA整体的时间能力:InfiniVLA 保留过去,流式推理跟进现在,X-Foresight 预测未来,Flow Matching 表达多种行动可能,MoT 为这些能力提供更有效的容量与分工。
04 .
单图灵平台Max蒸馏已落地,
双 Orin X平台在推进
单图灵平台上的 Max 蒸馏已经落地,双 Orin X 平台的蒸馏版本正在推进,并已开始内部测试。
刘先明指出,双 Orin 版本涉及跨平台、跨模型架构的蒸馏,技术挑战更大,需要对底层甚至算子层面进行更彻底的优化。
这延续了单图灵方案的设计逻辑:学生模型需要围绕目标硬件调整,模型、编译器与部署链路共同影响最终执行效率。双 Orin X 的适配进一步深入到算子层面。
后续,无论单图灵还是双 Orin,蒸馏版 VLA Lite 都将随着基座模型能力升级持续优化。
小鹏第二代 VLA 的 Max 蒸馏,核心是围绕芯片瓶颈重构学生架构,降低视觉计算负担并尽可能保留模型容量,同时结合教师能力、目标场景数据与不同平台的底层优化,实现能力迁移。
.....