51c自动驾驶~合集67

我自己的原文哦~ https://blog.51cto.com/whaosoft143/14936187

#xxx

.....

#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#第二代VLA蒸馏

刘先明谈小鹏第二代VLA蒸馏:重构视觉计算,尽可能保留模型容量

车端 VLA 蒸馏面临的直接矛盾,是在更有限的算力、内存、功耗与推理时延预算下,尽可能保留教师模型的能力和驾驶风格。

简单缩小模型、砍半或剪枝,可以用于适配部署条件,但学生模型能否承接教师能力、能否在目标芯片上高效执行,仍需要解决。

今日,小鹏通用智能中心负责人刘先明撰写长文,系统回顾了这次第二代 VLA 升级背后的技术路径,也进一步阐明了小鹏为什么要从"真实物理世界的客观约束"出发,重新思考模型架构。

小鹏第二代 VLA 引入了长时序理解、未来预测和多种行动轨迹表达,这些能力进一步增加了模型容量与计算效率的要求。

刘先明在介绍 XOS 6.3.0 底层架构时,将 Max 蒸馏归纳为四项工作:针对芯片重做架构、持续增强教师模型、提高学生模型的基础能力,以及优化训练数据的质量与分布。

01 .

先重构视觉计算,尽可能保留大脑容量

Max 蒸馏从学生模型的架构开始。

按照刘先明的介绍,团队围绕 Max 车型的计算瓶颈,重新分配模型中的计算资源。其中,计算量最重的 ViT 部分进行了彻底重构。

具体做法包括:

以 HybridViT、TuringViT 等视觉架构工作为基础,重构视觉部分。

使用学习式压缩降低有效计算量。结合编译器与部署优化,提高硬件利用效率。

在上述优化基础上,尽可能保留模型大脑容量。

这几项工作的关系很明确:视觉架构与学习式压缩用于降低有效计算量,编译器和部署优化用于提高硬件执行效率,资源分配则尽量保留承载模型能力的容量。

刘先明强调,这样做可以让学生模型在143aiwh消防通信安全二总线can总线接受蒸馏之前,就具备更高的能力起点。学生架构的硬件适配,是这套蒸馏方案的前置工作。

02 .

能力迁移依赖教师、

学生与数据分布的匹配

完成学生架构设计后,蒸馏还依赖两个条件:足够强的教师模型,以及合适的数据分布。

教师模型提供更丰富的学习信号;数据分布决定学生在哪些问题上学习,以及训练能否覆盖目标使用场景。小鹏依托数据基础设施组织高质量、分布合理的样本,把教师能力、学生容量与训练重点结合起来。

数据工作的重点是数量 × 质量 × 分布。

数量提供覆盖基础,质量影响学习效果,分布决定哪些场景被充分学习。统一存储、多模态检索与规模化挖掘,则用于从海量数据中找到有价值的样本,补齐常见场景与长尾问题的覆盖。

Max 的数据选择还受到产品目标约束。按照刘先明的介绍,Ultra 以向 L4 能力演进为长期研发目标,持续拓展场景覆盖、长尾问题处理和跨区域泛化能力;Max 聚焦通勤与日常使用,在数据选择和训练中,将有限资源优先投入这些高频场景。

因此,Max 蒸馏同时包含架构层面的资源分配和训练层面的场景取舍。

03 .

第二代 VLA 的能力结构,

构成蒸馏的迁移背景

小鹏希望尽可能保留的第二代 VLA 原始能力,来自四项相互配合的架构设计。

InfiniVLA 负责历史信息。 本次车端部署选择 30 秒历史上下文,通过缓存机制控制长时序处理的计算开销,配合流式自回归推理,持续接收观察、进行推理并输出行动。

X-Foresight 负责未来预测。 根据车辆位置、速度和环境等信息的变化预测未来场景,车端方案选择 6 秒预测范围,使当前决策能够参考后续变化。

Flow Matching Head 负责动作轨迹生成。 以融合视觉、导航和车辆状态的长时序驾驶表征为条件,通过学习的向量场将噪声转化为动作轨迹,拟合多峰分布,表达不同驾驶意图与轨迹选择。训练阶段结合安全、效率、舒适和合规反馈,通过强化学习优化策略。

MoT 负责容量与专家分工。 通过视觉与文本信息指导场景切换,选择相应专家,同时复用视觉信息、保持长时记忆连续。

这几项技术共同建立了第二代VLA整体的时间能力:InfiniVLA 保留过去,流式推理跟进现在,X-Foresight 预测未来,Flow Matching 表达多种行动可能,MoT 为这些能力提供更有效的容量与分工。

04 .

单图灵平台Max蒸馏已落地,

双 Orin X平台在推进

单图灵平台上的 Max 蒸馏已经落地,双 Orin X 平台的蒸馏版本正在推进,并已开始内部测试。

刘先明指出,双 Orin 版本涉及跨平台、跨模型架构的蒸馏,技术挑战更大,需要对底层甚至算子层面进行更彻底的优化。

这延续了单图灵方案的设计逻辑:学生模型需要围绕目标硬件调整,模型、编译器与部署链路共同影响最终执行效率。双 Orin X 的适配进一步深入到算子层面。

后续,无论单图灵还是双 Orin,蒸馏版 VLA Lite 都将随着基座模型能力升级持续优化。

小鹏第二代 VLA 的 Max 蒸馏,核心是围绕芯片瓶颈重构学生架构,降低视觉计算负担并尽可能保留模型容量,同时结合教师能力、目标场景数据与不同平台的底层优化,实现能力迁移。

.....

相关推荐
百度Geek说24 分钟前
Agentic Harness Workflow 框架:把 AI Coding 变成工程化流程
人工智能
Data-Miner26 分钟前
离线AI制表:模型适配与脚本固化实操
大数据·数据库·人工智能·excel
指针向南29 分钟前
视频截图发黑先检查透明区域
图像处理·人工智能·计算机视觉·音视频
地平线开发者34 分钟前
MQBench QAT量化实践指南
人工智能·算法·自动驾驶
Είναι η κοπέλα42 分钟前
llama.cpp 与 GGUF 格式:本地大模型的“裸引擎“
开发语言·人工智能·pytorch·python·conda
桃西西呀1 小时前
Spring AI Alibaba 之二:Spring AI 底座与原子抽象一笔带过,看清 SAA 在之上加了什么编排
人工智能·spring·llm
段一凡-华北理工大学1 小时前
高炉炼铁机器视觉与智能识别十八讲~系列文章05:炉顶料面识别:装料分布判读与布料制度优化
大数据·人工智能·机器视觉·工业智能化·高炉炼铁智能化·高炉炉顶料面识别
sbjdhjd1 小时前
智能体开始“动手”之后:OpenAI越权事件、Anthropic算力资本化与开放权重模型竞逐 | AI与SI行业日报整理(9月29日—10月6日)
大数据·人工智能·经验分享·笔记·ai·chatgpt·开源
hsfxuebao1 小时前
Loop Engineering 已死? 一文带你了解Graph Engineering
人工智能·后端
秦先生在广东1 小时前
Atlassian 携手 OpenAI 深化合作:以企业知识图谱驱动 AI 智能体在开发全流程中的应用
人工智能