51c自动驾驶~合集67

我自己的原文哦~ https://blog.51cto.com/whaosoft143/14936187

#xxx

.....

#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx
#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#xxx

.....

#第二代VLA蒸馏

刘先明谈小鹏第二代VLA蒸馏:重构视觉计算,尽可能保留模型容量

车端 VLA 蒸馏面临的直接矛盾,是在更有限的算力、内存、功耗与推理时延预算下,尽可能保留教师模型的能力和驾驶风格。

简单缩小模型、砍半或剪枝,可以用于适配部署条件,但学生模型能否承接教师能力、能否在目标芯片上高效执行,仍需要解决。

今日,小鹏通用智能中心负责人刘先明撰写长文,系统回顾了这次第二代 VLA 升级背后的技术路径,也进一步阐明了小鹏为什么要从"真实物理世界的客观约束"出发,重新思考模型架构。

小鹏第二代 VLA 引入了长时序理解、未来预测和多种行动轨迹表达,这些能力进一步增加了模型容量与计算效率的要求。

刘先明在介绍 XOS 6.3.0 底层架构时,将 Max 蒸馏归纳为四项工作:针对芯片重做架构、持续增强教师模型、提高学生模型的基础能力,以及优化训练数据的质量与分布。

01 .

先重构视觉计算,尽可能保留大脑容量

Max 蒸馏从学生模型的架构开始。

按照刘先明的介绍,团队围绕 Max 车型的计算瓶颈,重新分配模型中的计算资源。其中,计算量最重的 ViT 部分进行了彻底重构。

具体做法包括:

以 HybridViT、TuringViT 等视觉架构工作为基础,重构视觉部分。

使用学习式压缩降低有效计算量。结合编译器与部署优化,提高硬件利用效率。

在上述优化基础上,尽可能保留模型大脑容量。

这几项工作的关系很明确:视觉架构与学习式压缩用于降低有效计算量,编译器和部署优化用于提高硬件执行效率,资源分配则尽量保留承载模型能力的容量。

刘先明强调,这样做可以让学生模型在143aiwh消防通信安全二总线can总线接受蒸馏之前,就具备更高的能力起点。学生架构的硬件适配,是这套蒸馏方案的前置工作。

02 .

能力迁移依赖教师、

学生与数据分布的匹配

完成学生架构设计后,蒸馏还依赖两个条件:足够强的教师模型,以及合适的数据分布。

教师模型提供更丰富的学习信号;数据分布决定学生在哪些问题上学习,以及训练能否覆盖目标使用场景。小鹏依托数据基础设施组织高质量、分布合理的样本,把教师能力、学生容量与训练重点结合起来。

数据工作的重点是数量 × 质量 × 分布。

数量提供覆盖基础,质量影响学习效果,分布决定哪些场景被充分学习。统一存储、多模态检索与规模化挖掘,则用于从海量数据中找到有价值的样本,补齐常见场景与长尾问题的覆盖。

Max 的数据选择还受到产品目标约束。按照刘先明的介绍,Ultra 以向 L4 能力演进为长期研发目标,持续拓展场景覆盖、长尾问题处理和跨区域泛化能力;Max 聚焦通勤与日常使用,在数据选择和训练中,将有限资源优先投入这些高频场景。

因此,Max 蒸馏同时包含架构层面的资源分配和训练层面的场景取舍。

03 .

第二代 VLA 的能力结构,

构成蒸馏的迁移背景

小鹏希望尽可能保留的第二代 VLA 原始能力,来自四项相互配合的架构设计。

InfiniVLA 负责历史信息。 本次车端部署选择 30 秒历史上下文,通过缓存机制控制长时序处理的计算开销,配合流式自回归推理,持续接收观察、进行推理并输出行动。

X-Foresight 负责未来预测。 根据车辆位置、速度和环境等信息的变化预测未来场景,车端方案选择 6 秒预测范围,使当前决策能够参考后续变化。

Flow Matching Head 负责动作轨迹生成。 以融合视觉、导航和车辆状态的长时序驾驶表征为条件,通过学习的向量场将噪声转化为动作轨迹,拟合多峰分布,表达不同驾驶意图与轨迹选择。训练阶段结合安全、效率、舒适和合规反馈,通过强化学习优化策略。

MoT 负责容量与专家分工。 通过视觉与文本信息指导场景切换,选择相应专家,同时复用视觉信息、保持长时记忆连续。

这几项技术共同建立了第二代VLA整体的时间能力:InfiniVLA 保留过去,流式推理跟进现在,X-Foresight 预测未来,Flow Matching 表达多种行动可能,MoT 为这些能力提供更有效的容量与分工。

04 .

单图灵平台Max蒸馏已落地,

双 Orin X平台在推进

单图灵平台上的 Max 蒸馏已经落地,双 Orin X 平台的蒸馏版本正在推进,并已开始内部测试。

刘先明指出,双 Orin 版本涉及跨平台、跨模型架构的蒸馏,技术挑战更大,需要对底层甚至算子层面进行更彻底的优化。

这延续了单图灵方案的设计逻辑:学生模型需要围绕目标硬件调整,模型、编译器与部署链路共同影响最终执行效率。双 Orin X 的适配进一步深入到算子层面。

后续,无论单图灵还是双 Orin,蒸馏版 VLA Lite 都将随着基座模型能力升级持续优化。

小鹏第二代 VLA 的 Max 蒸馏,核心是围绕芯片瓶颈重构学生架构,降低视觉计算负担并尽可能保留模型容量,同时结合教师能力、目标场景数据与不同平台的底层优化,实现能力迁移。

.....

相关推荐
资讯综合1 小时前
国内AI原生公司观察:联想集团业务重构与MiniMax模型研发
人工智能
江畔柳前堤1 小时前
On-Policy Distillation 全景深潜
人工智能·网络协议·目标检测·http·机器学习·chatgpt·重构
计算机编程-吉哥1 小时前
深度学习:我用YOLO11-L做了一个水下垃圾检测系统 对比YOLOv8-L/Faster R-CNN【计算机毕业设计选题推荐】
人工智能·深度学习·yolo·课程设计·计算机毕业设计选题
小刘快学习1 小时前
批量推理的吞吐优化:聚合平台怎么做
人工智能
IvorySQL1 小时前
PostgreSQL 日报|8 字节 TOAST 值支持(9 月 16 日)
数据库·人工智能·postgresql
ai小陈1 小时前
LTX2.5音视频生成任务验收实战:批量记录与音画质量检查
人工智能·python·深度学习·ai·音视频·gpu算力
机器人猎头David1 小时前
如何看待机器人行业人才频繁流动?
人工智能·机器人猎头·猎头公司·猎头公司推荐·机器人猎头公司
精益数智工坊1 小时前
云计算环境元数据是什么意思?云计算元数据管理怎么做?
大数据·人工智能·数据挖掘·数据可视化
湘-枫叶情缘1 小时前
为什么你通过AI学了很多,却感觉自己没变强? ——从“知识输入”到“能力形成”的认知转化工程
人工智能·程序人生