上交严骏驰团队开源生成式仿真Point as Skeleton:闭环自动驾驶全新渲染方案

点云做"骨架",扩散做"血肉"

目录

[01 三大核心配套模块](#01 三大核心配套模块)

[1.1 Reset-and-Roll:适配仿真交互的改良滚动扩散](#1.1 Reset-and-Roll:适配仿真交互的改良滚动扩散)

[1.2 点云双分支骨架:解决推演几何漂移核心约束](#1.2 点云双分支骨架:解决推演几何漂移核心约束)

[1.3 nuPlan-SimGen闭环生成接口](#1.3 nuPlan-SimGen闭环生成接口)

[02 横向对标](#02 横向对标)

[03 数据集量化实验](#03 数据集量化实验)

[3.1 nuScenes标准静态场景对比](#3.1 nuScenes标准静态场景对比)

[3.2 nuPlan自定义变道闭环测试](#3.2 nuPlan自定义变道闭环测试)

[3.3 长时序100帧连续推演定性验证](#3.3 长时序100帧连续推演定性验证)

[3.4 数据集质量辅助验证](#3.4 数据集质量辅助验证)

[04 写在最后](#04 写在最后)


当前自动驾驶闭环仿真存在无法两全的行业矛盾:

  • CARLA这类开源模拟器交互性拉满,但渲染画面和真实车载相机成像差距巨大;
  • nuScenes真实数据集视觉保真度高,却属于开环固定轨迹,车辆换速、变道后无法实时生成对应传感器画面。

上海交大严骏驰团队、联合复旦、引望等提出Point as Skeleton生成式仿真框架:

依托离线累积点云构建场景骨架,搭配Reset-and-Roll滚动扩散推理机制,解决闭环推演过程误差持续放大痛点,在nuScenes、nuPlan两大数据集完成全维度验证,多场景FID、FVD生成画质指标全面优于DriveArena、MagicDiT等主流生成仿真基线,同时提供可直接接入规划模块的nuPlan-SimGen闭环接口,为端到端自动驾驶算法低成本、高保真仿真评测提供完整技术方案。

01 三大核心配套模块

整套框架分为Reset-and-Roll滚动扩散推理器、点云双分支骨架条件、nuPlan闭环生成接口三大部分,以预训练扩散模型作为视觉渲染主干,所有模块协同适配自动驾驶分步闭环滚动推演流程。

图 | Reset-and-Roll推理机制对比示意图

1.1 Reset-and-Roll:适配仿真交互的改良滚动扩散

传统Rolling Diffusion滚动扩散仅维持固定滑动隐窗口,无法适配模拟器"一步动作、一帧图像"的交互逻辑。模拟器每一步只会执行下一个规划路点,远期轨迹仅作为参考预测,不能固化进全局隐状态。

改良机制核心逻辑分为两步:

  • **单步渲染阶段:**加载当前已确定的自车、障碍物状态,同时载入短期未来规划轨迹作为辅助条件,执行滚动窗口去噪,借助未来运动线索让车辆、行人运动更贴合真实路况;
  • **仿真步切换前重置:**仅缓存只使用当前真实状态生成的干净隐向量,所有融入远期规划信息的临时隐变量全部丢弃,下一仿真步重新基于全新真实场景状态运算。

简化公式解读: 代表仅依靠历史真实状态预测下一帧,传统因果推理需要积分全部未来运动可能性,平均后运动预测趋于保守;Reset-and-Roll仅在当前帧渲染临时借用未来轨迹,不会永久留存混合时序隐变量,规避跨步骤误差传导。

消融对比能直观体现差距:标准滚动扩散推演90帧后画面大面积虚影、建筑形变;叠加Reset重置机制后,长时序画面几何一致性大幅提升。

图 | 多方案长时序定性效果对比图

图内从左至右依次为真值、普通自回归、因果全序列、Epona、标准滚动、本文Reset+点云骨架方案,第五组纯滚动方案背景随自车运动扭曲,第六组完整方案无明显畸变。

1.2 点云双分支骨架:解决推演几何漂移核心约束

单纯依靠图像特征做自回归生成,缺少底层三维几何锚点,长距离行驶道路、车辆轮廓会持续偏移。

论文把离线数据集所有LiDAR点云拆分为静态背景、动态目标两大资产,分别构建全局骨架模板,每一步仿真根据实时障碍物位姿重投影至相机平面,提供色彩、深度双重稳定条件。

图 | 点云骨架构建与投影全流程示意图

  1. **静态背景点云:**遍历全部仿真/真实日志LiDAR帧,统一转换至世界坐标系累积,剔除动态车辆点,生成固定全局场景骨架,全程不变;
  2. **动态目标点云:**按车型、行人类别聚类,生成类别通用点模板,仿真中根据实时3D包围盒平移旋转,匹配当前障碍物位置;
  3. 双分支投影条件:

**① 上色点分支:**将图像色彩映射至点云,投影生成彩色条件图,提供像素级外观约束;缺点是局部目标点云稀疏,单辆车仅少量扫描点,容易出现色块断层;

**② 模板深度分支:**用类别点模板生成稠密深度图,弥补上色分支几何缺失,两者拼接共同输入扩散模型作为强条件。

消融实验数据可以直观证明双分支价值:仅布局+历史帧条件FID高达44.88;叠加彩色条件降至38.27;再补充模板深度+实例增强后FID最低至27.85,目标IoU同步提升至58.57%。

配套实例点增强策略:训练时对车辆点云做体素扰动、视角随机投影,弥补仿真和真实扫描视角分布差距,进一步提升偏移轨迹下物体完整性。

图 | 3D实例增强流水线示意图

1.3 nuPlan-SimGen闭环生成接口

为打通生成模型与主流自动驾驶规划仿真链路,论文基于nuPlan平台开发专用插件,实现规划、仿真、图像渲染完整闭环。

图 | nuPlan-SimGen轨迹生成与语义评测示意图

核心功能:

  1. **轨迹偏移评测:**初始阶段复用原始日志位姿,指定步长后切换自定义变道、加减速轨迹,模拟自车脱离录制路线场景;
  2. **语义量化工具:**将点模板投影生成车辆掩码,和图像分割结果计算IoU,无真值偏移轨迹也能定量评估生成几何对齐程度;
  3. **全流程联动:**nuPlan规划器输出动作序列→交通模拟器更新全场景物体位姿→点云骨架重投影→扩散模型渲染图像→图像回传规划模块做下一轮决策。

整套接口兼容5Hz、6Hz两种图像生成帧率,适配不同算力车载仿真设备,同时支持批量生成长时序100帧以上连续驾驶视频。

图 | nuPlan仿真平台可视化界面

界面左侧为规划轨迹面板,右侧同步输出多视角生成驾驶图像与三维点云地图,可完整复现隧道、城市道路各类测试工况。

02 横向对标

当前自动驾驶生成仿真三条主流路线横向对比:

1. 纯重建类方案(Street Gaussians、OmniRe)

图 | Street Gaussians管线

优势:静态场景画质极高,几何精准;短板完全无法适配自车轨迹偏移,脱离录制路线画面直接失效,只能做离线场景可视化,不支持闭环交互仿真。

2. 重建+生成混合方案(FreeVS、R3D2)

图 | FreeVS管线

优势:小幅轨迹偏移可修复画面;短板依赖单场景重建资源,新增路段需要重新离线重建,无法全自动批量生成仿真数据,工业大规模评测效率低下。

3. 通用视频生成仿真(DriveArena、Epona、MagicDiT)

图 | DriveArena框架

优势:无需前置重建,直接根据布局生成画面;短板无三维几何约束,长时序推演道路、目标持续漂移,高速、长距离场景鲁棒性差。

Point as Skeleton属于「三维点云先验+改良滚动扩散」全新分支,兼具重建方案几何稳定性与生成方案灵活交互能力,核心差异化优势:

  • 一是离线一次性构建场景骨架,后续任意自定义轨迹无需二次重建;
  • 二是Reset机制根除跨步骤隐状态误差;
  • 三是色彩+深度双点云条件双重锚定画面,长时序漂移远低于同类生成基线。

图 | 各方案逐帧FVD变化曲线

FVD数值越高代表画面时序失真越严重,本文方案全程维持最低曲线,Epona全序列FVD持续走高,纯激光布局基线失真幅度接近两倍。

03 数据集量化实验

实验选用nuScenes静态数据集、nuPlan自定义偏移仿真数据集两套评测体系,核心指标FID(单帧画质)、FVD(时序连贯度)、车辆掩码IoU(三维几何对齐度),不单纯堆砌SOTA名次,客观解读指标边界。

3.1 nuScenes标准静态场景对比

图 | nuScenes Dataset 上对比

选用SD1.5图像版、SD3.5视频版两套模型分别对标Panacea、MagicDrive、Epona等成熟生成方案:

  • 图像版本FID 7.09、FVD 69.47,大幅领先Epona 7.50、82.80;
  • 视频版本FID低至5.97,FVD仅58.3,是表格内最优结果。

3.2 nuPlan自定义变道闭环测试

模拟真实仿真最常用的偏离原始轨迹工况,所有模型无真值参考,依靠点掩码IoU衡量生成车辆位置准确性:

FreeVS视频基线IoU仅54.72;本文视频版本IoU达到59.92,同时FID压低至18.37,是所有方案里画质、几何对齐双最优。

IoU指标真实含义:数值越高,生成车辆和模拟器三维包围盒匹配度越高,规划模块读取图像感知时不会出现目标错位、漏检,直接影响仿真评测可信度;

图 | 工程核心指标

3.3 长时序100帧连续推演定性验证

图 | 长时序多方案可视化对比

整条序列时长接近17秒,涵盖城区道路、路口转弯等工况,Vanilla滚动方案中后期建筑严重扭曲,Epona车辆轮廓持续模糊,Point as Skeleton道路标线、车辆边界全程清晰,无大面积几何畸变。

补充消融结论:窗口推演越长,各类方案失真差距越明显,短时10帧内各方案差距微弱,只有长时序闭环仿真才能体现点云骨架约束的核心价值,短期小规模仿真场景下本方案增益不突出。

3.4 数据集质量辅助验证

论文提出TDQ轨迹分布分数衡量仿真数据集多样性,TDQ越高代表场景、车辆参数覆盖越全面。实验证明数据集TDQ和生成预测误差强负相关,样本量提升至百万级后误差趋于饱和。

04 写在最后

闭环自动驾驶仿真,长期卡在"高保真重建交互受限"与"灵活生成几何易漂"的两难之间。Point as Skeleton给出的答案,不是二选一,而是用离线累积点云搭起场景骨架,用色彩+深度双分支约束扩散模型的几何底线,再辅以Reset-and-Roll滚动推理掐断长时序误差传导。

它的价值在于三个层面:

  • **对研究者:**提供一个可自定义轨迹的生成式仿真评测基准,无需逐场景重建;
  • **对工程师:**打通生成与规划链路,支持端到端模型的低成本闭环迭代;
  • **对行业:**在真实路测与纯仿真之间,补上了"既保真、又可控"的中间地带。

当然,它不是万能的。这套方案依赖激光雷达点云,恶劣天气和远距离场景下性能衰减明显,动态物体的点云完整性仍受限于传感器密度。它还不能替代真实路测,但它把生成式仿真从"能看"推到了"能用"的阶段。

在自动驾驶算法迭代越来越依赖仿真评测的今天,这个方向的探索才刚刚开始。

Ref

论文标题:Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation

论文链接:https://arxiv.org/pdf/2607.06516

相关推荐
HiEV1 天前
Mobileye 3.0:自动驾驶科技问题基本解决,Shashua押注物理AI
人工智能·自动驾驶
总线通信小百科2 天前
汽车零部件LIN总线测试三大痛点
经验分享·自动驾驶·汽车·数据处理
张彦峰ZYF2 天前
具身智能:AI 长出“手脚”,进入物理世界——大模型驱动机器人、自动驾驶与产业落地调研
人工智能·机器人·自动驾驶
才鲸嵌入式2 天前
JEPA具身智能或自动驾驶路线的公司
人工智能·机器学习·大模型·自动驾驶·具身智能·通用人工智能·jepa
爱分享的康康2 天前
aiSim6自动驾驶仿真平台:功能、技术与工程落地完整解析
人工智能·机器学习·自动驾驶
惊鸿一博2 天前
世界模型与闭环仿真_介绍与相关关系
人工智能·自动驾驶
feasibility.4 天前
从数字智能到物理智能体:深度解构具身智能时代的边缘计算、嵌入式实时系统与多形态智能体
人工智能·机器人·自动驾驶·嵌入式·无人机·具身智能·智能体
renhongxia15 天前
世界模型的四个商业场景:自动驾驶、机器人、内容产业与工业仿真
人工智能·机器人·自动驾驶
chenyuhao20245 天前
第一章_自动驾驶中的社会交互
人工智能·机器学习·自动驾驶