
「点云做"骨架",扩散做"血肉"」
目录
[01 三大核心配套模块](#01 三大核心配套模块)
[1.1 Reset-and-Roll:适配仿真交互的改良滚动扩散](#1.1 Reset-and-Roll:适配仿真交互的改良滚动扩散)
[1.2 点云双分支骨架:解决推演几何漂移核心约束](#1.2 点云双分支骨架:解决推演几何漂移核心约束)
[1.3 nuPlan-SimGen闭环生成接口](#1.3 nuPlan-SimGen闭环生成接口)
[02 横向对标](#02 横向对标)
[03 数据集量化实验](#03 数据集量化实验)
[3.1 nuScenes标准静态场景对比](#3.1 nuScenes标准静态场景对比)
[3.2 nuPlan自定义变道闭环测试](#3.2 nuPlan自定义变道闭环测试)
[3.3 长时序100帧连续推演定性验证](#3.3 长时序100帧连续推演定性验证)
[3.4 数据集质量辅助验证](#3.4 数据集质量辅助验证)
[04 写在最后](#04 写在最后)
当前自动驾驶闭环仿真存在无法两全的行业矛盾:
- CARLA这类开源模拟器交互性拉满,但渲染画面和真实车载相机成像差距巨大;
- nuScenes真实数据集视觉保真度高,却属于开环固定轨迹,车辆换速、变道后无法实时生成对应传感器画面。
上海交大严骏驰团队、联合复旦、引望等提出Point as Skeleton生成式仿真框架:

依托离线累积点云构建场景骨架,搭配Reset-and-Roll滚动扩散推理机制,解决闭环推演过程误差持续放大痛点,在nuScenes、nuPlan两大数据集完成全维度验证,多场景FID、FVD生成画质指标全面优于DriveArena、MagicDiT等主流生成仿真基线,同时提供可直接接入规划模块的nuPlan-SimGen闭环接口,为端到端自动驾驶算法低成本、高保真仿真评测提供完整技术方案。
01 三大核心配套模块
整套框架分为Reset-and-Roll滚动扩散推理器、点云双分支骨架条件、nuPlan闭环生成接口三大部分,以预训练扩散模型作为视觉渲染主干,所有模块协同适配自动驾驶分步闭环滚动推演流程。

图 | Reset-and-Roll推理机制对比示意图
1.1 Reset-and-Roll:适配仿真交互的改良滚动扩散
传统Rolling Diffusion滚动扩散仅维持固定滑动隐窗口,无法适配模拟器"一步动作、一帧图像"的交互逻辑。模拟器每一步只会执行下一个规划路点,远期轨迹仅作为参考预测,不能固化进全局隐状态。

改良机制核心逻辑分为两步:
- **单步渲染阶段:**加载当前已确定的自车、障碍物状态,同时载入短期未来规划轨迹作为辅助条件,执行滚动窗口去噪,借助未来运动线索让车辆、行人运动更贴合真实路况;
- **仿真步切换前重置:**仅缓存只使用当前真实状态生成的干净隐向量,所有融入远期规划信息的临时隐变量全部丢弃,下一仿真步重新基于全新真实场景状态运算。
简化公式解读: 代表仅依靠历史真实状态预测下一帧,传统因果推理需要积分全部未来运动可能性,平均后运动预测趋于保守;Reset-and-Roll仅在当前帧渲染临时借用未来轨迹,不会永久留存混合时序隐变量,规避跨步骤误差传导。
消融对比能直观体现差距:标准滚动扩散推演90帧后画面大面积虚影、建筑形变;叠加Reset重置机制后,长时序画面几何一致性大幅提升。

图 | 多方案长时序定性效果对比图
图内从左至右依次为真值、普通自回归、因果全序列、Epona、标准滚动、本文Reset+点云骨架方案,第五组纯滚动方案背景随自车运动扭曲,第六组完整方案无明显畸变。
1.2 点云双分支骨架:解决推演几何漂移核心约束
单纯依靠图像特征做自回归生成,缺少底层三维几何锚点,长距离行驶道路、车辆轮廓会持续偏移。
论文把离线数据集所有LiDAR点云拆分为静态背景、动态目标两大资产,分别构建全局骨架模板,每一步仿真根据实时障碍物位姿重投影至相机平面,提供色彩、深度双重稳定条件。

图 | 点云骨架构建与投影全流程示意图
- **静态背景点云:**遍历全部仿真/真实日志LiDAR帧,统一转换至世界坐标系累积,剔除动态车辆点,生成固定全局场景骨架,全程不变;
- **动态目标点云:**按车型、行人类别聚类,生成类别通用点模板,仿真中根据实时3D包围盒平移旋转,匹配当前障碍物位置;
- 双分支投影条件:
**① 上色点分支:**将图像色彩映射至点云,投影生成彩色条件图,提供像素级外观约束;缺点是局部目标点云稀疏,单辆车仅少量扫描点,容易出现色块断层;
**② 模板深度分支:**用类别点模板生成稠密深度图,弥补上色分支几何缺失,两者拼接共同输入扩散模型作为强条件。

消融实验数据可以直观证明双分支价值:仅布局+历史帧条件FID高达44.88;叠加彩色条件降至38.27;再补充模板深度+实例增强后FID最低至27.85,目标IoU同步提升至58.57%。
配套实例点增强策略:训练时对车辆点云做体素扰动、视角随机投影,弥补仿真和真实扫描视角分布差距,进一步提升偏移轨迹下物体完整性。

图 | 3D实例增强流水线示意图
1.3 nuPlan-SimGen闭环生成接口
为打通生成模型与主流自动驾驶规划仿真链路,论文基于nuPlan平台开发专用插件,实现规划、仿真、图像渲染完整闭环。

图 | nuPlan-SimGen轨迹生成与语义评测示意图
核心功能:
- **轨迹偏移评测:**初始阶段复用原始日志位姿,指定步长后切换自定义变道、加减速轨迹,模拟自车脱离录制路线场景;
- **语义量化工具:**将点模板投影生成车辆掩码,和图像分割结果计算IoU,无真值偏移轨迹也能定量评估生成几何对齐程度;
- **全流程联动:**nuPlan规划器输出动作序列→交通模拟器更新全场景物体位姿→点云骨架重投影→扩散模型渲染图像→图像回传规划模块做下一轮决策。
整套接口兼容5Hz、6Hz两种图像生成帧率,适配不同算力车载仿真设备,同时支持批量生成长时序100帧以上连续驾驶视频。

图 | nuPlan仿真平台可视化界面
界面左侧为规划轨迹面板,右侧同步输出多视角生成驾驶图像与三维点云地图,可完整复现隧道、城市道路各类测试工况。
02 横向对标
当前自动驾驶生成仿真三条主流路线横向对比:
1. 纯重建类方案(Street Gaussians、OmniRe)

图 | Street Gaussians管线
优势:静态场景画质极高,几何精准;短板完全无法适配自车轨迹偏移,脱离录制路线画面直接失效,只能做离线场景可视化,不支持闭环交互仿真。
2. 重建+生成混合方案(FreeVS、R3D2)

图 | FreeVS管线
优势:小幅轨迹偏移可修复画面;短板依赖单场景重建资源,新增路段需要重新离线重建,无法全自动批量生成仿真数据,工业大规模评测效率低下。
3. 通用视频生成仿真(DriveArena、Epona、MagicDiT)

图 | DriveArena框架
优势:无需前置重建,直接根据布局生成画面;短板无三维几何约束,长时序推演道路、目标持续漂移,高速、长距离场景鲁棒性差。
Point as Skeleton属于「三维点云先验+改良滚动扩散」全新分支,兼具重建方案几何稳定性与生成方案灵活交互能力,核心差异化优势:
- 一是离线一次性构建场景骨架,后续任意自定义轨迹无需二次重建;
- 二是Reset机制根除跨步骤隐状态误差;
- 三是色彩+深度双点云条件双重锚定画面,长时序漂移远低于同类生成基线。

图 | 各方案逐帧FVD变化曲线
FVD数值越高代表画面时序失真越严重,本文方案全程维持最低曲线,Epona全序列FVD持续走高,纯激光布局基线失真幅度接近两倍。
03 数据集量化实验
实验选用nuScenes静态数据集、nuPlan自定义偏移仿真数据集两套评测体系,核心指标FID(单帧画质)、FVD(时序连贯度)、车辆掩码IoU(三维几何对齐度),不单纯堆砌SOTA名次,客观解读指标边界。
3.1 nuScenes标准静态场景对比

图 | nuScenes Dataset 上对比
选用SD1.5图像版、SD3.5视频版两套模型分别对标Panacea、MagicDrive、Epona等成熟生成方案:
- 图像版本FID 7.09、FVD 69.47,大幅领先Epona 7.50、82.80;
- 视频版本FID低至5.97,FVD仅58.3,是表格内最优结果。
3.2 nuPlan自定义变道闭环测试
模拟真实仿真最常用的偏离原始轨迹工况,所有模型无真值参考,依靠点掩码IoU衡量生成车辆位置准确性:
FreeVS视频基线IoU仅54.72;本文视频版本IoU达到59.92,同时FID压低至18.37,是所有方案里画质、几何对齐双最优。
IoU指标真实含义:数值越高,生成车辆和模拟器三维包围盒匹配度越高,规划模块读取图像感知时不会出现目标错位、漏检,直接影响仿真评测可信度;

图 | 工程核心指标
3.3 长时序100帧连续推演定性验证

图 | 长时序多方案可视化对比
整条序列时长接近17秒,涵盖城区道路、路口转弯等工况,Vanilla滚动方案中后期建筑严重扭曲,Epona车辆轮廓持续模糊,Point as Skeleton道路标线、车辆边界全程清晰,无大面积几何畸变。
补充消融结论:窗口推演越长,各类方案失真差距越明显,短时10帧内各方案差距微弱,只有长时序闭环仿真才能体现点云骨架约束的核心价值,短期小规模仿真场景下本方案增益不突出。
3.4 数据集质量辅助验证
论文提出TDQ轨迹分布分数衡量仿真数据集多样性,TDQ越高代表场景、车辆参数覆盖越全面。实验证明数据集TDQ和生成预测误差强负相关,样本量提升至百万级后误差趋于饱和。
04 写在最后
闭环自动驾驶仿真,长期卡在"高保真重建交互受限"与"灵活生成几何易漂"的两难之间。Point as Skeleton给出的答案,不是二选一,而是用离线累积点云搭起场景骨架,用色彩+深度双分支约束扩散模型的几何底线,再辅以Reset-and-Roll滚动推理掐断长时序误差传导。
它的价值在于三个层面:
- **对研究者:**提供一个可自定义轨迹的生成式仿真评测基准,无需逐场景重建;
- **对工程师:**打通生成与规划链路,支持端到端模型的低成本闭环迭代;
- **对行业:**在真实路测与纯仿真之间,补上了"既保真、又可控"的中间地带。
当然,它不是万能的。这套方案依赖激光雷达点云,恶劣天气和远距离场景下性能衰减明显,动态物体的点云完整性仍受限于传感器密度。它还不能替代真实路测,但它把生成式仿真从"能看"推到了"能用"的阶段。
在自动驾驶算法迭代越来越依赖仿真评测的今天,这个方向的探索才刚刚开始。
Ref
论文标题:Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation