-
论文英文题目:PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization
-
论文发表期刊:CVPR (IEEE/CVF Conference on Computer Vision and Pattern Recognition)
-
论文发表年份:2026年
1、基本情况
- 解决的问题 :论文解决了无人机在GNSS限制(无卫星信号)环境下的高精度、鲁棒且实时的自身6自由度(6-DoF)位姿估计和观察目标的地理定位问题。它旨在克服传统方法依赖昂贵有源传感器(如激光测距仪)和易漂移的视觉惯性里程计(VIO)的局限。
- 采用的方法 :提出了一种名为 PiLoT 的统一框架,核心思想是将定位转化为像素到3D的直接配准问题。通过将实时视频流与带有地理参考的3D地图(如谷歌地球)进行连续配准,实现无漂移定位。
- 方法的适用范围:适用于长航程飞行、剧烈运动、昼夜或跨季节环境变化等具有挑战性的航空部署场景。
- 方法的局限性:在极端视觉条件(如浓雾)或显著的地图/相机标定偏差下性能可能下降;目前依赖高保真3D模型,在缺乏3D网格数据的区域(如广阔荒野)适用性受限。
2、数据集情况
论文构建了一个百万级的大规模合成数据集,用于训练无人机专用的特征提取网络,弥补了现有数据集在规模和几何标注上的不足。
- 构建工具:开发了基于 AirSim-Cesium-Unreal Engine 的自动化渲染管线,实现了从大规模地理空间数据到地理对齐图像的转换。
- 规模 :涵盖82个地区,总飞行距离达650.3公里,包含超过110万对RGB-D图像。
- 标注精度:提供精确且经过投影验证的6-DoF位姿和每像素绝对深度图。
- 多样性:模拟了多种天气(晴、雾、雨)、光照(昼夜)以及极端的相机视角(俯仰、偏航旋转、不同高度)。
3、主要技术路线
(1)总体概括
PiLoT 采用双线程引擎架构,将耗时的地图渲染与核心定位线程解耦,确保低延迟的同时实现无漂移的精度。
(2)分项介绍
- 渲染线程 (Render Thread) :
- 输入:上一帧的估计位姿 \(\hat{T}_{i-1}\)。
- 流程 :利用等速卡尔曼滤波器(KF)预测当前参考位姿 \(\hat{T}_{i|i-1}\);渲染合成视图(RGB图像 \(I_i^r\) 及深度图 \(D_i^r\)),并通过反投影生成一系列3D地理锚点 (Geo-anchors) \(P^W_j\)。
- 输出:包含参考图像、预测位姿和地理锚点的参考包 \(B_i\)。
- 定位线程 (Localization Thread) :
- 输入:实时视频查询帧 \(I_q\) 和参考包 \(B_i\)。
- 流程 :
- 特征提取:使用轻量级网络(MobileOne-S0 编码器 + U-Net 解码器)提取3层特征金字塔(粗、中、精)及不确定性图。
- JNGO优化器 :执行神经引导的联合随机梯度优化。首先通过"旋转感知采样"在俯仰和偏航轴上生成大量位姿假设;随后在特征空间内并行执行由粗到精的 Levenberg-Marquardt (LM) 优化;最后结合运动约束选择最佳位姿。
- 输出:无人机自身6-DoF位姿及查询帧中任意像素的3D地理坐标(经纬高度)。
- 技术优势:实现了高达25 FPS以上的运行速度,且能处理高达10米和10度偏航的帧间大位移。
(3)损失函数
- 训练几何损失 (Geometric Loss): \L = \\sum_j \\rho_B(\| p_j\^q - \\tilde{p}_j\^q \|_2\^2)\\ 其中 \(p_j^q\) 为地理锚点的真实2D投影,\(\tilde{p}_j^q\) 为基于位姿估计的预测投影,\(\rho_B\) 为 Barron 鲁棒损失函数。该损失迫使网络学习基于稳定3D几何的特征。
- 推理优化代价函数 : 最终 pose 的选择基于总代价: \C_{total}\^{(m)} = C_{photo}\^{(m, \\ell=2)} + \\lambda \| \\log(\\hat{T}_{pred}\^{-1} \\tilde{T}'*m)\^\\vee \|_2\^2\\ 其中 \(C* {photo}\) 为特征光度代价,第二项为运动正则项,利用运动学先验排除离群假设。
4、实验结果概括
(1)评价指标
- 中值误差 (Median Error):成功定位帧的平移(米)和旋转(度)中值。
- 召回率 (Recall@k):在给定平移/旋转阈值内成功定位的帧百分比。
- 完整性 (Completeness):产生有效位姿且未发生失效的帧百分比。
- 频率 (Frequency/FPS):每秒处理帧数。
(2)评测结果
在合成(SynthCity-6)与真实世界(UAVScenes, UAVD4L-2yr)基准上,PiLoT 均显著超越了 PixLoc 和 Render2Loc 等先进方法。在 NVIDIA Jetson Orin 平台上运行速度达到 28.0 FPS ,中值平移误差在不同数据集上均处于亚米级至米级。
图表描述与解读

-
图 1 :PiLoT 概览。系统通过将实时视频帧 与带有地理参考的3D地图 作为输入,实现了在无GNSS和IMU信号 环境下的高精度、无漂移且实时的自身与目标地理定位。图中描绘了一条长度为10,011米的无人机长距离飞行轨迹,轨迹颜色根据位置误差进行编码(绿色代表低误差,红色代表高误差),系统最终实现了1.374米的中值误差 、100%的成功率 以及每帧30至40毫秒 的极低处理延迟。系统的核心输出包含两部分:一是通过底部一排查询视图中AR叠加层的紧密对齐所体现的无人机6自由度(6-DoF)位姿 ,二是通过左侧电影胶片视图中的动态目标跟踪所示,能够获取查询图像中任意像素的3D地理坐标(经度、纬度、高度)。此外,图1底部的序列图重点展示了该系统在面对跨昼夜(从19:23的晴天到19:36的夜间)及跨季节等剧烈环境变化挑战时的卓越鲁棒性。
-

-
图 2 :双线程框架。核心技术是将耗时的地图渲染过程与核心定位线程进行解耦并并行运行,以解决精度与实时性之间的矛盾。底部的渲染线程 (Render Thread)首先利用等速卡尔曼滤波器(KF Predictor)预测当前的参考位姿 \(\hat{T}_{i|i-1}\),随后根据该位姿渲染合成视图(RGB图像 \(I_i^r\) 及深度图 \(D_i^r\)),并通过反投影(Reprojection)生成包含3D地理锚点的参考包 \(\mathcal{B}_i\)。与此同时,顶部的定位线程(Localization Thread)接收实时视频查询帧 \(I_i^q\) 并结合上一轮生成的参考包执行像素到3D配准(Pixel-to-3D Registration),从而输出当前的6自由度(6-DoF)位姿 \(\hat{T}_i\)。这种并行架构消除了传统线性管线中定位引擎必须等待渲染任务完成的时间瓶颈,确保了系统能够在保持高频运行的同时,利用动态更新的地理锚点实现无漂移的绝对定位。
-

-
图 3 :框架与定位管线。展示了PiLoT框架的整体管线与定位机制 ,其总体定位管线(a)以查询帧和地理参考3D地图为输入,通过特征提取骨干网络得到特征残差,并输入JNGO优化器 ,最终输出无人机的6自由度(6-DoF)位姿及目标的3自由度(3-DoF)地理位置坐标。该框架的核心在于其高效的"一对多"配准范式;(b)即通过单一参考视图生成的3D地理锚点(Geo-anchors),在特征空间内与大量的位姿假设(Hypotheses)进行并行对齐。随后,由粗到精的优化器 (c)在特征金字塔的不同层级上迭代运行,通过逐步减小特征残差来收敛搜索空间,从而锁定最优位姿。最终估计轨迹(d)展示了无人机在3D地图上连续、鲁棒且无漂移的飞行路径,同时系统还配备了目标指示器(Target indicator),能够通过位姿深度查找将查询帧中的任意2D像素映射为现实世界中的经纬高坐标。
-

-
图 4 :合成数据生成。展示了PiLoT大规模合成数据集的生成过程 及其带来的零样本"仿真到现实"(sim-to-real)泛化性能 。图中(a)部分描绘了利用Cesium for Unreal插件在地理参考3D瓦片上渲染出的真实无人机飞行轨迹,该数据集涵盖了82个地区,总飞行里程达650.3公里,并生成了超过110万对RGB-D图像;(b)部分展示了数据集在天气、光照时间以及视点(包括平移Tx/Ty、高度Tz、俯仰角及偏航角旋转)上的多工况多样性 ;(c)部分强调了其几何一致性,通过导出每像素绝对深度并进行重投影验证,确保了合成数据与3D结构的严丝合缝;(d)部分则通过对比实拍查询帧与合成参考帧在三个层级(L0粗糙、L1中等、L2精细)上的特征金字塔,直观地证明了该数据集能驱动网络学习到领域不变的几何特征,从而在真实世界数据中实现卓越的泛化表现。
-

-
图 5 :旋转感知采样与优化。展示了系统在俯仰角(Pitch)和偏航角(Yaw)空间内的位姿收敛过程,体现了JNGO优化器 如何通过结合宽范围的旋转感知采样 与并行的由粗到精优化 ,实现在无人机剧烈运动下的鲁棒定位。图(a)初始阶段 展示了在卡尔曼预测位姿(蓝色菱形)周围,系统利用各向异性采样策略生成大量初始假设(种子点),这些种子点覆盖了较广的旋转搜索范围以确保包含真实位姿(红星)。随后在(b)至(d)的粗、中、精三级LM优化过程中,这些位姿假设在特征金字塔的不同层级上并行迭代,可视化图中的颜色代表了特征光度代价(Loss),可以看到假设点群随迭代逐步向低损失区域靠拢并最终精准地收敛于真实位姿,从而克服了局部最优并纠正了帧间大位移造成的偏差。
-

-
图 6 :每帧稳定性分析。定量展示合成轨迹上的每帧稳定性分析 ,对比了PiLoT与Render2Loc、PixLoc、Render2RAFT及Render2ORB等基线方法在平移误差(Position Error)和旋转误差(Orientation Error)随时间(帧索引)的变化情况。图中重点分析了在雾天(Foggy)和夜间(Night)等极端视觉挑战下的表现,结果清晰地显示出PiLoT(以绿色表示)的误差分布始终维持在极低水平,且相较于其他方法产生的频繁跳变,PiLoT表现出极少的"灾难性离群点"。这组图表有力地证明了PiLoT框架在恶劣环境和复杂运动状态下具有卓越的鲁棒性和时间连续性,能够提供比现有最先进(SoTA)视觉定位方法更稳定、更平滑且无漂移的定位轨迹。
-

-
图 7 :定性轨迹结果。展示了在 UAVD4L-2yr 样本序列上,无人机自身定位与动态目标地理定位的定性对比结果 。图中上半部分描绘了无人机的飞行轨迹,其中 PiLoT(绿色) 的估计轨迹与 RTK 真实值(黑色) 最为贴合,明显优于 Render2ORB、Render2RAFT、PixLoc 和 Render2Loc 等对比方法。图的下半部分通过颜色编码展示了动态目标的定位误差 ,颜色代表预测位置与真实位置之间的欧几里得距离(蓝色表示低误差,红/黄色表示高误差)。结果直观地证明,由于 PiLoT 提供了更稳定、更高精度的自身位姿估计,其生成的目标轨迹呈现出统一的蓝色,意味着在整个飞行过程中均保持了极低的目标定位误差,实现了卓越的动态目标追踪性能。
-

-
表 1:无人机数据集对比。详细对比了本文提出的数据集与现有主流无人机定位数据集(如 University-1652、SUES-200、UAVScenes、UAVD4L 等)在规模、视角多样性和几何标注完整性方面的差异。该表从图像数量(Img)、覆盖区域(Region)、飞行高度(Alt)与相机俯仰角(Pitch)的范围、数据类型(合成或真实)、环境工况变化(Cond.)、以及是否提供 6 自由度真实位姿(6-DoF)、米级深度图(Depth)和连续视频序列(Seq.)等多个维度进行了全面评估。对比结果清晰地展示了现有数据集的局限性,即大多缺乏在大规模场景下同时提供精确 6-DoF 位姿和深度标注的能力,而本文构建的数据集不仅在规模上达到了百万级(1M+),覆盖区域多达 378 个,且在俯仰角变化、环境工况以及全方位的几何与序列标注上均处于领先地位,这为网络学习稳定的 3D 几何特征并实现从仿真到现实(sim-to-real)的零样本泛化提供了核心支撑。
-

-
表 2 :综合性能对比。展示了 PiLoT 系统与多种基线方法(包括混合定位方法 Render2ORB/RAFT 和绝对定位方法 PixLoc、Render2Loc 等)在 SynthCity-6(合成) 、UAVScenes(真实) 及 UAVD4L-2yr(真实) 三个代表性数据集上的综合性能对比。该表从运行频率(FPS)、平移与旋转的中值误差(Med m/◦)、不同阈值下的召回率(R@1/3/5)以及定位完整性(Comp.)四个核心维度进行了定量评估。结果显示,PiLoT 在所有测试基准上均确立了新的技术标杆(SoTA):它不仅以 28.0 FPS 的处理速度刷新了推理效率记录,且在定位精度上显著优于现有最先进方法(如 RoMaV2 驱动的 Render2Loc),在极具挑战性的 UAVD4L-2yr 数据集(包含两年的季节和光照跨度)中实现了 0.92 米 的中值平移误差和 100% 的定位完整性。这组数据有力地证明了 PiLoT 框架在处理剧烈环境变化时的卓越鲁棒性,以及其在无需任何真实数据微调的情况下实现跨领域(仿真到现实)的高精度零样本泛化能力。
-

-
表 3 :目标地理定位性能。定量展示了 PiLoT 与多种代表性基线方法在动态目标地理定位 (Target Geo-localization)任务上的性能对比结果,有力地证明了该系统卓越的自身定位精度能直接转化为极高精度的目标定位能力。该表分别在 Single-Target (Real) (真实世界单目标,基于 UAVD4L-2yr)和 Multi-Target (Syn) (合成多目标,基于 UAVD4L-SynTarget)两个基准上进行了评估,并采用 Recall@1/3/5 作为核心指标,即定位误差在 1 米、3 米和 5 米范围内的目标百分比。实验数据显示,PiLoT 在所有场景下均大幅领先于 Render2Loc 和 PixLoc 等方法:在真实世界挑战中,其 1 米误差内的目标召回率达到了 90.81% ,而在合成多目标环境下更达到了 93.74%。这一结果直观地反映出,通过 PiLoT 获取的高精度 6 自由度位姿结合深度查找(Depth Lookup),能够实现对查询图像中任意像素位置的精准经纬高映射,从而为无人机提供实时、稳定且具备毫秒级响应能力的动态目标追踪性能。
-

-
表 4 :消融实验。汇总了 PiLoT 系统的消融实验结果 ,通过定量评估各个核心组件以及所提训练数据集对定位性能(采用不同平移/旋转阈值下的召回率 Recall@k)的具体贡献,验证了系统设计的有效性。在系统组件消融 中,实验显示仅使用现成的(Off-the-shelf)骨干网络时召回率极低(1m/1° 仅为 4.2%),而加入领域特定训练 后性能显著提升至 51.4%,随后引入旋转感知位姿假设生成 机制使召回率大幅跃升至 83.8%,最终配合运动正则项 达到了 84.3% 的最优水平,证明了这些设计在应对无人机剧烈运动和初始位姿偏差时的关键作用。在训练数据消融方面,结果清晰地表明,在包含多样光照和天气的完整合成数据集上训练的模型(84.3%),其表现远优于仅使用 MegaDepth 真实世界数据(69.9%)或不含环境变化的合成数据(63.5%)的模型,这有力地证明了该大规模数据集在弥合"仿真到现实"领域差距、使特征适应无人机俯视及大倾角透视视角方面起到了核心支撑作用。
-
1、在没有GNSS信号时,系统如何获取第一帧的初始位姿?
-
在没有GNSS信号的环境下,PiLoT系统通常通过图像检索技术 (如NetVLAD等)将当前查询帧与带有地理参考的地图数据库进行匹配,或者利用粗略的传感器先验 (如惯性测量单元IMU数据或信号消失前的最后已知坐标)来获取第一帧的初始位姿先验。该系统对初始先验的精度具有极高的容忍度,其核心的JNGO优化器专门设计用于处理"嘈杂初始值",能够通过旋转感知采样生成大量位姿假设,并结合由粗到精的并行优化机制,在平移误差高达10米、偏航角误差高达10度的情况下依然能够实现稳健收敛,从而启动后续的连续视频定位管线。
-
2、卡尔曼滤波在本文中起到什么作用?
-
在本文提出的 PiLoT 框架中,卡尔曼滤波(Kalman Filter, KF) 采用等速模型(Constant-velocity),主要起到了线程解耦预测 、采样引导 以及运动先验约束 的核心作用。首先,在双线程架构中,渲染线程利用 KF 根据上一帧位姿预测当前参考位姿,从而提前生成 3D 地理锚点,实现了渲染与定位任务的并行化处理并确保了高频实时性;其次,在 JNGO 优化器 生成位姿假设时,KF 预测器提供了平移分布的统计参数,用于引导位姿假设的随机采样;最后,在位姿选择阶段,系统将 KF 预测位姿作为物理运动先验引入代价函数中,通过运动正则项计算假设位姿与预测位姿之间的测地距离,从而有效排除在剧烈运动或视觉干扰下产生的定位离群点,确保了定位轨迹的平滑性与鲁棒性。
-
3、2.5D地图和3D地图的区别是什么?
-
在无人机定位领域,2.5D地图与3D地图的主要区别在于其几何信息的完整性 以及对定位自由度(DoF)的支持能力 。2D/2.5D地图 通常由正射影像(DOM)结合数字高程模型(DEM/DSM)组成,虽然引入了海拔信息,但在本质上仍是单层的高度投影,缺乏建筑物侧面、遮挡物下方等复杂的立体几何细节,因此早期基于2D/2.5D地图的方法往往只能实现3自由度(经纬度、偏航角)的估计,且在处理大倾角、非俯视视角时由于几何畸变而效果受限。相比之下,本文PiLoT系统所采用的3D地图 (如谷歌地球的3D网格模型)包含了完整的体积几何结构和多视角的纹理信息,能够通过渲染线程生成任意相机位姿下的虚景合成视图,从而通过"像素到3D"的配准实现精确的6自由度(6-DoF)全位姿估计(包括经纬高及俯仰、翻滚、偏航角)。简而言之,2.5D地图更倾向于提供一种"带高度的平面视图",而3D地图则是可互动的数字孪生环境,是实现长距离、剧烈运动下无漂移绝对定位的核心基础。
-
4、如果上一帧位姿不准,怎么办?
-
如果上一帧位姿不准,PiLoT 系统主要通过其核心的 JNGO(神经引导联合随机梯度优化器) 机制来解决这一问题,确保系统在大范围偏差下仍能稳健收敛。具体而言,该系统放弃了传统的单点优化,转而采用"一对多"配准范式,利用旋转感知采样 策略在上一帧位姿(或预测位姿)周围主动生成多达 144 个初始位姿假设,并针对无人机运动敏感的俯仰角和偏航角轴显著扩大搜索范围。每一个生成的位姿假设都会在 CUDA 中进行由粗到精的并行精细化处理 ,利用三层特征金字塔通过梯度下降逐步减小特征残差,这使得系统即使在面临高达 10 米的平移误差和 10 度的偏航角误差 时,依然能够引导位姿向真实值实时收敛。在优化完成后,系统会根据包含运动正则项 的总代价函数进行筛选,利用等速卡尔曼滤波提供的"物理运动先验"来校验视觉对齐结果,从而有效排除那些在视觉上匹配但在物理运动规律上极不合理的离群点。此外,特征提取网络在训练阶段就专门针对 5-15 米及 5-15 度的随机位姿噪声进行了强化训练,使其学习到的 3D 几何特征对初始化不确定性具有极强的鲁棒性。
-
5、3D渲染的作用是什么?
-
在 PiLoT 框架中,3D 渲染 的核心作用是作为连接全球地理参考 3D 地图与实时视频流的桥梁,通过生成带有几何真值的虚拟参考视图来实现高精度的绝对定位。具体而言,系统中的渲染线程 (Render Thread)利用卡尔曼滤波预测的位姿,实时从 3D 地图中渲染出合成的 RGB 图像及对应的深度图,并利用反投影技术将深度有效的像素映射到世界坐标系中,从而构建一系列 3D 地理锚点 (Geo-anchors),为后续定位线程的"像素到 3D 配准"提供关键的几何基准。这种设计通过双线程引擎 将耗时的地图渲染与核心定位任务解耦并并行运行,不仅有效消除了计算瓶颈,确保了系统在嵌入式硬件上能够以超过 25 FPS 的速度实时运行 ,还因为渲染视图直接源自地理参考的全局 3D 地图,从而从根本上消除了传统方法的累积漂移,实现了无漂移的 6 自由度位姿估计 以及针对动态目标的精准地理定位。