类型一:经典几何解算方法(基于投影几何)
此类方法通过建立机载实时图像与地理空间(或参考地图)之间的显式几何映射关系进行解算。
- 方法1:透视n点算法 (PnP, Perspective-n-Point)
- 输入是什么: 一组 2D 图像点及其在世界坐标系中对应的 3D 坐标对(通过像素匹配获取)、相机的内参矩阵。
- 核心原理是什么: 建立像点与空间 3D 点之间的几何投影关系,通过最小化重投影误差,利用 RANSAC 等策略求解相机的旋转矩阵 \(R\) 和平移向量 \(t\)。
- 输出是什么: 相机(无人机)在世界坐标系下的绝对位姿(6-DoF),进而推算目标经纬度。
- 有什么优势: 定位精度高(可达米级)、无累积误差、能够适应地物起伏明显的复杂低空场景。
- 方法2:地球椭球模型反演(无源定位)
- 输入是什么: 无人机自身位姿、相机内参、目标在图像上的像素坐标。
- 核心原理是什么: 将定位问题简化为观测射线(相机光心与像点连线)与地球椭球模型表面的交点求解问题。
- 输出是什么: 目标的精确地理坐标(经度、纬度、高程)。
- 有什么优势: 在不依赖外部基准图匹配的特定场景下也能工作,算法流程清晰且技术成熟。
类型二:检索与统计加权解算方法
此类方法通常用于"由粗到精"的定位范式,侧重于从大范围数据库中快速定位区域。
- 方法1:加权坐标估计 (WCE, Weighted Coordinate Estimation)
- 输入是什么: 从卫星影像库检索到的前 \(K\) 个候选候选图块及其坐标、查询特征与各候选特征的欧氏距离。
- 核心原理是什么: 根据特征向量间的距离分配权重,对多个候选坐标进行加权平均,并结合一类 SVM 算法滤除误匹配的离群点坐标。
- 输出是什么: 估计的地理中心位置(如 UTM 坐标)。
- 有什么优势: 能够有效抑制检索中的噪声匹配,提高在大范围区域内进行初始定位的鲁棒性。
类型三:深度学习回归与端到端预测方法
利用深度神经网络直接建立图像特征到空间位置的映射。
- 方法1:任务标记回归 (Task Token Regression,如 GAGeo 框架)
- 输入是什么: 查询图与参考图的视觉特征、多模态几何提示(如点、框)、可学习的任务特定标记。
- 核心原理是什么: 将任务标记嵌入 Transformer 序列中,利用注意力机制聚合跨视图几何特征,通过特定任务解码头在单次前向传播中回归目标属性。
- 输出是什么: 目标的边界框、分割掩码以及相机的精确位置与旋转。
- 有什么优势: 单阶段框架处理效率高、支持多任务并行输出、能有效利用 3D 几何先验减轻视角偏见。
类型四:几何感知的 3D 对齐与采样方法
结合三维先验知识(如 DSM、LoD 地图或重力对齐)进行空间对齐。
- 方法1:代价体积位姿采样 (Cost Volume Pose Sampling)
- 输入是什么: 查询图像特征、粗位姿初值、LoD 三维城市地图。
- 核心原理是什么: 在粗位姿周围进行位姿假设采样,通过投影 3D 线框/点云建立描述概率分布的代价体积,搜索最大概率位姿并利用 Gauss-Newton 等方法精细化。
- 输出是什么: 绝对 6-DoF 姿态信息。
- 有什么优势: 充分利用了城市场景的几何结构信息,能处理视角差异极大或重叠度低的匹配挑战。