无人机单目深度估计测试:ZipDepth 与 AerialMetric

提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档

文章目录

  • 前言
  • [1 ZipDepth:只有约 6M 参数的轻量级深度模型](#1 ZipDepth:只有约 6M 参数的轻量级深度模型)
    • [1.1 模型结构](#1.1 模型结构)
    • [1.2 知识蒸馏](#1.2 知识蒸馏)
    • [1.3 无人机影像测试](#1.3 无人机影像测试)
  • [2. AerialMetric / MoGe2-Aerial:面向无人机的 Metric Depth](#2. AerialMetric / MoGe2-Aerial:面向无人机的 Metric Depth)
    • [2.1 从 Relative Depth 到 Metric Depth](#2.1 从 Relative Depth 到 Metric Depth)
    • [2.2 针对 UAV 场景进行深度适配](#2.2 针对 UAV 场景进行深度适配)
    • [2.3 无人机影像测试](#2.3 无人机影像测试)
  • 总结

前言

最近在做一些无人机视觉相关的模型测试,其中一个比较感兴趣的方向是 Monocular Depth Estimation(单目深度估计)。

相比传统的双目视觉、激光雷达或者基于多视角重建的方法,单目深度估计只需要一张 RGB 图像,就可以预测场景中不同位置的深度信息。对于无人机来说,这类方法在目标定位、环境感知、避障、三维信息恢复以及后续空间分析中都有比较大的应用潜力。

这次主要测试了两个最近比较有意思的方向:

  • ZipDepth:强调轻量化和 Zero-shot 泛化能力;
  • AerialMetric / MoGe2-Aerial:专门针对无人机航拍视角进行 Metric Depth 适配。

虽然两者都可以输入一张无人机 RGB 图像并输出深度结果,但它们解决的问题其实并不完全相同。


1 ZipDepth:只有约 6M 参数的轻量级深度模型

ZipDepth 比较吸引我的地方是它非常强调 模型轻量化和实际部署能力。其推理模型参数量只有约 6.1M,相比很多基于大型 Vision Transformer 的单目深度模型要小很多。

1.1 模型结构

ZipDepth 的 Encoder 采用了类似 RepVGG 的可重参数化卷积结构。RepVGG 这类结构一个比较典型的特点是:训练阶段可以使用多分支结构增强特征表达能力,而在推理阶段,可以将这些分支重新参数化为标准卷积。

因此最终部署时,网络结构依然比较规整,对 GPU、TensorRT 或边缘设备通常更加友好。

在 Encoder 提取图像特征之后,ZipDepth 还结合了:

  • Strip Pooling
  • SE / Global Context
  • SPPF
  • Lightweight FPN Decoder

等结构,对不同尺度的场景信息进行融合。

对于无人机图像来说,这一点其实比较重要。因为航拍影像通常同时包含:

  • 大尺度道路和建筑;
  • 中尺度车辆、树木;
  • 小尺度屋顶结构和地面目标。

单纯依赖局部卷积特征,很容易缺少对整个场景空间关系的理解,因此模型需要同时考虑局部细节和较大范围的上下文信息。最后,ZipDepth 使用一种轻量化的上采样方式,将低分辨率深度特征恢复到原始图像分辨率。

1.2 知识蒸馏

ZipDepth 另外一个比较有意思的地方是它采用了 Knowledge Distillation(知识蒸馏)。

其 Teacher Model 使用的是较大的 Depth Anything V2-Large,通过大量不同场景的数据,将大型深度模型学习到的知识迁移到一个非常小的 CNN 网络中。因此 ZipDepth 的思路并不是单纯依靠小模型直接训练,而更接近于:大模型负责学习丰富的深度先验,小模型负责把这些知识压缩下来用于实际部署。这也是目前轻量视觉模型中非常常见的一条路线。

1.3 无人机影像测试

分别测试的是resize尺寸从1280 2048道2560的对比效果。从无人机影像的实际测试来看,ZipDepth 对场景整体的 前后空间关系恢复得比较明显。

例如:

建筑物与地面之间的高度关系;

道路与周围建筑的空间层次;

树木、车辆与背景之间的相对距离;

基本都能够从深度图中体现出来。

同时,一些建筑边缘和道路边界的深度变化也保持得比较完整。我觉得 ZipDepth 最大的特点并不是追求极致的 Metric Depth 精度,而是它在:模型大小、推理速度、Zero-shot 泛化能力和深度质量之间取得了一个比较好的平衡。

2. AerialMetric / MoGe2-Aerial:面向无人机的 Metric Depth

第二个测试的是 AerialMetric 项目中的 MoGe2-Aerial。

需要区分的是,AerialMetric 本身是一套针对无人机航拍场景构建的 Metric Depth 数据集与 Benchmark,而 MoGe2-Aerial 是基于 MoGe2 进一步进行 UAV 场景适配得到的模型。

2.1 从 Relative Depth 到 Metric Depth

普通单目深度模型很多预测的是 Relative Depth(相对深度),主要描述场景中不同位置"谁近、谁远",但预测值不一定对应真实世界中的实际距离。

而 Metric Depth 更进一步,希望恢复具有真实物理尺度意义的深度,例如目标距离相机 30 m、地面距离无人机 80 m 等。MoGe2 的一个重要思路是对场景几何结构与全局尺度信息进行解耦建模:先恢复相对稳定的三维几何关系,再进一步估计对应的真实尺度。对于无人机测距、目标空间定位等任务,Metric Depth 显然具有更直接的应用价值。

2.2 针对 UAV 场景进行深度适配

无人机影像与常见的街景、自动驾驶和室内深度数据存在明显的 Domain Gap。

UAV 通常具有更高的拍摄高度,同时会出现鸟瞰、斜视、大俯角以及不同 FOV 等情况,场景的深度范围也远大于普通地面视角。因此,直接使用在常规场景上训练的深度模型,尤其是在绝对尺度估计方面容易产生偏差。AerialMetric 针对这些特点构建无人机 Metric Depth 数据,并在 MoGe2 基础上进行航拍域适配,得到 MoGe2-Aerial,使模型在保留原有通用三维几何能力的同时,更适应 UAV 图像中的视角与尺度分布。

2.3 无人机影像测试

从实际测试结果来看,MoGe2-Aerial 对无人机影像中的地面、建筑以及不同远近区域的深度变化能够形成比较连续的预测,同时相比单纯的 Relative Depth,它更关注深度结果本身的实际尺度意义。

这也是我比较关注这个方向的原因:如果后续进一步结合 相机内参、无人机姿态、飞行高度以及 GPS 信息,Metric Depth 就有机会用于目标实际距离估计,甚至进一步完成从二维图像坐标到真实三维空间位置的转换。

总结

总结来说,ZipDepth 更强调轻量化与高效部署,而 MoGe2-Aerial 更关注无人机场景下具有真实尺度意义的深度估计。两者分别代表了单目深度估计中"轻量通用化"和"航拍场景专业化"两个很有价值的方向。更多问题欢迎访问

https://github.com/Thamkench

进行交流与讨论

相关推荐
Henry-SAP1 小时前
具身智能新突破:开源生态与IPO热潮
人工智能·云原生·sap·erp
W_326001 小时前
Python-OpenCV边缘检测与阈值分割:Sobel、Scharr、Laplacian、Canny、全局与自适应阈值
开发语言·图像处理·python·opencv·机器学习
其实防守也摸鱼1 小时前
红队技能总结导图:从入门到精通的完整知识体系
开发语言·人工智能·学习·安全·web安全
Nil2081 小时前
golang解决单词转换
算法
饼干哥哥1 小时前
重生之我是导演:爆改成「牛来版」黑客帝国?附3D预演台保姆级教程!
人工智能·后端·深度学习
Bruce_Liuxiaowei1 小时前
自动化渗透测试——用AI构建自动化渗透测试流程
运维·人工智能·自动化
AI导出鸭1 小时前
怎么让Claude做表格?AI导出鸭苹果版将Claude输出的Markdown表格或结构化列表智能解析为二维数据,一键导出Excel/Word标准表格。
人工智能·chatgpt·word·excel·ai导出鸭
ACP广源盛139246256731 小时前
Qwen3.8‑2.4T 开源落地@ACP#国产 MoE 大模型私有化部署中 MST 多屏转换芯片 GSV2231 硬件价值与应用场景
大数据·数据库·人工智能·嵌入式硬件
imaol11 小时前
文件编程--标准IO
linux·运维·算法