无人机单目深度估计测试:ZipDepth 与 AerialMetric

提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档

文章目录

  • 前言
  • [1 ZipDepth:只有约 6M 参数的轻量级深度模型](#1 ZipDepth:只有约 6M 参数的轻量级深度模型)
    • [1.1 模型结构](#1.1 模型结构)
    • [1.2 知识蒸馏](#1.2 知识蒸馏)
    • [1.3 无人机影像测试](#1.3 无人机影像测试)
  • [2. AerialMetric / MoGe2-Aerial:面向无人机的 Metric Depth](#2. AerialMetric / MoGe2-Aerial:面向无人机的 Metric Depth)
    • [2.1 从 Relative Depth 到 Metric Depth](#2.1 从 Relative Depth 到 Metric Depth)
    • [2.2 针对 UAV 场景进行深度适配](#2.2 针对 UAV 场景进行深度适配)
    • [2.3 无人机影像测试](#2.3 无人机影像测试)
  • 总结

前言

最近在做一些无人机视觉相关的模型测试,其中一个比较感兴趣的方向是 Monocular Depth Estimation(单目深度估计)。

相比传统的双目视觉、激光雷达或者基于多视角重建的方法,单目深度估计只需要一张 RGB 图像,就可以预测场景中不同位置的深度信息。对于无人机来说,这类方法在目标定位、环境感知、避障、三维信息恢复以及后续空间分析中都有比较大的应用潜力。

这次主要测试了两个最近比较有意思的方向:

  • ZipDepth:强调轻量化和 Zero-shot 泛化能力;
  • AerialMetric / MoGe2-Aerial:专门针对无人机航拍视角进行 Metric Depth 适配。

虽然两者都可以输入一张无人机 RGB 图像并输出深度结果,但它们解决的问题其实并不完全相同。


1 ZipDepth:只有约 6M 参数的轻量级深度模型

ZipDepth 比较吸引我的地方是它非常强调 模型轻量化和实际部署能力。其推理模型参数量只有约 6.1M,相比很多基于大型 Vision Transformer 的单目深度模型要小很多。

1.1 模型结构

ZipDepth 的 Encoder 采用了类似 RepVGG 的可重参数化卷积结构。RepVGG 这类结构一个比较典型的特点是:训练阶段可以使用多分支结构增强特征表达能力,而在推理阶段,可以将这些分支重新参数化为标准卷积。

因此最终部署时,网络结构依然比较规整,对 GPU、TensorRT 或边缘设备通常更加友好。

在 Encoder 提取图像特征之后,ZipDepth 还结合了:

  • Strip Pooling
  • SE / Global Context
  • SPPF
  • Lightweight FPN Decoder

等结构,对不同尺度的场景信息进行融合。

对于无人机图像来说,这一点其实比较重要。因为航拍影像通常同时包含:

  • 大尺度道路和建筑;
  • 中尺度车辆、树木;
  • 小尺度屋顶结构和地面目标。

单纯依赖局部卷积特征,很容易缺少对整个场景空间关系的理解,因此模型需要同时考虑局部细节和较大范围的上下文信息。最后,ZipDepth 使用一种轻量化的上采样方式,将低分辨率深度特征恢复到原始图像分辨率。

1.2 知识蒸馏

ZipDepth 另外一个比较有意思的地方是它采用了 Knowledge Distillation(知识蒸馏)。

其 Teacher Model 使用的是较大的 Depth Anything V2-Large,通过大量不同场景的数据,将大型深度模型学习到的知识迁移到一个非常小的 CNN 网络中。因此 ZipDepth 的思路并不是单纯依靠小模型直接训练,而更接近于:大模型负责学习丰富的深度先验,小模型负责把这些知识压缩下来用于实际部署。这也是目前轻量视觉模型中非常常见的一条路线。

1.3 无人机影像测试

分别测试的是resize尺寸从1280 2048道2560的对比效果。从无人机影像的实际测试来看,ZipDepth 对场景整体的 前后空间关系恢复得比较明显。

例如:

建筑物与地面之间的高度关系;

道路与周围建筑的空间层次;

树木、车辆与背景之间的相对距离;

基本都能够从深度图中体现出来。

同时,一些建筑边缘和道路边界的深度变化也保持得比较完整。我觉得 ZipDepth 最大的特点并不是追求极致的 Metric Depth 精度,而是它在:模型大小、推理速度、Zero-shot 泛化能力和深度质量之间取得了一个比较好的平衡。

2. AerialMetric / MoGe2-Aerial:面向无人机的 Metric Depth

第二个测试的是 AerialMetric 项目中的 MoGe2-Aerial。

需要区分的是,AerialMetric 本身是一套针对无人机航拍场景构建的 Metric Depth 数据集与 Benchmark,而 MoGe2-Aerial 是基于 MoGe2 进一步进行 UAV 场景适配得到的模型。

2.1 从 Relative Depth 到 Metric Depth

普通单目深度模型很多预测的是 Relative Depth(相对深度),主要描述场景中不同位置"谁近、谁远",但预测值不一定对应真实世界中的实际距离。

而 Metric Depth 更进一步,希望恢复具有真实物理尺度意义的深度,例如目标距离相机 30 m、地面距离无人机 80 m 等。MoGe2 的一个重要思路是对场景几何结构与全局尺度信息进行解耦建模:先恢复相对稳定的三维几何关系,再进一步估计对应的真实尺度。对于无人机测距、目标空间定位等任务,Metric Depth 显然具有更直接的应用价值。

2.2 针对 UAV 场景进行深度适配

无人机影像与常见的街景、自动驾驶和室内深度数据存在明显的 Domain Gap。

UAV 通常具有更高的拍摄高度,同时会出现鸟瞰、斜视、大俯角以及不同 FOV 等情况,场景的深度范围也远大于普通地面视角。因此,直接使用在常规场景上训练的深度模型,尤其是在绝对尺度估计方面容易产生偏差。AerialMetric 针对这些特点构建无人机 Metric Depth 数据,并在 MoGe2 基础上进行航拍域适配,得到 MoGe2-Aerial,使模型在保留原有通用三维几何能力的同时,更适应 UAV 图像中的视角与尺度分布。

2.3 无人机影像测试

从实际测试结果来看,MoGe2-Aerial 对无人机影像中的地面、建筑以及不同远近区域的深度变化能够形成比较连续的预测,同时相比单纯的 Relative Depth,它更关注深度结果本身的实际尺度意义。

这也是我比较关注这个方向的原因:如果后续进一步结合 相机内参、无人机姿态、飞行高度以及 GPS 信息,Metric Depth 就有机会用于目标实际距离估计,甚至进一步完成从二维图像坐标到真实三维空间位置的转换。

总结

总结来说,ZipDepth 更强调轻量化与高效部署,而 MoGe2-Aerial 更关注无人机场景下具有真实尺度意义的深度估计。两者分别代表了单目深度估计中"轻量通用化"和"航拍场景专业化"两个很有价值的方向。更多问题欢迎访问

https://github.com/Thamkench

进行交流与讨论

相关推荐
外域速览1 小时前
OpenAI 智能体「越狱」风波未平,苹果折叠屏 iPhone Ultra 下周三登场
人工智能·ios·iphone
william_yangshun6 小时前
【AI Agent 实战】agent-vision-toolkit 中文版:给纯文本模型(DeepSeek)装上视觉能力
人工智能·多模态
智能体与具身智能6 小时前
TVA具身智能的概念、架构与应用(19)
人工智能·python·具身智能
AI智能体工作室6 小时前
生产级 RAG 检索增强架构实战:向量数据库、混合检索(Hybrid Search)、RRF 融合与重排(Rerank)全链路
人工智能
geinvse_seg6 小时前
我做了个 AI 架构审查员,把整个微服务项目通读了一遍,还顺手做成了 Skill
人工智能
李帅朋6 小时前
微分基本定义笔记
人工智能·笔记·深度学习·神经网络
醍醐实验室6 小时前
下一代端到端全模态(Omni)模型解密:离散音频 Token 化与极速双工流式交互架构
人工智能
米小虾7 小时前
你的 Agent 有 1000 万上下文,为什么第 50 轮就开始失忆?
人工智能·agent
东风破_7 小时前
Text2SQL :用自然语言操作 SQLite 数据库
人工智能·后端
吴佳浩 Alben7 小时前
Agent 怎么做自动化评测?构建端到端的 Agent Evaluation 体系
人工智能·语言模型·架构·自动化·ai编程