单目深度估计 / 36

Depth Anything

通用单目深度估计模型

Depth Anything利用大规模无标注图像和教师模型产生的深度监督学习通用单目深度表征,在多种自然场景中具有较强的零样本泛化能力。代表性参数规模为约 24.8M/97.5M/335M(Small/Base/Large),性能定位是跨场景泛化强,边界与结构细节较好。

技术来源
Lihe Yang 等
提出时间
2024
性能定位
跨场景泛化强,边界与结构细节较好
部署成熟度
较成熟
01

PARAMETERS

参考参数与输入输出

代表性参数量约 24.8M/97.5M/335M(Small/Base/Large)
输入单张 RGB 图像;尺寸按模型预处理
输出相对深度图;度量版本可输出尺度深度
算力与部署GPU 推荐;Small 版本可用于较轻部署

参数量是公开代表性配置或合理范围,不同骨干、类别数、输入尺寸和实现版本会改变结果;详细实施时以选定配置导出的模型信息为准。

02

PERFORMANCE

性能如何理解

跨场景泛化强,边界与结构细节较好。泛化能力通常优于早期 MiDaS 配置,但二者都不能替代标定后的精密 3D 测量。网站不使用脱离条件的单一 FPS 或 mAP 数字作为承诺,因为数据集、输入尺寸、精度模式、批量大小、GPU 型号和后处理口径都会显著改变测试结果。

推理速度
中高
精度定位
很高
部署成熟度
较成熟
03

CHARACTERISTICS & USE CASES

核心特点与应用边界

核心特点

  • 大规模无标注数据提升跨域泛化
  • S/B/L 配置覆盖不同精度和算力
  • 可作为相对深度或下游度量深度骨干

典型场景

  • 场景层次估计
  • 空间关系预分析
  • 缺少深度传感器的辅助感知

限制与风险

  • 相对深度不能直接等同真实毫米距离
  • 工业测量必须经过标定、度量模型和误差验证
04

MODEL COMPARISON

单目深度估计同类模型对比

模型参考参数规模速度精度定位部署优先场景
Depth Anything当前 约 24.8M/97.5M/335M(Small/Base/Large) 中高 很高 较成熟 场景层次估计
MiDaS 约 21M–344M(Small 至 DPT-Large) 成熟 空间层次分析

表中“速度、精度、部署”为同类别内的定性定位,用于缩小候选范围,不替代同一测试集、同一硬件和同一精度模式下的实测。

SELECTION SUMMARY

选型结论

Depth Anything适合优先考虑场景层次估计、空间关系预分析、缺少深度传感器的辅助感知的项目。它的主要价值是大规模无标注数据提升跨域泛化;需要重点评估相对深度不能直接等同真实毫米距离、工业测量必须经过标定、度量模型和误差验证。

建议先用企业真实数据建立基线,再统一测试准确率、召回率、误检率、单张延迟、峰值显存和导出兼容性,最后确定模型规模与部署方式。