特征与多模态 / 33
DINOv2
自监督视觉基础模型
DINOv2通过教师—学生式自监督预训练从大规模图像中学习通用视觉表征,不依赖文本配对,输出特征可用于检索、聚类和多种下游任务。代表性参数规模为约 22M/86M/300M/1.1B(S/B/L/G),性能定位是无需标签即可获得强泛化特征,下游适配能力高。
- 技术来源
- Meta AI
- 提出时间
- 2023
- 性能定位
- 无需标签即可获得强泛化特征,下游适配能力高
- 部署成熟度
- 较成熟
PARAMETERS
参考参数与输入输出
参数量是公开代表性配置或合理范围,不同骨干、类别数、输入尺寸和实现版本会改变结果;详细实施时以选定配置导出的模型信息为准。
PERFORMANCE
性能如何理解
无需标签即可获得强泛化特征,下游适配能力高。纯视觉表征通常比 CLIP 更细致,但不具备自然语言零样本分类接口。网站不使用脱离条件的单一 FPS 或 mAP 数字作为承诺,因为数据集、输入尺寸、精度模式、批量大小、GPU 型号和后处理口径都会显著改变测试结果。
- 推理速度
- 中
- 精度定位
- 表征很高
- 部署成熟度
- 较成熟
CHARACTERISTICS & USE CASES
核心特点与应用边界
核心特点
- 无需人工标签学习通用视觉特征
- 多尺度 ViT 覆盖边缘实验到大型服务器
- patch 特征适合密集预测与相似性分析
典型场景
- 相似图检索
- 少样本分类
- 异常样本聚类与筛选
限制与风险
- 它是特征基础模型而非直接业务判定器
- 领域差异大时仍需线性探针、微调或阈值标定