实例与语义分割 / 17

SAM

可提示通用分割基础模型

SAM由图像编码器、提示编码器和轻量掩码解码器组成,可通过点、框或粗掩码分割未预定义类别目标,特别适合辅助数据标注。代表性参数规模为约 91M/308M/636M(ViT-B/L/H),性能定位是开放对象泛化强,适合交互标注而非固定类别判定。适合交互式辅助标注、通用对象抠图和快速生成候选掩码。

技术来源
Meta AI
提出时间
2023
性能定位
开放对象泛化强,适合交互标注而非固定类别判定
部署成熟度
较成熟
01

PARAMETERS

参考参数与输入输出

代表性参数量约 91M/308M/636M(ViT-B/L/H)
输入图像加点、框或已有掩码提示
输出一个或多个候选目标掩码及质量分数
算力与部署ViT-B 起步需 GPU;ViT-H 显存和延迟较高

参数量是公开代表性配置或合理范围,不同骨干、类别数、输入尺寸和实现版本会改变结果;详细实施时以选定配置导出的模型信息为准。

02

PERFORMANCE

性能如何理解

开放对象泛化强,适合交互标注而非固定类别判定。泛化和交互能力远强于 U-Net,但固定场景速度与类别稳定性不如专用模型。网站不使用脱离条件的单一 FPS 或 mAP 数字作为承诺,因为数据集、输入尺寸、精度模式、批量大小、GPU 型号和后处理口径都会显著改变测试结果。

推理速度
中低
精度定位
泛化高
部署成熟度
较成熟
03

CHARACTERISTICS & USE CASES

核心特点与应用边界

核心特点

  • 支持点、框和掩码多种提示
  • 图像嵌入可缓存以加速重复交互
  • 对开放世界对象具有较强零样本泛化

典型场景

  • 交互式辅助标注
  • 通用对象抠图
  • 快速生成候选掩码

限制与风险

  • 不是面向固定缺陷类别训练的判定模型
  • 细小工业缺陷和领域图像可能需要适配或后处理
04

MODEL COMPARISON

实例与语义分割同类模型对比

模型参考参数规模速度精度定位部署优先场景
Mask R-CNN 约 44M(R50-FPN 代表配置) 很高 成熟 零件实例轮廓
U-Net 约 7M–31M(依通道数与骨干而变) 中高 成熟 连续缺陷区域
DeepLabV3+ 约 26M–60M(取决于骨干) 很高 较成熟 大幅面表面分割
SAM当前 约 91M/308M/636M(ViT-B/L/H) 中低 泛化高 较成熟 交互式辅助标注
SAM 2 约 38.9M–224.4M(tiny 至 large) 中高 泛化高 较成熟 视频数据标注
YOLO Seg 约 3M–72M(随 YOLO 版本与尺度变化) 很高 成熟 在线轮廓检测

表中“速度、精度、部署”为同类别内的定性定位,用于缩小候选范围,不替代同一测试集、同一硬件和同一精度模式下的实测。

SELECTION SUMMARY

选型结论

SAM适合优先考虑交互式辅助标注、通用对象抠图、快速生成候选掩码的项目。它的主要价值是支持点、框和掩码多种提示;需要重点评估不是面向固定缺陷类别训练的判定模型、细小工业缺陷和领域图像可能需要适配或后处理。

建议先用企业真实数据建立基线,再统一测试准确率、召回率、误检率、单张延迟、峰值显存和导出兼容性,最后确定模型规模与部署方式。