实例与语义分割 / 17
SAM
可提示通用分割基础模型
SAM由图像编码器、提示编码器和轻量掩码解码器组成,可通过点、框或粗掩码分割未预定义类别目标,特别适合辅助数据标注。代表性参数规模为约 91M/308M/636M(ViT-B/L/H),性能定位是开放对象泛化强,适合交互标注而非固定类别判定。适合交互式辅助标注、通用对象抠图和快速生成候选掩码。
- 技术来源
- Meta AI
- 提出时间
- 2023
- 性能定位
- 开放对象泛化强,适合交互标注而非固定类别判定
- 部署成熟度
- 较成熟
PARAMETERS
参考参数与输入输出
参数量是公开代表性配置或合理范围,不同骨干、类别数、输入尺寸和实现版本会改变结果;详细实施时以选定配置导出的模型信息为准。
PERFORMANCE
性能如何理解
开放对象泛化强,适合交互标注而非固定类别判定。泛化和交互能力远强于 U-Net,但固定场景速度与类别稳定性不如专用模型。网站不使用脱离条件的单一 FPS 或 mAP 数字作为承诺,因为数据集、输入尺寸、精度模式、批量大小、GPU 型号和后处理口径都会显著改变测试结果。
- 推理速度
- 中低
- 精度定位
- 泛化高
- 部署成熟度
- 较成熟
CHARACTERISTICS & USE CASES
核心特点与应用边界
核心特点
- 支持点、框和掩码多种提示
- 图像嵌入可缓存以加速重复交互
- 对开放世界对象具有较强零样本泛化
典型场景
- 交互式辅助标注
- 通用对象抠图
- 快速生成候选掩码
限制与风险
- 不是面向固定缺陷类别训练的判定模型
- 细小工业缺陷和领域图像可能需要适配或后处理
MODEL COMPARISON
实例与语义分割同类模型对比
| 模型 | 参考参数规模 | 速度 | 精度定位 | 部署 | 优先场景 |
|---|---|---|---|---|---|
| Mask R-CNN | 约 44M(R50-FPN 代表配置) | 低 | 很高 | 成熟 | 零件实例轮廓 |
| U-Net | 约 7M–31M(依通道数与骨干而变) | 高 | 中高 | 成熟 | 连续缺陷区域 |
| DeepLabV3+ | 约 26M–60M(取决于骨干) | 中 | 很高 | 较成熟 | 大幅面表面分割 |
| SAM当前 | 约 91M/308M/636M(ViT-B/L/H) | 中低 | 泛化高 | 较成熟 | 交互式辅助标注 |
| SAM 2 | 约 38.9M–224.4M(tiny 至 large) | 中高 | 泛化高 | 较成熟 | 视频数据标注 |
| YOLO Seg | 约 3M–72M(随 YOLO 版本与尺度变化) | 很高 | 高 | 成熟 | 在线轮廓检测 |
表中“速度、精度、部署”为同类别内的定性定位,用于缩小候选范围,不替代同一测试集、同一硬件和同一精度模式下的实测。