实例与语义分割 / 18

SAM 2

图像与视频可提示分割模型

SAM 2把图像视为单帧视频,并通过流式记忆机制在连续帧间传播目标信息,实现统一的图像与视频可提示分割和交互式修正。代表性参数规模为约 38.9M–224.4M(tiny 至 large),性能定位是视频掩码传播高效,交互体验优于第一代。适合视频数据标注、连续帧目标分割和交互式跟踪修正。

技术来源
Meta AI
提出时间
2024
性能定位
视频掩码传播高效,交互体验优于第一代
部署成熟度
较成熟
01

PARAMETERS

参考参数与输入输出

代表性参数量约 38.9M–224.4M(tiny 至 large)
输入图像/视频加点、框或掩码提示
输出图像掩码或跨帧持续传播的实例掩码
算力与部署GPU 推荐;长视频需管理显存与记忆状态

参数量是公开代表性配置或合理范围,不同骨干、类别数、输入尺寸和实现版本会改变结果;详细实施时以选定配置导出的模型信息为准。

02

PERFORMANCE

性能如何理解

视频掩码传播高效,交互体验优于第一代。视频能力显著强于 SAM,但状态管理和部署复杂度更高。网站不使用脱离条件的单一 FPS 或 mAP 数字作为承诺,因为数据集、输入尺寸、精度模式、批量大小、GPU 型号和后处理口径都会显著改变测试结果。

推理速度
中高
精度定位
泛化高
部署成熟度
较成熟
03

CHARACTERISTICS & USE CASES

核心特点与应用边界

核心特点

  • 统一处理静态图像与视频序列
  • 记忆机制支持目标跨帧持续跟踪
  • 多种模型规模覆盖速度与质量需求

典型场景

  • 视频数据标注
  • 连续帧目标分割
  • 交互式跟踪修正

限制与风险

  • 遮挡、目标消失重现和长序列漂移仍需质检
  • 工业私有数据应先验证泛化和提示策略
04

MODEL COMPARISON

实例与语义分割同类模型对比

模型参考参数规模速度精度定位部署优先场景
Mask R-CNN 约 44M(R50-FPN 代表配置) 很高 成熟 零件实例轮廓
U-Net 约 7M–31M(依通道数与骨干而变) 中高 成熟 连续缺陷区域
DeepLabV3+ 约 26M–60M(取决于骨干) 很高 较成熟 大幅面表面分割
SAM 约 91M/308M/636M(ViT-B/L/H) 中低 泛化高 较成熟 交互式辅助标注
SAM 2当前 约 38.9M–224.4M(tiny 至 large) 中高 泛化高 较成熟 视频数据标注
YOLO Seg 约 3M–72M(随 YOLO 版本与尺度变化) 很高 成熟 在线轮廓检测

表中“速度、精度、部署”为同类别内的定性定位,用于缩小候选范围,不替代同一测试集、同一硬件和同一精度模式下的实测。

SELECTION SUMMARY

选型结论

SAM 2适合优先考虑视频数据标注、连续帧目标分割、交互式跟踪修正的项目。它的主要价值是统一处理静态图像与视频序列;需要重点评估遮挡、目标消失重现和长序列漂移仍需质检、工业私有数据应先验证泛化和提示策略。

建议先用企业真实数据建立基线,再统一测试准确率、召回率、误检率、单张延迟、峰值显存和导出兼容性,最后确定模型规模与部署方式。