YOLOv5
单阶段 · Anchor-basedYOLOv5采用 CSP 主干、PAN/FPN 特征融合与多尺度检测头,训练脚本、数据格式和部署资料完整,适合快速建立可复现的检测基线。代表性参数规模为约 1.9M–86.7M(n 至 x),性能定位是速度优先且工程成熟,易形成稳定基线。适合工业缺陷初筛、通用物体检测和边缘设备快速验证。
- 来源
- Ultralytics,2020
- 适用
- 通用目标检测、工业缺陷初筛、边缘设备快速验证
MODEL CATALOG
按真实算法名称说明平台模型目录,覆盖检测、分割、分类、OCR、姿态、3D 点云和基础视觉模型。每项均列出技术来源、核心特点与典型使用场景,方便在实施前完成选型。
SUPPORT SCOPE
本页具体模型:可作为训练或推理架构选择的算法,如 Faster R-CNN、Cascade R-CNN、RetinaNet、FCOS 和 ATSS。
实现生态:MMDetection、MMOCR、MMPose、MMDetection3D 与 OpenPCDet 属于框架或工具箱,不再当作单个模型名称。平台在这些生态下按项目接入具体配置。
最终可用模型、预训练权重、许可证、GPU 环境与导出格式,以合同约定和实际部署版本为准。
从强调实时性的单阶段检测器,到强调精度与复杂场景适应性的两阶段检测器。
YOLOv5采用 CSP 主干、PAN/FPN 特征融合与多尺度检测头,训练脚本、数据格式和部署资料完整,适合快速建立可复现的检测基线。代表性参数规模为约 1.9M–86.7M(n 至 x),性能定位是速度优先且工程成熟,易形成稳定基线。适合工业缺陷初筛、通用物体检测和边缘设备快速验证。
YOLOv6围绕工业应用重构主干、颈部和检测头,并结合重参数化与量化部署能力,在常见 GPU 和 TensorRT 环境中强调稳定吞吐。代表性参数规模为约 4.7M–59.6M(N 至 L),性能定位是面向实时推理优化,吞吐与精度平衡较好。适合高速产线检测、物流目标识别和GPU 批量推理。
YOLOv7通过 E-ELAN、模型缩放和可训练的 bag-of-freebies 提升实时检测效率,在不增加推理成本的训练技巧与结构设计之间取得平衡。代表性参数规模为约 6.2M–71.3M(tiny 至 X),性能定位是实时检测性能强,适合既有权重继续维护。
YOLOv8使用解耦的 Anchor-free 检测头,并在同一套命令和 API 中统一检测、分割、分类与姿态任务,适合团队快速迭代多种视觉项目。代表性参数规模为约 3.2M–68.2M(n 至 x),性能定位是训练易用、推理快速,多任务工具链统一。适合常规工业检测、多任务视觉项目和快速原型与交付。
YOLOv9引入可编程梯度信息 PGI 与 GELAN 架构,关注网络前向过程中信息损失问题,使不同规模模型能够更有效地利用参数和梯度信号。代表性参数规模为约 2M–58M(不同公开配置),性能定位是强调参数利用率与深层网络信息保留。适合复杂背景检测、精度敏感项目评估和新架构研究验证。
YOLOv10采用一致双重标签分配,让训练阶段兼顾丰富监督与端到端预测,从而移除传统 NMS 后处理并降低实时系统中的额外延迟。代表性参数规模为约 2.3M–29.5M(N 至 X),性能定位是后处理延迟低,适合端到端实时推理。适合低延迟在线检测、高帧率视频流和端到端推理服务。
YOLO11延续统一多任务工具链并改进特征提取和参数效率,以较小模型规模覆盖从边缘端到服务器的训练与推理,是新建项目的实用基线。代表性参数规模为约 2.6M–56.9M(n 至 x,检测配置),性能定位是速度、精度和工程易用性平衡全面。适合新建工业视觉项目、边云协同推理和多任务统一维护。
RT-DETR把 DETR 的集合预测用于实时检测,通过高效混合编码器和查询选择降低计算成本,并能调整解码层数改变速度与精度平衡。代表性参数规模为约 20M–76M(R18 至 R101 等配置),性能定位是端到端精度高,可调解码层控制延迟。适合密集目标检测、端到端在线服务和重叠物体识别。
Faster R-CNN先由区域建议网络生成候选框,再完成分类和边界框精修,结构清晰且训练行为稳定,是精度导向检测和算法对照实验的经典基线。代表性参数规模为约 42M(R50-FPN 代表配置),性能定位是定位稳定、精度基线可靠,但推理速度较慢。适合精密缺陷定位、中小数据集基线和离线高精度检测。
Cascade R-CNN串联多个逐步提高 IoU 阈值的检测头,使候选框在不同质量阶段持续精修,重点改善严格 IoU 指标下的边界框定位精度。代表性参数规模为约 69M(R50-FPN 代表配置),性能定位是高 IoU 定位精度突出,计算成本较高。
RetinaNet以 Focal Loss 降低大量易分类背景样本的权重,让单阶段检测器更专注于困难前景和稀少类别,在不平衡数据中表现稳定。代表性参数规模为约 38M(R50-FPN 代表配置),性能定位是类别不平衡时稳定,速度介于 YOLO 与两阶段模型之间。
FCOS按特征图位置直接回归目标框四边距离,并通过中心度抑制低质量预测,省去 Anchor 尺寸、比例和匹配规则的繁琐设计。代表性参数规模为约 32M(R50-FPN 代表配置),性能定位是配置简洁,多尺度表现稳定。适合多尺度目标检测、Anchor 难以调优的项目和通用工业检测。
ATSS依据每个目标候选框 IoU 的均值和标准差动态确定正样本阈值,减少固定匹配规则造成的偏差,并统一解释 Anchor 与 Anchor-free 差异。代表性参数规模为约 32M(R50-FPN 代表配置),性能定位是样本匹配稳定,对尺度变化适应较好。
输出目标轮廓或像素级类别,用于面积、边界、缺陷区域和可提示分割。
Mask R-CNN在 Faster R-CNN 检测框架上增加并行掩码分支,并以 RoIAlign 保持空间对齐,可同时输出实例类别、位置和像素级轮廓。代表性参数规模为约 44M(R50-FPN 代表配置),性能定位是实例边界稳定,精度高但实时性有限。
U-Net利用对称编码器和解码器提取上下文,并通过跳跃连接恢复高分辨率细节,结构直观且在小规模像素标注数据上容易建立基线。代表性参数规模为约 7M–31M(依通道数与骨干而变),性能定位是少样本下易训练,结构简单稳定。适合连续缺陷区域、焊缝与裂纹分割和小样本像素分类。
DeepLabV3+以空洞空间金字塔池化捕获不同尺度上下文,再通过轻量解码器恢复边界细节,适合目标尺寸差异明显的语义分割场景。代表性参数规模为约 26M–60M(取决于骨干),性能定位是多尺度上下文和边界细节兼顾。适合大幅面表面分割、道路与场景解析和多尺度缺陷区域。
SAM由图像编码器、提示编码器和轻量掩码解码器组成,可通过点、框或粗掩码分割未预定义类别目标,特别适合辅助数据标注。代表性参数规模为约 91M/308M/636M(ViT-B/L/H),性能定位是开放对象泛化强,适合交互标注而非固定类别判定。适合交互式辅助标注、通用对象抠图和快速生成候选掩码。
SAM 2把图像视为单帧视频,并通过流式记忆机制在连续帧间传播目标信息,实现统一的图像与视频可提示分割和交互式修正。代表性参数规模为约 38.9M–224.4M(tiny 至 large),性能定位是视频掩码传播高效,交互体验优于第一代。适合视频数据标注、连续帧目标分割和交互式跟踪修正。
YOLO Seg在 YOLO 检测骨干与特征融合基础上增加原型掩码和实例系数预测,以较低额外开销同时完成目标检测和实例轮廓输出。代表性参数规模为约 3M–72M(随 YOLO 版本与尺度变化),性能定位是实时性好,检测与分割部署链路统一。
为整张图像或裁剪区域分配类别,适合缺陷判级、产品分型和工况识别。
MobileNet以深度可分离卷积显著减少参数量和乘加计算,并通过宽度与分辨率系数调节资源消耗,是移动端和边缘分类的经典骨干。代表性参数规模为约 2.5M–6.9M(V1/V2/V3 常见配置),性能定位是低计算量、低功耗,精度上限低于大型骨干。适合低功耗视觉终端、高速产品分类和边缘特征提取。
ResNet通过残差捷径让深层网络学习增量映射,缓解梯度退化问题,模型行为稳定且被广泛用作分类器以及检测、分割任务的骨干网络。代表性参数规模为约 11.7M/25.6M/44.5M(18/50/101),性能定位是精度稳定、生态成熟,是可靠的迁移学习基线。
VGG连续堆叠 3×3 卷积和池化层形成规则深层结构,便于理解和提取中间特征,但大型全连接层使模型参数量与部署体积明显偏大。代表性参数规模为约 138M/144M(VGG16/VGG19),性能定位是结构直观但参数量大,主要用于兼容与对照。
ConvNeXt吸收 Transformer 时代的宏观结构、归一化和训练策略,使用大核深度卷积构建现代纯卷积骨干,在保持卷积特性的同时提升规模化精度。代表性参数规模为约 28.6M–197.8M(Tiny 至 Large),性能定位是分类精度高,兼顾卷积部署特性。
YOLO Classify把图像分类纳入 YOLO 统一训练、验证、预测和导出接口,便于已有检测团队复用数据管理、实验记录与部署流程,降低多任务维护成本。代表性参数规模为约 2.7M–57M(随版本和尺度变化),性能定位是训练入口统一、迭代快速,适合工程团队。
覆盖文本区域检测、字符识别和目标关键点定位;框架按实际算法配置交付。
PaddleOCR集成文本检测、方向分类、文本识别、版面分析和文档理解组件,可按语言、精度和算力自由组合,中文资料与工程部署能力完整。代表性参数规模为约 3M–100M+(按检测、识别和文档组件组合),性能定位是中文与多语言覆盖完整,轻量方案部署效率高。
DBNet + CRNN由 DBNet 通过可微二值化定位任意形状文本区域,再由 CRNN 使用卷积、序列建模和 CTC 解码识别字符,适合模块化定制 OCR 流程。代表性参数规模为约 35M–45M(R50-DBNet 加常见 CRNN),性能定位是组件边界清晰,便于独立替换和领域微调。
YOLO Pose在 YOLO 实例检测基础上增加关键点回归头,一次前向同时定位对象和骨骼点,延续统一的数据、训练、验证与模型导出工具链。代表性参数规模为约 3M–69M(随 YOLO 版本与尺度变化),性能定位是实时性强,检测和姿态输出链路统一。适合工位动作分析、人体姿态估计和零件装配关键点定位。
RTMPose采用 RTMCC 坐标分类表示与高效卷积骨干,在较低参数量下兼顾实时推理和关键点定位精度,并支持人体、动物和自定义对象姿态。代表性参数规模为约 5.5M–27.7M(S 至 L 常见配置),性能定位是参数效率高,速度与关键点精度平衡优秀。
处理点云、相机与激光雷达信息,用于三维分类、分割、定位和多传感器融合。
BEVFusion将相机纹理特征和激光雷达几何特征统一投影到鸟瞰视图空间,再由共享检测头完成三维感知,兼顾两类传感器优势。代表性参数规模为约 50M–150M+(取决于图像/点云骨干),性能定位是融合精度高,传感器完整时环境感知能力强。适合移动机器人感知、多传感器设备和复杂三维环境检测。
CenterPoint把三维对象表示为鸟瞰视图中的中心点,再回归尺寸、高度、方向和速度,避免复杂锚框匹配并简化旋转目标的三维检测流程。代表性参数规模为约 5M–35M(取决于体素/柱状骨干),性能定位是点云检测高效稳定,对旋转目标定位直接。适合仓储车辆检测、机器人点云感知和三维移动目标定位。
PointNet直接对无序点集逐点提取特征,再通过对称最大池化得到与排列无关的全局表示,建立了端到端点云分类和分割的基础范式。代表性参数规模为约 3.5M(经典分类配置),性能定位是结构简单、旋转与采样预处理后基线稳定。适合整体形状分类、简单零件点云分割和点云算法基线。
PointNet++通过最远点采样、邻域分组和逐层 PointNet 聚合构建局部到全局的层次特征,能够描述非均匀点云中的细粒度几何结构。代表性参数规模为约 1.5M–2M(常见分类配置),性能定位是局部几何表达强,复杂点云精度优于 PointNet。适合复杂零件分类、局部三维缺陷和点云语义分割。
用于特征提取、零样本分类、相似度检索、数据筛选与单目深度估计。
DINOv2通过教师—学生式自监督预训练从大规模图像中学习通用视觉表征,不依赖文本配对,输出特征可用于检索、聚类和多种下游任务。代表性参数规模为约 22M/86M/300M/1.1B(S/B/L/G),性能定位是无需标签即可获得强泛化特征,下游适配能力高。
CLIP通过大规模图文对比学习把图像和文本映射到同一向量空间,可直接根据文本类别完成零样本分类、语义检索和开放词汇数据筛选。代表性参数规模为约 102M–428M(RN50 至 ViT-L/14 常见配置),性能定位是零样本语义迁移强,细粒度工业判定需适配。
OpenCLIP复现并扩展 CLIP 式图文对比训练,提供多种 ViT、ConvNeXt 骨干和开放数据权重,便于比较训练数据、模型规模与领域适应方案。代表性参数规模为约 60M 至数十亿(随骨干而变),性能定位是模型和权重选择丰富,性能跨度大。适合私有化图文检索、多权重基准评估和领域图文模型研究。
Depth Anything利用大规模无标注图像和教师模型产生的深度监督学习通用单目深度表征,在多种自然场景中具有较强的零样本泛化能力。代表性参数规模为约 24.8M/97.5M/335M(Small/Base/Large),性能定位是跨场景泛化强,边界与结构细节较好。
MiDaS通过混合多个深度数据集训练并处理不同深度尺度,使模型在未知场景中保持相对深度排序能力,提供轻量 CNN 到 DPT 大模型多种配置。代表性参数规模为约 21M–344M(Small 至 DPT-Large),性能定位是跨数据集稳定,模型选择和兼容资料丰富。
MODEL SELECTION
实施阶段会结合数据形态、标注质量、延迟目标、GPU 资源、导出格式和第三方许可证共同确定训练配置。
先确定分类、检测、分割或姿态任务,以及 mAP、召回率、误检率和延迟目标。
检查样本量、目标尺度、类别分布、拍摄条件和标注格式,再选择合适架构。
核对 GPU、显存、CUDA、推理引擎、模型许可证和企业网络边界。
用真实业务数据建立可复现基线,按约定测试集与指标完成模型验收。
PRIVATE DEPLOYMENT
网页 B/S 架构,支持企业内网私有化部署;需要专业技术人员完成环境评估、模型配置、训练验证与交付。