MODEL CATALOG

支持模型介绍

按真实算法名称说明平台模型目录,覆盖检测、分割、分类、OCR、姿态、3D 点云和基础视觉模型。每项均列出技术来源、核心特点与典型使用场景,方便在实施前完成选型。

7
任务方向
30+
模型与生态
B/S
私有化部署

SUPPORT SCOPE

先区分模型名称与实现框架

本页具体模型:可作为训练或推理架构选择的算法,如 Faster R-CNN、Cascade R-CNN、RetinaNet、FCOS 和 ATSS。

实现生态:MMDetection、MMOCR、MMPose、MMDetection3D 与 OpenPCDet 属于框架或工具箱,不再当作单个模型名称。平台在这些生态下按项目接入具体配置。

最终可用模型、预训练权重、许可证、GPU 环境与导出格式,以合同约定和实际部署版本为准。

01 / DETECTION

2D 目标检测

从强调实时性的单阶段检测器,到强调精度与复杂场景适应性的两阶段检测器。

YOLOv5

单阶段 · Anchor-based

YOLOv5采用 CSP 主干、PAN/FPN 特征融合与多尺度检测头,训练脚本、数据格式和部署资料完整,适合快速建立可复现的检测基线。代表性参数规模为约 1.9M–86.7M(n 至 x),性能定位是速度优先且工程成熟,易形成稳定基线。适合工业缺陷初筛、通用物体检测和边缘设备快速验证。

来源
Ultralytics,2020
适用
通用目标检测、工业缺陷初筛、边缘设备快速验证
查看模型详情

YOLOv6

单阶段 · 工业部署

YOLOv6围绕工业应用重构主干、颈部和检测头,并结合重参数化与量化部署能力,在常见 GPU 和 TensorRT 环境中强调稳定吞吐。代表性参数规模为约 4.7M–59.6M(N 至 L),性能定位是面向实时推理优化,吞吐与精度平衡较好。适合高速产线检测、物流目标识别和GPU 批量推理。

来源
美团视觉智能部,2022
适用
产线检测、物流目标识别、CPU/GPU/TensorRT 部署
查看模型详情

YOLOv7

单阶段 · 实时检测

YOLOv7通过 E-ELAN、模型缩放和可训练的 bag-of-freebies 提升实时检测效率,在不增加推理成本的训练技巧与结构设计之间取得平衡。代表性参数规模为约 6.2M–71.3M(tiny 至 X),性能定位是实时检测性能强,适合既有权重继续维护。

来源
Wang、Bochkovskiy、Liao,2022
适用
实时视频分析、高速产线、既有 YOLOv7 权重迁移
查看模型详情

YOLOv8

单阶段 · Anchor-free

YOLOv8使用解耦的 Anchor-free 检测头,并在同一套命令和 API 中统一检测、分割、分类与姿态任务,适合团队快速迭代多种视觉项目。代表性参数规模为约 3.2M–68.2M(n 至 x),性能定位是训练易用、推理快速,多任务工具链统一。适合常规工业检测、多任务视觉项目和快速原型与交付。

来源
Ultralytics,2023
适用
多任务视觉项目、原型验证、常规工业检测
查看模型详情

YOLOv9

单阶段 · PGI / GELAN

YOLOv9引入可编程梯度信息 PGI 与 GELAN 架构,关注网络前向过程中信息损失问题,使不同规模模型能够更有效地利用参数和梯度信号。代表性参数规模为约 2M–58M(不同公开配置),性能定位是强调参数利用率与深层网络信息保留。适合复杂背景检测、精度敏感项目评估和新架构研究验证。

来源
Wang、Yeh、Liao,2024
适用
精度敏感检测、复杂背景、需要评估新架构的项目
查看模型详情

YOLOv10

单阶段 · NMS-free

YOLOv10采用一致双重标签分配,让训练阶段兼顾丰富监督与端到端预测,从而移除传统 NMS 后处理并降低实时系统中的额外延迟。代表性参数规模为约 2.3M–29.5M(N 至 X),性能定位是后处理延迟低,适合端到端实时推理。适合低延迟在线检测、高帧率视频流和端到端推理服务。

来源
清华大学,2024
适用
低延迟推理、端到端部署、高帧率在线检测
查看模型详情

YOLO11

单阶段 · 多任务

YOLO11延续统一多任务工具链并改进特征提取和参数效率,以较小模型规模覆盖从边缘端到服务器的训练与推理,是新建项目的实用基线。代表性参数规模为约 2.6M–56.9M(n 至 x,检测配置),性能定位是速度、精度和工程易用性平衡全面。适合新建工业视觉项目、边云协同推理和多任务统一维护。

来源
Ultralytics,2024
适用
新建视觉项目、多任务统一训练、边云协同部署
查看模型详情

RT-DETR

Transformer · 端到端

RT-DETR把 DETR 的集合预测用于实时检测,通过高效混合编码器和查询选择降低计算成本,并能调整解码层数改变速度与精度平衡。代表性参数规模为约 20M–76M(R18 至 R101 等配置),性能定位是端到端精度高,可调解码层控制延迟。适合密集目标检测、端到端在线服务和重叠物体识别。

来源
百度,2023
适用
密集目标、端到端检测、希望减少 NMS 依赖的项目
查看模型详情

Faster R-CNN

两阶段 · 高精度

Faster R-CNN先由区域建议网络生成候选框,再完成分类和边界框精修,结构清晰且训练行为稳定,是精度导向检测和算法对照实验的经典基线。代表性参数规模为约 42M(R50-FPN 代表配置),性能定位是定位稳定、精度基线可靠,但推理速度较慢。适合精密缺陷定位、中小数据集基线和离线高精度检测。

来源
Microsoft Research,2015
适用
精密缺陷、小目标、对延迟不极端敏感的离线检测
查看模型详情
02 / SEGMENTATION

实例与语义分割

输出目标轮廓或像素级类别,用于面积、边界、缺陷区域和可提示分割。

Mask R-CNN

实例分割

Mask R-CNN在 Faster R-CNN 检测框架上增加并行掩码分支,并以 RoIAlign 保持空间对齐,可同时输出实例类别、位置和像素级轮廓。代表性参数规模为约 44M(R50-FPN 代表配置),性能定位是实例边界稳定,精度高但实时性有限。

来源
Facebook AI Research,2017
适用
多个独立目标、零件轮廓、实例级缺陷面积统计
查看模型详情

U-Net

语义分割

U-Net利用对称编码器和解码器提取上下文,并通过跳跃连接恢复高分辨率细节,结构直观且在小规模像素标注数据上容易建立基线。代表性参数规模为约 7M–31M(依通道数与骨干而变),性能定位是少样本下易训练,结构简单稳定。适合连续缺陷区域、焊缝与裂纹分割和小样本像素分类。

来源
University of Freiburg,2015
适用
连续缺陷区域、焊缝、表面纹理与医学图像分割
查看模型详情

DeepLabV3+

语义分割

DeepLabV3+以空洞空间金字塔池化捕获不同尺度上下文,再通过轻量解码器恢复边界细节,适合目标尺寸差异明显的语义分割场景。代表性参数规模为约 26M–60M(取决于骨干),性能定位是多尺度上下文和边界细节兼顾。适合大幅面表面分割、道路与场景解析和多尺度缺陷区域。

来源
Google,2018
适用
大幅面区域、复杂尺度、道路与工业表面语义分割
查看模型详情

SAM

可提示分割

SAM由图像编码器、提示编码器和轻量掩码解码器组成,可通过点、框或粗掩码分割未预定义类别目标,特别适合辅助数据标注。代表性参数规模为约 91M/308M/636M(ViT-B/L/H),性能定位是开放对象泛化强,适合交互标注而非固定类别判定。适合交互式辅助标注、通用对象抠图和快速生成候选掩码。

来源
Meta AI,2023
适用
交互式标注、通用对象分割、减少多边形描边工作量
查看模型详情

SAM 2

图像与视频分割

SAM 2把图像视为单帧视频,并通过流式记忆机制在连续帧间传播目标信息,实现统一的图像与视频可提示分割和交互式修正。代表性参数规模为约 38.9M–224.4M(tiny 至 large),性能定位是视频掩码传播高效,交互体验优于第一代。适合视频数据标注、连续帧目标分割和交互式跟踪修正。

来源
Meta AI,2024
适用
视频标注、目标跟踪式分割、连续帧数据生产
查看模型详情

YOLO Seg

实时实例分割

YOLO Seg在 YOLO 检测骨干与特征融合基础上增加原型掩码和实例系数预测,以较低额外开销同时完成目标检测和实例轮廓输出。代表性参数规模为约 3M–72M(随 YOLO 版本与尺度变化),性能定位是实时性好,检测与分割部署链路统一。

来源
Ultralytics
适用
实时轮廓检测、边缘推理、与 YOLO 检测项目统一维护
查看模型详情
03 / CLASSIFICATION

图像分类

为整张图像或裁剪区域分配类别,适合缺陷判级、产品分型和工况识别。

MobileNet

轻量 CNN

MobileNet以深度可分离卷积显著减少参数量和乘加计算,并通过宽度与分辨率系数调节资源消耗,是移动端和边缘分类的经典骨干。代表性参数规模为约 2.5M–6.9M(V1/V2/V3 常见配置),性能定位是低计算量、低功耗,精度上限低于大型骨干。适合低功耗视觉终端、高速产品分类和边缘特征提取。

来源
Google,2017
适用
边缘设备、低功耗终端、对速度和模型体积敏感的分类
查看模型详情

ResNet

残差 CNN

ResNet通过残差捷径让深层网络学习增量映射,缓解梯度退化问题,模型行为稳定且被广泛用作分类器以及检测、分割任务的骨干网络。代表性参数规模为约 11.7M/25.6M/44.5M(18/50/101),性能定位是精度稳定、生态成熟,是可靠的迁移学习基线。

来源
Microsoft Research,2015
适用
工业分类、小样本迁移、检测与分割骨干网络
查看模型详情

VGG

经典 CNN

VGG连续堆叠 3×3 卷积和池化层形成规则深层结构,便于理解和提取中间特征,但大型全连接层使模型参数量与部署体积明显偏大。代表性参数规模为约 138M/144M(VGG16/VGG19),性能定位是结构直观但参数量大,主要用于兼容与对照。

来源
Oxford Visual Geometry Group,2014
适用
教学与对照基线、既有 VGG 权重项目、特征可视化
查看模型详情

ConvNeXt

现代卷积网络

ConvNeXt吸收 Transformer 时代的宏观结构、归一化和训练策略,使用大核深度卷积构建现代纯卷积骨干,在保持卷积特性的同时提升规模化精度。代表性参数规模为约 28.6M–197.8M(Tiny 至 Large),性能定位是分类精度高,兼顾卷积部署特性。

来源
Meta AI,2022
适用
高精度分类、视觉骨干升级、GPU 服务器训练
查看模型详情

YOLO Classify

统一工具链分类

YOLO Classify把图像分类纳入 YOLO 统一训练、验证、预测和导出接口,便于已有检测团队复用数据管理、实验记录与部署流程,降低多任务维护成本。代表性参数规模为约 2.7M–57M(随版本和尺度变化),性能定位是训练入口统一、迭代快速,适合工程团队。

来源
Ultralytics
适用
已有 YOLO 团队、快速分类基线、多任务项目统一管理
查看模型详情
04 / OCR & POSE

OCR 与关键点检测

覆盖文本区域检测、字符识别和目标关键点定位;框架按实际算法配置交付。

PaddleOCR

OCR 工具系统

PaddleOCR集成文本检测、方向分类、文本识别、版面分析和文档理解组件,可按语言、精度和算力自由组合,中文资料与工程部署能力完整。代表性参数规模为约 3M–100M+(按检测、识别和文档组件组合),性能定位是中文与多语言覆盖完整,轻量方案部署效率高。

来源
百度飞桨
适用
铭牌、标签、包装字符、仪表与文档识别
查看模型详情

DBNet + CRNN

文本检测 + 识别

DBNet + CRNN由 DBNet 通过可微二值化定位任意形状文本区域,再由 CRNN 使用卷积、序列建模和 CTC 解码识别字符,适合模块化定制 OCR 流程。代表性参数规模为约 35M–45M(R50-DBNet 加常见 CRNN),性能定位是组件边界清晰,便于独立替换和领域微调。

来源
学术开源模型 / OpenMMLab 实现生态
适用
规则或弯曲文本框定位、工业字符识别、定制字库
查看模型详情

YOLO Pose

实时关键点

YOLO Pose在 YOLO 实例检测基础上增加关键点回归头,一次前向同时定位对象和骨骼点,延续统一的数据、训练、验证与模型导出工具链。代表性参数规模为约 3M–69M(随 YOLO 版本与尺度变化),性能定位是实时性强,检测和姿态输出链路统一。适合工位动作分析、人体姿态估计和零件装配关键点定位。

来源
Ultralytics
适用
人体姿态、工位动作、零件定位点与装配关键点
查看模型详情

RTMPose

实时姿态估计

RTMPose采用 RTMCC 坐标分类表示与高效卷积骨干,在较低参数量下兼顾实时推理和关键点定位精度,并支持人体、动物和自定义对象姿态。代表性参数规模为约 5.5M–27.7M(S 至 L 常见配置),性能定位是参数效率高,速度与关键点精度平衡优秀。

来源
OpenMMLab,2023
适用
人体/动物关键点、行为分析、工业对象姿态点定位
查看模型详情
05 / 3D VISION

3D 检测与点云

处理点云、相机与激光雷达信息,用于三维分类、分割、定位和多传感器融合。

BEVFusion

多传感器融合

BEVFusion将相机纹理特征和激光雷达几何特征统一投影到鸟瞰视图空间,再由共享检测头完成三维感知,兼顾两类传感器优势。代表性参数规模为约 50M–150M+(取决于图像/点云骨干),性能定位是融合精度高,传感器完整时环境感知能力强。适合移动机器人感知、多传感器设备和复杂三维环境检测。

来源
MIT HAN Lab 等,2022
适用
相机 + LiDAR 融合、移动机器人、复杂三维环境感知
查看模型详情

CenterPoint

3D 目标检测

CenterPoint把三维对象表示为鸟瞰视图中的中心点,再回归尺寸、高度、方向和速度,避免复杂锚框匹配并简化旋转目标的三维检测流程。代表性参数规模为约 5M–35M(取决于体素/柱状骨干),性能定位是点云检测高效稳定,对旋转目标定位直接。适合仓储车辆检测、机器人点云感知和三维移动目标定位。

来源
Yin、Zhou、Krähenbühl,2020
适用
车辆与设备检测、仓储点云、三维移动目标定位
查看模型详情

PointNet

点集学习

PointNet直接对无序点集逐点提取特征,再通过对称最大池化得到与排列无关的全局表示,建立了端到端点云分类和分割的基础范式。代表性参数规模为约 3.5M(经典分类配置),性能定位是结构简单、旋转与采样预处理后基线稳定。适合整体形状分类、简单零件点云分割和点云算法基线。

来源
Stanford University,2017
适用
点云分类、整体形状识别、基础点云分割
查看模型详情

PointNet++

层次点集学习

PointNet++通过最远点采样、邻域分组和逐层 PointNet 聚合构建局部到全局的层次特征,能够描述非均匀点云中的细粒度几何结构。代表性参数规模为约 1.5M–2M(常见分类配置),性能定位是局部几何表达强,复杂点云精度优于 PointNet。适合复杂零件分类、局部三维缺陷和点云语义分割。

来源
Stanford University,2017
适用
局部缺陷、零件分割、复杂三维形状与稀疏点云
查看模型详情
06 / FOUNDATION

基础视觉与多模态

用于特征提取、零样本分类、相似度检索、数据筛选与单目深度估计。

DINOv2

自监督视觉特征

DINOv2通过教师—学生式自监督预训练从大规模图像中学习通用视觉表征,不依赖文本配对,输出特征可用于检索、聚类和多种下游任务。代表性参数规模为约 22M/86M/300M/1.1B(S/B/L/G),性能定位是无需标签即可获得强泛化特征,下游适配能力高。

来源
Meta AI,2023
适用
相似图检索、聚类、少样本分类、异常样本筛选
查看模型详情

CLIP

图文对齐

CLIP通过大规模图文对比学习把图像和文本映射到同一向量空间,可直接根据文本类别完成零样本分类、语义检索和开放词汇数据筛选。代表性参数规模为约 102M–428M(RN50 至 ViT-L/14 常见配置),性能定位是零样本语义迁移强,细粒度工业判定需适配。

来源
OpenAI,2021
适用
文本搜图、零样本分类、数据清洗与开放词汇预筛
查看模型详情

OpenCLIP

开放图文模型

OpenCLIP复现并扩展 CLIP 式图文对比训练,提供多种 ViT、ConvNeXt 骨干和开放数据权重,便于比较训练数据、模型规模与领域适应方案。代表性参数规模为约 60M 至数十亿(随骨干而变),性能定位是模型和权重选择丰富,性能跨度大。适合私有化图文检索、多权重基准评估和领域图文模型研究。

来源
ML Foundations
适用
私有化图文检索、权重对比、领域数据微调研究
查看模型详情

Depth Anything

单目深度估计

Depth Anything利用大规模无标注图像和教师模型产生的深度监督学习通用单目深度表征,在多种自然场景中具有较强的零样本泛化能力。代表性参数规模为约 24.8M/97.5M/335M(Small/Base/Large),性能定位是跨场景泛化强,边界与结构细节较好。

来源
Lihe Yang 等,2024
适用
单目场景层次、辅助测量研究、空间关系预分析
查看模型详情

MiDaS

单目相对深度

MiDaS通过混合多个深度数据集训练并处理不同深度尺度,使模型在未知场景中保持相对深度排序能力,提供轻量 CNN 到 DPT 大模型多种配置。代表性参数规模为约 21M–344M(Small 至 DPT-Large),性能定位是跨数据集稳定,模型选择和兼容资料丰富。

来源
Intel ISL
适用
空间层次分析、三维效果预估、缺少深度传感器的辅助任务
查看模型详情

MODEL SELECTION

模型选择不是只看名称

实施阶段会结合数据形态、标注质量、延迟目标、GPU 资源、导出格式和第三方许可证共同确定训练配置。

  1. 01
    任务与指标

    先确定分类、检测、分割或姿态任务,以及 mAP、召回率、误检率和延迟目标。

  2. 02
    数据与场景

    检查样本量、目标尺度、类别分布、拍摄条件和标注格式,再选择合适架构。

  3. 03
    训练与部署

    核对 GPU、显存、CUDA、推理引擎、模型许可证和企业网络边界。

  4. 04
    基线与验收

    用真实业务数据建立可复现基线,按约定测试集与指标完成模型验收。

PRIVATE DEPLOYMENT

用真实数据确认模型与部署方案

网页 B/S 架构,支持企业内网私有化部署;需要专业技术人员完成环境评估、模型配置、训练验证与交付。