2D 目标检测 / 08

RT-DETR

实时端到端 Transformer 检测器

RT-DETR把 DETR 的集合预测用于实时检测,通过高效混合编码器和查询选择降低计算成本,并能调整解码层数改变速度与精度平衡。代表性参数规模为约 20M–76M(R18 至 R101 等配置),性能定位是端到端精度高,可调解码层控制延迟。适合密集目标检测、端到端在线服务和重叠物体识别。

技术来源
百度
提出时间
2023
性能定位
端到端精度高,可调解码层控制延迟
部署成熟度
较成熟
01

PARAMETERS

参考参数与输入输出

代表性参数量约 20M–76M(R18 至 R101 等配置)
输入RGB 图像;常用 640×640
输出无需 NMS 的类别、置信度与边界框集合
算力与部署CUDA GPU 更合适;高分辨率下显存需求明显

参数量是公开代表性配置或合理范围,不同骨干、类别数、输入尺寸和实现版本会改变结果;详细实施时以选定配置导出的模型信息为准。

02

PERFORMANCE

性能如何理解

端到端精度高,可调解码层控制延迟。全局建模和端到端能力优于传统 YOLO,但轻量边缘部署成本通常更高。网站不使用脱离条件的单一 FPS 或 mAP 数字作为承诺,因为数据集、输入尺寸、精度模式、批量大小、GPU 型号和后处理口径都会显著改变测试结果。

推理速度
精度定位
很高
部署成熟度
较成熟
03

CHARACTERISTICS & USE CASES

核心特点与应用边界

核心特点

  • 端到端集合预测减少 NMS 依赖
  • 解码层数可作为推理速度调节旋钮
  • 对密集与重叠目标具有良好建模能力

典型场景

  • 密集目标检测
  • 端到端在线服务
  • 重叠物体识别

限制与风险

  • 训练和导出比传统 CNN 检测器复杂
  • 小数据集通常需要良好预训练权重
04

MODEL COMPARISON

2D 目标检测同类模型对比

模型参考参数规模速度精度定位部署优先场景
YOLOv5 约 1.9M–86.7M(n 至 x) 很高 中高 成熟 工业缺陷初筛
YOLOv6 约 4.7M–59.6M(N 至 L) 很高 中高 成熟 高速产线检测
YOLOv7 约 6.2M–71.3M(tiny 至 X) 很高 中高 较成熟 实时视频分析
YOLOv8 约 3.2M–68.2M(n 至 x) 很高 成熟 常规工业检测
YOLOv9 约 2M–58M(不同公开配置) 一般 复杂背景检测
YOLOv10 约 2.3M–29.5M(N 至 X) 很高 较成熟 低延迟在线检测
YOLO11 约 2.6M–56.9M(n 至 x,检测配置) 很高 成熟 新建工业视觉项目
RT-DETR当前 约 20M–76M(R18 至 R101 等配置) 很高 较成熟 密集目标检测
Faster R-CNN 约 42M(R50-FPN 代表配置) 中低 很高 成熟 精密缺陷定位
Cascade R-CNN 约 69M(R50-FPN 代表配置) 很高 较成熟 精密零件定位
RetinaNet 约 38M(R50-FPN 代表配置) 成熟 稀少缺陷检测
FCOS 约 32M(R50-FPN 代表配置) 中高 较成熟 多尺度目标检测
ATSS 约 32M(R50-FPN 代表配置) 中高 较成熟 目标尺度变化明显

表中“速度、精度、部署”为同类别内的定性定位,用于缩小候选范围,不替代同一测试集、同一硬件和同一精度模式下的实测。

SELECTION SUMMARY

选型结论

RT-DETR适合优先考虑密集目标检测、端到端在线服务、重叠物体识别的项目。它的主要价值是端到端集合预测减少 NMS 依赖;需要重点评估训练和导出比传统 CNN 检测器复杂、小数据集通常需要良好预训练权重。

建议先用企业真实数据建立基线,再统一测试准确率、召回率、误检率、单张延迟、峰值显存和导出兼容性,最后确定模型规模与部署方式。