OCR 文字识别 / 26

DBNet + CRNN

文本检测与序列识别组合

DBNet + CRNN由 DBNet 通过可微二值化定位任意形状文本区域,再由 CRNN 使用卷积、序列建模和 CTC 解码识别字符,适合模块化定制 OCR 流程。代表性参数规模为约 35M–45M(R50-DBNet 加常见 CRNN),性能定位是组件边界清晰,便于独立替换和领域微调。

技术来源
学术开源模型 / OpenMMLab 实现
提出时间
2015–2020
性能定位
组件边界清晰,便于独立替换和领域微调
部署成熟度
较成熟
01

PARAMETERS

参考参数与输入输出

代表性参数量约 35M–45M(R50-DBNet 加常见 CRNN)
输入含文本图像与检测多边形、识别转写标注
输出文本区域、字符序列与置信度
算力与部署GPU 训练;CPU/GPU 均可推理,视骨干而定

参数量是公开代表性配置或合理范围,不同骨干、类别数、输入尺寸和实现版本会改变结果;详细实施时以选定配置导出的模型信息为准。

02

PERFORMANCE

性能如何理解

组件边界清晰,便于独立替换和领域微调。定制自由度高于 PaddleOCR 一体化方案,但集成、预处理和部署工作量更大。网站不使用脱离条件的单一 FPS 或 mAP 数字作为承诺,因为数据集、输入尺寸、精度模式、批量大小、GPU 型号和后处理口径都会显著改变测试结果。

推理速度
中高
精度定位
部署成熟度
较成熟
03

CHARACTERISTICS & USE CASES

核心特点与应用边界

核心特点

  • 检测与识别可独立训练和替换
  • DBNet 对弯曲或不规则文本边界友好
  • CRNN 对变长字符序列建模经典稳定

典型场景

  • 工业字符定制识别
  • 弯曲文本检测
  • 专用字库与规则后处理

限制与风险

  • 两阶段误差会从检测传递到识别
  • 组合吞吐取决于文本框数量和裁剪策略
04

MODEL COMPARISON

OCR 文字识别同类模型对比

模型参考参数规模速度精度定位部署优先场景
PaddleOCR 约 3M–100M+(按检测、识别和文档组件组合) 成熟 产品铭牌识别
DBNet + CRNN当前 约 35M–45M(R50-DBNet 加常见 CRNN) 中高 较成熟 工业字符定制识别

表中“速度、精度、部署”为同类别内的定性定位,用于缩小候选范围,不替代同一测试集、同一硬件和同一精度模式下的实测。

SELECTION SUMMARY

选型结论

DBNet + CRNN适合优先考虑工业字符定制识别、弯曲文本检测、专用字库与规则后处理的项目。它的主要价值是检测与识别可独立训练和替换;需要重点评估两阶段误差会从检测传递到识别、组合吞吐取决于文本框数量和裁剪策略。

建议先用企业真实数据建立基线,再统一测试准确率、召回率、误检率、单张延迟、峰值显存和导出兼容性,最后确定模型规模与部署方式。