OCR 文字识别 / 26
DBNet + CRNN
文本检测与序列识别组合
DBNet + CRNN由 DBNet 通过可微二值化定位任意形状文本区域,再由 CRNN 使用卷积、序列建模和 CTC 解码识别字符,适合模块化定制 OCR 流程。代表性参数规模为约 35M–45M(R50-DBNet 加常见 CRNN),性能定位是组件边界清晰,便于独立替换和领域微调。
- 技术来源
- 学术开源模型 / OpenMMLab 实现
- 提出时间
- 2015–2020
- 性能定位
- 组件边界清晰,便于独立替换和领域微调
- 部署成熟度
- 较成熟
PARAMETERS
参考参数与输入输出
参数量是公开代表性配置或合理范围,不同骨干、类别数、输入尺寸和实现版本会改变结果;详细实施时以选定配置导出的模型信息为准。
PERFORMANCE
性能如何理解
组件边界清晰,便于独立替换和领域微调。定制自由度高于 PaddleOCR 一体化方案,但集成、预处理和部署工作量更大。网站不使用脱离条件的单一 FPS 或 mAP 数字作为承诺,因为数据集、输入尺寸、精度模式、批量大小、GPU 型号和后处理口径都会显著改变测试结果。
- 推理速度
- 中高
- 精度定位
- 高
- 部署成熟度
- 较成熟
CHARACTERISTICS & USE CASES
核心特点与应用边界
核心特点
- 检测与识别可独立训练和替换
- DBNet 对弯曲或不规则文本边界友好
- CRNN 对变长字符序列建模经典稳定
典型场景
- 工业字符定制识别
- 弯曲文本检测
- 专用字库与规则后处理
限制与风险
- 两阶段误差会从检测传递到识别
- 组合吞吐取决于文本框数量和裁剪策略
MODEL COMPARISON
OCR 文字识别同类模型对比
| 模型 | 参考参数规模 | 速度 | 精度定位 | 部署 | 优先场景 |
|---|---|---|---|---|---|
| PaddleOCR | 约 3M–100M+(按检测、识别和文档组件组合) | 高 | 高 | 成熟 | 产品铭牌识别 |
| DBNet + CRNN当前 | 约 35M–45M(R50-DBNet 加常见 CRNN) | 中高 | 高 | 较成熟 | 工业字符定制识别 |
表中“速度、精度、部署”为同类别内的定性定位,用于缩小候选范围,不替代同一测试集、同一硬件和同一精度模式下的实测。