图像分类 / 23

ConvNeXt

现代化纯卷积网络

ConvNeXt吸收 Transformer 时代的宏观结构、归一化和训练策略,使用大核深度卷积构建现代纯卷积骨干,在保持卷积特性的同时提升规模化精度。代表性参数规模为约 28.6M–197.8M(Tiny 至 Large),性能定位是分类精度高,兼顾卷积部署特性。

技术来源
Meta AI
提出时间
2022
性能定位
分类精度高,兼顾卷积部署特性
部署成熟度
较成熟
01

PARAMETERS

参考参数与输入输出

代表性参数量约 28.6M–197.8M(Tiny 至 Large)
输入RGB 图像;常用 224×224 或更高分辨率
输出类别概率或层次视觉特征
算力与部署GPU 推荐;大模型需要较高显存和训练时长

参数量是公开代表性配置或合理范围,不同骨干、类别数、输入尺寸和实现版本会改变结果;详细实施时以选定配置导出的模型信息为准。

02

PERFORMANCE

性能如何理解

分类精度高,兼顾卷积部署特性。精度通常优于经典 ResNet,但速度、显存和部署普适性不如轻量 MobileNet。网站不使用脱离条件的单一 FPS 或 mAP 数字作为承诺,因为数据集、输入尺寸、精度模式、批量大小、GPU 型号和后处理口径都会显著改变测试结果。

推理速度
精度定位
很高
部署成熟度
较成熟
03

CHARACTERISTICS & USE CASES

核心特点与应用边界

核心特点

  • 大核深度卷积扩大有效感受野
  • LayerNorm 与阶段设计更现代
  • 可作为检测和分割的高质量骨干

典型场景

  • 高精度产品分类
  • 服务器端视觉骨干
  • 复杂纹理与细粒度识别

限制与风险

  • 大模型训练成本明显高于 ResNet18/50
  • 部分边缘推理引擎对 LayerNorm 与大核优化不足
04

MODEL COMPARISON

图像分类同类模型对比

模型参考参数规模速度精度定位部署优先场景
MobileNet 约 2.5M–6.9M(V1/V2/V3 常见配置) 很高 成熟 低功耗视觉终端
ResNet 约 11.7M/25.6M/44.5M(18/50/101) 成熟 工业图像分类
VGG 约 138M/144M(VGG16/VGG19) 中低 成熟 教学与算法对照
ConvNeXt当前 约 28.6M–197.8M(Tiny 至 Large) 很高 较成熟 高精度产品分类
YOLO Classify 约 2.7M–57M(随版本和尺度变化) 很高 成熟 整图缺陷判级

表中“速度、精度、部署”为同类别内的定性定位,用于缩小候选范围,不替代同一测试集、同一硬件和同一精度模式下的实测。

SELECTION SUMMARY

选型结论

ConvNeXt适合优先考虑高精度产品分类、服务器端视觉骨干、复杂纹理与细粒度识别的项目。它的主要价值是大核深度卷积扩大有效感受野;需要重点评估大模型训练成本明显高于 ResNet18/50、部分边缘推理引擎对 LayerNorm 与大核优化不足。

建议先用企业真实数据建立基线,再统一测试准确率、召回率、误检率、单张延迟、峰值显存和导出兼容性,最后确定模型规模与部署方式。