特征与多模态 / 34
CLIP
图文对齐多模态模型
CLIP通过大规模图文对比学习把图像和文本映射到同一向量空间,可直接根据文本类别完成零样本分类、语义检索和开放词汇数据筛选。代表性参数规模为约 102M–428M(RN50 至 ViT-L/14 常见配置),性能定位是零样本语义迁移强,细粒度工业判定需适配。
- 技术来源
- OpenAI
- 提出时间
- 2021
- 性能定位
- 零样本语义迁移强,细粒度工业判定需适配
- 部署成熟度
- 较成熟
PARAMETERS
参考参数与输入输出
参数量是公开代表性配置或合理范围,不同骨干、类别数、输入尺寸和实现版本会改变结果;详细实施时以选定配置导出的模型信息为准。
PERFORMANCE
性能如何理解
零样本语义迁移强,细粒度工业判定需适配。文本交互能力优于 DINOv2,但纯视觉细节和领域稳定性可能较弱。网站不使用脱离条件的单一 FPS 或 mAP 数字作为承诺,因为数据集、输入尺寸、精度模式、批量大小、GPU 型号和后处理口径都会显著改变测试结果。
- 推理速度
- 中
- 精度定位
- 语义泛化高
- 部署成熟度
- 较成熟
CHARACTERISTICS & USE CASES
核心特点与应用边界
核心特点
- 自然语言可直接充当类别描述
- 图像和文本向量支持快速相似度检索
- 无需固定分类头即可扩展概念
典型场景
- 文本搜图
- 零样本分类
- 开放词汇数据清洗
限制与风险
- 工业细粒度缺陷与专业术语可能不在预训练分布
- 提示词、语言和阈值会显著影响结果