论文原题目:FG-CLIP: Fine-Grained Visual and Textual Alignment

2025年发表在arXiv的预印本,是一篇由工业界实验室(奇虎360)主导的、面向实际落地的高质量工作,侧重于数据工程 + 模型训练策略的极致优化。

代码位置:http:// https://github.com/360CVGroup/FG-CLIP

一、问题背景:

原始的CLIP模型虽然强大,但在细粒度理解上存在三个致命的先天缺陷:

缺陷 具体表现 举例说明
文本长度太短 文本编码器最多只支持77个token。如果描述很长,后面全被截断。 好比只能看20个字的商品标题,而看不了一长串的“这件红色圆领纯棉短袖T恤...”
 图-文对齐只关注整体 CLIP把整张图整句话做匹配,没有局部视野。 一张图里有“猫”和“狗”,句子是“一只白色的猫”。CLIP只知道图-文相关,但不知道“白色”到底指哪个动物。
缺乏硬负样本 训练数据里的负样本太简单(比如“猫”对“汽车”),模型无需细看就能区分。 考试只考“苹果 vs 西瓜”,不考“红富士苹果 vs 国光苹果”,所以遇到真·细节辨别题(如区分两种红色苹果)就懵了。

所以论文核心主张:与其靠模型自己学习,不如用海量高质量数据和精心设计的训练任务,把细粒度能力“喂”给CLIP

二、主要贡献:

贡献 规模 作用
1. 16亿长文本-图像对(Long Captions) 1.6 Billion 用LMM(多模态大模型)重写LAION-2B的短标题,提供全局级的丰富语义细节
2. FineHARD数据集(区域级定位+描述) 1200万张图,4000万个边界框 提供区域级的精准对齐,让模型知道这个框里的东西对应这段描述
3. 1000万硬负样本(Hard Negatives) 10 Million 在相似描述中改一个字(如把“红色”改成“粉色”),逼模型提高细粒度的判别

三、 创新点:

FG-CLIP采用两阶段训练:

  • Stage 1: 全局对齐
  • Stage 2: 全局+区域+硬负样本联合训练

创新点1:在Stage 1中,对每张图同时使用短标题和长标题做这个损失。长标题(如黄色斑点狗趴在公园长椅上)比短标题(一只狗)提供了全局级的细粒度监督。

1. 相似度计算—— 打分

  • 含义:计算图像特征v和文本特征t 的余弦相似度。值越接近1,表示图文越匹配。

  • 通俗理解:这是CLIP最基础的匹配打分基础,所有后续损失都基于这个分数。

2. 全局对比损失—— 关注整体

N:批次大小。
τ:可学习的温度参数,控制分布的“锐利度”。

公式分两部分:图像→文本(拉近匹配的图文对)和文本→图像(对称操作)。

通俗理解:在一个批次里,把真正配对的图文拉近把不配对的推开。这是CLIP的经典InfoNCE损失。

3. 区域对比损失—— 关注局部

  • 通俗理解:这不比全文匹配,而是局部匹配。模型必须学会把粉色鼠标垫这个文字,精准对应到图片中那个带网格的粉色方块区域上。这赋予了CLIP指哪儿看哪儿的能力。

4. 硬负样本损失—— 找不同特训

  • 通俗理解:给同一个区域r_i,模型不仅要认出正样本,还要把10个长得极其相似的物体都能区分出不同。因为负样本只是改了一个属性词(颜色或材质),模型如果不认真看细节,就分不出来。

5. 总损失—— 三管齐下

四、比较的基准和数据集:

1.论文在五个维度上展开了史上最全面的CLIP对比实验,对手涵盖了当年最先进的变体:
任务类型 对比的基线模型 核心看点
细粒度区域理解 CLIP, EVA-CLIP, Long-CLIP, FineCLIP FG-OVD基准(困难/中等/容易/平凡四档),硬负样本下碾压对手
边界框分类 RegionCLIP, CLIPSelf, FineCLIP 在COCO/LVIS/Open Images上,FG-CLIP的ViT-L达63.2%,远超FineCLIP的54.5%
开放词汇目标检测 OV-RCNN, Detic, RO-ViT, F-ViT 作为骨干网络(Backbone),在OV-COCO的新颖类别(AP_novel)上达到41.2%,SOTA
图文检索(长/短) Long-CLIP(长文本), EVA-CLIP 在DCI长文本检索上,T2I达66.1%,相对CLIP原始模型提升超30个百分点
多模态大模型底座 LLaVA-v1.5 (with CLIP) 替换视觉塔后,在RefCOCO(指代表达理解)上提升最高达+7.0%
 2.数据集(Data):

1. Stage 1 数据:重述版LAION-2B
  • 来源:LAION-2B(原始网络爬取数据)。

  • 处理:动用 160台 NPU,耗时30天,用CogVLM2-19B把原始短标题(如一只鸟)重写成长达几十个单词的详细描述(如一只红翅黑鹂栖息在公园的树枝上,背景是蓝天)。

  • 规模:16亿(1.6B)对长-短图文对。

2. Stage 2 数据:FineHARD,这是论文专门构建的高质量区域级数据集,包含三个层级:
  • 图像与全局描述:1200万张图,配CogVLM2生成的详细长标题。

  • 区域框与描述(40M个框)

    • 基于GRIT数据集图像,用Yolo-World检测框。

    • 用SpaCy解析全局描述,为每个框匹配对应的描述片段(如图2的缝纫机图片中,框出粉色切割垫并配文“a pink cutting mat”)。

  • 硬负样本(10M个)

    • 用Llama-3.1-70B,对每个正样本描述,替换其中的1个或多个属性词(颜色、材质),生成10个极其相似的负样本。

    • 质量检查:3000个样本中,98.9%合格,仅1.1%噪声。

总结:

FG-CLIP证明了一个在LLM时代,模型架构决定了能力的上限,但数据质量决定了能力的下限。 当把长文本、区域对齐、硬负样本这三块短板全部用超大规模数据补上时,CLIP这种经典架构也能迸发出惊人的细粒度感知力。这对于电商商品识别、自动驾驶细粒度场景理解、医疗影像报告生成等落地场景,具有极大的实用价值。

Logo

电商企业物流数字化转型必备!快递鸟 API 接口,72 小时快速完成物流系统集成。全流程实战1V1指导,营造开放的API技术生态圈。

更多推荐