《FG-Clip:细粒度视觉和文本对齐》论文核心部分详解
论文原题目:FG-CLIP: Fine-Grained Visual and Textual Alignment
2025年发表在arXiv的预印本,是一篇由工业界实验室(奇虎360)主导的、面向实际落地的高质量工作,侧重于数据工程 + 模型训练策略的极致优化。
代码位置:http:// https://github.com/360CVGroup/FG-CLIP
一、问题背景:
原始的CLIP模型虽然强大,但在细粒度理解上存在三个致命的先天缺陷:
| 缺陷 | 具体表现 | 举例说明 |
|---|---|---|
| 文本长度太短 | 文本编码器最多只支持77个token。如果描述很长,后面全被截断。 | 好比只能看20个字的商品标题,而看不了一长串的“这件红色圆领纯棉短袖T恤...” |
| 图-文对齐只关注整体 | CLIP把整张图和整句话做匹配,没有局部视野。 | 一张图里有“猫”和“狗”,句子是“一只白色的猫”。CLIP只知道图-文相关,但不知道“白色”到底指哪个动物。 |
| 缺乏硬负样本 | 训练数据里的负样本太简单(比如“猫”对“汽车”),模型无需细看就能区分。 | 考试只考“苹果 vs 西瓜”,不考“红富士苹果 vs 国光苹果”,所以遇到真·细节辨别题(如区分两种红色苹果)就懵了。 |
所以论文核心主张:与其靠模型自己学习,不如用海量高质量数据和精心设计的训练任务,把细粒度能力“喂”给CLIP。
二、主要贡献:
| 贡献 | 规模 | 作用 |
|---|---|---|
| 1. 16亿长文本-图像对(Long Captions) | 1.6 Billion | 用LMM(多模态大模型)重写LAION-2B的短标题,提供全局级的丰富语义细节 |
| 2. FineHARD数据集(区域级定位+描述) | 1200万张图,4000万个边界框 | 提供区域级的精准对齐,让模型知道这个框里的东西对应这段描述 |
| 3. 1000万硬负样本(Hard Negatives) | 10 Million | 在相似描述中改一个字(如把“红色”改成“粉色”),逼模型提高细粒度的判别 |
三、 创新点:
FG-CLIP采用两阶段训练:
- Stage 1: 全局对齐
- Stage 2: 全局+区域+硬负样本联合训练

创新点1:在Stage 1中,对每张图同时使用短标题和长标题做这个损失。长标题(如黄色斑点狗趴在公园长椅上)比短标题(一只狗)提供了全局级的细粒度监督。
1. 相似度计算—— 打分

-
含义:计算图像特征v和文本特征t 的余弦相似度。值越接近1,表示图文越匹配。
-
通俗理解:这是CLIP最基础的匹配打分基础,所有后续损失都基于这个分数。
2. 全局对比损失—— 关注整体

N:批次大小。
τ:可学习的温度参数,控制分布的“锐利度”。
公式分两部分:图像→文本(拉近匹配的图文对)和文本→图像(对称操作)。
通俗理解:在一个批次里,把真正配对的图文拉近,把不配对的推开。这是CLIP的经典InfoNCE损失。
3. 区域对比损失—— 关注局部

-
通俗理解:这不比全文匹配,而是局部匹配。模型必须学会把粉色鼠标垫这个文字,精准对应到图片中那个带网格的粉色方块区域上。这赋予了CLIP指哪儿看哪儿的能力。
4. 硬负样本损失—— 找不同特训

-
通俗理解:给同一个区域
,模型不仅要认出正样本,还要把10个长得极其相似的物体都能区分出不同。因为负样本只是改了一个属性词(颜色或材质),模型如果不认真看细节,就分不出来。
5. 总损失—— 三管齐下

四、比较的基准和数据集:
1.论文在五个维度上展开了史上最全面的CLIP对比实验,对手涵盖了当年最先进的变体:
| 任务类型 | 对比的基线模型 | 核心看点 |
|---|---|---|
| 细粒度区域理解 | CLIP, EVA-CLIP, Long-CLIP, FineCLIP | FG-OVD基准(困难/中等/容易/平凡四档),硬负样本下碾压对手 |
| 边界框分类 | RegionCLIP, CLIPSelf, FineCLIP | 在COCO/LVIS/Open Images上,FG-CLIP的ViT-L达63.2%,远超FineCLIP的54.5% |
| 开放词汇目标检测 | OV-RCNN, Detic, RO-ViT, F-ViT | 作为骨干网络(Backbone),在OV-COCO的新颖类别(AP_novel)上达到41.2%,SOTA |
| 图文检索(长/短) | Long-CLIP(长文本), EVA-CLIP | 在DCI长文本检索上,T2I达66.1%,相对CLIP原始模型提升超30个百分点 |
| 多模态大模型底座 | LLaVA-v1.5 (with CLIP) | 替换视觉塔后,在RefCOCO(指代表达理解)上提升最高达+7.0% |
2.数据集(Data):

1. Stage 1 数据:重述版LAION-2B
-
来源:LAION-2B(原始网络爬取数据)。
-
处理:动用 160台 NPU,耗时30天,用CogVLM2-19B把原始短标题(如一只鸟)重写成长达几十个单词的详细描述(如一只红翅黑鹂栖息在公园的树枝上,背景是蓝天)。
-
规模:16亿(1.6B)对长-短图文对。
2. Stage 2 数据:FineHARD,这是论文专门构建的高质量区域级数据集,包含三个层级:
-
图像与全局描述:1200万张图,配CogVLM2生成的详细长标题。
-
区域框与描述(40M个框):
-
基于GRIT数据集图像,用Yolo-World检测框。
-
用SpaCy解析全局描述,为每个框匹配对应的描述片段(如图2的缝纫机图片中,框出粉色切割垫并配文“a pink cutting mat”)。
-
-
硬负样本(10M个):
-
用Llama-3.1-70B,对每个正样本描述,替换其中的1个或多个属性词(颜色、材质),生成10个极其相似的负样本。
-
质量检查:3000个样本中,98.9%合格,仅1.1%噪声。
-
总结:
FG-CLIP证明了一个在LLM时代,模型架构决定了能力的上限,但数据质量决定了能力的下限。 当把长文本、区域对齐、硬负样本这三块短板全部用超大规模数据补上时,CLIP这种经典架构也能迸发出惊人的细粒度感知力。这对于电商商品识别、自动驾驶细粒度场景理解、医疗影像报告生成等落地场景,具有极大的实用价值。
更多推荐






所有评论(0)