1. 电商多模态表征的演进与挑战

在电商搜索场景中,用户的一次搜索行为往往需要同时处理商品的多个模态信息。以搜索"小香风外套"为例,系统不仅需要从商品主图中识别"编织纹理"与"版型设计"等视觉元素,还需从商品文本中解析"羊毛"、"短款"、"春季新款"等关键属性,更需要综合判断图像与文本描述是否指向同一件商品。这种多模态信息的互补性构成了电商搜索的核心特征:图像擅长呈现形态、颜色与设计元素,而文本则更擅长承载品牌、材质、功能等结构化语义。

电商场景的特殊性在于商品信息的"多对一复杂结构":一件商品通常关联多张图片(主图、SKU图、创意图等)和由标题、详情描述等构成的长文本。这些不同模态的信息在密度和语义覆盖范围上存在显著差异,甚至可能出现冗余或冲突。例如,商品图片可能展示多种颜色选项,而标题仅提及主推色;详情文本可能强调"透气性",但图片难以直观呈现这一特性。

1.1 技术演进历程

多模态表征方法经历了三个主要发展阶段:

早期方法采用独立编码器架构,将图像和文本分别映射到共享空间,实现粗粒度的图文对齐。这类方法虽然简单直接,但难以捕捉跨模态的深层关联。典型代表如2014年的DeViSE模型,使用预训练的CNN和词向量模型分别处理图像和文本,通过线性投影实现跨模态对齐。

视觉语言模型(VLM)时代引入了大规模图文预训练,推动表征学习从浅层特征拼接转向深层跨模态交互。2018年的ViLBERT和LXMERT等模型通过跨模态注意力机制,实现了更精细的图文关联建模。这类模型在电商场景展现出更强的商品理解能力,特别是在处理复杂属性组合时表现突出。

多模态大语言模型(MLLM)进一步将视觉感知纳入语言推理框架,使表征能力从简单的匹配判断扩展到深层内容理解和关系推理。2022年提出的Flamingo和2023年的BLIP-2等模型,通过将视觉编码器与大语言模型结合,实现了更接近人类认知的多模态理解能力。

1.2 电商场景的特殊挑战

电商多模态表征面临三个独特挑战:

异构任务统一建模的困难。电商搜索全链路涉及查询理解、召回、相关性判定、排序等多个环节,每个环节对表征的需求各不相同。传统方案为每个任务单独建模,导致语义空间不一致和重复建设。例如,召回阶段需要粗粒度匹配能力,而排序阶段则需要细粒度判别能力。

模态失衡问题。在训练过程中,不同模态的数据量和信息密度差异会导致模型偏向主导模态。我们的实验显示,当文本数据量是图像的1.5倍时,纯文搜任务的R@10提升7.2%,而图搜任务下降9.8%。这种跷跷板效应严重制约了模型的综合性能。

细粒度语义对齐的需求。电商场景要求模型不仅能判断商品是否相似,还需理解具体差异。例如,两件"白色衬衫"可能在领型、袖长等细节上存在差异,这些细微差别对购买决策至关重要但难以通过传统方法捕捉。

2. MOON 1.0:异构任务统一建模的初步探索

MOON 1.0的核心创新在于提出了基于生成式MLLM的电商多模态表征框架。该框架通过多任务联合学习,将图搜、文搜、商品搜及分类等异构任务纳入统一表征空间。具体实现上,我们设计了专家混合引导机制,针对不同模态输入及商品类别、属性等关键语义维度进行差异化建模。

2.1 架构设计

模型采用双塔结构,视觉塔基于ViT-L/16架构,文本塔采用RoBERTa-large。不同于传统双塔模型,我们在共享投影层后引入了任务特定的专家网络。每个专家网络由3层MLP构成,通过门控机制动态组合专家输出。这种设计既保持了共享表征空间的一致性,又允许针对不同任务进行特化处理。

训练阶段采用多任务联合优化,损失函数为:

L_total = λ1*L_retrieval + λ2*L_classification + λ3*L_attribute

其中λ1=0.6, λ2=0.3, λ3=0.1,通过网格搜索确定。检索损失L_retrieval采用改进的Triplet Loss,引入难样本挖掘策略,将负样本采样集中在语义相似但关键属性不同的商品对上。

2.2 实践效果与局限

在阿里妈妈搜索直通车的实际应用中,MOON 1.0带来了显著效果提升。以精排CTR预估模型为例,全量上线后大盘CTR提升20%。消融实验显示,统一表征相比单任务专用模型,在保持各项任务性能相当的情况下,计算资源消耗减少43%,模型维护成本降低60%。

然而,MOON 1.0暴露出明显的跷跷板效应。当调整任务数据配比时,图搜与文搜性能呈现此消彼长的关系。具体表现为:当图像数据占比从30%提升到50%时,图搜R@10从68.3%升至72.1%,但文搜R@10从65.7%降至59.2%。深入分析发现,这是因为共享参数空间中不同模态的表示在争夺有限的容量,缺乏有效的平衡机制。

3. MOON 2.0:动态模态平衡的关键突破

MOON 2.0的核心创新在于解决了模态失衡问题。我们提出三个关键技术:模态驱动的专家混合(Modality-driven MoE)、双重语义对齐(Dual-level Alignment)和图文协同增强(Image-text Co-augmentation)。

3.1 Modality-driven MoE机制

传统MoE机制主要依赖token级信号进行专家路由,难以有效区分模态特性。我们创新性地引入可学习的双重对齐偏好矩阵,显式刻画每个专家对不同模态对齐目标的偏好。具体实现包括:

  1. 在FFN层嵌入MoE结构,设置8个专家网络,每个专家为256维的MLP
  2. 设计模态感知路由控制器,输入同时考虑token嵌入和模态类型标识
  3. 引入稀疏正则化:L_{sparse} = 0.01*||G||_1,其中G为门控权重

实验表明,该机制使模型能够根据输入模态动态调整专家组合。当处理图像时,视觉专家(Expert 1-4)的平均激活率达到0.73;处理文本时,语言专家(Expert 5-8)的激活率为0.81,实现了明显的模态专业化分工。

3.2 Dual-level Alignment策略

我们提出商品间(Inter-product)和商品内(Intra-product)双重对齐:

Inter-product Alignment 采用改进的对比损失:

L_inter = -log[exp(s(q,p)/τ)/(exp(s(q,p)/τ)+∑exp(s(q,n)/τ))]

其中温度系数τ=0.05,通过线性warmup策略在训练初期从0.01逐步提升。

Intra-product Alignment 创新性地引入属性级一致性约束:

L_intra = 1 - cos_sim(E_v(a_i), E_t(a_i))

其中a_i表示第i个商品属性,E_v和E_t分别表示视觉和文本编码器对该属性的嵌入。

3.3 Image-text Co-augmentation方法

我们开发了两阶段增强策略:

图像增强 采用扩散模型,首先生成商品主体的分割掩码,然后基于文本描述生成背景多样的变体。关键创新在于属性保持损失:

L_attr = ||φ(I_orig) - φ(I_aug)||_2

其中φ为预训练的属性分类器,确保增强不改变核心属性。

文本增强 使用微调的LLaMA-2 7B模型,输入原始标题和商品类目,生成语义等价但表述多样的新标题。我们设计了基于困惑度的过滤机制,只保留ppl<15的增强样本。

4. 实验验证与效果分析

4.1 评测基准构建

我们构建了MBE 2.0评测基准,包含640万真实电商样本,涵盖三大类任务:

  1. 检索任务:图搜商品/文搜商品/商品搜商品
  2. 分类任务:三级类目预测
  3. 属性任务:材质/风格/适用场景等50+属性预测

该基准特别设计了对抗性测试集,包含20万人工标注的困难样本,用于评估模型的细粒度区分能力。

4.2 主要实验结果

在MBE 2.0上,MOON 2.0取得全面突破:

  • 图搜商品R@10:91.08%(较MOON 1.0提升22.8%)
  • 文搜商品R@10:63.09%(提升17.3%)
  • 商品搜商品R@10:94.21%(提升19.6%)
  • 分类准确率:88.37%(提升6.2%)
  • 属性预测F1:83.15%(提升9.8%)

跨数据集测试中,在Fashion200K上:

  • 图搜mAP:76.42(超过SOTA 8.3%)
  • 文搜mAP:72.18(超过SOTA 6.7%)

4.3 消融实验分析

各模块的贡献度如下:

模块 图搜R@10 文搜R@10 分类Acc
完整模型 91.08 63.09 88.37
-Modality-driven MoE 74.59↓ 57.32↓ 82.84↓
-Dual-level Alignment 68.17↓ 23.35↓ 77.41↓
-Image-text Co-aug 78.17↓ 60.63↓ 83.25↓

特别值得注意的是,Dual-level Alignment的移除导致文搜性能骤降,验证了跨模态对齐对文本理解的关键作用。

5. 实际应用与部署经验

在阿里妈妈搜索直通车系统中,MOON 2.0的部署面临三个主要挑战:

5.1 线上服务优化

计算图优化 :将Modality-driven MoE的路由计算与专家网络执行解耦,通过异步调度实现并行化。实测显示,这使推理延迟从78ms降至43ms。

缓存策略 :针对高频查询商品,建立多级缓存:

  1. 原始特征缓存(TTL=5min)
  2. 嵌入向量缓存(TTL=15min)
  3. 相似商品列表缓存(TTL=1h)

该策略使缓存命中率达68%,QPS提升3倍。

5.2 模型蒸馏方案

为满足不同场景的算力需求,我们开发了渐进式蒸馏流程:

  1. 使用MOON 2.0作为教师模型,训练12层Student模型(保留92%性能)
  2. 进一步蒸馏到6层Tiny模型(保留85%性能)
  3. 针对移动端,开发4层Mobile模型(保留78%性能)

蒸馏关键点在于:

  • 使用中间层注意力矩阵作为监督信号
  • 保留MoE路由模式但减少专家数量
  • 引入对抗蒸馏损失增强泛化性

5.3 业务效果验证

在全量上线后的A/B测试中,MOON 2.0带来显著提升:

指标 实验组 对照组 提升
CTR +26% 基准 -
转化率 +18% 基准 -
搜索GMV +22% 基准 -
退换货率 3.2% 4.7% ↓32%

退换货率的显著下降特别值得关注,这表明更好的多模态理解确实带来了更精准的商品匹配。

6. 未来发展方向

基于MOON系列的实践经验,我们认为电商多模态表征将向两个关键方向演进:

6.1 多粒度语义表征

当前模型对商品属性的表征仍较粗糙。我们正在探索层次化属性建模:

  • 宏观层面:品类、风格等
  • 中观层面:材质、版型等
  • 微观层面:缝线、纽扣等细节

初步实验显示,引入粒度感知损失可使细粒度检索准确率提升15%。

6.2 感知-推理-生成一体化

下一代模型将整合三种能力:

  1. 感知:精准识别商品属性
  2. 推理:理解属性间关联(如"雪纺"材质适合"夏季"场景)
  3. 生成:自动生成营销文案或搭配建议

我们正在开发的MOON 3.0原型已展现出令人期待的潜力,在商品问答任务上准确率达到72%,远超传统模型的58%。

在实际部署中,我们发现模型对时尚趋势的捕捉能力仍有提升空间。例如,当某种设计元素突然流行时,模型需要较长时间(通常2-3周)才能充分学习其语义特征。这指向了另一个重要方向——动态自适应学习,使模型能够快速吸收新兴概念而不遗忘已有知识。

Logo

电商企业物流数字化转型必备!快递鸟 API 接口,72 小时快速完成物流系统集成。全流程实战1V1指导,营造开放的API技术生态圈。

更多推荐