分享自:

通用对比学习:一种用于通用多模态检索的新方法

期刊:39th conference on neural information processing systems (NeurIPS 2025)

关于《通用多模态检索的广义对比学习》的学术研究报告

本文旨在向同行研究人员介绍一篇发表于第39届神经信息处理系统大会(NeurIPS 2025)的学术论文。该研究由来自高通人工智能研究院(Qualcomm AI Research)的Jungsoo Lee, Janghoon Cho, Hyojin Park, Munawar Hayat, Kyuwoong Hwang, Fatih Porikli, Sungha Choi(通讯作者)共同完成。论文标题为《Generalized Contrastive Learning for Universal Multimodal Retrieval》,即《面向通用多模态检索的广义对比学习》。

一、 研究的学术背景

本研究属于人工智能领域,具体聚焦于计算机视觉与自然语言处理交叉方向的多模态检索任务。随着互联网和数字设备的普及,包含图像、文本、视频等多种模态(modality)的数据日益增长。传统的跨模态检索(cross-modal retrieval),例如以文搜图或以图搜文,已经取得了显著进展,其核心方法(如CLIP模型)通过在大规模图文对数据上进行对比学习(contrastive learning),将图像和文本映射到一个共享的语义表示空间。

然而,现实世界中的数据往往是多模态融合的,例如一个维基百科页面同时包含图片和说明文字。现有的跨模态检索模型在面对这种由图像和文本共同构成的“融合模态”检索键(key)时,性能会显著下降。这背后的核心挑战是“模态鸿沟”(modality gap),即语义相似的图像和文本样本在表示空间中可能距离较远,而语义不相似的同类模态样本反而距离较近。当检索库中同时存在纯文本、纯图像以及图文融合的条目时,模型难以在一个统一的表示空间内进行精确匹配。

为了应对这一挑战,多模态检索(multimodal retrieval)应运而生,其目标是训练一个单一的、通用的检索模型,能够处理查询(query)和候选键(key)之间任意模态组合的检索任务(例如,用文本查询检索图文融合的条目,或用图文融合的查询检索图像)。此前的主流方法(如VISTA模型)依赖于构建新的、特定于任务的三元组数据集(例如,专门为“用图文对查询图像”或“用文本查询图文对”任务生成数据)。这种方法存在两大局限:1) 数据构建成本高昂,且质量难以保证;2) 模型难以泛化到训练时未见的其他模态组合检索场景。

因此,本研究旨在解决一个关键问题:如何在不依赖昂贵且定制化的新数据集构建的前提下,有效提升模型在多种模态组合下的通用多模态检索性能? 具体目标包括:提出一种能够利用现有图文对数据、学习统一多模态表示空间的新方法,并在多个基准测试和不同检索模型上验证其有效性和泛化能力。

二、 研究的详细工作流程

本研究主要包含以下几个核心步骤:问题定义与模型准备、广义对比学习(GCL)损失函数的设计与实现、实验设置与模型训练、以及全面的性能评估与分析。

1. 问题定义与模型准备: 研究首先形式化了多模态检索问题。给定一个由图像编码器θ_i和文本编码器θ_t组成的检索模型θ,输入图像x_i和文本x_t,可得到各自的嵌入表示e_i和e_t。对于图文融合的样本x_it,其融合嵌入e_it的获取方式取决于具体模型:对于VISTA模型,使用其专门的融合编码器;对于CLIP类模型,则采用分数级融合(score-fusion, SF)策略,即e_it = e_i + e_t。研究关注两种检索设定:全局设定(所有模态的候选样本混合在一个共享库中检索)和局部设定(针对特定任务,从同模态候选库中检索)。

研究选用已预训练好的跨模态检索模型作为基础,包括VISTA、CLIP-SF和TinyClip-SF。特别地,对于VISTA,作者使用了其第二阶段训练(即使用生成的三元组数据微调)之前的检查点,以证明其方法无需新生成数据也能提升性能。

2. 广义对比学习(GCL)损失函数的设计: 这是本研究的核心创新。作者提出了一种新颖的损失函数——广义对比学习(Generalized Contrastive Learning, GCL),旨在利用现有的图文对数据集,在一个批次(mini-batch)内对所有模态(纯文本、纯图像、图文融合)进行统一的对比学习。

具体工作流程如下: * 数据准备与嵌入提取:对于一个包含N个图文对的批次,首先通过模型提取每个图像样本的嵌入e_i、每个文本样本的嵌入e_t。然后,根据所选模型的方法(VISTA融合编码器或CLIP-SF的加法融合)为每个图文对生成融合嵌入e_it。 * 构建批次与相似度矩阵:将这三组嵌入(共3N个嵌入向量)整合到一个统一的批次中。对于一个给定的查询嵌入(例如,某个图像嵌入e_i^j),其正样本(positive pairs)被定义为来自同一原始图文对的、不同模态的嵌入,即对应的文本嵌入e_t^j和融合嵌入e_it^j。批次内所有其他样本(包括其他图像、文本、融合嵌入)均被视为负样本(negative pairs)。 * 损失计算:GCL损失函数对六种查询-正样本模态组合(i→t, i→it, t→i, t→it, it→i, it→t)分别计算对比损失,并求平均。其数学公式如下:

L_GCL = - (1/(6N)) * Σ_{j=1}^{N} Σ_{(a,b)∈P} log[ exp(e_a^j · e_b^j / τ) / Σ_{m∈M} Σ_{k=1}^{N} exp(e_a^j · e_m^k / τ) ] 其中,P代表六种正样本对组合的集合,M代表所有三种模态{i, t, it}的集合,τ是温度参数。该损失函数的核心思想是,拉近来自同一语义内容但不同模态的样本(正样本对),同时推远所有其他不相关的样本(负样本对),无论这些负样本属于何种模态。 
  • 训练过程:使用现有的图文对数据集(本研究采用LLaVA视觉指令预训练数据集LCS-558K)对预训练的基础模型进行微调,优化目标即为最小化GCL损失。这个过程不需要任何为特定任务生成的、包含图文融合样本的三元组数据。

3. 实验设置与评估: 为了全面评估GCL的有效性,研究设计了严格的实验方案: * 基准测试:在三个公认的多模态检索基准上进行评估:M-BEIR(包含10个子数据集,评估8种不同的检索任务)、MMEB(包含12个子数据集)和COVR(视频检索基准)。实验均在零样本(zero-shot)设置下进行,即模型不在目标数据集的训练集上微调。 * 对比方法:将应用了GCL的模型与多个基线进行对比:1) 原始预训练模型;2) 使用标准对比学习(仅限图像-文本对)微调的模型;3) 对于VISTA,还包括了使用其原论文中生成的特定三元组数据集(it2i, t2it)微调的模型(记为CL+Triplet)。 * 评估指标:采用检索任务的标准指标Recall@K(K取1, 5, 10, 50等)。

4. 数据分析工作流程: 除了常规的性能比较,研究还进行了深入的定量与定性分析以验证GCL的作用机制: * 表示空间可视化:使用主成分分析(PCA)将VISTA和VISTA+GCL学习到的图像、文本、图文融合嵌入投影到二维空间,直观展示GCL如何促使不同模态的语义相似样本在表示空间中更紧密地混合。 * 模态间相似度计算:计算并比较各模态平均嵌入向量之间的余弦相似度,量化“模态鸿沟”的缩小程度。 * 消融实验:通过逐一移除GCL损失中针对特定模态组合的损失项(如仅移除跨模态对齐项i↔t,或仅移除融合嵌入作为候选的项i/t→it等),分析各部分损失对最终性能的贡献。 * 结果深度分析:分析真实答案(ground truth)在检索结果中的排名分布变化;计算查询与真实答案之间、以及查询与Top-K候选答案之间的平均余弦相似度,从匹配质量和检索一致性两个角度评估模型改进。

三、 研究的主要结果

实验结果表明,GCL方法在多个维度上显著提升了多模态检索的性能。

1. 主要性能提升: * 在M-BEIR基准上:在全局检索设定下,GCL为VISTA、CLIP-SF和TinyClip-SF模型带来了全面的、一致性的性能提升。平均召回率(Recall@50)分别从24.65%、14.92%和17.36%提升至34.06%、21.89%和22.71%。提升尤其体现在涉及图文融合模态(q_it 或 c_it)的复杂检索任务上。例如,对于任务“qt→(ci,ct)”和“qit→cit”,GCL带来了显著的性能飞跃。值得注意的是,使用生成三元组数据微调的VISTA(CL+Triplet)虽然在特定任务(如qit→ci, qt→cit)上表现最佳,但在其他未见任务或经典跨模态任务上表现不佳甚至下降,存在过拟合特定场景和遗忘原始跨模态对齐能力的问题。而GCL则实现了更均衡、更通用的性能提升。 * 在MMEB和COVR基准上:GCL同样带来了显著的性能改进。在MMEB的局部设定下,VISTA+GCL的平均Recall@1达到了44.9%,优于基线方法。在COVR视频检索任务上,GCL也一致提升了所有Recall@K指标,证明了其对视频模态的泛化能力。

2. 分析与验证结果: * 表示空间改善:PCA可视化清晰显示,经过GCL训练后,图像、文本和图文融合嵌入在表示空间中混合得更加均匀,模态间的界限变得模糊。余弦相似度表格数据也证实,各模态中心之间的相似度在GCL后大幅提高,表明“模态鸿沟”被有效缩小。 * 消融实验结论:消融研究证实了GCL中每个损失项的必要性。移除跨模态对齐项(i↔t)会严重损害纯跨模态检索任务;移除涉及融合嵌入作为候选的项(i/t→it)会降低在融合候选库上的检索性能;移除涉及融合嵌入作为查询的项(it→i/t)则会影响以融合内容为查询的任务。这说明了GCL通过统一的损失设计,同时优化了所有九种可能的模态组合检索。 * 与现有方法的对比:GCL超越了仅关注减少同类模态内相似度的“模态内分离损失”(intra-modality separation loss),后者在多模态检索任务上的提升有限。 * 对轻量级模型的赋能:GCL能够显著提升轻量级模型TinyClip的性能,使其在参数量远少于VISTA和CLIP的情况下,取得更具竞争力的检索效果,同时保持更快的推理速度,这为在移动或边缘设备上部署高效检索模型提供了可行方案。 * 排序与相似度分析:分析显示,经过GCL训练后,真实答案在检索结果中的排名显著靠前(大量集中于前500名)。同时,查询与真实答案之间的余弦相似度普遍提高,且查询与Top-K候选答案之间的相似度曲线更加平缓,表明即使排名靠后的候选也保持了较高的语义相关性,提升了检索结果的整体质量和鲁棒性。

四、 研究的结论与价值

本研究得出结论:提出的广义对比学习(GCL)是一种简单而有效的损失函数,它能够在不依赖人工构造的、针对特定场景的三元组数据集的情况下,显著提升多模态检索模型的性能。通过在一个批次内集成文本、图像和图文融合三种模态的嵌入,并执行全面的跨模态对比学习,GCL成功地缩小了模态鸿沟,在一个统一的表示空间中更好地对齐了不同模态的语义信息。

本研究的科学价值在于:1) 提出了一种新颖且通用的多模态表示学习框架,将检索任务从有限的模态组合扩展到了任意模态组合;2) 揭示了利用现有大规模图文对数据来学习融合模态表示的可行性,为多模态学习提供了新的数据利用视角;3) 通过系统的实验证明了该方法的有效性、泛化性和对轻量级模型的适用性。

其应用价值显著:GCL提供了一种低成本、可扩展的解决方案来提升现有检索模型(如CLIP、VISTA)处理现实世界中复杂多模态数据的能力。这使得构建能够同时处理文本、图像、图文混合乃至视频内容的通用检索系统成为可能,可广泛应用于搜索引擎、内容推荐、数字图书馆、智能助理等场景。

五、 研究的亮点

  1. 方法创新性:提出了广义对比学习(GCL)这一核心创新,巧妙地将融合模态嵌入纳入标准的对比学习框架,仅使用现有图文对数据即可训练,避免了昂贵且局限的新数据构造。
  2. 通用性与泛化性:GCL不是针对某一两种特定检索场景进行优化,而是旨在同时改善所有可能的模态组合(共九种)的检索性能,体现了其“通用”(Universal)的设计目标。
  3. 实证充分性:在三个主流基准(M-BEIR, MMEB, COVR)和多个模型架构(VISTA, CLIP, TinyClip)上进行了全面验证,涵盖了图像、文本、图文混合及视频检索任务,结论坚实可靠。
  4. 深入的分析:不仅报告了性能数字,还通过可视化、消融实验、排序分析、相似度分析等多种手段,深入阐释了GCL为何以及如何工作,增强了研究的可信度和洞察力。
  5. 实用性:方法简单易实现,可直接作为损失函数用于微调现有预训练模型,且对轻量模型同样有效,具有良好的部署前景。

六、 其他有价值的内容

论文还简要讨论了未来的研究方向,例如将GCL与多模态大语言模型(MLLMs)结合,以进一步增强其在生成式、推理式任务中的检索增强能力。作者也坦诚提到了当前工作的一个局限:用于微调的通用数据集(LCS-558K)可能无法完全覆盖某些特定领域任务(如时尚检索CIRR、FashionIQ)的细微差异,建议GCL可作为有效的预训练阶段,后续可通过领域特定数据进一步微调以获得最优性能。这为后续研究指明了潜在改进方向。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com