关于《通用多模态检索的广义对比学习》的学术研究报告
本文旨在向同行研究人员介绍一篇发表于第39届神经信息处理系统大会(NeurIPS 2025)的学术论文。该研究由来自高通人工智能研究院(Qualcomm AI Research)的Jungsoo Lee, Janghoon Cho, Hyojin Park, Munawar Hayat, Kyuwoong Hwang, Fatih Porikli, Sungha Choi(通讯作者)共同完成。论文标题为《Generalized Contrastive Learning for Universal Multimodal Retrieval》,即《面向通用多模态检索的广义对比学习》。
一、 研究的学术背景
本研究属于人工智能领域,具体聚焦于计算机视觉与自然语言处理交叉方向的多模态检索任务。随着互联网和数字设备的普及,包含图像、文本、视频等多种模态(modality)的数据日益增长。传统的跨模态检索(cross-modal retrieval),例如以文搜图或以图搜文,已经取得了显著进展,其核心方法(如CLIP模型)通过在大规模图文对数据上进行对比学习(contrastive learning),将图像和文本映射到一个共享的语义表示空间。
然而,现实世界中的数据往往是多模态融合的,例如一个维基百科页面同时包含图片和说明文字。现有的跨模态检索模型在面对这种由图像和文本共同构成的“融合模态”检索键(key)时,性能会显著下降。这背后的核心挑战是“模态鸿沟”(modality gap),即语义相似的图像和文本样本在表示空间中可能距离较远,而语义不相似的同类模态样本反而距离较近。当检索库中同时存在纯文本、纯图像以及图文融合的条目时,模型难以在一个统一的表示空间内进行精确匹配。
为了应对这一挑战,多模态检索(multimodal retrieval)应运而生,其目标是训练一个单一的、通用的检索模型,能够处理查询(query)和候选键(key)之间任意模态组合的检索任务(例如,用文本查询检索图文融合的条目,或用图文融合的查询检索图像)。此前的主流方法(如VISTA模型)依赖于构建新的、特定于任务的三元组数据集(例如,专门为“用图文对查询图像”或“用文本查询图文对”任务生成数据)。这种方法存在两大局限:1) 数据构建成本高昂,且质量难以保证;2) 模型难以泛化到训练时未见的其他模态组合检索场景。
因此,本研究旨在解决一个关键问题:如何在不依赖昂贵且定制化的新数据集构建的前提下,有效提升模型在多种模态组合下的通用多模态检索性能? 具体目标包括:提出一种能够利用现有图文对数据、学习统一多模态表示空间的新方法,并在多个基准测试和不同检索模型上验证其有效性和泛化能力。
二、 研究的详细工作流程
本研究主要包含以下几个核心步骤:问题定义与模型准备、广义对比学习(GCL)损失函数的设计与实现、实验设置与模型训练、以及全面的性能评估与分析。
1. 问题定义与模型准备: 研究首先形式化了多模态检索问题。给定一个由图像编码器θ_i和文本编码器θ_t组成的检索模型θ,输入图像x_i和文本x_t,可得到各自的嵌入表示e_i和e_t。对于图文融合的样本x_it,其融合嵌入e_it的获取方式取决于具体模型:对于VISTA模型,使用其专门的融合编码器;对于CLIP类模型,则采用分数级融合(score-fusion, SF)策略,即e_it = e_i + e_t。研究关注两种检索设定:全局设定(所有模态的候选样本混合在一个共享库中检索)和局部设定(针对特定任务,从同模态候选库中检索)。
研究选用已预训练好的跨模态检索模型作为基础,包括VISTA、CLIP-SF和TinyClip-SF。特别地,对于VISTA,作者使用了其第二阶段训练(即使用生成的三元组数据微调)之前的检查点,以证明其方法无需新生成数据也能提升性能。
2. 广义对比学习(GCL)损失函数的设计: 这是本研究的核心创新。作者提出了一种新颖的损失函数——广义对比学习(Generalized Contrastive Learning, GCL),旨在利用现有的图文对数据集,在一个批次(mini-batch)内对所有模态(纯文本、纯图像、图文融合)进行统一的对比学习。
具体工作流程如下: * 数据准备与嵌入提取:对于一个包含N个图文对的批次,首先通过模型提取每个图像样本的嵌入e_i、每个文本样本的嵌入e_t。然后,根据所选模型的方法(VISTA融合编码器或CLIP-SF的加法融合)为每个图文对生成融合嵌入e_it。 * 构建批次与相似度矩阵:将这三组嵌入(共3N个嵌入向量)整合到一个统一的批次中。对于一个给定的查询嵌入(例如,某个图像嵌入e_i^j),其正样本(positive pairs)被定义为来自同一原始图文对的、不同模态的嵌入,即对应的文本嵌入e_t^j和融合嵌入e_it^j。批次内所有其他样本(包括其他图像、文本、融合嵌入)均被视为负样本(negative pairs)。 * 损失计算:GCL损失函数对六种查询-正样本模态组合(i→t, i→it, t→i, t→it, it→i, it→t)分别计算对比损失,并求平均。其数学公式如下:
L_GCL = - (1/(6N)) * Σ_{j=1}^{N} Σ_{(a,b)∈P} log[ exp(e_a^j · e_b^j / τ) / Σ_{m∈M} Σ_{k=1}^{N} exp(e_a^j · e_m^k / τ) ] 其中,P代表六种正样本对组合的集合,M代表所有三种模态{i, t, it}的集合,τ是温度参数。该损失函数的核心思想是,拉近来自同一语义内容但不同模态的样本(正样本对),同时推远所有其他不相关的样本(负样本对),无论这些负样本属于何种模态。 3. 实验设置与评估: 为了全面评估GCL的有效性,研究设计了严格的实验方案: * 基准测试:在三个公认的多模态检索基准上进行评估:M-BEIR(包含10个子数据集,评估8种不同的检索任务)、MMEB(包含12个子数据集)和COVR(视频检索基准)。实验均在零样本(zero-shot)设置下进行,即模型不在目标数据集的训练集上微调。 * 对比方法:将应用了GCL的模型与多个基线进行对比:1) 原始预训练模型;2) 使用标准对比学习(仅限图像-文本对)微调的模型;3) 对于VISTA,还包括了使用其原论文中生成的特定三元组数据集(it2i, t2it)微调的模型(记为CL+Triplet)。 * 评估指标:采用检索任务的标准指标Recall@K(K取1, 5, 10, 50等)。
4. 数据分析工作流程: 除了常规的性能比较,研究还进行了深入的定量与定性分析以验证GCL的作用机制: * 表示空间可视化:使用主成分分析(PCA)将VISTA和VISTA+GCL学习到的图像、文本、图文融合嵌入投影到二维空间,直观展示GCL如何促使不同模态的语义相似样本在表示空间中更紧密地混合。 * 模态间相似度计算:计算并比较各模态平均嵌入向量之间的余弦相似度,量化“模态鸿沟”的缩小程度。 * 消融实验:通过逐一移除GCL损失中针对特定模态组合的损失项(如仅移除跨模态对齐项i↔t,或仅移除融合嵌入作为候选的项i/t→it等),分析各部分损失对最终性能的贡献。 * 结果深度分析:分析真实答案(ground truth)在检索结果中的排名分布变化;计算查询与真实答案之间、以及查询与Top-K候选答案之间的平均余弦相似度,从匹配质量和检索一致性两个角度评估模型改进。
三、 研究的主要结果
实验结果表明,GCL方法在多个维度上显著提升了多模态检索的性能。
1. 主要性能提升: * 在M-BEIR基准上:在全局检索设定下,GCL为VISTA、CLIP-SF和TinyClip-SF模型带来了全面的、一致性的性能提升。平均召回率(Recall@50)分别从24.65%、14.92%和17.36%提升至34.06%、21.89%和22.71%。提升尤其体现在涉及图文融合模态(q_it 或 c_it)的复杂检索任务上。例如,对于任务“qt→(ci,ct)”和“qit→cit”,GCL带来了显著的性能飞跃。值得注意的是,使用生成三元组数据微调的VISTA(CL+Triplet)虽然在特定任务(如qit→ci, qt→cit)上表现最佳,但在其他未见任务或经典跨模态任务上表现不佳甚至下降,存在过拟合特定场景和遗忘原始跨模态对齐能力的问题。而GCL则实现了更均衡、更通用的性能提升。 * 在MMEB和COVR基准上:GCL同样带来了显著的性能改进。在MMEB的局部设定下,VISTA+GCL的平均Recall@1达到了44.9%,优于基线方法。在COVR视频检索任务上,GCL也一致提升了所有Recall@K指标,证明了其对视频模态的泛化能力。
2. 分析与验证结果: * 表示空间改善:PCA可视化清晰显示,经过GCL训练后,图像、文本和图文融合嵌入在表示空间中混合得更加均匀,模态间的界限变得模糊。余弦相似度表格数据也证实,各模态中心之间的相似度在GCL后大幅提高,表明“模态鸿沟”被有效缩小。 * 消融实验结论:消融研究证实了GCL中每个损失项的必要性。移除跨模态对齐项(i↔t)会严重损害纯跨模态检索任务;移除涉及融合嵌入作为候选的项(i/t→it)会降低在融合候选库上的检索性能;移除涉及融合嵌入作为查询的项(it→i/t)则会影响以融合内容为查询的任务。这说明了GCL通过统一的损失设计,同时优化了所有九种可能的模态组合检索。 * 与现有方法的对比:GCL超越了仅关注减少同类模态内相似度的“模态内分离损失”(intra-modality separation loss),后者在多模态检索任务上的提升有限。 * 对轻量级模型的赋能:GCL能够显著提升轻量级模型TinyClip的性能,使其在参数量远少于VISTA和CLIP的情况下,取得更具竞争力的检索效果,同时保持更快的推理速度,这为在移动或边缘设备上部署高效检索模型提供了可行方案。 * 排序与相似度分析:分析显示,经过GCL训练后,真实答案在检索结果中的排名显著靠前(大量集中于前500名)。同时,查询与真实答案之间的余弦相似度普遍提高,且查询与Top-K候选答案之间的相似度曲线更加平缓,表明即使排名靠后的候选也保持了较高的语义相关性,提升了检索结果的整体质量和鲁棒性。
四、 研究的结论与价值
本研究得出结论:提出的广义对比学习(GCL)是一种简单而有效的损失函数,它能够在不依赖人工构造的、针对特定场景的三元组数据集的情况下,显著提升多模态检索模型的性能。通过在一个批次内集成文本、图像和图文融合三种模态的嵌入,并执行全面的跨模态对比学习,GCL成功地缩小了模态鸿沟,在一个统一的表示空间中更好地对齐了不同模态的语义信息。
本研究的科学价值在于:1) 提出了一种新颖且通用的多模态表示学习框架,将检索任务从有限的模态组合扩展到了任意模态组合;2) 揭示了利用现有大规模图文对数据来学习融合模态表示的可行性,为多模态学习提供了新的数据利用视角;3) 通过系统的实验证明了该方法的有效性、泛化性和对轻量级模型的适用性。
其应用价值显著:GCL提供了一种低成本、可扩展的解决方案来提升现有检索模型(如CLIP、VISTA)处理现实世界中复杂多模态数据的能力。这使得构建能够同时处理文本、图像、图文混合乃至视频内容的通用检索系统成为可能,可广泛应用于搜索引擎、内容推荐、数字图书馆、智能助理等场景。
五、 研究的亮点
六、 其他有价值的内容
论文还简要讨论了未来的研究方向,例如将GCL与多模态大语言模型(MLLMs)结合,以进一步增强其在生成式、推理式任务中的检索增强能力。作者也坦诚提到了当前工作的一个局限:用于微调的通用数据集(LCS-558K)可能无法完全覆盖某些特定领域任务(如时尚检索CIRR、FashionIQ)的细微差异,建议GCL可作为有效的预训练阶段,后续可通过领域特定数据进一步微调以获得最优性能。这为后续研究指明了潜在改进方向。