分享自:

多模态对比学习中应对齐什么?COMM:一种捕获冗余、独特与协同信息的对比多模态学习策略

期刊:ICLR

本文为发表于ICLR 2025的学术会议论文,标题为“What to Align in Multimodal Contrastive Learning?”,由来自EPFL、Neurospin (CEA)、CEDRIC (CNAM)和CHUV放射科的Benoit Dufumier、Javiera Castillo Navarro、Devis Tuia和Jean-Philippe Thiran共同完成。该研究提出了一种名为COMM(Contrastive Multimodal Learning)的新型多模态自监督学习方法,旨在克服现有对比学习方法在多模态学习中仅能捕获冗余信息的局限性,从而学习更全面的模态间交互信息,包括冗余、独特和协同信息。

学术背景 该研究属于机器学习领域下的多模态表示学习分支。人类通过多感官整合来感知世界,融合不同模态的信息以调整行为。受此启发,基于对比学习的对齐方法为多模态自监督学习提供了一个吸引人的解决方案,它通过将每个模态视为同一实体的不同视图,学习在不同模态的特征之间进行对齐。然而,这种方法本质上是有限的,因为它只学习模态之间共享或冗余的信息,而忽略了其他重要的交互形式,例如独特信息和协同信息。因此,现有方法在需要利用模态间互补信息或单一模态独特信息的任务上表现不佳。本研究的核心目标是解决这一问题,提出一种能够学习并整合所有类型模态交互(冗余、独特、协同)的统一框架,从而学习到与任务无关、更具通用性的多模态表示。

研究流程详述 本研究包含理论分析、方法设计、控制实验验证和真实世界数据集评估等多个紧密相连的流程。

  1. 理论分析与方法提出:研究首先基于部分信息分解(PID)理论,对多模态交互进行了量化定义。PID将联合变量(X1, X2)关于任务Y的信息I(X1, X2; Y)分解为四个部分:冗余信息(R)、协同信息(S)以及分别来自模态1和模态2的独特信息(U1, U2)。研究指出,现有的跨模态对比学习方法(如CLIP)因其依赖于“多视图冗余假设”,即假设所有任务相关信息都在模态间共享,本质上只能学习到冗余信息R。为了突破这一限制,作者提出了COMM方法。其核心思想不是去对齐不同模态的单一模态特征,而是学习一个统一的多模态特征表示Z = fθ(X),并通过最大化该多模态特征在不同增强版本之间的互信息来进行对比学习。理论分析证明,通过优化特定的对比目标,可以自然地使模型学习到包含R, S, U1, U2的完整信息。

  2. COMM模型架构与训练

    • 架构:COMM采用模块化架构(如图2所示)。首先,每个模态通过独立的模态特定编码器进行处理。然后,通过一个“潜在转换器”将各模态特征映射为嵌入序列。最后,这些序列被拼接并送入一个Transformer块中进行融合,生成最终的统一多模态嵌入表示Zθ。
    • 训练目标:对于一个多模态输入X = (X1, …, Xn),COMM的训练过程(以双模态为例,见图3)涉及以下几个步骤:
      • 多模态增强:从预设的“标签保持多模态增强”集合T*中采样两种增强变换t’和t”,分别应用于原始输入X,得到两个增强视图X’和X”。
      • 模态掩码:为了学习各模态的独特信息,还创建了掩码版本Xi,即仅保留第i个模态,其他模态用掩码符号替代。
      • 特征提取:将X’, X”, 以及所有Xi输入网络fθ,得到对应的多模态特征Z’, Z”, 和Zi。
      • 损失函数:最终的训练损失L_COMM包含两部分:1) 最大化Z’和Z”之间的互信息(通过InfoNCE估计器),这部分旨在学习I(X, X’) ≈ I(X, Y),从而捕获R+S+U1+U2;2) 对于每个模态i,最大化Zi与Z’以及Zi与Z”之间的互信息,这部分旨在学习I(Xi; Y) = R+Ui。因此,总损失L_COMM = -[Î(Z’, Z”) + Σ_i (Î(Zi, Z’) + Î(Zi, Z”))],通过联合优化这些项,模型能够同时学习冗余、独特和协同信息。
  3. 控制环境实验(双模态Trifeature数据集):为了精确验证COMM捕获不同交互类型的能力,研究构建了一个基于Trifeature数据集的合成双模态实验环境。他们设计了三个明确依赖特定交互类型的任务:

    • 冗余任务:预测两个图像共享的形状(信息冗余于两个模态)。
    • 独特任务:仅从其中一个图像预测其纹理(信息仅存在于单个模态)。
    • 协同任务:判断一对图像是否满足预定义的纹理-颜色映射规则(需要同时结合两个模态的互补信息)。 在此环境中,他们比较了COMM与基线模型(如跨模态对比“Cross”、跨模态+自监督对比“Cross+Self”以及FactorCL)的性能。结果表明(如图4),只有COMM能够同时成功学习所有三种类型的交互,而“Cross”只能学习冗余信息,“Cross+Self”能学习冗余和独特信息但无法捕获协同信息,FactorCL在协同任务上也表现不佳。
  4. 真实世界数据集评估

    • 双模态实验:研究在MultiBench基准测试中的多个真实世界数据集上评估了COMM,这些数据集涵盖不同领域(医疗、机器人、情感计算等)和数据类型(图像、文本、音频、时间序列、表格数据)。任务包括回归(视觉与触觉的末端执行器位置预测)和分类(死亡率预测、情感分析、幽默检测、讽刺检测)。实验分为自监督预训练后线性探测和全模型微调两种设置。如表1所示,在线性探测设置下,COMM在大多数任务上显著优于现有最先进的自监督方法(如FactorCL),特别是在需要复杂交互的任务(如MOSI、UR-Funny、Mustard)上提升明显。在微调设置下,COMM也取得了具有竞争力的最优或接近最优的结果。
    • 多模态IMDb数据集:针对电影类型预测任务(需要结合海报图像和剧情描述的协同信息),COMM同样表现出色(如表2)。在自监督设置下,COMM大幅超越了CLIP、SLIP等方法。在全监督微调设置下,COMM也优于专门设计的融合架构搜索方法(MFAS)和最新的视觉-语言生成模型(如LLaVA-Next),展示了其学习复杂协同交互的强大能力。
    • 三模态实验:为了验证COMM对多于两个模态的扩展性,研究在Vision&Touch(接触预测)和UR-Funny数据集上进行了三模态实验。如表3所示,COMM在三模态设置下性能优于双模态版本,也超越了之前的三模态对比学习方法CMC,证明了其框架处理任意数量模态的通用性。

主要结果 1. 理论验证:通过控制实验(图4),研究直接证实了COMM能够有效捕获PID理论定义的所有三种模态交互(冗余R、独特U、协同S),而现有方法存在明显缺陷。这验证了其理论框架的正确性。 2. 性能优势:在涵盖7个多模态任务的广泛真实世界基准测试中,COMM在绝大多数任务上取得了最先进的性能(表1,表2)。特别是在那些被认为需要大量协同信息的任务(如MOSI情感分析、MM-IMDb类型预测)上,COMM的优势更为显著,说明其确实学到了超越冗余的更深层交互。 3. 方法有效性验证: * 损失函数:消融研究(图5)显示,损失函数中的两个组成部分(L和ΣLi)对于高效学习所有信息类型都至关重要。单独优化ΣLi可以快速学习冗余和独特信息但无法学习协同信息;单独优化L可以学习所有信息但速度缓慢。COMM的联合损失结合了二者的优点。 * 融合模块:比较线性融合与基于注意力的Transformer融合(表4)发现,非线性融合模块对于学习协同交互(如XOR关系)是必需的,线性融合无法捕获协同信息。 * 数据增强:实验表明(表5),对两个模态都施加强数据增强对COMM学习所有交互类型是有益的,这不同于FactorCL需要任务依赖的增强策略,体现了COMM的通用性。

结论与意义 本研究提出了COMM,一种新颖的对比多模态学习方法,它通过在一个统一的多模态表示空间中对齐增强后的多模态特征,突破了传统跨模态对比学习仅关注冗余信息的局限。理论分析表明,该方法能够自然地涌现出对冗余、独特和协同信息的建模能力。大量实验证明,COMM在合成和真实世界的多模态任务上均能有效学习复杂的模态间交互,并取得最先进的性能。

研究的价值: 1. 科学价值:为多模态表示学习提供了新的理论视角和实用框架。它将部分信息分解(PID)理论形式化地引入到对比学习框架中,明确了学习目标,并设计了一个能够实现该目标的简单而有效的算法。这推动了多模态学习从仅关注对齐向全面理解模态间丰富交互关系的范式转变。 2. 应用价值:COMM的通用性使其能够处理任意数量、任意类型的模态数据,并在医疗、机器人、情感计算、多媒体等多个领域展现出优越的迁移性能。其学习到的与任务无关的通用表示,有望在数据稀缺或任务多样的实际应用中发挥重要作用。 3. 启发性:COMM的设计与认知神经科学中的“全局工作空间理论”相呼应,为构建更接近人类多感官整合机制的人工智能模型提供了思路。

研究亮点 1. 核心创新:提出了“对齐什么”这一根本问题的新答案——不是对齐单一模态特征,而是对齐融合后的多模态表示。这是方法上的关键突破。 2. 理论扎实:基于信息论和PID提供了严谨的理论分析,不仅解释了现有方法的局限,也为新方法的设计提供了清晰指导。 3. 验证全面:从完全可控的合成数据到复杂的真实世界基准,从双模态到三模态,从分类到回归任务,进行了系统、严谨、广泛的实验验证,结论令人信服。 4. 通用性强:方法不依赖于特定模态或强假设(如FactorCL所需的完美条件增强),架构灵活,可扩展至多种模态和领域。 5. 性能卓越:在多个具有挑战性的基准测试中大幅提升了性能,特别是在需要协同信息的任务上,证明了其实际有效性。

其他有价值内容 论文还讨论了COMM的局限性(如对多于两个模态的PID理论扩展尚不明确、计算成本稍高、表示的可解释性等)和未来研究方向(如设计更优的多模态增强策略、探索表示的 disentanglement 等)。这些讨论为后续研究指明了潜在的发展路径。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com