本文为发表于ICLR 2025的学术会议论文,标题为“What to Align in Multimodal Contrastive Learning?”,由来自EPFL、Neurospin (CEA)、CEDRIC (CNAM)和CHUV放射科的Benoit Dufumier、Javiera Castillo Navarro、Devis Tuia和Jean-Philippe Thiran共同完成。该研究提出了一种名为COMM(Contrastive Multimodal Learning)的新型多模态自监督学习方法,旨在克服现有对比学习方法在多模态学习中仅能捕获冗余信息的局限性,从而学习更全面的模态间交互信息,包括冗余、独特和协同信息。
学术背景 该研究属于机器学习领域下的多模态表示学习分支。人类通过多感官整合来感知世界,融合不同模态的信息以调整行为。受此启发,基于对比学习的对齐方法为多模态自监督学习提供了一个吸引人的解决方案,它通过将每个模态视为同一实体的不同视图,学习在不同模态的特征之间进行对齐。然而,这种方法本质上是有限的,因为它只学习模态之间共享或冗余的信息,而忽略了其他重要的交互形式,例如独特信息和协同信息。因此,现有方法在需要利用模态间互补信息或单一模态独特信息的任务上表现不佳。本研究的核心目标是解决这一问题,提出一种能够学习并整合所有类型模态交互(冗余、独特、协同)的统一框架,从而学习到与任务无关、更具通用性的多模态表示。
研究流程详述 本研究包含理论分析、方法设计、控制实验验证和真实世界数据集评估等多个紧密相连的流程。
理论分析与方法提出:研究首先基于部分信息分解(PID)理论,对多模态交互进行了量化定义。PID将联合变量(X1, X2)关于任务Y的信息I(X1, X2; Y)分解为四个部分:冗余信息(R)、协同信息(S)以及分别来自模态1和模态2的独特信息(U1, U2)。研究指出,现有的跨模态对比学习方法(如CLIP)因其依赖于“多视图冗余假设”,即假设所有任务相关信息都在模态间共享,本质上只能学习到冗余信息R。为了突破这一限制,作者提出了COMM方法。其核心思想不是去对齐不同模态的单一模态特征,而是学习一个统一的多模态特征表示Z = fθ(X),并通过最大化该多模态特征在不同增强版本之间的互信息来进行对比学习。理论分析证明,通过优化特定的对比目标,可以自然地使模型学习到包含R, S, U1, U2的完整信息。
COMM模型架构与训练:
控制环境实验(双模态Trifeature数据集):为了精确验证COMM捕获不同交互类型的能力,研究构建了一个基于Trifeature数据集的合成双模态实验环境。他们设计了三个明确依赖特定交互类型的任务:
真实世界数据集评估:
主要结果 1. 理论验证:通过控制实验(图4),研究直接证实了COMM能够有效捕获PID理论定义的所有三种模态交互(冗余R、独特U、协同S),而现有方法存在明显缺陷。这验证了其理论框架的正确性。 2. 性能优势:在涵盖7个多模态任务的广泛真实世界基准测试中,COMM在绝大多数任务上取得了最先进的性能(表1,表2)。特别是在那些被认为需要大量协同信息的任务(如MOSI情感分析、MM-IMDb类型预测)上,COMM的优势更为显著,说明其确实学到了超越冗余的更深层交互。 3. 方法有效性验证: * 损失函数:消融研究(图5)显示,损失函数中的两个组成部分(L和ΣLi)对于高效学习所有信息类型都至关重要。单独优化ΣLi可以快速学习冗余和独特信息但无法学习协同信息;单独优化L可以学习所有信息但速度缓慢。COMM的联合损失结合了二者的优点。 * 融合模块:比较线性融合与基于注意力的Transformer融合(表4)发现,非线性融合模块对于学习协同交互(如XOR关系)是必需的,线性融合无法捕获协同信息。 * 数据增强:实验表明(表5),对两个模态都施加强数据增强对COMM学习所有交互类型是有益的,这不同于FactorCL需要任务依赖的增强策略,体现了COMM的通用性。
结论与意义 本研究提出了COMM,一种新颖的对比多模态学习方法,它通过在一个统一的多模态表示空间中对齐增强后的多模态特征,突破了传统跨模态对比学习仅关注冗余信息的局限。理论分析表明,该方法能够自然地涌现出对冗余、独特和协同信息的建模能力。大量实验证明,COMM在合成和真实世界的多模态任务上均能有效学习复杂的模态间交互,并取得最先进的性能。
研究的价值: 1. 科学价值:为多模态表示学习提供了新的理论视角和实用框架。它将部分信息分解(PID)理论形式化地引入到对比学习框架中,明确了学习目标,并设计了一个能够实现该目标的简单而有效的算法。这推动了多模态学习从仅关注对齐向全面理解模态间丰富交互关系的范式转变。 2. 应用价值:COMM的通用性使其能够处理任意数量、任意类型的模态数据,并在医疗、机器人、情感计算、多媒体等多个领域展现出优越的迁移性能。其学习到的与任务无关的通用表示,有望在数据稀缺或任务多样的实际应用中发挥重要作用。 3. 启发性:COMM的设计与认知神经科学中的“全局工作空间理论”相呼应,为构建更接近人类多感官整合机制的人工智能模型提供了思路。
研究亮点 1. 核心创新:提出了“对齐什么”这一根本问题的新答案——不是对齐单一模态特征,而是对齐融合后的多模态表示。这是方法上的关键突破。 2. 理论扎实:基于信息论和PID提供了严谨的理论分析,不仅解释了现有方法的局限,也为新方法的设计提供了清晰指导。 3. 验证全面:从完全可控的合成数据到复杂的真实世界基准,从双模态到三模态,从分类到回归任务,进行了系统、严谨、广泛的实验验证,结论令人信服。 4. 通用性强:方法不依赖于特定模态或强假设(如FactorCL所需的完美条件增强),架构灵活,可扩展至多种模态和领域。 5. 性能卓越:在多个具有挑战性的基准测试中大幅提升了性能,特别是在需要协同信息的任务上,证明了其实际有效性。
其他有价值内容 论文还讨论了COMM的局限性(如对多于两个模态的PID理论扩展尚不明确、计算成本稍高、表示的可解释性等)和未来研究方向(如设计更优的多模态增强策略、探索表示的 disentanglement 等)。这些讨论为后续研究指明了潜在的发展路径。