分享自:

从因果推断视角学习不变模态表示以实现鲁棒多模态学习

期刊:Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)

本文提出了一种用于鲁棒多模态学习的因果模态不变表征(Causal Modality-Invariant Representation, CMIR)学习框架。论文发表于第64届计算语言学协会年会论文集(长期论文卷),页码为45698–45721,会议时间为2026年7月2日至7日。论文作者为Sijie Mai(通讯作者)和Shiqin Han,均来自华南师范大学计算机学院。研究得到了广东省哲学社会科学规划项目(编号GD26YJY34)的支持。

多模态情感计算(Multimodal Affective Computing, MAC)旨在利用语言、声学和视觉模态来预测人类的情感、情绪、意图和观点。近年来,该领域在人机交互、客户服务自动化和情感计算系统中取得了显著进展。然而,现有模型往往从训练数据中学习到虚假的跨模态相关性(spurious cross-modal correlations)而非真正的因果关系,这严重损害了模型在分布偏移(distribution shift)或噪声模态条件下的泛化能力。例如,模型可能过度依赖说话者在训练数据中持续出现的微笑这一虚假视觉特征,而非关注语义内容和真实的情感表达,导致在测试不同说话者时性能下降。尽管已有一些方法通过领域适应或解耦策略来尝试解决这一问题,但它们缺乏因果解释,无法保证解耦特征与因果成分和虚假成分对齐。近年来的因果推断方法虽然能够识别和消除虚假相关性,但往往缺乏严格的理论分析,或仅针对特定偏置类型,依赖于先验知识或假设,难以泛化到未见环境中。针对这些问题,本文提出了CMIR框架,从因果推断的视角出发,在理论上基于因果推断和信息论,将每种模态分解为两个互补成分:因果不变表征((z^{inv}_m))和环境特异的虚假表征((z^{spu}_m))。核心思想是:尽管原始特征的分布可能因环境而异,但不变特征与预测目标之间的因果机制保持稳定。

论文首先建立了因果模态不变表征的理论基础。作者提出了三个定理。定理1定义了因果不变模态表征,指出如果存在函数类(\phi_m: x_m \rightarrow z^{inv}_m)和分布距离度量(d),使得最小化跨环境的条件分布(p(y|\phi_m(x_m), e))的最大差异问题有解,则该解即为因果不变表征,满足跨环境的条件分布不变性。定理2从理论上保证了通过编码器(g_m)和解码器(r_m)优化联合目标可以提取解耦表征,其中预测损失、不变性约束、互信息最小化约束和重构约束分别强制不变表征的预测一致性、环境独立性、与虚假表征的统计独立性以及信息完备性。定理3证明了在不变性条件、信息充分性和损失函数正则性假设下,基于不变表征的预测器在分布偏移下的最坏情况风险严格低于使用原始特征的预测器,这是因为虚假特征在新环境中可能任意变化,而因果机制保持不变。

在算法实现层面,CMIR的整体框架包括单模态网络提取原始单模态特征(x_m)、编码器(g_m)、解码器(rm)和预测头(h)。预测损失(L{pred})通过编码器将输入映射为不变表征(z^{inv}_m)和虚假表征(z^{spu}m),再融合所有模态的不变表征进行标签预测,分类任务使用交叉熵损失,回归任务使用均方误差或平均绝对误差。不变性约束(r^{(m)}{inv})通过模拟虚拟环境实现:为每个样本分配随机环境标签(e \in {1,2,…,k}),注入不同强度的加性噪声(\epsilon^{(e)}_m = \alpha^{(e)} \cdot \epsilon_m),其中(\alpha^{(e)})是环境依赖的噪声系数,(\sigmam)是模态特异的协方差矩阵。扰动后的特征输入编码器得到各环境下的不变表征,不变性约束通过最小化不同环境间表征的L1距离(\sum{e_1 \neq e_2} |z^{inv,(e_1)}_m - z^{inv,(e_2)}_m|1)实现。互信息约束(r^{(m)}{dec})采用特征正交性作为互信息最小化的近似:计算不变表征和虚假表征的归一化相关矩阵(c_m = \text{nor}(z^{inv}_m)\text{nor}(z^{spu}_m)^\top),然后通过(| \text{diag}(c_m) + \alpha \cdot (c_m - \text{diag}(c_m)) |F^2)强制正交。重构约束(r^{(m)}{rec})通过解码器从解耦表征对重构原始输入,使用均方误差(|x_m - \hat{x}_m|2^2)确保信息无损失。总损失函数(L = L{pred} + \sum_{m}(\lambda1 r^{(m)}{inv} + \lambda2 r^{(m)}{dec} + \lambda3 r^{(m)}{rec}))通过三个超参数(\lambda_1, \lambda_2, \lambda_3)平衡约束强度。

在实验评估中,研究者将CMIR应用于多模态情感分析(MSA)、多模态幽默检测(MHD)和多模态讽刺检测(MSD)任务,使用CMU-MOSI、CMU-MOSEI、CH-SIMS-v2、UR-FUNNY和MUSTARD数据集。在CMU-MOSI上,CMIR在ACC7上超过强基线ITHP超过2个点,在ACC2上超过1个点。在CMU-MOSEI上,CMIR在ACC2、F1、MAE和ACC7上均达到最佳。在CH-SIMS-v2上,CMIR在所有指标上均优于基线,ACC5提升2.5个点。在UR-FUNNY和MUSTARD上,CMIR分别超过最强基线超过4个点和2个点。在分布外(OOD)场景下,CMIR相对于ITHP的优势进一步扩大:ACC2提升从1.5个点增加到3.5个点,ACC7提升从2.1个点增加到7.2个点,并一致优于CLUE、GEAR、MULDEF等因果方法。噪声模态讨论中,CMIR在不同高斯噪声率(10%至70%)下均表现最优,尤其在MAE上优势显著,平均ACC2达87.0%,MAE为0.666。在面对训练时未见过的混合噪声(拉普拉斯噪声和随机擦除噪声)时,CMIR同样表现出色,平均ACC2为86.7%,MAE为0.685。消融实验表明,去除因果推断(使用原始特征)、不变性约束、互信息约束或重构约束均导致性能下降,其中去除不变性约束和互信息约束的下降最为明显。超参数鲁棒性分析显示,当权重较小或过大时性能变化有限,环境数量(k)的变化对性能影响较小,ACC2始终保持在81%以上。t-SNE可视化表明,CMIR学习到的因果表征在特征空间中类别分离清晰,中性样本位于正负样本之间,而常规表征则重叠明显。

本文的结论是:CMIR通过将每种模态解耦为因果不变成分和虚假成分,能够学习稳定且因果感知的表征,在多个任务上取得最先进性能,在分布偏移和噪声模态条件下表现优异。研究的亮点在于:首次在MAC中系统地将每种模态解耦为因果和虚假成分,提出了联合不变性约束、互信息最小化和重构约束的统一框架,并在理论上严格证明了不变表征的存在性、可提取性和分布鲁棒风险优势。此外,方法不依赖特定偏置假设,具有广泛的适用性。研究团队也指出了局限性:环境模拟通过特征扰动可能无法完全捕捉真实世界分布偏移的复杂性,互信息最小化采用特征正交性近似而非精确估计,未来工作可探索更精确的互信息估计技术。

总体而言,本文从因果推断视角出发,为多模态情感计算中的鲁棒表示学习提供了坚实的理论支撑和有效的算法实现,不仅推动了多模态学习中因果表征学习的理论发展,也为实际部署中应对环境变化和噪声干扰提供了有价值的解决方案。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com