分享自:

UniMF:面向模态缺失与未对齐多模态序列的统一多模态情感分析框架

期刊:ieee transactions on multimediaDOI:10.1109/tmm.2023.3338769

本文是发表于 *IEEE Transactions on Multimedia*(2024年第26卷)的一项原创性研究,题为《UniMF: A Unified Multimodal Framework for Multimodal Sentiment Analysis in Missing Modalities and Unaligned Multimodal Sequences》。该研究由浙江工业大学计算机科学与技术学院的 Ruohong Huan、Guowei Zhong、Peng Chen 以及 Ronghua Liang 完成,于2023年12月4日在线发表。研究提出了一种统一的多模态框架 UniMF,旨在同时解决多模态情感分析(Multimodal Sentiment Analysis, MSA)中模态缺失(missing modalities)与多模态序列不对齐(unaligned multimodal sequences)两大挑战。

在学术背景方面,多模态情感分析长期以来依赖完整且对齐的多模态输入。然而,现实场景中获取完整数据往往十分困难,且对多模态序列进行词级对齐需要高昂成本并可能损失非语言模态信息。已有方法通常只能单独处理模态缺失或序列不对齐,少数能同时处理二者的方法又普遍存在多阶段训练、需要额外数据或网络结构冗余等问题。为此,作者提出了一种轻量且高效的统一框架 UniMF,以期在较少可学习参数的前提下获得具有竞争力或最优(State-of-the-Art, SOTA)的性能。

UniMF 的整体工作流程包含两个核心模块:翻译模块(translation module)和预测模块(prediction module)。翻译模块的核心是多模态生成Transformer(Multimodal Generation Transformer, MGT),其基础是一种作者新提出的注意力机制——多模态生成掩码(Multimodal Generation Mask, MGM)。MGM 通过引入特殊 token [multi],将传统神经机器翻译中的编码器-解码器(encoder-decoder)结构整合为单一注意力机制。具体而言,在输入语言和音频模态而视频模态缺失的情况下,语言序列、音频序列与[multi] token 构成编码部分,其中语言与音频可进行自注意力并将信息汇聚至[multi] token;而待生成的视频序列与[multi] token 构成解码部分,视频序列中的每个 token 只能关注自身及其左侧 token,以自回归方式生成缺失模态。为了区分不同翻译方向,作者针对不同模态缺失组合设计了多种 mask_g 矩阵。MGT 由多层 MGM 注意力与前馈网络堆叠而成,并加入层归一化。在训练阶段,对生成目标使用均方误差损失进行教师强制(teacher forcing)训练,在推理阶段则从[multi] token 开始逐 token 生成缺失模态。当两种模态同时缺失时,UniMF 采用两个独立的 MGT 进行一对一的翻译,而非在一个 Transformer 中同时生成两种模态。预测模块的核心是多模态理解Transformer(Multimodal Understanding Transformer, MUT),基于作者新提出的多模态理解掩码(Multimodal Understanding Mask, MUM)注意力机制。此模块引入另一特殊序列——多模态序列(MultimodalSequence, MMSeq),其长度可随机初始化,并通过 MUM 与语言、音频、视频三个单模态序列进行信息交换。具体而言,MMSeq 接收来自所有单模态的信息,而语言、音频、视频则在完成自注意力的基础上接收来自 MMSeq 的信息。这种设计避免了全注意力机制中的冗余跨模态注意力,使模态内与模态间的信息交互更加高效。在预测模块前向传播中,输入模态首先经过一维时间卷积映射至统一维度,并使用门控循环单元(GRU)进行初步序列建模,随后加入位置编码和模态类型编码。MUT 的最终输出中,MMSeq 对应的表示被送入全连接层得到情感预测结果,训练时使用 L1 损失。最终,UniMF 的总损失为翻译模块损失与预测模块损失之和。

在实验部分,作者在四个数据集上进行了广泛验证,分别是 CMU-MOSI、CMU-MOSEI、MELD 和 UR-FUNNY。模态特征方面,语言模态使用预训练 GloVe 模型提取 300 维词向量,部分实验替换为 BERT 词向量;音频模态使用 COVAREP 或 openSMILE 提取;视频模态使用 Facet 或 OpenFace 提取。超参数通过 Optuna 的树结构 Parzen 估计器进行搜索,并采用学习率平台衰减策略。在仅处理模态缺失的实验中,UniMF 在 CMU-MOSI 的大部分输入模式上优于现有 SOTA 方法 CTFN,仅在仅音频输入和音频加视频输入时略低,但平均参数量仅为 148k。在 MELD 数据集的 sentiment 子集上,UniMF 在仅语言和仅音频输入时分别比 MELD 基线和 GME-LSTM(A) 高 0.77% 和 0.35%,在 emotion 子集上也表现出有竞争力的性能。在 CMU-MOSEI 数据集上,除语言加音频输入模式外,UniMF 均取得 SOTA,且参数量比 MMIN 平均低约 91.6%。在 UR-FUNNY 数据集上,除音频加视频输入模式外,UniMF 同样取得 SOTA。针对未对齐多模态序列的实验主要在 CMU-MOSI 和 CMU-MOSEI 的未对齐版本上进行。在 GloVe 设置下,UniMF 在 CMU-MOSI 上的准确率和 F1 分数分别比 SPT 提高 1.88% 和 1.84%,在 CMU-MOSEI 上的准确率比 SPT 高 0.1%,且参数量减少约 47.4%。在同时处理模态缺失与未对齐序列的实验中,UniMF 在 CMU-MOSI 上除仅音频输入外均表现优异,且参数量比 MMIN 低约 90.5%;在 CMU-MOSEI 上则在所有模态缺失模式下均取得最佳平均性能。消融实验进一步证实了 MGT、MUT、[multi] token、MMSeq 以及位置编码和模态编码的重要性:将 MGT 替换为传统神经机器翻译 Transformer 会导致约 1%~2% 的性能下降;将 MUT 替换为全注意力 Transformer 会导致约 2%~5% 的性能下降;移除 [multi] token 或 MMSeq 也均造成一致的性能损失。在 BERT 与 GloVe 的对比实验中,UniMF 在 CMU-MOSI 和 CMU-MOSEI 上均超越了基于 BERT 的 SOTA 方法,在 UR-FUNNY 上也接近或超过 SOTA,并保持较低参数量。作者还通过 t-SNE 可视化展示了 UniMF 在缺失模态情况下联合表示分布的不变性优于 TFR-Net 和 EMT-DLFR。此外,在模态插补性能上,UniMF 的 MGT 在所有缺失模式下均获得比 TFR-Net 和 EMT-DLFR 更低的均方误差和平均绝对误差。

本研究的结论是,UniMF 能够通过翻译模块与预测模块的有效协作,在参数规模较小的前提下同时应对模态缺失和序列不对齐两大问题。其科学价值在于提出了 MGM 和 MUM 两种新的注意力机制,将编码器-解码器结构统一到单一 Transformer 中,并通过 MMSeq 实现更优的多模态融合,推动了多模态情感分析模型轻量化和鲁棒性的发展。应用价值方面,该框架为现实场景中多模态数据不完整或时间不同步的情感识别提供了可行的端到端解决方案,在人机交互、社交媒体分析等领域具有广泛前景。研究的亮点包括:提出统一且轻量的框架,显著降低参数量;新设计的 MGM 和 MUM 注意力机制有效提升信息交互效率;引入 [multi] token 和 MMSeq 作为跨模态信息汇聚与统一表示的关键载体;在多个数据集上获得具有竞争力或 SOTA 的结果。未来工作将聚焦于序列压缩、利用注意力矩阵稀疏性优化 CUDA 核以及探索更好的特殊 token 与 MMSeq 初始化方法。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com