本文提出了一种面向查询的视听认知网络(query-centric audio-visual cognition network,QUAG),用于层次化视频时刻检索、步骤分割与步骤描述任务。该研究由Yunbin Tu、Liang Li、Li Su和Qingming Huang等人共同完成,作者分别来自中国科学院大学计算机科学与技术学院、中国科学院计算技术研究所人工智能安全重点实验室以及鹏城实验室。论文发表于2025年的AAAI(Association for the Advancement of Artificial Intelligence)会议。
该研究聚焦于一个新兴的多模态任务HiREST(hierarchical retrieval and step-captioning),该任务整合了视频检索、时刻检索(moment retrieval)、时刻分割(moment segmentation)和步骤描述(step-captioning)四个子任务。在视频理解领域,用户不仅希望根据文本查询找到完整视频,更希望直接定位到与查询最相关的视频片段,并进一步将该片段细分为更细粒度的步骤,再为每个步骤生成简洁的描述语句。HiREST任务的提出正是为了应对这种层次化需求。此前的开创性工作使用预训练的CLIP模型进行视频检索,并将其作为特征提取器,通过多任务学习范式解决其余三个子任务。然而,该工作忽略了多模态之间存在的层次关系和关联关系,未能充分学习用户偏好内容的综合认知。针对这一问题,本文基于“由浅入深”的认知原则,提出QUAG网络,旨在构建可靠的多模态表示,以便更好地完成时刻检索、分割和步骤描述。
QUAG由两个核心模块组成:模态协同感知(modality-synergistic perception,MSP)和查询中心认知(query-centric cognition,QC²)。在模型整体流程中,首先利用预训练模型分别提取视觉帧、音频和查询文本的表示。视觉表示和文本表示分别由EVA-CLIP的视觉编码器和文本编码器提取,音频表示则先通过Whisper提取语音转写,再由MiniLM文本编码器映射为向量表示。三种模态表示经过线性投影进入同一嵌入空间。随后,MSP模块对视觉和音频表示进行全局对比对齐,通过InfoNCE损失最大化正样本对之间的双向相似度,使视觉和音频模态在嵌入空间中保持一致。在此基础上,MSP进一步利用多头交叉注意力机制对视觉和音频表示进行局部细粒度交互,挖掘它们之间的协同表示,并将两个方向的联合表示拼接后经过全连接层融合为视听表示。在得到浅层视听表示后,QC²模块利用深层查询表示对该视听表示执行时间-通道过滤。具体来说,QC²先计算查询与视听表示之间的时间相关矩阵和通道相关矩阵,再通过逐元素乘法将二者融合为时间-通道相关矩阵,并用该矩阵对视听表示进行过滤,以突出用户查询所关注的内容。之后,查询表示经过多头自注意力机制处理后注入过滤后的视听表示,形成查询中心的视听表示。该表示随后送入基于Transformer的多模态编码器进行增强,并分别用于时刻检索、时刻分割和步骤描述三个任务。时刻检索通过两个线性层预测起始和结束帧的概率分布;时刻分割以自回归方式逐步预测步骤边界,并将已预测边界作为后续输入的一部分;步骤描述则利用预训练的CLIP4Caption模型初始化的文本解码器,以自回归方式生成每个步骤的描述语句。模型在训练时采用轮询方式从三个任务的数据加载器中采样一个批次,并结合全局对比对齐损失进行多任务训练。
实验部分在HiREST数据集上对QUAG进行了全面评估。在时刻检索任务中,QUAG在Recall@IoU 0.5和0.7两项指标上分别达到72.54%和38.86%,优于对比方法中的联合模型、QD-DETR、TR-DETR和UVCOM。在时刻分割任务中,QUAG在Recall@IoU 0.5和0.7以及Precision@IoU 0.5和0.7上均取得最佳结果,分别为39.27%、17.35%、31.68%和14.81%,表明该方法在步骤边界预测方面具有较高的准确性和召回能力。在步骤描述任务中,QUAG在METEOR、ROUGE-L、CIDEr、SPICE和蕴含得分上分别达到4.76、13.20、25.44、4.49和40.10%,相比联合模型均有明显提升。此外,QUAG还在TVSum数据集上进行了基于查询的视频摘要任务测试,以验证模型的泛化能力。在TVSum上,QUAG的平均Top-5 mAP达到87.0%,与对比方法中的最优结果基本持平,且在部分视频类别上取得了最佳成绩。为了进一步分析各模块的贡献,作者在步骤描述任务上进行了消融实验。结果表明,单独使用MSP或QC²模块均能带来一定提升,但将两者结合使用时性能提升最为显著,CIDEr和SPICE指标相比联合模型分别提高了20.1%和48.7%。这表明两个模块之间存在互补作用,共同建模模态间的层次关系和关联关系有助于学习更有效的用户偏好内容表示。作者还对MSP中全局对比损失项的权衡参数λ进行了敏感性分析,结果显示模型对λ取值不敏感,且加入对比损失后整体性能优于不加入该损失的情况。定性分析中,作者展示了QUAG与联合模型在时刻检索、分割和步骤描述上的可视化对比案例,结果表明QUAG检索到的时刻包含更少的无关细节,步骤边界预测更准确,生成的步骤描述与真实标注在语义上更加一致。同时作者也报告了一个失败案例,指出当视频中教师持续出现时,模型可能误判教学内容尚未结束,导致检索到的时刻包含较多无用内容,且对“辣椒粉”“辣酱”等细粒度物体的描述能力不足。作者提出未来可以通过引入更细粒度的视觉特征(如分割特征)来改善这一问题。
本研究的核心贡献在于:第一,从人类由浅入深的感知与认知机制出发,提出了查询中心视听认知网络,通过构建查询中心视听表示来联合解决HiREST中的三个挑战性任务;第二,在QUAG中设计了MSP模块,通过全局对比对齐和局部细粒度交互来获得更有效的视听表示;第三,设计了QC²模块,通过深层查询对浅层视听表示进行时间-通道过滤,使模型能够重点关注用户请求的内容。实验结果表明,QUAG在HiREST数据集上取得了当时最优的结果,并在TVSum上验证了良好的泛化性能。该研究为层次化视频理解任务提供了一种新的建模思路,即通过显式建模模态间层次关系和关联关系来学习更符合用户意图的多模态表示。在实际应用中,该模型可服务于教学视频的细粒度内容定位与自动解说、视频摘要生成以及基于查询的视频内容检索等场景,具有较好的实用价值。