分享自:

QVHighlights:通过自然语言查询检测视频中的时刻和精彩片段

期刊:35th Conference on Neural Information Processing Systems (NeurIPS 2021)

本文提出了一种新的视频理解任务数据集与基线模型,旨在同时支持基于自然语言查询的视频时刻检索(moment retrieval)与高亮检测(highlight detection)。该研究由北卡罗来纳大学教堂山分校(University of North Carolina at Chapel Hill)计算机科学系的 Jie Lei、Tamara L. Berg 和 Mohit Bansal 完成,论文发表于 2021 年神经信息处理系统大会(NeurIPS 2021)。

在视频理解领域,基于自然语言的视频检索通常返回整个视频,但用户往往只关心其中少数几个关键片段。此前已有多个数据集支持时刻检索,例如 DiDeMo、Charades-STA 和 TVR,但这些数据集通常只为一个查询标注单一的连续时刻,且很多时刻在视频中出现的位置存在明显的时间偏差,即更多出现在视频开头。对于高亮检测,大多数已有数据集与用户查询无关,无法根据不同查询提供定制化的高亮结果。尽管 ClickThrough 和 ActivityThumbnails 提供了基于查询的高亮标注,但它们的标注非常稀疏,例如只标注少量关键帧或短片段,难以用于训练和评估高精度模型。此外,时刻检索和高亮检测虽然在语义上高度相关,但由于缺少同时支持这两类任务的数据集,以往通常被分开研究。针对这些问题,作者构建了 QVHighlights 数据集,并提出了一种名为 Moment-DETR 的端到端 Transformer 基线模型。

QVHighlights 数据集包含超过 10,000 个 YouTube 视频,涵盖日常生活视频、旅行视频和新闻视频三大类。每个视频都配有一个人工书写的自由形式自然语言查询,并且在视频中标注了与查询相关的一个或多个不连续时刻。与以往数据集中单个时刻的限制不同,QVHighlights 平均每个查询对应 1.8 个时刻,这更符合真实场景中相关内容可能被无关内容分隔的情况。除了时刻标注外,该数据集还提供了每个相关 2 秒片段的五级李克特量表(Likert scale)显著性评分,评分来自 3 位不同标注者,用于支持基于查询的高亮检测任务。数据收集通过 Amazon Mechanical Turk 完成,先让标注者观看视频并书写查询,再从 2 秒片段网格中选择相关片段,最后对相关片段进行显著性评分。质量控制方面,作者设置了资格测试,只有回答全部正确的人才能参与标注。总计生成了 10,310 条查询和 18,367 个时刻,视频总数为 10,148 个。通过对时刻长度和位置分布的分析,发现该数据集的时刻分布几乎均匀地分布在视频中,比以往数据集更少受到时间偏差的影响。统计显示,约 38% 的时刻长度不超过 10 秒,而约 23% 的时刻长度超过 30 秒。此外,在显著性评分中,94.41% 的已标注片段被至少两位用户评为“fair”或更好。

在方法部分,作者提出了 Moment-DETR。该模型借鉴了目标检测中的 DETR 架构,将时刻检索视为直接集合预测问题,去除了传统方法中常见的手工设计组件,例如候选生成和非极大值抑制。Moment-DETR 的输入由视频特征和查询文本特征拼接而成。视频特征使用 SlowFast 和 CLIP 的视频编码器每 2 秒提取一次,并将两者归一化后拼接,形成维度为 2816 的表示;查询文本使用 CLIP 文本编码器提取 token 级特征。随后,使用两个独立的 2 层感知机将视频和查询特征投影到共享嵌入空间,并沿长度维度拼接输入 Transformer 编码器。编码器由多个带有多头自注意力和前馈网络的层堆叠而成,解码器接收一组可训练的 moment queries(时刻查询嵌入),通过自注意力和交叉注意力与编码器输出交互。模型的预测头包括三个部分:基于编码器输出预测每个视频片段的显著性分数,基于解码器输出预测标准化时刻中心坐标和宽度,以及预测每个预测时刻的前景或背景类别。训练时,使用匈牙利算法对预测时刻和真实时刻进行二分匹配,匹配代价包括类别概率和时刻坐标的 L1 与广义 IoU 损失。显著性损失使用 hinge loss,在真实时刻内区分高分和低分片段,并区分真实时刻内和真实时刻外的片段。整体损失由显著性损失、分类损失和时刻定位损失加权组成。由于模型没有引入人类先验,作者还利用自动语音识别(ASR)字幕进行弱监督预训练,以弥补人工标注数据不足的问题。具体做法是使用 YouTube 的 ASR 字幕作为查询,以其对应的时间戳作为弱监督信号,共获得约 236,000 个字幕-时间戳对用于预训练,模型结构和损失函数与标准训练相同,只是去掉了显著性损失中的第一项。

实验部分将 QVHighlights 划分为 70% 训练、15% 验证和 15% 测试。时刻检索使用平均精度均值(mAP)在 IoU 阈值 0.5、0.75 以及 0.5 到 0.95 的平均值进行评估,同时报告 Recall@1 指标。高亮检测使用 mAP 和 hit@1 进行评估,其中将评分为“very good”的片段视为正样本。实验结果显示,Moment-DETR 在未使用预训练时,在 R1@0.5 和 mAP@0.5 上显著优于 XML+ 等基线,但在较高 IoU 阈值(如 R1@0.7 和 mAP@0.75)上低于 XML+。加入 ASR 弱监督预训练后,Moment-DETR 在所有主要指标上均大幅超过基线,其中 R1@0.5 为 59.78%,R1@0.7 为 40.33%,mAP avg 为 36.14%,高亮检测 mAP 为 37.43%,hit@1 为 60.17%。损失消融实验表明,显著性损失不仅对高亮检测有重要影响,还显著改善了时刻检索性能,说明联合学习显著性有助于时刻定位。对 10 个 moment query 的可视化显示,不同 query 槽位学会了预测不同位置和宽度的时刻,例如有的槽位偏向视频开头的短时刻,有的偏向视频末尾的短时刻,少数槽位擅长预测长时刻。在预训练数据域和规模的消融中,使用 5.4k 个 QVHighlights 域内视频进行预训练明显优于使用 10k 个 HowTo100M 域外视频,表明预训练与下游任务域的一致性非常重要。在 Charades-STA 数据集上的泛化实验也验证了 Moment-DETR 在不同数据上的适应能力,使用 HowTo100M 预训练后,R1@0.5 达到 55.65%,R1@0.7 达到 34.17%,均优于已有方法。

该研究的主要贡献包括三个方面:第一,构建了 QVHighlights 数据集,支持同时训练和评估基于查询的时刻检索与高亮检测任务,并且包含多时刻标注和逐片段显著性评分。第二,提出了 Moment-DETR 模型,不依赖手工设计的预处理或后处理步骤,通过 Transformer 直接预测时刻坐标和显著性分数,并在弱监督预训练后大幅超越多个基线方法。第三,提供了详细的数据分析、模型消融和可视化结果,帮助理解该方法的内部工作机制,为后续研究提供了有价值的参考。

从应用角度看,该数据集和模型为视频平台中基于自然语言的精确内容定位与个性化高亮推荐提供了可能方向。用户可以输入自由形式查询,系统即能够返回视频中的相关片段并标注高亮程度,从而改善视频浏览和搜索体验。此外,由于 Moment-DETR 的端到端设计和弱监督预训练策略,这一框架也有潜力迁移到其他多模态视频理解任务中,例如视频问答和视频摘要。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com