本研究由来自清华大学计算机科学与技术系及北京信息科学与技术国家研究中心(BNRIST)的 Houlun Chen、Xin Wang、Hong Chen、Zeyang Zhang、Wei Feng、Bin Huang、Jia Jia 和 Wenwu Zhu 等研究者完成。该论文发表于第38届神经信息处理系统大会(NeurIPS 2024)的数据集与基准(Datasets and Benchmarks)轨道。
本研究属于视频理解与跨模态检索领域,聚焦于视频语料库时刻检索(Video Corpus Moment Retrieval, VCMR)任务。VCMR 旨在根据文本查询从大规模未裁剪视频语料库中检索出最匹配的视频时刻。该任务包含两个子任务:视频检索(Video Retrieval, VR)和单视频时刻检索(Single Video Moment Retrieval, SVMR)。现有 VCMR 基准的查询文本较为粗粒度,难以在语义相似的候选时刻中区分目标时刻与部分匹配的干扰项,导致模型难以学习具有判别力的视频特征。针对这一局限,研究者提出了更具挑战性的细粒度 VCMR 场景,要求模型根据细粒度查询从语料库中定位最佳匹配时刻,并能够从部分匹配的候选项中区辨出来。构建此类细粒度视频文本数据集通常依赖大量人工标注,效率低且可扩展性受限,因此研究者提出利用大语言模型(Large Language Model, LLM)和大规模多模态模型(Large Multimodal Model, LMM)进行自动标注。
研究的主要目标是设计一个自动化的细粒度视频文本标注流水线,以高效生成包含可靠静态与动态细节的高质量标注数据,并在此基础上构建细粒度 VCMR 基准,评估现有先进模型在细粒度场景下的表现,从而揭示当前方法在细粒度视频理解方面的不足。
论文提出了名为 VERIFIED 的自动视频文本标注流水线。该流水线包含两个独立的增强标注模块和一个噪声评估模块。在静态增强标注模块中,系统首先利用 PySceneDetect 对目标视频时刻进行自适应镜头分割,并选取每个片段中间帧作为关键帧。对于 DiDeMo-FIG 和 Charades-FIG,每个时刻最多选取 1 个关键帧;对于 ActivityNet-FIG,最多选取 5 个关键帧。随后,使用图像 LMM(LLaVA-1.6-Mistral-7B)以原始粗粒度字幕为引导,对每个关键帧分别描述前景与背景的细粒度属性,最终生成完整细粒度描述。接着,使用 LLM(Mistral-7B-Instruct-v0.2)提取关键静态属性,并改写生成 ns=3 条多样化的静态增强字幕候选。
在动态增强标注模块中,研究者观察到现有视频字幕模型难以充分提取动态信息,因此引入了视频问答(Video Question Answering, VQA)引导的方法。首先由 LLM 根据原始粗粒度字幕生成 nqa=5 个面向动态变化的问题,然后将视频帧与这些问题输入视频 LMM(Gemini-1.5-Pro)。对于 DiDeMo-FIG 和 Charades-FIG,视频帧以 8fps 提取;对于 ActivityNet-FIG,均匀采样 64 帧。视频 LMM 依次回答这些问题,并生成整体动态描述。最后,由 LLM 提取关键动态信息并改写生成 nd=3 条动态增强字幕候选。
针对 LLM 与 LMM 可能产生的幻觉问题,研究者设计了细粒度感知噪声评估器(Fine-granularity Aware Noise Evaluator)。具体流程是:对于每条原始粗粒度字幕 q,使用 LLM 生成 npos=3 条语义不变的正面改写字幕、nneg=3 条静态属性显著改变的负面干扰字幕,以及 nneg=3 条动态内容显著改变的负面干扰字幕。由于 LLM 生成的干扰字幕有时可能与原始字幕语义相近,研究者使用 Sentence-BERT 计算语义距离,选择语义最接近的正面字幕和语义差异最大的静态与动态负面干扰字幕。利用这些扰动后的硬负样本,对视频基础模型 UMT 进行微调。微调时设计了两种损失函数:硬负样本增强的对比损失(Hard-Negatives Augmented Contrastive Loss)和匹配损失(Hard-Negatives Augmented Matching Loss)。对比损失在视频到文本和文本到视频两个方向上计算,将选出的静态与动态硬负样本作为额外的负样本。匹配损失在正样本对和包含硬负样本的负样本对上计算二元分类损失。为了减轻 LLM 生成文本可能带来的偏差,微调时使用选出的正面改写字幕替换原始字幕。最终损失为两组损失的加权组合,权重 λc 和 λm 均设为 1。微调共收集约 125k 条扰动样本,在 4 块 A100-80G GPU 上训练 10 个 epoch,批大小为 16,学习率为 1e-5。微调完成后,评估器为每条生成的细粒度字幕给出匹配置信度分数,分数较低的字幕更可能包含不准确内容。最终为每个视频时刻选择得分最高的细粒度增强字幕作为标注。
利用上述流水线,研究者基于三个广泛使用的 VCMR 数据集构建了细粒度基准:Charades-FIG、DiDeMo-FIG 和 ActivityNet-FIG。统计分析表明,细粒度标注的词汇量和平均单词数约为原有粗粒度标注的两倍,其中形容词数量显著增加。例如 Charades-FIG 的平均形容词数从 0.04 增至 1.17,ActivityNet-FIG 从 0.60 增至 3.01,表明细粒度字幕包含更丰富的描述性细节。许多到许多对应关系统计显示,细粒度标注大幅减少了非判别性问题。Charades-FIG 的类别数从 1393 降至 194,实例数从 8805 降至 422;DiDeMo-FIG 和 ActivityNet-FIG 同样显著下降。用户研究结果验证了标注质量:Charades-FIG、DiDeMo-FIG 和 ActivityNet-FIG 中分别有 100%、88% 和 100% 的用户认可静态增强字幕提供了更丰富的细节,80%、88% 和 84% 的用户认可动态增强字幕的细节丰富度,平均准确度评分分别为 4.57、4.36 和 4.44(满分 5 分),说明经过过滤后标注准确度较高。
在实验评估部分,研究者基准测试了五种先进 VCMR 模型:HERO、XML、ReLoCLNet、CONQUER 和 SquidNet。评估指标包括 VCMR、SVMR 和 VR 任务,VCMR 与 SVMR 使用 R@k 和 mIoU 指标,VR 使用 R@k 指标。在细粒度 VCMR 任务上,所有模型均未取得理想的性能。以 Charades-FIG 为例,0.5/R1 的最高值仅为 2.61%(SquidNet),0.7/R1 最高为 0.94%,说明模型在细粒度场景下难以精确定位目标视频时刻。在 DiDeMo-FIG 中,CONQUER 表现最优,0.5/R1 为 5.48%,0.5/R100 为 51.63%;在 ActivityNet-FIG 中,SquidNet 的 0.5/R1 为 4.66%。相较之下,CONQUER 作为两阶段方法在多个任务上表现稳定,而 SquidNet 在 VR 上准确度最高(Charades-FIG 的 R1 达 11.67%,DiDeMo-FIG 的 R1 达 16.94%,ActivityNet-FIG 的 R1 达 32.57%),但在 SVMR 和 VCMR 上表现不稳定。研究者因此建议在细粒度场景下,避免在训练阶段将视频级别与时刻级别的学习目标过度纠缠。
进一步实验中,研究者比较了使用粗粒度训练数据与细粒度训练数据训练 XML 模型后的效果。在 Charades-FIG 上,使用细粒度数据训练的模型 0.5/R5 从 0.89% 提升至 2.63%,VR R1 从 0.62% 提升至 2.80%;在 DiDeMo-FIG 和 ActivityNet-FIG 上也观察到一致的提升,表明引入细粒度标注对于跨视频语料库的检索尤为重要。研究还针对评估器模块进行了消融实验:分别选择每个视频时刻置信度最高和最低的字幕进行训练,结果显示使用最低分字幕训练的模型性能显著下降。例如在 Charades-FIG 上,最高分字幕的 0.5/R1 为 1.05%,而最低分字幕仅为 0.67%;在 DiDeMo-FIG 上,最高分字幕的 0.5/R1 为 3.19%,最低分字幕为 2.04%,说明评估器能够识别出更好的训练数据,过滤掉不准确的标注内容。
论文的核心结论是指出当前 VCMR 基准对粗粒度理解的依赖限制了模型学习判别性视频特征和感知细粒度差异的能力。作者提出的 VERIFIED 流水线通过结合 LLM 与 LMM,并设计细粒度感知噪声评估器,能够自动生成具有可靠静态与动态细节的高质量标注。所构建的 Charades-FIG、DiDeMo-FIG 和 ActivityNet-FIG 基准为细粒度 VCMR 研究提供了新的评价平台。对现有先进模型的评估表明,基于粗粒度标注训练的模型在细粒度场景下泛化能力不足,亟需发展更强的细粒度视频理解方法。研究还指出了未来方向,包括训练端到端字幕模型以简化多模型组合的复杂流程,以及进一步缩小扰动近似与真实幻觉之间的差距。
该研究的亮点包括:首次定义了更具挑战性的细粒度 VCMR 任务设置;提出了一种结合静态与动态增强字幕模块和细粒度感知噪声评估器的自动标注流水线;通过引入扰动硬负样本微调视频基础模型,有效提升了评估器对不准确标注的识别能力;构建了三个高质量的细粒度 VCMR 基准数据集,并通过统计分析和用户研究验证了标注质量和判别性;系统评估了多种先进 VCMR 模型,揭示了当前方法在细粒度场景下的性能瓶颈,为未来研究提供了明确方向。