本研究由来自清华大学(Tsinghua University)和微软亚洲研究院(Microsoft Research Asia)的Jialuo Li、Bin Li、Jiahao Li与Yan Lu共同完成。论文《Divide, Then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding》即将发表于CVPR 2026。该工作瞄准了长视频理解任务中一个核心的工程与建模矛盾:受限于大语言模型的上下文窗口与密集视频令牌带来的高昂计算成本,现有的大多模态模型(Large Multimodal Models, LMMs)无法直接处理完整视频,而必须通过帧选择或令牌压缩来降低输入规模。以往的主流做法是均匀采样(uniform sampling),它虽然在时序覆盖上具有优势,但不考虑查询内容,容易遗漏关键片段或引入冗余噪声;近期兴起的查询感知自适应帧选择(query-aware adaptive frame selection)虽然能提升性能,却往往需要高昂的搜索计算。该研究的基本判断是:并非所有查询都需要复杂的帧搜索机制。作者首先建立并验证了全局查询(global query, GQ)与局部查询(localized query, LQ)的类型学划分,然后据此提出了一个免训练(training-free)的帧选择框架DIG,使策略能够根据查询类型动态切换。
从研究背景来看,这项工作处于视频大语言模型推理优化领域。过去的LMM在视频问答(Video Question Answering, VQA)中普遍采用均匀采样,因为其简洁高效。然而,该团队通过对Qwen2.5-VL-7B、InternVL3-8B和LLaVA-OneVision-7B等模型在MLVU、LongVideoBench和VideoMME三个长视频基准上的系统性评估发现,增加均匀采样的帧数并不会单调提升性能——当输入帧数超过某个最优值后,准确率反而下降。进一步将查询人工分类为全局查询与局部查询后,他们发现这种退化主要来自局部查询:随着帧数增加,无关帧被注入上下文,严重干扰了对特定时间片段的定位与推理;而全局查询由于依赖整体信息,其性能保持相对稳定。这一观察构成了本研究最核心的认识论基础:帧选择策略的有效性高度依赖于查询类型。
在方法流程上,DIG包含四个主要阶段。第一阶段是查询类型识别。系统利用一个大语言模型(实验中采用Qwen3-Next-80B-A3B)对用户问题进行自动分类,将其判定为全局查询或局部查询。对于全局查询,DIG直接采用标准均匀采样,尽可能保留视频的全局时序覆盖,避免不必要的关键帧搜索计算。对于局部查询,则进入一个专门构建的多阶段提取管线。
第二阶段是内容自适应帧选择(Content-Adaptive Frame Selection, CAFS)。该模块首先以2帧每秒(2 fps)的采样率获取视频帧,并使用DINOv2视觉编码器提取每个帧的语义特征向量。接着,计算相邻帧特征的余弦距离,得到一个距离序列。根据相邻帧之间视觉语义的突变程度,该算法识别出距离序列中的有效峰值。这些峰值通常对应场景切换或镜头变化,因此可以作为视频的自然分段点。为了降低噪声影响,只有突出度(prominence)大于0.1的峰值才会被保留。对于任意两个相邻分段点之间的视频片段,由于内部视觉较为一致,CAFS选择该片段的中点帧作为代表性帧(r-frame)。这一过程产生了一组数量远小于原始帧数、但在语义上能覆盖整段视频的代表帧集合。与传统的固定间隔采样相比,CAFS能够根据视频内容本身的密度自适应地调整代表帧数量,避免了短视频中的冗余和长视频中的覆盖不足。
第三阶段是奖励分配(reward assignment)。为了从r-frame中进一步挑选与查询最相关的帧,DIG没有依赖传统方法中常用的CLIPScore或目标检测器,而是直接调用LMM本身作为相关性评估器。具体而言,系统设计了一个二维评分提示:模型需要同时评估当前帧对回答查询的直接有用性,以及该帧是否暗示相邻帧可能包含补充信息。每帧被赋予0至100之间的奖励分数。实验表明,LMM凭借更强的推理能力和世界知识,能提供比CLIPScore更精确、更符合复杂语义需求的奖励信号。此外,即使LMM只是充当奖励分配器,使用更大的Qwen2.5-VL-32B作为奖励模型也明显优于7B版本,进一步说明奖励阶段的质量直接受模型规模与能力的影响。
第四阶段是视频精炼(video refinement)。获得各r-frame的奖励值后,DIG采用一种无需固定超参数的迭代奖励引导选择算法。该算法反复计算当前奖励集合的均值,将所有低于均值的奖励置为零,然后比较正向索引集合是否不再变化;当集合稳定时停止迭代。通过这种方式,所有最终被选择的r-frame都具有高于平均值的重要性。接下来,对于每个被选中的r-frame,DIG提取其在原视频中对应的视频片段,并扩展至窗口长度wlen为2的相邻r-frame范围,以获取更细粒度的时间上下文。不同r-frame对应的片段通过并集操作合并,形成一段经过精炼的、高度聚焦于查询内容的视频。最后,从这段精炼视频中均匀采样目标数量的帧,输入到LMM完成最终推理。
实验在三个长视频理解基准上展开:MLVU、LongVideoBench和VideoMME的中长时长切分。为了消除字幕等额外模态的干扰,所有评测均只使用视觉信息。基础推断模型采用Qwen2.5-VL-7B与Qwen2.5-VL-32B。与均匀采样、AKS和Q-Frame等基线相比,DIG在从8帧到256帧的几乎所有配置下均取得一致的性能提升。例如,在32帧配置下,DIG使Qwen2.5-VL-7B在MLVU上相对均匀采样提升了7.68个百分点,在LongVideoBench上提升了4.51个百分点。当帧数扩展至128帧时,AKS和Q-Frame在LongVideoBench上反而比均匀采样低1至2个百分点,而DIG仍保持正向收益。这证实了DIG在高帧密度和强基线模型下依然具有稳健的可扩展性。
在消融与分析部分,论文针对不同模块进行了详细评估。首先,在查询类型与策略匹配方面,结果显示均匀采样在全局查询上的表现与DIG管线相当甚至略有领先,而在局部查询上,DIG则显著优于均匀采样。这一发现支持了论文的核心主张:复杂搜索机制并非对所有查询都是必要或有效的。其次,CAFS模块在不同视频时长下均优于固定帧率采样和统一帧数采样,尤其在超过10分钟的长视频中表现突出,表明其能更准确地捕获非线性的语义分布。将CAFS替换为均匀采样后,DIG的性能显著下降,进一步验证了CAFS的贡献。在奖励分配方面,LMM生成的奖励在MLVU、LongVideoBench和VideoMME等基准上普遍优于CLIPScore,且更大规模的奖励模型能够进一步提高整体性能。窗口长度wlen的消融实验表明,将wlen设为0会导致性能最低,因为绝大多数查询需要跨越单一场景的时序上下文;而过大的窗口(如wlen=8)又会引入不相关的邻接信息,产生噪声。wlen=2在多数基准上取得了最佳平衡。计算效率方面,尽管DIG在低帧数下的计算量高于均匀采样,但当计算预算超过约720 TFLOPS后,DIG的准确率能够突破均匀采样的性能瓶颈(约62.5%),并随帧数增加继续提升,体现出更好的性能-计算扩展性。
本研究的结论具有明确的学术意义与应用价值。在科学层面,它首次系统性地将查询类型学引入帧选择策略设计,并通过跨模型、跨基准的实验证据表明,优化长视频LMM推理不能单纯依赖“更多帧”或“更复杂搜索”,而应依据问题类型进行策略适配。这种“先划分,再定位”(divide, then ground)的思路为后续研究提供了一个新的分析框架。在应用层面,DIG是一个完全免训练的方法,能够直接与现有LMM和推理框架集成,无需额外微调即可提升长视频问答性能。它尤其适用于资源受限场景下的长视频分析,例如视频摘要、监控检索或影视内容审阅。该工作还提示,对于全局性理解任务,简单的均匀采样可能已经足够,而过度的关键帧搜索反而会造成不必要的计算浪费。
论文的主要亮点可以归纳为三点。第一,提出并验证了全局查询与局部查询的类型学划分,并证明不同查询类型对帧选择策略的敏感度存在显著差异。第二,设计了内容自适应帧选择CAFS,利用DINOv2特征和峰值检测实现基于内容的代表帧提取,避免传统固定采样在长短视频上的覆盖问题。第三,将LMM本身纳入奖励分配环节,通过二维评分和迭代奖励引导的视频精炼,实现了比CLIPScore等浅层特征匹配方法更可靠的查询相关帧筛选。整体上,这项工作在视频LMM的推理效率与准确性之间提供了一种灵活且可扩展的折衷方案。