分享自:

走向开放词汇学习:一项综述

期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence

本文属于类型b,是一篇关于开放词汇学习(Open Vocabulary Learning)的综述论文。该文由Jianzong Wu、Xiangtai Li、Shilin Xu、Haobo Yuan等多位研究者共同撰写,其中前四位作者贡献相同,通讯作者为Xiangtai Li。作者分别来自北京大学、南洋理工大学、武汉大学、阿卜杜拉国王科技大学、悉尼大学、苏黎世联邦理工学院和浙江大学等机构。论文发表于《IEEE Transactions on Pattern Analysis and Machine Intelligence》,该期刊是计算机视觉与模式识别领域的顶级期刊。论文系统地综述了开放词汇学习领域的最新进展,涵盖了定义、背景、方法、任务设定、数据集、评估指标以及未来的挑战和方向。

论文首先明确了开放词汇学习的基本概念,并将其与零样本学习(Zero-Shot Learning)、开放集识别(Open-Set Recognition)、开放世界学习(Open World Learning)以及分布外检测(Out-of-Distribution Detection)等相关概念进行了对比。作者指出,传统的深度神经网络通常基于闭集假设(close-set assumption),即模型只能识别训练集中已有的类别。然而在真实场景中,图像或视频中的物体类别远多于标注数据集中包含的类别,因此这种闭集假设限制了模型的实用性和泛化能力。零样本学习虽然试图解决这一问题,但它严格禁止在训练过程中接触任何新类别的视觉信息,通常只能依赖预定义的词嵌入进行分类,导致在新类别上的表现不尽如人意。与之不同,开放词汇学习允许利用视觉相关的语言数据(如图像描述文本)作为辅助监督信号,并可以借助大规模视觉语言模型(Vision-Language Models, VLMs)如CLIP和ALIGN中的语言词汇知识,从而实现对训练中未出现的新类别的识别。作者还指出,开放词汇学习中的语言词汇空间并不一定需要完全覆盖基础类别和新类别,甚至可以包含超出预定义类别的词汇,这进一步增强了模型的扩展能力。

在方法层面,论文将开放词汇学习的主要任务分为开放词汇目标检测、开放词汇分割、开放词汇视频理解以及开放词汇三维场景理解等方向,并对每一方向的方法进行了分类和总结。对于开放词汇目标检测,论文将其方法归纳为五类:知识蒸馏(Knowledge Distillation)、区域文本预训练(Region Text Pre-training)、使用更均衡数据进行训练(Training with More Balanced Data)、提示建模(Prompting Modeling)以及区域文本对齐(Region Text Alignment)。知识蒸馏方法的核心是将预训练视觉语言模型中的对齐知识迁移到闭集检测器中,使检测器具备识别新类别的能力。代表性工作ViLD通过将CLIP图像编码器生成的区域特征与检测器提取的区域特征进行对齐,实现了对新类别的检测。区域文本预训练方法则利用大规模图像-文本对数据进行预训练,使视觉区域特征与文本特征在语义空间中对齐,OVR-CNN是这一方向的开创性工作。使用更均衡数据进行训练的方法主要通过引入图像分类数据、伪标签数据或生成数据来缓解类别不均衡问题,Detic和OWLv2是其中的代表。提示建模方法侧重于设计更有效的提示形式,使视觉语言模型的知识能够更好地迁移到检测任务中,如DetPro和PromptDet。区域文本对齐方法则专注于改进区域视觉特征与文本特征之间的匹配机制,例如OV-DETR通过条件二值匹配机制替代传统的二分匹配,以更好地处理新类别。

在开放词汇分割方面,论文总结了六类方法:利用视觉语言模型提升识别能力、从图像描述数据中学习、生成伪标签、无像素级标注训练、联合学习多个任务以及采用去噪扩散模型。利用视觉语言模型的方法通常将分割任务视为密集分类问题,并通过将像素特征与类别文本嵌入对齐来实现对新类别的分割,LSeg和MaskCLIP是早期代表性工作。从图像描述数据中学习的方法利用图文对中的名词信息作为弱监督信号,OpenSeg和CGG通过区域-词对齐和描述生成损失来充分利用图像描述数据。生成伪标签的方法通过视觉语言模型或自动标注技术生成新类别的掩码标注,从而增强训练数据的多样性,OVSeg和XPM属于此类。无像素级标注训练的方法探索在仅有图像描述等弱监督信号下进行语义分割,GroupViT和SegCLIP通过对比学习和聚类损失实现这一目标。联合学习多个任务的方法旨在用一个统一的框架同时处理语义分割、实例分割和全景分割,X-Decoder和FreeSeg是代表性工作。采用去噪扩散模型的方法利用扩散模型中间表示中的丰富语义信息进行分割,ODISE是这一方向的突出代表。

论文还介绍了开放词汇视频理解的相关工作,包括视频分类和视频目标跟踪与实例分割。在视频分类中,ActionCLIP和X-CLIP等工作通过时序融合模块或视频编码器将CLIP的图像级知识迁移到视频域。在跟踪和视频实例分割中,OVTrack和MindVLT等工作利用视觉语言模型增强跟踪器对未见类别的泛化能力。对于开放词汇三维场景理解,论文指出由于缺乏大规模的三维-文本配对数据,直接训练三维视觉语言模型非常困难。PointCLIP通过将点云投影为深度图并利用CLIP进行识别,迈出了三维开放词汇感知的第一步。后续工作如ULIP和OpenShape通过收集三维-图像-文本三元组数据或构建大规模三维-文本数据集来提升三维模型的开集识别能力。在三维目标检测和场景理解中,OV-3Detic和PLA等工作通过将二维检测器和视觉语言模型的知识迁移到三维任务中,实现了对未见类别的检测和分割。

论文最后总结了开放词汇学习面临的挑战和未来研究方向。作者指出,尽管开放词汇学习取得了显著进展,但仍存在若干亟待解决的问题,例如如何进一步提升新类别的检测和分割精度、如何设计更高效的跨模态对齐方法、如何降低对大规模预训练数据的依赖以及如何将开放词汇能力扩展到更复杂的任务如三维场景理解和视频理解。此外,论文还提供了一个持续更新的开源项目地址,用于跟踪开放词汇学习领域的最新研究进展。整体而言,这篇综述系统地梳理了开放词汇学习的发展脉络和核心技术,为该领域的研究者提供了全面的参考和指导,具有重要的学术价值和实际应用意义。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com