分享自:

视觉Transformer及其CNN-Transformer混合变体综述

期刊:Artificial Intelligence ReviewDOI:10.1007/s10462-023-10595-0

本文属于类型b,即一篇科学综述论文。以下是对该综述的学术报告。

本文的作者是Asifullah Khan、Zunaira Rauf、Anabia Sohail、Abdul Rehman Khan、Hifsa Asif、Aqsa Asif和Umair Farooq。其中Asifullah Khan的第一标注单位是巴基斯坦工程与应用科学研究所(PIEAS)的计算机与信息科学系,其他作者也分别隶属于不同研究机构。该论文发表于 Artificial Intelligence Review 期刊,于2023年10月4日在线发表,DOI为10.1007/s10462-023-10595-0。论文题目为“A survey of the vision transformers and their CNN-transformer based variants”,中文可译为《视觉Transformer及其CNN-Transformer混合变体综述》。

这篇综述论文的核心主题是视觉Transformer(Vision Transformer, ViT)以及近年来出现的混合视觉Transformer(Hybrid Vision Transformer, HVT),即CNN-Transformer混合架构。论文系统地梳理了ViT的基本组成、主要变体,并重点对混合架构进行分类和解释。其发表背景在于,自2020年Dosovitskiy等人提出ViT以来,视觉Transformer在计算机视觉领域迅速兴起,但其缺乏卷积神经网络(Convolutional Neural Network, CNN)所固有的局部归纳偏置,导致对小规模数据集的泛化能力有限且计算开销较大。为解决这些问题,研究者开始将卷积操作与自注意力机制相结合,形成混合视觉Transformer。由于此类架构数量快速增长,亟需系统性的分类和梳理,这正是本文的写作目的。

该论文的主体内容可以从以下几个主要观点进行阐述。

第一,ViT的基本架构建立在图像分块、位置嵌入和多头自注意力机制之上。 论文指出,ViT首先将输入图像分割为固定大小的非重叠图像块(patches),随后将每个图像块展平并通过线性层映射为向量表示,即块嵌入(patch embedding)。由于Transformer本身不具备空间位置感知能力,ViT引入位置嵌入(positional embedding)来保留图像块之间的顺序信息。论文将位置嵌入方法归纳为三类:绝对位置嵌入(Absolute Position Embedding, APE)、相对位置嵌入(Relative Position Embedding, RPE)和卷积位置嵌入(Convolutional Position Embedding, CPE)。其中,CPE利用二维卷积操作获取位置信息,能够更好地适应图像数据的二维结构。ViT的核心模块是多头自注意力(Multi-head Self-Attention, MSA),它通过查询(query)、键(key)和值(value)三个嵌入空间计算图像块之间的全局关系。与CNN的局部感受野不同,MSA能够对图像中任意位置之间的关系进行建模,从而获取全局上下文信息。此外,ViT编码器还包含前馈神经网络(Feed-Forward Network, FFN)、残差连接和层归一化等模块。这些基础概念构成了后续所有ViT变体和混合架构的共同技术底座。

第二,根据架构层面的修改方式,ViT变体可以分为五个主要类别。 论文将现有的非混合ViT架构归纳为:(1)基于图像块的方法(patch-based approaches),如Tokens-to-Token ViT(T2T-ViT)、Transformer in Transformer(TNT-ViT)和Deformable Patch-based Transformer(DPT)等,它们分别采用迭代分块、多层次分块和自适应分块等策略来改善图像块提取的质量;(2)基于知识迁移的方法(knowledge transfer-based approaches),如Data-efficient Image Transformer(DeiT)和Target-aware Transformer(TAT),这些方法利用知识蒸馏将大型教师模型的特征迁移到小型学生模型,以降低对大规模训练数据的依赖;(3)基于移位窗口的方法(shifted window-based approaches),以Swin Transformer为代表,通过在局部窗口内计算自注意力并进行窗口移位来实现跨窗口连接,从而在保持计算效率的同时建模全局关系;(4)基于注意力的方法(attention-based approaches),如Class Attention in Image Transformer(CaiT)和Deformable Attention Transformer(DAT),它们通过修改注意力模块的结构来提升性能或降低计算复杂度;(5)基于多Transformer的方法(multi-transformer-based approaches),如CrossViT、Dual-ViT和MPViT,这些方法利用多个并行或级联的Transformer分支来捕获多尺度特征。论文对这些类别中的代表性架构逐一进行了介绍,并说明了它们相对于原始ViT的改进之处。

第三,混合视觉Transformer(HVT)的核心思想是将CNN的局部特征提取能力与Transformer的全局建模能力相结合,并根据卷积操作在架构中的整合方式可分为八个类别。 这是本综述区别于以往综述的最重要贡献。论文指出,纯ViT面临三个主要问题:无法有效捕获局部邻域相关性、MSA机制计算和内存开销大、输入块大小固定。HVT通过引入卷积操作来注入归纳偏置,从而缓解这些问题。论文将HVT的分类体系划分为:(1)早层整合(early-layer integration),即在网络的前端使用CNN提取初始特征,再将特征图输入Transformer,代表性架构包括Hybrid ViT、Detection Transformer(DETR)和LeViT;(2)侧层整合(lateral-layer integration),即在Transformer网络末端或前馈网络中使用CNN层,如Dense Prediction Transformer(DPT)和LocalViT;(3)顺序整合(sequential integration),即交替堆叠CNN块和Transformer块,如CoAtNet和CMT,其中CoAtNet的实验表明“两个卷积块后接两个Transformer块”的排列方式效果较优;(4)并行整合(parallel integration),即CNN分支和Transformer分支同时处理输入并在末端融合,如Conformer和Mobile-Former;(5)层次化整合(hierarchical integration),即定义一个统一的混合块并在多个阶段重复使用,形成类似CNN的层次化骨干网络,如MaxViT、CvT和ViTAE;(6)基于注意力机制的整合(attention-based integration),即直接在注意力计算过程中引入卷积,如EA-AA-ResNet和ResT;(7)通道增强整合(channel boosting-based integration),即利用CNN和ViT作为辅助学习器生成增强通道,如CB-HVT;(8)论文在正文中还提及了第八类,但主要分类图示中明确列出了这些类别。通过这种分类,论文清晰地展示了卷积操作可以在不同位置和不同层次上与Transformer结构进行融合,并为后续架构设计提供了参考框架。

第四,ViT和HVT已经在计算机视觉的多个应用领域展现出显著优势。 论文在应用部分系统总结了这些架构在图像/视频识别、图像生成、图像分割、图像复原、特征提取、医学图像分析、目标检测和姿态估计等方面的应用。在图像识别方面,论文列举了多种混合架构,如利用ViT和CNN分别编码全局和局部信息的跨模态三维物体识别方法,以及Hybrid Attention ViT用于面部眼周跨模态识别等。在图像生成方面,论文介绍了UVCGAN、SwinGAN、SWCGAN和L-Former等混合生成对抗网络,这些模型利用CNN提取局部特征、Transformer建模全局特征,在医学图像重建和遥感图像生成等任务中表现优异。在图像分割方面,DualSeg、SCDeepLab和Mask2Former等混合方法在葡萄分割、隧道裂缝分割和通用语义分割中均超越了纯CNN或纯ViT方法。在图像复原方面,Dual-former和HNCT等模型通过结合卷积和自注意力,在去模糊、超分辨率和去噪任务中实现了性能与计算成本之间的良好平衡。在医学图像分析中,Fully Convolutional Transformer(FCT)、HiFormer和TSEDeepLab等混合模型在多个医学图像分割基准数据集上取得了领先结果。在目标检测方面,ViT-FRCNN和MDCT等HVT方法在自然图像和遥感图像检测中均展现了更强的泛化能力。

第五,论文还讨论了ViT和HVT当前面临的主要挑战以及未来的研究方向。 在挑战方面,论文指出以下几个关键问题:首先,如何为ViT赋予适当的等变性和不变性归纳偏置仍然十分困难;其次,MSA和卷积操作都依赖密集矩阵乘法,导致HVT架构在体积分析和分割等密集预测任务中可能面临高计算复杂度和内存开销;第三,训练ViT和HVT通常需要高性能GPU等硬件资源,这限制了它们在边缘设备上的部署;第四,ViT的多头注意力机制使得模型的可解释性较差,难以判断哪些输入区域对决策过程起关键作用;第五,如何高效融合Transformer层学习到的空间无关全局特征和卷积层学习到的空间相关局部特征是HVT架构设计中的一个核心难题;最后,ViT和HVT由于学习容量大,通常需要大规模标注数据集,这在医学图像等领域尤其困难。在未来方向方面,论文强调可解释性是ViT发展的重要议题,建议研究特征可视化、激活图生成和Grad-CAM等技术来揭示模型的决策过程,从而识别和纠正偏见与错误。此外,论文还认为在架构层面高效统一MSA和CNN层、降低计算复杂度、以及在小数据场景下提升泛化能力将是未来研究的重点方向。

本文的学术价值和应用价值体现在两个方面。从学术角度看,这篇综述的独特之处在于它并非单纯关注ViT或CNN,而是聚焦于二者融合这一迅速发展的趋势。通过提出基于卷积操作整合方式的HVT分类体系,论文为研究者理解不同混合架构之间的设计差异和演进逻辑提供了清晰框架。此外,论文对每一类架构的代表性工作进行了归纳,并给出经验性的比较表格,有助于后续工作选择合适的基线模型。从应用角度看,论文展示了HVT在医学图像分析、遥感图像、自动驾驶、图像复原等多个实际领域中的优越性能,说明混合架构不仅具有理论意义,也具有广泛的工程落地潜力。论文还指出了当前面临的挑战和未来方向,为计算机视觉领域的研究者提供了有价值的参考。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com