本文属于类型b,是一篇综述论文。以下是根据原文内容撰写的学术报告。
本文作者为王耀力(Yaoli Wang)、邓耀俊(Yaojun Deng)、郑元瑾(Yuanjin Zheng)、Pratik Chattopadhyay以及Lipo Wang。作者分别来自太原理工大学电子信息工程学院、南洋理工大学电气与电子工程学院、印度理工学院(BHU)计算机科学与工程系以及南洋理工大学数字分子分析与科学研究所。该文发表于MDPI出版社的期刊《Technologies》2025年第13卷第32期,文章编号为32,并于2025年1月12日正式出版。通讯作者为Lipo Wang。文章标题为《Vision Transformers for Image Classification: A Comparative Survey》,即《用于图像分类的视觉Transformer:一项比较性综述》。该综述聚焦于视觉Transformer(Vision Transformer,ViT)在图像分类任务中的发展、优化与对比研究,旨在系统梳理从最初ViT到各类改进模型的技术演进路径、性能比较以及当前面临的挑战与未来方向。
本文的第一个核心观点是:Transformer架构最初为自然语言处理(Natural Language Processing,NLP)设计,其核心机制为自注意力(self-attention),该机制使模型能够捕捉序列中的长程依赖关系,并实现高度并行化处理。与传统卷积神经网络(Convolutional Neural Networks,CNNs)相比,自注意力不依赖固定的局部感受野,而是学习全局的、自适应长度的关系。论文以Vaswani等人提出的“Attention is All You Need”为基础,详细介绍了自注意力机制中查询(Query,Q)、键(Key,K)和值(Value,V)矩阵的线性变换与注意力计算方式,并指出位置编码(position encoding)在弥补自注意力缺乏位置感知方面的作用。通过引入多头注意力(multi-head attention),模型可以在不同子空间捕捉多种复杂关系。该部分为读者理解ViT的机制提供了必要的理论背景。
本文的第二个核心观点是:ViT是首个成功将纯Transformer架构应用于图像分类任务的模型。Dosovitskiy等人于2020年提出的ViT将二维图像切分为固定大小的图像块(patch),并将每个图像块线性映射为向量嵌入,之后输入Transformer编码器。ViT借鉴了BERT中的类别令牌(class token)概念,加入一个可学习的分类标记,并与位置嵌入结合后输入多层自注意力与前馈网络。ViT的主要特点是去掉了卷积层,完全依赖自注意力来建模图像块之间的全局关系。然而,ViT的训练高度依赖大规模数据集。当仅使用ImageNet等中等规模数据集进行训练时,其准确率与ResNet相当;只有在JFT-300M等超大规模数据集上预训练后,ViT才能在下游任务如ImageNet、CIFAR-100和VTAB上超越ResNet。这一结论表明ViT具有显著的数据依赖特性。
本文的第三个核心观点是:针对ViT的不足,研究者提出了多种改进方向,其中数据效率改进是最直接的方向之一。以DeiT(Data-efficient Image Transformer)和T2T-ViT(Tokens-to-Token ViT)为代表。DeiT在仅使用ImageNet训练的情况下,通过引入知识蒸馏(distillation)策略显著减少了模型对超大规模数据的依赖。DeiT在结构中增加了一个蒸馏令牌(distillation token),与传统类别令牌并列,分别用于计算交叉熵损失和教师模型损失。实验表明,硬蒸馏(hard distillation)优于软蒸馏,且两个令牌在学习过程中逐渐趋于相似但方向不同。T2T-ViT则通过T2T模块对相邻令牌进行聚合,以更好地建模图像局部结构(如边缘和角点),并采用软分割(soft split)策略生成重叠令牌,提升局部特征提取效率。此外,T2T-ViT采用了深窄(deep-narrow)结构来减少特征冗余和计算复杂度。
本文的第四个核心观点是:将CNN概念与Transformer架构融合是提升图像分类性能的重要策略。论文以CPVT、VT(Visual Transformer)、Refiner、CvT和CeiT等模型为例进行说明。CPVT引入了位置编码生成器(Positional Encoding Generator,PEG),使用卷积核在每个图像块上动态生成自适应长度的位置嵌入,取代传统的固定位置编码。VT利用CNN对图像进行语义令牌化(tokenizer),将像素空间转化为语义令牌空间,从而减少Transformer的计算负担并提升高层特征提取能力。Refiner提出了Refiner-Attention机制,对Q、K、V进行线性扩展后分别应用分布式局部注意力(Distributed Local Attention,DLA),以缓解过度平滑问题。CvT则将Transformer中的线性投影替换为卷积投影,并在多个阶段逐步降低特征分辨率、提高特征维度,消除了显式位置编码的需要。CeiT则仅在图像分块前使用一次卷积,即可获得明显的性能提升。这些模型说明,即便有限的CNN结构引入也能显著提升Transformer在图像分类任务中的性能。
本文的第五个核心观点是:轻量化Transformer模型在保持一定准确率的前提下显著降低计算成本和参数量。论文重点介绍了LeViT和CCT(Compact Convolutional Transformer)。LeViT在DeiT基础上引入金字塔结构,使用卷积进行特征提取和降采样,用1×1卷积替代线性变换,并去除类别令牌,以平均池化输出作为分类器输入。LeViT还提出了注意力偏置(attention bias)来替代传统位置编码,在每个层中保持位置信息。实验结果显示,LeViT在计算量不到DeiT一半的情况下保持相近精度,在CPU上的训练速度比EfficientNet快约三倍。CCT则用卷积替代ViT中的图像切块过程,并提出序列池化(sequence pooling)方法取代类别令牌,能够在小数据集如CIFAR-10上直接训练取得良好效果。此外,论文还提及动态令牌稀疏化(dynamic token sparsification)、PSLT(Progressive Shift Ladder Transformer)以及Quantformer等轻量化方法,这些方法在FLOPs降低和推理吞吐量提升方面表现突出。
本文的第六个核心观点是:通过加深Transformer结构并改进注意力机制,可以缓解注意力崩溃(attention collapse)或过度平滑问题。CaiT(Class-Attention in Image Transformers)模型将类别令牌从自注意力层中解耦,在早期层仅对图像块进行自注意力建模,在网络末端才引入类别令牌并通过类注意力层更新。这种设计改善了训练效率和分类能力。DeepViT研究了直接加深ViT所导致的注意力图相似性增加问题,提出了Re-Attention机制,通过学习到的线性变换在不同注意力头之间交换信息,并使用BatchNorm替代LayerNorm,从而保持注意力头的多样性,避免特征表示退化。实验表明,Re-Attention在不显著增加参数和计算量的前提下有效缓解了过度平滑。
本文的第七个核心观点是:聚合嵌套Transformer和交叉注意力机制为在有限训练数据下提升Transformer性能提供了新途径。NesT(Nested Transformers)采用层级堆叠与聚合的方式,先对非重叠图像块分别进行自注意力计算,再通过聚合函数(其中引入卷积)实现跨块信息交互。该方法在保持参数量相近的情况下降低了计算复杂度并提升了准确率。CrossViT则通过交叉注意力层融合不同尺度图像块的特征,同时处理细粒度块和粗粒度块,在不明显增加参数的前提下提高模型对多尺度信息的利用效率。CrossViT中仅使用类别令牌计算Q,提高了注意力计算的效率。
本文的第八个核心观点是:通过改进训练过程中的损失函数也能有效提升Transformer图像分类性能。论文介绍了针对过度平滑问题提出的三种逐块损失函数(patch-wise loss),包括逐块余弦损失(patch-wise cosine loss)、逐块对比损失(patch-wise contrastive loss)和逐块混合损失(patch-wise mixing loss)。这些损失函数分别通过最大化块表示多样性、保持不同层之间对应块表示的一致性、以及为每个块引入监督信息来增强块表示的判别能力。实验结果显示,这些损失函数在多种Transformer模型上均能提升性能、增强训练稳定性并支持更高的drop path率。
最后,论文通过三个表格对多种ViT模型与代表性CNN模型进行了系统对比。Table 1展示了在CIFAR-10和CIFAR-100数据集上的参数、FLOPs和Top-1准确率,说明CCT和NesT等轻量模型在小规模数据集上表现优异。Table 2对比了在ImageNet、ImageNet Real和ImageNet V2上训练的模型结果,详细列出了ViT-B/16、ViT-L/16、DeiT系列、T2T-ViT系列、CPVT、VT、Refined-ViT、CvT、CeiT、LeViT、CaiT、DeepViT等模型与ResNet、EfficientNet、NFNet等CNN模型的性能差异。Table 3则展示了预训练ViT在CIFAR-10、CIFAR-100、Oxford-IIIT Pets、Oxford-IIIT Flowers和Stanford Cars等下游任务上的泛化能力。这些数据说明,在充分预训练后,许多改进ViT模型在准确率和泛化性上已达到甚至超过经典CNN模型,但在计算复杂度与参数规模方面仍存在挑战。
该综述系统梳理了视觉Transformer在图像分类任务中的核心机制、基础模型、改进策略、性能对比和未来方向。文章的主要价值在于为研究者提供了一条从ViT原始架构到各类优化的技术演进路径,指出了数据依赖、计算效率和位置感知等关键问题,并详细总结了多种应对策略。未来研究可进一步探索卷积与Transformer的深度融合、更有效的归一化与损失机制、面向硬件的高效Transformer设计,以及基于图像-文本联合训练的预训练范式。这些内容对于推动视觉Transformer在图像分类和其他视觉任务中的进一步发展具有重要参考意义。