本文发表于 *ACM Computing Surveys*,作者为 Salman Khan、Muzammal Naseer、Munawar Hayat、Syed Waqas Zamir、Fahad Shahbaz Khan 与 Mubarak Shah,是一篇关于视觉领域中 Transformer 模型的综合性综述。文章系统梳理了 Transformer 从自然语言处理(NLP)进入计算机视觉(Computer Vision)领域的动机、基础原理、代表性架构以及在不同视觉任务中的应用,并对未来的研究方向进行了展望。
一、论文的核心背景与目标
Transformer 模型最初在自然语言处理任务中取得了突破性成果,例如 BERT、GPT 系列和 T5 等模型在文本分类、机器翻译和问答等任务上表现优异。其核心优势在于:第一,自注意力(self-attention)机制能够建模输入序列中元素之间的长距离依赖关系;第二,与循环神经网络相比,Transformer 支持对序列的并行处理;第三,与卷积网络相比,Transformer 所需的归纳偏置(inductive bias)较少,天然适合作为集合函数(set-function)处理数据;第四,Transformer 的模块化设计使其能够较为统一地处理图像、视频、文本和语音等多种模态。这些特性促使视觉领域研究者尝试将 Transformer 应用于图像分类、目标检测、分割、生成建模、多模态任务、视频处理和三维分析等方向。
论文的目标是为视觉 Transformer 提供一个全面的技术综述,梳理自注意力的基本概念、预训练策略、统一尺度与多尺度视觉 Transformer 架构、卷积与注意力混合设计、自监督视觉 Transformer,以及 Transformer 在各类视觉任务中的具体应用,最后分析开放问题和未来可能的研究方向。
二、Transformer 的基础机制与预训练思想
论文首先介绍了 Transformer 的两大基础思想:自注意力机制和大规模预训练。自注意力的核心在于,对于输入序列中的每个实体,通过可学习的查询(query)、键(key)、值(value)权重矩阵计算其与所有其他实体的相关性,并利用 softmax 归一化后的注意力分数对所有值进行加权求和,从而更新每个实体的表示。多头注意力(multi-head attention)则通过多个并行的自注意力头捕捉不同子空间中的复杂关系。与静态滤波器的卷积操作不同,自注意力中的权重是动态计算的,并且对输入点的排列和数量变化具有不变性,因此在处理不规则输入时更加灵活。
预训练方面,视觉 Transformer 通常先在大规模数据集上进行监督或自监督预训练,再在下游任务上微调。自监督学习(self-supervised learning, SSL)通过设计 pretext task(如掩码图像建模、图像着色、拼图任务、旋转预测和对比学习等)自动生成伪标签,从而利用大量无标注数据学习有意义的表示。论文强调,预训练对于视觉 Transformer 的性能至关重要,例如 ViT 仅在 ImageNet 上训练时准确率会显著下降,而在 JFT 数据集上预训练后再微调则能取得明显提升。
三、视觉 Transformer 的架构分类
论文将视觉中的自注意力与 Transformer 模型分为单头自注意力和多头自注意力两大类。单头自注意力主要包括在 CNN 中引入非局部操作(non-local operation)以捕捉长距离依赖,例如 Wang 等人提出的 non-local block 在视频分类中取得了良好效果。但由于其计算复杂度较高,后续工作提出了 criss-cross attention 和局部自注意力等更高效的变体,以降低内存和计算开销。此外,还有研究者将自注意力作为独立原语替代卷积层,如 Ramachandran 等人提出的局部自注意力层和 Zhao 等人提出的向量注意力网络,这些方法在 ImageNet 分类和目标检测中表现出较少的参数量和较强的鲁棒性。
多头自注意力视觉 Transformer(ViT)是近年来研究的重点。论文将其进一步细分为以下几类:
统一尺度视觉 Transformer:以 ViT 为代表,将图像分割为固定大小的 patch,将每个 patch 展平为向量后输入标准 Transformer 编码器。ViT 首次证明 Transformer 可以完全替代卷积网络,但需要大规模预训练数据。DeiT 通过知识蒸馏(distillation)方法,使 Transformer 可以在中等规模数据集(如 ImageNet-1k)上高效训练。T2T-ViT 通过递归合并相邻 token 来减少 token 数量并聚合空间上下文。XCiT 提出跨协方差注意力,将注意力计算从 token 维度转移到特征通道维度,从而将复杂度从二次降低为线性。
多尺度视觉 Transformer:标准 ViT 在所有层中保持 token 数量和特征维度不变,难以捕获不同尺度的空间细节。多尺度层次化设计通过逐步减少 token 数量并增加特征维度来生成层次化特征,更适合密集预测任务。代表性工作包括 PVT(Pyramid Vision Transformer)、Swin Transformer、Focal Transformer、CrossFormer 和 RegionViT 等。Swin Transformer 通过局部窗口注意力和窗口移位机制在计算效率和全局建模能力之间取得平衡,成为后续许多工作的基础架构。
混合卷积-Transformer 设计:这类模型结合了卷积在提取低级局部特征方面的优势与 Transformer 在建模长距离依赖方面的能力。CvT 使用卷积投影进行 patch 嵌入并采用层次化结构;LeViT 在前端使用轻量 CNN 块,在 CPU 上推理速度显著提升;CoAtNet 通过堆叠深度卷积和自注意力层,在仅使用 ImageNet-1k 训练的情况下达到 86% 的 top-1 准确率;NesT 通过块内局部自注意力和块间全局交互实现层次化建模,并可在小数据集上从头训练。
自监督视觉 Transformer:MoCo v3、DINO 和 EsViT 等工作将对比学习和自蒸馏方法应用于 ViT 训练。DINO 的一个显著发现是自监督 ViT 能够自动产生与图像语义分割接近的注意力图,即使没有像素级监督。EsViT 进一步引入 patch 级别的自监督,通过强化同一图像不同增强版本中相似 patch 的对应关系来提升特征迁移能力。
四、Transformer 在各类视觉任务中的应用
目标检测:DETR 将目标检测视为集合预测问题,利用 Transformer 编码器-解码器结构一次性预测所有目标框,并通过二分匹配损失(bipartite matching loss)实现端到端训练,去除了 RPN 和非极大值抑制等手工设计模块。然而 DETR 存在小目标检测困难和收敛慢的问题。Deformable DETR 引入可变形注意力,仅关注特征图上的稀疏采样点,同时支持多尺度特征聚合,将训练时间降低约 10 倍。Anchor DETR 使用锚点查询替代可学习查询,进一步加速收敛。YOLOS 则完全基于 ViT 架构,将多个可学习的目标查询 token 引入检测任务,展示了纯 Transformer 检测器的可行性。
图像分割:对于全景分割等密集预测任务,Wang 等人提出位置敏感的轴向注意力(axial attention),将二维自注意力分解为沿高度轴和宽度轴的两个一维注意力,从而在保持全局上下文建模能力的同时显著降低计算复杂度。SegFormer 采用层次化 PVT 作为编码器,并设计简单的 MLP 解码器进行分割。Segmenter 使用 ViT 编码器和掩码 Transformer 解码器,通过可学习的掩码 token 与图像 patch token 交互来预测分割掩码。
生成建模:Image Transformer 和 iGPT 等工作将 Transformer 用于图像自回归生成。iGPT 直接对像素序列进行建模,在无监督特征学习方面取得了与对比学习方法相当的性能。TransGAN 构建了完全基于 Transformer 的生成对抗网络,在 STL-10 等数据集上取得了具有竞争力的生成效果。DALL·E 是一个 120 亿参数的 Transformer 模型,能够根据文本描述生成高保真图像,并支持图像补全和图像到图像的转换。
底层视觉:IPT(Image Processing Transformer)通过在大规模合成退化数据上预训练,可同时处理超分辨率、去噪和去雨等多种图像恢复任务。SwinIR 和 ESRT 等模型利用窗口注意力和空间分辨率缩减策略,将 Transformer 应用于高分辨率图像超分辨率。Colorization Transformer 通过分阶段训练和行列注意力机制实现高分辨率灰度图像着色。
多模态任务:论文将视觉-语言预训练模型分为双流和单流架构。ViLBERT 和 LXMERT 采用双流结构,分别对视觉和语言输入进行编码,再通过跨模态注意力进行融合。VisualBERT、VL-BERT、UNITER 和 Oscar 等采用单流结构,将视觉区域特征和文本 token 拼接后输入统一的 Transformer。这些模型通常使用掩码语言建模、掩码视觉区域预测和图文匹配等预训练任务学习跨模态表示。CLIP 通过对比学习在大规模图文对数据上训练,在 30 个视觉基准上展示了强大的零样本迁移能力。
视频与三维分析:VideoBERT 将 BERT 扩展到视频领域,通过预测视频帧和文本 token 之间的对应关系学习视频表示;TimeSformer 在视频 Transformer 中分别探索了空间和时间维度的自注意力。在三维分析中,Point Transformer 和 Point-BERT 等工作将自注意力应用于点云分类和分割任务,通过建模点之间的全局关系提升三维场景理解能力。
五、论文的意义与价值
该综述系统性地整合了视觉 Transformer 这一快速发展领域的研究成果,为研究者提供了从基础机制到具体应用的完整知识框架。其价值体现在多个方面:第一,明确了 Transformer 相比 CNN 和 RNN 的核心优势,特别是长距离依赖建模、并行处理、低归纳偏置和多模态统一处理能力;第二,提出了视觉 Transformer 架构的分类体系,帮助研究者理解不同设计选择(如统一尺度与多尺度、纯注意力与混合卷积、单头与多头注意力)对性能的影响;第三,全面覆盖了从高层识别到底层恢复、从单模态到多模态、从二维图像到三维点云和视频的多种视觉任务,展示了 Transformer 的广泛适用性;第四,指出了当前视觉 Transformer 面临的关键挑战,例如自注意力的二次计算复杂度、对大规模预训练数据的依赖、在小数据集上的训练困难,以及如何进一步将 CNN 的归纳偏置有效融入 Transformer 架构等问题。这些分析和展望为后续研究提供了明确的方向指引。
本文不仅是视觉 Transformer 领域的重要参考文献,也为跨模态学习、自监督表示学习和高效注意力机制设计等前沿方向提供了系统的理论支撑和实践总结。