这是一篇发表于*IET Computer Vision*期刊的综述论文,作者包括Jinfeng Cao(青岛理工大学)、Bo Peng(青岛理工大学)、Mingzhong Gao(深圳大学)等。论文于2025年出版,题为“Object detection based on CNN and Vision‐Transformer: a survey”,系统性地回顾了基于卷积神经网络和视觉Transformer的目标检测技术的发展历程、关键技术和未来挑战。
论文指出,目标检测作为计算机视觉领域最核心且最具挑战性的任务之一,旨在同时回答图像中“物体是什么”和“物体在哪里”两个问题。该技术已广泛应用于自动驾驶、工业检测、人脸识别等现实场景。在过去二十年中,目标检测已从基于手工特征的传统方法,全面迈入了由深度学习驱动的现代方法阶段,尤其是卷积神经网络和视觉Transformer的出现,带来了显著的性能突破。这篇综述旨在为研究人员和从业者提供一个全面的技术基础,以加深对目标检测技术的理解。
文章首先梳理了目标检测器的发展路线,其核心维度是基于基础组件的分类,即卷积神经网络(CNN)基和Transformer基检测器。卷积神经网络(CNN)基的两阶段检测器遵循一种先粗后精的层级范式,首先识别潜在的兴趣区域,随后进行分类和边界框回归。里程碑式的框架包括开创性的RCNN、解决多尺度输入的SPPNet、统一分类与回归任务的Fast RCNN、引入区域提议网络(RPN)实现端到端训练的Faster RCNN,以及后续解决多尺度特征融合的FPN和提升定位精度的Cascade RCNN等。此类方法检测精度高,但多阶段处理带来的计算复杂度在一定程度上限制了其推理速度。
为了解决速度问题,卷积神经网络(CNN)基的一阶段检测器应运而生。这类检测器摒弃了独立的区域提议生成阶段,直接从特征图预测边界框和类别概率,极大地提升了计算效率。代表作包括首次实现统一回归框架的YOLO、利用多尺度特征图预测的SSD,以及通过Focal Loss解决正负样本严重不平衡问题的里程碑式工作RetinaNet。此外,YOLO系列(从YOLOv2到YOLOv4)通过引入锚点机制、多尺度训练和路径聚合网络等技术创新,不断在速度和精度之间寻求最佳平衡,使其成为实时应用领域的主流选择。值得注意的是,对锚点机制固有局限性的反思,促使了卷积神经网络(CNN)基的锚点自由(Anchor-Free)检测器的另一范式转变。这类方法不再依赖预定义的锚点框,而是通过预测物体关键点(如角点、中心点)来回归物体属性。CornerNet、CenterNet和FCOS等是该方向的代表,它们简化了检测流程并消除了锚点带来的超参数敏感性问题。
近年来,深度学习领域的另一重大进展是Transformer架构从自然语言处理向计算机视觉的迁移。基于Transformer的检测器逐渐成为与卷积神经网络(CNN)并驾齐驱的强大替代方案。此类检测器可分为两类主干框架。一类是基于Transformer的集合预测(Set Prediction)模型,其开山之作DETR将目标检测重新定义为直接集合预测问题,通过二分图匹配机制彻底摒弃了锚点框和非极大值抑制(NMS)等人工组件,实现了真正的端到端检测。尽管DETR面临训练收敛慢和小目标检测不佳的挑战,其后续变体,如引入了可变形注意力的Deformable-DETR、通过去噪训练稳定匹配过程的DN-DETR、利用动态锚点盒加速收敛的DAB-DETR,以及结合多种优势达到顶尖性能的DINO等,均在不同方向上完善了这一框架。另一类是基于Transformer的主干网络(Backbone)用于检测,这类方法将Transformer架构(如ViT、Swin Transformer)作为强大的特征提取网络,嵌入到传统的检测框架中,利用其出色的全局上下文建模能力来增强特征表示。
在关键技术方面,该综述详细探讨了四个方面。第一,特征提取网络是系统的基础组件,从早期的AlexNet、VGGNet到影响深远的ResNet及其后的EfficientNet等轻量化网络,卷积神经网络结构不断演化。同时,以ViT和Swin Transformer为代表的Transformer架构,通过自注意力机制和层次化设计,为特征提取提供了全新视角。第二,损失函数是模型训练的优化目标,由分类损失和边界框回归损失组成。分类损失方面,Focal Loss的核心创新在于引入调制因子,动态降低易分类样本的损失贡献,迫使模型聚焦于难例,有效解决了前景-背景类别不平衡问题。边界框回归损失方面,从Smooth L1 Loss发展到IoU Loss及其一系列变体(GIoU, DIoU, CIoU等),通过直接优化预测框与真实框的交并比,解决了L1损失中分别回归各顶点带来的不一致问题,显著提升了定位精度。第三,多尺度特征处理是检测不同大小目标的关键,论文对比了无融合、单向融合和双向融合等不同的特征金字塔构建策略。第四,标签分配策略决定了训练中哪些预测框被视为正样本。近年来的研究重点已从静态分配策略(如基于IoU的固定阈值法)转向能够根据模型当前状态和学习进度动态调整正负样本的动态分配策略,如SimOTA等,这为提升检测器性能提供了新的思路。
最后,该综述指出了目标检测领域当前面临的挑战和未来研究方向。这包括对轻量化模型的持续追求,以满足移动设备和边缘计算场景的需求;随着DETR等模型的成功,端到端检测成为热门趋势,旨在完全消除人工设计的组件,简化流程;在数据标注成本高昂的现实下,弱监督和无监督学习方法显得尤为重要;此外,提升模型的可解释性、探索更高效的神经架构搜索(NAS)技术,以及扩展在3D目标检测等复杂任务中的应用,均是未来有价值的研究方向。
总而言之,这篇综述全面而深入地剖析了从卷积神经网络(CNN)到视觉Transformer时代目标检测技术的演进历程。其价值在于不仅为初学者清晰勾勒了该领域的技术发展脉络与理论基础,也为资深研究人员提供了关于最新技术突破、关键挑战和未来趋势的系统性参考。论文通过对比分析不同技术路线的优缺点,强调了当前领域正朝着更高效、更统一、更智能的端到端范式发展的重要观点,对于推动目标检测技术的持续创新和实际应用部署具有重要的指导意义。