这是一篇发表于2025年4月9日的综述文章,题为《基于CNN的2D目标检测技术:综述》(CNN Based 2D Object Detection Techniques: A Review),作者为Badri Raj Lamichhane、Gun Srijuntongsiri和Teerayut Horanont,均来自泰国国立法政大学诗琳通国际理工学院的信息、计算机与通信技术学院。文章发表在开放获取期刊《Frontiers in Computer Science》上。该综述全面回顾并评估了基于卷积神经网络(Convolutional Neural Networks, CNN)的目标检测技术,重点分析了深度学习在提升模型性能方面的进展。
文章首先阐述了目标检测的学术背景和重要性。目标检测作为计算机视觉的核心范式,旨在精确识别并定位数字图像或视频流中的物体。这项技术的关键意义在于自动化并增强以往依赖人类视觉评估的流程,应用遍及自动驾驶中的行人及车辆检测、医疗影像中的肿瘤识别、制造业的质量控制以及监控系统的安全提升等多个领域。早期的方法依赖手工设计的特征,如方向梯度直方图(Histogram of Oriented Gradients, HOG)和尺度不变特征变换(Scale-Invariant Feature Transform, SIFT),这些方法虽有效,但在处理小物体、遮挡和复杂背景时存在局限。随着深度学习,特别是CNN的兴起,目标检测领域实现了革命性突破,CNN能够从大规模数据中学习复杂的层次化特征,显著提升了检测的精度和鲁棒性。文章指出,该综述的目的在于通过对一阶段(1-stage)、二阶段(2-stage)和混合(hybrid)方法进行分析,深入了解CNN目标检测系统在架构、骨干网络设计和损失函数上的方法论,以帮助研究者和实践者在设计和实施系统时做出明智决策。
文章的主体部分对目标检测技术进行了系统性的分类和详细阐述。它将当代基于CNN的通用目标检测技术主要分为三大类:一阶段(回归式)框架、二阶段(区域式)框架以及融合二者优势的混合框架。
关于一阶段检测框架,其核心理念是追求速度,通过单次前向传播直接预测物体的类别和边界框坐标,跳过了独立的区域提议步骤,因此特别适用于实时应用。文章详尽列举并剖析了该类别下的代表性模型。首先是YOLO(You Only Look Once)系列,这是该框架的典型代表。从最初的YOLOv1开始,它将输入图像划分为网格,每个单元格负责预测边界框和置信度。后续版本不断进化,YOLOv2引入了锚框(anchor boxes)和多尺度训练以提升精度;YOLOv3采用了更深的Darknet-53骨干网络和特征金字塔网络(Feature Pyramid Network, FPN)来改善多尺度预测;YOLOv4则整合了CSPDarknet53骨干、空间金字塔池化(Spatial Pyramid Pooling, SPP)和路径聚合网络(Path Aggregation Network, PAN)等技术,进一步平衡了速度与精度。YOLOv5到YOLOv11等更高版本则不断引入如层聚焦、多尺度特征融合、姿态估计、基于Transformer的特征提取等先进技术,持续提升对小目标、遮挡物体的检测能力,并优化了计算效率。除YOLO外,单次多框检测器(Single Shot Multibox Detector, SSD)也是关键模型,它利用不同尺度的特征图上的预定义锚框进行检测,在处理速度和准确率之间取得了很好的平衡。另一个重要革新是RetinaNet,它通过引入Focal Loss损失函数,解决了训练过程中正负样本(背景与物体)严重不平衡的问题,使得单阶段检测器在保持速度快的同时,达到了可与二阶段方法媲美的精度。
关于二阶段检测框架,其特点是“先粗后精”,将检测过程分为两个步骤。第一步是通过区域提议网络(Region Proposal Network, RPN)生成可能包含物体的候选区域;第二步是对这些候选区域进行精细的分类和边界框回归。这一框架通常能实现比一阶段方法更高的检测精度,但计算成本和时间成本也更高。文章系统地回顾了该框架从R-CNN到Mask R-CNN的演进历程。开创性的R-CNN使用选择性搜索(selective search)生成候选区域,然后利用CNN提取特征,最后通过支持向量机(Support Vector Machine, SVM)进行分类。它的主要缺陷在于计算冗余、速度慢。空间金字塔池化网络(SPPNet)通过引入空间金字塔池化层,解决了CNN要求固定尺寸输入的问题,可接受任意大小的图像,并提升了速度。Fast R-CNN继而引入了感兴趣区域池化(Region of Interest Pooling, RoI pooling),使得每个候选区域可以共享卷积特征,极大减少了计算量,并实现了多任务联合训练。Faster R-CNN则里程碑式地设计了RPN,将其与整个检测网络融为一体,实现了端到端训练,在速度和精度上都取得了质的飞跃。Mask R-CNN在Faster R-CNN的基础上增加了一个用于像素级实例分割的分支,通过提出RoI Align技术解决了RoI Pooling中的特征错位问题,能同时输出目标检测框和高精度的物体掩膜,成为实例分割领域的标杆。此外,文章还介绍了特征金字塔网络,它通过自下而上和自上而下两条路径,构建了富含高级语义和低级空间细节的多尺度特征图,有效解决了小目标检测的难题。其他如CentripetalNet和TridentNet则分别从关键点检测和多分支尺度感知的角度,为二阶段框架提供了新的思路。
关于混合方法,其目标在于结合一阶段和二阶段框架的优势,力求在速度、计算复杂度和精度之间达到最优平衡。例如,Cascade R-CNN通过级联多个检测头,利用不同的交并比(Intersection over Union, IoU)阈值逐步精细化边界框,以更高的计算成本换取精度的显著提升。Libra R-CNN则尝试在同一个系统中依据置信度分数交替使用一阶段和二阶段方法。此外,一些NAS-FPN等算法利用神经架构搜索(Neural Architecture Search, NAS)自动设计性能最优的特征金字塔结构。
文章在结尾部分总结了这些研究的价值与意义。它明确指出,虽然二阶段和混合方法在准确度和检测精度上拥有优越性,但一阶段方法凭借其更快的处理速度和更低的计算复杂性,在特定的实时应用场景中具有显著优势。这篇综述的贡献在于,它为学术界和工业界选择和应用不同技术路线提供了清晰的决策指导。通过详尽辨析各类方法的架构、骨干网络、性能表现及其内在的权衡关系,该研究不仅梳理了目标检测领域从传统手工特征到现代深度学习模型的发展脉络,也指出了当前存在的挑战和未来的研究方向,如如何在复杂场景下进一步提升小目标、遮挡目标与多形变目标的检测鲁棒性。这项工作对于推动计算机视觉技术在自动驾驶、智能监控、医疗诊断等前沿应用的落地具有重要的参考价值和实践意义。