分享自:

你只需看一次:统一的实时目标检测

期刊:2016 IEEE Conference on Computer Vision and Pattern RecognitionDOI:10.1109/CVPR.2016.91

本文是Joseph Redmon、Santosh Divvala、Ross Girshick与Ali Farhadi等人提出YOLO(You Only Look Once)目标检测模型的原始研究论文,作者来自University of Washington、Allen Institute for AI和Facebook AI Research,论文于2016年发表在IEEE Conference on Computer Vision and Pattern Recognition(CVPR)上。该研究属于计算机视觉与深度学习领域,核心目标是将目标检测从传统的多阶段流水线转化为单一的回归问题,从而实现实时且统一的检测框架。

在研究背景方面,此前主流的目标检测方法通常复用分类器来执行检测任务。例如可变形部件模型(Deformable Parts Models,DPM)采用滑动窗口方式在图像上均匀运行分类器,而R-CNN系列方法则先通过区域提议(region proposal)生成潜在边界框,再对各个提议区域运行分类器,并借助后处理来细化边界框和消除重复检测。这些复杂流水线不仅速度较慢,而且由于各组件需要单独训练,整体优化较为困难。YOLO的提出旨在解决这一问题,其核心思想是将目标检测重新定义为一个从图像像素直接到边界框坐标和类别概率的回归问题,使得单一神经网络在一次评估中即可同时预测多个边界框及其类别概率。由于整个检测流程被整合为一个网络,因此可以直接以检测性能为目标进行端到端优化。

在研究方法与工作流程上,YOLO将输入图像划分为一个S×S的网格。如果一个物体的中心落入某个网格单元,那么该单元负责检测该物体。每个网格单元预测B个边界框以及这些框的置信度(confidence),置信度定义为Pr(Object)∗IOU(truth, pred),即该框包含物体的概率与预测框和真实框的交并比(Intersection over Union,IOU)的乘积。每个边界框包含5个预测值:中心坐标x、y,宽度w、高度h,以及置信度。其中x和y表示相对于网格单元边界的位置,w和h则相对于整幅图像进行预测。此外,每个网格单元还预测C个条件类别概率Pr(Class_i|Object),并且每个网格单元只预测一组类别概率,而不考虑该单元中边界框的数量。在测试阶段,条件类别概率与单个边界框的置信度相乘,得到每个框的类别特定置信度分数,该分数同时编码了目标类别出现的概率以及预测框与物体的匹配程度。

在Pascal VOC数据集上评估时,该研究使用S=7、B=2,类别数C=20,因此网络最终输出为7×7×30的张量。网络设计受到GoogLeNet图像分类模型的启发,包含24个卷积层和2个全连接层。与GoogLeNet的inception模块不同,YOLO使用1×1约简层后再接3×3卷积层。作者还训练了一个快速版本Fast YOLO,其网络仅包含9个卷积层且滤波器数量更少,其他训练和测试参数与YOLO一致。在训练过程中,网络首先在ImageNet 1000类分类任务上进行预训练,使用的输入分辨率为224×224,随后将输入分辨率提升到448×448以适应检测任务,并添加四个卷积层和两个全连接层。训练损失函数采用多部分平方和误差,同时引入λ_coord=5和λ_noobj=0.5来增强边界框坐标误差的权重并降低不含物体的网格单元的置信度误差权重,从而缓解类别不平衡问题。此外,损失函数对边界框宽度和高度取平方根进行预测,以减轻大框和小框误差被同等对待的问题。每个网格单元预测多个边界框时,训练阶段只选择一个与真实框IOU最高的预测器负责该物体,以促进预测器的专业化。

实验部分首先在Pascal VOC 2007上比较了YOLO与其他实时检测系统。结果显示Fast YOLO达到155帧每秒(FPS),map为52.7%,是此前实时检测器的两倍以上;YOLO达到45 FPS,map为63.4%。使用VGG-16的YOLO模型虽然准确率更高,但速度显著下降。在错误分析中,YOLO的定位错误(localization error)占比较高,但在背景误检(background false positives)方面显著少于Fast R-CNN。具体而言,Fast R-CNN的前若干检测中有13.6%为背景误检,而YOLO的错误中背景误检仅占4.75%。进一步实验表明,将YOLO与Fast R-CNN结合,可以利用YOLO对背景的抑制能力来重新评分Fast R-CNN的检测结果,从而将Fast R-CNN的map从71.8%提升到75.0%,提升幅度为3.2%。在Pascal VOC 2012上,YOLO单独得分为57.9% map,而Fast R-CNN+YOLO组合达到70.7% map,位列排行榜前列。此外,为评估跨域泛化能力,论文在Picasso和People-Art两个艺术图像数据集上进行了人物检测实验。结果表明,R-CNN在从自然图像泛化到艺术图像时AP明显下降,DPM虽然下降较少但起点较低,而YOLO在保持较好VOC 2007精度的同时,AP下降幅度更小,说明YOLO能够学习到更通用的物体表示。

论文的核心结论是,YOLO作为一个统一的目标检测模型,结构简单并且可以直接在完整图像上进行训练。与基于分类器的方法不同,YOLO的训练损失函数直接对应检测性能,且整个模型是联合训练的。Fast YOLO是文献中最快的通用目标检测器,YOLO则推动了实时目标检测的最新水平。由于YOLO对新领域具有良好的泛化能力,它适合需要快速且鲁棒的目标检测应用。此外,作者还对YOLO的局限性进行了讨论,例如由于每个网格单元只能预测两个边界框且只能有一个类别,模型对成群出现的小物体检测能力有限;由于网络包含多个下采样层,用于边界框预测的特征相对粗糙;同时损失函数对小框和大框的误差处理相同,使得小框中的小误差对IOU影响更大。作者开源了训练和测试代码,并提供了多种预训练模型,这为后续研究和实际应用提供了重要基础。总体来看,YOLO的提出不仅在方法上实现了从多阶段管线到单阶段回归的范式转变,还在实时性与准确率之间提供了新的平衡,对后来的目标检测研究产生了深远影响。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com