本研究由深圳大学计算机与软件工程学院的何东方、文嘉俊和赖志辉共同完成,论文发表于《AATCC Journal of Research》2021年人工智能特刊(Artificial Intelligence Conference, Vol. 8, Special Issue One)。
研究背景
纺织品质量检测是服装工业中的关键环节。传统的人工目视检验存在劳动强度大、人力成本高、漏检率高等严重弊端。尽管基于计算机视觉的自动检测技术提供了一条有前景的路径,但以往的统计方法(如灰度共生矩阵GLCM和局部二值模式LBP)以及基于滤波器的方法(如Gabor和Sobel滤波)均存在局限性。统计方法难以从多样化的纺织材料中提取有效特征,无法获得鲁棒性(鲁棒性,robustness)强的表征;而基于滤波器的方法则面临参数调节困难、计算复杂度高等问题,难以实际应用。
近年来,基于卷积神经网络(Convolutional Neural Network, CNN)的深度学习目标检测算法在计算机视觉领域表现出色。其中,Faster R-CNN(Faster R-CNN)作为检测精度最高的两阶段目标检测网络之一,能有效提取纺织图像中前景与背景区分不明显的抽象特征。然而,原始Faster R-CNN仅利用顶层特征图进行预测,丢失了低层网络丰富的位置信息,对于小尺度缺陷及狭长形缺陷的检测能力不足。本研究旨在解决纺织织物缺陷检测中有效特征提取的难题,提出一种基于改进Faster R-CNN的纺织缺陷检测模型,以提高对各类缺陷,尤其是小目标和狭长目标的检测精度。
详细研究流程
研究团队首先对样本数据进行了系统准备与增强。研究所用的数据集共三个,均由香港理工大学纺织及制衣学系和香港浸会大学提供。数据集1包含1127个正样本和1000个负样本;经数据增强(包括水平或垂直翻转、添加高斯模糊和“椒盐”噪声)后,数据集2包含317个正样本;数据集3则包含329个正样本。所有图像尺寸均为256x256像素,并被制作成适用于Faster R-CNN训练和测试的VOC2007格式。
在模型构建的第一阶段,研究团队采用ResNet-101深度卷积网络进行整体图像的缺陷特征提取。网络的核心改进之一是引入了特征金字塔网络(Feature Pyramid Network, FPN),以此来解决原始Faster R-CNN仅依赖顶层特征而丢失低层位置信息的问题。FPN采用了自底向上、自顶向下及横向连接的多尺度融合架构,将高层的强语义信息通过上采样与低层的精确位置信息进行特征融合,并对每一层进行独立预测,从而显著增强了对小目标的检测能力。
在特征提取之前,研究团队应用了K-means聚类分析算法来确定预设锚框(Anchor)的比例。在原始Faster R-CNN中,锚框的宽高比固定为1:2、1:1和2:1。但通过对训练样本进行聚类分析,研究发现部分缺陷样本的目标宽高比极为悬殊,甚至达到约5:1。因此,模型将锚框的宽高比比例值优化调整为(0.25, 0.5, 1, 2, 4)共五种,包括新增的1:4和4:1比例,使生成的边界框能更准确地匹配真实数据集中狭长缺陷的形状。
特征图经FPN多尺度映射后,被输入区域提议网络(Region Proposal Network, RPN)以生成候选区域。本模型在此后用两个关键组件替代了原始Faster R-CNN的相应模块。第一,使用兴趣区域对齐(Region of Interest Align, ROI Align)替代了兴趣区域池化(ROI Pooling)。ROI Pooling在操作中存在两次量化过程,即先将浮点数坐标量化为整数,再进行区域平均分割时的量化,导致候选框位置与回归结果之间产生偏差,这对小目标检测尤为不利。ROI Align则取消了量化操作,通过双线性插值法计算每个分割单元的固定坐标位置,再执行池化,从而保留了精确的浮点级空间信息,提升了对小缺陷的定位精度。第二,使用软化非极大值抑制(Soft Non-Maximum Suppression, Soft-NMS)替代了传统的非极大值抑制(NMS)。当数据集中出现两个或多个目标紧密相邻、检测框高度重叠时,传统NMS的贪心策略会简单地将得分较低的重叠框得分置零并删除,这可能导致真实目标被误删。Soft-NMS则设定了一个衰减函数,对于与最高分检出框M重叠的其他检出框,其得分依据与M的交并比(Intersection over Union, IoU)大小进行相应衰减,而非直接清零。重叠程度越高,得分衰减越大。该机制能有效保留因高度重叠而被误抑制的相邻真实目标的检测框,降低了误检率。
最终,经过ROI Align池化和Soft-NMS抑制后的特征被送入全连接层,通过Softmax损失函数和L1损失函数分别完成缺陷的分类和边界框的位置回归。
主要实验结果
研究者在TensorFlow 1.8深度学习框架下,使用配置为Intel Core i7-7820 CPU、62GB内存及GeForce GTX 1080Ti GPU的服务器进行训练,模型基于ResNet-101迭代5000次,学习率设为0.001。实验对比了所提模型与YOLOv2(以Darknet19为骨干网络)和原始Faster R-CNN(以ResNet-101为骨干网络)在三个数据集上的性能。
在数据集1上,本方法的均值平均精度(Mean Average Precision, mAP)达到82.6%,召回率为85.0%,均优于YOLOv2的81.5%和84.6%以及原始Faster R-CNN的76.8%和79.2%。在数据集2上,本方法的mAP高达96.6%,召回率为94.2%,显著优于原始Faster R-CNN的85.0%和93.9%。在数据集3上,本方法的mAP达到最高的98.3%,召回率为96.2%。综合来看,本改进方法在三个数据集上的mAP均为最高,证明了模型的有效性。消融实验分析表明,FPN的加入虽然对整体mAP的提升约为3%,但能有效改善小缺陷的检测精度;调整锚框比例能有效增强对狭长目标的检测;Soft-NMS在目标重叠时能有效减少真实目标检测框的丢失,但在重叠不明显时效果与NMS基本无差别。效率分析显示,由于加入FPN后特征维度大幅减少,所提模型的单张样本检测时间为0.196秒,与未使用FPN的原始Faster R-CNN的0.198秒持平,基本实现效率翻倍的同时保持了精度优势。
研究结论及价值
本研究通过实验证明,将FPN、ROI Align和Soft-NMS集成到Faster R-CNN检测框架中,所构建的改进模型相较于原始网络有效提升了约6%的mAP值,实现了98%的检测准确率和85%的均值平均精度,其性能优于当前最先进的深度学习目标检测算法。该模型对于人眼难以分辨的微小结节具有良好的检测能力,并且在纺织物前景与背景差异不明显时,仍能稳定工作,对添加的噪声也具有鲁棒性。此项研究不仅将深度学习目标检测技术成功应用于纺织工业生产,为自动织物瑕疵检测提供了高精度、高鲁棒性(鲁棒性,robustness)的解决方案,而且方法论上的创新对计算机视觉领域中小目标、重叠目标的检测问题也具有启发意义。研究者指出,未来工作将继续优化模型以进一步提高检测速度,实现更高效的实时在线检测。