本文提出了一种用于织物缺陷检测的新型显著性模型ACCTNet,由杨瑞敏、郭娜、田博、王俊普、刘善亮和于淼等人完成,作者分别来自中原工学院信息与通信工程学院和河南轻工职业学院机电工程学院。论文发表于 *Journal of Engineered Fibers and Fabrics*,2024年第19卷,DOI为10.1177/15589250241258272,文章于2024年4月11日投稿,2024年5月15日被接收。
在纺织制造过程中,由于材料问题或机器故障,织物不可避免地会出现断经、污渍、缺纱等缺陷,导致资源浪费和经济损失。传统的织物缺陷检测主要依靠人工目视检查,但该方法受光照、疲劳和检验员经验影响较大,难以提供稳定可靠的检测结果。随着计算机视觉技术的发展,自动视觉检测方法逐渐成为织物缺陷检测的重要方向。传统的自动检测方法大致可分为基于统计、结构、频谱、模型、学习以及混合方法等几大类,但这些方法大多依赖手工设计的低级特征和启发式线索,缺乏对高层语义信息的利用,适应性和泛化能力不足。视觉显著性检测通过模拟人类视觉系统快速定位显著目标,在织物缺陷检测中展现出潜力。近年来,基于深度学习的显著性目标检测(salient object detection,SOD)模型逐渐取代传统方法,取得了显著的性能提升。然而,大多数现有的SOD模型仅基于卷积神经网络(CNN),无法显式地学习具有长程依赖关系的全局上下文信息。视觉Transformer(vision transformer)通过自注意力机制能够建模图像的长距离依赖关系,但在织物缺陷检测中的应用仍较少。
为了解决上述问题,本文提出了一种结合CNN和视觉Transformer各自优势的显著性模型ACCTNet。该模型主要包含三个部分:编码器网络(encoder network)、相邻上下文协调模块(adjacent context coordination module)和对比度聚合模块(contrast-aggregation module)。编码器网络采用VGG16作为骨干网络,去掉最后一个池化层和三个全连接层,包含五个卷积块,分别提取conv1-2、conv2-2、conv3-3、conv4-3和conv5-3的特征图。输入图像尺寸统一为352×352×3,各卷积块输出特征图尺寸分别为输入的1/2、1/4、1/8、1/16和1/32。相邻上下文协调模块由三个分支组成,中间为局部分支(local branch),两侧为相邻分支(adjacent branches),用于协调前一个、当前和后一个编码器块之间的跨尺度特征。局部分支首先使用感受野块(receptive field block,RFB)通过四个空洞卷积扩大感受野并提取多感受野特征,随后使用坐标注意力(coordinate attention,CA)模块对特征进行自适应细化,以捕获跨通道信息以及方向感知和位置感知信息,从而更准确地定位缺陷区域。相邻分支分为前向到当前分支和后续到当前分支,分别通过空间注意力(spatial attention,SA)对下采样或上采样后的特征进行加权,并与当前特征进行逐元素相乘。最后将各分支输出与输入特征逐元素相加,实现多尺度上下文信息的有效融合。对比度聚合模块通过平均池化和减法操作计算每个特征与其局部邻域之间的差异,以突出低对比度背景下的缺陷区域。同时,将编码器网络最后四个侧输出通过堆叠的Transformer块进行全局上下文信息建模。具体做法是先将后四层特征下采样至相同尺度并沿通道维度拼接,然后经过线性投影和多头自注意力等操作提取长程依赖关系。最后,通过渐进式上采样过程将局部特征、对比度特征、前一层融合特征和全局特征进行融合,生成最终的缺陷预测图。模型的损失函数采用多级深度监督策略,以指导网络生成更准确的预测结果。
实验在平纹织物数据集和花纹织物数据集上进行。平纹织物数据集包含2200张训练图像和500张测试图像,涵盖压痕、折痕、脱纬、污渍和破洞五类主要缺陷,其中包含大量低对比度的细长缺陷和微小缺陷。花纹织物数据集包含5948张训练图像和500张测试图像,背景纹理更复杂,包含缺纱、断纱、纱线、棉球、破洞和污渍六类缺陷。评价指标采用精度-召回曲线(PR曲线)、F-measure曲线、最大F-measure(Fβ)、平均绝对误差(MAE)、S-measure(Sm)和E-measure(Em)。在定量比较中,ACCTNet在平纹和花纹织物数据集上分别取得了78.49%和97.19%的Em值,显著优于12种现有最先进的显著性目标检测方法(包括NLDF、DSS、PiCANet、R3Net、BASNet、PoolNet、GateNet、F3Net、C2FNet、PSGLoss、TPRNet和ICON)。在平纹数据集上,ACCTNet的Fβ为0.6511,MAE为0.0040,Sm为0.7239,Em为0.7849;在花纹数据集上,Fβ为0.9077,MAE为0.0064,Sm为0.9208,Em为0.9719。PR曲线和F-measure曲线也表明ACCTNet在两个数据集上均优于其他方法。此外,ACCTNet的参数量仅为26.72M,运行速度为27 fps,在参数量和速度方面优于大多数对比方法。定性分析显示,ACCTNet在检测点状缺陷、线状缺陷、较大缺陷、不规则缺陷以及低对比度缺陷时,均能生成区域一致性高、边界清晰的检测结果,优于其他对比方法。
消融实验在平纹织物数据集上验证了三个主要组件的有效性。首先,将编码器网络从VGG16替换为ResNet50和Res2Net,结果表明使用VGG16时性能最佳,但不同骨干网络的结果差异不大,说明模型具有较好的鲁棒性。其次,仅使用相邻上下文协调模块、对比度聚合模块或Transformer块中的单一组件时,相邻上下文协调模块的性能最好,而仅使用Transformer块的网络性能最差,表明局部纹理信息比全局上下文信息更重要。当三个组件结合使用时,模型性能显著提升,证明局部纹理信息和全局上下文信息的有效融合对织物缺陷检测至关重要。此外,对Transformer块数量的实验表明,当使用4个Transformer块时模型性能最佳,超过4个后性能逐渐下降,可能是因为信息冗余。最后,比较了多级监督和单级监督两种学习策略,结果表明多级监督策略在Fβ、MAE、Sm和Em上均有提升,能生成定位更准确、区域更完整、轮廓更清晰的预测图。
本文的主要结论是,ACCTNet通过协调相邻尺度的局部特征、聚合对比度信息以及引入视觉Transformer提取全局上下文语义知识,能够在平纹和花纹织物上高效准确地检测缺陷。该模型在检测精度和效率之间取得了较好的平衡,参数少、速度快,在纺织工业质量控制中具有一定的应用价值。同时,作者指出由于ACCTNet属于监督学习方法,需要大量像素级标注的缺陷样本,这限制了其在缺陷样本稀缺的工业场景中的应用。因此,未来将探索基于图信号处理理论的半监督织物检测方法,以减少对标注数据的依赖。