分享自:

基于混合注意力的多尺度自动编码器算法用于织物缺陷检测

期刊:Coloration TechnologyDOI:10.1111/cote.12725

本文提出了一种基于混合注意力多尺度无跳跃U型深度卷积自编码器(mixed-attention-based multi-scale non-skipping U-shaped deep convolutional autoencoder, MADCAE)的织物缺陷检测模型。该研究由西安工程大学电子信息学院的张宏伟(Hongwei Zhang)、吴燕姿(Yanzi Wu)、李鹏飞(Pengfei Li),北京理工大学医学工程研究所的陆帅(Shuai Lu)以及杭州师范大学数学学院的姚乐(Le Yao)共同完成,发表于 Coloration Technology 期刊2024年第140卷第3期,页码451至466。研究得到了国家自然科学基金(项目号62003300、61803292)、陕西省重点研发计划(项目号2021GY-311)和西安工程大学研究生科研创新基金(项目号chx2022011)的资助。研究旨在解决色织织物生产过程中缺陷检测的难题,特别是在复杂纹理背景下传统方法难以有效重建和定位缺陷区域的问题。

从学术背景来看,色织织物因其美观多变的花型在服装和工业制造中应用广泛,但其生产过程中由于操作不当、机器故障等原因不可避免地会产生破洞、断头、双纱等缺陷,这些缺陷会导致织物价格下降45%至65%。目前缺陷检测主要依赖人工目视检查,效率低且结果不稳定。传统机器学习方法仅适用于单一颜色图案的织物,难以适应复杂多变的色织织物生产场景。基于深度学习的无监督方法因无需大量缺陷标记样本而受到广泛关注,其中自编码器是最常用的无监督缺陷检测方法之一。然而传统自编码器结构简单,难以获取图像的深层信息和特征,且卷积层对每个像素同等对待,难以提取更具代表性的像素信息,导致复杂纹理背景图像重建效果差,直接影响检测性能。自注意力机制虽然能够捕获更大感受野和上下文信息,但计算复杂度高,且常忽略通道信息。针对这些问题,本文提出了MADCAE模型,旨在通过混合注意力机制和多尺度特征融合提升缺陷检测精度。

在研究 workflow 方面,MADCAE模型主要包括训练阶段和测试阶段。训练阶段首先输入一张分辨率为256×256的三通道无缺陷色织织物样本图像,经过两次2×2下采样和高斯模糊操作,分别得到分辨率为128×128和64×64的图像。三张不同尺度的输入图像分别叠加相同比例的椒盐噪声,其中噪声叠加概率p设为0.9,盐点像素值为255、椒点像素值为0,二者出现概率各为0.5。随后三张噪声图像被送入编码器中的相应卷积块进行特征提取和特征融合。编码器浅层使用由大核注意力(large kernel attention, LKA)模块与3×3卷积结合的卷积块替代传统二维卷积,LKA通过将13×13的大核卷积分解为5×5深度卷积、扩张率为3的5×5深度扩张卷积和1×1卷积,以扩大感受野并评估当前像素周围像素的重要性。编码器深层使用ACmix模块,该模块通过1×1卷积将输入特征投影为中间特征集,再分别以自注意力机制和卷积两种范式聚合特征,并通过可学习偏置标量α和β融合两种输出,从而同时关注通道和空间信息,减少编码过程中的信息丢失。每层编码器包含卷积层,卷积核大小为3、填充为1、步长为1,dropout率为0.4。解码器每层使用两个反卷积,卷积核大小为3、填充为1、步长为1,输出与对应输入层分辨率相同的图像。三个不同尺度的特征图经过3×3卷积和上采样操作后均恢复至256×256分辨率,最终重建结果由三张重建图相加取平均得到。模型训练使用L1损失函数,优化器为Adam,学习率为2e-4,训练轮数为15000,批大小为8。测试阶段将待检测的色织织物图像输入训练好的模型,模型对缺陷区域进行修复重建,输出重建图。随后对原始图像和重建图像进行灰度化和高斯滤波处理,灰度化公式为x_gray = 0.2125x_r + 0.7154x_g + 0.0721x_b,高斯滤波采用3×3卷积核。接着计算残差图,并使用自适应二值化阈值方法过滤随机噪声,阈值t = μ + kσ,其中μ和σ分别为残差图的均值和标准差,k取3.75。最后通过先腐蚀后膨胀的开运算数学形态学处理得到最终缺陷检测结果。实验使用YDFID-1数据集,该数据集包含19种不同花型的色织织物图像共3830张,分辨率为512×512×3,其中无缺陷图像3500张,缺陷图像330张。实验选取其中10种花型(sl1、sl5、sl14、sl15、cl1、cl2、cl12、sp3、sp5、sp24)进行训练和测试,这些花型分为简单格子(simple lattices, SL)、条纹图案(stripe patterns, SP)和复杂格子(complex lattices, CL)三类。评估指标包括精确率(precision, P)、召回率(recall, R)、准确率(accuracy, ACC)、F1分数和交并比(intersection over union, IoU)。

实验结果显示,在图像重建方面,与DCAE、UDCAE、MSDCAE、MSUDCAE和AFFGAN五种模型相比,MADCAE能够在sl5、cl1和sp3三种数据集上有效进行纹理重建和缺陷区域修复,重建效果优于其他模型。在缺陷检测定性分析中,MADCAE在sl1、sl14、cl1、cl2、cl12、sp3、sp5和sp24八个数据集中能够准确定位缺陷区域,仅在sl5和sl15数据集中存在漏检情况。在定量分析中,MADCAE在P、ACC、F1和IoU四项指标上取得了10种花型中最高的平均结果,分别为59.158%、99.004%、55.927%和41.800%,但其平均召回率R为64.417%,比MSDCAE的65.610%低1.193%。消融实验表明,同时使用LKA和ACmix混合注意力模块时,模型在P、R、ACC、F1和IoU上分别达到59.158%、64.417%、99.004%、55.927%和41.8%,优于仅使用其中一种注意力模块的结果,说明同时考虑空间和通道信息有助于特征提取和缺陷重建。此外,无跳跃连接结构的模型在五项指标上均优于有跳跃连接结构的模型,其中P从43.05%提升至59.158%,IoU从18.37%提升至41.8%,说明跳跃连接结构会将浅层编码特征直接传递至解码层,导致缺陷区域低频信息在输出中被保留,从而影响重建性能。

研究的结论是,MADCAE模型通过混合注意力机制和多尺度无跳跃U型结构,能够在不依赖大量缺陷标记样本的情况下有效重建色织织物的纹理和花型,并快速检测和定位缺陷区域,检测精度满足色织织物缺陷检测需求。该研究为色织织物制造行业提供了一种便捷有效的自动缺陷检测方案。未来工作将进一步改进缺陷边缘不确定区域的重建效果。本文的亮点在于:第一,将LKA大核注意力分解与ACmix卷积-自注意力混合模块结合,用于编码器的浅层和深层特征提取,同时关注空间和通道信息,有效缓解了传统自编码器对每个像素同等对待的问题;第二,摒弃了U-Net的跳跃连接结构,避免了浅层缺陷特征直接传递至解码层导致的重建性能下降;第三,采用多尺度输入策略,通过不同分辨率图像的编码融合,学习更丰富的特征信息。这些创新使得模型在复杂纹理背景下的织物缺陷检测中表现出较强的竞争力和应用价值。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com