分享自:

基于混合Transformer的工业纹理表面异常检测模型VitalNet

期刊:IEEE Transactions on Instrumentation and MeasurementDOI:10.1109/TIM.2023.3250225

本文提出了一种名为VitalNet的混合Transformer模型,用于工业纹理表面的异常定位。该研究由Xian Tao(中国科学院自动化研究所)、Chandranath Adak(印度理工学院巴特那分校)、Pang-jo Chun(东京大学)、Shaohua Yan(中国科学院自动化研究所)和Huaping Liu(清华大学)共同完成,发表于《IEEE Transactions on Instrumentation and Measurement》2023年第72卷。

在工业质量控制领域,基于深度学习的自动化视觉检测已受到广泛关注,尤其是在木质表面、纺织面料、钢材表面、光伏电池和卫生陶瓷等纹理表面的缺陷检测中。传统的监督学习方法面临标注成本高、缺陷样本稀缺、需预先知道所有缺陷类型以及标注噪声等问题。因此,无监督异常定位方法逐渐成为研究热点。与仅需判断图像类别的异常检测不同,异常定位需要在仅使用无缺陷样本训练的情况下,分割出像素级的缺陷区域。现有的方法主要分为两类:基于图像重建的方法和基于特征嵌入的方法。基于图像重建的方法(如自编码器和生成对抗网络)通过学习正常样本的分布来重建输入图像,并通过比较原始图像与重建图像的差异来定位异常,但这类方法往往在正常区域重建效果差或异常区域重建效果好的问题上表现不佳。基于特征嵌入的方法利用预训练深度网络提取特征,通过比较目标图像与正常图像的特征来生成异常图。然而,卷积神经网络(CNN)受限于局部感受野,难以有效建模长距离依赖关系,导致对大尺寸或长跨度异常定位效果不佳。虽然已有一些方法尝试结合全局和局部信息,如分块策略或多层特征融合,但仍存在诸多限制。

VitalNet的提出正是为了解决上述问题。该模型由两个主要模块组成:特征表示模块和异常估计模块。在特征表示模块中,研究采用了Vision Transformer(ViT)来提取局部判别特征,同时利用其全局语义捕获能力。输入图像被分割成多个块(patch),经过线性投影得到块嵌入,并加入位置嵌入后送入Transformer编码器。与CNN架构中需要精心选择和融合多层特征不同,VitalNet仅使用ViT中间层(第九层)的特征,并将其重塑为特征图,供后续模块使用。这一设计充分利用了ViT对全局上下文的感知能力,避免了多层特征选择的复杂性。

异常估计模块是VitalNet的核心创新之一。该模块采用CNN-Transformer混合结构,以同时捕获局部和全局信息。输入特征图首先经过两个1×1卷积层,然后将结果分割成小块并转换为特征嵌入,再通过多个Transformer块构建编码器瓶颈。在解码部分,研究提出了特征金字塔解码器,通过自上而下的逐元素相加融合不同Transformer层的特征图,最后通过拼接和1×1卷积生成重建特征图。在训练阶段,仅使用正常样本,通过计算输入特征图与重建特征图之间的L2距离作为损失函数。在推理阶段,异常图通过输入特征图与重建特征图的直接差值获得。

实验部分在五个基准数据集上进行了广泛验证,包括MVTec AD-texture、KolektorSDD2、NanoTwice、MT Defect和Dot-Patterned Fabric。在MVTec AD-texture数据集上,VitalNet与多种最先进方法进行了比较,包括基于图像重建的方法、基于特征嵌入的方法和基于Transformer的方法。结果显示,VitalNet在皮革和瓷砖类别上取得了最佳性能,在木材类别上取得第二好的成绩,整体平均像素AUROC达到了最佳水平,超越竞争方法0.2%至40.7%。此外,研究还采用了像素平均精度(AP)作为评价指标,VitalNet在MVTec AD-texture的五个类别中四个类别取得了最佳AP分数,相比最先进的ViT-based方法MSTUE提升了20.7%。在其他四个数据集上,VitalNet同样表现出色,平均像素AUROC比STPM高出2%,且在Dot-Patterned Fabric上与最佳方法差距不超过0.4%。定性结果也表明,VitalNet能够准确定位不同大小和形状的异常区域,而其他方法如DFR、PaDiM、STPM和CFlow在不同数据集上存在漏检或误检的问题。

消融研究进一步验证了VitalNet各模块的有效性。在CNN与ViT有效上下文比较中,ViT的注意力机制能够聚焦于整个目标区域,而CNN的感受野随层数增加而增大但始终受限。不同ViT层的性能比较表明,第八层和第九层取得了更好的性能,中间层能够同时兼顾不同缺陷尺度,单层特征即可超越CNN多层融合的方法。不同预训练模型的比较显示,ViT-based模型(ViT-L16、ViT-L32)优于CNN-based模型(VGG16、VGG19),尤其是在瓷砖类别上。异常估计模块的对比实验表明,混合Transformer结构优于纯CNN自编码器和纯Transformer结构。Transformer层数m的评估显示,m=3时性能最佳。特征融合操作的比较表明,拼接操作比加法操作在像素AUROC上高出0.9%。样本效率实验表明,即使仅使用2%至5%的训练数据,VitalNet仍能大幅超越许多竞争方法,在皮革纹理上仅需五张正常样本即可达到99%的像素AUROC。最小检测尺寸实验表明,VitalNet在512×512输入图像上能够检测到3×3像素大小的缺陷。噪声实验表明,训练样本中的噪声不会显著影响网络性能。运行时间分析显示,VitalNet平均耗时150毫秒处理单张图像,在速度和精度之间取得了良好平衡。

该研究的科学价值在于提出了一种新颖的混合Transformer框架,首次将ViT与CNN-Transformer混合结构相结合用于异常定位,仅使用单层ViT特征即可有效学习正常样本的特征表示,避免了多层特征选择和融合的复杂性。其应用价值在于该方法在多个真实工业数据集上取得了最先进的性能,具有良好的泛化能力和实时性,能够满足工业生产中对缺陷检测的需求。研究的亮点包括:提出了灵活高效的异常估计模块,通过注意力机制和金字塔架构增强上下文感知能力;仅依赖单层ViT特征即可超越现有方法;在多个数据集上验证了方法的广泛适用性。未来研究方向包括处理复杂或非均匀纹理表面的异常定位,以及利用持续学习策略解决跨域异常定位问题。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com