本研究报告基于发表在 *Expert Systems with Applications*(2022年,第209卷,文章编号118269)上的原创研究论文《Swin-MFINet:基于Swin Transformer的多特征集成网络用于像素级表面缺陷检测》。该研究由Bingol University计算机工程系的Hüseyin Üzen、Samsun University软件工程系的Muammer Türkoğlu、Sabanci University工程与自然科学学院的Berrin Yanikoglu以及Inonu University计算机工程系的Davut Hanbay共同完成。
学术背景与研究目的
在现代制造业中,钢材、织物、大理石等产品的表面缺陷直接影响产品质量并造成经济损失。传统的人工检测方式耗时且效率低下,因此基于计算机视觉的自动化表面缺陷检测成为研究热点。该领域面临三大核心挑战:背景相似性(缺陷与背景纹理高度相似)、缺陷尺寸变异性(缺陷大小差异显著)以及低对比度(光照条件导致缺陷与背景难以区分)。早期的深度学习方法多基于卷积神经网络(CNN),虽然CNN能够提取有效的局部空间特征,但由于卷积操作的局部性限制,难以捕获全局语义信息或长程空间关系。近年来,Transformer架构凭借自注意力机制在图像分类中展现出优于CNN的全局建模能力,但其应用于分割和检测任务时仍存在不足,且对大规模训练数据有较强依赖。而表面缺陷检测数据集通常规模较小。针对上述问题,本研究提出了一种名为Swin-MFINet的新型网络模型,旨在结合预训练CNN的强特征提取能力、Swin Transformer的全局语义建模能力以及卷积层对空间细节的捕捉能力,实现高精度的像素级表面缺陷检测。
研究流程与实验方法
该研究的整体框架是一个编码器-解码器结构,并在解码器后接一个多特征集成(Multi-Feature Integration,MFI)模块。编码器部分采用在ImageNet上预训练的InceptionV3网络,利用其强大的初始特征提取能力应对小样本数据集问题。具体地,从InceptionV3的不同层级(i1、i5、i9、i14、i19)提取多尺度特征图,其中低层特征包含边缘、颜色、纹理等空间细节,高层特征包含语义信息。最后一层输出(i19)被送入瓶颈块(bottleneck),该瓶颈块由两个Swin Transformer块组成,用于从编码器输出中提取全局语义特征。
解码器部分包含四个阶段。前三个阶段均采用Patch Expanding层进行上采样,然后与编码器同尺度特征图进行拼接(Concat),再输入Swin Transformer块。Patch Expanding层通过重塑特征向量维度并进行点卷积实现分辨率提升,避免了插值操作。Swin Transformer利用窗口多头自注意力(W-MSA)和移位窗口多头自注意力(SW-MSA)在降低计算成本的同时建立不同窗口间的长程依赖关系。在解码器的最后阶段,研究者并未继续使用Transformer结构,而是用CBNReLU块(卷积+批归一化+ReLU激活)替代。这是因为Transformer在提取边缘、颜色、纹理等细粒度空间信息方面存在局限性,而卷积层能更有效地保留这些对检测微小缺陷至关重要的局部特征。
多特征集成模块受FPNet启发,将解码器四个阶段输出的特征图(ds1、ds2、ds3、ds4)通过Patch Expanding提升至同一空间分辨率后沿深度维度拼接。随后应用通道压缩-空间激励块(channel squeeze and spatial excitation block,SSE)。SSE首先对拼接特征图执行1×1卷积和Sigmoid激活生成空间注意力权重,再将权重与原始特征图逐元素相乘,从而强化对缺陷检测有重要贡献的空间位置。最后,经过CBNReLU、上采样和CBNReLU层处理后,通过1×1卷积和Sigmoid激活函数生成最终的像素级缺陷预测图。
实验使用了两个公开数据集:MT(Magnetic-Tile)数据集包含1344张图像(386张有缺陷,958张无缺陷),涵盖不平整、磨损、裂纹、气孔、断裂等缺陷类型;MVTec-Texture数据集选取了地毯、网格、皮革、瓷砖、木材五个纹理类别的共1781张图像(382张有缺陷,1399张无缺陷)。实验采用2折交叉验证,评价指标为平均交并比(mIoU)和F1分数。模型使用TensorFlow和Keras框架实现,批量大小为8,学习率为1e-4,训练100个epoch,优化器为Adam。对比方法包括LinkNet、PSPNet、FPNet、U-Net、Attention-UNet以及基于Swin Transformer的Swin-UNet。
主要实验结果
在MT数据集上,提出的Swin-MFINet取得了81.37%的mIoU和89.73%的F1分数,显著优于第二名FPNet的73.94% mIoU和85.01% F1分数。值得注意的是,同样基于Swin Transformer的Swin-UNet在该数据集上表现极差(mIoU仅17.28%),这证实了在小规模表面缺陷数据集上直接使用纯Transformer架构难以有效训练,而预训练CNN编码器与Transformer解码器的混合设计能够克服这一瓶颈。在MVTec-Texture数据集上,Swin-MFINet同样取得最高成绩(77.07% mIoU,87.05% F1分数),Attention-UNet以76.16% mIoU位居第二,而Swin-UNet仍为最低(51.62% mIoU)。与已有文献比较,MT数据集上此前最好的方法是DFF(基于ResNet50和注意力门控),mIoU为73.7%;MVTec-Texture上此前最好的方法CAVGA(自动编码器+注意力门控)mIoU为73.40%。Swin-MFINet在两个数据集上均刷新了最优结果。
消融实验验证了模型中各关键组件的有效性。在SSE模块的选择上,与不使用任何SE模块(80.17% mIoU on MT,75.62% on MVTec)、CSE(79.69%/76.02%)、MaxOut-ScSE(79.18%/76.71%)和Add-ScSE(80.78%/76.20%)相比,SSE方案在两个数据集上均取得最高分数,且推理速度最快(31 FPS)。在解码器最后阶段使用卷积层而非Swin Transformer块的对比实验中,使用CBNReLU块的模型在MT和MVTec上分别比使用Transformer块的模型高1.47%和1.30%的mIoU,同时FPS也更高(31 vs 28)。此外,以不同预训练骨干网络(InceptionResNetV2、DenseNet169、EfficientNetB0、ResNeXt50、MobileNet、VGG16、ResNet50)替换InceptionV3的对比实验表明,InceptionV3在两个数据集上均取得最优平均性能,验证了编码器选择的合理性。
视觉结果分析显示,Swin-MFINet在背景相似、低对比度以及缺陷尺寸变化大的场景中均能比对比方法更准确地分割出缺陷区域。然而,失败案例分析表明,该模型在检测极细微划痕或与动态背景纹理几乎不可区分的缺陷时仍存在漏检或过度检测的问题。
结论与研究价值
本研究提出的Swin-MFINet模型通过将预训练InceptionV3编码器、Swin Transformer解码器以及多特征集成与SSE模块相结合,有效解决了像素级表面缺陷检测中小数据集训练困难、全局语义信息提取不足以及空间细节丢失等核心问题。在MT和MVTec-Texture两个基准数据集上,该模型分别取得81.37%和77.07%的mIoU,均超过此前所有文献报道的最优结果。这一研究表明,混合架构——即CNN与Transformer的协同使用——是应对工业表面缺陷检测中数据规模有限、缺陷形态复杂多变等挑战的有效途径。该模型不仅具有重要的学术价值,为Transformer在工业视觉检测中的轻量化适配提供了新思路,同时也具备良好的实际应用前景,能够以31 FPS的推理速度满足实时检测需求。
研究亮点
本研究的核心亮点包括:第一,提出了针对小样本表面缺陷数据的CNN-Transformer混合编码器-解码器架构,利用预训练InceptionV3弥补Transformer对大数据量的依赖;第二,在解码器中创新性地引入“Transformer前三阶段+卷积最后阶段”的混合设计,使模型同时具备全局语义建模能力和局部空间细节保留能力;第三,开发了多特征集成模块,通过融合不同解码阶段的特征图并应用SSE注意力机制,进一步提升了关键特征的显著性;第四,在多个公开数据集上取得了当前最优性能,并通过系统的消融实验和骨干网络对比实验验证了各组件设计的合理性与有效性;第五,模型在保持高性能的同时实现了较高的推理速度,为工业实时检测场景提供了可行性依据。