本研究由西安工程大学电子信息学院的刘明阳、张缓缓、景军锋、张宏伟以及西安航空大学电子工程学院的康雪娟等人完成,发表于 Measurement 期刊第257卷(2026年),论文于2025年4月24日投稿,2025年8月8日修回,2025年9月10日被接受,2025年9月12日在线发表。
一、研究背景与目的
印花织物缺陷检测是工业质检中的难点问题。由于印花织物背景图案复杂、色彩多样,缺陷与背景之间的对比度极低,许多细微缺陷容易被图案和颜色掩盖,传统目标检测方法难以在此类复杂背景下取得可靠结果。现有基于卷积神经网络的方法虽然能自动提取特征,但其局部感受野限制了全局特征建模能力,且固定尺寸的卷积核难以适应多尺度缺陷;而基于Transformer的方法虽然擅长建模长程依赖关系,却往往难以捕获细微的局部纹理变化,对细小缺陷的分割效果不佳。为了解决上述问题,本文提出了一种名为DT-UNet的印花织物缺陷分割网络,旨在融合动态蛇形卷积的局部几何建模能力与Transformer的全局上下文处理能力,提升低对比度、复杂纹理背景下细微缺陷的分割精度,并降低模型的计算复杂度。
二、研究方法与工作流程
DT-UNet的整体架构由编码器(Encoder)、Transformer模块和解码器(Decoder)三部分组成。编码器包含三个阶段,分别使用3个、6个和9个D-Bottleneck模块。D-Bottleneck模块是本文的核心创新之一,它将动态蛇形卷积(DSConv)算子与ResNet-50的Bottleneck结构相融合,模块内包含两个1×1卷积、一个3×3卷积、一个DSConv以及残差连接。每个阶段中的第一个D-Bottleneck步长为2,用于将特征图分辨率减半;后续模块步长为1,保持分辨率不变。输入图像尺寸为3×224×224,经过卷积和最大池化后变为64×56×56。第一阶段输出256通道、56×56分辨率的特征;第二阶段输出512通道、28×28分辨率;第三阶段输出1024通道、14×14分辨率。DSConv的设计沿x轴和y轴分别进行动态偏移,通过累加偏移量实现卷积核在细长管状结构上的自适应形变,并利用双线性插值处理分数坐标,从而更有效地感知细微结构特征。
编码器输出的特征图首先进入嵌入模块。嵌入模块由1×1卷积、展平操作、位置编码和Dropout组成。1×1卷积将1024通道特征映射为768通道,展平操作将14×14×768的三维矩阵变为196×768的二维序列,位置编码添加可学习的位置嵌入以保留空间信息,Dropout用于增强泛化能力。
随后,特征序列被送入Transformer模块。Transformer模块基于视觉Transformer(ViT)设计,由多头自注意力(MSA)、多层感知机(MLP)和层归一化(Layer Norm)组成。其计算过程可表示为:先对输入进行层归一化,经过MSA并与输入残差相加,再经层归一化和MLP,再与前一输出残差相加。Transformer层用于捕获全局上下文信息,弥补卷积操作局部感受野的不足。解码器由上来样、解码块和跳跃连接组成,解码块包含两个3×3卷积,每个卷积后接批归一化和ReLU激活,最终通过卷积层输出分割掩码。
实验在三个数据集上进行。印花织物缺陷数据集(PFDD)包含4类缺陷:毛边(BR)、昆虫污染(IC)、接缝头(SH)和孔洞(HE),共1382张图像,其中训练集1185张,测试集197张。瓷砖表面缺陷数据集(TSDD)包含5类缺陷,共1568张图像,训练集1255张,测试集313张。MVTec数据集中选取了木材(wood)、螺丝(screw)、药片(pill)和皮革(leather)四类工业缺陷数据进行对比实验。所有实验基于PyTorch框架,在配备Intel Xeon Silver 4314 CPU和NVIDIA GTX 4090 GPU的工作站上统一训练与验证。评价指标采用平均像素准确率(MPA)、类别像素准确率(CPA)、交并比(IoU)和平均交并比(MIoU)。
消融实验分为两部分。第一部分将TransUNet编码器中ResNet-50的Bottleneck模块替换为D-Bottleneck模块,以验证D-Bottleneck对细微缺陷分割的有效性。第二部分在PFDD上逐步减少Transformer层数,从原始TransUNet的12层依次降至10、8、6、4、2和0层,以确定最佳层数配置。
三、主要实验结果
在PFDD数据集上,DT-UNet的像素准确率(PA)达到99.87%,MPA为85.90%,MIoU为78.35%。与基线模型TransUNet相比,MPA提升了47.35个百分点,MIoU提升了41.73个百分点。TransUNet的MPA仅为38.55%,MIoU为36.62%。U-Net的MPA为86.23%,MIoU为71.29%,虽然MPA略高于DT-UNet,但MIoU明显低于DT-UNet。其他方法如DeepLabv3+、PSPNet和SwinUNet的MIoU分别为38.61%、24.08%和50.02%,均显著低于DT-UNet。可视化结果显示,DT-UNet对四类缺陷均能准确定位,尤其对TransUNet完全漏检的孔洞类缺陷也能有效分割。
在TSDD数据集上,DT-UNet的PA为99.45%,MPA为95.41%,MIoU为88.77%,均显著优于所有对比方法。其中,PUNet的MIoU为85.75%,ResUNet为82.65%,HRNet为81.02%,其余方法的MIoU均在80%以下。
在MVTec数据集的四个工业缺陷子集上,DT-UNet同样表现出较强的泛化能力。木材数据集的PA为99.26%,MPA为92.19%,MIoU为87.92%;螺丝数据集的PA为99.91%,MPA为86.11%,MIoU为80.85%;药片数据集的PA为99.60%,MPA为81.70%,MIoU为76.85%;皮革数据集的PA为99.80%,MPA为83.89%,MIoU为79.71%。除皮革数据集的MPA略低于PUNet的91.68%外,其余指标均大幅领先于其他对比方法,尤其是MIoU指标,DT-UNet在四个数据集上均取得最高分,其中药片数据集的MIoU达到76.85%,是对比方法中唯一一个超过60%的模型。
消融实验第一部分显示,将Bottleneck替换为D-Bottleneck后,孔洞缺陷的CPA从0%提升至28.81%,IoU从0提升至27.22%,召回率从0提升至83.16%,F1分数从0提升至42.80%。接缝头缺陷的CPA为93.08%,IoU为79.63%,略低于原始Bottleneck的92.84%和83.40%,但召回率和F1值均有改善。消融实验第二部分表明,D-Bottleneck与4层Transformer的组合在PFDD上取得最佳性能:PA为99.87%,MPA为85.90%,MIoU为78.35%,同时FLOPs为20.46G,参数量为43.02M,相较于12层Transformer的基线模型,计算量大幅降低,参数量减少超过一半。当Transformer层数减少至0时,MPA降至75.48%,MIoU降至67.11%,但仍高于原始TransUNet,说明D-Bottleneck对性能提升贡献显著,而适当数量的Transformer层对于捕获全局上下文信息不可或缺。
四、结论与意义
本文提出的DT-UNet通过将动态蛇形卷积融入Bottleneck模块,使卷积核能够根据特征内容在细节密集区域自动“收缩”或在弱纹理区域“扩展”,实现了局部自适应增强。与此同时,Transformer模块负责处理全局上下文信息,形成“全局动态感知+局部动态增强”的混合架构。实验结果表明,该方法在印花织物缺陷数据集、瓷砖表面缺陷数据集以及多种工业缺陷数据集上均取得了领先的分割性能,验证了其对不同尺度和复杂背景下缺陷的准确分割能力及良好的泛化能力。与TransUNet相比,DT-UNet在更低的计算成本下实现了显著更高的分割精度。然而,由于Transformer本身计算开销较大,未来工作将向两个方向发展:一是探索轻量化注意力机制以降低计算复杂度;二是面向边缘计算设备进行优化,结合量化感知训练和硬件感知剪枝,实现工业边缘设备上的实时缺陷检测。
五、研究亮点
本研究的核心创新在于提出了D-Bottleneck模块,将动态蛇形卷积与残差瓶颈结构结合,增强了模型对细微局部几何特征的提取能力;通过限制Transformer层数,在保持全局上下文建模能力的同时,减少了计算冗余和局部细节稀释问题;构建的“全局动态感知+局部动态增强”混合架构在多个数据集上取得了当前最先进的分割结果,尤其对于低对比度、复杂纹理背景下的细微缺陷,DT-UNet展现出显著优于现有方法的检测能力。