本研究由常州大学计算机科学与人工智能学院的陈浩文(Haowen Chen)、刘浩(Hao Liu)、梁久祯(Jiuzhen Liang)、庄俊杰(Junjie Zhuang)和王如玉(Ruyu Wang)共同完成,其中庄俊杰和王如玉对本研究贡献等同。通讯作者为梁久祯。该研究成果于2025年5月25日被*The Journal of Supercomputing*接收发表,论文题为《AFF-DSTNet: Fabric Anomaly Detection Based on Adaptive Feature Fusion Dual-Student–Teacher Network》。
在纺织工业中,织物质量检测是直接影响产品市场接受度和企业品牌形象的关键环节。目前该检测主要依靠人工完成,不仅产生大量劳动力成本,还因视觉疲劳和注意力下降难以保证检测的完美性。因此,基于机器视觉的织物异常检测方法近年来受到广泛关注。
采集和标注织物缺陷样本非常昂贵,这使得无监督异常检测算法(unsupervised anomaly detection)成为日益突出的研究方向。在众多无监督算法中,Bergmann等人提出的学生-教师网络(student-teacher network)方法展现出强大的竞争力。其核心思想是利用在大规模图像上预训练的教师网络(teacher network)指导仅使用正常数据训练的学生网络(student network),推理阶段若输入包含异常,学生网络的预测将与教师网络产生显著差异,以此作为异常检测信号。
然而,将现有学生-教师网络应用于织物缺陷检测面临若干关键挑战:首先,由于织物异常多样且网络感受野(receptive field)固定,传统学生-教师网络架构难以精确检测所有类型的织物异常,尤其对于复杂图案织物;其次,网络过拟合问题会显著影响检测精度,若学生网络在训练过程中被过度训练,实际检测时可能产生较高的假阳性率;更重要的是,模型需具备优良的异常定位能力,包括对异常区域进行精确边界界定。针对上述局限,本研究提出了AFF-DSTNet——一种具有双学生网络的学生-教师网络框架。
AFF-DSTNet采用单教师双学生的网络架构。教师网络是基于Wide ResNet-101-2蒸馏而来的MCA-PDN(多维协同注意力-补丁描述网络),学生网络分别为MCA-PDN学生网络(以下简称PDN学生)和掩码自编码器学生网络(masked autoencoder student,以下简称MAE学生),两者结构相同且参数随机初始化。原始PDN网络神经元的感受野被严格限制为固定大小,确保图像某部位的异常不会引发远端部位的异常特征向量,从而保持网络定位异常的能力。研究者引入了Yu等人提出的多维协同注意力模块(MCA)以增强网络提取图像特征的能力。
训练过程中,AFF-DSTNet仅使用正常图像,使两个学生网络同时模仿教师网络在正常图像上的输出。模型损失由三部分组成:PDN学生与教师网络生成的两张特征图之间的平方差(Lst)、教师网络与MAE学生生成的特征图之间的平方差(Lmae),以及PDN学生与MAE学生生成的特征图之间的平方差(Lstmae)。总损失L = Lst + Lmae + Lstmae。
在学生-教师网络中,传统做法是学生与教师使用相同架构以最小化正常样本上的特征差异,但这会降低两者在异常数据上的差异程度。颜色差异异常通常表现为色彩单一的不规则区域,其特征高度一致且缺乏内部变化。学生网络的泛化能力可能导致在处理颜色异常时,其输出与教师网络在异常区域的输出差异不显著,从而削弱检测效果。MAE学生的设计正是为了弥补这一缺陷。
研究者使用KL散度(Kullback-Leibler divergence)量化异常区域与正常区域之间上下文信息的差异。MAE采用独特的随机掩码策略:将输入图像划分为等大小补丁(patch),随机掩码75%的补丁,被掩码补丁仅保留位置编码。实验发现这一掩码策略意外地赋予了模型强大的上下文信息获取能力,即使检测具有复杂纹理的织物图像时仍对色差异常保持高灵敏度。掩码策略迫使MAE从部分可见图像区域推断整个图像内容,驱动模型深度理解并有效利用可见区域提供的上下文信息以实现对遮蔽区域的高效重构。
为验证上述发现,研究者使用教师网络分别训练MAE和传统自编码器,两者均采用编码器-解码器架构,但后者不对输入图像做任何改动。热力图对比表明,普通自编码器在正常区域与教师网络的差异甚至高于异常区域,难以正确检测颜色异常;而采用掩码策略的MAE能正确检测这些色差异常。MAE学生对不同类型织物异常的检测具有明显差异化表现:对于flaw、scratch、break等对比度较低、上下文信息差异不显著的异常类型,MAE学生难以做出准确全面的预测;而对孔洞(hole)和色差(color)等高对比度异常,MAE学生能给出精确的检测结果。
由于MAE学生基于编码器-解码器架构,而教师网络为全卷积网络,MAE学生难以重建细粒度图案并可能在正常图像上产生误检。为此,研究者将PDN学生输出通道数加倍,使用MAE学生重建特征与PDN学生提取特征之间的差异作为MAE学生的评价指标,最终通过通道平均获得二维异常分数图,并利用双线性插值调整至原始输入图像大小。
PDN学生与MAE学生生成的异常分数图各有优势与局限。对于划痕、损伤等与正常区域对比度低的异常类型,由于MAE学生对原始图像进行大量掩码处理,其检测性能不如PDN学生;而对于色差异常,MAE学生表现出高精度。简单的等权重线性相加会导致模型检测精度的损失。
为此,研究者提出了焦点像素融合策略(focus pixel fusion strategy)。首先通过公式th = exp × [公式]计算焦点像素阈值,选取异常分数图Mpdn中分数大于该阈值的像素作为焦点像素,其中exp为经验值,经实验设为0.3。然后计算焦点像素占异常图总像素的比例a%,选取Mmae中分数最高的前a%像素作为该图的焦点像素。随后计算两组焦点像素的交并比(IOU),据此判断异常类型并调整融合权重与范围。
融合过程中,仅在两组焦点像素重叠的部分进行异常分数图融合,其余区域统一使用PDN学生输出的异常分数,以确保正常区域不因融合过程产生噪声。Mmae需进行归一化处理至与学生-教师网络生成的值域一致。当IOU大于0.7时,MAE学生网络的结果完全纳入需要合并的区域;小于0.7时,两个学生网络进行线性加权融合。最终检测结果mcom = [公式] × mpdn + [公式] × mscaled_mae。IOU经验值选定为0.7的依据是:该阈值下高对比度异常(颜色与孔洞)与低对比度异常的比例差距进一步扩大,且此时detect.auroc尚未出现明显下降趋势,符合AFF-DSTNet先检测后定位的主要目标。
织物图片上的异常可能导致正常区域产生某些变形,如折痕异常伴随部分阴影效果,拉伸引起的损伤异常伴随织物形变。学生网络未学习这些共存现象的教师特征提取方式,可能将存在这些现象的正常区域误识别为异常。在学生-教师网络框架中,过度增加训练图像会提升学生模仿教师异常现象的能力而降低检测性能,刻意减少训练图像又会抑制正常图像的重要信息。
研究者提出了PNFE数据增强方法:随机选择10%的图像使用柏林噪声(Perlin noise)生成阴影效果,10%的图像应用鱼眼透镜畸变(fisheye lens distortion)模拟织物形变现象,10%的图像进行90°翻转。柏林噪声是一种平滑连续的伪随机噪声,适合模拟自然界的纹理或光影变化;鱼眼效应能有效模拟图像受挤压和拉伸时的形变。具体实现为:在选定图像上定义与原始图像相同大小的网格,为每个网格角点分配随机梯度,通过插值方法平滑计算网格间的噪声值生成连续变化的柏林噪声图,设置固定阈值筛选噪声值低于阈值的像素进行渐变阴影效果添加。对应用鱼眼效果的图像,随机生成形变中心点和四个畸变系数控制鱼眼效果的强度和范围,以极坐标计算每个像素相对于鱼眼中心的距离,基于畸变系数对像素进行径向变形。PNFE方法使网络过拟合问题大幅减少,异常定位能力得以提升。
研究使用浙江大学ZJU-Leaper公开数据集和香港大学HKU公开数据集。ZJU-Leaper按照检测难度分为四组:第一组包括白色素色、粗条纹和细条纹图案;第二组包括点图案、千鸟格、方格和结图案;第三组包括斜纹格、蓝色格纹、棕色格纹、灰色格纹和红色格纹;第四组包括花卉印花1、2、3。HKU数据集包含盒、星形和点三种图案类型。评估指标包括图像级AUROC、像素级AUROC和像素级AUPRO。实验中将ZJU-Leaper数据下采样至256×256,使用Adam优化器,学习率设为1e-4,权重衰减设为1e-5,基于PyTorch和单块Tesla V100-PCI-32GB GPU。
与现有无监督织物缺陷检测算法DSR(2022)、MMR(2023)、EfficientAD(2024)、AnomalyCLIP(2024)、CFLOW-AD(2021)、RD4AD(2022)进行对比。在ZJU-Leaper数据集上,AFF-DSTNet取得detect.auroc 98.88%、segment.auroc 97.93%、AUPRO 89.70%的成绩;在HKU-Leaper数据集上取得detect.auroc 99.04%、segment.auroc 99.88%、AUPRO 96.32%的成绩。DSR方法在图像级检测上接近本研究水平,但其像素级异常定位性能存在差距。MMR方法单独使用MAE架构对小面积异常检测性能较差,图像级检测结果不理想。EfficientAD虽同样采用学生-教师架构,但AFF-DSTNet在整体检测性能上有相应提升。RD4AD在ZJU数据集取得最佳segment.auroc,但在HKU数据集上表现仍有提升空间。
在纹理丰富的Group-3和Group-4子数据集上,AFF-DSTNet在AUPRO指标中均取得第二名,其余指标均为第一。消融实验表明:移除PNFE模块后segment.auroc下降0.25,移除FPFS模块后下降0.89,仅使用基础PDN学生网络时下降1.06,无MCA的PDN网络下降1.72,证明三个核心模块均对检测性能有显著贡献。PNFE内部消融显示,柏林阴影和鱼眼效应对检测性能的提升比翻转操作更显著。在HKU数据集的box子数据集上,使用PNFE方法后detect.auroc从96.15提升至97.12,segment.auroc从99.54提升至99.63。
本研究提出的AFF-DSTNet通过单教师双学生的无监督异常检测方法,改善了传统学生-教师网络无法精确定位部分织物异常的问题。通过聚焦像素融合策略,模型能根据异常类型自适应调整融合权重和范围,实现了比简单等权重融合更优的检测精度。PNFE数据增强方法在不增加训练图像数量的前提下有效缓解了过拟合问题。实验结果表明,AFF-DSTNet在ZJU-Leaper和HKU两个公开数据集上的综合性能优于近年来的对比方法,尤其在高纹理复杂度织物的微小缺陷检测中表现突出。
该研究为织物异常检测提供了一种更有效的技术方案,具有明确的工业应用价值:可替代传统低效高成本的人工检测方式,提升纺织品质量检测的自动化水平和可靠性。然而,模型仍存在一定局限:一旦发生严重过拟合,检测精度仍会大幅下降;MAE学生网络训练会增加整体检测时间。研究者在单块Tesla A100 GPU上的FPS对比中,AFF-DSTNet达到18.24 FPS,优于S-T方法的1.07 FPS和PatchCore的8.53 FPS,但与EfficientAD的40.62 FPS仍有差距。未来计划将MAE简化为可集成到学生-教师网络中的轻量级模块,在保持检测精度的同时实现更快的异常检测。
本研究的主要创新点在于:第一,揭示了MAE的掩码策略在织物异常检测中与PDN具有良好互补性——MAE对色差和大面积纹理异常敏感,PDN对局部细微异常敏感;第二,创新性地提出了焦点像素融合策略,通过分析两组异常分数图中焦点像素的IOU来自适应调整融合过程,相比已有的等权重融合或注意力机制融合策略,能够根据异常类型进行更精细的信息整合;第三,设计了PNFE数据增强方法,通过仿真异常共存现象而非增加训练数据量来缓解过拟合,这与其他基于生成模型或几何变换的增强方法在思路上有本质区别。