本文属于类型a:单一原创研究报告。以下是根据该文档内容撰写的学术报告。
一、作者、机构与发表信息
本研究由来自中国常州大学计算机科学与人工智能学院的魏成(Cheng Wei)、梁久祯(Jiuzhen Liang)、刘浩(Hao Liu)、侯振杰(Zhenjie Hou)和宦战(Zhan Huan)共同完成。通讯作者为梁久祯。该研究得到了公安部道路交通安全重点实验室开放项目(项目号:2021ZDSYSKFKT04)和江苏省石化过程关键设备数字孪生技术工程研究中心(项目号:DT2020720)的支持。论文于2022年12月10日被接受,并于2022年12月25日在线发表于 The Visual Computer 期刊(2023年第39卷,页码6655–6671),论文标题为“Multi-stage unsupervised fabric defect detection based on DCGAN”。
二、研究背景与目的
织物缺陷检测是纺织工业质量控制中的关键环节。传统的织物缺陷检测主要依赖人工目检,但人工检测方法普遍存在成本高、效率低、误检率高等问题。因此,基于机器视觉的自动检测方法近年来受到广泛关注。织物缺陷具有多样性,且实际生产线中缺陷样本稀缺,缺陷样本的采集与标注成本高昂,这使得织物缺陷检测成为一个重要且具有挑战性的问题。当前,无监督学习算法由于不需要标注数据,能够降低数据获取成本,因而在表面缺陷检测领域得到广泛应用。
在此背景下,本研究旨在提出一种基于深度卷积生成对抗网络(DCGAN)的多阶段无监督织物缺陷检测方法。该方法仅需少量无缺陷的织物图像作为训练数据,即可实现对测试图像中缺陷的像素级检测与分割。具体目标包括:第一,利用生成对抗网络(GAN)的图像生成能力和流形分布理论,实现对缺陷图像的重建;第二,通过比较原始图像与重建图像之间的差异,生成能够突出缺陷区域的残差图(residual map);第三,引入分类器训练阶段,生成似然图(likelihood map),并融合残差图与似然图以提高检测精度;第四,通过改进的线性加权融合方法减少图像拼接问题和缺陷干扰,从而获得更优的重建结果。
三、研究流程与实验方法
本研究提出的多阶段无监督织物缺陷检测方法主要包含三个训练阶段:GAN网络训练阶段、编码器训练阶段和分类器训练阶段。整体框架以图像块(image patch)为基本处理单元,图像块大小为32×32像素,训练数据从正常织物图像中在线随机裁剪获得。
第一阶段:GAN网络训练阶段。 研究采用标准的DCGAN架构,参考Radford等人提出的参数设置。训练样本为从少量无缺陷图像中随机裁剪得到的正常图像块。生成器(generator)负责将潜在空间(latent space)中的随机向量映射到数据空间(data space),学习正常样本图像块的数据分布;判别器(discriminator)则作为二分类器,尝试区分生成图像与真实图像。该阶段的目标优化函数为:
[ \min_G \maxD V(G, D) = E{x \sim px(x)}[\log(D(x))] + E{z \sim p_z(z)}[1 - \log(D(G(z)))] ]
其中 (p_x) 为正常图像块的数据分布,(p_z) 为高斯分布的潜在空间。理想状态下,当 (p_g = p_x) 时,判别器输出为0.5,达到纳什均衡点。训练过程中使用Adam优化器,初始学习率为0.0002,共训练30个epoch。对于点状织物(dot-type),由于其难以收敛,先以0.001的学习率进行20轮训练以加速收敛。
第二阶段:编码器训练阶段。 由于GAN本身无法直接实现图像重建功能,本研究引入编码器(encoder)结构,建立从数据空间到潜在空间的映射。编码器与参数锁定的生成器共同构成自编码器结构。训练编码器时,参考f-AnoGAN的架构,采用i zi f方法,其优化目标为:
[ L_{izif} = \frac{1}{n}|x - G(\hat{z})|^2 + \lambda \frac{1}{n_d}|f(x) - f(G(\hat{z}))|^2 ]
其中第一项为图像空间中的像素级重建误差,第二项为判别器提取的特征约束,(λ) 默认设为1。值得一提的是,本研究引入并改进了线性加权融合方法,以解决图像重建中的拼接缝隙问题和大缺陷对重建的干扰。具体做法是:通过滑动窗口获取一组重叠的图像块,在行方向上计算重叠区域的平均值,在列方向上进行类似操作,最终合成完整的256×256像素重建图像。与标准均匀裁剪重建方法相比,改进后的加权平均融合算法能够有效减少拼接缝隙,降低大缺陷对图像块重建的干扰,使重建图像在视觉上更接近原始图像。
第三阶段:分类器训练阶段。 该阶段与测试阶段并行进行。首先,在测试过程中对融合残差图进行像素统计,筛选出含有缺陷的测试图像;从这些缺陷图像中随机裁剪大量32×32像素的图像块,通过编码器-生成器结构进行重建,利用结构相似性算法(SSIM)计算原始图像块与重建图像块之间的相似度概率 (p);根据相似度值设置阈值,为图像块打上正常、不确定或缺陷标签。为了解决在线采样中正负样本不均衡的问题,研究通过残差图像的像素计数定位缺陷区域,并对该区域进行采样,以提高缺陷样本的比例。同时,为避免简单地定义阈值,研究设置了长度为0.1的缓冲区间,以所有SSIM值的平均值 (p_{ave}) 为中值进行分类。由此,分类器由一个二分类模型扩展为三分类模型,输出图像块为正常、不确定和缺陷块的概率 (p_1, p_2, p_3)。似然图的定义如下:
[ L(i, j) = 1 - p_1 - \alpha p_2 ]
其中 (α=0.5)。分类器使用Adam优化器,初始学习率为0.001,共训练50个epoch。训练完成后,分类器通过滑动窗口对测试图像进行扫描,输出每个图像块为正常块的概率,并上采样恢复至原始图像尺寸,生成似然图。
测试阶段与数据融合。 在测试阶段,给定待测图像 (I),生成器与编码器共同作用得到重建图像 (I_r)。残差图根据如下公式计算:
[ I_{diff} = abs(I - I_r) ]
为减少残差图中的散点噪声,研究采用两种降噪策略:第一,计算原始图像与重建图像之间的SSIM概率矩阵,对残差图进行初步降噪;第二,融合似然图与优化后的残差图,利用似然图作为先验知识进一步消除非缺陷区域的噪声点。最终通过固定阈值分割得到二值化缺陷分割图:
[ I{res} = \begin{cases} 0, & I{diff} \cdot S_{map} \cdot likelihood \leq threshold \ 1, & otherwise \end{cases} ]
此外,研究还进行了消融实验,探讨图像块大小对检测结果的影响,比较了16×16、32×32和64×64三种尺寸,结果表明32×32像素的图像块获得了最佳分割效果。
四、主要实验结果
研究在由香港大学工业自动化研究实验室提供的织物数据库上进行了实验验证。该数据库包含三种纹理类型的织物图像:箱型(box)、点型(dot)和星型(star),图像尺寸均为256×256像素,24位深度。其中箱型和点型各有30张无缺陷图像,星型有25张无缺陷图像。缺陷类型包括断头(broken ends)、破洞(holes)、多网(netting multiple)、粗条(thick bar)、细条(thin bar),点型织物还额外包含结头(knots)缺陷。
实验采用F-measure作为主要评价指标,同时计算真阳率(TPR)、假阳率(FPR)、阳性预测值(PPV)和阴性预测值(NPV),并引入ROC曲线进行综合评估。研究将所提方法与最近几年的织物缺陷检测算法进行了比较,包括GHOG(2019)、DCGAN(2019)、WLRL(2020)、PTVLR(2021)和CCGAN(2022)。
消融实验结果。 在图像块尺寸影响方面,16×16像素的过小图像块容易受缺陷干扰,导致重建图像质量下降,影响残差图对缺陷细节的描述;64×64像素的过大图像块则给DCGAN带来负担,生成图像细节变差,残差图中散点噪声增多。ROC曲线结果表明32×32像素的图像块在三种织物类型上均取得最佳分割效果。在重建方法对比方面,与Hu等人提出的标准重建方法相比,改进的加权融合重建方法在箱型、点型和星型三种织物上均提高了检测精度,尤其对于尺寸较大、与背景差异明显的缺陷,加权融合方法能有效减少缺陷对编码器编码的干扰。
对比实验结果。 在箱型织物上,本文方法的F-measure值为59.56%,高于GHOG(15.88%)、WLRL(48.87%)、DCGAN(39.28%)和PTVLR(55.58%),但低于CCGAN(65.97%)。在点型织物上,本文方法取得了最高的F-measure值75.31%,显著优于GHOG(32.08%)、WLRL(57.67%)、DCGAN(61.44%)、PTVLR(69.78%)和CCGAN(60.61%)。在星型织物上,本文方法的F-measure值为69.58%,同样为所有方法中最高,优于GHOG(44.12%)、WLRL(53.30%)、PTVLR(53.20%)和CCGAN(59.30%)。综合来看,本文方法在三种织物类型上的平均TPR为83%,平均FPR为1.17%,平均F-measure值为68.15%,在检测精度上整体优于所比较的其他方法。从ROC曲线来看,本文方法在三种织物类型上均表现出较大的曲线下面积,显示了检测结果的优越性。
定性结果。 从视觉对比结果来看,PTVLR和本文方法在突出缺陷细节方面能力较强,WLRL次之。GHOG方法能够定位缺陷,但缺乏对缺陷形状的描述能力,且在三种织物类型上均存在大量误检点。DCGAN方法能准确定位缺陷,但难以检测小尺寸和不明显的缺陷,且仍存在大量散点噪声。本文方法由于更关注缺陷细节,在TPR上略有不足,但在FPR上明显优于其他方法,表明误检率较低。
五、结论与研究价值
本研究提出了一种基于DCGAN的多阶段无监督织物缺陷检测方法。该方法通过GAN网络的图像生成能力和流形分布理论,实现了对测试图像的重建;通过编码器与生成器的协同工作,获得了具有突出缺陷的残差图;通过提出的分类器训练策略和线性加权融合重建策略,有效减少了残差图中的散点噪声,提高了检测精度。实验结果表明,该方法在三种织物类型上的平均F-measure值达到68.15%,优于近年来提出的多种无监督织物缺陷检测算法。
在科学价值方面,本研究将织物缺陷检测任务转化为基于DCGAN的无监督任务,仅需少量正常样本即可完成模型训练,为小样本条件下的缺陷检测提供了一种可行思路。同时,研究充分利用了DCGAN中判别器的分类能力,通过优化训练策略,使其输出正常图像块的概率,并生成似然图作为先验知识,这一策略有效提升了分割精度。在应用价值方面,该方法能够对不同类型织物中的多种缺陷进行像素级检测与分割,具有较强的适应性和实用性,有望在纺织工业的自动质量控制中得到应用。
六、研究亮点
本研究的亮点主要体现在三个方面。第一,提出了一种新的多阶段检测框架,将织物缺陷检测任务转化为无监督任务,通过比较测试图像与重建图像的差异来实现缺陷检测。第二,充分利用DCGAN判别器的分类能力,训练分类器以输出正常图像块的概率,并生成似然图,该似然图能够消除残差图中大量散点噪声,提高检测精度。第三,引入并改进了线性加权融合方法,优化了重建图像块的融合过程,减少了缺陷对模型的干扰,有效改善了图像重建质量。
七、局限性与展望
本研究仍存在一些局限性。首先,模型对与背景纹理颜色相似的缺陷检测效果不佳,主要原因是残差图无法有效突出此类缺陷,相应的似然图也难以准确定位缺陷位置。其次,分类器的训练阶段需要与测试阶段同时进行,这不符合实际工厂生产的实时检测需求。未来的研究希望在保持模型检测精度的同时,实现对缺陷的快速检测,以提升该方法在实际生产中的应用价值。