分享自:

结合频域卷积模块的机织物图像疵点目标检测

期刊:纺织学报DOI:10.13475/j.fzxb.20240407501

本研究由江南大学生态纺织教育部重点实验室的顾孟尚、张宁、潘如如和高卫东等研究人员完成,发表于2025年5月的《Journal of Textile Research》(纺织学报)第46卷第5期。该研究针对机织物图像疵点检测中深度学习模型存在的特征提取效率低和泛化能力不足的问题,提出了一种名为频域卷积模块(ffc-tex)的新型解决方案。

研究背景与目标

织物疵点检测是纺织品生产质量控制的关键环节,目前仍大量依赖人工目视检测,存在效率低下、成本高昂且缺乏客观性等问题。随着工业数字化转型,实现自动化的疵点检测成为迫切需求。深度学习,特别是卷积神经网络(CNNs),已成为提升检测自动化水平的核心技术。其中,YOLO系列目标检测模型以其卓越的检测效率在工业领域展现出广阔的应用前景。然而,这类模型的性能高度依赖于数据集的完备程度,而现实中织物类型和疵点形态的多样性与此构成了尖锐矛盾,导致模型在面对未知或变化的数据时泛化能力下降。

为解决此问题,研究者们将目光投向了模型的基础组件——卷积操作。与普通自然图像不同,机织物图像由生产工艺决定了其具有高度的周期性纹理特征。传统的卷积操作在网络的浅层感受野有限,只能学习到局部的特征,难以感知织物的全局周期性结构;而在深层网络中,尽管感受野扩大,但细致的周期性纹理信息已被高度抽象的语义特征所弱化。这种局限性阻碍了模型高效利用织物最显著的全局纹理特征。本研究旨在通过融合频域分析和传统卷积的优势,设计一个能够高效解耦织物全局纹理与局部疵点特征的模块,从而提升深度学习模型在织物疵点检测中的泛化能力和鲁棒性。

研究方法与工作流程

研究团队基于快速傅里叶卷积和织物图像特性,设计并持续优化了ffc-tex模块,并将其集成到YOLOv5目标检测模型中,形成新的检测方案。研究流程主要包含以下几个部分:

首先,进行ffc-tex模块的设计与改进。该模块的核心思想是利用傅里叶变换在频域中实现大核卷积,从而在网络浅层就为模型提供全局感受野。相较于传统的快速傅里叶卷积模块,ffc-tex模块进行了三项关键改进:一是幅值和相位的解耦(Decoupling of Magnitude and Phase),将频域中的复数特征分解为独立的幅值谱和相位谱。幅值谱反映了纹理、边缘等频率成分的能量强度,而相位谱则定位了这些特征出现的具体位置,这样不仅将隐式的特征显式化,降低了模型的学习负担,还能让模型根据任务需要选择性地关注不同信息,实现更精确的特征提取。二是频率分布图和波形方向分布图的构建(Construction of Frequency Distribution Map and Waveform Direction Map),通过将频谱图从笛卡尔坐标系转换到极坐标系,显式地编码了每个频率元素的频率值和波形方向,为模型提供了清晰的空间传播特性描述,有助于模型分析频率元素间的绝对关系。三是频域注意力机制(Frequency Domain Attention Mechanism),通过优化传统的通道和空间注意力模块,使其更适应频域特征图的能量分布特性。模块调整了处理顺序,先计算空间注意力,以利用频谱图中空间位置所代表的频率信息,再计算通道注意力,从而增强了模型对频域中目标特征的表示能力。

紧接着,研究团队构建了多组精心设计的数据集以全面验证模型性能。所有图像均来自验布机实机采集,原始尺寸为2482像素×896像素,随后被统一裁剪并调整为256像素×256像素。为深入探究模型在面对不同织物和不同疵点时的泛化能力,研究者将泛化问题解耦为织物类型和疵点类型两个变量,并据此构建了四个不同的数据集:数据集a(单类疵点,多类织物)用于评估模型对不同背景纹理的表征能力;数据集b(多类疵点,单类织物)用于评估模型对不同类型疵点的表征能力;数据集c1(多类疵点,多类织物,验证集与训练集同源)用于评估模型总体的鲁棒性和泛化能力;数据集c2(多类疵点,多类织物,验证集与训练集完全独立)用于更客观且严格地评估模型在未见过的织物纹理和新疵点上的泛化性能。

随后,研究团队设计了两种将ffc-tex模块集成到YOLOv5架构中的方案。方案一(本文模型1)仅将骨干网络中的第一个跨阶段局部网络模块(CSP模块)替换为ffc-tex模块,而方案二(本文模型2)则替换了骨干网络中的所有CSP模块。这种设计是为了验证频域卷积在浅层网络中发挥大核卷积优势的假设。所有模型均使用PyTorch框架,在NVIDIA GeForce RTX3090 GPU上进行300个周期的训练,并采用SGD优化器及余弦学习率调整策略。模型的性能评估采用均值平均精确度(mAP)、精确度(P)、召回率(R)和检测速率等指标。

主要研究结果

通过在不同数据集上的对比实验和消融实验,研究得到了如下关键结果:

在模型性能对比分析中,YOLOv5基准模型在数据较为单一的数据集上表现良好,但在面对多样化的数据集c1和c2时,性能急剧下降,mAP50指标分别降至65.7%和59.1%,验证了传统卷积模型泛化能力不足的问题。而本文模型1在所有数据集上均实现了显著的性能提升,尤其是在复杂数据集c2上,mAP50提升了16.3%,达到75.4%;mAP75的指标提升更为惊人,在数据集b、c1和c2上分别提升了19.1%、28.9%和32.9%。这表明ffc-tex模块的加入有效增强了模型的泛化能力。同时,模型1的检测速率(189.1帧/秒)甚至超过了基准的YOLOv5n模型(158.7帧/秒),展示了频域卷积在浅层处理大尺寸特征图时的计算效率优势。相比之下,模型2虽然在性能上也有提升,但提升幅度不如模型1,且检测速率大幅下降至89.7帧/秒,证明了频域卷积更适合在浅层网络中发挥作用,不能完全替代深层网络中的CSP模块。研究还发现,单纯增加网络深度和参数量的YOLOv5l模型,在从已知数据泛化到未知数据(c2)时效果有限,而本文模型1的频域特征融合策略则更为高效。

在消融实验中,对ffc-tex模块的各个组件进行了有效性验证。首先,引入完整的快速傅里叶卷积模块(即消融模型2)为模型带来了可观的性能净提升,在数据集c1和c2上的提升分别达到5.91%和5.28%,证实了频域卷积本身的核心作用。其次,在此基础上对频域特征进行重新构建,包括幅值-相位解耦和频率-方向图构建(即消融模型3),进一步提升了模型在未知数据集c2上的表现达5.35%,证明了这些改进能够有效提升特征的泛化能力和模型的解释性。最后,加入频域注意力机制的完整ffc-tex模块(即本文模型1),在所有数据集上均实现了最佳性能,相比消融模型2,在数据集c2上的提升高达9.67%,表明注意力机制极大地增强了模型对关键频域特征的聚焦和表示能力。

此外,检测结果的可视化和特征层可视化直观地揭示了其工作原理。检测结果显示,基准YOLOv5模型通常只能检测到疵点的显著局部区域,而结合了ffc-tex模块的模型能够更完整地框选出整个疵点,甚至将空间上断裂但结构连续的疵点识别为同一目标。特征层可视化则表明,原始模型在浅层难以区分纹理和疵点,而使用了频域卷积的模型在浅层就能有效抑制背景中的周期性织物纹理,使疵点特征在特征图中得到显著增强。

研究结论、价值与亮点

本研究成功提出并验证了一种针对机织物图像的频域卷积模块ffc-tex。该模块通过在网络浅层引入基于傅里叶变换的全局感受野,高效地实现了织物全局纹理与局部疵点特征的解耦,显著提升了深度学习目标检测模型的泛化能力、鲁棒性和检测精度。其科学价值在于,它从原理上解决了传统卷积在周期性图像处理中的局限性,为卷积神经网络的设计提供了新的视角,即将大核卷积以频域计算的方式引入网络浅层,优化了整个特征提取流程。

在应用价值方面,提出的模型1在提高检测精度的同时,也提升了检测速度,这对于满足纺织工业对实时、高速、高精度自动化疵点检测的迫切需求具有重要意义。尤其在面对织物种类频繁切换的实际生产环境时,该模型展现出的对未知织物的强大泛化能力,使其更具工业部署的潜力。

本研究的亮点主要体现在三个方面:第一,方法上的融合创新,将传统的傅里叶变换图像处理技术与现代深度学习模型在特征层面深度融合,通过显式化频域特征弥补了深度学习模型解释性不足的缺陷。第二,巧妙的模块设计,通过对幅值、相位、频率和方向的解耦与显式编码,并引入适配频域的注意力机制,最大化地挖掘了频域信息对织物疵点检测的价值。第三,严谨的解耦验证思路,通过控制变量法构建针对不同泛化场景的数据集,清晰地揭示了模型性能提升的来源,即对织物纹理和疵点特征的分离能力,为后续相关研究提供了可靠的评估范式。研究最后指出,未来的方向可以继续探索将更多具有先验知识的手工特征提取方法与深度学习模型相结合,以实现性能上的互补与突破。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com