本研究由Min Li、Pei Ye、Shuqin Cui、Ping Zhu和Junping Liu等人完成,他们均来自武汉纺织大学计算机与人工智能学院。该研究成果于2024年12月21日发表在期刊Sensors上,论文标题为“HKAN: A Hybrid Kolmogorov–Arnold Network for Robust Fabric Defect Segmentation”。
在学术背景方面,织物缺陷检测是纺织品生产过程中的关键质量控制环节,常见的缺陷类型包括着色不均、纹理不一致、结构损伤(如断纱、破洞、裂纹)、表面瑕疵(如油污、褶皱)以及边缘问题等。早期该任务主要依赖人工目视检查,效率低且劳动强度大。随着深度学习技术的发展,卷积神经网络(CNN)成为织物缺陷检测的主流方法。然而,CNN受限于局部感受野,难以捕获图像中的长距离依赖关系,在处理跨越多个区域或背景纹理复杂的缺陷时性能显著下降。Transformer架构凭借自注意力机制能够有效建模全局依赖,在计算机视觉领域取得了突破性进展,但其二次方的计算复杂度带来了沉重的计算负担。多层感知机(MLP)作为CNN和Transformer中不可或缺的组成部分,虽然在非线性拟合方面能力强大,但随着网络加深其可解释性变差,且参数效率较低。近年来兴起的Kolmogorov–Arnold网络(KAN)通过将可学习的激活函数置于边而非节点上,显著提升了模型的可解释性和参数效率,为本研究提供了新的思路。本研究旨在探索将KAN与CNN和Transformer相结合的可能性,并应用于织物缺陷分割任务,以综合三者的优势,克服单一架构的局限。
在研究方法与工作流程方面,本研究提出了一个名为HKAN的新型织物缺陷分割网络,其整体架构类似U-Net,由编码器、瓶颈层和解码器三部分组成。编码器和瓶颈层由多个级联的混合KAN模块构成,解码器采用卷积模块。混合KAN模块是本研究设计的核心创新,它将KAN卷积模块与KAN Transformer模块统一在一个框架中。KAN卷积模块的构建流程如下:输入特征图首先经过1×1卷积以加倍通道深度,然后经过3×3的KAN卷积提取空间特征,KAN卷积的每个卷积核元素都是一个B样条函数,而非传统的固定权重;输出依次经过批归一化和ReLU激活,再经一个1×1卷积精炼特征,最后通过残差连接与原始输入相加。KAN Transformer模块则基于PoolFormer架构设计,将原始MLP替换为两层可学习的KAN激活函数结构,保留了池化操作作为令牌混合器,从而在保持计算效率的同时增强对复杂非线性模式的表达能力。混合KAN模块的处理流程为:输入特征图先经过KAN卷积模块得到输出,然后重塑为序列形式输入KAN Transformer模块以捕获长距离依赖,最后再重塑回空间维度输出。整个编码过程分为四个阶段,特征图尺寸依次缩小至原始尺寸的1/2、1/4、1/8和1/16,并通过跳跃连接保留高分辨率空间信息。实验中使用了三个织物数据集进行评估:Four-Fabric-Defects数据集包含孔洞、油污、污渍和线头错误四类缺陷,原始325张图像经旋转、缩放和随机裁剪等增强后扩展至1625张;Fabric数据集包含1600张织物缺陷图像,其缺陷特征微弱且包含虚假缺陷;ZJU-Leaper数据集是目前最大的织物数据集,包含15种织物纹理类型,按背景复杂度分为4组,本研究从每种纹理中随机选取500张缺陷图像,共7500张用于实验。所有图像尺寸均为512×512像素,训练集与测试集比例为4:1。实验基于MMSegmentation框架部署,采用随机梯度下降算法,学习率设为0.01,动量为0.9,权重衰减为0.0005,最大迭代次数为40000,批量大小为8,在RTX 4060Ti GPU上运行。评估指标采用像素精度(PA)、平均交并比(mIoU)和平均Dice系数(mDice)。对比实验包括U-Net、PSPNet、DeepLabv3+、SegFormer、KNet和TransNext六种先进模型,此外还进行了消融实验以验证各模块的有效性,并进行了可视化实验直观比较不同方法的检测效果。
在主要结果方面,Four-Fabric-Defects数据集上的定量结果表明,HKAN取得了99.33%的PA、91.60%的mIoU和95.46%的mDice,优于所有对比模型。CNN类方法中U-Net表现最差,mIoU仅为70.59%;DeepLabv3+是CNN类中最佳,mIoU为89.59%,但需要41.2M参数和177G FLOPs。Transformer类方法中KNet表现最好,但HKAN在mIoU上仍超出其0.74%,且参数量更少(37.8M对72.1M),计算成本更低(167G FLOPs对249G FLOPs)。在Fabric数据集上,HKAN的mIoU和mDice分别达到70.41%和79.08%,为所有模型中最高,PA为99.68%,仅比最好的PSPNet和SegFormer低0.02%。该数据集缺陷特征微弱且与背景纹理对比度低,所有模型mIoU普遍偏低,CNN与Transformer方法之间性能差距很小,表明单一架构难以充分应对该数据集的挑战。在ZJU-Leaper数据集的第1组和第2组中,HKAN均取得最佳结果:第1组PA为97.77%、mIoU为86.63%、mDice为92.46%;第2组PA为97.53%、mIoU为85.88%、mDice为91.99%。第2组中HKAN的mIoU比U-Net高4.42%,比次优的DeepLabv3+高0.14%。在第3组和第4组中,织物纹理复杂且缺陷种类多样,HKAN在第3组的PA为98.43%,仅比PSPNet低0.01%,mDice分别达到93.36%和94.01%,优于其他所有模型。可视化结果显示,在Four-Fabric-Defects数据集上,对于简单孔洞检测大多数模型表现良好,但U-Net除外;检测油污时KNet和TransNext存在误检;检测污渍时DeepLabv3+、SegFormer和KNet在特定区域出现轻微误检,而HKAN无此问题。在Fabric数据集上,三个CNN模型的检测性能弱于Transformer类模型,HKAN的检测性能优于TransNext,边界更清晰完整。在ZJU-Leaper数据集上,HKAN显著优于对比模型,能准确捕获目标边界,在复杂场景中展现出色的细节描绘能力,面对显著背景干扰时具有更强的鲁棒性,对大尺度目标的分割更加一致,减少了SegFormer和KNet常见的碎片化或连贯性不足问题。消融实验以基于纯CNN的U-Net为基线,依次使用PoolFormer模块、KAN卷积模块、KAN Transformer模块和混合KAN模块作为编码器。结果显示,用KAN卷积替换U-Net中的卷积模块可将检测性能显著提升,但与主流模型仍有差距;使用PoolFormer模块和KAN Transformer模块作为编码器能进一步提升性能,但仍未达到SOTA水平;使用完整的混合KAN模块作为编码器时性能接近SegFormer和KNet。消融可视化表明,CNN编码器和KAN卷积编码器在处理复杂织物缺陷时表现不佳,存在误检和误判;Transformer编码器倾向于过度检测背景像素;混合KAN编码器在局部与全局特征之间取得了更好的平衡,能有效消除复杂背景纹理的干扰。
本研究的结论是,HKAN通过将CNN、Transformer和KAN整合到统一框架中,在织物缺陷分割任务上展现了显著潜力。在三个织物数据集上的大量实验表明,HKAN对简单和复杂织物图像均能取得优异的分割结果,超越了单纯基于CNN或Transformer的模型。HKAN的科学价值在于证明了将KAN与主流深度学习架构融合的可行性,为神经网络设计提供了新的视角。其应用价值体现在织物缺陷检测的工业场景中,HKAN在精度与计算效率之间取得了较好的平衡,适合实际部署。此外,HKAN还具有跨领域应用的通用性,例如在医学影像中的肿瘤边界检测、器官分割和微小病灶识别等任务中,其整合局部与全局特征的能力具有潜在优势。然而,HKAN也存在一定的局限性,主要挑战在于其计算复杂度较高,将CNN、Transformer和KAN统一在一个框架中增加了模型规模和推理时间,可能限制其在资源受限环境(如边缘设备或实时系统)中的应用。本研究的主要亮点包括:提出了混合KAN模块,将KAN卷积模块与KAN Transformer模块统一在一个框架中;设计了简单有效的KAN卷积模块,以较少参数实现与传统卷积相当的精度;将PoolFormer中的MLP替换为KAN,构建了轻量级KAN Transformer模块,增强了Transformer对全局上下文信息的捕获能力;在多个织物数据集上取得了优于主流语义分割模型的性能。未来工作将致力于将HKAN发展为适用于计算机视觉中各种下游任务的骨干网络,以探索其在其他领域的潜在应用。