分享自:

基于AI和机器学习的声学板精益自动化制造中的织物缺陷检测

期刊:Proceedings of the Institution of Mechanical Engineers, Part B: Journal of Engineering ManufactureDOI:10.1177/09544054231209782

作者为 Wai Hin Cheung 与 Qingping Yang,研究单位是 Brunel University London(伦敦布鲁内尔大学)的 College of Engineering, Design, and Physical Sciences(工程、设计与物理科学学院)。该论文发表于 *Proc IMechE Part B: J Engineering Manufacture*,2024 年第 238 卷第 12 期,页码 1827–1836,DOI 为 10.1177/09544054231209782。该研究属于制造工程与人工智能交叉领域,主要面向声学面板(acoustic panels)制造中的织物缺陷检测问题。

研究的学术背景是:在传统声学面板制造流程中,织物缺陷主要依靠人工目视检查(manual visual inspection),这种方式容易受人为失误、视觉疲劳和注意力下降等因素影响,导致检测效率与一致性不足。已有研究表明,人工检查员在连续目视检查不到 30 分钟后,检测能力就会明显下降。因此,为了提高生产效率和产品质量,需要开发基于人工智能和机器学习(machine learning, ML)的自动化织物缺陷检测系统。该研究的目标是利用深度学习(deep learning, DL)模型,对声学面板用织物进行缺陷自动分类,并将其集成到合作企业 Soundsorba Ltd 的精益自动化生产线中。

在研究方法方面,该工作首先回顾了基于机器视觉与深度学习卷积神经网络(convolutional neural network, CNN)的织物缺陷检测研究进展,并指出传统统计、谱分析、结构分析和基于模型的方法在缺陷定位、噪声敏感性和灵活性等方面存在局限。随后,研究基于迁移学习(transfer learning)方法,选择两种预训练 CNN 架构,即 GoogLeNet 和 ResNet50,构建织物缺陷分类模型。数据集共包含 1800 张图像,分为六类:褶皱(crease)、孔洞(hole)、墨渍(ink stain)、多重网纱(multiple netting)、油渍(oil stain)和无缺陷(no defect)。其中无缺陷类图像有 511 张,所占比例最高,为 28.4%;褶皱类有 373 张,占 20.7%;其他缺陷类图像数量在 220 至 234 张之间。

研究流程包括图像采集与预处理、网络结构修改、超参数优化、模型训练与测试以及可解释性分析。图像预处理阶段使用图像数据增强器(image data augmenter)进行随机旋转(0°至360°)和随机镜像翻转,以增强模型的泛化能力并减少过拟合。所有图像统一缩放为 224×224 像素,以匹配 GoogLeNet 和 ResNet50 输入层要求。由于原始缺陷尺寸极小,例如墨水污点最小可见尺寸约为 0.5 毫米,因此成像系统的分辨率需达到至少 0.5 毫米/像素。相应地,为保证缺陷信息在输入图像中可见,视场(field of view, FOV)不应超过 112 毫米×112 毫米。

在网络结构修改上,由于预训练网络原本输出 1000 类,而本研究仅需区分 6 类,因此研究替换了最后的全连接层和分类层。优化算法选择 Adam(adaptive moment estimation),初始学习率为 1×10⁻³,梯度衰减因子 β₁ 为 0.9,平方梯度衰减因子 β₂ 为 0.999,mini-batch 大小为 54,验证频率为 32。GoogLeNet 训练轮数设定为 36,ResNet50 设定为 20。每次训练前数据随机划分,训练集、验证集和测试集比例分别为 65%、15% 和 20%。为降低数据随机划分带来的误差,每种网络均重复训练和测试五次。

实验结果显示,GoogLeNet 模型的平均准确率为 89.84%,而 ResNet50 模型的平均准确率达到 95.45%。ResNet50 不仅准确率更高,而且五次重复实验准确率的标准差为 1.22%,低于 GoogLeNet 的 3.60%,因此其稳定性和鲁棒性更好。五次重复测试的准确率分布也显示 ResNet50 整体优于 GoogLeNet。对两种模型准确率进行双尾独立样本 t 检验,计算得到 t 值为 −3.297,自由度为 8,显著性水平 α=0.05 时的临界 t 值为 2.306。由于 |t| 大于临界值,拒绝原假设,说明两种模型平均准确率之间存在统计学显著差异。

在分类结果中,两种模型对“墨渍”类均达到 100% 正确率;ResNet50 对“孔洞”和“油渍”类也实现了 100% 识别。模型的混淆矩阵显示,“褶皱”类预测效果最差,GoogLeNet 模型中“褶皱”类的精确率为 0.7529,F-score 为 0.8000,说明该类别存在较多假阳性预测。研究者通过可视化第一个卷积层后的批归一化激活特征图发现,“褶皱”与“无缺陷”图像在特征提取阶段的激活输出非常相似,这解释了模型难以有效区分这两类的原因。相反,在墨渍图像中,卷积层特征图已经出现明显激活区域,对应织物上的墨渍位置,因此模型对该类识别效果最佳。

研究还采用 Grad-CAM(gradient-weighted class activation mapping,梯度加权类激活映射)技术生成显著性图,以增强 CNN 模型的可解释性。Grad-CAM 通过计算输出类得分对卷积特征图的全局平均池化梯度,得到神经元重要性权重,并用 ReLU 激活函数保留正向加权区域。结果表明,对于孔洞、墨渍和油渍等小尺寸缺陷,模型的高亮区域集中于缺陷位置;对于褶皱,网络主要关注褶皱形成的阴影区域;对于无缺陷图像,网络则几乎高亮整个图像范围,说明其在整个图像中搜索潜在缺陷特征。该结果进一步支持了模型决策机制的分析,也为后续模型改进提供了可视化依据。

研究指出了若干局限性。首先,由于对整幅图像进行分类,模型无法同时定位多个不同类型的缺陷。例如,若同一张图像同时包含褶皱和多重网纱,模型难以输出多个标签。其次,部分无缺陷图像因拍摄时照明不均出现对比度差异,可能影响“无缺陷”与“褶皱”类的区分能力。为解决这些问题,未来可将 CNN 图像级分类与区域卷积神经网络(R-CNN)或 YOLO 目标检测模型相结合,先分类后定位多缺陷区域。此外,成像系统应改进为环形光源或对称侧光源,并在织物下方增加背光,以减少光照不均对图像质量的影响。

该研究的结论指出,基于预训练 ResNet50 的 CNN 模型在声学面板织物缺陷分类中表现优越,平均准确率超过 95%,加权平均 F-score 超过 96%。该模型在准确性和稳定性方面均优于 GoogLeNet 模型,因此更适合工业部署。该工作不仅为声学面板制造中的自动化织物检测提供了可行模型,还明确了图像采集硬件的技术要求,包括分辨率、视场、光照和相机快门速度等。该研究有助于推动精益自动化制造在声学面板行业的实际应用,提升生产效率和产品质量。研究还得到了 Innovate UK 项目 KTP 12273 的部分资助,并由 Soundsorba Ltd 提供部分织物缺陷样本。

该研究的亮点在于:使用两种主流预训练 CNN 架构进行对比,并通过五次重复实验和统计检验验证模型差异;将 Grad-CAM 引入模型解释过程,揭示不同织物缺陷类别在网络中的学习特征;特别关注“无缺陷”类识别问题,避免现有部分研究仅检测缺陷而忽略正常样本的局限;同时,该工作提出了从图像采集到模型部署的完整工业应用思路,为后续系统集成提供了基础。整体而言,该研究在声学面板制造中的自动视觉检测领域具有明确的工程应用价值,并为未来结合目标检测模型和更优照明系统提供了改进方向。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com