本文提出了一种改进的Faster R-CNN(Faster Region-based Convolutional Neural Network,更快的基于区域的卷积神经网络)算法,用于工业质量控制中的钢材表面缺陷检测。研究由辽宁工程技术大学机械工程学院的Leng Yuefeng(冷岳峰)和Liu Jiazhi(刘佳志)完成,发表于《Scientific Reports》期刊,文章于2025年3月13日收稿、2025年7月18日接收,发表时间为2025年。
钢材表面缺陷检测是工业生产中一项至关重要的检验任务。中国在全球钢铁生产中占据主导地位,钢铁产品质量受损可能引发重大经济损失和严重安全隐患。近年来,基于深度学习的自动化缺陷检测已成为研究前沿,现有算法大致分为两阶段方法和单阶段方法两类。两阶段方法以Faster R-CNN为代表,集成了区域候选网络(Region Proposal Network,RPN)和特征金字塔网络(Feature Pyramid Network,FPN),能够有效融合多层级特征,虽然计算量略有增加,但语义丰富度和检测精度更高。单阶段检测器如YOLO系列、SSD(Single Shot MultiBox Detector,单次多框检测器)和RetinaNet则将检测任务形式化为统一的回归分类问题,以牺牲部分精度为代价优先保证计算效率。钢材表面缺陷检测面临细小缺陷漏检和精度不足的挑战,因此本研究旨在通过改进Faster R-CNN框架,提升细微缺陷的识别能力和检测速度。
本研究以基准Faster R-CNN框架为基础,采用ResNet50-FPN作为特征提取骨干网络。特征提取模块负责从输入图像中提取关键特征表示,其选择直接影响模型的检测速度和精度。与基线VGG16特征提取器相比,ResNet50通过跨层连接增强了多尺度特征融合能力,利用残差连接缓解了梯度消失问题,并用全局平均池化取代了传统的全连接层。采用ResNet50作为特征骨干能更有效地捕获表面缺陷特征、减少参数量并提高检测精度。FPN通过融合高层语义信息和低层高分辨率特征实现跨尺度特征融合,ResNet50-FPN的组合架构不仅增强了小目标检测能力,还优化了深度与效率之间的权衡。
在原特征提取框架中,ResNet50采用分层图像划分,从C1至C5层提取特征;FPN融合多层级特征生成P2至P5特征图。本研究的核心改进之一是在P3和P2之间集成了上采样层、卷积层、批归一化层和ReLU(Rectified Linear Unit,修正线性单元)激活层,实现了跨维度融合并增强了低层特征图中的信息表示。具体而言,增强的融合模块采用双线性插值对高层特征进行动态尺寸调整以匹配低层特征维度,确保空间对齐;同时使用3×3卷积核将P3和P2的通道数标准化为256,以进行有效的跨层整合。特征融合采用逐元素求和,随后进行批归一化和ReLU激活。融合特征图的数学表达式为Fnew = ReLU[BatchNorm(F’high+F’low)],其中C、H、W分别表示通道数、高度和宽度。这一增强显著改善了高层语义特征与低层空间特征的融合,改进后的FPN架构比传统FPN实现具有更强的灵活性和任务特定适应性,从而大幅提升了细粒度细节捕获能力。
第二个核心改进是在FPN和RPN之间集成轻量级通道注意力模块(Lightweight Channel Attention Module,LCAM)。该模块由下采样卷积层、ReLU激活层、上采样卷积层和Sigmoid激活层组成。工作流程为:FPN处理后的特征图首先进入下采样卷积层,通过3×3卷积将输入通道数从256降至128,在压缩特征的同时降低计算复杂度;随后输出经过ReLU激活层,保留正输入并将负值置零,增强数据非线性并提升复杂特征学习能力,其数学表达式为ReLU(x)=max(0,x);经ReLU激活后,特征图经过上采样卷积层将通道维度从128恢复至256,增强精化特征空间表示;然后进入Sigmoid激活层生成注意力权重,权重值域为[0,1],接近1的值表示更高重要性,接近0的值表示较低显著性,从而建立通道级相关性,其数学表达式为σ(x)=1/(1+e^(-x))。Sigmoid激活后,注意力特征图与FPN输出特征图进行逐元素乘法融合,生成精化特征表示。假设输入特征图为x∈R^(B×C×H×W),两个卷积层的权重和偏置分别为W1∈R^(Creduced×C×3×3)、W2∈R^(C×Creduced×3×3)和b1、b2,注意力机制加权公式为f(x)=x⊙σ(W2*max(0,W1*x+b1)+b2),其中⊙表示逐元素乘法,*表示卷积运算。
研究采用东北大学采集的NEU-DET热轧钢带表面缺陷数据集进行实验。该数据集包含六类典型缺陷:裂纹(Crazing,Cr)、夹杂物(Inclusions,In)、斑块(Patches,Pa)、点蚀表面(Pitted Surface,Ps)、轧制氧化皮(Rolled-in Scale,Rs)和划痕(Scratches,Sc),共1800张200×200像素的灰度图像,每类缺陷300张,训练集与测试集按5:1比例划分。实验环境采用AMD Ryzen 7 5800H CPU和NVIDIA GeForce RTX 3050 Laptop GPU,深度学习框架为PyTorch 2.1.1+。参数设置为:初始学习率0.0001,动量0.9,权重系数0.0005,训练轮数100,批大小4,IoU(Intersection over Union,交并比)阈值为0.5。模型训练采用随机梯度下降(Stochastic Gradient Descent,SGD)优化,学习率每4个轮次衰减10%。检测判定标准为预测框与真实框的IoU超过0.5时视为有效检测。评估指标包括准确率(Precision,P)、召回率(Recall,R)、平均精度(Average Precision,AP)、平均精度均值(mean Average Precision,mAP)和检测速度(Frames Per Second,FPS)。
首先对比了不同特征提取网络的性能。实验在VGG16、VGG19、ResNet18和ResNet50之间进行对比,结果表明:VGG16的准确率最低、推理速度最慢且参数量最大;VGG19的网络更深但精度次优且参数量最大;ResNet18参数量最小且速度最快但精度不足;ResNet50通过残差连接解决了梯度消失问题,并用全局平均池化替代全连接层,显著减少了参数量。ResNet50的mAP达到72.8%,FPS为10.66,参数量为163,627KB,以适中的参数量和高效的推理速度实现了最优精度,因此被选为改进Faster R-CNN框架的特征提取骨干网络。
消融实验验证了不同改进策略的有效性。实验设置了六个组别:第1组为基准模型(ResNet50+FPN),mAP为72.8%;第2组加入特征融合模块,mAP提升至74.4%,Cr、Ps和Rs类别的AP分别提升了7.3%、3.4%和2.5%;第3组仅加入轻量级通道注意力,mAP降至67.2%,说明单独使用注意力机制会导致部分细小缺陷被忽略;第4组同时加入特征融合和通道注意力,mAP达到78.3%,相较基准提升了5.5个百分点,Cr、In、Ps、Rs和Sc类别的AP分别提升了14.8%、2.6%、4.9%、7.8%和3.0%;第5组在第4组基础上加入CBAM(Convolutional Block Attention Module,卷积块注意力模块),mAP降至73.3%,表明过度的注意力集中反而忽视了有效的特征区域;第6组将第4组中的标准卷积替换为深度可分离卷积,在保持检测性能的同时改善了Cr、In和Pa类别的AP,mAP提升至80.2%,FPS达到9.68,较基准增加了1.9个百分点和3.8%的速度提升。
与其他主流算法的对比实验表明,所提模型在Cr、Pa和Ps缺陷检测中取得了最优性能,mAP为80.2%,超过了Faster R-CNN(72.8%)、SSD(68.6%)、Cascade R-CNN(62.6%)、YOLOv5(74.3%)、YOLOv6(74.8%)、YOLOv7(73.4%)、YOLOv8(74.7%)、YOLOv9(73.4%)、YOLOv10(77.1%)、YOLOv11(75.3%)和YOLOv12(77.3%)。在Cr类别上,仅本模型(54.8% AP)和参考文献[23]的方法(52.9% AP)超过了50% AP。在Rs类别上,各模型的AP值普遍在50%至70%之间。这些限制源于缺陷图案与钢材固有纹理之间的视觉相似性,即使人工检查也存在较高错误率。
与其他注意力机制的对比实验中,LCAM以80.2%的mAP优于CA(Coordinate Attention,坐标注意力,75.8%)、SE(Squeeze-and-Excitation,压缩激励,77.4%)、EMA(Efficient Multi-scale Attention,高效多尺度注意力,76.3%)和MHSA(Multi-Head Self-Attention,多头自注意力,75.4%),同时保持了相当水平的FPS和模型参数量。
研究的主要结论为:特征融合模块与FPN的集成增强了模型的层级特征处理能力和细粒度细节提取能力,大幅提高了召回率,使mAP提升了1.6个百分点;在FPN和RPN之间加入轻量级通道注意力机制使模型更加关注钢材表面的缺陷部位,减少了参数量1419KB且运行时间提升了8.9%;用深度可分离卷积替代标准卷积降低了模型复杂度,推理速度提升了3.8%,同时mAP提升至80.2%,增加了1.9个百分点;CBAM集成降低了平均精度,而将FPN与LCAM生成的特征图结合则显著提高了检测精度。最终改进模型将Cr、In、Pa、Ps、Rs和Sc六类缺陷的检测精度分别提升了20.1%、8.7%、5.7%、9.1%、13.6%和18.6%,整体mAP提升了12.6个百分点。
本研究的主要亮点包括:提出了特征融合与轻量级通道注意力相结合的Faster R-CNN架构,在不显著增加计算开销的前提下显著提升了细小缺陷的识别精度;通过系统的消融实验和对比实验验证了各改进模块的独立贡献和协同效应;在NEU-DET数据集上取得了80.2%的mAP,超过了多种主流的单阶段和两阶段检测器;最终模型在检测速度上较基准模型提升了40.9%(从10.66 FPS到9.68 FPS的报告存在细节差异,但整体趋势表明速度未受明显影响且精度大幅提升)。该研究为自动化钢材表面检测系统提供了可靠的理论基础和实用框架,在工业质量控制领域具有重要的应用价值。