分享自:

基于YOLOv11多尺度特征提取的道路缺陷检测算法研究

期刊:Engineering Letters

本文属于类型a,即单一原创研究的学术论文。以下是对该研究的学术报告。

本文的主要作者为Yong Liu和Ying Tian,均来自辽宁科技大学计算机与软件工程学院(School of Computer Science and Software Engineering, University of Science and Technology Liaoning)。该研究发表于《Engineering Letters》期刊,具体为2026年7月第34卷第7期,页码为2877至2887。论文标题为“Research on Road Defect Detection Algorithm Based on YOLOv11 with Multi-scale Feature Extraction”。

该研究属于计算机视觉与智能交通系统交叉领域,具体聚焦于道路缺陷的自动检测。随着全球城市化进程加快和道路交通流量迅速增长,路面缺陷对道路使用寿命、行车安全和运输效率产生了显著影响。传统的人工巡检方法效率低、主观性强、漏检率高,而基于图像处理的传统方法在光照变化、恶劣天气和夜间环境下鲁棒性较差。近年来,基于深度学习的目标检测方法逐渐成为道路缺陷检测的主流,其中YOLO系列算法因其在检测精度与推理速度之间的良好平衡而被广泛采用。然而,道路缺陷形态不规则、尺度变化大,且环境复杂,现有方法在细小裂缝和不规则目标的检测上仍存在精度不足的问题。因此,本研究旨在改进YOLOv11m模型,提升其对不规则道路缺陷的特征提取能力和检测精度。

研究的具体工作流程可以从模型改进、实验设置和性能评估三个层面来阐述。首先在模型改进方面,作者基于YOLOv11m框架提出了YOLOv11m-CRC模型,主要包含三个创新模块。第一,设计了C3K2_SDSConv模块,将动态蛇形卷积(Dynamic Snake Convolution, DSConv)与空洞卷积(Dilated Convolution)引入C3K2结构之中。动态蛇形卷积通过可学习的偏移量使卷积核能够自适应地调整采样位置,从而更灵活地捕捉裂缝等细长不规则结构的形态特征。同时,空洞卷积在不增加参数量的前提下扩大了感受野,使模型能够同时关注局部细节和更大范围的上下文信息。第二,设计了CRC模块,用轻量级的上采样算子CARAFE(Content-Aware Reassembly of Features)替代传统的最邻近插值上采样,并结合残差连接以保留低频结构信息。CARAFE能够根据内容感知的方式预测每个位置的重组核,从而在上采样过程中更好地保持空间一致性。残差连接则缓解了复杂重组操作可能带来的信息损失。第三,在C2PSA模块中引入了可变形双层路由注意力(Deformable Bi-level Routing Attention, DBRA)机制,以增强模型对全局上下文和局部细粒度信息的建模能力。DBRA通过偏移预测网络自适应地选择采样位置,并通过top-k路由区域构建键值对,使模型能够选择性地聚合语义相关的区域信息。在实验设置方面,研究使用RDD2022数据集进行训练和评估。该数据集由东京大学发布,包含来自多个国家的47,420张道路场景图像和超过55,000个标注实例。为保证数据一致性,作者仅选取了来自日本的7,900张图像,并按70%、10%和20%的比例划分为训练集、验证集和测试集。实验在Windows 10系统上进行,使用NVIDIA GeForce RTX 4070 Ti GPU,训练200个epoch,批量大小为16,输入图像统一调整为640×640像素,初始学习率为0.01。评估指标包括精确率(Precision)、召回率(Recall)、平均精确率均值(mean Average Precision, mAP)、参数量(Params)和计算量(GFLOPs)。

在实验结果方面,消融实验和对比实验均验证了各模块的有效性。在注意力机制对比实验中,DBRA注意力机制在mAP@50上达到58.6%,优于CBAM、CA、EAM和DSAM等注意力机制,且参数量仅略有增加。在C3K2模块改进实验中,C3K2_SDSConv模块将mAP@50从53.9%提升至54.8%,相比其他改进方案如EFAttention、PConv、KANConv、FasterBlock和RCSOSA均取得了更好的性能。在上采样模块对比实验中,CRC模块将mAP@50提升至55.5%,相比传统上采样提高了1.6%,且参数量和计算量增加较少。最终,当三个模块同时集成时,YOLOv11m-CRC模型在RDD2022测试集上实现了60.9%的精确率、53.0%的召回率和56.2%的mAP,相比YOLOv11m分别提升了0.6%、2.1%和2.3%。此外,mAP@50:95也从24.1%提升至26.0%。在不同YOLO系列模型的对比实验中,YOLOv11m-CRC在mAP@50上优于YOLOv3m、YOLOv5m、YOLOv6m、YOLOv8m、YOLOv9m、YOLOv10m和YOLOv12m,分别高出1.3、2.0、4.7、0.7、0.6、3.3、2.3和0.2个百分点。虽然Faster R-CNN和RT-DETR在精度上接近或略高,但其参数量和计算量远高于所提方法。在泛化能力实验中,YOLOv11m-CRC在Road Damage数据集上的mAP@50提高了2.1%,在中国子集上的mAP@50提高了2.4%,表明模型在不同数据集上具有良好的泛化性能。可视化结果显示,YOLOv11m-CRC在光照充足和低光照场景下均能更准确地检测道路缺陷,漏检和误检更少。

研究的结论指出,YOLOv11m-CRC模型通过多尺度特征提取和注意力机制的协同优化,显著提升了对不规则道路缺陷的检测能力。该研究的科学价值在于为不规则目标的特征提取提供了一种有效的设计思路,即通过动态蛇形卷积与空洞卷积的结合来适应复杂形态,同时利用内容感知上采样和可变形注意力机制来增强特征表示。在应用价值方面,该模型在保持较高检测精度的同时,计算开销仍处于可接受范围,基本满足实时道路缺陷检测的需求,为智能交通系统中的自动化巡检提供了可行的解决方案。

本研究的亮点主要体现在三个方面。第一,模型设计具有针对性,三个改进模块分别从特征提取、上采样和注意力机制三个角度解决了不规则道路缺陷检测中的关键问题。第二,实验验证充分,不仅进行了详细的消融实验,还与多种主流目标检测模型和不同数据集进行了对比,证明了所提方法的有效性和泛化能力。第三,各模块的设计兼顾了性能与效率,在提升检测精度的同时避免了参数量的过度增加,具有较强的实际部署潜力。此外,研究中使用的RDD2022数据集涵盖了多种道路缺陷类型和不同国家的道路场景,为模型评估提供了较为真实的测试环境。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com