本研究由福建农林大学交通与土木工程学院的林俊奇(junqi lin)、王品鑫(pinxin wang)、阮云凯(yunkai ruan)及孙云强(yunqiang sun),以及浙江浙交检测技术有限公司的王品鑫(pinxin wang)共同完成。论文发表于 *Scientific Reports*,2026年第16卷,文章编号5284。
本研究属于计算机视觉与交通基础设施智能运维的交叉领域,聚焦于路面缺陷检测(pavement defect detection)。随着全球路网扩展与交通量增加,路面病害日益严重,威胁交通安全与路面耐久性,因此高效、准确的路面缺陷检测成为道路养护和交通安全管理的关键环节。传统人工巡检或简单图像处理方法效率低、主观性强,机器学习方法依赖人工设计特征,泛化能力受限。深度学习尤其是卷积神经网络(convolutional neural networks, CNNs)能自动学习图像层次特征,其中YOLO系列单阶段检测器在精度与速度之间取得了良好平衡,适合路面缺陷检测任务。然而,路面缺陷形态不规则、尺度多样、环境光照多变,且边缘设备计算资源有限,现有模型在精度与轻量化之间仍存在矛盾。针对上述问题,本文提出了一种基于YOLO11的增强型轻量化模型YOLO11-WLBS,旨在提升路面缺陷检测精度、降低模型参数,并验证其在极端条件下的鲁棒性与跨数据集泛化能力。
在研究方法上,本研究以YOLO11m为基线模型,系统集成了四个改进模块。第一个模块是小波变换卷积(wavelet transform convolution, WTConv),利用Haar小波将输入特征图分解为低频(LL)、水平高频(LH)、垂直高频(HL)和对角高频(HH)四个子带,分别进行基础卷积处理后通过逆小波变换重构特征图,从而增强裂缝边缘等高频细节特征的表达。第二个模块是轻量化自适应提取(lightweight adaptive extraction, LAE),位于卷积骨干网络之后,采用分组下采样卷积提取局部空间特征,同时利用全局平均池化和1×1卷积生成通道注意力权重,通过逐元素乘法融合局部特征与自适应权重,在保持轻量化的同时增强语义表达能力。第三个模块是双向特征金字塔网络(bidirectional feature pyramid network, BiFPN),替代YOLO11颈部原有的单向特征金字塔网络,通过自顶向下和自底向上的双向信息流以及可学习的融合权重,实现多尺度特征的高效融合,缓解单向传输带来的语义退化问题。第四个模块是简单注意力机制(simple attention module, SIMAM),通过计算神经元之间的能量差异来评估特征重要性,无需复杂的矩阵运算即可突出显著区域,提升小裂缝和低对比度缺陷的检测能力。
实验采用UAV-PDD2023数据集,该数据集包含2440张由无人机拍摄的高分辨率路面图像(2592×1944像素),标注了横向裂缝、纵向裂缝、龟裂、斜裂缝、坑洞和修补六类缺陷,共10075个缺陷实例。数据按7:2:1划分为训练集、验证集和测试集。模型训练在配备NVIDIA GeForce RTX 4080 Super GPU的工作站上进行,采用SGD优化器,初始学习率0.01,批大小64,训练300轮,输入尺寸640×640。性能评估指标包括精确率(precision, P)、召回率(recall, R)、F1分数(F1-score)、平均精度(mean average precision, mAP)在IoU阈值0.5下的mAP@0.5以及0.5至0.95范围内的mAP@0.5–0.95。
首先,研究比较了多种经典目标检测模型与不同YOLO版本。结果表明,SSD、Faster R-CNN和Mask R-CNN的检测精度较低,精确率分别为0.572、0.636和0.659;YOLO系列中YOLO11最高,精确率为0.853。进一步对YOLO11的五个变体进行对比,YOLO11m在精度(0.853)与参数量(20.06M)之间取得最佳平衡,因此被选为基线模型。
随后进行的消融实验验证了各模块的独立贡献与协同效应。单独添加WTConv时,精确率提升0.022,mAP@0.5提升0.033;单独添加BiFPN时,精确率提升0.028,mAP@0.5提升0.031;单独添加LAE时,参数量减少6.14M,同时精度略有提升;单独添加SIMAM时,mAP@0.5提升0.034。当四个模块全部集成时,模型达到最优性能:精确率0.947,召回率0.895,F1分数0.920,mAP@0.5为0.944,mAP@0.5–0.95为0.703,参数量降至14.94M,相比基线YOLO11m减少约25.5%,精确率提升6.4%,召回率提升15.8%,mAP@0.5提升12.2%。
在模型可视化分析中,研究采用Grad-CAM生成热力图以直观展示注意力分布。结果显示,YOLO11m对裂缝区域的注意力分散且不完整,而YOLO11-WLBS能精确覆盖完整裂缝边缘和几何形态,尤其在多类型缺陷混合场景下,改进模型能完整识别所有缺陷区域,进一步验证了WTConv和BiFPN在特征提取与融合方面的有效性。
在极端条件测试中,研究通过伽马校正模拟低照度与高曝光场景,通过双线性插值下采样模拟低分辨率模糊成像。结果表明,YOLO11-WLBS在低照度、高照度和模糊条件下均能保持稳定检测性能,在高照度下检测精度甚至略有提升,展示了较强的鲁棒性。
在跨数据集泛化实验中,模型在UAPD数据集上进行了测试。该数据集包含2401张无人机拍摄的真实路面缺陷图像,图像分辨率为500×500。结果显示,模型在UAPD上仍保持较高精度,精确率0.869,召回率0.813,mAP@0.5为0.824,mAP@0.5–0.95为0.603,精度下降可归因于图像分辨率降低和视角差异,但整体表现仍满足工程要求。
在分类型性能评估中,YOLO11-WLBS对四类裂缝缺陷的检测精度均高于整体水平,其中龟裂(alligator cracks, AC)的mAP@0.5–0.95达到0.812,比整体高0.109,显示出WTConv对复杂纹理缺陷的增强作用。纵向裂缝(longitudinal cracks, LC)的mAP@0.5–0.95略低于整体0.004,可能因其细长形态和大尺度变化导致高IoU阈值下的定位困难。坑洞(potholes)的召回率仅0.657,主要原因是样本占比仅2%,且坑洞边界不规则、易受阴影和积水干扰,同时WTConv对高频特征的强调可能削弱了对坑洞所需的低频结构信息的学习。
在移动端部署验证中,模型通过TensorFlow Lite框架进行全整数(int8)量化和层剪枝,部署于Redmi K90 Pro Max智能手机上。实时路面检测显示,系统能准确识别并标注斜裂缝、纵向裂缝、横向裂缝和龟裂,帧率分别达到31.29和29.82 FPS,接近30 FPS的实时性能,验证了模型在边缘设备上的工程实用性。
研究的主要结论包括:所引入的四个模块均能独立提升模型性能,其中WTConv和BiFPN贡献最为显著,四模块融合实现了最佳协同效果;YOLO11-WLBS相比基线YOLO11在精确率、召回率、mAP@0.5和mAP@0.5–0.95上分别提升0.064、0.158、0.122和0.058,同时参数量降低约25.5%;模型在极端光照、模糊和多场景条件下保持稳定,表现出强泛化能力和环境适应性。
本研究的科学价值在于提出了一种融合小波变换、轻量化自适应提取、双向特征金字塔和能量注意力机制的轻量化路面缺陷检测框架,解决了检测精度与计算效率之间的平衡难题。其应用价值在于模型参数量小、推理速度快,适合部署于车载终端、无人机和智能手机等边缘设备,为道路智能巡检和基础设施监测提供了高效、鲁棒的解决方案。研究亮点包括:首次将WTConv与BiFPN结合用于路面缺陷检测,显著增强了高频边缘特征和多尺度融合能力;通过消融实验系统量化了每个模块的贡献;并完成了从模型设计到移动端部署的完整验证。局限性与未来工作主要涉及训练计算资源消耗较高、稀有缺陷类别性能受数据稀缺影响,未来将引入多源数据集、多模态融合和缺陷严重程度定量评估,进一步完善路面缺陷管理系统。