分享自:

基于区域的深度学习自主结构视觉检测用于多种损伤类型识别

期刊:Computer-Aided Civil and Infrastructure EngineeringDOI:10.1111/mice.12334

基于区域的深度学习自主结构视觉检测方法研究报告

作者: young-jin cha*, wooram choi, gahyun suh, sadegh mahmoudkhani (加拿大曼尼托巴大学土木工程系) 与 oral büyüköztürk (美国麻省理工学院土木与环境工程系)

发表期刊: computer-aided civil and infrastructure engineering, 2018年, 第33卷, 731–747页

研究背景与目的

土木基础设施(如桥梁)的视觉变化(例如裂缝或腐蚀)是结构健康状况的重要指标,因此视觉检测一直是评估桥梁状况的主要手段。然而,传统的人工视觉检测方法严重依赖于检测人员的专业训练水平,并且在定量评估的一致性和可达性方面存在显著局限,对公共安全构成隐患。为了克服这些限制,研究人员开始发展基于计算机视觉(computer vision)的结构损伤检测技术,以实现对图像的远程自动检测。

早期的研究大多集中在图像处理技术(image-processing techniques, IPTs)上,并结合预处理和后处理方法来检测特定单一类型的结构损伤,例如混凝土裂缝或路面坑槽。尽管部分研究尝试通过引入机器学习技术来提升在真实环境下的效率和鲁棒性,但这些方法仍然耗时且只能检测单一损伤类型。为克服IPT方法的缺陷,cha等人于2017年引入了基于卷积神经网络(convolutional neural networks, CNNs)的深度学习方法,该方法能够自动计算损伤敏感特征,但使用滑动窗口进行损伤定位时,难以确定最优窗口大小以适应不同尺度的图像。针对这一系列问题,本研究旨在提出一种能够提供准实时(quasi real-time)、同时检测多种类型损伤的自动化结构视觉检测方法。为此,研究者采用并改良了更快速的基于区域的卷积神经网络(faster region-based convolutional neural network, faster r-cnn)。

研究工作流程

本研究的核心工作流程包含数据库构建、网络架构修改与训练、模型测试与验证,以及视频检测框架的提出四个主要环节。

首先,研究者建立了一个专门的结构损伤图像数据库。他们使用Nikon D5200和D7200数码单反相机,在距离目标1.0至1.5米处,从加拿大曼尼托巴大学的两座桥梁和一栋建筑综合体采集了297张原始图像,这些图像的分辨率高达6,000×4,000像素,并涵盖了不同的光照条件。随后,这些图像被裁剪为500×375像素的小图,并从中筛选出2,366张包含特定损伤类型的图像用于构建最终数据库。研究者使用在MATLAB环境中自主开发的代码,对这2,366张图像中的4,695个物体(损伤实例)进行了手动标注,确定了损伤的类型标签和边界框的坐标。标注的损伤类型包括五种:混凝土裂缝(concrete crack)、两个腐蚀等级的中度钢腐蚀(medium steel corrosion)和高度钢腐蚀(high steel corrosion)、螺栓腐蚀(bolt corrosion)以及钢分层(steel delamination)。为生成测试集,研究者随机选取了至少包含每种损伤类型30%图像和30%物体实例的图像。未选入测试集的剩余图像则组成训练与验证集。最后,为了在小规模数据库上提升CNN的性能并减少过拟合,研究者对训练和验证集进行了水平翻转的数据增强(data augmentation)处理。

其次,研究者对Faster R-CNN的架构进行了修改与训练实施。Faster R-CNN通过共享卷积层将区域提议网络(region proposal network, RPN)和快速R-CNN(fast r-cnn)集成在一起。RPN负责生成可能包含物体的候选区域提议,而Fast R-CNN则对这些提议进行更精细的定位和分类。两者共享同一个CNN进行特征提取(本研究采用ZF-Net),从而大幅降低了计算成本并提升了速度。为了适应五种损伤类型及背景(共6类),研究者对原始的ZF-Net架构进行了定制化修改:在RPN部分,将最后的层替换为256个深度的特定卷积层和全连接层(feature vector),并接上Softmax层和回归层;在Fast R-CNN部分,替换了最后的池化层和全连接层,并增加了Dropout层以防止过拟合,最后同样接上适配6类输出的Softmax层和回归层。整个网络的训练采用四步交替优化策略,以微调RPN和Fast R-CNN的参数。训练使用带动量的随机梯度下降法(MBGD),在含GPU的工作站上,整个训练过程耗时约4小时。为了找到最优的锚点(anchors)尺寸和比例,研究者进行了详尽的试验,考察了27种比例组合和6种尺寸组合。

主要实验结果

经过对40种不同锚点配置方案进行训练和验证后,模型性能通过平均精度(average precision, AP)和平均精度均值(mean ap, mAP)进行评估。测试结果显示,在名为“案例29”的配置中,网络达到了87.8%的最佳mAP。该案例中锚点的比例为0.20、0.85和1.70,尺寸为96、192和384。在此条件下,五种损伤类型的AP分别为:混凝土裂缝90.6%,中度钢腐蚀83.4%,高度钢腐蚀82.1%,螺栓腐蚀98.1%,钢分层84.7%。模型在GPU模式下对每张500×375像素图像的测试速度仅为0.03秒,展现了极高的效率。

为了验证模型的鲁棒性,研究者采集了11张全新的6,000×4,000像素图像进行测试。测试方法是将每张大图分割成128个符合输入尺寸的子图,分别检测后再将结果拼接。在此项测试中,模型取得了89.7%的mAP,与训练测试集上的结果高度一致,分别是:混凝土裂缝94.7%,中度钢腐蚀91.8%,高度钢腐蚀86.1%,螺栓腐蚀90.9%,钢分层85.2%。测试结果通过图像直观展示,在各种光照条件(强光、阴影、均匀光)下,大部分损伤都被成功检测和定位。然而,也存在少量误检或漏检的情况,例如强光下部分螺栓腐蚀被误判为钢腐蚀,或因拍摄距离问题导致小裂纹未识别。研究表明,这些微小误差可通过扩大训练数据库、调整相机拍摄角度(如通过无人机UAV)等方式解决。

此外,研究者还将本方法与cha等人在2017年提出的基于传统CNN的裂缝检测方法进行了对比研究。结果显示,虽然传统CNN方法也具有较高准确率,但所提出的Faster R-CNN方法在损伤定位方面更具优势。因为Faster R-CNN在训练数据准备阶段和RPN定位过程中均采用了灵活尺寸的锚点框,能够更精准地贴合不同长度和形状的裂缝,而不像传统方法那样依赖固定大小的滑动窗口。同时,由于Faster R-CNN的特征图由CNN一次处理后共享,其测试速度也远快于需要在每个滑动窗口上重复运行整个网络的传统CNN方法。

结论与应用价值

本研究成功开发了一种基于改进型Faster R-CNN的结构表面损伤检测方法,能够以准实时速度(每帧0.03秒)同时检测并定位五种结构损伤类型。其科学价值在于,通过将目标检测领域的先进深度网络架构迁移并适配于土木工程领域,克服了传统图像处理方法和早期CNN方法只能检测单一种类损伤、或者定位效率低和灵活性差的难题。特别是其端到端的训练方式和特征图共享机制,为多类目标检测提供了高精度与高速度的解决方案。

在应用价值方面,该方法为实现自动化、智能化的结构健康监测(structural health monitoring, SHM)提供了坚实的算法基础。研究者还进一步提出了一个基于视频的检测框架,使该方法能够用于处理帧率为30 fps、分辨率为1,920×1,080的视频流,从而实现准实时的视觉检测。该框架若结合无人机(UAV)使用,将能有效解决相机视角受限的问题,有望取代传统的人工视觉巡检,为桥梁等土木基础设施的安全维护提供革命性的技术支持。

研究亮点

本研究的亮点主要体现在以下三个方面。第一,问题导向的方法创新:它首次将Faster R-CNN应用于多类型建筑结构表面损伤的同时检测与精确定位,解决了此前方法只能有效检测单一损伤类型的痛点。第二,高度定制化的实验流程:研究团队从零开始构建了一个包含2,366张细粒度标注图像的数据库,并通过详尽的试错过程对网络的关键超参数——尤其是RPN中的锚点尺寸和比例——进行了优化,找到了针对此类特定损伤的最优配置集。第三,高效性能与鲁棒性的统一:最终模型不仅在测试集上取得了87.8%的mAP,更在全新的、包含复杂光照条件的高分辨率图像中表现出一致的高精度(89.7% mAP),同时保持了每张图0.03秒的极快处理速度,证明了其在实际部署中的巨大潜力。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com