分享自:

基于深度学习的宽基线立体图像匹配综述

期刊:Remote SensingDOI:10.3390/rs13163247

本文是一篇发表于 Remote Sensing 期刊的综述论文(Review),题为《Review of Wide-Baseline Stereo Image Matching Based on Deep Learning》(基于深度学习的宽基线立体影像匹配综述)。该文由 Guobiao Yao(山东建筑大学测绘地理信息学院)、Alper Yilmaz(俄亥俄州立大学摄影测量计算机视觉实验室)、Fei Meng(山东建筑大学)及 Li Zhang(中国测绘科学研究院)共同撰写,于2021年8月17日发表。该综述聚焦于利用深度学习解决宽基线立体影像匹配这一摄影测量与计算机视觉领域的核心难题,系统性地梳理了从特征检测、特征描述到端到端匹配的深度学习技术流派。

论文的主体内容围绕三大核心技术主题展开,每一部分都阐述了其发展脉络与代表性成果的优劣。

第一个主题是基于深度学习的特征检测(Deep-Learning-Based Feature Detection)。 宽基线影像因视角变化引起几何与辐射畸变,传统手工特征(如SIFT)提取面临挑战。深度学习为解决这一问题提供了新思路,其主流方法分为监督学习与无监督学习。 * 监督学习策略:该类方法通常将传统算法提取的特征点作为“锚点”,训练神经网络预测更多特征点的位置、方向和尺度。例如,Lenc等人提出的方法通过设计局部不变特征损失函数,利用连体网络(Siamese Neural Network)学习特征的几何变换不变性,开创了深度学习不变特征检测的先河,其检测的特征具备良好的尺度和旋转不变性。在此基础上,Zhang等人利用光照不变特征解决了强光照变化下的匹配问题,而Doiphode等人则引入仿射不变约束以提取更稳定的特征。然而,这些方法在模型训练前通常需要已知图像块间的几何关系,这增加了训练数据制备的难度。为了缓解此问题,Mishkin等人提出了结合传统算法与深度学习的策略,他们使用多尺度Hessian矩阵检测初始特征点,并基于三元组网络AffNet来估算仿射不变区域,大幅提升了特征检测的效率与可靠性。 * 无监督学习策略:其代表为Savinov等人提出的方法,它将特征检测问题转化为图像兴趣点响应值排序问题。通过训练一个卷积神经网络学习像素点的响应函数,并依据响应值排序筛选出对透视变换保持良好不变性的特征点。研究表明,该方法在视角变化图像上的特征重复率可能优于传统的高斯差分(DoG, Difference of Gaussian)策略。然而,对于存在大视角变化的宽基线影像,现有深度学习特征检测器在重复性和稳定性方面仍有较大不足。总体而言,当前主流的监督学习方法因其能直接学习几何协变框架,其性能往往优于无监督学习。

第二个主题是基于深度学习的特征描述(Deep-Learning-Based Feature Description)。 特征描述旨在为检测到的特征点生成具有高相似度(即匹配特征间)和高判别力(即非匹配特征间差异大)的描述向量。深度学习在此领域的突破,主要源于网络结构(特别是连体网络和三元组网络)的构建和损失函数的设计。 * 早期模型与度量网络:早期代表作为MatchNet,它采用连体网络架构,包含特征编码网络和相似性度量网络,通过全连接层计算图像块间的相似度得分来判断是否匹配。随后,Zagoruyko等人探索了中央-环绕双流网络(CSTSnet)和空间金字塔池化网络(SPPnet),前者融合了图像的多分辨率信息并强化中心像素,后者则通过空间金字塔池化层增强了网络对不同尺寸图像块的适应性。 * 全卷积描述符与损失优化:为降低度量网络的计算消耗,Tian等人提出了全卷积描述模型L2-Net。它借鉴SIFT的思想,直接输出128维向量,并用L2范数下的欧氏距离衡量相似度,极大提升了效率。L2-Net因其优良的泛化能力和性能,成为了经典的描述网络主干。针对L2-Net忽视负样本贡献的缺陷,Balntas等人提出了三元组与浅层CNN(TSCNN),通过引入负样本训练来拉大非匹配描述符的距离。在此基础上,HardNet进一步引入“最难负样本”(即与匹配描述符最近的非匹配描述符)进行采样,并设计三元组边界损失函数,大幅提升了训练效率和匹配性能。此后,一系列改进模型涌现,如SOSNet引入二阶相似性正则化防止过拟合,GeoDesc通过余弦相似度量和自适应阈值增强了描述符的几何不变性,而ContextDesc则通过融合几何与视觉上下文信息,更好地适应了不同场景的几何和辐射畸变。高质量描述符的核心在于充分挖掘特征邻域的局部和全局信息,而三元组网络在学习和利用特征的独特性方面表现更优。

第三个主题是端到端匹配(Deep-Learning End-to-End Matching)。 与前两者将检测、描述、匹配分阶段独立训练不同,端到端策略旨在将整个流程融合为一个整体,通过联合训练获得全局最优模型参数。 * 期探索**:LIFT是端到端模型的早期先驱,它首次将特征检测、方向估计和特征描述集成到一个统一的流水线中。但其训练过程仍采用基于反向传播的多阶段训练模式,且依赖运动恢复结构(SfM, Structure from Motion)算法生成训练用匹配块,这限制了模型的训练效率和实用性。 * 自监督与先进架构:为解决LIFT的问题,DeTone等人提出了SuperPoint模型。它先利用一个名为MagicPoint的自监督网络自动标注训练数据中的特征点,替代了繁琐的SfM手工标注,然后通过编码-解码结构实现特征点检测和描述符的端到端联合训练。更进一步的突破是D2Net,它颠覆了传统的“先检测再描述”模式,提出了“先描述再检测”的新范式。D2Net采用单分支网络架构,将特征的位置和描述符信息存储于高维特征通道中,直接在高层次语义信息的密集描述符中寻找具备区分性的特征点,这更有利于获取稳定和高效的匹配。尽管端到端策略更易获得全局最优解,但复杂的多网络结构需要海量训练数据,因此,自监督学习模式是当前最具应用前景的方向之一。

实验评估与展望部分: 论文选取了涵盖端到端匹配、深度特征检测与描述、以及手工设计方法组合在内的5类共10种代表性算法,并在多组包含大视角变化、表面不连续、纹理稀少的无人机和卫星宽基线立体影像上进行了详尽的定性与定量测试。结果表明,结合深度学习特征检测与描述的方法(如AffNet + HardNet/SOSNet)综合性能突出,能获得较多且分布均匀的匹配点;而深度学习方法在手工业态和城区等杂乱或重复纹理场景下依然面临严峻挑战。此外,研究揭示各算法均难以达到亚像素级匹配精度,根源在于特征检测与匹配两阶段的相对独立,导致相应点难以精确对准。 最后,论文指出了未来的发展趋势与挑战:特征检测需在高重复性、高稳定性的仿射不变特征提取上进一步突破;特征描述应引入视角变换模块(Viewpoint Transform Module)以增强模型的透明度和泛化能力;而端到端匹配则需在精简网络结构的同时探索利用大规模自监督数据,以应对复杂场景和重复纹理的匹配难题。该综述为宽基线影像匹配领域的研究者提供了全面的方法谱系、性能比较和发展洞见,具有重要的学术参考价值。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com