分享自:

基于图像的3D重建最新进展:传统摄影测量与学习技术的比较综述

期刊:pfg – journal of photogrammetry, remote sensing and geoinformation scienceDOI:10.1007/s41064-026-00412-y

基于图像的3D重建技术新进展:摄影测量视角下的传统与学习方法的综述报告

作者: Xin Wang, Tengfei Wang, Markus Hillemann, Yifei Yu, Zhe Shen, Zongqian Zhan, Rongjun Qin, Markus Ulrich
发表期刊: pfg – Journal of Photogrammetry, Remote Sensing and Geoinformation Science
发表时间: 2026年

一、论文主题与背景

本文是一篇系统性的综述论文,旨在从摄影测量的视角全面审视基于图像的三维重建(image-based 3D reconstruction)领域中传统方法与基于学习的方法的最新进展。作者来自武汉大学测绘学院、卡尔斯鲁厄理工学院摄影测量与遥感研究所以及俄亥俄州立大学地理空间数据分析实验室,代表了摄影测量、遥感和地理信息科学领域的顶尖研究力量。

论文的核心出发点在于:近年来,深度学习技术的迅猛发展使得基于学习的三维重建方法在重建完整性和推理速度等方面显示出超越传统方法的潜力,但这些方法是否真正满足摄影测量对度量精度(metric accuracy)、可靠性和不确定性量化等严格要求,尚缺乏系统的审视。因此,本文的目标是架起经典摄影测量与数据驱动的三维视觉之间的桥梁,为工程、工业和地理空间应用中的稳健、精确且可认证的三维重建系统指明方向。

二、论文的主要观点

观点一:传统摄影测量管线的核心价值在于显式几何、可解释假设与不确定性统计处理

论文系统回顾了传统摄影测量三维重建的基本流程,将其分解为运动恢复结构(Structure from Motion,SfM)、多视图立体(Multi-View Stereo,MVS)和表面重建(surface reconstruction)三个阶段。作者指出,传统SfM又分为增量式(incremental)和全局式(global)两种主要策略。增量式方法如COLMAP通过迭代注册图像、三角化和光束法平差(bundle adjustment)来确保高精度,但计算开销大、可扩展性受限;全局式方法则通过旋转平均(rotation averaging)和平移平均(translation averaging)一次性估计所有相机位姿,显著提升了效率,但对异常值更为敏感。

在MVS方面,论文详细阐述了基于成对匹配的视差估计方法和基于多视图约束的深度估计方法(包括平面扫描、面片匹配和体素方法),并特别强调了机器视觉应用中MVS管线的独特优势:通过预标定的固定相机系统可以避免在线SfM的计算开销,实现度量级的三维重建。论文通过具体实例(如超心透镜、线扫描相机和机器人手臂辅助的MVS)展示了传统方法在工业测量中的不可替代性。支持这一观点的关键是:传统管线中每一步的几何关系都是显式和可追溯的,误差传播具有统计基础,这对于高精度测绘至关重要。

观点二:传统SfM和MVS的最新进展聚焦于可扩展性、效率和专业场景适配

论文指出,近年来传统SfM的研究重心已从基础流程转向大规模数据集的高效处理。代表性工作如GLOMAP通过改进视图图标定和全局定位,实现了与增量式基线COLMAP相当的精度,但速度提升了一到两个数量级;HSfM等混合方法结合了全局初始化和增量细化,兼顾了鲁棒性和效率;层级式方法则通过树状结构的局部模型构建与逐级合并,为无人机影像等大规模场景提供了显著的加速。此外,实时SfM方法(如on-the-fly SfM)在无需GPS/IMU数据的前提下实现了在线增量重建,满足了无人机和移动测绘场景的需求。这些进展表明传统方法并未停滞,而是在不断适应大数据时代的挑战。

在传统MVS方面,论文重点讨论了PatchMatch框架的持续演进。ACMHP和ACMM通过自适应棋盘采样和多假设联合视图选择解决了假设传播效率低和视图聚合不可靠的问题;APD-MVS通过自适应变形不可靠像素的面片来扩大有效匹配区域;PolarPMS则引入了偏振信息作为额外的物理约束,用于处理无纹理或反射表面。这些方法在保持全分辨率可扩展性和可解释性的同时,显著改善了弱纹理区域的完整性和鲁棒性。论文特别指出,传统MVS在度量保真度和全分辨率处理能力方面仍具优势。

观点三:基于学习的SfM方法在端到端可微性和泛化能力上取得了突破,但面临可扩展性瓶颈

论文将学习式SfM分为基于连接点的架构和基于图像的架构两类。前者如ESfM和VggSfM通过排列等变编码器和深度Transformer网络直接从特征匹配中回归相机位姿和三维点,实现了完全可微的SfM流程;后者如SFM-Net和BA-Net则从视频帧直接学习场景结构和相机运动。作者特别指出,VggSfM虽然通过可微的Levenberg-Marquardt层实现了端到端优化,但在处理数千张高分辨率图像时面临实际的可扩展性限制。而基于图像的架构通常假设极强的帧间连续性,采用固定参考帧策略,难以适应摄影测量中常见的稀疏采样、遮挡多样性和大规模高分辨率数据集。这一观点的核心论据是:深度学习模型在初始位姿估计方面表现出色,但往往缺乏经典光束法平差所提供的迭代梯度优化能力,因此对于毫米级精度的摄影测量任务,将学习式初始化与特征度量或光度光束法平差相结合的混合方法仍然不可或缺。

观点四:学习式MVS方法显著提升了重建完整性,但可靠性验证仍是关键瓶颈

论文将学习式MVS分为三大范式:基于深度图的方法、基于可微渲染的场景表示方法(NeRF和3DGS)以及前馈泛化方法。基于深度图的监督方法(如MVSNet及其变体)通过构建代价体和3D CNN正则化实现了高精度的逐像素深度估计;无监督方法则通过光度一致性损失避免了昂贵的地面真值深度需求。这些方法在弱纹理和复杂场景中的完整性方面明显优于传统方法,但在域迁移和置信度标定方面仍存在可靠性问题。

NeRF和3DGS代表了场景表示的范式转变。NeRF通过可微体积渲染隐式地优化神经场,在视图合成方面表现出色,但其密度表示与摄影测量对精确水密表面的要求不一致。为此,NeuS和VolSDF等方法将NeRF重构为符号距离场(SDF)形式,使得零水平集被显式优化为场景表面。3DGS采用显式的高斯基元表示,通过可微光栅化实现实时渲染,随后发展出的2DGS和PGSR等方法通过将高斯坍缩为定向圆盘或平面高斯,结合深度和法向一致性损失,成功从高斯场中提取出了可用于摄影测量的表面网格。然而,论文强调了一个关键问题:这些方法优化的视觉逼真度并不等同于几何正确性,特别是在域偏移或训练数据偏置下可能产生幻觉深度值,这在测量任务和安全关键应用中必须加以审慎考虑。

观点五:不确定性量化是学习式三维重建方法面临的核心瓶颈,跨领域泛化、高分辨率可扩展性和实时性能构成关键研究前沿

论文以一张对比表概括了不同重建方法族在度量保真度、鲁棒性、不确定性和可扩展性方面的典型特性。传统MVS在度量保真度和可解释性方面具有优势,但在弱纹理区域表现下降;基于深度图的方法改善了完整性,但受限于域迁移和代价体可扩展性;NeRF和3DGS方法强化了外观重建,但其度量几何通常依赖额外的深度、法向或SDF约束;前馈泛化方法提供了稀疏视图重建的直接途径,但其位姿-尺度一致性和测量可靠性仍需系统验证。

作者明确指出,传统管线可以通过解析方法推导一阶统计量来实现不确定性量化,而深度网络的置信度分数往往过于自信,这一差距构成了学习式方法在摄影测量中应用的重大障碍。未来研究需关注可靠的深度不确定性估计、跨域泛化能力、对百万像素级影像和大规模图像集的扩展能力,以及在线测量和动态反馈场景中的实时一致性鲁棒性。

三、论文的意义与价值

本文的学术价值在于:第一,它提供了一个独特的摄影测量视角来评估学习式重建方法,强调度量精度和可靠性而非单纯的视觉质量,这一视角在当前的深度学习热潮中尤为重要和稀缺。第二,论文系统梳理了从传统SfM/MVS/表面重建到最新的NeRF、3DGS和前馈泛化模型(如DUSt3R、VGGT)的完整技术谱系,建立了一个统一的分析框架。第三,通过对不确定性量化、领域泛化和可扩展性等关键瓶颈的深入剖析,论文为未来的跨学科研究指明了方向。

在应用价值方面,本文为摄影测量工程师、地理空间工程人员、工业测量专家和机器人研究人员提供了一个决策参考框架,帮助他们评估基于学习的方法是否能在特定应用中替代或补充传统管线。论文强调的混合方法——将学习式初始化与经典光束法平差相结合——为实际部署提供了切实可行的路径。最终,论文的核心呼吁是:面向工程和地理空间应用的三维重建系统必须是稳健的、精确的和可认证的,而非仅追求视觉上的逼真。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com