本文标题为《3D Gaussian Splatting for Real-Time Radiance Field Rendering》,主要作者包括Bernhard Kerbl、Georgios Kopanas、Thomas Leimkühler,以及George Drettakis,分别隶属于法国Inria Université Côte d’Azur、德国马克斯普朗克信息学研究所(Max-Planck-Institut für Informatik)。该研究发表在《ACM Transactions on Graphics》期刊上,论文的DOI为:https://doi.org/xxxxxxx.xxxxxxx。
近年来,神经辐射场(Neural Radiance Fields,简称NeRF)技术革新了从多张图像合成新视角场景的能力。然而,传统的NeRF方法通常需要大量的神经网络训练和渲染时间,这显著限制了其在高分辨率实时应用中的广泛应用。当前较快的解决方案虽然缩短了训练时间,但在质量上有所妥协。此外,对于一些完整且无边界的场景,目前还没有方法能够在1080p分辨率下达到实时渲染(≥30帧/秒)。
该研究提出了一种全新的基于3D高斯分布(Gaussian Splatting)的场景表示方法,旨在在保证视觉质量的同时实现快速的训练与实时渲染。作者通过将场景表示为3D高斯分布,并结合一种实时可微分渲染器,大幅提升了渲染速度和优化效率。本研究的主要目标是:在1080p分辨率下实现高质量的实时新视角渲染,同时保持训练时间与之前最快方法相当甚至更短。
论文的核心贡献包括三个主要技术创新点:3D高斯场景表示、优化与密度控制流程,以及快速的基于GPU的可微分渲染器。
研究采用3D高斯分布作为场景的基础表示单元: - 通过结构化运动(Structure-from-Motion, SFM)技术从多视角图像中生成稀疏点云,随后将点云初始化为3D高斯分布。 - 每个高斯分布由其位置、方差矩阵(用于表示各方向上的分布情况)和不透明度等参数定义。相比于体素(Voxel)或哈希网格(Hash Grid)等传统连续表示方法,3D高斯分布不仅具有连续体积表示的优点,还可以通过投影到2D空间实现高效的光栅化。
论文开发了一种快速的基于GPU的光栅化渲染器,其主要特点包括: - 瓦片化光栅化:通过将屏幕划分为16×16的瓦片(Tile),并对高斯分布进行深度排序,极大提高了渲染效率。 - 可微分性:渲染器在前向渲染过程中记录每个像素的累计不透明度值,并在后向传播阶段通过深度回溯计算梯度。 - 无深度限制:渲染器支持对任意深度复杂度的场景进行处理,并避免了传统方法中对最大可混合点数的限制。
论文在多个数据集上验证了方法的有效性,包括: - Mip-NeRF360数据集:该数据集包含大规模、无边界场景的高质量测试集。 - Tanks & Temples数据集:一个广泛用于评估三维场景重建算法的数据集。 - Synthetic Blender数据集:包含合成的封闭场景,提供高精度的真值数据。
论文将所提方法与几种主流方法(如Mip-NeRF360、InstantNGP和Plenoxels)进行了对比,其结果表明: - 在训练时间上,本文方法显著优于Mip-NeRF360(48小时训练时间),仅需约5-45分钟即可达到类似甚至更高的渲染质量。 - 在渲染速度上,本文方法可以达到93-135帧/秒的实时性能,而Mip-NeRF360需要10秒渲染一帧。 - 在视觉质量上,本文方法在多个场景中表现优于现有最优方法,特别是在背景和薄结构细节的保留方面。
通过PSNR(峰值信噪比)、SSIM(结构相似性)和LPIPS(感知相似性)等常用指标进行评估,所提方法在多个数据集上均达到或超越当前最优水平。此外,本文通过可视化测试视图的渲染结果,进一步验证了方法在复杂场景中的重建与渲染能力。
与其他显式场景表示方法相比,本文提出的3D高斯分布表现出更高的紧凑性。实验表明,在达到相同渲染质量的情况下,本文方法所需的高斯分布数量远低于点云模型,模型存储大小仅为其四分之一。
尽管本文在实时渲染领域取得了显著进展,但仍存在一些不足: 1. 边界区域的伪影:在训练视角未覆盖的区域,可能会出现几何形状缺失或高斯分布过度拉伸的情况。 2. 内存消耗:相比于基于NeRF的方法,3D高斯分布在训练阶段的GPU内存使用较高,未来可通过优化低级实现或引入压缩技术来改进。 3. 动态场景的适应性:本文方法目前主要针对静态场景,未来可探索其在动态场景中的应用。
本文提出了一种基于3D高斯分布的新型场景表示与优化方法,在显著提高渲染质量的同时实现了实时渲染性能。该方法在多个数据集上的成功验证表明,其具有广泛的应用潜力。未来工作将进一步优化算法的效率和适用范围,为更复杂和动态的场景建模与渲染提供解决方案。