分享自:

用于视图合成的神经辐射场场景表示

期刊:Communications of the ACMDOI:10.1145/3503250

神经辐射场(Neural Radiance Fields, NeRF):一种用于视图合成的连续场景表示方法

研究背景与作者信息

本文介绍了一项发表于 Communications of the ACM(2022年1月,第65卷第1期)的研究成果。该论文的原始版本曾发表于2020年欧洲计算机视觉会议(ECCV 2020)。论文题为《NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis》,由Ben Mildenhall、Pratul P. Srinivasan、Matthew Tancik、Jonathan T. Barron、Ravi Ramamoorthi和Ren Ng共同完成。其中,Ben Mildenhall、Pratul P. Srinivasan和Matthew Tancik为共同第一作者。Ben Mildenhall、Pratul P. Srinivasan、Matthew Tancik和Ren Ng来自加州大学伯克利分校,Jonathan T. Barron来自Google Research,Ravi Ramamoorthi来自加州大学圣地亚哥分校。

该研究属于计算机视觉与计算机图形学的交叉领域,核心关注的是视图合成(View Synthesis)问题。视图合成是指从一组给定的输入图像及其对应的相机位姿出发,渲染出场景在新视角下的图像。长期以来,如何在较大的相机基线范围内生成照片级真实感的新视图一直是一个极具挑战性的问题。此前的方法要么依赖于离散化的体素网格(voxel grid)或三角形网格(triangle mesh),要么受限于分辨率与存储开销的权衡,难以在复杂真实场景上取得令人满意的效果。该研究的目标是提出一种新的场景表示方式,能够直接优化以复现大量高分辨率输入视图,同时保持极高的存储效率。

研究方法与工作流程

该研究提出了神经辐射场(Neural Radiance Field, NeRF)这一全新的场景表示框架。其核心思想是将一个静态场景表示为一个连续的5D函数,该函数的输入是空间中的三维坐标 ( (x, y, z) ) 以及观察方向 ( (\theta, \phi) ),输出是该位置处的体密度(volume density)和依赖于观察方向的发射辐射度(emitted radiance,即RGB颜色)。具体而言,研究使用一个多层感知机(MLP)网络 ( F_\Theta: (x, d) \rightarrow (c, \sigma) ) 来近似这一连续函数。该网络首先通过8个全连接层(每层256个通道,使用ReLU激活函数)处理输入的三维坐标 ( x ),输出体密度 ( \sigma ) 和一个256维的特征向量;随后将该特征向量与相机的观察方向 ( d ) 拼接,经过一个额外的全连接层(128个通道,ReLU激活)输出与视角相关的RGB颜色。

在渲染过程中,研究者采用了经典的体渲染(volume rendering)技术。对于一条相机射线 ( r(t) = o + td ),其期望颜色 ( C® ) 通过沿射线积分得到。体密度 ( \sigma(x) ) 可解释为射线在位置 ( x ) 处终止于无穷小粒子的微分概率。为了数值估计这一连续积分,研究采用了分层采样(stratified sampling)策略:将近远边界 ( [t_n, t_f] ) 划分为 ( N ) 个等间距区间,并在每个区间内均匀随机采样一个点。随后使用正交规则(quadrature rule)累积采样点的颜色与密度,得到射线的像素颜色。由于体渲染过程天然可微,因此可以通过最小化渲染图像与真实图像之间的误差来优化网络参数。

值得注意的是,仅靠上述基础实现,模型难以收敛到足够高分辨率的表示。为解决这一问题,研究引入了两个关键改进。第一个改进是位置编码(positional encoding):将输入的5D坐标通过高频函数 ( \gamma(\cdot) ) 映射到更高维空间,使MLP能够表示更高频率的函数。该编码函数为正弦和余弦函数的组合,分别应用于归一化后的空间坐标(( L=10 ))和观察方向向量的分量(( L=4 ))。第二个改进是层次化采样(hierarchical sampling),该部分在原文中进行了详细介绍,本文未展开。

在优化过程中,研究为每个场景独立优化一个神经网络。每次迭代随机采样一批相机射线(batch size为4096条射线),沿每条射线采样 ( N=192 ) 个坐标点,使用体渲染计算颜色,损失函数为渲染颜色与真实像素颜色之间的总平方误差。优化器使用Adam,学习率从 ( 5 \times 10^{-4} ) 指数衰减至 ( 5 \times 10^{-5} )。单个场景的优化通常需要1到2天在单个GPU上完成。

主要实验结果

研究在多个数据集上对方法进行了定量和定性评估。在合成物体渲染数据集上,包括DeepVoxels数据集(包含4个具有简单几何的朗伯物体,每个物体渲染512×512像素,479张输入视图和1000张测试视图)以及研究者自建的“真实感合成360°”数据集(包含8个具有复杂几何和非朗伯材质的物体,每个场景渲染100张输入视图和200张测试视图,分辨率为800×800像素)。在真实场景数据集“Real Forward-Facing”中,包含8个用手持手机拍摄的场景(20至62张图像,图像分辨率为1008×756像素),其中1/8的图像留出作为测试集。

定量结果如表1所示(原文中表1报告了PSNR、SSIM和LPIPS指标)。在“Diffuse Synthetic 360°”数据集上,NeRF的PSNR达到40.15,SSIM达到0.991,LPIPS为0.023,均显著优于对比方法。在“Realistic Synthetic 360°”数据集上,NeRF同样取得了PSNR 31.01、SSIM 0.947、LPIPS 0.081的最优成绩。在真实前向场景数据集上,NeRF的PSNR为26.50,SSIM为0.811,LPIPS为0.250,除LPIPS略低于LLFF外,其余指标均达到或接近最优。对比方法包括Scene Representation Networks(SRN)、Neural Volumes(NV)和Local Light Field Fusion(LLFF)。其中SRN采用的是MLP映射坐标到特征向量的隐式表面表示,其渲染结果往往过度平滑且纹理模糊;NV使用显式的128³体素网格,无法扩展到高分辨率细节;LLFF虽然在真实前向场景上表现不错,但在含有400–500像素视差的合成数据集上经常无法估计正确几何,且存储需求巨大(单个“真实感合成”场景超过15GB),而NeRF仅需5MB网络权重,压缩比约为3000倍。

定性结果表明,NeRF能够恢复复杂的几何和外观细节,例如船舶的索具、乐高模型的齿轮和履带、麦克风的金属支架和网罩以及材料的非朗伯反射特性。在真实场景中,NeRF能比LLFF更一致地表示精细几何(如蕨类植物的叶片、霸王龙骨架的肋骨和栏杆),并正确重建部分遮挡区域。此外,通过消融实验,研究证实了视角依赖(view dependence)对于表示镜面反射至关重要,缺少视角依赖时模型无法重现高光效果;而缺少位置编码时,模型表示高频几何和纹理的能力大幅下降,外观呈现过度平滑。

结论与研究意义

该研究的核心贡献在于证明了将场景表示为5D神经辐射场——即以MLP输出体密度和视角相关的发射辐射度作为3D位置和2D观察方向的函数——能够产生优于此前主流方法的渲染效果。该方法克服了离散化体素网格在高分辨率复杂场景建模中的存储瓶颈,仅需输入图像和相机位姿即可优化场景表示,无需任何3D几何监督。在科学价值层面,NeRF为神经场景表示开辟了新的研究方向,证明了连续隐式表示在复杂真实场景视图合成中的潜力。后续许多工作在此基础上扩展了重光照(relighting)、形变(deformation)和动画(animation)等功能,推动了基于真实世界图像的图形管线的发展。

研究亮点

该研究的主要亮点包括:第一,提出了连续5D神经辐射场表示,将体密度限制为仅依赖空间位置,而颜色同时依赖位置和观察方向,从而实现多视图一致性并有效建模非朗伯效应;第二,引入位置编码解决了深层网络偏向学习低频函数的问题,使MLP能够表示高频几何与纹理细节;第三,采用分层采样体渲染策略,突破了离散体素网格的分辨率限制,在保持连续表示的同时实现了高分辨率渲染;第四,在极低的存储开销(每场景约5MB)下实现了照片级真实感的新视图合成。此外,该工作提供了完整的数据集、代码和视频演示,为后续研究提供了重要的基准与参考。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com