这篇文档属于类型a,即单一原创研究的学术论文。以下是根据该文档内容生成的中文报告。
本文的主要作者为陈一平(Yiping Chen)、李军(Jonathan Li)、韩婷(Ting Han)、冯慧芳(Huifang Feng)、陈军(Jun Chen)和王程(Cheng Wang)。陈一平与韩婷来自中山大学测绘科学与工程学院,李军来自厦门大学福建省智慧城市感知与计算重点实验室及加拿大滑铁卢大学地理与环境管理系,冯慧芳、陈军和王程来自厦门大学福建省智慧城市感知与计算重点实验室。该研究发表于 ISPRS Journal of Photogrammetry and Remote Sensing 第232卷(2026年),页码675–688。
该研究属于三维点云语义分割与实例分割领域,具体聚焦于城市级建筑物立面(facade)点云数据的构建与基准评测。随着建筑信息模型(Building Information Modeling, BIM)和数字孪生(digital twins)等应用对高质量三维城市场景理解需求的增长,大规模且精细标注的三维数据集对于算法研发和科学研究变得至关重要。然而,现有建筑物立面数据集大多基于图像,缺乏空间信息,且易受光照和天气条件影响。同时,公开可用的大规模建筑物点云标注数据集仍然稀缺,覆盖范围相对较小。因此,该研究旨在构建一个城市级建筑物立面点云数据集City-Facade,以支持语义级和实例级分割任务的训练与评估,并促进城市三维理解算法的发展。
该研究的工作流程主要包括四个部分:数据采集、数据预处理与标注、数据集分析与比较、基准实验评测。在数据采集阶段,研究团队使用Riegl VMX-450车载移动激光扫描(Mobile Laser Scanning, MLS)系统,在中国厦门市六个具有不同建筑风格的城市区域进行扫描,覆盖道路总长度约60公里,原始数据量约为59.3亿个点,总大小约为213.8 GB。这六个区域分别为集美乡村(JMC)、长安路(CAR)、厦禾路(XHR)、石鼓山立交(SGS)、吕岭路(LLR)和演武路(YWR)。在数据预处理与标注阶段,研究团队使用CloudCompare软件对三维点进行人工标注。标注过程中首先进行语义标注,定义了8类建筑物立面元素:墙(wall)、窗(window)、门(door)、屋顶(roof)、广告牌(advertisement)、空调(air conditioner)、雨棚(rain shed)和阳台(balcony),以及未标注类别(unclassified)用于表示非建筑物元素,如地面、植被、车辆、标牌和电力线等。在语义标注基础上,团队进一步对建筑物立面元素进行了实例级标注,以区分不同建筑物的不同构件实例。最终发布的数据集包含803个建筑物立面片段,共有约1640万个已标注点,其中645个片段用于训练,158个片段用于测试。每个片段的点云以.txt格式保存,包含六个属性:x、y、z坐标、强度值、实例标签和语义标签。标注过程采用多标注员独立标注和交叉验证策略,并通过人工审核与一致性检查以保证标签质量。在数据集分析与比较阶段,团队根据城市功能区将数据划分为办公区、乡村住宅区、滨海风景区、中心历史区和独特商业区五种类型,并统计了各类别的点数分布。结果表明墙类点数最多,占总标注点数超过50%;窗类为第二大类。City-Facade是当前唯一同时提供语义级和实例级标注的建筑物立面数据集。在基准实验评测阶段,研究团队选择了十种代表性的三维点云语义分割算法进行对比,包括PointNet、PointNet++、DGCNN、DeepGCNs、RandLANet、ASSANet-L、Point Transformer、PointNeXt-L、PointVector、PointMetaBase-L以及该团队此前提出的ASGFormer。实例分割实验则采用了DBSCAN、HDBSCAN、K-Means、MeanShift和基于深度学习的SoftGroup五种方法。实验在统一平台上进行,使用单个NVIDIA A100 80G GPU,基于PyTorch 1.12.1和Python 3.8,采用AdamW优化器,初始学习率为0.01,最小学习率为1e-5,训练100个轮次,批大小为4。
实验结果显示,在语义分割任务中,ASGFormer在平均交并比(mean Intersection over Union, mIoU)上达到45.49%,总体精度(Overall Accuracy, OA)为86.49%,优于其他对比方法。早期基于点和图的方法如PointNet和DGCNN在语义分割上表现较差,其mIoU均低于12%,尤其在门、广告牌、空调等少数类别上几乎无法识别。RandLANet虽然在部分少数类别上有所提升,但整体精度较低。Point Transformer在若干少数类别上表现较好,但墙类IoU仅为6.62%,说明其对大面积类别识别能力不足。PointMetaBase-L和PointVector在墙、窗和门等主要类别上表现较为均衡,但在少数类别上仍有明显缺陷。ASGFormer通过融合空间结构关系和语义差异,增强了立面元素分割性能,但在类别不平衡问题上仍有提升空间。在实例分割任务中,深度学习-based的SoftGroup取得了最佳性能,AP50达到69.0%,AP25达到71.2%,平均精度AP为63.5%,显著优于传统聚类方法。可视化结果表明,基于softgroup的方法能够更准确地聚类立面元素,而传统方法在面对复杂场景时存在较多误分割和漏分割现象。
该研究的结论指出,City-Facade是一个大规模城市级建筑物立面点云数据集,覆盖约60公里道路,包含约2亿个已标注三维点,并同时提供语义级和实例级标注。该数据集包含多种建筑风格和立面构件类型,可用于建筑物立面元素分割、点云补全、建筑状态分析和测绘等多种任务。研究团队通过全面的基准实验评估了现有语义分割和实例分割方法在该数据集上的表现,揭示了当前方法在处理类别不平衡和小目标识别方面的局限性。City-Facade的发布旨在填补现有数据集的空白,推动三维理解任务向更复杂和多样化的城市建筑环境发展。该数据集将在GitHub上公开,并根据社区反馈持续改进和更新。
该研究的亮点主要体现在三个方面。首先,City-Facade是首个城市级建筑物立面点云数据集,同时提供语义级和实例级标注,这是现有建筑物立面数据集所不具备的。其次,该数据集覆盖范围广、建筑风格多样,包含乡村住宅、历史街区、商业区和滨海风景区等不同城市功能区,能够增强模型的泛化能力。第三,该研究通过系统的基准实验揭示了当前三维点云分割方法在建筑物立面细粒度分割中的不足,为后续算法设计提供了明确的挑战方向。此外,该数据集还提供了未标注的完整城市级点云数据,用户可以根据自身需求进一步标注,扩展数据集的应用范围。
该研究的科学价值在于为三维建筑物立面语义和实例分割提供了一个标准化的评测基准,有助于推动深度学习算法在遥感与三维视觉交叉领域的发展。其应用价值体现在支持建筑信息模型构建、城市三维重建、数字孪生和智慧城市等领域,特别是在建筑物细节重建(如从LOD2模型细化到LOD3模型)和城市级三维模拟方面具有重要实际意义。