分享自:

装袋与提升集成分类器在多光谱、高光谱和PolSAR数据分类中的比较评估

期刊:Remote SensingDOI:10.3390/rs13214405

本文属于类型a,是一篇关于遥感数据分类中集成学习算法比较评估的原创研究。

作者与发表信息

本研究由Hamid Jafarzadeh、Masoud Mahdianpari、Eric Gill、Fariba Mohammadimanesh和Saeid Homayouni共同完成。主要作者来自加拿大纽芬兰纪念大学电气与计算机工程系、C-CORE研究中心以及加拿大国立科学研究院(INRS)的水土环境中心。该论文于2021年11月2日发表在期刊《Remote Sensing》上,文章标题为《Bagging and Boosting Ensemble Classifiers for Classification of Multispectral, Hyperspectral and PolSAR Data: A Comparative Evaluation》。

学术背景与研究目的

遥感(Remote Sensing,RS)图像分类是地球观测(Earth Observation,EO)领域中最常用的分析技术之一,被广泛应用于变化检测、作物制图、森林监测和湿地分类等任务。卫星图像分类方法通常分为两大类:无监督算法和监督算法。集成学习(Ensemble Learning,EL)属于监督分类方法,其核心思想是将多个“弱学习器”组合成一个“强学习器”,以提高分类精度。集成学习中两个主要家族为Bagging(装袋法)和Boosting(提升法)。Bagging中的各个预测器相互独立,目标在于降低方差;而Boosting中的预测器顺序构建,后一个预测器试图修正前一个预测器的误差,旨在降低偏差。

近年来,极端梯度提升(XGBoost)和轻量梯度提升机(LightGBM)等新一代集成学习算法在数据科学领域表现出色,但在遥感卫星图像分类中的系统性检验仍然不足。已有若干研究将XGBoost、LightGBM与随机森林(Random Forest,RF)、支持向量机(Support Vector Machine,SVM)等算法在特定场景下进行了比较,但尚缺乏针对多种不同类型遥感数据的统一比较评估。因此,本研究旨在系统比较五种集成学习算法——AdaBoost、梯度提升机(GBM)、XGBoost、LightGBM和RF——以及单一决策树(Decision Tree,DT)作为基线分类器,在多光谱、高光谱和极化合成孔径雷达(PolSAR)三种遥感数据上的分类性能。

研究流程与详细方法

本研究使用了三个真实世界的基准数据集。第一个是ISPRS Vaihingen高分辨率多光谱影像,由国际摄影测量与遥感学会(ISPRS)提供,覆盖德国Vaihingen地区,尺寸为2006×3007像素,空间分辨率约9厘米,包含红外、红、绿三个波段,地物类别为不透水面、建筑、低矮植被、树木和汽车五类,样本总量超过600万像素。第二个是Pavia University高光谱场景,由ROSIS-3传感器获取,空间分辨率为1.3米,包含103个光谱波段,覆盖意大利帕维亚大学校园,尺寸为610×340像素,包含沥青、草地、砾石、树木、金属板、裸土、沥青屋顶、自锁砖和阴影九类地物,共有42776个标注像素。第三个是San Francisco Bay全极化SAR数据,由RADARSAT-2卫星于2008年4月2日获取,空间分辨率为8米,尺寸为1380×1800像素,地物类别为水体、植被、高密度城区、低密度城区和已开发区域五类,样本总量超过180万像素。

实验流程分为两个主要阶段。第一阶段是超参数调优。研究采用GridSearchCV进行网格搜索,对每种算法最重要的两个用户定义参数进行优化。具体而言,DT优化最大树深(Maximum Tree Depth,MTD)和最小样本分裂数(Minimum Sample Split,MSS);AdaBoost优化基分类器数量(Number of Base Classifiers,NBCs)和学习率(Learning Rate,LR);GBM优化MTD和NBCs;XGBoost优化MTD和NBCs;LightGBM优化MTD和NBCs;RF优化MTD和NBCs。超参数调优分别在三个数据集上独立进行,以平均测试准确率(Mean Test Accuracy,MTA)作为评价指标来排序参数组合。

对于多光谱数据,DT的最优参数为MSS=10和MTD=100;AdaBoost的最优参数为NBCs=80和LR=1;GBM的最优参数为NBCs=30和MTD=30;XGBoost的最优参数为MTD=20和NBCs=30;LightGBM的最优参数为NBCs=80和MTD=20,但为了降低计算成本,NBCs设为50、MTD设为10也可接受;RF的最优参数为MTD=20和NBCs=80。对于高光谱数据,DT的最优参数为MSS=8和MTD=200;AdaBoost的最优参数为NBCs=25和LR=1;GBM的最优参数为NBCs=25和MTD=30;XGBoost的最优参数为MTD=30和NBCs=50;LightGBM的参数关系不如多光谱数据中那样规律,但过高的NBCs和MTD会降低分类精度;RF的最优参数为NBCs=250和MTD=50。对于PolSAR数据,DT的最优参数为MSS=5和MTD=150;AdaBoost在NBCs=80和LR=0.8时取得最佳结果;GBM的最优参数为NBCs=80和MTD=30;XGBoost的最优参数为NBCs=50和MTD=30;LightGBM的最优参数为NBCs=100和MTD=30;RF的最优参数为NBCs=150和MTD=20。

第二阶段是使用调优后的参数进行正式分类实验,并采用总体精度(Overall Accuracy,OA)和F1分数(F1-score)对分类结果进行定量评价。所有方法均为基于像素的分类方式。

主要结果与逻辑关系

在多光谱数据上,RF和XGBoost取得了最高的分类精度,OA分别为77.41%和77.28%,DT和GBM次之,分别为76.12%和76.15%,LightGBM为75.4%,AdaBoost最低,仅为72.3%。F1分数呈现出类似的排序,RF为75.8%,XGBoost为75.79%,DT为75.01%。这一结果表明,在多光谱数据上,Bagging类方法RF以及改进的Boosting方法XGBoost具有更可靠的性能。从分类图的可视化结果来看,RF和XGBoost对地物边界的刻画也相对清晰。

在高光谱数据上,LightGBM和XGBoost表现最佳,OA分别为86.34%和85.94%,RF紧随其后,为85.52%,GBM为83.84%,DT为80.51%,AdaBoost仍然最低,为78.29%。F1分数方面,XGBoost最高,为84.48%,RF为83.44%,LightGBM为83.01%。这说明在光谱维度较高的数据集中,基于梯度提升的新一代算法能够利用丰富的光谱信息获得明显优势。从可视化结果来看,LightGBM和XGBoost对九类城市地物的区分更为细致准确。

在PolSAR数据上,XGBoost以84.62%的OA显著领先,RF为81.94%,LightGBM为80.09%,DT为77.12%,AdaBoost为74.52%,GBM表现最差,仅为66.79%。F1分数方面,XGBoost为81%,显著高于其他方法。这表明XGBoost在处理极化SAR数据这种具有特殊散射机制的数据时具有很强的适应能力和鲁棒性。值得关注的是,GBM在PolSAR数据上性能大幅下降,说明传统梯度提升方法对这类数据可能存在过拟合或噪声敏感问题。这三个数据集的实验结果共同揭示了一个重要规律:XGBoost在所有三种数据类型上都进入了精度最高的前两名,展示了该方法对不同遥感数据类型的广泛适应性。同时,所有方法在高光谱数据上取得的精度都高于其在多光谱和PolSAR数据上的精度,说明集成学习算法在输入特征数量更多的情况下能发挥更大优势。

结论与研究价值

本研究得出以下结论:第一,从方法角度看,XGBoost和LightGBM作为新一代集成学习算法,在大多数情况下提供了最佳分类结果,其中XGBoost在三种遥感数据类型上均表现优异,展示了其强大的泛化能力和鲁棒性;第二,从数据角度看,所有算法在高光谱数据集上都获得了比其他两类数据更高的精度,证明集成学习在高维特征空间下具有更好的性能表现;第三,超参数调优对最终分类精度具有重要影响,但最优参数值会随数据集大小和类别复杂度而变化,因此针对具体应用进行参数优化是必要步骤。

本研究的科学价值在于,它首次系统性地将两类集成学习家族——Bagging和Boosting中的代表算法在三种主流遥感数据类型上进行了统一比较,填补了该领域的空白。其应用价值在于,研究结果为遥感应用领域的从业者提供了算法选择的参考依据。特别是XGBoost方法在不同类型遥感数据上的突出表现,说明它具备成为遥感图像分类通用工具的巨大潜力。

研究亮点

本研究的亮点主要体现在以下几个方面:一是研究数据的多样性,覆盖了光学多光谱、高光谱和雷达PolSAR三种具有不同物理特性的遥感数据;二是算法比较的系统性,同时纳入了传统单一分类器DT、经典集成方法RF、传统Boosting方法AdaBoost和GBM以及新一代Boosting方法XGBoost和LightGBM;三是超参数调优的规范性,通过网格搜索在三种数据集上独立优化参数,保证了比较的公平性;四是发现了XGBoost在跨数据类型分类中的优越性和稳健性,这对遥感分类实践具有直接的指导意义。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com