分享自:

结合特征选择与机器学习的葡萄叶片氮含量田间高光谱成像评估

期刊:Computers and Electronics in AgricultureDOI:10.1016/j.compag.2026.112093

本研究由Atif Bilal Asad(华盛顿州立大学精准与自动化农业系统中心,现隶属于康奈尔大学)、Achyut PaudelSafal Kshetri 等多位研究人员合作完成,通讯作者为 Manoj Karkee(康奈尔大学)和 Markus Keller(华盛顿州立大学)。该研究成果以原创论文的形式发表于学术期刊《Computers and Electronics in Agriculture》第252卷(2026年),论文编号112093。

这项研究属于精准农业与遥感交叉学科领域。氮素(Nitrogen, N)是酿酒葡萄生产中最为关键的矿物质营养之一,深刻影响着葡萄藤的长势、果实成分乃至最终的葡萄酒品质。由于土壤氮素有效性存在显著的空间和时间异质性,实时、准确地评估葡萄叶片氮浓度对于制定优化的变量施肥策略,实现单株级别的精准养分管理至关重要。然而,传统的叶片组织实验室化学分析方法不仅耗时、费力,且具有破坏性,难以满足大规模葡萄园快速、高空间分辨率监测的需求。在此背景下,结合地面高光谱成像(Hyperspectral Imaging, HSI)与机器学习(Machine Learning, ML)技术的无损检测方法展现出巨大潜力。但高光谱数据高维度和高冗余度的特点,以及对模型可解释性和泛化能力的要求,仍是该领域面临的主要挑战。本研究旨在开发一种集成特征选择框架,用于识别对氮素最为敏感的少数关键波段,并构建稳健的预测模型,最终评估这些选定特征在不同葡萄品种和不同测量尺度(叶片与冠层)间的可迁移性。

研究团队在2022至2023连续两个生长季内,于美国俄勒冈州和华盛顿州的商业葡萄园中,系统性地采集了霞多丽(Chardonnay)黑比诺(Pinot Noir)康科德(Concord)西拉(Syrah) 四个葡萄品种的田间数据。数据采集覆盖了开花期(Bloom)和转色期(Veraison)两个关键物候阶段,并包含了叶片和冠层两个尺度。叶片尺度的光谱和对应化学值数据来自霞多丽和黑比诺,而冠层尺度的数据则来自霞多丽、西拉和康科德。研究使用了一台架设在三脚架上的可见光-近红外(VNIR)高光谱相机,采集了400-1000纳米范围内共274个波段的高光谱图像。叶片尺度的光谱数据是通过人工分割图像中的标记叶片并提取平均反射率获得的,而冠层尺度的数据则是利用一系列植被指数和光谱角制图方法,自动分割出所有冠层叶片像素后提取其平均光谱。获取的所有原始数据均经过严格的预处理流程,包括异常值剔除、标准正态变量(Standard Normal Variate, SNV)变换和Savitzky-Golay滤波降噪。

本研究的核心技术流程是构建并应用一套名为“集成特征选择”(Ensemble Feature Selection)的框架,它分为三个主要阶段。第一阶段是基于层次聚类的冗余特征消除。为了应对高光谱波段间的严重多重共线性,研究团队采用基于皮尔逊相关系数(Pearson correlation)距离矩阵的层次聚类法,将264个有效波段聚合为少数代表性集群。在每个集群内部,独创性地计算一个融合了皮尔逊相关性、互信息(Mutual Information)和中心性度量的“共识分数”(Consensus Score),用以选出最具代表性和对氮素最敏感的波段。这一步骤有效降低了数据维度,同时保留了具有生理学意义的谱区。第二阶段是集成特征选择方法的实施。该框架整合了包括SelectKBest、LASSO、岭回归(Ridge)、弹性网络(Elastic Net)、随机森林(Random Forest)、极端随机树(Extra Trees)、梯度提升(Gradient Boosting)以及随机蛙跳算法(Random Frog)在内的八种互补的选择器。通过在100次自举迭代中计算每个波段的平均排名和一个独立的稳定性分数(Stability Score),并结合为一个最终的稳定性加权分数,确保了选出的波段不仅在平均意义上排名靠前,而且在不同的数据子集上都具有一致的高重要性,这克服了传统平均排名聚合的局限性。第三阶段是基于偏最小二乘回归(PLSR)的顺序特征优化。这一步作为诊断验证,将经过集成排序的波段按重要性从高到低逐个加入PLSR模型,通过交叉验证(Cross-validation)的R²和RMSE指标,找到性能达到最优或饱和时的最少波段数量,从而确定了每个品种和尺度下的最佳波段子集,例如霞多丽叶片水平使用了13个波段。最终,研究利用这组优化后的波段原始反射率值和物候期作为输入,在嵌套交叉验证框架下训练和评估了弹性网络、支持向量回归(SVR-RBF)、XGBoost和高斯过程回归(GPR)四种机器学习模型。

研究结果表明,该集成特征选择框架能有效识别出紧凑且具有品种特异性的氮敏波段。这些选定的波段广泛覆盖了可见光叶绿素吸收区(约500-670 nm)、红边区(约700-760 nm)和近红外区(>760 nm),反映了叶绿素含量、叶片内部结构和色素对氮素状态的综合影响。在叶片水平上,霞多丽品种的支持向量回归模型实现了最高的预测精度,R²(决定系数)=0.82,RMSE(均方根误差)=0.19% 干重;黑比诺品种的高斯过程回归模型取得了R²=0.69,RMSE=0.20% 干重。在冠层水平上,预测表现同样出色,霞多丽(R²=0.65,RMSE=0.17% 干重)、康科德(R²=0.72,RMSE=0.12% 干重)和西拉(R²=0.70,RMSE=0.16% 干重)均获得了可靠的估计精度。一个关键的发现是,白色品种(如霞多丽)的氮敏波段在可见光、红边和近红外区域呈现平衡分布,而红色品种(如黑比诺、西拉、康科德)的氮敏波段则更依赖于可见光区域,这归因于花青素与叶绿素在红色品种中的强烈交互作用对可见光反射率的显著影响。这些基于少数波段的模型性能,与使用全波段(274个)的PLSR模型相当甚至更优,证实了该特征选择方法能有效降低噪声和过拟合风险。此外,模型成功捕捉到了所有品种中普遍存在的从开花期到转色期叶片氮浓度下降的生物学规律,进一步验证了模型的生理合理性。

本研究最为重要的科学价值和应用潜力在于叶片到冠层的波段可迁移性评估。结果显示,将从白色品种(霞多丽)叶片尺度上选定的波段,直接应用于其冠层尺度的氮含量预测,模型R²达到了0.67,甚至优于直接在冠层尺度上训练的模型性能(R²=0.65)。同样,将从红色品种(黑比诺)叶片尺度上选定的波段应用到红色品种(康科德、西拉)的冠层预测中,也维持了相当的性能(R²约为0.70-0.71)。这一发现首次在葡萄氮素高光谱评估文献中,系统性地验证了通过集成框架选出的光谱特征具有跨尺度和跨品种的稳健性,表明这些特征捕捉到的是与氮素相关的内在生理信号,而非与测量尺度或品种类型相关的偶然伪影。这不仅增强了模型的泛化能力,也为未来开发更简单、更具普适性的便携式或无人机载窄带多光谱传感器提供了坚实的数据驱动基础,有望实现基于地面平台的高通量葡萄园氮素实时监测与精准施肥决策。

本研究的亮点在于:其一,提出了新颖的集成特征选择方法,通过融合多种选择器并引入稳定性加权评分,改进了传统单一方法或平均排名法的不足;其二,首次系统评价并证实了基于地面高光谱成像的氮敏波段在叶片-冠层尺度和不同色素类型品种间的可迁移性,填补了该领域的研究空白;其三,研究覆盖了多个商业酒葡萄和果汁葡萄品种,在多个生长季和跨区域的环境条件下进行,增强了结论的可靠性。该研究也指出了其在地理区域和样本量上的局限性,并展望未来可结合如PROSAIL等物理辐射传输模型,从机理层面深化对跨尺度光谱一致性的理解,为精准葡萄栽培管理提供更强大的技术支撑。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com