本文属于类型a,即单一原创研究的学术报告,以下是对该研究的详细介绍:
一、研究作者、机构与发表信息
本文发表于期刊 *Ecography*,在线发表日期为2024年,正式出版年份为2025年,文献编号为e07520。第一作者为Lucas Damián Gorné,隶属于阿根廷国立科尔多瓦大学及阿根廷国家科学与技术研究理事会;通讯作者亦为Lucas Damián Gorné。合作者来自英国牛津大学、利兹大学、美国加州大学洛杉矶分校、巴西圣保罗大学等多个国际研究机构。Sandra Díaz作为资深作者之一,来自阿根廷国立科尔多瓦大学,是植物功能生态学领域的知名学者。
二、研究背景与目的
植物功能性状(plant functional trait)信息在生态学和生物地理学研究中应用日益广泛,但大尺度研究中完整获取足够物种的性状数据仍然困难。为此,研究者常使用插补(imputation)或“填补空缺”(gap-filling)方法来补全性状矩阵中的缺失值。插补方法在整体统计推断层面被证明是有效的,但近年来出现了一种“脱离语境使用插补值”(out-of-context use of imputed values)的趋势,即研究者将插补得到的特定物种性状值作为独立输入,用于计算新的变量,例如群落加权平均值(community weighted means,CWM)或在预定义表型空间(phenotypic space)中的投影位置。这种用途超出了插补方法的设计初衷,可能引入难以评估的偏差。
本文的研究目的是通过实证性状数据库检验三种常用插补方法的准确度(accuracy)与精确度(precision),并评估脱离语境使用插补值对群落加权平均值和表型空间投影位置计算的影响,最终提出实用的建议以避免插补方法的误用。
三、研究流程与方法
1. 数据集构建
研究使用了两个主要数据源。第一个是Díaz等人于2022年发布的全球植物形态与功能谱数据集,该数据集合包含六个维管植物性状(植物高度、茎干密度、叶面积、叶干物质含量、单位叶质量氮含量和传播体质量)的物种平均值。研究者提取了其中无缺失性状值的物种子集,用于定义表型空间。第二个数据集来自Baraloto等人2010年发表的新热带木本植物性状数据,该数据集合保留了单株个体水平的性状信息。研究者按全球植物形态与功能谱的性状筛选后,保留了至少测量了两个性状的个体以及至少有两个个体被测量的物种,最终得到个体水平数据集(7227个个体,来自448个物种、200个属)及其聚合的物种水平数据集。物种水平数据集的完整性为97.32%,个体水平数据集的覆盖率为67.88%。值得注意的是,个体水平数据集的冗余度(redundancy)高于物种水平数据集,因为同一物种内个体间的性状变异小于物种间的变异。
2. 留一法检验(leave-one-out procedure)程序
研究在物种水平Baraloto数据集上测试了三种广泛使用的插补方法:贝叶斯分层概率矩阵分解(Bayesian hierarchical probabilistic matrix factorization,BHPMF)、基于预测均值匹配的链式方程多重插补(multiple imputation by chained equations with predictive mean matching,MICE-PMM)以及Rphylopars方法(一种基于系统发育的极大似然方法)。在插补前,所有性状均经过log10转换并进行标准化处理。
研究采用留一法程序评估插补质量,具体流程为:对性状矩阵中的每一个元素逐一移除,然后用插补方法预测该被移除的值,并与实际观测值进行比较。在获得插补值后,研究者首先将超出各性状经验范围的值约束至该性状的最小值或最大值。随后,通过普通最小二乘回归分析插补值与实际值的关系来评估准确度,理想情况下截距应为0、斜率应为1;通过计算q指数(插补值所解释的总方差比例)和标准化均方根误差(zRMSE)来评估精确度。
3. 脱离语境使用插补值效应的评估
研究者选择在大多数性状上最精确的插补方法(Rphylopars)以及在大部分性状上偏差最小的方法(BHPMF),比较基于实际值与基于插补值计算得到的结果差异。具体做法为:模拟1000个群落,物种数从10到100随机均匀分布,物种相对多度服从幂律分布,计算每个群落的性状群落加权平均值,然后分别用实际性状值和插补性状值计算CWM,并比较二者。同时,研究者利用Díaz数据集进行主成分分析(principal component analysis,PCA)定义表型空间,然后将Baraloto数据集中的物种分别基于实际值和插补值投影到该表型空间的前两个主成分轴上,比较投影位置的差异。
4. 冗余度对插补值影响的检验
为了说明数据集冗余度对插补质量的影响,研究者使用BHPMF方法分别在物种水平和个体水平Baraloto数据集上执行留一法程序。在个体水平上还采用了两种策略:第一种与前述留一法一致;第二种在每次插补时不仅移除待检验的测量值,还移除该物种—性状组合的所有其他个体信息,目的是模拟降低冗余度后的效果。此外,研究者计算了每个物种内性状的相对幅度范围,并分析了该幅度范围与插补值相对误差之间的关系。
四、主要研究结果
在物种水平Baraloto数据集上,三种插补方法产生的插补值仅解释了各性状总变异的0%至45.3%。BHPMF方法在所有性状上的精确度最低,其zRMSE值均超过1,表明使用总体平均值作为插补值甚至比BHPMF插补值平均更精确。Rphylopars在除LMA外的所有性状上显示出最高的精确度,MICE-PMM在LMA上最精确。此外,BHPMF是唯一产生超出经验范围插补值的方法。
在准确度方面,三种方法均产生了有偏的插补值。对于植物高度、叶面积、叶干物质含量和单位叶质量氮含量这四个性状,回归截距均大于0且斜率均小于1,说明插补值在低端被高估、在高端被低估。对于茎干密度,截距小于0且斜率小于1,表明该性状被系统性低估。BHPMF方法的偏差总体最小。值得注意的是,三种方法报告的每个插补值的不确定性(如标准差或表型方差)与实际相对误差之间没有关系,意味着这些不确定性指标不能用于判断某个特定插补值的可靠性。
对于脱离语境使用插补值的影响,无论是计算群落加权平均值还是在表型空间中的投影位置,基于插补值得到的结果均存在偏差,表现为低端高估、高端低估。在冗余度效应方面,个体水平数据集的插补精确度和准确度明显优于物种水平数据集。然而,当在个体水平数据集中移除同一物种内相同性状的其他个体信息时(individual2水平),插补质量急剧下降至接近物种水平。同时,物种内性状相对幅度范围越宽,插补值的相对误差越大。这些结果揭示了一个关键现象:即使物种水平数据集非常完整(缺失比例仅为2.68%),由于冗余度低,插补质量仍然很差。本文所使用的性状是为了构建全球植物形态与功能谱而有意选择的,性状间相关性较弱,因此物种水平数据集的冗余度较低。
五、结论与意义
本研究的核心结论是:插补方法不会产生新的信息,只是提取和重新分配数据集中已有的信息。当数据集的冗余度较低时,插补值的可靠性会显著下降,而脱离插补语境使用这些插补值进行后续变量计算会导致偏差。研究建议,在计划任何脱离语境的插补值应用之前,必须使用留一法程序检验插补值的质量。研究者提供了一个决策树,帮助科研人员判断何时应更加谨慎地使用插补。该决策树的核心思想是:如果关注点是整个矩阵的整体模式(如多变量分析检测性状综合征),插补通常优于仅使用完整个案;但如果关注点是矩阵中的个别元素(如特定物种的具体性状值),则应高度谨慎。
此外,作者提出了一个重要建议:不应发表填补空缺后的数据集,而应只发表经验数据、所使用的插补方法以及可复现插补过程的脚本。这样可以避免插补数据的无节制传播,确保数据来源和质量的透明性。
六、研究亮点
本研究的亮点在于:第一,首次明确区分了插补的“语境”与“脱离语境”应用,并系统评估了脱离语境使用插补值对后续计算的影响;第二,揭示了冗余度而非缺失比例是决定插补质量的关键因素;第三,实证证明即使数据集几乎完整,低冗余度仍可导致插补值质量低下;第四,提出了具体可操作的留一法检验程序和决策树,为研究者提供了实用的质量控制工具;第五,提出了不发表填补后数据集的重要科学伦理建议,有助于提升生态学研究的可重复性和数据透明度。
七、其他有价值的内容
本文的补充材料中包含了用于执行留一法程序的脚本代码,这为其他研究者复现和改编该程序提供了便利。此外,研究使用的Baraloto数据集来自TRY植物性状数据库(数据集编号269),其个体水平数据为评估冗余度与插补质量之间的关系提供了理想的研究对象。研究还强调了信息论框架下“冗余度”概念的操作化定义,为理解插补方法的适用范围提供了理论基础。作者团队的国际多机构合作为研究提供了广泛的数据来源和多元的方法论视角,增强了研究结论的普适性和说服力。