分享自:

预测模型中正确选择验证策略的重要性:附实际示例的教程

期刊:Analytica Chimica ActaDOI:10.1016/j.aca.2023.341532

这篇论文由Eneko Lopez、Jaione Etxebarria-Elezgarai、Jose Manuel Amigo和Andreas Seifert撰写,作者分别来自西班牙的CIC nanoGUNE BRTA、巴斯克大学(University of the Basque Country)以及Ikerbasque巴斯克科学基金会。文章发表于Analytica Chimica Acta期刊第1275卷,文章编号341532,于2023年6月17日在线发布,是一篇开放获取文章,采用CC BY-NC-ND 4.0许可协议。

本文属于类型b,即科学论文中的教程(tutorial)类型文章,重点讨论预测模型中验证策略选择的重要性,题目为《The importance of choosing a proper validation strategy in predictive models. A tutorial with real examples》。本文围绕化学计量学和机器学习中建模验证的核心问题,结合三个真实数据集,系统阐述交叉验证、外部测试集及重采样方法对模型可靠性的影响,尤其强调数据内在层级结构对验证策略选择的决定性作用。

论文首先提出了机器学习在化学计量学中的基本建模框架:给定一个由m个样本和n个自变量构成的矩阵X(m×n)以及预测变量y(m×1),建模的目的是寻找一个回归向量b(n×1),使得y=Xb+e,其中e为残差向量。文章聚焦于偏最小二乘判别分析(PLS-DA)这一广泛应用的分类方法。PLS-DA通过寻找与y块协方差最大的正交方向(即潜在变量,Latent Variables,LVs)来处理高度相关变量,并在此后选择合适的阈值来判断样本所属类别。然而,模型可靠性不能仅依赖训练集表现,真正可靠的模型必须在全新样本上具备良好的预测能力。为此,作者提出了衡量模型可靠性的四个统计评估标准:稳定性(stability)、显著性(significance)、可预测性(predictability)和泛化能力(generalizability)。

论文详细阐述了验证策略的类型。首先是测试集(Test Set)的划分,即将数据分为训练集(用于建模)和外部验证集(用于评估泛化能力)。划分方法包括Kennard-Stone算法、随机划分和基于数据结构的划分。Kennard-Stone算法基于样本间距离依次选择覆盖方差空间的样本进入测试集,优点在于实现简单,但缺点是未考虑y的方差分布。随机划分操作简单,但在类别不平衡时容易产生偏差。基于数据结构的划分则要求将同一样本的全部重复测量作为一个整体留在同一集合中,以避免信息泄漏,是作者反复强调的最合适方法。此外,划分前后的预处理顺序也至关重要:行方向预处理(如标准正态变量变换SNV、平滑、导数)可以在划分前进行;而依赖整体数据结构的列方向操作(如均值中心化、自标度化)或依赖数据集整体信息的方法(如多元散射校正MSC)则应在划分后的训练集上进行,并将参数固定后应用于测试集。

论文的第二大重点是重采样(resampling)方法,包括交叉验证(Cross-Validation,CV)、刀切法(Jackknife)、自助法(Bootstrap)和置换检验(Permutation Test)。交叉验证的重点在于评估模型预测性能,常用策略包括留一法交叉验证(Leave-One-Out CV,LOO-CV)、威尼斯百叶窗法(Venetian Blinds CV,VB-CV)以及基于数据结构的交叉验证(如留一被试交叉验证,Leave-One-Subject-Out CV,LOSO-CV)。刀切法则聚焦于模型参数(如回归向量b)的稳定性,通过计算多次删除样本后参数的方差来识别不稳定的回归系数,并可用于变量选择。自助法通过有放回抽样构造与训练集规模相同的子集,以估计参数的置信区间。置换检验则通过随机打乱y值的顺序重新建模,检验模型结果是否显著区别于随机结果,常结合Wilcoxon检验来计算p值。

文章围绕三个真实数据集展开分析与结果对比。第一个是阿尔茨海默病(Alzheimer’s Disease)的小型医学数据集,包含20名临床前阿尔茨海默病患者和19名健康个体的脑脊液(Cerebrospinal Fluid,CSF)样本,每个样本以傅里叶变换红外光谱(FTIR)在2000–4000 cm⁻¹范围内重复测量三次,最终形成117×1036的数据矩阵。结果显示,在忽略样本重复结构的情况下,LOO-CV和10折VB-CV均能给出高达0.9以上的灵敏度、特异性和准确率(accuracy)等品质因数(Figures of Merit),模型表现“非常理想”。然而,当采用LOSO-CV时,最佳性能仅为约75%,且外部验证的标准差覆盖了0.3到0.8的范围,表明模型极度不稳定。作者进一步演示了若从一开始就随机划分训练集与外部验证集而不考虑样本结构,模�型在4–5个潜在变量时表现出“良好”的训练和验证结果,但标准差范围依然较大。相比之下,将同一样本的三次光谱平均后重新建模,则LOO-CV、VB-CV与LOSO-CV及外部验证的趋势趋于一致,但由于样本量减少,外部验证的标准差极高,模型鲁棒性仍然不足。该数据集的结论是,无论采用何种验证策略,均无法构建可靠且稳定的阿尔茨海默病分类模型,根本原因在于样本量过小且光谱变异性过大。

第二个数据集为COVID-19检测的拉曼光谱(Raman Spectroscopy)大数据集,包含53名确诊患者和50名健康对照,每个样本三个重复测量,最终形成309×900的数据矩阵。该数据集的结果显示了与第一个数据集类似的现象:LOO-CV与3折VB-CV在约11个潜在变量时可以达到接近100%的训练准确率,但交叉验证准确率从未超过95%;而采用LOSO-CV时,仅需4个潜在变量即可达到最佳性能,且与外部验证的结果一致。当随机划分数据集为80%训练集和20%外部验证集并重复10次后,模型在8个潜在变量下达到训练和验证的最佳性能,而超过15个潜在变量后模型纳入噪声导致性能下降。对每个样本的三次光谱进行平均后,所有交叉验证策略及外部验证均在4个潜在变量时表现最佳,但外部验证的标准差仍然很高。总体而言,COVID-19数据集的模型结果可通过LOSO-CV和平均光谱方法获得可接受的性能。

第三个数据集为食品科学领域的小型葡萄酒鉴真数据集,包含19瓶赤霞珠(Cabernet Sauvignon)和18瓶西拉(Syrah)葡萄酒,每瓶三个子样本,形成111×235的近红外(NIR)光谱数据矩阵。与阿尔茨海默病数据集类似,使用全数据集时,LOO-CV和3折VB-CV在9个潜在变量时可以达到100%的训练和交叉验证准确率,但LOSO-CV仅能获得约80%的准确率,且与外部验证结果一致。随机划分训练集和外部验证集后,训练和验证均在9个潜在变量时达到完美性能,造成过度乐观的假象。使用平均光谱后,最佳性能在9个潜在变量时出现,与LOSO-CV的结果一致,但外部验证的标准差依然较高。

在置换检验部分,作者对三个数据集的训练集进行了Wilcoxon检验以评估模型显著性。阿尔茨海默病数据集的LOO-CV和3折VB-CV在5个潜在变量后p值低于0.05,表明结果显著区别于随机预测;但LOSO-CV的p值仍然很高,表明结果可能不具显著性。COVID-19和葡萄酒数据集的置换检验结果显示,所有验证策略下模型结果均具有高度显著性,尽管COVID-19数据集在16个潜在变量处出现p值波动,但绝对数值极小,接近计算数值精度的极限。

论文还利用Hotelling T²和Q残差(Residuals)诊断了阿尔茨海默病数据集中的样本投影行为。在5个潜在变量下,某样本在校准阶段具有较高的T²但较低的Q残差,说明其对模型具有特殊重要性;在LOO-CV中该样本投影变化不大,但在LOSO-CV中其T²和Q残差急剧增大,超出95%置信限,表明该样本并不真正属于该模型。当使用14个潜在变量时,无论如何交叉验证,该样本均看似正常,说明过度拟合会掩盖样本的不稳定性。

最后,论文讨论了使用回归向量进行刀切估计的局限性。尽管阿尔茨海默病数据集的10次随机运行所得回归向量标准差很小,看似稳定,但这并不代表分类结果可靠。回归向量仅仅是在训练数据上拟合的参数,删除部分样本对其影响可能很小,但对残差却有很大影响。因此,校准集的品质因数并不能说明分类模型的质量。

本文强调了在构建预测模型时验证策略选择的核心重要性,尤其是数据的内部层级结构(如重复测量、被试分组)对交叉验证和外部验证结果的决定性影响。错误地使用LOO-CV或不考虑样本结构的随机划分会产生过度乐观的模型表现,从而误导研究者得出错误的可靠性结论。作者呼吁科学界避免盲目追求高拟合统计量,而应通过严格的验证程序评估模型的稳定性、显著性、可预测性和泛化能力。该论文的科学价值和应用价值在于为化学计量学和机器学习社区提供了一套系统的验证策略指导框架,并通过真实数据演示了错误验证可能带来的严重后果,对医学诊断、食品质量控制、环境监测等领域中的光谱建模实践具有直接的指导意义。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com