分享自:

开发临床预测模型所需样本量的计算

期刊:BMJDOI:10.1136/bmj.m441

本文为方法学指南类论文(类型b),旨在为开发临床预测模型(clinical prediction model)时如何计算所需样本量提供科学、实用的指导。文章由 Richard D Riley 等多位生物统计学与临床流行病学专家联合撰写,发表于 BMJ 2020 年第 368 卷,文章编号为 m441。主要作者来自 Keele University、Vanderbilt University School of Medicine、University of Manchester、University Medical Center Utrecht、University of Oxford 等机构。

本文的核心论点是:传统的“每个变量至少 10 个事件”(10 events per variable, 10 EPV)的经验法则过于简单化,实际所需样本量应依据具体研究背景进行量身定制。作者提出了一套四步程序,用以计算开发临床预测模型所需的最低样本量,并强调了样本量不足会导致模型过拟合(overfitting)和预测不准确,从而影响临床决策。

首先,文章详细阐述了“10 EPV”法则的局限性。作者指出,该法则中的“变量”一词具有误导性,因为某些预测因子(predictor)在回归方程中需要多个 β 参数,例如三分类变量需要两个参数,连续变量的非线性效应也需要多个参数。因此,更准确的表述应当是“每个候选预测参数的事件数”(events per candidate predictor parameter, EPP)。此外,“候选”一词十分关键,因为模型过拟合的程度取决于所考虑的全部预测参数数量,而不仅仅是最终纳入模型的参数数量。作者进一步强调,以往支持 10 EPV 法则的模拟研究主要关注预测因子效应估计的偏倚和精度,而非风险预测的准确性。不同研究对所需 EPP 的建议从低于 10 到高达 50 不等,这正说明所需 EPP 具有情境依赖性,不仅取决于事件数与候选预测参数数之比,还取决于总参与者数、研究人群中的结局比例(发病率),以及模型的预期预测性能。

其次,文章提出了计算样本量以确保预测精确并最小化过拟合的四步方法。该方法建立在 van Smeden 等人和 Riley 等人近年来的方法学研究基础之上,要求研究者预先设定目标人群的总体结局风险或平均结局值、候选预测参数数量,以及以整体模型拟合度(R²)表示的预期模型性能。

第一步:计算能够精确估计总体结局风险或平均结局值所需的样本量。其基本原理是,样本量必须足以精确估计模型的截距(intercept),以确保模型能够准确预测平均结局值或总体结局比例。对于二分类结局(binary outcome)和生存结局(time-to-event outcome),作者建议将总体结局比例估计的误差范围控制在 ≤0.05 以内。例如,若二分类结局发生率为 0.5,则至少需要 385 名参与者才能获得 0.45 至 0.55 的置信区间;若结局比例为 0.1 和 0.2,则分别至少需要 139 和 246 名参与者。对于生存结局,还需确定关键时间点和预期事件发生率。

第二步:计算能够使所有个体的预测值具有较小平均误差所需的样本量。针对二分类结局,van Smeden 等人通过模拟发现,候选预测参数数量、总样本量和结局比例是影响模型平均预测准确性的三个主要驱动因素。据此提出了样本量计算公式,以帮助确保新模型在目标人群中预测概率的平均绝对预测误差(mean absolute prediction error, MAPE)较小。例如,当候选预测参数为 10 个、结局比例为 0.3 时,至少需要 461 名参与者和 13.8 EPP 才能将观察概率与真实概率之间的平均绝对误差控制在 0.05。该计算可通过交互式工具(https://mvansmeden.shinyapps.io/beyondepv/)实现,适用于候选预测因子不超过 30 个的情况。对于连续结局(continuous outcome),需要精确估计残差标准差(residual standard deviation),若要将残差标准差的乘法误差控制在 10% 以内,所需样本量为 234+p,其中 p 为预测参数数量。

第三步:计算能够产生较小所需收缩(shrinkage)的样本量。过拟合是指模型在开发数据中表现过于极端,而在同一目标人群的新数据中预测性能下降。收缩(也称为惩罚或正则化)方法通过将极端预测拉向总体平均值来缓解过拟合,但收缩因子本身也需要从开发数据中估计,样本量过小时其估计往往不精确,导致无法完全纠正过拟合。Riley 等人因此建议确定与较小期望收缩量(≤10%)相对应的样本量和候选预测因子数量。该计算需要预先设定候选预测参数数量、预期结局比例或发生率,以及预期模型性能的保守估计值——即 Cox-Snell R²(R²_CS)。R²_CS 反映了信噪比,信噪比高时过拟合风险较低,可估计更多参数;信噪比低时过拟合风险较高,可可靠估计的参数较少。对于连续结局,R²_CS 即决定系数 R²。例如,开发一个包含 30 个预测参数、预期 R²_CS 为 0.7 的连续结局模型,需要 206 名参与者才能确保期望收缩为 10%。对于二分类结局,若候选预测参数为 20 个、预期 R²_CS 至少为 0.1,则需要 1698 名参与者才能确保期望收缩为 10%;若结局比例为 0.3,则对应 EPP 为 25.5。作者特别强调,对于二分类和生存结局,R²_CS 的上限 max(R²_CS) 由总体结局比例或发生率决定,通常远小于 1。例如,结局比例为 0.5、0.3、0.1 和 0.05 时,对应的 max(R²_CS) 分别为 0.75、0.71、0.48 和 0.33。因此,即使模型性能良好,预期的 R²_CS 也可能很小,样本量计算应采用保守值。

第四步:计算能够使表观模型拟合度的乐观性(optimism)较小的样本量。该步骤旨在确保模型在开发数据中的表观 Nagelkerke R² 与经乐观性校正后的值之间的差异较小。表观 R²_Nagelkerke 是模型在开发数据中的表现,而乐观性校正后的值更接近模型在目标人群中的真实拟合度。样本量计算同样需要预先设定预期 R²_CS 和 max(R²_CS)。例如,开发一个预期 R²_CS 为 0.2、结局比例为 0.05 的逻辑回归模型,需要 1079 名参与者才能将表观 R²_Nagelkerke 的期望乐观性控制在 0.05。

在应用示例部分,作者分别以先兆子痫(preeclampsia)预测、静脉血栓栓塞症(venous thromboembolism, VTE)复发预测、以及儿童和青少年去脂体重(fat free mass)预测为例,展示了如何将上述四步程序用于实际样本量计算。例如,在二分类结局示例中,若候选预测参数为 30 个、结局比例为 0.05、预期 R²_CS 为 0.05,则至少需要 5249 名女性(对应 263 个事件和 8.75 EPP),该结果主要由第三步(收缩因子)驱动。若将候选预测因子减少到 20 个,则所需样本量降至 3500 人。在生存结局示例中,若候选预测参数为 30 个、预期 R²_CS 为 0.051、事件率为 0.065,则至少需要 5143 名参与者和 692 个事件,对应 EPP 为 23.1。在连续结局示例中,若预期 R²_CS 为 0.90、候选预测参数为 20 个,则至少需要 254 名参与者,对应每人 12.7 个预测参数,该结果主要由残差标准差估计精度驱动。

文章还讨论了若干扩展话题。首先,若需确保模型在关键亚组中的预测准确性,则可能需要更大的样本量,因为预测因子效应的精度还受其效应大小、方差、与其他预测因子的相关性等因素影响。其次,在已有数据集的情况下,样本量计算仍可用于判断该数据集是否足够,以及可考虑纳入多少预测因子而不至于过拟合。第三,使用变量选择(variable selection)方法(如 LASSO 或弹性网络)时,样本量要求仍需进一步研究,因为这些方法虽然能同时进行收缩和变量选择,但惩罚因子和所选预测因子子集在小样本下可能高度不稳定。第四,基于机器学习(machine learning)的风险预测模型可能需要比经典回归模型大得多的样本量,有研究显示二分类结局的机器学习方法可能需要比逻辑回归多 10 倍以上的事件数才能达到较小的过拟合程度。第五,当对已有模型进行更新(model updating)时,若仅更新截距或仅需估计一个常数倍率,则所需样本量可大幅减少。

文章最后总结指出,较大的样本量有助于开发更稳健的模型,研究者应尽可能收集更多数据;数据应具有足够质量并能代表目标人群和应用场景。在数据收集后,应使用适当的方法进行模型构建,不推荐将数据拆分为训练集和测试集,而应使用全部数据进行模型开发,并通过重抽样方法(如 bootstrap)进行内部验证。此外,外部验证已有模型所需的样本量计算需要不同的方法,应另行讨论。

本文的学术价值在于系统性地提出了一套比“10 EPV”经验法则更为科学、灵活且情境化的样本量计算方法,适用于连续、二分类和生存结局的预测模型开发。其应用价值在于为研究者在设计预测模型研究时提供了明确的、可操作的指导,并提供了 Stata 和 R 软件包 pmsampsize 以便于实际应用。文章的重要贡献还在于澄清了 EPP 与 EPV 的区别,强调了候选预测参数数量、结局比例和预期模型性能对样本量需求的共同影响,并对机器学习方法在医学预测建模中的样本量问题提出了警示。这些观点对于改善临床预测模型研究的质量和可靠性具有重要意义。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com