分享自:

统计入门:如何处理科学研究中的缺失数据?

期刊:Interactive Cardiovascular and Thoracic SurgeryDOI:10.1093/icvts/ivy102

本文发表于期刊 *Interactive CardioVascular and Thoracic Surgery*,文章标题为“Statistical Primer: How to deal with missing data in scientific research?”,作者为 Grigorios Papageorgiou、Stuart W. Grant、Johanna J.M. Takkenberg 和 Mostafa M. Mokhles,作者单位分别为荷兰鹿特丹伊拉斯姆斯大学医学中心心胸外科与生物统计学系,以及英国曼彻斯特大学学术外科系。文章于2017年11月10日投稿,2018年2月27日被接收,并于2018年5月10日在线发表。该文属于方法学指导类论文,旨在向非统计学专业的研究者系统介绍缺失数据的基本概念、处理策略以及报告规范,帮助临床研究者在面对缺失数据时做出更科学合理的选择。

在临床研究中,缺失数据极为常见,可出现在随机对照试验、队列研究、病例对照研究以及临床注册研究中。缺失数据如果处理不当,会导致统计效能下降、关键亚组代表性丧失、治疗效果估计偏倚以及统计分析复杂性增加。因此,作者强调,研究者应当首先在研究设计和数据收集阶段尽可能减少缺失数据,其次理解缺失数据的产生机制,再选择合适的方法处理缺失数据,最后在必要时进行敏感性分析。

文章首先介绍了缺失数据的三种主要机制:完全随机缺失(missing completely at random, MCAR)、随机缺失(missing at random, MAR)和非随机缺失(missing not at random, MNAR)。完全随机缺失指观测值的缺失与已观测或未观测的数据均无关,所有个体发生缺失的概率相同;例如超声设备偶发故障导致部分超声心动图测量值缺失。随机缺失指缺失的概率依赖于其他已观测变量,而非缺失值本身;例如年轻患者更可能错过随访预约,因此缺失的超声心动图测量值可能与已观测的年龄变量相关。非随机缺失指缺失的概率依赖于未观测的值本身,即使考虑了所有可用的其他信息,缺失与观测值之间的系统性差异仍然存在;例如重度瓣膜疾病患者因无法前往医院而更可能缺失超声测量值。作者指出,尽管理论上存在检验MCAR或MAR的方法,但其实际价值有限;区分MAR与MNAR则需要依赖未观测数据,因此无法仅基于已观测数据做出判断。研究者应当结合数据的收集方式和临床背景,评价某种缺失机制假设的合理性。

在处理缺失数据的方法部分,文章重点比较了完整案例分析(complete case analysis)、单一插补(single imputation)和多重插补(multiple imputation)。完整案例分析是最简单的方法,即删除任何分析所需变量存在缺失的个体。在完全随机缺失条件下,该方法不会导致结果偏倚,但会因样本量减少而损失统计效能,且当数据为随机缺失时会产生偏倚。完整案例分析可能适用于研究主要结局数据缺失的情形。单一插补则是用某个替代值填补缺失值,例如使用正态分布连续变量的均值、分类变量的中位数或众数、回归方程的预测值,或者采用最好/最差观测值结转法。在某些情况下,如果认为缺失的风险因素数据极可能是由于风险因素不存在所致,则可合理地将缺失值插补为“无该风险因素”。尽管单一插补能保留所有研究对象,但可能引入偏倚,且由于插补未以结局变量为条件,其参数估计的不确定性并不能得到恰当反映。单一插补可用于最坏或最好情形下的敏感性分析。

多重插补是处理随机缺失数据的更稳健方法,其核心思想分为三个步骤:插补、分析和合并。第一步,生成多个原始不完整数据集的副本,在每个副本中,缺失值由基于观测数据预测分布随机抽取的值替代,该过程引入了插补值的不确定性。第二步,对每个插补后的数据集分别拟合研究模型,各数据集的分析结果会因插补值的差异而略有不同。第三步,利用Rubin规则对各个分析结果进行合并,得到合并估计值和相应的标准误。与完整案例分析相比,多重插补在随机缺失条件下能提供有效结果,同时避免因样本量减少而损失效能;与单一插补相比,多重插补不仅考虑了插补值本身的不确定性,还考虑了插补之间的方差,因此能够避免标准误过小的问题。然而,作者强调,多重插补并非万能。在非随机缺失条件下,上述方法通常均无法提供有效结果,此时需要基于不同非随机缺失情景进行敏感性分析,以评估结果的稳健性。

文章进一步阐述了多重插补的注意事项和局限。例如,对于缺失结局数据,通常认为完整案例分析更为合适,因为插补结局数据可能导致误导性结果;但也可以使用单一插补进行最坏或最好情景的敏感性分析,或在存在与结局高度相关的辅助变量时进行多重插补。关于插补数据集的数量,虽然5个数据集通常被认为足够,但增加数据集数量可提高估计效率和结果的可重复性。由于多重插补基于迭代算法,应评估收敛性并在必要时增加迭代次数。在构建插补模型时,应将结局变量纳入其中,以反映结局与不完整协变量之间的关联。对于纵向研究,常见的多重插补软件通常要求将长格式数据转换为宽格式,这更适合测量时间点一致的均衡设计。在生存分析中,由于结局变量由事件指示变量和时间变量共同构成,目前研究建议在插补模型中使用Nelson–Aalen估计量结合事件指示变量,而非直接使用事件指示变量与时间变量。关于可接受的缺失比例,文章指出没有统一标准,理论上多重插补可处理较大比例的缺失,但结果质量取决于插补模型的复杂性、样本量以及变量的变异性;例如,如果剩余50%的数据能够准确估计用于抽取插补值的预测分布,则50%的缺失可能可接受,但在小样本、高变异性或异质性研究人群中则未必可行。鉴于多重插补的复杂性,作者建议在统计专家指导下进行。

在报告规范方面,作者提供了详细指南,建议在科学论文中报告每个关键变量的缺失数量和比例,或补充报告完整案例的数量;讨论缺失数据产生的潜在原因;以表格或图形比较完整案例与不完整案例的变量分布;明确说明所采用的缺失数据处理方法,以及关于缺失机制的假设;报告所用软件及版本,并说明是否修改了默认设置;报告插补数据集的数量和迭代次数;列出纳入插补模型的变量;说明是否在分析中使用了高阶项及其是否纳入插补模型;并通过不同非随机缺失情景下的敏感性分析评估随机缺失假设的稳健性。

为说明上述方法的实际表现,作者基于一个先天性心脏病患者接受同种主动脉瓣移植的随访研究,人为模拟了术后主动脉压力阶差40%缺失的三种情景,并分别使用完整案例分析、单一均值插补和多重插补进行Cox回归分析。结果显示,在完全随机缺失和随机缺失条件下,多重插补得到的结果比简单方法更接近完整数据的结果,且完整案例分析的置信区间更宽,反映了效能损失;在非随机缺失条件下,所有方法均产生偏倚,此时需要进一步的敏感性分析。作者由此得出结论:在临床研究中应优先通过良好的研究设计和数据收集方案减少缺失数据;虽然简单方法在缺失比例较小且缺失机制清楚时可能适用,但多重插补通常是处理缺失数据的首选策略。多重插补能解决完整案例分析和单一插补的诸多缺陷,但显著增加了分析复杂性,并且当数据为非随机缺失时仍可能导致偏倚。因此,处理缺失数据应遵循系统化流程,并清晰报告相关步骤,复杂方法应在统计学家指导下实施。该文的核心价值在于为非统计学背景的临床研究者提供了关于缺失数据处理的系统入门指南,强调了缺失机制判断、方法选择以及结果报告透明性的重要性。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com