基于可解释人工智能的子宫内膜癌术后血栓栓塞风险个性化预测:一项使用SHAP方法的研究
一、研究背景与目的
子宫内膜癌是常见的妇科恶性肿瘤之一,手术治疗仍是其主要治疗手段。然而,下肢深静脉血栓(lower extremity deep venous thrombosis, LEDVT)作为子宫内膜癌患者术后常见且严重的并发症,若未及时干预,血栓脱落可引发致死性肺栓塞,严重威胁患者生存。因此,临床上早期准确识别LEDVT高危患者对于及时启动预防措施、改善患者预后至关重要。
目前临床广泛使用的Caprini评分和Wells评分等通用风险评估工具在妇科肿瘤人群中的预测准确性有限。这些工具多为静态评分系统,无法纳入术后动态指标(如D-二聚体变化趋势),也难以充分量化肿瘤特异性因素(如国际妇产科联盟分期和组织学分级)对血栓风险的协同影响。近年来,基于电子病历的机器学习(machine learning, ML)方法在术后并发症预测领域受到越来越多的关注,ML能够处理复杂的高维非线性数据,特别适用于预测由多因素交互作用导致的深静脉血栓等术后并发症。然而,尽管ML模型具有强大的预测性能,其决策过程常被视为“黑箱”,削弱了临床信任与采纳。为此,本研究引入了SHAP(Shapley Additive Explanations)框架,该框架能够同时提供全局特征重要性排序和针对个体患者的局部预测解释,清晰界定每个临床变量对特定个体预测结果的贡献方向与大小,从而将“黑箱”转化为可信赖的临床决策支持工具。
本研究旨在基于常规可获得的围手术期临床数据,开发并验证一个子宫内膜癌患者术后下肢深静脉血栓的个体化预测模型。研究首次在该领域系统应用SHAP可解释人工智能方法,目标不仅是开发高精度预测工具,同时实现对模型决策逻辑的全局和个体化解释,为临床医生提供透明可信的风险评估依据,推动术后LEDVT管理向精准化早期干预演进。
二、研究流程与方法
本研究为回顾性多中心研究,共纳入遵义医科大学附属医院、贵州省人民医院、沿河土家族自治县人民医院、遵义医科大学第三附属医院及六盘水市妇幼保健院五家中心2011年10月至2026年3月期间接受子宫内膜癌全面分期手术的841例患者作为模型开发队列。841例连续筛查患者按8:2比例随机分为训练集(n=673)和内部验证集(n=168),另设包含95例患者的外部验证队列用于外部验证。纳入患者均经术后病理确诊为子宫内膜癌并接受标准手术治疗,排除标准包括:术前抗凝治疗、静脉血栓栓塞病史及合并其他恶性肿瘤。术后LEDVT定义为根治术后30天内新发的下肢深静脉血栓(包括股静脉、腘静脉、胫腓静脉丛或髂静脉),诊断需经彩色多普勒超声或CT静脉造影确认。在841例患者中,72例(8.6%)发生术后血栓。
数据收集方面,研究利用电子病历系统收集患者术前24小时内的临床数据用于特征选择和预测模型构建。收集的数据主要包括个体因素、手术相关因素、术后实验室指标及肿瘤特征。为减少缺失数据引入的偏倚,首先排除缺失率超过25%的变量,其余变量中连续变量用中位数填补、分类变量用众数填补。在初步考虑约40个候选预测因子后,进行了多重共线性初步筛选:对离散变量计算Cramér‘s V,对连续变量计算Pearson相关系数。最终选取27个变量用于后续建模,包括:年龄、BMI、高血压、糖尿病、绝经状态、最大肿瘤直径、淋巴结转移、血管侵犯、病理分级、临床分期、手术时间、术中失血量、术中输血量、术中输液量、白细胞计数、红细胞计数、红细胞压积、血小板计数、活化部分凝血活酶时间、凝血酶时间、术后D-二聚体水平(术后24-48小时内测定)、纤维蛋白原水平、术后持续卧床时间、使用止血药物、使用抗凝药物、术后双下肢按摩及留置中心静脉导管。
鉴于术后LEDVT事件仅占原始数据集的8.6%(72/841),存在显著的类别不平衡问题,研究采用了五种数据重采样策略进行数据增强:ADASYN、None、RandomOver、SMOTE和SMOTE-Tomek。基于平均AUC指标,选择RandomOver作为最优数据增强方法。为严格防止信息泄漏,数据处理流程结构为:初始训练-测试划分→训练集内5折交叉验证→仅在每次交叉验证的训练折内应用随机过采样→模型训练→在未接触的验证折上评估。内部测试集和外部验证集完全不参与任何重采样过程。
本研究共纳入26种机器学习算法进行模型构建和性能比较,包括NearestCentroid、BernoulliNB、RandomForestClassifier、AdaBoostClassifier、SVM、LogisticRegression、LinearDiscriminantAnalysis、CalibratedClassifierCV、RidgeClassifierCV、SGDClassifier、PassiveAggressiveClassifier、NuSVC、BaggingClassifier、ExtraTreeClassifier、LinearSVC、XGBClassifier、KNeighborsClassifier、LGBMClassifier、GaussianNB、DummyClassifier、ExtraTreesClassifier、LabelSpreading、LabelPropagation、DecisionTreeClassifier和Perceptron。训练阶段采用分层5折交叉验证进行超参数调优,各算法的最终参数组合通过网格搜索与人工微调确定。所有模型在同一计算环境(Python 3.9/scikit-learn 1.1)中实现和评估。
在特征选择与模型解释方面,研究引入SHAP框架进行系统解释。首先基于训练集计算每个样本的SHAP值,按平均绝对值降序排列生成特征重要性排序列表。随后实施“递归消除”过程:从全部27个特征开始,迭代移除最不重要的特征,每一步在内部验证集上重新计算AUC,当AUC下降超过0.02时停止消除,从而确定关键变量并实现模型性能与简洁性的最优平衡。最终模型选定支持向量机(Support Vector Machine, SVM),核心变量为四个:术后D-二聚体水平、年龄、纤维蛋白原水平和临床分期。
三、主要研究结果
在模型开发与性能比较阶段,利用术前24小时内收集的临床数据构建了26个ML模型以预测子宫内膜癌患者术后LEDVT的发生。在五种不同数据增强策略下,六个模型——NearestCentroid、BernoulliNB、RandomForestClassifier、AdaBoostClassifier、SVM和LogisticRegression——在AUC方面表现出稳定性,因此被纳入后续特征选择分析。
特征重要性排序分析显示,27个候选特征按重要性降序排列为:术后D-二聚体水平、年龄、纤维蛋白原水平、临床分期、术后持续卧床时间、红细胞压积、红细胞计数、手术时间、凝血酶时间、病理分级、高血压、术后双下肢按摩、淋巴结转移、活化部分凝血活酶时间、糖尿病、血管侵犯、术中输液量、最大肿瘤直径、白细胞计数、术中失血量、血小板计数、术中输血量、使用止血药物、绝经状态、BMI、使用抗凝药物、留置中心静脉导管。递归特征消除分析表明,当特征数降至10以下时,大多数模型仍保持相对较高性能。其中,SVM模型仅使用四个特征即达到接近全特征集的性能(AUC=0.82),展现出强大的特征选择能力。基于多模型RFE结果和临床共识,最终选定术后D-二聚体、年龄、纤维蛋白原和临床分期四个核心变量构建最终SVM模型。
最终模型验证结果显示:训练集上该模型AUC为0.823,内部验证集AUC为0.828(95%CI: 0.706–0.905),表明无显著过拟合;独立外部验证集AUC为0.819,与内部验证性能高度一致,进一步证实了模型良好的泛化能力。同时,校准曲线显示模型在内部和外部验证集中均具有良好的校准度。
在模型解释层面,全局特征重要性分析中,术后D-二聚体水平(平均|SHAP|=0.06)、年龄(0.05)、纤维蛋白原水平(0.02)和临床分期(0.01)是影响模型预测的四个最重要特征。SHAP依赖图揭示了各特征与预测风险之间的非线性关系:术后D-二聚体水平呈现明显的正相关,当其标准化值从约-1增加到1时,对应的SHAP值从约-0.05上升至0.05,表明D-二聚体水平越高,LEDVT风险越大;年龄呈现“U型”关联,中间年龄段SHAP值接近零,分布两端(尤其是高龄侧)SHAP值升高至约0.08,提示极端年龄患者LEDVT风险发生改变;纤维蛋白原在较低范围内(标准化值)多对应负SHAP值,提示潜在保护效应,但当标准化值超过约2.0时SHAP值趋于正值,表明高水平成为危险因素;临床分期的SHAP值随分期增加而升高,尤其在标准化值超过约1.5后SHAP值可升至约0.03,表明疾病进展程度与术后LEDVT风险密切相关。
在个体层面,SHAP瀑布图直观展示了模型为每位患者提供个性化风险预测的决策逻辑。高风险患者(实际发生血栓)的模型输出值(f(x)=0.219)显著高于全体患者平均基线水平(E[f(x)]=0.081),升高的术后D-二聚体(2.008)是最重要的正向驱动因素(SHAP值+0.1),晚期临床分期(2.5)提供额外正向贡献(+0.02);低风险患者(未发生血栓)的模型输出值(f(x)=0.03)远低于基线水平,较低的术后D-二聚体(0.68)是最关键的保护因素(最大负SHAP值-0.02),早期临床分期(0.4)也提供了显著的负向贡献。
在临床应用方面,研究基于最终模型开发了一个可视化决策界面原型。临床医生输入四个围手术期特征的实际值后,系统可立即输出个体化DVT概率并同时生成力图进行解释。决策曲线分析结果显示,使用校准后的SVM模型在5%–52%的风险阈值范围内提供了正的净临床获益。
四、研究结论与价值
本研究开发并验证了一个基于SHAP的可解释机器学习模型,用于个体化预测子宫内膜癌患者术后LEDVT风险。该模型仅使用四个常规围手术期临床指标即展现出可靠的风险评估能力,在内部验证(AUC=0.828)和外部验证(AUC=0.819)中均表现出色,且决策逻辑透明可解释。这为妇科肿瘤术后并发症的精准预防提供了实用决策支持工具。
本研究的科学价值在于:其一,首次在子宫内膜癌术后LEDVT预测领域系统应用SHAP可解释人工智能框架,成功解决了机器学习模型“黑箱”困境;其二,最终模型选定的四个核心预测因子均具有明确的病理生理学基础——术后D-二聚体直接反映术后纤溶系统激活程度和高凝状态,年龄的U型风险关联提示年轻患者(可能与侵袭性肿瘤生物学相关)和老年患者(常伴血管内皮功能障碍和活动减少)存在不同的血栓形成机制,纤维蛋白原与风险的非线性关系提示临床评估应关注其异常升高的“拐点”而非简单线性相关,临床分期综合反映了肿瘤负荷对机体凝血-炎症网络的系统性影响;其三,相比传统静态评分工具,该模型通过机器学习算法捕捉了这些因素之间复杂的交互作用,实现了从基于人群的风险分层到个体化概率预测的范式转变。
研究的应用价值体现在:决策界面原型的开发展示了临床转化的可行性,DCA分析提供了5%–52%的有效决策阈值范围,使临床医生可根据具体干预措施的副作用大小灵活设定决策阈值。基于模型的个体化决策相比“一刀切”策略可显著改善患者整体预后。
五、研究亮点
本研究的核心亮点有三:第一,首次将SHAP可解释人工智能方法系统应用于子宫内膜癌术后LEDVT预测领域,实现“一预测一图一解释”的精准临床解读模式;第二,通过递归特征消除将模型精简至仅四个常规临床指标(术后D-二聚体、年龄、纤维蛋白原、临床分期),在保持高预测性能的同时大幅提升了临床实用性;第三,通过SHAP依赖图揭示了各特征与血栓风险之间丰富的非线性关联(如年龄的U型关系、纤维蛋白原的阈值效应、D-二聚体的临界风险阈值),为制定年龄分层预防策略和识别关键干预节点提供了新的临床洞见。
研究也存在若干局限性:外部验证队列较小(n=95)且地理范围有限;回顾性设计未纳入遗传性易栓症、术后早期活动能力及血栓弹力图等潜在重要变量;术后影像学检查主要为症状触发而非对所有患者常规进行,可能存在检测偏倚而低估无症状LEDVT的真实发生率。未来研究方向包括开展前瞻性干预研究验证特定决策阈值、开发并部署与电子病历系统无缝集成的临床决策支持工具、收集纵向时间序列数据以将术后动态监测指标纳入模型,从而将当前静态预测升级为实时连续风险评估系统。