本研究由Mohsen Pourmousa、Sankalp Jain(共同第一作者)等人领衔,通讯作者为Alexey V. Zakharov。研究团队来自美国国立卫生研究院国家转化科学促进中心(NCATS)、麻省理工学院(MIT)和北卡罗来纳大学教堂山分校(UNC)三个独立机构。该论文于2025年发表在《Nature Communications》期刊上。
胰腺癌因其显著的基因组异质性和对系统治疗的特殊耐药性,预后在过去十年未有改善,因此发现高效低毒的抗癌药物组合是肿瘤学领域最具挑战性的任务之一。鉴于已获批药物具有已知的毒性特征和大规模可及性,利用它们发现新的协同组合成为理想策略。然而,识别有效组合面临海量可能分子和组合数目、实验验证耗时等挑战。在此背景下,计算机模拟(in silico)方法,特别是机器学习技术,为高通量筛选提供了有效补充。本研究旨在通过整合计算与实验方法,发现针对胰腺癌的新型协同药物组合,并评估不同机器学习模型的预测能力。
研究的工作流程分为几个主要阶段。首先,研究团队使用NCATS的内部化合物库MIPE4,对包含近2000个抗肿瘤化合物进行针对胰腺癌细胞系PANC-1的单药剂量-反应筛选。细胞以500个/孔密度接种于1536孔板,经过72小时孵育后,采用基于ATP检测的CellTiter-Glo发光法细胞活力测定试剂盒评估细胞存活率。从中鉴定出32个活性最高的化合物(IC50值在2纳摩尔至3微摩尔之间)。随后,对这32个化合物进行所有成对组合的10x10矩阵筛选,每种组合设置九个1:2梯度稀释,总计产生496个组合的协同效应数据。本研究选用gamma(γ)评分作为协同作用量化指标,gamma值低于0.95被定义为协同作用,高于0.95则为非协同作用。重复实验的gamma值皮尔逊相关系数达0.83,确认了数据的可重复性。
基于这496个组合的训练数据集,三个独立研究团队分别开发了机器学习模型,以预测一个涵盖原初1785个化合物库所产生的约159万种组合中潜在的协同配对。NCATS团队采用了随机森林(Random Forest, RF)、极端梯度提升(XGBoost)和深度神经网络(Deep Neural Network, DNN)等算法,将分子指纹(如Avalon-2048和Morgan-2048)和分子描述符等特征进行平均以表征组合。其最佳模型是一个结合了RF分类和回归的共识模型,使用Avalon-2048指纹,在留一化合物交叉验证中达到0.78 ± 0.09的ROC曲线下面积(AUC)。UNC团队开发了基于多种描述符(如RDKit描述符、Morgan指纹和Simplex描述符)的RF、梯度提升和神经网络模型,以及整合了化合物IC50值的图卷积网络(Graph Convolutional Network, GCN),并通过一个包含MOA筛选等多层级标准的定制化流程来提名最终组合。MIT团队则采用了其先前开发的ComboNet方法的改进版,利用图卷积网络,从分子结构中自动学习特征向量。该模型不仅在PANC-1数据上训练,还整合了NCI-60的单药数据和NCI-ALMANAC的组合数据(总计约4000个组合数据点),以多任务学习方式进行训练,预测一个“定制协同评分”(bespoke synergy score),在测试集上平均AUC达到0.840 ± 0.036。
三家机构各自独立提名了30个最具协同潜力的组合,共计88个独特组合(仅有2个重叠),随后由NCATS在PANC-1细胞上使用与训练数据生成相同的10x10矩阵法进行实验验证。结果显示出不同模型的高命中率(hit rate):MIT的图卷积网络模型表现最佳,正确预测了30个组合中的25个,命中率高达83%;NCATS的RF共识模型正确识别了16个组合,命中率为53%;UNC的模型则精准预测了12个组合,命中率为40%。在获得所有88个组合的实验协同评分后,研究还进行了回顾性评估,即让各个模型对所有88个组合的协同性进行预测。此时,MIT、UNC和NCATS模型的命中率分别转变为58%、57%和45%。值得关注的是,NCATS模型实现了最高的平衡准确度(0.59)和最高的精准度(0.65),表明其产生的假阳性最少;而MIT模型虽有最高的AUC值(0.78),却产生了较多的假阳性。
综合训练集和测试集中实验验证为协同的组合,本研究生成了一个包含307个经过实验验证的协同药物组合的数据集。其中,有26个组合显示出极强的协同作用(gamma < 0.5)。通过对这些组合中化合物和作用机制(Mechanism of Action, MOA)的频次分析发现,卡非佐米(carfilzomib)是出现频率最高的化合物。在MOA层面,蛋白酶体抑制(proteasome inhibition)最为常见,其次为Polo样激酶1(PLK1)和组蛋白去乙酰化酶(Histone Deacetylase, HDAC)抑制。网络分析进一步揭示,蛋白酶体抑制与HDAC抑制的组合是最为频繁的协同MOA配对。通过将结果与随机生成的组合进行1000次比较的统计学检验,证实了“蛋白酶体-HDAC抑制”这一交互作用在协同组合中的出现次数(9次)显著高于随机预期(平均4.4次),p值小于0.01。
本研究的核心结论是,机器学习模型,特别是图卷积网络等深度学习方法,在预测药物协同作用方面展现出巨大潜力,并得到了高命中率的实验验证。通过这种计算与实验结合的方式,该研究不仅交付了307个实验验证的协同组合作为宝贵的资源,还揭示了以蛋白酶体抑制和HDAC抑制为代表的关键协同机制,为胰腺癌治疗提供了新的线索。研究的科学价值在于,它为在精心设计的前瞻性研究中,对不同复杂度的主流机器学习方法进行基准测试提供了一个令人信服的案例。其应用价值在于,所发现的协同组合或关键MOA配对,有希望在临床前研究中推进,从而开发出有效的胰腺癌疗法。
本研究的一个突出亮点在于其严谨的前瞻性验证设计:模型在对高达160万个未见组合进行预测后才进入实验验证阶段,这为评估模型的真实泛化能力提供了可靠标准。另一个亮点是揭示了MIT模型在通过利用外部大规模数据集(NCI-ALMANAC)进行辅助训练后,显著提升了预测性能,这为克服单一疾病数据稀缺性问题提供了思路。此外,尽管三家机构的最终预测列表重叠极少,却都取得了令人瞩目的整体高命中率,这充分展示了不同计算方法的互补性,也印证了协作研究在攻克复杂生物医学问题中的巨大力量。