分享自:

基于深度学习的基因扰动效应预测尚未超越简单线性基线

期刊:Nature MethodsDOI:10.1038/s41592-025-02772-6

深度学习方法在基因扰动效应预测中并未超越简单线性模型基线

研究概述

本文介绍了一项发表于 Nature Methods(2025年8月,第22卷)的重要基准测试研究,题为“Deep-learning-based gene perturbation effect prediction does not yet outperform simple linear baselines”。该研究由来自海德堡大学 BioQuant 中心及欧洲分子生物学实验室(EMBL)的 Constantin Ahlmann-EltzeWolfgang HuberSimon Anders 共同完成。研究系统性地比较了五种单细胞基础模型(foundation model)和两种其他深度学习模型,与特意设计的简单基线方法在预测基因扰动后转录组变化方面的表现。

研究背景与科学问题

近年来,随着大语言模型(large language models)在知识表征领域的成功,生物学界掀起了将基础模型(foundation model)概念应用于生物数据的热潮。多个基于数百万单细胞转录组学数据训练的单细胞基础模型相继发表,其中 scGPT 和 scFoundation 声称能够预测由基因扰动(genetic perturbation)引起的基因表达变化。基因扰动效应预测对于理解基因功能和遗传相互作用(genetic interaction)至关重要,然而当前尚缺乏对这些深度学习模型性能的严格基准测试。

本研究旨在回答一个核心问题:这些计算成本高昂的深度学习基础模型在预测基因扰动效应时,是否真的优于精心设计的简单基线方法?为此,研究者设计了全面的基准测试框架,涵盖双重扰动(double perturbation)和单扰动(single perturbation)预测任务。

研究方法与实验设计

双重扰动预测基准测试

研究者首先评估了模型预测双重扰动后表达变化的能力。研究使用了 Norman 等人2019年发表于 Science 的数据集,该数据集通过 CRISPR 激活系统(CRISPR activation system)在 K562 细胞中上调了100个单独基因和124对基因组合。研究对象的表型(phenotype)数据为对数转换后的 RNA 测序表达值,覆盖19,264个基因。

实验流程如下:研究者将100个单扰动和随机选择的62个双重扰动作为训练集(training set),用于微调(fine-tune)各个模型,剩余62个双重扰动作为测试集(test set)。为增强结果的稳健性,使用不同的随机划分重复了五次分析。评估指标为预测值与观测值之间的 L2 距离(L2 distance),主要关注1,000个最高表达基因,同时也检验了 Pearson delta 度量和其他基因子集的 L2 距离。

研究中设置了两个简单基线:一是“无变化”模型(‘no change’ model),始终预测与对照组相同的表达值;二是“加性”模型(‘additive’ model),对每个双重扰动预测其个体对数倍数变化(logarithmic fold changes, LFCs)之和。这两个基线均不使用双重扰动训练数据,体现了极简设计理念。

被测试的深度学习模型包括:scGPT、scFoundation、UCE、scBERT、Geneformer,以及 GEARS 和 CPA。其中 UCE、scBERT 和 Geneformer 并非为扰动预测任务专门设计,研究者通过将其与线性解码器(linear decoder)结合,将细胞嵌入(cell embedding)映射到基因表达空间来重新利用它们。

此外,研究者还系统评估了模型预测遗传相互作用的能力。其操作化定义为:双重扰动表型与加性期望值的差异超过零模型(null model)下正态分布预期的程度。在全数据集中,研究者以5%的错误发现率(false discovery rate)识别出5,035个遗传相互作用。他们计算了每个模型的310,000个预测值与加性期望值的差异,通过改变阈值 d,绘制了真阳性率(true positive rate, TPR)与错误发现比例(false discovery proportion)的关系曲线。

相互作用被进一步分类为“缓冲”(buffering)、“协同”(synergistic)或“相反”(opposite)类型。若两个单独扰动的 LFCs 同号,其相互作用分类为:若 LFC 介于0与加性期望值之间为缓冲,超过加性期望值为协同,符号与单独扰动相反则为相反类型。

单扰动预测基准测试

在评估模型预测未见单扰动效应的能力时,研究者使用了三个数据集:Replogle 等人发表于 Cell 的两个 CRISPR 干扰(CRISPR interference)数据集(K562 和 RPE1 细胞系),以及 Adamson 等人2016年发表于 Cell 的 K562 细胞数据集。

研究者设计了一个简单线性模型(linear model)作为基线。该模型将每个读出基因(read-out gene)表示为 k 维向量,每个扰动表示为 l 维向量,分别收集在矩阵 G 和 P 中。G 和 P 可从训练数据的降维嵌入获得,也可由外部来源提供。给定训练集基因表达数据矩阵 Y_train,通过最小化 ||Y_train - (GWP^T + b)||²₂ 求得 k×l 矩阵 W,其中 b 为 Y_train 的行均值向量。在本文修改期间,另有预印本提出了更为简单的基线方法,即始终预测训练集所有扰动的总体均值,研究者也将其纳入比较。

研究未纳入 scFoundation,因其要求每个数据集与预训练数据基因完全匹配,而 Adamson 和 Replogle 数据中大部分所需基因缺失。CPA 因不具备预测未见扰动效应的能力而被排除。

研究还检验了外部嵌入的效用:从 scFoundation 和 scGPT 提取基因嵌入矩阵 G,从 GEARS 提取扰动嵌入矩阵 P,将其装配到线性模型中评估性能。特别地,研究者还测试了使用 Replogle 数据预训练的 P 进行跨细胞系迁移学习的表现。

主要研究结果

双重扰动预测结果

所有模型的双重扰动预测误差均显著高于加性基线模型(图1a)。最佳的加性模型 L2 距离为4.7,R² 达0.93,而表现最好的深度学习模型 scFoundation 的 L2 距离为4.4,R² 为0.79。以 CEBPE+CEBPB 基因为例的散点图(图1b)清晰展示了各模型预测值与观测值的对应关系。

在遗传相互作用预测方面,没有任何模型优于“无变化”基线(图1c)。所有模型主要预测缓冲相互作用,而极少预测协同相互作用,且那些预测正确的协同相互作用更为罕见(图1f)。在组成分析中,观测到的相互作用中2.3%为缓冲、0.6%为协同。

研究者还发现一个异常现象:hbg2 和 hbz 这对血红蛋白基因频繁出现在各模型和各双重扰动的最高预测相互作用列表中(扩展数据图5)。除 Geneformer 和 scFoundation 外,所有模型对这两个基因的双重扰动预测 LFC≈0,类似于“无变化”基线,尽管它们单独扰动时效应显著(扩展数据图6)。更广泛地,scGPT、UCE 和 scBERT 对大多数基因的预测在不同扰动间几乎不变异,GEARS 和 scFoundation 的变异也远小于真实情况(扩展数据图7)。

单扰动预测结果

在预测未见单扰动效应方面,无论 L2 距离还是 Pearson delta 度量,都无一深度学习模型能持续超越均值预测或线性模型基线(图2a)。然而,当线性模型装配从 GEARS 获取的扰动嵌入或从 scFoundation/scGPT 获取的基因嵌入时,其性能可媲美甚至超越原始深度学习模型的内部解码器(图2c)。线性模型装配 scFoundation 和 scGPT 的基因嵌入可超越“均值”基线,但未持续超越使用训练数据自身 G 和 P 的线性模型。

最持续超越所有其他模型的方法是:采用在 Replogle 数据上预训练的 P 的线性模型(K562 细胞系数据作为 Adamson 和 RPE1 数据的预训练来源,RPE1 细胞系用于 K562 数据)。预测准确性在 K562 与 RPE1 间表达模式更相似的基因上更高(扩展数据图9)。这些结果表明,在单细胞图谱数据上的预训练仅带来超随机的微小收益,而在扰动数据上的预训练则真正提升了预测性能。

研究结论与科学价值

本研究的结论清晰而重要:当前的基础模型在基因扰动效应预测任务上未能超越特意设计的极简线性预测模型,尽管深度学习模型的微调过程消耗了显著的计算资源(扩展数据图10)。这些简单基线无法表征真实的生物学复杂性,却未被基础模型超越,说明基础模型提供可泛化细胞状态表征并预测未执行实验结果的目标仍遥不可及。

本研究与先前评估基础模型在其他任务上性能的基准测试结果一致,均发现相较于简单方法的收益可忽略不计。自本文预印本发布以来,多个后续基准测试研究进一步证实了深度学习模型难以超越简单基线的结论。

科学价值方面,该研究凸显了在指导和评估方法开发过程中进行批判性基准测试(critical benchmarking)的极端重要性。通过设置合理且具有挑战性的基线,研究揭示了当前深度学习模型在扰动预测领域的真实能力边界,为未来的方法改进指明了方向。

研究亮点与创新点

本研究的主要亮点体现在以下几个方面:

首先,基准测试设计的严谨性和全面性。通过纳入双重扰动和单扰动两类任务、多种评估指标、五个重复实验,研究确保了对模型性能的全面评估。遗传相互作用预测功能的引入更增添了评估维度的丰富性。

其次,基线设计的巧妙性。“无变化”和“加性”模型并非随意选择,而是与生物学实际密切相关的合理基准。加性模型实质上代表了一种“无遗传相互作用”的零模型,其优越表现提示当前深度学习模型可能尚未有效捕获非线性遗传相互作用。

第三,线性模型框架的灵活性。通过可替换 G 和 P 矩阵的设计,研究实现了对外部知识嵌入效用的解耦评估,揭示了预训练数据性质对迁移学习效果的决定性影响。

第四,对模型行为的深度剖析。通过分析预测变异度、基因复用模式等细节,研究揭示了深度学习模型的一些非预期行为,如某些模型实质上退化为“无变化”基线。

该研究不仅为单细胞扰动预测领域提供了全面的基准测试框架,更通过严谨的证据表明,简单方法的竞争性表现应当促使研究者重新审视基础模型在特定生物学任务中的实际增益,推动社区建立更严格的评估标准。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com