分享自:

利用GEARS预测新型多基因扰动的转录结果

期刊:nature biotechnologyDOI:10.1038/s41587-023-01905-6

这是一篇原创研究论文,以下是相关学术报告:

作者与发表信息

本研究由斯坦福大学(Stanford University)的Yusuf Roohani、Kexin Huang和Jure Leskovec完成。Yusuf Roohani来自生物医学数据科学系(Department of Biomedical Data Science),Kexin Huang和Jure Leskovec来自计算机科学系(Department of Computer Science)。该研究于2023年8月17日在线发表,并于2024年6月正式刊登在《自然·生物技术》(Nature Biotechnology)期刊第42卷第927至935页。

研究背景与目的

理解细胞对遗传扰动(genetic perturbation)的转录响应是众多生物医学应用的核心,例如识别与癌症相关的遗传相互作用,以及开发再生医学的方法。然而,由于可能的多基因扰动组合数量呈组合爆炸式增长,实验验证受到严重限制。现有计算方法存在明显局限:主流方法依赖从基因表达数据集推断基因调控网络(gene regulatory network),但这类网络难以准确推断或不够完整;较新的深度学习方法虽然有所改进,但仍然要求组合中的每个基因都曾被实验扰动过,无法预测包含全新扰动基因的组合效应。为此,本研究提出了“图增强基因激活与抑制模拟器”(graph-enhanced gene activation and repression simulator, GEARS),旨在整合深度学习与基因关系知识图谱,预测单基因和多基因扰动的转录响应,特别是预测那些包含从未被实验扰动过的基因的组合效果。

研究方法与工作流程

GEARS的核心架构包含五个主要步骤。第一步,为未扰动状态下的每个基因初始化两个独立的多维嵌入向量(embedding):一个是基因嵌入(gene embedding),用于捕捉基因的关键特征;另一个是基因扰动嵌入(gene perturbation embedding),用于表征扰动效应。第二步,将这些嵌入向量作为节点特征,分别放入两个关系图中。一个是基因共表达知识图谱(gene coexpression knowledge graph),基于基因间表达模式的相似性构建;另一个是基于基因本体(Gene Ontology, GO)的扰动关系图谱(perturbation relationship graph),利用GO中基因共享通路的信息构建。第三步,使用图神经网络(graph neural network, GNN)在这两个图中整合邻居节点的信息,以更新每个基因的基因嵌入和扰动嵌入。这种设计基于两个生物学直觉:表达模式相似的基因对外部扰动应有相似的响应,以及参与相似通路的基因在被扰动后应影响相似下游基因的表达。第四步,对于一个给定的扰动组合,通过“求和”组合算子(composition operator)将组合中所有基因的扰动嵌入合并,然后施加到每一个基因的基因嵌入上,生成“扰动后基因嵌入”(post-perturbation gene embedding)。第五步,通过一个跨基因解码器(cross-gene decoder)将这些扰动后基因嵌入转换为最终的预测基因表达值。具体而言,每个基因先通过其专属的解码器层生成一个标量效应值,接着将全转录组信息整合为一个“跨基因”嵌入向量(cross-gene embedding),再以此为条件,对每个基因的效应值进行修正,最终将预测的扰动效应向量叠加到一个随机采样的未扰动对照细胞的基因表达上,得到最终的扰动后基因表达谱。模型训练采用了一种自聚焦方向感知损失函数(autofocus direction-aware loss),该函数通过提高误差的指数权重来自动关注差异表达基因,并加入方向性损失以确保预测表达变化方向的准确性。此外,GEARS通过贝叶斯神经网络损失(Bayesian neural network loss)为每个基因的预测提供不确定性评分(uncertainty score),以衡量在未见过的扰动上预测的置信度。

主要研究结果

在预测单基因扰动转录响应方面,研究者使用了两套大规模的Perturb-seq数据集(分别包含来自RPE-1细胞的1,543个扰动和来自K562细胞的1,092个扰动,共测量超过170,000个细胞)进行评估。训练时,部分基因的扰动数据被完全保留作为测试集。结果显示,GEARS显著优于所有基线模型,包括“无扰动”模型、基于基因调控网络的线性传播模型以及一个现有的深度学习模型CPA。在只考虑前20个差异表达最显著基因的更具挑战性的任务中,GEARS的均方误差(mean squared error, M.S.E.)比最佳基线降低了30-50%。在评估所有基因的皮尔逊相关系数(Pearson correlation)时,GEARS在两种细胞系上的性能均提升了两倍以上。GEARS还能更准确地预测表达变化的方向,并成功将那些诱导相似转录响应的基因聚类,即使在训练期间未见过这些基因的扰动数据。

在预测多基因扰动结果方面,研究使用了一个包含131个双基因扰动的数据集。根据训练时模型中每个基因是否曾被单独扰动过,将双基因扰动分为三种难度递增的泛化场景:组合中两个基因都见过(0 unseen)、一个基因未见过(1 unseen)和两个基因均未见过(2 unseen)。结果显示,GEARS在所有场景下的表现均提升超过30%,特别是在两个基因均未见过的最高难度场景下,改善幅度达到了53%。在基因水平的分析中,GEARS能够准确预测包含未见基因的组合扰动趋势和幅度,并且其预测结果与仅扰动已见基因的单基因效应不同,展示了模型真正学习到组合效应的能力。GEARS预测所得差异表达基因与真实差异表达基因的Jaccard相似度也提升了50%。

在预测非加性遗传相互作用(genetic interaction)方面,研究定义了五种亚型:协同作用(Synergy)、抑制作用(Suppression)、新形态(Neomorphism)、冗余(Redundancy)和上位效应(Epistasis)。当组合中两个基因均被单独扰动过时,GEARS预测的遗传相互作用得分与基于真实表达计算的地面真值得分的相关性远优于现有方法,如在协同作用、新形态和冗余上决定系数(r²)约为0.4,而CPA模型则约为0.0。在识别新型遗传相互作用的实际应用中,GEARS在预测排名前10的精度(precision@10)上,对于五种遗传相互作用亚型中的四种,比基线方法高出40%以上;在冗余和上位效应亚型上,提升幅度超过90%。同时,它在预测最强相互作用的任务上,准确度是先前方法的两倍。

为探索新的生物学表型,研究者应用GEARS预测了102个基因的所有5,151个成对组合扰动结果。对预测的扰动后表达谱进行降维聚类分析,不仅重现了训练数据中已知的多个表型簇(如促生长因子簇、红系标志物簇、巨核细胞标志物簇、粒细胞标志物簇等),还发现了一个在训练数据中未被观察到的新表型簇,该簇显示了极高的红系标志物表达。通过与人类细胞图谱中的原红细胞数据对比,证实了这一预测表型的生物学合理性,展示了GEARS发现新表型的能力。此外,基于所有成对组合的预测结果,研究者构建了一个多维遗传相互作用图谱,该图谱可以同时呈现五种不同类型的遗传相互作用,揭示了许多基因,特别是功能相关基因之间,呈现出强烈的特定相互作用趋势,例如参与早期红系分化通路的基因PTPN12、IKZF3和LHX1之间表现出一致的强协同作用。这套预测在已发表的细胞适应性筛选数据上得到了部分交叉验证。

研究结论与价值

GEARS通过独特地整合先验生物学知识图谱与深度学习,首次实现了对包含从未被实验扰动过的基因在内的多基因组合的转录结果预测。该方法不仅能准确预测单基因和多基因扰动后的基因表达谱,还能精准检测和分类多种类型的非加性遗传相互作用,并预测出训练数据之外的新生物学表型。其科学价值在于为系统性地探索海量组合扰动空间提供了一个强大的计算引擎,突破了实验手段通量的瓶颈。在应用价值上,GEARS能够指导扰动实验的设计,优先推荐信息量最大的扰动组合,从而降低实验成本;有助于发现协同作用的基因对以增强联合治疗的效果;还能辅助设计用于改造细胞身份的基因组合,例如在再生医学中优化将诱导多能干细胞重编程为特定细胞类型的转录因子组合,或改造免疫细胞以防止其在肿瘤治疗中耗竭。

研究亮点

本研究的主要亮点包括:第一,GEARS独特的能力在于能够预测包含从未被实验扰动过的基因的组合效应,这是对现有方法学局限性的重大突破,其关键在于创新性地引入了基于基因本体(GO)的扰动关系图。第二,该方法能同时区分并预测五种不同类型的遗传相互作用,而传统的遗传相互作用图谱通常只关注协同或缓冲效应,GEARS提供的多维图谱能更全面、更丰富地描绘基因间复杂的功能关系。第三,GEARS不仅能复现已知表型,还能预测出全新的、具有生物学意义的扰动后表型,显示出其在发现未知生物学上的潜力。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com