本文献类型为 类型a,以下是根据其内容生成的中文学术报告。
本研究由来自加州大学伯克利分校(University of California, Berkeley)的 Chenling Xu、Romain Lopez、Edouard Mehlman 等多位研究人员共同完成(其中前三者为共同第一作者),通讯作者为 Nir Yosef 教授,其所属单位包括加州大学伯克利分校电气工程与计算机科学系及计算生物学中心等。该研究成果于 2021年 发表在 Molecular Systems Biology 期刊上。
随着单细胞转录组学(single-cell transcriptomics)技术的飞速发展,公开可用的数据集呈指数级增长,促使了如人类细胞图谱(Human Cell Atlas)等大规模计划的诞生。该领域自然演进的下一个关键步骤,是将来自不同组织或疾病模型的众多数据集进行整合(harmonization),以增强统计稳健性,实现研究间的一致性和可重复性,并最终建立关于细胞状态与类型的通用本体论(common ontology)。
实现这一目标面临两大核心挑战:数据协调(data harmonization) 和自动化细胞状态注释(automated cell state annotation)。数据协调旨在整合两个或以上转录组学数据集,以消除因技术、实验室、样本处理等非生物学因素带来的批次效应。然而,现有方法存在局限性:早期基于线性模型的方法不适用于具有异质性细胞群体的样本;而新兴的非线性策略虽然在数据对齐方面有效,但其对齐过程缺乏概率可解释性,且容易导致过度校正(over-normalization)。在自动化注释方面,传统方法或依赖于可能缺失的标记基因,或采用易受批次效应影响的分类器,无法高效利用多个数据集的标签信息。
针对上述问题,本研究旨在展示其先前开发的 scVI(single-cell Variational Inference)方法在数据协调和基于协调的注释任务上的卓越性能,并进一步开发了一种名为 scanVI(single-cell annotation using Variational Inference)的新型半监督深度生成模型,以概率性方式整合和注释单细胞数据,解决现有方法的可扩展性、适应性和不确定性量化等问题。
本研究构建了一套基于变分推断(variational inference)和神经网络的全概率生成式框架,其工作流程和模型架构如下:
1. 模型构建与核心原理 研究首先将多个经过标准基因筛选的 scRNA-seq 数据集合并为一个大矩阵,其中每个条目表示基因 g 在细胞 n 中的表达量 xng,并记录每个细胞的数据集来源 sn 及部分可用的细胞类型注释 cn。
xng 在给定数据集标识符 sn 和两个潜在随机变量(latent random variables)——代表捕获效率和测序深度的 ln 和代表生物差异的低维向量 zn——的条件下,服从零膨胀负二项分布(zero-inflated negative binomial, ZINB)。通过显式地以数据集标识符为条件,scVI 能有效控制技术性偏差,其推断出的潜在空间 zn 可直接用于数据协调。cn 来指导 zn 的推断,scanVI 对 scVI 的模型结构进行了精细化扩展。在 scanVI 的生成模型中,zn 不再服从简单的标准正态分布,而是由一个混合模型生成:首先,细胞类型 cn 服从一个多项分布;其次,引入一个新的潜在变量 un 来描述细胞类型内部的进一步生物学变异。然后,zn 由 cn 和 un 共同通过神经网络参数化生成。这使 scanVI 成为一个半监督学习算法,能够同时处理有标签和无标签的细胞。2. 近似后验推断与训练 由于精确的贝叶斯计算不可行,研究采用由神经网络参数化的变分推断来近似后验分布。模型通过最大化证据下界(ELBO)来优化神经网络参数和逆离散参数,并使用 Adam 优化器进行随机梯度下降。训练时,对离散变量进行解析积分,对连续变量使用重参数化技巧(reparametrization trick)。值得一提的是,研究在整个评估过程中为所有数据集固定了一套相同的超参数,证明了该方法只需极少的调参即可应用。
3. 评估策略与数据集 研究通过一系列全面的基准测试来评估模型,包括: - 数据协调评估:使用批次混合熵(entropy of batch mixing) 衡量不同数据集细胞的混合程度,使用k-最近邻纯度(k-nearest neighbors purity) 和聚类保留度(clustering preservation) 衡量原始生物学结构的保留程度。这两个指标存在权衡,需要综合考量。 - 自动化注释评估:通过隐藏一个数据集的标签并从另一个数据集迁移标签,使用加权准确率(weighted accuracy) 等指标评估标签预测的准确性,并利用蛋白质表达数据等外部元数据进行交叉验证。 - 下游分析验证:以差异表达分析(differential expression)为例,通过计算近似贝叶斯因子(Bayes factors)来评估模型的实用性。 测试数据集涵盖了多种技术平台(10x Chromium, Smart-seq2, InDrop, CEL-Seq2 等)、多种物种(人、小鼠)和不同组织(PBMC、骨髓、胰腺、大脑),样本量从几千到超过十万个细胞不等,并包括了模拟连续发育轨迹和跨物种整合的复杂场景。
1. 在多种场景下实现了卓越的数据协调 在包含相似生物学、不同技术、不同细胞类型组成的多个数据集对上的基准测试表明,scVI 和 scanVI 在批次混合熵和保留原始结构的权衡中,表现优于 Seurat alignment、MNN、Harmony、Scanorama 等现有方法。尤其在处理数据集的细胞类型仅部分重叠或完全不重叠的挑战性场景时,scVI 和 scanVI 能有效避免将不同细胞群体错误混合,而基准方法 Seurat 则显示出明显的过度混合。
2. 高效处理连续轨迹和跨物种数据 在造血作用连续发育轨迹的数据协调中,scVI 不仅能在共享分化路径上良好混合细胞,还能在数据集特有的终末分化群体处保持低混合度,精准反映生物学现实。将 scanVI 的离散标签应用于此连续场景,其性能同样与 scVI 相当。在跨物种(人和小鼠)的黑质脑区数据协调任务中,scVI 和 scanVI 亦表现出一致的优越性能。
3. 可扩展至大规模多数据集整合 将 scVI 应用于一个由 26 个数据集、105,476 个细胞组成的队列时,仅需不到 50 分钟(使用单个 NVIDIA Tesla K80 GPU 和 8 核 CPU)即可完成整合,而 Seurat 和 MNN 在更强大的硬件上需超过 24 小时。这不仅突显了 scVI 线性的时间复杂度,也证明了其处理大规模数据的可扩展性。
4. 在半监督注释任务中精度优越且稳健 - 标签迁移:在 PBMC 数据集中,通过比较 mRNA 协调空间与蛋白质水平的相似性,scanVI 推断的潜在空间相较于 scVI 和 Seurat 能更准确地反映细胞的真实生物学状态。 - 种子标签传播:在对仅有少量高置信度“种子”标记的 T 细胞亚群进行自动化注释时,scanVI 以 84%的准确率显著优于基于聚类或 k-最近邻的方法(约 71-74%),有效解决了因标记基因稀疏导致的注释难题。 - 层级分类:在包含 265 个精细亚型的小鼠神经系统数据集中,仅有 0.8%的细胞被标记。利用层级分类扩展的 scanVI 达到 37%的准确率,显著优于 scVI(32%)和 Seurat(23%)。
5. 支持概率性假设检验,对错误标记稳健 以差异表达分析为例,scVI 和 scanVI 能直接在协调后的联合数据上计算贝叶斯因子,避免了其他方法“先对齐、再分析”的非概率性局限。在模拟数据上,二者的结果与真实对数倍数变化(log fold change)的相关性显著优于传统方法 edgeR。更有价值的是,当引入高达 30%的随机错误标签时,scanVI 凭借其对标签不确定性的显式建模,在差异表达分析的准确性上表现出比 scVI 和 edgeR 更强的稳健性。
本研究有力地证明了 scVI 和 scanVI 构成了一个统一的、完全概率化的单细胞转录组学数据整合与分析框架。scVI 为大规模数据协调提供了准确、可扩展的解决方案。作为其半监督扩展,scanVI 在此之上原生地解决了机器学习中的标签迁移、不确定性量化和噪声标签等核心挑战,能灵活应对部分细胞被标注、标签存在层级结构等真实世界中普遍存在的复杂情况。
科学价值在于,该框架通过一个单一的生成模型直接将非线性的技术噪声控制和生物学信号解耦,为差异表达等下游分析任务提供了具有概率解释的统一模型,避免了多步骤分析中的信息丢失和误差累积。
应用价值在于,两个方法均通过 scvi-tools 软件包易于获取和使用,且展现出较小的超参数调优需求。该框架有望成为单细胞组学数据整合分析的标准工具,直接服务于人类细胞图谱等大规模科研项目,推动建立统一、可复现的细胞身份定义标准。