RNA测序数据中基因计数归一化对基于主成分分析的探索性分析的影响
一、 研究团队与发表信息
本研究的作者是Henk J. van Lingen, Maria Suarez-Diez和Edoardo Saccenti*(通讯作者)。他们均来自荷兰瓦赫宁根大学的系统与合成生物学实验室。这项研究成果发表于爱思唯尔(Elsevier)旗下的期刊《BBA - Gene Regulatory Mechanisms》,发表时间为2024年8月16日,文章编号为195058。
二、 学术背景与研究目的
本研究属于生物信息学和计算生物学领域,具体聚焦于RNA测序(RNA-seq)数据的预处理与多变量分析。RNA-seq技术已成为生命科学研究的基石,能够高通量地测量基因表达水平。在RNA-seq数据分析流程中,归一化(Normalization)是一个至关重要的初始步骤,旨在校正由测序深度、基因长度、GC含量等实验和技术因素引入的偏差,以确保样本间的公平比较并更接近真实的生物学状态。
目前,关于归一化方法影响的讨论和评估,绝大多数集中在单变量分析的背景下,特别是差异表达基因分析。然而,基因表达水平之间由于共享的生物学过程和共调控而存在相关性,因此,采用主成分分析(Principal Component Analysis, PCA)等多变量探索性数据分析工具,能够更好地探索和量化基因与样本之间的关系,揭示数据中的潜在模式和结构。尽管PCA在RNA-seq数据分析中被广泛应用,但数据预处理(尤其是归一化)如何影响PCA模型及其生物学解释,却鲜有系统性的研究。在化学计量学和代谢组学文献中,数据预处理对PCA结果的影响已得到较多关注,但在RNA-seq领域,这一关键问题尚未得到充分重视。
鉴于PCA模型完全由数据的相关/协方差矩阵决定,而归一化会改变基因计数之间的相关性模式(正如先前在代谢物浓度研究中观察到的那样),因此,不同的归一化方法很可能对PCA的结果产生实质性影响。这种影响可能延伸到基于PCA模型(如通过载荷排名筛选重要基因)进行的下游生物学解释,例如通路富集分析。
因此,本研究旨在系统地探究归一化如何影响RNA-seq数据的PCA模型及其解释。研究团队考虑了12种广泛使用的归一化方法,并将其应用于模拟数据和三个真实的实验数据集,通过评估PCA模型的复杂性、样本在低维空间的聚类质量、基因在模型中的重要性排名,并结合通路富集分析,来全面评估归一化对基于PCA的探索性分析的影响。
三、 详细研究流程
本研究是一个计算分析研究,其工作流程严谨而系统,主要包含以下几个核心环节:
数据准备:
- 实验数据集:研究使用了三个公开可获取的RNA-seq数据集,均来自基因表达综合数据库(GEO)。
- 数据集1(肿瘤数据):来自口腔鳞状细胞癌研究,包含3名患者的3个肿瘤组织和3个正常组织样本,共计6个样本,涉及15,668个基因(过滤后为10,144个基因)。
- 数据集2(神经母细胞瘤数据):来自神经母细胞瘤细胞系研究,包含16个样本(4组不同处理),涉及27,037个基因(过滤后为14,619个基因)。
- 数据集3(结肠癌数据):来自结肠癌细胞系MIB1基因敲低研究,包含4个样本(2个对照,2个敲低),涉及60,676个基因转录本(过滤后为9,598个基因)。
- 模拟数据:为了在已知真实相关结构(无相关性)的情况下评估归一化是否引入虚假相关性,研究团队根据负二项分布模拟生成了一个包含100个样本和10,144个基因的计数矩阵,模拟参数基于肿瘤数据集的真实基因计数分布进行估计。
归一化方法应用: 研究系统评估了12种常用的归一化方法,涵盖了校正不同偏差来源的策略(如文库大小、基因长度、GC含量、读数分布等)。这些方法包括:总计数法(TC)、上四分位数法(UQ)、全分位数法(FQ)、修剪M值均值法(TMM)、相对对数表达法(RLE)、中心对数比法(CLR)、概率商法(PQN)、每千碱基转录本每百万映射读数法(RPKM)、每百万映射转录本数法(TPM)、以及针对GC含量的两种分位数归一化法(GCW, GCWB)和条件分位数归一化法(CQN)。所有归一化操作均使用R语言中的相应软件包(如edgeR、scone、cqn、EDASeq、kodama)完成。
数据分析流程: 对每个数据集(原始数据及12种归一化后的数据)执行以下分析:
- 相关性模式分析:计算并比较归一化前后基因间皮尔逊相关系数的分布特征,包括显著性比例、正负相关比例、符号变化比例以及相关系数大小分布。此外,使用协方差同步成分分析(Covariance Simultaneous Component Analysis, CovSCA)对来自所有归一化方法(及原始数据)的样本相关矩阵进行整体建模和可视化,以全面评估不同方法导致的相关系构相似性。
- 主成分分析:对所有数据(在PCA前进行单位方差缩放)执行PCA。评估每个PCA模型的复杂性(即解释大部分方差所需的主成分数量)。通过PCA得分图可视化样本在低维空间的分布,并使用轮廓宽度(Silhouette Width)定量评估基于已知实验条件(如肿瘤/正常、不同处理组)的样本聚类质量。
- 基因重要性评估与通路富集分析:对于每个PCA模型(使用前两个主成分),根据公式计算每个基因对模型的总体重要性(结合载荷和解释方差)。选取重要性排名前1000的基因,使用KEGG数据库进行通路富集分析(p值 cutoff = 0.10)。通过比较不同归一化方法下富集到的通路集合,评估归一化对生物学解释的影响。最后,使用非度量多维尺度分析(Non-metric Multidimensional Scaling, NMDS)对二值化的通路富集结果矩阵进行降维可视化,以综合展示不同归一化方法在生物学解释上的异同。
方法特殊性:
- CovSCA的应用:这是一种用于同时分析和比较多个协方差/相关矩阵的多元统计技术。本研究创新性地将其用于同时比较13个(12种归一化+原始数据)大型基因相关矩阵,从而在整体层面评估归一化对相关结构的影响。
- 基因重要性综合指标:研究采用了一个结合主成分载荷和对应特征值(解释方差)的指标来对基因进行整体重要性排序,这比单纯看单个主成分的载荷更能反映基因对多维模型的综合贡献。
- Procrustes旋转:为了考虑PCA解的方向不确定性(旋转自由度),研究对来自不同归一化数据的PCA载荷矩阵进行了Procrustes旋转对齐,以检验模型间的差异是否仅源于旋转,还是本质不同。
四、 主要研究结果
归一化对相关模式的影响:
- 在模拟数据(真实无相关)中,所有归一化方法均未引入统计上显著的虚假相关性(实际α水平与名义α水平0.05一致)。这与代谢组学数据中的发现不同,作者通过数学推导和示例说明,这种差异源于转录组数据极高的维度(基因数量巨大),高维特性抵消了归一化可能引入的虚假相关信号。
- 在真实实验数据中,归一化显著改变了基因间的相关性模式。例如,在肿瘤数据中,原始数据有23%的相关系数显著,而大多数归一化方法将此比例降低至10%以下(GCW除外)。更重要的是,相当大比例(4%到超过40%)的相关系数在归一化后符号发生了改变,这对于推断基因调控网络具有重要影响。GCW归一化对相关结构的扰动最小,而RPKM等方法扰动较大。CovSCA分析直观显示,对于肿瘤和神经母细胞瘤数据,原始数据与GCW归一化数据的相关模式最接近;而对于结肠癌数据,则有所不同。大多数其他归一化方法产生的相关模式彼此相似。
PCA模型复杂性与得分图:
- 不同归一化方法得到的PCA模型复杂性(解释大部分方差所需的主成分数)没有巨大差异。例如,对于肿瘤数据,前三个主成分通常能解释超过70%的方差,表明数据的有效降维不受归一化方法的显著影响。
- PCA得分图(样本聚类) 的表现因数据和归一化方法而异。
- 对于肿瘤数据,原始数据和GCW归一化数据的PCA图相似,但样本聚类效果不佳(平均轮廓宽度为负或接近零)。而其他多数方法(如TC, UQ, TMM, RLE, CLR, RPKM, TPM)显著改善了正常组织与肿瘤组织样本的分离,其中TPM方法获得了最高的平均轮廓宽度(0.52)。FQ、GCWB、PQN和CQN方法则在肿瘤样本内部聚类上表现更好。
- 对于神经母细胞瘤和结肠癌数据,也观察到了类似的现象,即不同归一化方法会导致样本在PCA空间中的相对位置和聚类紧密程度发生变化。这表明,虽然降维效果相似,但样本在低维空间中的具体格局(即哪些样本更相似)受到归一化选择的影响。
基因重要性排名与通路富集分析的差异:
- 这是本研究最关键的发现之一。尽管某些归一化方法可能产生相似的PCA得分图,但它们对应的PCA载荷(决定基因重要性)却可能大相径庭。通过比较不同归一化方法下排名前1000的重要基因集合,发现重叠度差异很大(从神经母细胞瘤数据中RPKM与TC的99%重叠,到结肠癌数据中原始数据与PQN的仅7.5%重叠)。Procrustes旋转分析证实,这种差异并非仅仅源于PCA解的旋转自由度,而是模型内在的不同。
- 这种基因重要性排名的差异直接导致了生物学解释的显著分歧。对排名前1000基因进行的KEGG通路富集分析显示,不同归一化方法富集到的通路集合存在明显不同。例如,在肿瘤数据中,UQ、GCWB和CQN等方法富集到了一些其他方法未富集到的独特通路。NMDS分析进一步综合证实,基于不同归一化方法得到的通路富集结果在“生物学解释空间”中分布在不同的位置,尤其是GCW、PQN和CQN的结果常常与其他方法分离。这意味着,选择不同的归一化方法,可能引导研究者关注完全不同的生物学过程和通路。
五、 研究结论与价值
本研究系统性地证明,RNA-seq数据的归一化处理会显著影响后续基于主成分分析的探索性数据分析及其生物学解释。尽管不同归一化方法可能产生视觉上相似的PCA得分图,但它们所对应的PCA模型(载荷结构)以及由此推导出的重要基因集合和通路富集结果可能存在巨大差异。归一化改变了基因间的相关性模式,这是导致PCA模型差异的根本原因。
研究的科学价值在于,它首次在多变量探索性分析的框架下,全面揭示了数据预处理(归一化)与下游生物学发现之间的紧密耦合关系,填补了该领域的研究空白。其应用价值在于为生物信息学分析人员提供了重要的方法论警示和实用建议:不能将归一化视为一个无关紧要或标准化的“黑箱”步骤,尤其是在使用PCA等探索性工具时。
基于研究结果,作者提出了以下关键建议: 1. 互补性验证:建议至少使用两种具有互补校正特性(同时处理样本内和样本间变异)的归一化方法,并比较分析结果。 2. 警惕结果不一致:如果不同归一化方法导致结果差异巨大,应视为警示信号,需检查数据质量、方法假设是否满足、实验设计或分析脚本是否存在问题。 3. 遵循简约原则:当多种方法给出相似结果时,优先选择原理和实现更简单的方法(如TPM),以简化解释并增强可重复性。 4. 避免“方法挖掘”:不应为了得到预期的分析结果(如特定的样本分离或通路富集)而反复尝试不同的归一化方法,这是一种形式的“p-hacking”,会损害科学发现的可靠性。 5. 多角度验证:应将多变量分析(如PCA)的结果与单变量分析(如差异表达分析)的结果视为互补,并相互验证。
六、 研究亮点
- 研究视角新颖:首次系统地将归一化对RNA-seq数据的影响评估,从传统的差异表达分析领域,拓展到多变量探索性分析(PCA)领域,揭示了后者同样深受预处理选择的影响。
- 分析全面系统:研究设计严谨,同时使用了模拟数据(控制真实相关结构)和多个具有不同特征的公开实验数据集,评估了12种主流归一化方法,并从相关性结构、PCA模型特性、聚类效果到最终的生物学解释(通路富集)进行了多层次、多角度的综合分析。
- 关键性发现:明确指出了“相似的PCA得分图可能掩盖完全不同的基因重要性排名和生物学解释”这一重要现象,挑战了仅凭得分图判断分析结果的常见做法。
- 方法应用创新:引入了CovSCA和Procrustes旋转等多元统计技术,用于系统比较相关矩阵和PCA模型,增强了分析的深度和说服力。
- 提出实用指南:不仅指出了问题,还基于证据提出了具体、可操作的数据分析建议,对领域内的最佳实践具有直接的指导意义。
七、 其他有价值的内容
研究还深入讨论了在PCA前进行数据缩放(如单位方差标准化)的必要性与潜在影响,指出缩放是为了防止高表达(通常也是高方差)基因主导PCA模型,但同时也承认基因本身的生物学变异携带重要信息。这种权衡的讨论体现了分析的深度。
此外,作者简要探讨了本研究的局限性及未来方向,例如未考虑批次效应校正方法对PCA的影响,以及归一化如何影响PCA模型的稳健性和稳定性(一个与样本量相关的开放性问题)。这些讨论为后续研究指明了潜在路径。