分享自:

中国人群免疫多组学图谱:构建、调控网络与疾病关联分析

期刊:scienceDOI:10.1126/science.adt3130

由中国科学家团队主导完成的一项大规模多组学研究,构建了首个针对中国人群的免疫细胞多组学精细图谱,相关成果以《Chinese immune multi-omics atlas》为题于2026年1月8日发表于国际顶级学术期刊 *Science*。该研究由曹亚南(Ruijin Yangtze River Delta Health Institute)、徐讯(BGI Research)、刘龙奇(BGI Research/山西医科大学)、金鑫(BGI Research)、刘传宇(BGI Research/山西医科大学)担任通讯作者,殷建华、郑宇辉、黄琢理、周雯雯、袁月、蔡鹏飞、白勇等多位研究人员作为共同第一作者,联合了来自深圳华大生命科学研究院、中国科学院大学、山西医科大学、华南理工大学、浙江大学、西湖大学、新加坡国立大学、复旦大学、中国科学院生物物理研究所等国内外数十家科研机构的众多学者共同完成。

这项研究属于免疫学与基因组学的交叉前沿领域。人类免疫系统具有高度异质性,这种差异受到遗传和非遗传因素(如年龄、性别)的共同影响,并与众多免疫相关疾病的发生密切相关。深入理解调控免疫变异的遗传机制,对于揭示疾病易感性至关重要。单细胞基因组学技术的发展,为在单个细胞分辨率下绘制这些遗传效应图谱提供了可能。然而,此前该领域进展受到两大瓶颈的限制:一是缺乏大规模的单细胞染色质可及性测序数据集;二是现有资源严重偏向欧洲 ancestry(祖先来源)人群,缺乏针对中国人群的系统性资源。因此,研究团队启动了“中国免疫多组学图谱”项目,旨在填补这些空白,为中国人群免疫系统的调控架构解析提供一个基础性资源。

研究流程严谨而系统,主要包含数据生成、细胞图谱构建、调控网络解析、遗传变异定位以及人工智能模型开发等多个关键步骤。

首先,研究团队建立了一个由428名20至77岁的中国健康成年人组成的自然队列,其中男性189名,女性239名。从每位参与者采集的外周血单个核细胞中,研究者分别进行了大规模的单细胞RNA测序和单细胞染色质可及性测序。经过严格的质量控制和双联体去除,最终获得了6,484,974个高质量scRNA-seq(单细胞RNA测序)细胞和3,762,242个高质量scATAC-seq(单细胞转座酶可及染色质测序)细胞。同时,对参与者进行了全基因组测序以获取基因型信息,并收集了血浆脂质组、代谢组和血液生化指标等多维度数据,构建了一个全面的多组学资源库。

其次,为了系统注释免疫细胞类型,研究者采用了迭代降维和聚类方法,建立了一个包含四个层级(L1-L4)的层次化注释体系。最终在L4层级上,精细定义了73个转录组学上 distinct(独特)的免疫细胞类型,包括多种罕见细胞类型。通过整合scRNA-seq和scATAC-seq数据,确保了两种模态数据细胞簇的良好对齐和一致性。多组学因子分析揭示了与年龄和性别相关的分子及细胞比例变化模式。例如,年龄增长与特定单核细胞和CD4+ T细胞亚群比例增加相关,而性别差异则体现在特定细胞亚群比例和代谢物水平上。

第三,为了解析基因调控机制,研究团队利用scATAC-seq数据绘制了338,036个候选顺式调控元件图谱。通过整合染色质可及性图谱与基因表达数据,构建了增强子驱动的基因调控网络。该网络连接了84,625个调控区域与13,645个靶基因,形成了404个增强子连接的调控单元。研究者从中筛选出237个高质量的调控单元,并识别出不同免疫细胞类型特异性的关键转录因子,例如B细胞中的PAX5、单核细胞中的SPI1、T细胞中的RUNX3等。此外,研究还揭示了转录因子活性随年龄变化的动态模式,例如在CD8+ T细胞中,EOMES、RUNX3等转录因子的活性与年龄呈正相关。

第四,研究的一个核心是定位细胞类型分辨率的数量性状位点。利用个体水平的伪批量数据,研究团队在69种细胞类型中进行了顺式表达数量性状位点作图,在42种细胞类型中进行了顺式染色质可及性数量性状位点作图。研究共鉴定出9,600个egenes(表达数量性状基因)和52,361个capeaks(染色质可及性数量性状峰),其中分别有28.84%和55.19%是细胞类型特异性的,凸显了基因调控架构的细胞类型特异性。研究还检测到84个跨染色体的trans-egenes(反式表达数量性状基因)。通过比较分析,研究发现CIMA队列检测到的cis-egenes数量超过欧洲人群队列OneK1K,这主要得益于CIMA中每个样本的平均细胞数更高。此外,研究追踪了B细胞和单核细胞分化轨迹上的动态eQTLs(表达数量性状位点),发现部分遗传变异的效应大小会随着细胞分化状态的变化而改变。

第五,为了探究遗传调控与免疫性状及疾病的潜在联系,研究团队将上述xQTL(分子数量性状位点)结果与全基因组关联研究数据相结合,进行了基于汇总数据的孟德尔随机化分析。该分析旨在寻找变异-基因/染色质可及性峰-性状三者之间的多效性关联。研究在68种免疫细胞类型中发现了1196个显著的SMR关联,涉及833个变异、138个egenes、280个capeaks和68个性状。其中73.2%的关联仅在单一细胞类型中显著,表明细胞类型特异性调控非常普遍。

研究揭示了许多具有生物学意义的例子。例如,变异rs34415530在CD4+ FOXP3+ 调节性T细胞中特异性影响IKZF4基因的表达,进而介导了对血液中IL-12b蛋白水平和哮喘易感性的多效性影响。这提示该变异可能通过削弱Treg细胞的功能,影响树突状细胞的活性,从而调控细胞因子水平和疾病风险。另一个例子是变异rs2235922,它在经典CD14+单核细胞中特异性上调PADI2基因的表达,并与类风湿关节炎风险正相关,为理解该疾病的遗传机制提供了新的细胞类型特异性视角。研究还发现了跨多种细胞类型共享的调控关联,例如变异rs10946216与B细胞和树突状细胞中CCR6基因的表达以及类风湿关节炎风险相关。

第六,作为方法学上的创新,研究团队开发了CIMA-CLM,一个整合了染色质序列信息和单细胞基因表达数据的细胞类型特异性语言模型。该模型采用双分支架构:一支利用预训练的HyenaDNA模型将501bp的染色质序列编码为DNA嵌入向量;另一支利用预训练的scGPT模型从单细胞基因表达数据中生成细胞嵌入向量。两个嵌入向量再经过额外的Transformer编码器和融合解码器的整合,最终用于预测染色质可及性。在32种有足够数据的细胞类型上进行评估,模型预测的染色质可及性信号与实验观测的scATAC-seq谱图高度一致,中位皮尔逊相关系数范围在0.7661至0.9612之间,显示出优异的预测性能。该模型还能通过计算机模拟诱变,评估非编码变异对染色质可及性的功能影响,为解析疾病相关位点的机制提供了有力工具。

该研究的结论是:CIMA项目构建了一个全面的人口规模免疫多组学资源,解析了中国人群免疫系统细胞类型特异性的调控架构。它不仅提供了一个精细的参考图谱,还建立了一个整合遗传变异、多组学分子表型和疾病风险的分析框架,极大地深化了我们对人类免疫多样性遗传基础的理解。

本研究的亮点在于:1. 规模与代表性:针对中国人群,构建了迄今为止最大的单细胞多组学免疫图谱之一,涵盖了超过1000万个细胞,弥补了该领域资源偏差。2. 多组学整合深度:平行生成并深度整合了scRNA-seq、scATAC-seq、WGS(全基因组测序)及血浆生化等多层数据,实现了从序列到表型的多维度解析。3. 细胞分辨率与特异性:精细定义了73种免疫细胞类型,并在此基础上绘制了细胞类型特异性的基因调控网络和遗传效应图谱,发现了大量先前未被揭示的细胞类型特异性调控事件。4. 机制与疾病关联:通过SMR分析,将细胞类型特异性的分子QTL与循环蛋白水平和疾病风险直接联系起来,提出了多个具有潜在因果机制的假设,如IKZF4在Treg细胞中调控哮喘风险的范例。5. 方法学创新:开发了CIMA-CLM这一新型人工智能模型,成功整合序列与表达信息预测染色质可及性,并用于评估非编码变异功能,为计算基因组学提供了新工具。

此外,该研究产生的所有数据资源,包括单细胞表达矩阵、染色质可及性信号、细胞类型标记、差异表达基因、基因调控网络以及细胞类型分辨率的QTL汇总统计数据等,均已通过CIMA门户网站公开,为全球科研人员开展免疫相关研究,特别是针对中国人群的疾病研究,提供了宝贵的公共资源。尽管研究存在一些局限性,例如scRNA-seq和scATAC-seq数据来自同一血液样本的不同细胞 aliquot(等分样本)而非同一细胞,可能为调控网络推断带来些许复杂性,但研究团队通过严格的质量控制和稳健的整合策略已最大程度降低了潜在影响。未来,采用能在同一细胞内同时检测多种组学模态的技术将进一步验证和完善这些发现。总体而言,CIMA研究是精准医学和群体基因组学领域的一项重要里程碑式工作。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com