分享自:

组织学图像预测空间基因表达潜力的基准测试

期刊:Nature CommunicationsDOI:10.1038/s41467-025-56618-y

空间基因表达预测方法基准测试:从组织病理学图像到临床应用潜力的全面评估

一、 研究概述

本研究由悉尼大学(University of Sydney)、悉尼大学查尔斯·珀金斯中心(Charles Perkins Centre)、悉尼大学数学与统计学院(School of Mathematics and Statistics)、悉尼大学计算机学院(School of Computer Science)、健康数据发现实验室(Laboratory of Data Discovery for Health Limited, D24H)以及韦斯特米德医学研究所(The Westmead Institute for Medical Research)的研究人员共同完成。主要作者包括 Chuhan Wang, Adam S. Chan, Xiaohang Fu, Shila Ghazanfar, Jinman Kim, Ellis Patrick 和 Jean Y. H. Yang。该研究于2025年发表在《自然·通讯》(Nature Communications)期刊上。

二、 学术背景

研究领域: 本研究属于生物信息学、计算生物学和数字病理学的交叉领域,具体聚焦于利用深度学习模型从常规苏木精-伊红(Haematoxylin-and-Eosin, H&E)染色组织病理学图像预测空间转录组学(Spatially Resolved Transcriptomics, SRT)数据。

研究动机与背景知识: 空间转录组学技术能够量化组织空间坐标上的基因表达,为理解疾病的分子机制提供了前所未有的洞察。然而,SRT技术成本高昂,限制了其在常规临床实践中的直接应用。相比之下,H&E染色组织病理学图像成本效益高,是临床诊断的常规手段。近年来,利用配对的组织病理学图像预测空间基因表达(Spatial Gene Expression, SGE)的计算方法应运而生,旨在提升现有H&E图像的信息价值,从而促进大规模空间基因表达变异研究及生物标志物发现。

尽管已有多项预测方法在最近三年内被提出,但这些方法的性能尚未得到系统、独立的基准测试。现有的综述主要停留在方法调查和分类层面,缺乏全面的性能比较。不同方法由各自开发者使用不同的评估框架进行评价,导致难以客观比较其效能、稳定性和泛化能力。此外,对于预测结果在下游分析(如临床预后)中的潜在影响,也缺乏关键评估。

研究目标: 本研究旨在对现有的从H&E图像预测SGE的方法进行一次全面、公正的基准测试。评估不仅涵盖预测准确性,还扩展到模型泛化能力、临床转化潜力、用户友好性和计算效率等多个维度,为领域内的研究者和潜在用户提供方法选择的指导,并指出未来发展的方向。

三、 详细工作流程

本研究是一个系统的计算基准测试研究,不涉及湿实验,其核心工作流程包括以下几个关键步骤:

1. 方法选择与数据准备: * 方法纳入: 研究人员筛选了截至2024年1月已发表的、专门从H&E图像预测SGE(而非单细胞或批量RNA-seq)的十一种计算方法。这些方法包括:ST-Net, DeepSpace, Hist2ST, GeneEncoder, EGNV1, EGNV2, TCGN, THITOGENE, iStar, HistoGene 以及基于DeePPT架构复现的一个模型(因原DeePPT代码未公开)。选择标准基于方法的可用性、可执行性和明确的任务定义。 * 数据集: 使用了五个公开的SRT数据集进行内部训练和验证,包括两个基于Stahl et al.技术的较低分辨率数据集(HER2+乳腺癌和皮肤鳞状细胞癌CSCC)和三个10x Visium较高分辨率数据集(两个乳腺癌亚型和一个健康肾脏组织)。此外,使用癌症基因组图谱(The Cancer Genome Atlas, TCGA)的乳腺癌(BRCA)H&E图像和匹配的批量RNA-seq数据进行外部验证,以评估模型的泛化能力和临床转化潜力。 * 数据预处理: 对所有SRT数据,围绕每个测序点(spot)提取固定大小(多为224x224像素)的图像块(patch)。基因表达数据经过预处理,如筛选高变异基因(HVG)和去除低表达基因,形成用于模型训练的基因集(HER2+ ST: 785个基因;CSCC ST: 997个基因;Visium: ~990个基因)。TCGA图像被分割成小块并过滤掉空白区域。

2. 方法复现与统一训练框架: * 复现与调整: 对于每种方法,研究人员严格按照原论文描述或提供的代码进行复现。为确保公平比较,对部分方法的输入尺寸或参数进行了微调以适应统一的数据格式,但核心架构保持不变。例如,对于某些方法,将输入图像块尺寸从256x256调整为224x224。 * 训练策略: 对ST数据集采用4折交叉验证(Cross-Validation, CV),确保同一患者的不同组织切片位于同一折中,以防止数据泄露。在每折中,使用两折训练,一折验证(用于选择最佳训练轮次),一折测试。对于Visium数据,进行了跨研究评估(在一个Visium数据集上训练,在另一个上测试)以及将ST数据集训练的模型直接应用于Visium数据的跨分辨率评估。

3. 多维度评估体系构建与执行: 研究设计了一个包含五大类别、共计28项指标的综合性评估框架: * A. 基因表达预测性能: 在ST和Visium数据集的测试集上,计算预测SGE与真实SGE之间的皮尔逊相关系数(PCC)、互信息(MI)、结构相似性指数(SSIM)和曲线下面积(AUC)等指标。特别关注了对高变异基因(HVG)和空间变异基因(SVG)的预测性能,因为这些基因可能包含更重要的生物学信号。 * B. 模型泛化能力: 评估模型在未见过的独立数据上的表现。包括:1) 跨肿瘤亚型泛化(在Visium-HercepTest2+上训练,在Visium-HER2+上测试);2) 跨平台/分辨率泛化(在ST数据上训练,直接预测Visium数据);3) 在TCGA-BRCA H&E图像上的预测性能,通过计算预测的“伪批量”(pseudobulk,即所有预测点的平均)基因表达与真实批量RNA-seq表达之间的患者水平相关性来衡量。 * C. 临床转化潜力: 评估预测的SGE在模拟临床场景下的效用。1) 鲁棒性: 分析H&E图像质量(通过HistoQC工具计算的一系列质量控制指标)与预测性能之间的相关性,评估模型对输入图像质量的敏感度。2) 生存预后: 使用TCGA-BRCA数据,基于各方法预测的伪批量基因表达构建多变量Cox比例风险模型,预测HER2+、三阴性(TNBC)和管腔型(Luminal)乳腺癌亚型患者的生存风险。通过一致性指数(C-index)和Kaplan-Meier曲线对数秩检验的p值,与使用真实RNA-seq数据构建的基线模型进行比较。 * D. 用户可访问性(可用性): 根据既定的软件质量和编程指南,设计了一个评分方案,从软件可用性、代码质量、代码保障、文档、行为、论文、可重复性和泛化性等多个子类别对每种方法进行评分,满分为31分。 * E. 计算效率: 记录并比较了各方法在训练单个图像样本(HER2+ ST数据集中的样本A1)10个周期所需的时间和内存消耗。

4. 数据分析与结果整合: * 对所有评估指标的结果进行系统性的统计分析、可视化和排名。 * 通过层次聚类分析不同方法在基因特异性预测性能上的相似性,并将其与模型架构特征(如是否使用卷积神经网络CNN、Transformer、图神经网络GNN或范例学习)关联。 * 探究基因表达矩阵的稀疏性、组织异质性等因素对不同方法性能的影响。

四、 主要研究结果

1. 基因表达预测性能: * 在ST数据集上,所有方法的平均预测基因表达与真实值之间的PCC普遍较低(<0.25),这反映了从形态学图像中精确推断分子表达的固有挑战。 * EGNV2 在ST数据集的综合评估指标(PCC, MI, SSIM, AUC)上表现最佳,其利用范例(exemplar)引导预测的策略可能有助于减少全局噪声。 * 当聚焦于高变异基因(HVG)和空间变异基因(SVG) 时,大多数方法的预测相关性显著提高。例如,DeePPT在Visium-肾脏数据集上对HVG和SVG的预测PCC分别达到0.45和0.47,表现突出。这表明评估应更关注具有生物学意义的基因,而非所有基因的平均性能。 * 基于CNN架构、专注于单点图像块特征提取的方法(如DeePPT, ST-Net)在组织异质性较低的数据(如健康肾脏)上表现更好,而整合了全局或邻域空间信息的方法(如使用Transformer或GNN的方法)在此类数据上优势不明显,甚至可能引入噪声。

2. 模型架构与性能关联: * 层次聚类分析显示,具有相似架构的方法在基因预测性能上表现出聚类模式。例如,EGNV2、ST-Net和DeePPT(均主要依赖CNN处理单点图像块)聚在一起,且整体预测性能较好。 * 复杂的、包含多个组件(如同时使用CNN、Transformer、GNN)的深度学习架构在本研究评估的任务中并未显示出显著优势。专注于有效提取单点图像块内局部和全局特征的方法更具竞争力。 * 数据预处理(如归一化方式)的差异也会显著影响特定基因的预测性能。

3. 空间分辨率与数据稀疏性的影响: * 许多方法在从低分辨率ST数据训练后,直接应用于高分辨率Visium数据时表现不佳,凸显了跨平台/分辨率泛化的挑战。 * 基因表达矩阵的稀疏性(零值比例)影响模型训练。Visium数据通常比ST数据基因表达更密集(零值少),导致部分方法(如Hist2ST, THITOGENE)在训练时遇到困难(如收敛问题或过拟合)。选择高稀疏性基因(HSG)进行训练可以缓解此问题,但并未普遍提升整体预测性能。

4. 临床转化潜力评估结果: * 图像质量鲁棒性: HistoGeneHist2ST 的预测性能与H&E图像质量指标的相关性最低(r分别为0.05和0.19),表明它们对输入图像质量的变化更稳健,这可能得益于其工作流程中包含的图像归一化步骤。而DeePPT 的表现则高度依赖于图像质量(r=0.53)。 * 独立队列泛化性: 在TCGA-BRCA外部验证中,HistoGene, EGNV2DeepSpace 在预测伪批量基因表达与真实批量RNA-seq表达的患者水平相关性上表现最佳(均值约0.52-0.53),表明这些方法能够从新的H&E图像中捕获有意义的基因表达趋势。 * 生存预后效用: 在使用交叉验证的严谨设置下,基于预测基因表达的生存模型区分高风险和低风险患者的能力有限。仅在HER2+亚型中,DeepSpace, Hist2STST-Net 的模型达到了边界显著性(p值约0.03-0.07)。这表明,虽然预测的SGE显示出一定的临床关联信号,但其用于生存预测的稳健性仍需大幅提升。研究指出,当前方法仅使用了伪批量表达(丢失了空间信息),未来探索利用空间信息本身进行生存预测可能是一个方向。

5. 可用性与计算效率: * 可用性评分: Hist2ST 获得了最高的可用性总分(18.83/31),其次是THITOGENEHistoGeneDeePPT 因代码未公开得分最低。普遍存在的薄弱环节包括:缺乏单元测试、代码保障不足、需要用户具备较多领域知识才能运行、教程有限、以及将模型应用于新数据时常常需要用户编写新代码。 * 计算效率: 不同方法在训练时间和内存消耗上差异显著,这为资源受限的用户提供了选择依据。

五、 结论与意义

本研究通过迄今为止最全面的基准测试,系统评估了从H&E组织病理学图像预测空间基因表达的各种方法。研究得出结论:目前没有一种方法在所有评估类别中均表现最优。不同的方法在预测准确性、泛化能力、鲁棒性、临床实用性和易用性上各有优劣。

研究的科学价值与应用价值: 1. 提供了客观的选型指南: 为生物学家、病理学家和生物信息学研究人员在选择适合其特定需求(如更注重预测精度、还是更注重易用性和泛化能力)的工具时提供了基于实证的决策依据。 2. 指明了领域发展现状与挑战: 研究揭示了该领域当前的关键瓶颈,例如:跨平台/分辨率泛化能力不足、对图像质量敏感、在严谨的交叉验证下临床预测性能有限、以及大多数方法的可用性亟待提高。 3. 提出了更合理的评估范式: 研究论证了使用HVG和SVG而非所有基因的平均相关性作为主要评估指标更为合理,避免了低表达或零表达基因的噪声对整体评估的稀释效应。 4. 为未来方法开发指明方向: 研究建议未来工作应关注:整合H&E图像质量控制与标准化、深入理解哪些基因特性更易于从形态学预测、设计能更好处理不同数据稀疏性和分辨率的模型架构、开发能充分利用空间信息(而非仅伪批量表达)的下游分析流程,以及适应如10x Xenium等更高分辨率的新型空间转录组学技术。 5. 建立了可扩展的评估框架: 本研究提出的多维度评估框架(涵盖性能、泛化、转化、可用性、效率)可作为未来新方法评估的基准,促进该领域的标准化和健康发展。

六、 研究亮点

  1. 全面性与系统性: 这是首个对从H&E预测SGE的多种方法进行大规模、独立、多维度基准测试的研究,评估范围远超传统的预测准确性比较。
  2. 注重临床转化: 创新性地将评估延伸至模型鲁棒性、独立数据泛化能力和生存预测等临床相关场景,切实评估了这些计算工具的“落地”潜力。
  3. 深入的机制分析: 不仅报告了“谁更好”,还深入分析了“为什么”——通过关联模型架构、数据特性(如稀疏性、异质性)与性能表现,为理解方法优劣背后的原因提供了洞见。
  4. 强调可用性与可重复性: 将软件工程中的可用性评估引入生物信息学工具评价,突出了科研软件在实际应用中易用性和可维护性的重要性,并对代码可重复性进行了实战检验。
  5. 批判性视角与建设性建议: 研究对当前领域过于依赖全体基因平均相关性的评估标准提出了质疑,并倡导聚焦于生物学相关基因,为领域树立了更科学的评估标杆。

七、 其他有价值的内容

研究还观察到,利用预测的SGE进行空间聚类以识别组织区域时,基于预测结果的分区有时甚至优于基于真实SGE的结果。这暗示了预测模型可能从H&E图像中提取了额外的、互补的形态学特征,这些特征与基因表达空间模式相结合,能提供更全面的组织区域视图。这一发现值得进一步探索,可能开辟结合形态与分子信息进行组织分割的新途径。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com