分享自:

人工智能预测的空间转录组学从病理学中解锁乳腺癌生物标志物

期刊:CellDOI:10.1016/j.cell.2026.04.023

从病理切片到空间转录组:AI驱动的乳腺癌生物标志物发现

研究概述

该研究由美国国家癌症研究所(NCI)癌症数据科学实验室的Eldad D. Shulman、Emma M. Campagnolo及Eytan Ruppin等人合作完成,于2026年7月9日发表在《Cell》期刊上。研究团队开发了一种名为“Path2Space”的深度学习模型,能够直接从常规的苏木精-伊红(hematoxylin and eosin, H&E)染色病理全切片图像中预测空间基因表达,为乳腺癌生物标志物的大规模发现提供了可扩展且低成本的解决方案。

学术背景与研究目的

空间转录组学(spatial transcriptomics, ST)技术通过绘制完整肿瘤组织内的基因表达图谱,正在革新我们对乳腺癌异质性的理解。该技术能够揭示肿瘤内异质性(intratumoral heterogeneity)和肿瘤微环境(tumor microenvironment, TME)的结构,例如与临床结果相关的巨噬细胞亚群、促进淋巴细胞浸润的趋化因子丰富血管微环境,以及HER2阳性乳腺癌中T细胞与巨噬细胞的空间互作等。然而,空间转录组学的高昂成本严重制约了其在大规模生物标志物发现与验证中的应用潜力。

鉴于ST数据通常与H&E图像配对生成,从H&E切片预测空间基因表达便成为了一种可扩展的替代方案。此前虽有研究尝试从H&E图像预测基因表达,但均局限于少数基因,无法应用于大规模临床队列的生存和治疗反应分析。为此,研究团队开发了Path2Space模型,旨在从病理切片中预测全基因组范围的空间表达模式,进而应用于乳腺癌患者的生存分层和化疗及曲妥珠单抗(trastuzumab)治疗反应的预测。

详细研究流程

1. 模型构建与训练

Path2Space模型的开发基于Bassiouni等人的10× Genomics Visium ST数据集,该数据集包含H&E图像及其匹配的基因表达谱(每个捕获斑点直径为55微米)。研究流程分为两大步骤。第一步是预处理,研究者在每个斑点周围提取图像瓦片(tile),采用Macenko方法进行颜色标准化(color normalization),并利用一个名为CTransPath的基础数字病理模型进行特征提取。第二步是回归建模,研究者训练了一个多层感知机(multilayer perceptron, MLP)神经网络,以每个斑点的图像特征为输入,预测其对应的14,068个基因的表达向量。预测目标采用了对数转换后的计数(log-transformed counts),因为实验证明此方案在基因预测和细胞类型特异性信号捕获方面均优于基于每百万计数(counts per million, CPM)的模型。

训练采用留一患者交叉验证(leave-one-patient-out cross-validation)框架,并结合集成预测(ensemble prediction)策略。模型训练完成后,研究者应用了空间平滑(spatial smoothing)技术以减轻ST数据的技术变异。该技术将每个斑点的预测表达值与其邻近斑点进行平均处理,同样的平滑程序也应用于测量值,以便进行公平的性能评估。

2. 外部验证与基准测试

模型在三个独立的外部ST验证队列上进行了评估:HEST(经QC后含4位患者的5个样本)、Martinez等人队列(4位患者的4个样本)和人类肿瘤图谱网络(Human Tumor Atlas Network, HTAN,7位患者的9个样本)。值得注意的是,尽管模型仅在新鲜冷冻(fresh frozen, FF)切片上训练,其在福尔马林固定石蜡包埋(formalin-fixed paraffin-embedded, FFPE)切片上的表现同样稳健。

为全面评估性能,研究团队将Path2Space与21种已发表方法进行了基准测试(benchmarking)。所有模型均在相同数据集上训练和评估,Path2Space凭借空间平滑技术在所有比较中均取得了最高的中位皮尔逊相关系数(Pearson correlation coefficient, PCC)。

3. 细胞类型推断与去卷积分析

为验证模型能否捕获细胞类型特异性表达模式并准确估计细胞丰度,研究者使用了两个互补数据集。Panoptils数据集包含来自151位患者的1,709个感兴趣区域(regions of interest, ROIs),提供了核级别病理学家标注,代表无配对ST的标准TCGA诊断切片。HEST数据集则提供斑点级别二元细胞类型标注及配对的Visium ST数据。

研究者采用两种方法验证Path2Space的细胞类型预测能力。首先,进行差异表达分析(differential expression analysis),比较主要由某类细胞组成(>50%)的区域与完全缺乏该类细胞的区域。结果显示,Path2Space的预测表达能够复现在单细胞RNA测序(single-cell RNA sequencing, scRNA-seq)数据中观察到的模式。其次,研究者应用SPACET(一种无监督去卷积方法)从预测的ST数据中估计细胞类型丰度,随后又训练了一个监督式MLP回归器,在交叉验证中始终优于SPACET。

4. 空间亚型(Spatiotypes)的发现

研究团队将Path2Space应用于TCGA乳腺癌队列(来自976位患者的1,096张切片),以表征TME异质性并鉴定空间预后生物标志物。为匹配Visium分辨率,每张TCGA切片被划分为连续的伪斑点(pseudo-spots),约6,131个/张。随后利用SpaGCN(一种图卷积网络)将约670万个伪斑点聚类为7,295个空间相干的域(spatially coherent domains),进一步聚类为11个共享的空间转录组簇(ST clusters),不同簇表现出在信号通路活性、细胞组成、癌基因和抑癌基因表达及细胞互作方面的显著差异。

基于这11个ST簇的肿瘤组成,通过层次聚类(hierarchical clustering)定义了三个具有不同TME特征和生存结局的患者组,称为“空间亚型”(spatiotypes):增殖富集型(proliferation-enriched)以ST簇9和11为特征;免疫调节型(immune-modulated)以ST簇5为特征,与良好预后相关;免疫失活型(immune-inactive)以ST簇2和4为主,与较差的无病生存期(disease-free survival)显著相关。这一分类在调整年龄和肿瘤分期后仍为独立预后因素,并在METABRIC外部验证队列中得到重复。

5. 治疗反应预测

为量化预测基因表达的空间异质性,研究者定义了“空间邻域多样性”(spatial neighborhood diverseness, SPAND)指标,测量100×100微米邻域内的局部表达变异。在四个曲妥珠单抗治疗队列(TransNEO、PBCP、Impress和Cedars-Sinai)中,HER2 SPAND能一致预测病理完全缓解(pathological complete response, pCR),在HER2高表达肿瘤中的预测能力显著优于传统的bulk RNA测序和FISH检测。

同时,研究者利用11个ST簇的组成训练逻辑回归(logistic regression)模型预测化疗和曲妥珠单抗反应。在化疗预测中,Path2Space在TransNEO交叉验证中AUC达0.75,在PBCP和Impress外部验证队列中AUC分别为0.89和0.74,且泛化能力优于其他图像模型。在曲妥珠单抗反应预测上,模型在多个验证队列中AUC达0.72-0.90,整合HER2 SPAND后性能进一步提升,且优于或匹配基于bulk测序的分子标志物。

主要结论与应用价值

Path2Space提供了一种实用且可扩展的计算方法,使得以往因成本限制而无法开展的大规模空间分析成为可能。研究揭示,从常规H&E切片中获得的低代价空间TME图谱,在预测患者对化疗和曲妥珠单抗的反应方面,比昂贵的传统bulk测序标志物更为准确。

就临床应用而言,该框架支持两大互补场景。其一,基于H&E的分析能够在不具备分子检测的大规模回顾性队列中鉴定与临床结局相关的空间特征,这些生物标志物可在前瞻性环境中使用靶向检测进行验证。其二,Path2Space可直接从常规H&E切片进行预测,减少对昂贵分子检测的依赖,仅需可部署的计算基础设施即可实现患者分层,为分子检测提供了一种可扩展、低成本的高效替代方案。此外,该框架可推广至其它癌症类型和空间组学模态,如空间蛋白质组学和空间甲基化分析,具有广阔的应用前景。

研究亮点与方法学创新

本研究具有多重创新性。首先,Path2Space首次实现了从H&E切片对数千个基因空间表达的稳健预测,远远超越既往仅能预测少数基因的方法。其次,该模型在FFPE切片上的表现与FF切片相当,而FFPE切片是临床病理档案的主流保存形式,大大拓宽了应用范围。第三,SPAND指标的提出为量化微米尺度的空间异质性提供了新工具,并由此发现了与曲妥珠单抗反应显著相关的空间生物标志物。第四,基于ST簇组成定义的三种空间亚型首次从空间转录组层面提供了预后分层框架,在多个独立队列中均得到验证。最后,Path2Space在预测治疗反应方面多次匹配或超越基于昂贵bulk测序的传统生物标志物,证明了其转化潜力。

局限性与展望

该研究也存在一些局限性。当前架构针对Visium分辨率(约55微米斑点)进行优化,每个斑点仅含1-10个细胞,因此在推断稀有细胞类型时准确度下降。不过,研究表明这种下降是Visium分辨率数据的内在限制,而非模型设计缺陷,即使是基于实测ST数据的去卷积也同样存在这种与细胞丰度相关的准确度下降现象。细胞类型推断的粒度是未来开发的重要方向,随着Visium HD等单细胞或亚细胞分辨率训练数据的积累,模型性能有望进一步提升。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com