PRISM2:一种具备临床对话能力的端到端多模态病理学基础模型
研究团队与发表信息
本研究由Eugene Vorontsov、George Shaikovski、Adam Casson、Julian Viret、Eric Zimmermann等人共同完成,主要作者来自Paige(纽约)、Tempus(芝加哥)和Microsoft Research(剑桥),同时包括Memorial Sloan Kettering Cancer Center(MSK)及Yale University的合作者。其中Eugene Vorontsov等六位作者为共同第一作者,Kristen Severson和Siqi Liu为共同通讯作者。该研究发表于《Nature Medicine》,于2025年10月16日收稿,2026年6月12日接受。
研究背景与目标
计算病理学领域近年来因基础模型(foundation models)的发展而取得了显著进步。Virchow2、UNI2和H-optimus-1等模型通过在海量组织病理学图像块(tiles)上进行自监督学习,获得了可泛化的图像表征能力,在癌症检测、亚型和生物标志物量化等任务中提升了性能与数据效率。然而,这些模型在病例级别的推理上存在根本性限制。大多数高价值预测任务发生在患者病例层面,通常包含一个或多个十亿像素级的全切片图像(whole-slide images,WSIs),需要聚合数千个图像块。现有的工作流程主要依赖于弱监督学习来训练特定任务的图像块聚合器,但这需要大量数据整理,且容易过拟合、稳健性差。本研究的目标是超越这一范式,构建一个无需额外训练即能达到临床级别预测性能的通用模型。为此,研究团队提出了PRISM2——一种切片级别(slide-level)的多模态基础模型,通过临床对话监督将组织形态学与诊断推理相对齐,以支持基于提示的推理(prompt-based inference)和可迁移的嵌入(embeddings)用于下游任务。
研究流程与方法
PRISM2的训练采用了包含685,507份临床报告、对应2,350,518张WSIs、来自200,692名患者的大型数据集,涵盖多样化的组织类型(图2a)。这些WSIs均为福尔马林固定、石蜡包埋并经H&E染色,以0.5微米/像素的放大倍数扫描。研究的第一阶段,使用基于Perceiver架构的切片编码器聚合Virchow2的图像块嵌入。该切片级别表征与诊断摘要文本通过双重目标对齐:一是基于BioGPT文本嵌入的对比学习目标(contrastive objective),二是基于Phi-3 mini语言模型的自回归目标(autoregressive objective)。值得注意的是,PRISM2明确区别于PRISM和Titan之处在于其使用了临床对话(clinical dialogue)作为训练信号。为了克服病理报告异质性和信息密度不一的问题,研究引入了详细的问答对以及报告生成。具体而言,使用GPT-4o从原始报告中生成了五类处理后的文本任务:临床报告生成、是/否问答、开放式问答、多项选择问答和图文匹配。为了缓解是/否问答中“是”答案偏多的问题,研究采用了一种挖掘互补问答对的方法,即将随机报告与随机问题配对,并假设报告中未提及的发现为阴性。训练中总共创建了约1,400万个问答对。第二阶段,切片编码器被冻结,仅微调Phi-3 mini语言模型,以细化诊断问答能力,最终得到“诊断嵌入”(diagnostic embedding)。与“基础嵌入”(base embedding)不同,诊断嵌入源自40亿参数语言模型的隐藏状态,更适用于临床诊断任务,而基础嵌入则在生物标志物预测、生存预测等非诊断任务上泛化更好。此外,研究团队还利用包含225,597个病例的总体生存数据集对PRISM2切片编码器进行了生存预测的微调,产生了“生存嵌入”(survival embedding)。模型的评估设置涵盖了无需训练的基于提示的推理、线性探针(linear probe)以及生存分析等。
主要研究结果
在癌症检测方面,研究使用是/否问答的基于提示的推理,将PRISM2与Paige Prostate、Paige Breast和Paige BLN三个临床级产品进行了比较(图3a)。结果显示,PRISM2在不进行任何额外训练的情况下,其平衡准确率与Paige Prostate和Paige Breast相匹配,并显著优于Paige BLN(p < 0.05)。相比之下,PRISM和Titan使用对比式分类均未能匹配临床级产品的性能,尤其在BLN任务上表现差距明显。在全癌种(pan-cancer)检测中,PRISM2的提示式推理表现最佳,经线性探针进一步训练后,其性能继续提升,并且只有PRISM2能够匹配或超越全部三个临床级产品。在TCGA的乳腺癌、肺癌和肾癌亚型分类任务中,PRISM2通过多项选择问答也取得了与其他模型相似或更优的表现(图3c)。
在下游诊断任务中,研究通过在MSK内部的全癌种、乳腺癌、胃肠道检测任务以及TCGA亚型、CAMELYON16/17、PANDA和IMP-CRS等外部公开数据集上训练线性分类器来评估各模型的嵌入质量(图4a)。PRISM2诊断嵌入在全癌种检测上取得了0.967的AUC,显著优于PRISM2基础嵌入(0.956)、PRISM(0.947)和Titan(0.931)。在罕见癌症子集上,性能下降幅度较小(0.967至0.957)。在CAMELYON17淋巴结肿瘤分期任务中,PRISM2诊断和基础嵌入的二次加权κ值分别为0.881和0.888,显著高于PRISM(0.852)和Titan(0.641),且该评估需要进行跨机构迁移,表明PRISM2在分布外数据上的稳健性。在PANDA-SI前列腺癌分级中,PRISM2诊断嵌入同样显著优于所有其他嵌入。
在生存预测方面(图4b),经微调后的PRISM2生存嵌入在MSK结直肠癌无复发生存(RFS)任务上的C指数达到0.809,优于未微调的PRISM2基础嵌入(0.773)以及其他所有基础模型嵌入。在TCGA的13个疾病特异性生存(DSS)任务的平均性能上,PRISM2生存嵌入同样表现出色。在生物标志物预测任务中(图4c),PRISM2基础嵌入在MSK的10个生物标志物和TCGA的7个重叠生物标志物上取得了最高的平均AUC(分别为0.854和0.784),虽然优势幅度较小,但从未显著落后于其他模型。
此外,研究还展示了PRISM2在遵循CAP指南完成病理报告方面的能力(图5),其对组织学类型、DCIS存在与否、淋巴血管侵犯等字段的回答在经概率校准后可达较高调整平均召回率,表明模型具备初步的报告补全潜力。在模型设计消融研究中,扩展训练数据规模(3.5倍)对诊断任务性能的提升贡献了约50%的增益。
研究结论与价值
PRISM2是迄今规模最大的多模态切片级病理基础模型,拥有46亿参数,在近70万份标本和临床报告、超过230万张切片及1,400万个问答对上进行了训练。其核心贡献在于证明了语言监督预训练可以为病理表征提供可扩展且具有临床基础的信号。PRISM2不仅在下游任务上通过线性探针从未显著落后于先前的基础模型,更重要的是,它首次展示了无需额外训练即可通过对话式问答达到甚至超越临床级癌症检测产品的性能。该研究弥合了人类诊断推理与基础模型性能之间的鸿沟。在应用层面,PRISM2可作为一个交互式助手,在常规病理签署过程中回答“是否存在淋巴血管侵犯”等问题,为资源匮乏地区的病理医生提供第二意见,或作为“数字住院医生”预填CAP结构化报告,并可辅助高风险病例的优先分流、确认性免疫组化或测序检测的自动开具等。其双重嵌入架构(基础嵌入与诊断嵌入)为不同的下游任务提供了灵活的选择:诊断任务使用诊断嵌入,而生物标志物和预后任务则推荐使用基础嵌入。
研究亮点
本研究的突出亮点包括:第一,首次证明通用基础模型可通过基于提示的推理在不进行任务特定训练的情况下匹配或超过多家经FDA或CE认证的临床级专用模型的癌症检测性能;第二,在模型架构上引入了双嵌入设计,有效平衡了对诊断任务的专业性和对非诊断任务的泛化性;第三,在训练数据构造上,利用GPT-4o从临床报告生成大规模临床对话语料,并提出挖掘互补问答对以缓解是/否问题答案偏置的方法;第四,在生存预测任务中,仅通过对切片编码器进行微调便超越了从头训练的生存预测专用模型。这些结果标志着计算病理学基础模型从图像块级别向切片级别的关键范式转变,并为未来在生物标志物和预后预测等新前沿上的研究指明了方向。