分享自:

病理学基础模型:从技术和临床视角看演进、现状、挑战与机遇

期刊:BioengineeringDOI:10.3390/bioengineering13050577

本文作者为Hussien Al-Asi、Ibrahim Yilmaz、Jordan Reynolds、Shweta Agarwal、Aziza Nassar、Abba Zubair、Craig Horbinski、Bryan Dangott及Zeynettin Akkus,通讯作者为Zeynettin Akkus,研究机构隶属于Mayo Clinic Florida的检验医学与病理学系及人工智能与信息学系。该文作为一篇综述(Review)于2026年5月19日发表于期刊《Bioengineering》,属于开放获取文章。论文题目为《Pathology Foundation Models: Evolution, Current Landscape, Challenges and Opportunities from a Technical and Clinical Perspective》,系统梳理了病理学基础模型(Pathology Foundation Models,PFMs)的发展脉络、当前格局、临床转化障碍及未来方向。

本文的核心主题是从技术和临床双重视角审视PFMs如何重塑计算病理学。传统上,计算病理学依赖针对特定任务训练的深度学习模型,如基于卷积神经网络(Convolutional Neural Network,CNN)的ResNet、DenseNet和U-Net,它们虽然在肿瘤检测和分割等狭窄任务中表现良好,但需要大量标注且跨机构泛化能力有限。PFMs的兴起源于注意力机制与Transformer架构的突破,以及视觉Transformer(Vision Transformer,ViT)在图像建模中的应用。PFMs通过自监督学习在海量全切片图像(Whole-Slide Images,WSIs)上学习任务无关的形态学表征,具备广泛泛化能力和少样本适应能力。论文从临床动机出发,指出当代解剖病理学面临病例量持续增长、辅助检测日益复杂以及整合形态学、免疫表型和分子信息的认知负担加重等挑战,强调任务专用模型的局限性与“全能型”基础模型在常规实践中的不足。

在PFMs的发展演进方面,作者梳理了从弱监督多实例学习方法如聚类约束注意力多实例学习(CLAM)和层次化模型如层次化图像金字塔Transformer(HIPT),到大规模基础模型如UNI、Virchow、Phikon、CONCH、GigaPath、H-optimus、TITAN以及Mayo Clinic Atlas的演进过程。每个模型在架构设计、训练策略、数据规模和临床成熟度方面存在差异。例如,Virchow和Virchow 2基于对比自监督ViT,训练数据超过一百万张WSIs,在多组织和罕见癌症任务中表现稳健;CONCH利用视觉—语言对比学习,在预测微卫星不稳定性等复杂生物标志物时展现出优越的泛化能力;Mayo Clinic Atlas依托约120万张WSIs和自监督ViT-H/14架构,强调机构级大规模数据管护和广泛基准评估。论文特别指出,预训练数据的多样性——解剖部位和癌症类型的广度——往往比单纯的数据量更能决定下游任务表现。

关于性能与基准测试,作者系统分析了当前领域存在的评估挑战。TCGA作为最广泛使用的公共组织病理学数据集,存在欧洲裔患者比例过高(超过80%)和少数族裔代表性不足的偏倚。Camelyon16等公共数据集常包含站点特异性伪影如染色差异和标记笔痕迹,模型可能将这些非生物学特征作为捷径学习。为应对这些问题,PathoBench、PathBench和MedFair等新基准提供了标准化训练—测试划分和覆盖60余项临床相关任务的评估协议,涵盖形态学亚型分型、分子标志物预测和生存预后等。基准测试结果表明,Virchow2、CONCH和H-optimus-1是当前表现最优秀的模型;参数高效微调(PEFT)方法如低秩适应(LoRA)在临床任务适应中效果显著优于传统线性探测;在少样本场景下,测试时修改模型的方法如Baseline和Baseline++最为有效。

在亚专科领域的失效模式方面,论文着重分析了细胞病理学和血液病理学中的突出障碍。细胞病理学标本具有厚度可变和三维细胞结构的特点,单平面成像常不足以满足诊断需求,例如甲状腺细胞学中单个焦平面可能遗漏诊断相关特征,而大多数PFMs基于单平面WSIs训练,导致涂片和穿刺标本建模不足。血液病理学诊断高度依赖流式细胞术、细胞遗传学和分子检测等多模态辅助数据,但这些数据在当前PFMs训练数据集中基本缺失,加之血液病理学样本在训练队列中代表性不足,导致模型在该领域性能受限。此外,制片、染色和扫描平台的跨机构差异会显著改变模型行为,而非生物学伪影可能被误学习为诊断线索;许多模型依赖抽象特征表征,难以与既定形态学标准对应,限制了可解释性和病理学家信任度。

临床转化障碍方面,作者从多个维度进行了深入剖析。监管层面,PFMs具有内在自适应性和跨任务重用特性,而当前FDA的软件作为医疗器械(SaMD)框架主要针对固定功能算法设计,尚不能充分容纳持续学习或任务无关系统;同时,大多数PFMs缺乏前瞻性多中心临床验证研究。基础设施方面,WSIs的存储、检索和处理需要高性能图形处理器(GPU)、可扩展存储系统和低延迟网络,与实验室信息系统(LIS)、数字病理查看器及企业认证框架的集成带来额外的工程与安全负担。工作流整合层面,病理工作流程高度结构化且时间敏感,黑箱式模型难以获得病理学家信任,病理学家与AI交互范式尚未形成共识。数据治理和隐私问题涉及跨机构数据聚合、共享协议和机构控制权。经济层面,数字化病理基础设施成本叠加AI辅助诊断报销路径的不确定性,尤其在小型机构中构成采用障碍。作者强调,当前主要瓶颈已不再是纯算法层面,而是系统性挑战,需要监管、基础设施、工作流设计和临床验证的协同推进。

未来方向部分,作者提出了七项关键建议:建立标准化且具有临床意义的基准测试,包括诊断一致性、时间节省和患者管理影响等端点;开发病理学家在环系统,以决策支持工具而非全自主系统形式实现交互式查询、迭代反馈和受控持续学习;推动多模态融合,将组织病理学与基因组学、放射学、实验室值和临床记录整合;在通用框架内进行领域特定专业化,例如在细胞病理学中结合三维成像和罕见病队列;增强对领域偏移和伪影的鲁棒性,采用染色归一化、域适应和不确定性量化;提升可解释性并与病理学术语体系对齐,使模型输出关联到核异型性和结构模式等可识别组织学特征;开展前瞻性临床试验和真实世界验证,评估跨机构性能和人机交互指标。

论文的学术价值在于系统性地将PFMs的技术演进与临床实际部署需求相结合,明确指出了模型性能在基准测试中表现优异与真实世界泛化能力不足之间的差距。其应用价值体现在为计算病理学领域的研究者、临床医生和监管机构提供了一个全面的分析框架,强调了从模型中心创新向部署感知设计和评估转变的必要性。论文的重要论点在于:PFMs下一阶段的发展将取决于严格的基准测试、病理学家在环部署和多模态融合,使这些模型从研究工具演进为临床稳健系统。此外,论文指出预训练数据多样性比数据量更为关键、参数高效微调优于线性探测、以及“概念漂移”可解释性技术有助于诊断黑箱失败等观点,为后续研究提供了具体方向。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com