分享自:

将计算病理学与结直肠癌临床实践相结合

期刊:npj Precision OncologyDOI:10.1038/s41698-025-01119-w

这是一篇发表于 npj | precision oncology 的系统性综述,题为 “Aligning computational pathology with clinical practice for colorectal cancer”(将计算病理学与结直肠癌临床实践相对齐)。该文由 Elias BaumannJosé F. Carreño-MartínezAna Leni Frei 等多位作者(共同第一作者)以及通讯作者 Inti Zlobec 完成,主要来自瑞士伯尔尼大学(University of Bern)的组织医学与病理学研究所等机构。文章于2025年发表,旨在系统评估深度学习在结直肠癌计算病理学中的研究现状,并将其与 ICCR(国际癌症报告协作组织,International Collaboration on Cancer Reporting)结直肠癌病理报告指南中的各要素进行对齐,以揭示当前研究与临床实践之间的差距。

该综述并非单一原始研究,而是一篇系统性文献综述(类型b)。其核心方法是依照 PRISMA 指南进行系统检索,检索范围覆盖 PubMed、Web of Science、Embase 和 IEEE Xplore 等数据库,时间限定为2015年1月1日至2024年9月13日。在初筛4863篇文献、剔除重复项并补充人工检索后,最终纳入66篇符合标准的原创研究进行深入分析。文章将 ICCR 结直肠癌指南中的微观报告要素分为“核心要素”和“非核心要素”,逐项分析已发表的计算病理学方法,并从数据可用性、代码与模型权重公开程度、外部验证情况、临床可操作性等方面进行系统梳理。文章最后指出了当前研究中未被覆盖或未被充分探索的要素,并给出未来研究的建议路径。

文章的第一项主要观点是:计算病理学在结直肠癌中的研究覆盖面存在严重不均衡,主要集中于少数生物标志物,而多数核心诊断要素被忽视。 作者统计发现,在66篇纳入研究中,有39篇(59%)预测 MMR(错配修复,Mismatch Repair)状态,16篇(24%)预测 BRAF V600E 突变,9篇(14%)涉及淋巴结状态(pN)。而组织学分级、共存病理、pTNM分期、肿瘤出芽、神经周围侵犯、对新辅助治疗的反应等要素仅有极少数研究涉及。作者指出,这种不均衡反映出计算病理学研究目标与临床实际需求之间的错位。许多核心要素虽然对患者管理、分期和预后至关重要,但由于缺乏方法学新颖性等原因,反而未被充分研究。这一现象提示,领域内需要更多以临床报告为导向的研究,而非仅追求技术新颖性。

文章的第二项主要观点是:已发表的模型在临床可用性方面存在普遍不足,尤其表现在外部验证不足、代码与模型权重公开率低,以及缺乏标准化截断值(cutoff)。 作者通过元分析发现,虽然56%的研究使用了某种公开数据集或公开了自身数据,47%使用了 TCGA(癌症基因组图谱,The Cancer Genome Atlas)数据,但只有38%的研究提供代码,仅12%提供模型权重。作者特别指出,“可应合理请求获取”的条目被视为不可用,这进一步降低了可重复性。此外,对于 MMR 状态预测,尽管已有商业化的预筛工具获得 CE-IVD 认证,但在保持95%敏感性的前提下,特异性仍较低(如46%至61%),因此目前只能作为筛查工具,尚不能替代 IHC 或 PCR 等金标准检测。对于 BRAF V600E 突变预测,大多数研究未区分 V600E 特异突变与所有 BRAF 突变,且很少报告具有临床意义的敏感性与特异性阈值。这些问题使得大多数模型距离临床部署仍有一定距离。

文章的第三项主要观点是:在不同 ICCR 要素中,模型方法各异,但通常都面临组织识别、区域检测和切片级聚合的共同技术挑战。 例如,在淋巴结转移检测中,多数方法基于转移检测/分割,再预测切片级标签。Huang 等人提出的人机协同 AI 系统(nuclei.io)显著提高了对孤立肿瘤细胞的检测敏感性,并减少了病理医生的评估时间。Kindler 等人的深度神经网络在临床测试中达到0.990的敏感性,并与病理医生有高度一致性(κ = 0.94)。然而,作者强调,pN 分期的自动化还需要解决同一淋巴结可能在同一或不同切片上被多次切割、从而导致重复计数的问题。该问题至今未得到充分解决。对于组织学分级,多数研究采用瓷砖级分类或多实例学习,但很少有研究在多病理医生共识标签下进行验证,且未报到患者级聚合策略。对于肿瘤出芽,Lu 等人使用 Faster R-CNN 进行出芽检测,而 Bokhorst 等人使用 U-Net 和 HoVer-Net 进行组织分割与细胞核检测,并结合凸包算法识别浸润前沿。这两种方法各有优劣,但都存在验证数据量小、在坏死区域假阳性高、无法区分假出芽等局限。这些方法上的差异和共同缺陷说明,虽然已有一定技术积累,但要形成端到端的、符合 ICCR 指南的自动报告系统,仍需大量工程与验证工作。

文章的第四项主要观点是:ICCR 指南中仍有多项要素完全没有自动评估方法发表,这些空白为未来研究指明了方向。 作者在讨论部分用一张专门表格(Table 11)列出了尚未被有效解决的核心与非核心要素,包括组织学亚型、淋巴管/静脉侵犯(LVI)、切缘状态、肿瘤沉积、远处转移(pM)、神经内分泌确认、浸润超出固有肌层深度的测量、MLH1 启动子甲基化等。针对每一项空白,作者提出了可能的技术路线、所需数据类型以及预期临床获益。例如,对于组织学亚型,作者认为可以使用幻灯片级聚合模型来捕获形态学模式,但稀有亚型的识别需要异常检测方法;对于淋巴管/静脉侵犯,作者指出仅靠简单的多实例学习可能不够,因为需要结合动脉与静脉之间的空间关系作为上下文信息;对于切缘状态,作者提出可以使用瓷砖级分类器检测切缘处的肿瘤存在,并通过识别切割结构来估算肿瘤与切缘的距离。这些建议不仅为后续研究提供了具体方向,也突出了将计算病理学与标准化报告体系深入整合的必要性。

文章的最后一项重要观点在于其系统总结了计算病理学与临床实践对齐过程中的结构性障碍,并提出了推进策略。作者认为,当前研究的许多问题源于数据获取受限、多中心验证不足以及对 TCGA 数据的过度依赖。作者指出,TCGA 的 H&E 切片并非为诊断评估而选取,因此其验证结果对真实世界队列的可迁移性有限。诸如 BigPicture 等大规模数据共享项目的推进有望改善这一状况。此外,作者强调,病理学挑战赛(challenges)虽推动了方法学进步,但往往关注特定问题,且不要求提出可部署的工具,因而对临床转化的帮助有限。相反,基于 ICCR 指南要素的模型具有更强的可解释性和可验证性,更易被病理医生和实验室采纳。文章最后总结道,目前计算病理学在结直肠癌领域仍处于成熟度较低的阶段,研究与临床实践之间缺乏有效对齐。未来应优先填补各指南要素的自动化空白,并在临床情境中评估现有方法。该综述的价值在于首次系统地将深度学习研究与 ICCR 结直肠癌报告标准逐项对齐,为领域内研究者提供了清晰的现状图谱与优先研究方向,同时也为病理学人工智能的临床转化提供了务实的方法论参考。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com