这是一项由电子科技大学、首都医科大学附属北京同仁医院、宾夕法尼亚大学及四川大学华西医院等多家机构的研究人员合作完成的原创性研究。论文的第一作者为Yifan Wu和Yang Liu,通讯作者为Xuan Yang、Wenbin Wei及Shi Gu。该研究发表于 *Nature Communications*,于2025年4月13日在线发表。
本研究属于医学人工智能与罕见病诊断的交叉领域,聚焦于脉络膜肿瘤的自动鉴别诊断。脉络膜黑色素瘤(choroidal melanoma)是葡萄膜黑色素瘤(uveal melanoma)中最常见的亚型,在亚洲人群中的发病率仅为每百万人0.4至0.6例,属于典型的罕见恶性肿瘤。由于该病预后较差且易发生转移,及时准确的诊断至关重要。然而,在临床实践中,脉络膜黑色素瘤与脉络膜血管瘤(hemangioma)、脉络膜转移癌(metastatic carcinoma)在早期影像表现上常有重叠,而具备相关专业经验的眼科专家数量稀少,导致诊断困难。传统的深度学习模型虽然在常见病的计算机辅助诊断(computer-aided diagnostic, CAD)中表现优异,但在罕见病领域受限于高质量数据稀缺和模型可解释性不足两大瓶颈。为此,本研究旨在构建一个基于多模态数据和概念瓶颈的可解释人工智能模型,以辅助临床医生进行脉络膜肿瘤的鉴别诊断。
研究团队首先构建了脉络膜三模态影像(choroid tri-modal imaging, CTI)数据集。该数据集收集了北京同仁医院2013年至2019年间共750例患者的影像资料,包括542例脉络膜黑色素瘤、128例脉络膜血管瘤和80例脉络膜转移癌。影像模态涵盖荧光素血管造影(fluorescein angiography, FA)、吲哚菁绿血管造影(indocyanine green angiography, ICGA)和眼部超声(ultrasound, US)三种。并非所有患者都具备全部三种模态的影像,其中285例患者拥有完整的三模态数据,被定义为多模态(multimodal, MM)子集。研究将MM子集中20%的患者划分为独立测试集,其余数据采用五折交叉验证进行训练与评估。此外,97例患者的三种模态均配有文字诊断报告,用于后续概念提取。
在模型构建方面,研究首先建立了黑盒基线模型。该模型采用三个独立的模态特异性编码器分别对FA、ICGA和US图像进行特征提取,随后通过注意力池化(attention pooling)层融合多模态特征,并经全连接层输出分类结果。基线模型在仅使用单一模态时,FA的F1分数为78.3%,ICGA为85.9%,US为72.1%;当融合三种模态时,F1分数提升至89.2%。然而,黑盒模型无法向临床医生解释其预测依据。
为解决可解释性问题,研究团队提出了多模态医学概念瓶颈模型(multimodal medical concept bottleneck model, MMCBM)。该模型的核心思想是将临床专家的诊断知识以“概念”(concept)的形式嵌入模型结构。具体而言,研究者利用GPT-4从97份临床报告中自动提取与脉络膜肿瘤影像表现相关的短语作为概念,例如FA报告中的“静脉期簇状低荧光”“随时间整体荧光增强”“晚期染色”等。经GPT-4对语义相似概念进行合并后,得到FA概念47个、ICGA概念30个、US概念26个,共计103个概念。两名北京同仁医院的资深眼科专家对这些概念进行了验证和修订,删除了5个概念,在FA类别中新增8个概念,在ICGA类别中新增4个概念,US类别无改动。
概念的特征表示采用了概念激活向量(concept activation vectors, CAVs)方法。研究使用预训练图像编码器提取图像特征,并以每个概念的存在与否作为二分类标签,训练支持向量机(support vector machine, SVM)。每个SVM的分类超平面向量即为对应概念的CAV表示。在MMCBM中,输入图像被投影到概念空间中,计算图像与每个模态特异性概念的对齐分数,这些分数随后输入线性分类器以预测三种疾病的相对概率。模型在输出最终预测的同时,会给出激活程度最高的前k个概念作为诊断依据,使预测过程对人类可读。
在模型性能评估中,MMCBM在多模态测试集上取得了91.0%的F1分数,与黑盒模型的89.2%无统计学显著差异。在单模态输入条件下,两种模型的分类性能同样无显著差异。这一结果表明,引入可解释性约束并未牺牲模型的预测准确性。研究还比较了使用CLIP及其医学变体MedCLIP和BioMedCLIP作为特征提取器的替代方案,结果显示基于专家知识构建的CAV方法显著优于所有基于CLIP的框架。CLIP的F1分数仅为28.8%,MedCLIP为52.5%,BioMedCLIP为57.2%,均远低于MMCBM的91.0%。
在泛化性验证中,研究使用了两个独立的外部数据集。第一个来自北京同仁医院2020年至2023年收集的83例病例,MMCBM的准确率为92.8%,F1分数为90.3%,与黑盒模型相当。第二个来自四川大学华西医院2023年至2024年收集的43例病例,MMCBM的准确率为88.6%,显著优于黑盒模型的77.2%。值得注意的是,MMCBM在华西医院数据集上的准确率仅比内部测试集下降约4%,而黑盒模型下降了约15%,表明概念瓶颈结构在分布偏移情况下具有更好的鲁棒性。
研究还验证了测试时人工干预的效果。通过模拟临床专家对模型预测的错误概念分数进行修正,发现在每个模态干预3至4个概念时,模型的灵敏度和F1分数达到峰值并优于未干预模型,这表明适度的人类干预可以进一步提升模型性能。
在临床工作流整合评估中,研究招募了北京同仁医院的8名医生,包括2名资深眼科专家和6名住院医师。无模型辅助时,6名经验较少的医生平均F1分数为38.5%;在MMCBM提供的前10个激活概念的辅助下,F1分数提升至54.7%,相对提升幅度达42%。2名资深医生的基线F1分数为84.6%,在模型辅助下微升至85.7%,基本保持不变。进一步的对照实验表明,当模型生成的标签被随机化时,提供概念解释可以将医生的准确率从62.7%提升至70.2%,说明概念解释有助于减轻医生对错误标签的过度依赖。
本研究的核心结论是,MMCBM在保持与黑盒模型相当预测精度的同时,能够以人类可理解的概念形式提供诊断依据,其概念的构建与使用过程与临床专家的诊断思维高度一致。该模型不仅有助于提高经验较少医生对罕见脉络膜肿瘤的诊断准确性,还通过人机交互机制增强了人工智能系统在临床决策中的可信度与实用性。
本研究的亮点体现在以下方面:第一,构建了迄今规模最大的亚洲人群脉络膜肿瘤多模态影像数据集;第二,提出了将大语言模型提取的专家知识与概念瓶颈模型相结合的可解释框架,实现了诊断过程的透明化;第三,通过外部独立数据集验证了模型在分布偏移条件下的泛化优势;第四,通过临床医生参与的评估实验证明了解释性人工智能在辅助培训和决策支持中的实际价值。该工作为罕见病领域可解释医学人工智能的发展提供了一个可扩展的范式。