分享自:

基于大规模概念增强视觉-语言预训练的可解释生物医学基础模型

期刊:nature biomedical engineeringDOI:10.1038/s41551-026-01764-x

本研究由Yuxiang NieSunan HeYequan Bie 等来自香港科技大学哈佛大学腾讯优图实验室等多所机构的研究人员共同完成,通讯作者为 Hao Chen。论文发表于 *Nature Biomedical Engineering*,于2026年7月3日被接收并在线发表。研究团队开发了一个名为 ConceptCLIP 的可解释生物医学基础模型,通过大规模概念增强的视觉–语言预训练,在保持高诊断准确率的同时,为临床医生提供人类可理解的解释。

研究背景

医学影像人工智能的临床落地面临两个核心要求:诊断准确率达到专家水平,以及具备支持临床决策的可解释性。当前的多模态生物医学基础模型在准确性和泛化能力上取得了显著进展,但其内部机制往往如同“黑箱”,缺乏临床所需的细粒度、具有医学意义的概念级解释。另一方面,现有的可解释人工智能方法虽然能够提供医学概念层面的解释,但高度依赖针对特定临床场景的专家标注,限制了其大规模应用。因此,将高准确率与可解释性在同一模型中统一起来,成为制约医学人工智能广泛临床转化的关键瓶颈。

为了解决这一问题,研究团队提出了 ConceptCLIP,一个基于 MedConcept-23M 数据集进行预训练的可解释基础模型。该数据集包含2300万条生物医学“图像–文本–概念”三元组,源自 PubMed Central Open Access 子集,并通过 统一医学语言系统 对医学概念进行了标准化处理。

研究方法与工作流程

ConceptCLIP 的核心设计是双对齐预训练策略,包括图像–文本对齐区域–概念对齐两个部分。图像编码器初始化自 SigLIP-ViT-400m-16,文本编码器初始化自 PubMedBERT。图像–文本对齐采用 SigLIP 的 Sigmoid 损失函数,负责学习图像和文本之间的全局对应关系;区域–概念对齐则将图像局部区域的特征与文本中标准化医学概念的特征进行匹配,使模型能够建立细粒度的视觉–概念关联。训练总损失为两者加权求和。

在推理阶段,对于零样本诊断任务,每个候选类别用一个文本提示和其关联的概念集合表示。模型计算图像全局特征与提示文本特征之间的相似度作为全局分数,同时利用概念嵌入聚合与类别概念最相关的图像区域,计算局部分数,最后将两者结合得到最终预测概率。

数据方面,MedConcept-23M 的构建通过从 PMC-OA 中提取图像–文本对,再经过生物医学实体识别、基于 UMLS 的语义消歧以及基于 PubMedBERT 的文本蕴含验证三个阶段,为每个图像–文本对自动添加标准化的 UMLS 概念。此外,研究团队还从保留的样本中构建了包含9,222对图像–文本的 PMC-9K 跨模态检索基准数据集。

评估体系覆盖了10种医学影像模态、78个数据集,包括58个医学影像诊断数据集(涵盖零样本、线性探测和全量微调三种设置)、15个跨模态检索、医学报告生成、视觉问答及病理全切片图像分析数据集,以及5个可解释性分析数据集。

主要实验结果

在零样本医学影像诊断中,ConceptCLIP 在覆盖10种模态的39个数据集上均表现优于此前最优的医学基础模型,平均 AUC 比此前最好的医学基线模型提升了 6.81%,其中在 CT 上的提升高达 10.73%,在超声眼底图像上的提升也分别达到 10.06%8.98%。在仅有1%训练数据的线性探测实验中,ConceptCLIP 在 X 射线类别上取得了 71.48% 的平均 AUC,超越了第二名模型 3.75%。在全量微调实验中,ConceptCLIP 在10个模态中的8个上取得了最佳平均性能,其中6个模态的提升具有统计学显著性。

在分布偏移鲁棒性测试中,ConceptCLIP 在6个包含概念上新疾病或严重代表性不足疾病的数据集上,于其中5个上取得了最先进或具有竞争力的零样本性能;在9个来自病理、MRI、CT 和胸部 X 射线的多中心私有临床数据集上全部取得了最佳 AUC;在4个高位深临床图像数据集上仍然保持鲁棒,且优于未使用区域–概念对齐的变体模型。

在跨模态检索任务中,ConceptCLIP 在 PMC-9K 上取得了 82.85% 的图像到文本 Recall@1,显著优于 BiomedCLIP73.41%;在 Quilt-1M 上取得了 32.50% 的文本到图像 Recall@200,比 BiomedCLIP 绝对提升了 12.88%。在医学视觉问答中,ConceptCLIP 在 SLAKEVQA-RAD 上分别取得了 83.86%70.70% 的整体准确率,均为最佳表现。在医学报告生成中,ConceptCLIP 在 MIMIC-CXR 上取得了 26.38% 的宏观 F1 分数,超过第二名 4.28%。在病理全切片图像分析中,ConceptCLIP 在癌症诊断、突变预测和生存预测等九个任务上均表现强劲,例如在 BRACS-3 上取得了 91.65% 的癌症诊断 AUC。

可解释性分析

ConceptCLIP 在零样本医学概念标注任务上,覆盖皮肤科、病理、超声和 CT 五个数据集共 5,901 张测试图像和53个细粒度临床概念,平均性能比 PMC-CLIPBiomedCLIP 分别相对提升了 10.9%10.4%。引入局部对齐的推理方式在所有五个基准上均优于仅使用全局特征的基线。基于 ConceptCLIP 构建的概念瓶颈模型在诊断任务上比第二名方法提升了 6.13% 的 AUC,且性能与全量微调的黑盒模型相当甚至更优。在概念–疾病相关性发现实验中,ConceptCLIP 成功识别出结核病与空洞、实变、淋巴结肿大等概念的相关性,以及在乳腺超声中将形态不规则、低回声等概念与恶性病变关联。

临床医生用户研究

研究团队开展了一项涉及8名来自病理、超声和放射科的执业临床医生的用户研究,共完成 252 次临床医生–病例评估,覆盖 92 个独立病例。结果显示,当 AI 预测正确时,医生在查看解释后信任度显著提升;当 AI 预测错误时,解释能够揭示推理错误并显著降低信任。尤其在放射科,正确预测的信任度提升了 +1.25,错误预测的信任度下降了 −1.08。在诊断准确性方面,加入 ConceptCLIP 的解释后,整体临床发现识别准确率从 68.1% 提升至 76.2%,绝对提升达 8.1%,其中超声科的提升最为显著,达到 +10.6%。临床医生认为解释在正确预测时主要增强了信心并提高了效率,在错误预测时则有助于揭示 AI 错误。

研究结论与意义

ConceptCLIP 是医学领域第一个可解释的基础模型,通过将结构化医学概念整合到预训练过程中,实现了诊断性能与可解释性的统一。其双对齐策略不仅提升了零样本泛化能力和迁移学习性能,还使模型在推理阶段能够输出具有临床意义的概念级解释,支持医生验证模型输出、识别潜在错误并改进临床判断。该研究为构建可信赖的医疗人工智能奠定了基础,具有重要的科学价值和临床应用前景。

研究亮点

本研究的主要亮点包括:构建了目前规模最大的医学“图像–文本–概念”三元组数据集 MedConcept-23M;提出了全局图像–文本对齐与局部区域–概念对齐相结合的双对齐预训练框架;首次在生物医学基础模型中实现了大规模概念增强的预训练与可解释推理;并通过涵盖10种模态、78个数据集的广泛基准和临床医生用户研究,系统验证了模型在诊断性能和临床可用性方面的优势。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com