分享自:

阿里达摩院CT通用模型

期刊:ScienceDOI:10.1126/science.aec6129

RADAR:基于视觉-语言学习的腹部CT通用人工智能诊断模型

一、研究概述

本研究由浙江大学医学院附属第一医院梁廷波教授、阿里巴巴达摩院张灵博士、浙江大学张琪博士、张建鹏博士及肖文波博士等联合通讯,主要作者包括张琪、张建鹏、曹伟伟、卢子林、常万兴、丁浩南等。研究成果于2026年9月17日发表于 Science 期刊,题为“An expert-level generalist AI for abdominal CT diagnosis”(DOI: 10.1126/science.aec6129)。该研究开发了名为RADAR(Rapid Abdominal Diagnosis with AI and Radiology)的通用视觉-语言人工智能模型,用于腹部增强计算机断层扫描(CT)的广泛疾病诊断。

二、学术背景与研究动机

放射学在现代临床诊断中具有核心地位,能够检测和表征多种疾病。长期以来,实现一个能在多样化真实临床场景中提供专家级诊断支持的通用人工智能(AI)一直是该领域的愿景。腹部增强CT是其中最具挑战性的任务之一,需要评估数十个器官和数百种疾病。现有的AI解决方案主要依赖监督学习范式,需要大量昂贵的人工标注,疾病覆盖范围有限,且在开放临床场景中的可扩展性和适用性受限。

视觉-语言学习提供了一条替代路径:通过在成对的图像-文本数据上训练模型,将同一患者的视觉和文本嵌入在共享表示空间中拉近,同时将不同患者的表示推开。然而,在自然图像领域成功的方法难以直接迁移到腹部CT领域,原因在于腹部CT的解剖结构复杂且诊断信号相对于整个三维体数据极为稀疏。此前,研究团队曾开发FVLM模型,能够识别54种腹部CT疾病类别,为该方法提供了概念验证,但诊断准确率和疾病覆盖范围仍有待大幅提升。本研究旨在构建一个能够覆盖18个解剖结构、146种影像学表现的专家级通用腹部CT诊断AI系统。

三、研究设计与技术流程

(一)RAD-CT数据集构建

研究团队构建了名为RAD-CT的大规模腹部CT数据集。该数据集来自浙江大学医学院附属第一医院2010年1月至2023年12月期间进行的腹部增强CT检查(排除急诊病例),共计424,911例检查,包含149.7万个体数据级图像-文本对。通过解剖分解,最终生成超过1500万个解剖级图像-文本对用于训练。数据集构建的核心创新在于将训练数据从检查级别细化到解剖级别,具体分为两个步骤:一是CT扫描解剖解析,利用TotalSegmentator对104个解剖亚结构进行自动分割,并整合为36个主要解剖区域,最终选定18个目标解剖结构用于训练和评估;二是影像报告分解,利用Qwen大语言模型将原始影像报告分解为解剖特异性文本片段,未提及的解剖自动标注为“无显著异常”。

(二)RADAR模型架构

RADAR由三个核心组件构成:视觉编码器、掩码解码器(即解剖感知模块)和文本编码器。视觉编码器采用三维U-Net编码器从CT图像中提取高维特征表示;解剖感知模块是一个分割解码器,能够定位和解剖结构并生成体素级分割图,在端到端训练中自动完成解剖定位,无需外部分割掩码;文本编码器基于BERT-base架构,将对应的解剖亚报告转换为文本特征。训练样本中,视觉分支和文本分支分别被分解为多个解剖特异性组件,使模型在解剖层面学习表示。对于每个解剖结构,RADAR使用可学习的查询令牌通过交叉注意力机制聚合空间特征,形成该解剖的视觉嵌入;文本分支则使用[CLS]令牌的上下文表示作为文本嵌入。

(三)自适应对比学习策略

RADAR采用了自适应对比学习策略来缓解不同患者间语义相似性造成的假阴性问题。对于标记为正常的解剖结构,来自不同患者的表示被作为额外的正样本对以促进特征接近;对于异常病例,利用动量更新的文本编码器估计病理描述之间的相似性,通过软监督对语义相关的异常进行部分对齐。这一策略被整合进对比学习目标中,以提高解剖级图像-文本对齐的鲁棒性。

(四)训练与推理流程

CT体数据统一重采样为1mm×1mm×5mm分辨率,亨氏单位(HU)值裁剪至[−300, 400]并归一化至[0,1]。训练时随机裁剪为96×256×384体素的图像块,仅保留结构完整的解剖参与对齐。模型使用Adam优化器训练30个轮次,在24块NVIDIA H20 GPU上完成,总批大小为48。推理阶段采用滑窗策略,步长为窗口尺寸的一半。对于每个完整解剖结构,通过掩码引导提取对应解剖特征。诊断通过基于提示的查询完成:对每个发现构建正面提示(描述该发现存在)和负面提示(描述其不存在),分别编码后与解剖特异性图像特征计算余弦相似度,取相似度更高者作为预测结果。多期相CT检查中,将平扫、动脉期和静脉期的预测分数取最大值作为最终集成分数。

(五)评估体系

研究建立了覆盖18个解剖结构和146种影像学表现的综合基准。内部测试队列包含39,160例独立时间段(2024年1月至6月)的连续检查;急诊测试队列包含27,267例检查,涵盖17种常见急腹症;外部真实世界测试队列包含来自8个中心的24,239例检查;病理确诊测试队列包含来自两个独立中心的4,333例(涵盖结直肠癌、胰腺癌、胃癌和肝细胞癌);跨人群测试队列使用美国斯坦福医院的公开MERLIN-CT-Test数据集(5,137例)。此外,还进行了包含26名来自14家机构的放射科医生的读片研究。

四、主要研究结果

(一)内部真实世界评估

在39,160例内部测试队列中,RADAR对146种影像学表现的平均受试者工作特征曲线下面积(AUC)达到0.913(95%置信区间0.911-0.915),显著超过次优模型FVLM(0.776),高出0.137(p<0.001)。按18个解剖结构分组,AUC范围为0.838至0.982,几乎在所有结构上均优于对比模型。在功能系统层面(呼吸、骨骼肌肉、泌尿、消化、内分泌、血液和循环系统),AUC范围为0.896至0.964。实质器官(平均AUC 0.918)与空腔器官(平均AUC 0.907)表现均衡;疾病相关发现(0.914)与影像征象相关发现(0.911)表现一致;良性病变(0.910)与恶性病变(0.929)均表现稳健。在17种急腹症的急诊场景中,RADAR未经过急诊数据训练即达到0.904的平均AUC。多期相融合策略取得最佳性能。与监督学习方法比较,RADAR显著优于ViT(0.787)和nnU-Net+(0.868),尤其在低频发现上优势明显。

(二)外部多中心评估

在8个外部中心的24,239例检查中,RADAR平均AUC为0.895(95% CI 0.889-0.900),显著超过次优模型FVLM达0.176(p<0.001)。各中心AUC范围为0.874至0.912。内部与外部中心在超过一半的解剖结构上AUC差异小于0.01,表明模型具有良好的跨机构泛化能力。与内部队列相比,RADAR的AUC仅下降0.018,而监督学习方法ViT下降0.032、nnU-Net+下降0.050,进一步显示RADAR在外部泛化方面的优势。

(三)病理确诊队列验证

在两个病理确诊外部中心(共4,333例)中,RADAR在四种癌症诊断上表现优异:结直肠癌AUC为0.9430.955(中心1/中心2),胰腺癌为0.9840.957,胃癌为0.9220.891,肝细胞癌为0.9450.972。这一结果表明,尽管RADAR最初从影像报告中学习,其诊断能力能够很好地泛化至病理金标准确诊的队列。

(四)跨人群泛化评估

在美国斯坦福医院MERLIN-CT-Test数据集上,RADAR未经过任何微调即在21种范围内发现上达到0.883的AUC,显著优于BiomedCLIP(0.574)、MedGemma(0.555)和Lingshu(0.581),也超过MERLIN在同一数据集上训练后的内部性能(0.812)。经过微调后的RADAR+进一步将AUC提升至0.918,并将诊断覆盖范围扩展至全部30种发现。

(五)读片研究

26名放射科医生(来自14家机构,按经验和医院等级分为四组)参与了两阶段读片研究。未辅助时,医生特异性整体较高(98.8%),但敏感性差异显著,仅3名高年资医生的表现略优于RADAR。在RADAR辅助下,总体敏感性提升10.0%(p<0.001),特异性从98.8%轻度降至98.2%,每例阅片时间减少30.7%(p<0.001)。分层分析显示,顶级医院低年资医生在辅助后达到未辅助高年资医生相当的水平;其他医院低年资医生辅助后敏感性提升10.1%,超过同层级未辅助高年资医生7.0%。在恶性肿瘤检测(+7.3%)、急诊场景(+8.5%)和空腔器官疾病(+9.4%)等关键临床场景中均观察到显著提升。

(六)提示集成与微调策略

数据驱动提示集成策略使内部测试集AUC从0.913提升至0.928(p<0.001)。通过发现提示对齐方法进行监督微调后,内部测试集AUC进一步提升至0.940,外部测试集AUC从0.895提升至0.927(均p<0.001)。

五、研究结论与价值

RADAR是首个基于大规模视觉-语言学习框架、直接利用未经人工标注的临床影像报告训练而成的腹部CT通用AI诊断模型。该模型在涵盖18个解剖结构和146种影像学表现的综合评估中达到了专家级诊断水平,在多个外部中心、病理确诊队列和跨人群队列中展现出稳健的泛化能力。在临床应用层面,RADAR作为辅助阅读工具能够将放射科医生的诊断敏感性提升约10%,同时缩短阅片时间约30%,尤其对低年资医生和资源有限机构的提升效果显著。从科学价值而言,该研究证明了大规模视觉-语言学习为高效开发复杂放射学解读任务的通用AI系统提供了一条切实可行的路径,挑战了“通用模型在特定任务上必然劣于专用模型”的假设。从应用价值而言,RADAR的可提示查询机制使其无需任务特异性再训练即可适应新的诊断目标,具备快速部署于多样化临床场景的能力。

六、研究亮点

第一,RADAR提出细粒度视觉-语言学习框架,将CT体数据分解为解剖单元,在解剖层面实现图像与报告的精确对齐,有效解决了腹部CT诊断信号稀疏导致的跨模态对齐偏差问题。第二,解剖感知模块实现了端到端的解剖定位和分割,无需外部分割掩码。第三,自适应对比学习策略利用跨患者语义相似性校准对比学习,缓解了假阴性问题。第四,训练数据规模宏大——超过42万例检查、1500万个解剖级图像-文本对,且模型性能随数据量增长呈现未饱和趋势,显示进一步扩展的潜力。第五,模型提供了可解释的注意力热图,能够突出与诊断相关的影像区域,为放射科医生提供透明的决策支持,弥补了传统AI“黑箱”问题。第六,在未接受急诊数据训练的情况下,RADAR在急腹症场景中仍保持高水平表现,展现出对陌生紧急场景的强泛化能力。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com