本研究由哈尔滨医科大学附属第六医院的Runze Yu(于润泽)、Miao Peng(彭淼)、Huiying Li(李慧颖)、Simeng Liu(刘思萌)、Tong Su(苏桐)、Hanjie Guan(关涵杰)、Yufeng Shen(沈宇峰)、Yuhui Deng(邓宇辉)和Deli Zhao(赵德利)等人合作完成,其中Runze Yu和Miao Peng为共同第一作者,Yuhui Deng和Deli Zhao为共同通讯作者。哈尔滨市红十字中心医院也为本研究提供了支持。该研究发表于Medicine期刊2026年第105卷第36期,文章编号为e50485,于2026年7月2日投稿,2026年8月17日正式接收。研究得到了黑龙江省重点研发计划项目(编号2023ZX06C13)和国家自然科学基金(编号82502472)的资助。
先天性异常(congenital anomalies)对围产期健康构成重大负担,产前诊断的准确性、及时性和咨询的有效性直接关系到临床管理决策。超声检查是胎儿筛查的一线常规手段,但胎儿磁共振成像(magnetic resonance imaging, MRI)凭借其优异的软组织对比度和多平面成像能力,在颅骨骨化、胎位异常或声学阴影等因素限制超声评估时,能够更精细地刻画胎儿中枢神经系统(central nervous system, CNS)异常,已成为重要的辅助检查手段。然而,胎儿MRI的判读并非简单的图像识别过程,它需要将细微的影像学表现与孕周特异性的神经发育规律、动态演变的胎儿解剖结构以及母胎整体临床背景相结合进行综合解读。因此,胎儿MRI诊断在很大程度上依赖于亚专科化的多学科专家经验,而儿科及胎儿神经放射学专业人才的短缺和分布不均,构成了显著的诊断瓶颈。
大语言模型(large language models, LLMs)在放射学领域作为支持工具日益受到关注。既往研究表明,在输入以文本为主的情况下,LLMs可以辅助报告撰写、印象表述、信息总结和诊断推理。这在临床上具有实际意义,因为许多多学科工作流程并非始于每位参与者独立阅片,而是始于转诊信件、初步影像报告和书面病例摘要。文本诊断推理因此成为一个实际的应用场景:LLMs可以将结构化的影像学发现与临床信息相整合,生成鉴别诊断和面向管理的解读。本研究选取了三款具有代表性的高性能LLMs——ChatGPT5.5、Gemini 3.0和DeepSeek-R1,它们分别代表了不同的技术发展路径:ChatGPT以通用推理能力著称,Gemini强调多模态和长上下文推理,DeepSeek则专门针对高级推理行为进行了优化。研究旨在确定这些模型能否从书面胎儿MRI发现中产生可靠的诊断推理,以及当任务从主诊断识别拓展到鉴别诊断、产前管理建议、预后咨询和安全敏感性沟通时,其输出是否仍然保持临床适当性。
本研究为回顾性单中心诊断准确性研究,纳入2023年12月至2026年1月期间因产前超声怀疑胎儿CNS异常而转诊至哈尔滨医科大学附属第六医院的胎儿MRI病例。研究者回顾了200例接受胎儿脑部MRI检查的患者的放射学报告,最终排除115例(因图像质量不足或伪影影响评估、发育随访不规律或缺失、无明确影像异常、或缺乏确诊的最终诊断评估),纳入85例具有清晰放射学报告且经发育专家确认明确诊断的胎儿CNS MRI病例。每例胎儿的最终诊断由产后影像随访和/或全面的产后临床评估确定,作为后续分析的参考标准。所有MRI检查均在3.0T扫描仪上使用该机构的胎儿神经影像协议完成采集。研究获得机构审查委员会批准,免除书面知情同意。
在提示词设计与模型查询环节,三名具有胎儿影像经验的委员会认证放射科医师独立地从原始胎儿MRI报告中制备标准化自然语言病例摘要,采用统一模板保留关键MRI发现和必要的非识别性临床信息。为防止信息泄露,所有最终诊断标签、暗示诊断的措辞以及产后病理或遗传信息均在被提交给模型前予以剔除。标准化提示词由胎儿影像和发育专家组成的多学科团队制定,统一应用于所有病例,要求模型完成五项任务:(1)给出三个最可能的诊断或鉴别诊断,按可能性排序,并标注每个诊断的置信水平(高、中、低);(2)详细解释诊断推理过程,列出支持首要诊断的关键MRI特征,并简要说明其如何与其他候选诊断相区分;(3)提供临床管理建议,包括建议的后续产前检查、转诊路径或专科咨询及其理由;(4)总结面向胎儿家庭的预后咨询要点,包括潜在的神经发育结局、相关综合征风险和生存相关信息;(5)强调临床医生和家属在解读这些信息时需要注意的重要事项。所有标准化临床摘要和提示词均以中文撰写并直接提交给三个模型。
在响应评估与盲法评分环节,所有模型生成的响应在收集后被匿名化并随机重新标记为“答案1”“答案2”“答案3”,从而对评分者隐藏模型身份。全套响应由三名具有胎儿影像和产前诊断经验的独立评估者进行评估。评分者间信度采用双向随机效应组内相关系数(intraclass correlation coefficient, ICC)的绝对一致性模型ICC(2, 1)进行估计。为减少可能的顺序效应,每个病例生成的三个响应以随机顺序展示。每份响应独立评分,而非直接两两比较。模型性能依据预设的多维评估框架进行评价:主诊断匹配作为二分类结局(不匹配计0分,匹配计1分);四个主要领域采用5点李克特量表评估——诊断准确性(包括主诊断匹配、诊断列表质量和诊断置信度的合理性)、临床推理质量(包括MRI证据质量、鉴别分析深度和逻辑推理)、临床建议实用性(包括产前管理指南依从性、预后咨询合理性和多学科协调全面性)、沟通风格与安全性(包括安全边界意识、不确定性披露程度和患者友好度)。
数据统计分析使用SPSS 26.0软件完成。由于每个病例均由三个模型评估,比较基于配对或重复测量数据。二分类主诊断匹配采用Cochran Q检验,随后进行Holm校正的配对McNemar检验。李克特评分转换至0至1标准化量表后,以均值±标准差和中位数进行汇总,模型间整体差异采用Friedman检验,适当时以Holm校正的配对Wilcoxon符号秩检验进行事后比较。双侧P值小于0.05视为具有统计学显著性。Pearson系数用于在统一度量空间内比较各模型间的相关强度和方向,并以热图形式呈现。
研究共分析了255份模型生成响应(85个病例×3个LLMs)。各评分领域的评分者间一致性良好至优秀,ICC(2, 1)值范围为0.88至1.00。未发现任何模型产生完整的安全拒绝响应或未能提供所要求的排序鉴别诊断。
在主诊断一致性方面,DeepSeek取得了最高的主诊断匹配率,正确识别85例中的66例(77.65%),其次为Gemini(59/85,69.41%)和ChatGPT(52/85,61.18%)。Cochran Q检验显示三个模型间存在显著的整体差异(Q=6.2553, P=.0438),但Holm校正后无配对比较保持统计学显著性。因此,DeepSeek较高的匹配率应被理解为描述性趋势,而非配对优势的确切证据。
在推理质量与响应质量方面,所有四个评估领域均观察到显著的模型间差异(所有Friedman检验P<.001)。DeepSeek展现出最强的诊断性能,其诊断准确性得分(均值=0.751)和临床推理质量得分(均值=0.733)均为最高,且在两个领域中均显著优于ChatGPT(校正后P<.001),对Gemini保持描述性优势。然而,DeepSeek在下游临床转化任务中的相对表现有所下降:在临床建议实用性方面,Gemini取得最高分(均值=0.692),显著优于DeepSeek(均值=0.611;校正后P=.0341)和ChatGPT(均值=0.317;校正后P<.001);在沟通风格与安全性方面,Gemini同样获得最高分(均值=0.518),显著优于ChatGPT(校正后P=.0220)和DeepSeek(校正后P<.001)。值得注意的是,尽管DeepSeek诊断性能最强,其沟通风格与安全性得分反而最低。
探索性相关分析热图揭示了模型特异性的评价指标关联模式。在DeepSeek中,MRI证据质量、鉴别分析深度和逻辑推理与主诊断匹配呈正相关,表明诊断一致性越高,专家评定的推理得分也越高,提示DeepSeek倾向于通过连贯的证据路径而非孤立识别诊断术语来达成正确诊断。在ChatGPT中,诊断列表质量与主诊断匹配、MRI证据质量和逻辑推理呈负相关,说明更宽泛的诊断列表并不一定伴随更好的诊断表现。在Gemini中,逻辑推理与产前管理指南依从性和预后咨询合理性呈正相关。在沟通领域,Gemini的患者友好度与沟通清晰度呈负相关,这一关联应作描述性解释,并不表明共情语言导致了清晰度下降。此外,不确定性披露在所有三个模型中呈现一致模式:不确定性披露程度与主诊断匹配、MRI证据质量和逻辑推理广泛呈负相关,表明更频繁的不确定性表达更多与有限的分析性能相关,而非与校准良好的主动安全行为相关。总体而言,三个模型不仅在绝对性能上存在差异,其内部能力组织结构亦不相同:DeepSeek以紧凑的诊断推理核心为特征,Gemini以较广泛的诊断到管理整合为特征,ChatGPT则表现出更大的指标分离和响应阐述与诊断正确性之间较弱的对齐。
本研究的主要发现是:LLMs在胎儿CNS MRI文本诊断推理中的表现具有多维性和模型依赖性。DeepSeek在诊断准确性和推理质量方面表现最强,但临床建议实用性和沟通安全性方面表现欠佳;Gemini在下游临床转化任务中表现最均衡;ChatGPT在多项指标上相对落后,且表现出诊断列表广度与诊断正确性之间的负相关。这表明单纯的主诊断准确率不足以评价此类系统的临床价值,必须将诊断一致性、推理质量、临床建议实用性、沟通安全性及模型内部指标结构综合纳入考量。
研究的科学价值在于:通过统一提示词架构和盲法多评估者设计,系统比较了三款主流LLMs在胎儿CNS MRI这一高度专业化领域中的文本诊断推理能力,并首次揭示了不同模型内部能力组织结构的差异。研究所采用的“表现解剖学”分析视角——不仅关注模型“答对与否”,更关注模型内部各项能力的耦合方式——为医学LLM评估提供了方法论参考。研究的应用价值在于:明确了LLMs在胎儿MRI领域的近中期合理定位是作为受监督的辅助工具,而非自主诊断或咨询主体。推理导向型模型可帮助整理胎儿MRI特征、提出排序诊断和识别鉴别要点,而沟通表现更强的模型可辅助撰写管理建议或多学科讨论要点,但最终判断和家庭咨询必须由经验丰富的临床医生承担。本研究不支持将LLMs用于自主胎儿MRI诊断、管理决策或患者咨询。
本研究的亮点体现在以下几个方面:其一,研究设计紧密结合真实临床工作流程,采用“文本输入”模式模拟了多学科会诊中基于书面报告的诊断推理场景,具有明确的临床可转化性;其二,评估框架覆盖诊断、推理、管理和沟通四个维度,远超传统单一准确率评估;其三,探索性相关分析揭示了模型内部指标组织结构的差异,为理解LLM行为特征提供了新视角;其四,所有病例均具有产后确认的参考标准,增强了诊断匹配分析的可靠性。同时,研究者坦承了若干局限:单中心回顾性设计、85例样本量有限、仅评估了文本推理而未涉及直接图像感知、未与人类专家或多学科团队进行直接比较、部分终点依赖专家主观判断、以及商用LLM平台持续更新导致结果仅反映特定模型版本的表现。未来研究应在多中心前瞻性队列中验证这些发现,纳入人类专家与LLM及人机协作团队的对照比较,并探索多模态系统整合胎儿MRI序列与结构化临床文本的能力。总体而言,本研究支持将LLMs视为有前景但不完整的胎儿MRI文本推理工具,其临床价值将取决于能否安全整合到专家主导的产前影像工作流程之中。