大语言模型在急性缺血性卒中管理中的准确性与推理能力评估:一项多中心回顾性研究
主要作者与发表信息
本研究由Aymen Meddeb等人完成,第一作者与通讯作者Aymen Meddeb隶属于法国兰斯大学医疗中心(CHU Reims)神经放射科及德国柏林夏里特医学院(Charité – Universitätsmedizin Berlin)神经放射科。其他主要研究者来自柏林卒中研究中心、里尔大学医院神经放射科、慕尼黑工业大学诊断与介入放射研究所以及兰斯大学医疗中心神经内科。论文发表于 *Journal of NeuroInterventional Surgery*(JNIS),于2026年以在线优先形式发表,DOI为10.1136/jnis-2026-025429。
学术背景
急性缺血性卒中(acute ischemic stroke, AIS)的及时且准确的治疗决策对于静脉溶栓(intravenous thrombolysis, IVT)和机械取栓(mechanical thrombectomy, MT)至关重要。自2015年里程碑式临床试验以来,机械取栓已成为前循环大血管闭塞所致AIS的标准治疗。然而,大量患者首诊于非专科中心或基层医院,当地医师可能缺乏卒中神经病学或介入神经放射学的专业经验。在此类环境中,分诊决策——尤其是是否启动IVT或将患者转运至综合卒中中心接受MT——需要在时间压力下快速整合临床发现、影像数据和时效性因素。这种复杂性可能导致延误、不适当分诊或错失治疗机会。
大语言模型(large language models, LLMs)在医学知识任务和诊断推理中已表现出较强能力,但其在时间关键型真实世界决策场景(如急性卒中分诊)中的作用尚未得到充分评估。本研究旨在评估当前最先进的LLMs在AIS分诊与管理中的表现,将模型输出与机构实际治疗决策及专家临床评估进行基准对比,并系统分析模型的推理模式与潜在错误来源。研究目标为确定LLMs能否在缺乏即时专家资源的场景中提供可靠、可解释的决策支持。
研究流程与方法
本研究为回顾性设计,遵循TRIPOD-LLM报告规范。研究纳入来自两个欧洲国家两所大学医院(均认证为综合卒中中心)的两个独立数据集共80例AIS病例。第一组数据来自第一所机构2023年9月至12月期间接受MT的AIS患者,第二组数据来自第二所大学医院2023年11月至2024年2月期间的连续患者报告。所有数据收集符合赫尔辛基宣言伦理原则,除患者年龄与性别外,未向LLM传输任何可识别特征。研究获得当地伦理委员会批准,因回顾性性质免除了知情同意要求。
研究将80例AIS病例转化为结构化临床摘要(vignette),包含人口学、临床和影像数据。四款LLMs被纳入评估:DeepSeek R1(通过Together AI,2025年1月版本检查点)、OpenAI o3-mini(版本o3-mini-2025-01-31,通过OpenAI API)、Gemini 2.0 Flash(通过Google AI Studio)以及Llama 3.3-70B-instruct(Meta,通过Together AI)。所有模型于2025年3月使用固定检查点访问,每个病例仅查询一次,采用统一的结构化提示模板:“你是一名卒中专家。患者:[年龄、性别、病史、用药、NIHSS评分、发病时间、影像模态、ASPECTS评分、血管闭塞、侧支状态]。根据当前AIS指南,该患者应接受静脉溶栓、机械取栓还是两者联合?请提供详细推理以支持你的建议。”模型被要求提供治疗建议及临床理由。治疗资格通过不区分大小写的关键词匹配自动提取:若回复包含“thrombectomy”则MT资格编码为阳性,若包含“intravenous thrombolysis”则IVT资格编码为阳性,其余均为阴性。未进行解析后的人工修正。对于具备推理能力的模型(DeepSeek R1、o3 mini),扩展思维链(chain-of-thought)包含在输出中并用于错误分析。解码参数未显式设置,所有模型使用提供者默认值;o3-mini API不支持温度和top-p参数设置,采用固定内部推理强度(默认设置)。未启用检索增强生成、网页浏览或外部工具访问,模型完全依赖参数化知识。
六位人类专家参与了评分任务:两位神经科医师和四位神经放射科医师,均在卒中诊疗方面具有至少5年经验。每位专家独立审阅80份匿名摘要(以相同顺序呈现),并选择一种或多种适当治疗(IVT和/或MT)。回复通过Google Forms收集并编码为二元变量。
以临床病历中记录的最终机构治疗决策作为金标准(ground truth)。对每位评分者(人类或LLM)计算每种治疗类别(IVT和MT)的诊断准确性,将二元预测与金标准比较,然后按组平均。使用Fleiss’ κ评估人类评分者间一致性。补充计算Jaccard指数作为预测与金标准治疗决策间一致性的度量。
为识别失败模式并评估模型生成理由的连贯性,对所有四个LLMs的全部假阳性和假阴性输出进行了结构化定性错误分析。每个错误决策由两位作者(一位第三年神经放射科住院医师和一位有9年经验的顾问神经放射科医师)独立审阅,并归入四个互斥错误类别之一:①关键信息遗漏——LLM未能纳入输入摘要中明确提供的关键临床细节;②指南不依从——LLM的建议与适用的AHA/ASA卒中治疗指南标准相矛盾;③边界病例误分类——涉及真正的临床模糊或灰色地带(如4.5小时延长时间窗内的IVT资格或边缘ASPECTS评分);④建议正确但与金标准不一致——LLM的建议符合已发表指南标准但与机构治疗决策不同,可能反映了治疗团队可获得但结构化输入中缺失的临床信息(如患者偏好、未报告的合并症、实验室或影像发现)。初始评分者间一致性为中等(Cohen’s κ=0.55),所有不一致分类通过讨论达成共识。
主要研究结果
研究队列(n=80)的平均年龄为68.7±14.7岁,女性占51%(n=41)。血管危险因素患病率高,高血压70%、糖尿病11%、心房颤动10%。22%的患者接受抗血小板治疗,17%接受抗凝治疗。入院时NIHSS评分中位数(IQR)为11(5–16),表明中度至重度神经功能缺损。50%的病例(n=40)以MRI作为初始神经影像,使用包含DWI、FLAIR、TOF血管造影和SWI的标准化方案;41%的病例(n=33)接受非对比CT加CTA;6例患者(7%)同时接受两种影像。平均ASPECTS评分为8.2±2.1。
人类评分方面,神经科医师在MT决策上达到81%的准确率,IVT为80%;神经放射科医师MT准确率为84%,IVT为76%。MT资格的评分者间一致性在神经科医师中为中等(κ=0.618),神经放射科医师中也为中等(κ=0.595)。IVT决策中,神经科医师间呈高度一致(κ=0.725),但神经放射科医师间仅呈低度一致(κ=0.374)。全体临床医师的Jaccard指数为0.644,表明与金标准决策在全部治疗方案范围内有高度重叠。
LLM诊断准确率方面,DeepSeek R1在MT决策上表现最佳,准确率为0.87(95% CI 0.80–0.94),Jaccard指数最高(0.512),其次是OpenAI o3 mini(MT准确率0.80;Jaccard 0.473)。Gemini 2.0和Llama 3.3的IVT准确率较低(分别为0.65和0.63),Jaccard评分也较低(分别为0.347和0.285)。在人类和LLM两组中,MT准确率普遍高于IVT准确率,反映了IVT决策复杂性和变异性的增加。
推理评估方面,在MT组中,大多数病例无推理错误,从Llama 3.3的79%到DeepSeek R1的89%不等。MT中最常见的错误类别为“与金标准不一致”,占8–15%(取决于模型),其次为边界病例误分类(1–5%)。指南不依从罕见(%),未观察到任何MT决策中的关键信息遗漏。在IVT组中,无错误率在64%(Llama 3.3)至79%(DeepSeek R1)之间。“与金标准不一致”错误出现在11–18%的IVT病例中,而指南不依从显著更常见,Gemini 2.0和Llama 3.3均达到20%。关键信息遗漏罕见(%),边界病例误分类保持在≤3%。两名患者被排除在错误分析之外:一名拒绝治疗,另一名入组了临床研究。
结论与意义
本研究得出结论:LLMs在AIS治疗决策中表现出专家级水平,尤其是在MT方面,同时提供了可解释的推理。DeepSeek R1的MT决策准确率(87%)和IVT决策准确率(78%)表明生成式人工智能有潜力在高风险、时间关键型卒中诊疗场景中提供决策支持,特别是在无法立即获得专家会诊的环境中。研究支持对基于LLM的决策支持系统进行进一步前瞻性验证,并提示其可能在改善卒中分诊方面具有实用性,尤其适用于缺乏即时专科专业知识的场景。
本研究的科学价值在于:第一,采用多中心异质性数据集增加了外部效度;第二,将LLM性能同时与专家评分者和真实世界治疗决策进行基准对比;第三,系统性地分析了模型推理,要求LLMs提供明确理由而非仅输出二元结果,增强了可解释性和潜在临床信任。应用价值在于,可解释的输出可能促进临床医师信任、支持验证过程,并在资源有限或非工作时段提供教育价值。
研究亮点
研究的重要发现包括:所有组别中MT准确率普遍高于IVT准确率,反映了决策复杂度的根本差异——MT资格主要由明确的影像和临床标准驱动,而IVT决策需要整合多个经常相互竞争的因素(禁忌证、合并症、抗凝状态和精细的时间考虑)。IVT决策在神经放射科医师中仅呈低度一致性(κ=0.374),突显了这些病例固有的模糊性。研究还揭示了LLM错误的不同模式:MT决策中“与金标准不一致”占主导,提示信息不对称(结构化摘要中缺失了影响治疗团队决策的临床变量)可能导致基于指南的LLM推荐与真实世界决策之间的表面矛盾;IVT决策中指南不依从更突出,表明某些模型未能完全整合禁忌证和边界场景。研究的方法学新颖性在于引入了系统的四分类错误分析框架,对模型推理进行了定性评估,而非仅依赖准确性指标。研究的特殊性在于直接比较了具有推理能力的LLMs(DeepSeek R1和o3 mini的思维链可用于分析)与多学科专家团队,并以真实机构决策作为对照标准。
研究同时指出了若干局限性:回顾性设计可能引入偏倚;作为金标准的机构治疗决策本身可能存在变异,且其是否完全符合指南未被正式验证;模型性能不均匀,跨医疗体系的普适性有待建立;指南版本未被明确规定,分析主要依据AHA/ASA 2018/2019标准,而2026年指南已更新;后循环病例数量少(n=10, 12.5%),未能单独分析。未来研究应提供LLMs完整的临床数据集或采用基于共识的专家参考标准来判定指南符合性,明确指定指南版本或纳入检索增强生成,并在后循环卒中队列中进行专项评估。