本研究由来自爱尔兰都柏林博蒙特医院(Beaumont Hospital)诊断与介入神经放射科的Paul McHugh博士及其同事领导,并联合了瑞士巴塞尔大学医院(Basel University Hospital)等机构的研究人员共同完成。研究成果以“One scan, two answers: rapid vs brainomix agreement in thrombectomy patients”为题,发表在学术期刊 Journal of NeuroInterventional Surgery 上,于2026年在线发表。
学术背景 本研究属于急性缺血性卒中神经介入治疗领域,具体聚焦于患者选择的关键技术——计算机断层扫描灌注成像(CT Perfusion, CTP)的自动化后处理软件。自DAWN和DEFUSE-3等关键临床试验以来,基于CTP的灌注不匹配(即缺血半暗带与核心梗死区的体积差异)已成为超时间窗大血管闭塞(Large Vessel Occlusion, LVO)卒中患者进行血管内取栓治疗(Endovascular Thrombectomy, EVT)的重要筛选标准。RapidAI(Rapid)和Brainomix是临床中广泛应用的两种自动化CTP分析平台。Rapid采用基于固定灌注阈值(如相对脑血流量<30%)的算法,并作为DAWN和DEFUSE-3试验的官方软件,其输出结果直接奠定了当前临床指南中治疗阈值的依据。而Brainomix则采用基于机器学习的专有算法。在临床实践中,存在一个隐含假设:不同平台产生的CTP输出结果(如核心梗死体积)是可互换的,因此源自特定平台(如Rapid)验证的治疗阈值(如核心梗死体积<70毫升)常被不加区分地应用于其他平台的输出结果。然而,这两种平台算法基础迥异,且缺乏在真实世界取栓患者队列中直接进行头对头比较的大规模研究。因此,本研究旨在填补这一空白,直接比较Rapid和Brainomix在同一个大血管闭塞取栓患者队列中的CTP输出结果,评估平台间的一致性程度、差异特征及其对治疗决策的潜在影响。
研究流程详述 本研究是一项在单一高容量综合卒中中心进行的回顾性观察性研究。 1. 研究人群与数据收集:研究纳入了2019年1月至2024年12月期间因急性大血管闭塞卒中接受机械取栓治疗且进行了CTP成像的所有连续患者。所有CTP图像均使用同一型号的多层螺旋CT扫描仪按照标准方案采集。核心的纳入标准是患者同时拥有Rapid和Brainomix两个平台处理生成的完整CTP输出数据。排除标准包括:任一平台数据不完整、任一平台自动处理技术失败未生成结果图、或后循环卒中CTP覆盖范围不足。最终,在485名符合条件的患者中,有328名(67.6%)患者拥有完整的双平台CTP数据,构成了主要分析队列。研究前瞻性地从电子病历中收集了患者的基线人口统计学、临床资料(如年龄、性别、美国国立卫生研究院卒中量表评分、发病至成像时间)和影像学变量(如闭塞部位、侧支循环状态、脑白质病变和萎缩评分)。 2. CTP处理与核心变量:所有患者的CTP原始数据均使用Rapid(Ischema View)和Brainomix(e-Stroke Suite)两个软件平台进行独立的后处理分析。Rapid平台使用相对脑血流量<30%和达峰时间>6秒的固定阈值来定义缺血核心和半暗带。Brainomix平台则使用其专有的、基于多参数灌注数据训练的机器学习算法来生成核心和半暗带体积估计。研究从每个平台提取的主要CTP变量包括:缺血核心体积(毫升)、半暗带体积(毫升)以及不匹配比率。为了反映真实世界的临床情况,研究中保留了那些包含可能伪影(如“幽灵核心”)但软件仍成功生成数值输出的处理结果图。 3. 一致性分析与阈值再分类:这是本研究数据分析的核心部分。首先,使用皮尔逊相关系数、斯皮尔曼相关系数、组内相关系数以及Bland-Altman分析来评估两个平台在核心体积和半暗带体积上的一致性和系统偏差。其次,使用预先定义的不匹配标准(半暗带体积减核心体积≥10毫升且半暗带/核心比率≥1.2)对患者进行分类,并通过Cohen‘s kappa统计量评估两个平台在不匹配分类上的一致性。第三,定义“临床显著差异”为核心体积绝对差异>15毫升或相对差异>20%,并计算有此差异的患者比例。此外,还进行了敏感性分析,考察差异超过10毫升、20毫升和30毫升阈值的情况。第四,进行了一项简化的基于阈值的再分类练习:分别应用DEFUSE-3试验(核心体积<70毫升)和DAWN试验(核心体积<50毫升)中的核心体积截断值,仅基于这一体积标准(而非完整的试验入选标准)来判断患者是否符合取栓条件,并计算两个平台判断不一致(一个平台认为符合,另一个认为不符合)的患者比例。 4. 差异预测因素与临床结局分析:研究通过多变量线性回归和逻辑回归分析,探讨了可能预测平台间差异的临床和影像学因素(如年龄、基线卒中严重程度、闭塞部位、侧支循环状态、脑萎缩评分等)。同时,收集了患者的临床结局数据,包括90天改良Rankin量表评分和成功再灌注率,并初步探索了软件差异与临床功能结局之间的关联。 5. 统计方法:所有统计分析均使用Python进行。采用Mann-Whitney U检验、卡方检验等进行组间比较,并进行了按闭塞部位、核心体积类别和侧支循环状态分层的亚组分析。
主要结果详述 1. 基线特征与CTP测量值:纳入的328名患者平均年龄为69.9岁,中位NIHSS评分为13。最常见的闭塞部位是M2段(40.9%)。两个平台报告的CTP体积中位数存在明显差异:Rapid报告的核心体积中位数为4毫升,而Brainomix为10毫升;Rapid报告的半暗带体积中位数为65毫升,Brainomix为80毫升。 2. 一致性分析结果: * 核心体积:两个平台的核心体积总体相关性良好(皮尔逊r=0.82,组内相关系数=0.81)。然而,Bland-Altman分析揭示了显著的系统性偏差:Rapid平均比Brainomix低估了4.9毫升的核心体积。更重要的是,95%的一致性界限非常宽,为-50.5至+40.7毫升,这意味着对于单个患者,两个平台的估计值可能相差高达约90毫升。 * 半暗带体积:半暗带体积的相关性略低(r=0.77,组内相关系数=0.74),系统性偏差更大(Rapid平均低估19.4毫升),且一致性界限更宽(-130.9至+92.0毫升)。 * 不匹配分类:两个平台在不匹配分类上的一致率为91.5%,Kappa值为0.52,表明一致性为中等水平。 * 基于阈值的再分类:当应用DAWN试验的<50毫升核心体积阈值时,有7.0%(23/328)的患者在两个平台的分类上出现不一致;应用DEFUSE-3的<70毫升阈值时,不一致率为3.4%(11/328)。值得注意的是,在大多数不一致病例中(DAWN不一致病例中的13/23,DEFUSE-3不一致病例中的8/11),是Brainomix估计的核心体积超过了阈值(判定为不符合条件),而Rapid的估计值则在阈值之下(判定为符合条件)。 3. **临床显著差异**:20.1%(66/328)的患者出现了临床显著的核心体积差异(绝对差异>15毫升或相对差异>20%)。敏感性分析显示,33.2%的患者差异超过10毫升,6.1%的患者差异甚至超过30毫升。 4. 差异的预测因素与亚组分析:多变量分析显示,基线核心体积本身是预测绝对差异大小的唯一显著因素,核心越大,差异越大。亚组分析揭示了一个关键模式:偏差的方向并非固定不变,而是取决于梗死核心的大小。对于小核心(<20毫升),Rapid倾向于报告比Brainomix更小的体积(平均偏差-8.2毫升);而对于大核心(>50毫升),Rapid则报告比Brainomix更大的体积(平均偏差+10.6毫升)。此外,侧支循环状态不佳(<75%充盈)的患者,其平台间的绝对差异显著大于侧支循环良好的患者(13.0毫升 vs. 7.9毫升)。 5. 与临床结局的关联:在拥有90天随访数据的189名患者中,存在显著核心体积差异的患者在功能结局(改良Rankin量表评分)上有更差的趋势,但此差异未达到统计学显著性。调整基线NIHSS评分和核心体积后,软件差异与90天改良Rankin量表评分无独立关联。然而,作者指出,该分析效力不足,且所有患者均接受了取栓治疗,因此无法评估软件差异对“不治疗”决策可能产生的影响。
结论与意义 本研究得出结论:尽管Rapid和Brainomix两个CTP后处理平台在总体体积估计上具有良好的相关性,但它们并非可互换的工具。平台间存在系统性偏差和宽泛的一致性界限,可能导致约20%的患者出现临床显著的核心体积差异,并在约8.5%的患者中产生不匹配分类的分歧。这种差异在核心体积较大和侧支循环较差的患者中尤为明显。研究的核心科学价值在于,它首次在大规模取栓特异性队列中,系统性地量化并揭示了两种主流商业CTP软件输出结果之间的不一致性,挑战了临床实践中将其视为等效工具的隐含假设。其临床应用价值重大:它强烈提示临床医生,CTP输出结果是平台依赖性的算法估计,而非生物学“金标准”。机械地、不加区分地将基于某一平台(如Rapid)验证的固定数值阈值(如核心<70毫升)应用于另一平台(如Brainomix)的输出,可能导致患者选择的不一致。因此,在制定取栓决策时,应谨慎看待严格的CTP体积截断值,必须将其与更广泛的临床评估(如侧支循环、临床症状、非增强CT表现等)相结合。CTP的彩色编码图应被视为整合入临床决策的辅助信息,而非决定患者资格的最终裁决。
研究亮点 1. 研究规模与针对性:这是迄今为止在取栓患者队列中进行的规模最大的Rapid与Brainomix头对头比较研究(n=328),样本量充足,结果更具说服力。 2. 揭示了非线性的偏差模式:研究最重要的发现之一是偏差方向随核心体积大小而变化的“交叉效应”。这一发现超越了简单的“谁大谁小”的比较,深入揭示了不同算法(固定阈值 vs. 机器学习)在不同病理生理状态(小梗死 vs. 大梗死)下可能存在的系统性差异,对理解软件局限性具有重要启示。 3. 聚焦临床决策影响:研究不仅进行了统计学一致性检验,还紧密结合临床实践,通过“基于阈值的再分类”分析,直观地展示了平台差异如何可能导致实际治疗决策的不同(约3.4%-7.0%的患者可能因使用不同软件而获得不同的治疗推荐),使研究结论具有直接的临床相关性。 4. 探索差异的预测因素:研究分析了侧支循环状态、梗死核心大小等因素与平台差异的关系,为理解差异产生的可能机制(如不同算法对低灌注梯度区域的处理差异)提供了线索。 5. 反映真实世界条件:研究保留了存在技术质量问题但仍能生成数值输出的扫描数据,旨在模拟临床实践中经常遇到的不完美成像条件,增强了研究结果的泛化性和现实意义。
其他有价值的内容 研究在讨论部分还指出,软件算法可能存在未被终端用户知晓的迭代更新(“算法漂移”),这强调了进行持续、本地化的平台间验证是临床质量保证的必要组成部分。此外,研究承认了其局限性,包括缺乏判断“金标准”(如弥散加权成像)、未进行空间重叠分析(无法知晓两个平台是否对相同的体素进行分类)、以及回顾性单中心设计可能影响普适性。这些坦诚的讨论为未来研究指明了方向,例如结合空间分析和最终梗死体积验证的进一步研究。