作者:Yi Hao Chan、Deepank Girish、Sukrit Gupta、Jing Xia、Chockalingam Kasi、Yinan He、Conghao Wang、Jagath C. Rajapakse
第一作者单位:新加坡南洋理工大学计算与数据科学学院
发表期刊:NeuroImage
发表时间:2025年8月29日(在线发表)
文档类型:系统综述
本综述系统性地探讨了图神经网络(Graph Neural Networks, GNN)在静态态功能磁共振成像(resting-state functional MRI, rs-fMRI)数据中的应用,特别聚焦于如何利用这些模型及其可解释性技术来发现精神疾病(psychiatric disorders)的稳健生物标志物(biomarkers)。研究指出,尽管GNN在疾病分类任务中性能卓越,但现有的大部分研究在评估其所识别的潜在生物标志物的稳健性时存在严重不足,通常仅限于与现有文献进行主观且不一致的交叉引用。为此,本文提出了一个全新的评估框架,并对65项相关研究进行了回顾,旨在为该领域未来的研究奠定基础。
综述首先介绍了研究背景与方法论。精神疾病通常表现为大脑功能连接(functional connectivity, FC)的异常,而rs-fMRI作为一种客观量化手段已被广泛应用。然而,由于疾病异质性、个体差异、效应量小、噪声以及数据采集站点效应等因素,该领域至今未能找到强健且可重复的生物标志物。近年来,随着大型数据集的涌现和深度学习技术的发展,特别是GNN的出现,为该领域带来了转机。GNN能够自然地处理图结构数据,非常适用于对脑网络进行建模。为了全面审视现有文献,作者团队于2024年10月9日对PubMed和Scopus数据库进行检索,经过严格的人工筛选,最终纳入了65篇使用GNN并报告了注意力缺陷/多动障碍(ADHD)、自闭症谱系障碍(ASD)、重度抑郁症(MDD)和精神分裂症(SZ)潜在生物标志物的研究。
在建模与可解释性技术方面,综述对现有工作进行了深入剖析。文章首先总结了将fMRI数据抽象为图结构的两种主流范式:脑图(Brain Graph)和群体图(Population Graph)。脑图将每个脑区或感兴趣区(ROI)作为节点,以其连接轮廓或局部特征作为节点特征,边则代表脑区间的功能连接强度。群体图则以个体受试者为节点,利用人口学或影像学特征的相似度构建边。大多数研究采用静态功能连接和脑图范式,并以AAL图谱作为脑区划分的依据。在GNN模型架构上,综述将最先进的定制化方法归纳为三大类:一是从输入层面,如学习数据表征、引入高阶超图信息或多视角融合;二是修改消息传递和池化机制以贴合生物先验知识,例如按大脑半球或功能模块进行聚合;三是在训练过程中施加约束,例如利用模块度约束或自监督学习来提升模型的泛化能力和稳健性。尽管这些创新设计在基准测试中表现出色,但也带来了模型参数量增大、跨图谱结果难以调和等问题。
文章继而系统性地梳理了应用于GNN的特征归因(feature attribution)技术,即模型可解释性方法,并将其分为自解释性(self-interpretable)和事后解释性(post-hoc)两大类。自解释性方法通过模型架构设计本身来产生重要性分数,如通过结构约束的因子GNN、基于信息约束的图信息瓶颈(GIB)、基于图池化的BrainGNN以及基于注意力的图注意力网络(GAT)。事后解释方法则在模型训练后施加,包括基于梯度的积分梯度(IG)、基于分解的逐层相关性传播(LRP)、基于扰动的GNNExplainer以及基于代理模型的LIME等。综述强调,这些归因方法在不同粒度(节点、边、子图)上识别重要特征,各有优劣。尤其值得注意的是,尽管注意力机制在文献中被广泛用作解释工具,但自然语言处理领域的研究已对其忠实性提出质疑,这一争论同样值得在生物标志物发现领域引起高度警惕。
综述的核心贡献在于,它不仅回顾了“是什么”,更深入探讨了“怎么评”。针对当前研究缺乏客观稳健性评估的痛点,作者提出了一个名为“Hi-5”的五级层次化稳健性评估框架。该框架综合考量了预测器(predictor)、归因器(attributor)和数据三个核心要素对归因分数的影响。一个理想的生物标志物发现流程应逐步满足五个层级的标准:第一级,在测试集上达到最先进的(SOTA)分类性能;第二级,证明所用归因方法能通过参数随机化等健全性检查(sanity checks),并具备完整性(Completeness)、一致性(Consistency)、紧凑性(Compactness)等评估指标所示的相对稳健性;第三级,将发现的显著特征与同样通过前两级验证的其他研究进行交叉验证;第四级,在独立外部数据集上取得SOTA表现,且生物标志物被再次发现;第五级,通过荟萃分析(meta-analysis),证明该生物标志物在考虑不同预处理流程和图谱差异后依然有效。基于此框架,大量现有研究仅停留在第一级,而少数研究开始涉足第二级,跨研究可重复性的评估则非常欠缺。
在应用发现部分,综述逐一总结了GNN在四种精神疾病中的应用现状。结果显示,尽管各项研究的模型分类准确率较高(平均75.7%),但通过特征归因分数筛选出的重要脑区或功能连接在不同研究间差异巨大,可重复的生物标志物非常有限,仅局限于少数脑区,且几乎没有发现跨诊断(transdiagnostic)的生物标志物。这一发现有力地印证了现有评估标准主观且不稳定的核心论点。
这篇综述明确指出,目前GNN在fMRI生物标志物发现领域的应用仍处于初级阶段,其瓶颈不在于预测模型的分类精度,而在于缺乏客观、统一的稳健性评估框架。文章的深远价值在于,它不仅为神经影像研究者提供了关于GNN架构与可解释性技术选择的详尽路线图,更重要的是,它提出的“预测-归因-评估”框架和具体的量化评估指标(如保真度、稳定性、紧凑性),为终结该领域“各说各话”的现状指明了方向。通过呼吁建立基于客观指标的新标准,该综述有望推动该领域从单纯追求模型性能,转向发现真正具有临床转化价值的、可重复的神经影像生物标志物。