本研究的核心作者包括林安晨(Anchen Lin)、王伟坤(Weikun Wang)、韩海军(Haijun Han)等,通讯作者为周斌斌(Binbin Zhou)。研究团队主要来自杭州城市大学计算机与计算科学学院、浙江大学计算机科学与技术学院以及杭州城市大学医学院。该研究成果发表于《第34届国际人工智能联合会议论文集》(Proceedings of the Thirty-fourth International Joint Conference on Artificial Intelligence, IJCAI-25),是人工智能领域的顶级学术会议。
重度抑郁症(Major Depressive Disorder, MDD)是一种普遍且严重的精神疾病,其临床特征表现为精力与兴趣减退、持续悲伤情绪,甚至产生自杀意念。据世界卫生组织统计,全球有超过3亿人受到MDD的影响,而在中低收入国家,超过75%的患者未能获得及时治疗。临床上,MDD的诊断主要依赖医生主观评估或标准化量表工具,如患者健康问卷(PHQ-9)和汉密尔顿抑郁量表(HAMD)。然而,由于“社会面具”等现象,患者可能低报症状和精神状态,显著增加了误诊或漏诊的风险。与此相对,基于功能性磁共振成像(functional Magnetic Resonance Imaging, fMRI)的非主观诊断方法因其无创特性和优越的空间分辨率而备受关注。
fMRI通过脑图谱(brain atlas)将大脑划分为感兴趣区域(Regions of Interests, ROIs),测量血氧水平依赖(Blood Oxygen Level Dependent, BOLD)信号波动,进而推断脑区间的功能连接(Functional Connectivity, FC),FC已被证实是识别MDD的有效生物标志物。然而,该领域研究面临两大核心挑战:其一,fMRI数据采集成本高昂,导致大多数数据集样本量较小,限制了传统方法有效识别异常FC模式的能力,此即数据稀疏性问题;其二,现有模型往往忽视了将神经科学领域的先验知识(domain knowledge)融入模型设计的潜在价值。例如,抑郁症研究常聚焦于默认模式网络(Default Mode Network, DMN),已有研究表明,MDD患者的自我聚焦反刍思维与该网络的功能异常密切相关。
基于上述挑战,本研究旨在提出一个创新的框架,即在有效缓解数据稀疏性的同时,将DMN特异性知识引入模型,以更准确地捕捉MDD相关的神经活动模式,提升诊断的准确性、鲁棒性和可解释性。
为达成研究目标,作者提出了名为KnowMDD的知识引导跨对比学习框架,其核心流程分为两大部分:基于多图谱的脑功能图构建和知识引导的对比学习。
1. 基于多图谱的脑功能图构建 研究采用来自REST-meta-MDD多站点公共数据集的rs-fMRI数据,主要使用站点20的数据(包含282例MDD和251例正常对照)。为构建互补的脑图表示,研究者使用了三种不同的脑图谱:AAL(116个ROIs)、Harvard(112个ROIs)以及Craddock(200个ROIs)。
对于每位被试,首先根据所选图谱将大脑划分为相应的ROIs,并提取每个ROI内体素级BOLD信号的平均时间序列。随后,通过计算不同ROI时间序列之间的皮尔逊相关系数(Pearson correlation coefficient)来构建FC矩阵。为识别MDD相关的异常连接模式,研究人员对MDD组和正常对照组之间的FC进行配对t检验,并将p值低于预设阈值(如0.05)的连接定义为具有显著差异的潜在异常FC。此外,为应对个体间的临床和病理异质性,年龄、性别等人口统计学信息被编码为病理特征向量,并通过多层感知机(Multi-Layer Perceptron, MLP)与FC矩阵融合,构建出综合性的节点特征,最终生成功能脑图。
2. 知识引导的对比学习 此部分是该框架的核心创新。针对构建的脑图,研究首先引入自注意力(self-attention)机制,通过对FC矩阵进行线性投影获得查询、键和值矩阵,计算注意力权重,以捕捉不同ROI在FC模式中的全局语义关系。
与此同时,框架将DMN的领域知识融入对比学习范式以进行数据增强。具体而言,采用图卷积网络(Graph Convolutional Network, GCN)对脑图进行编码以捕捉潜在的功能异常关系。基于DMN与MDD的已知关联,选择位于DMN内的ROI以及与这些ROI有功能连接的脑区作为核心子图。以DMN节点为起始点进行随机游走编码,生成多条随机路径,从而构建核心子图。之后,通过MLP和池化层,提取出知识引导的子图特征。
至此,对于来自同一图谱的同一被试,可得到两个特征向量:一个是表征全局语义关系的注意力特征,另一个是表征特定生物学意义的DMN子图特征。研究者利用这一特性,设计了跨对比学习(cross contrastive learning)策略。对于一个包含多个被试的数据集,使用两种图谱为每位被试生成四组嵌入向量。跨对比学习将同一被试在不同图谱下的子图特征和注意力特征构造为正样本对,而将不同被试的特征构造为负样本对,并以此计算对比损失函数。最终的模型训练损失函数由跨对比损失和二分类损失加权求和而成,通过迭代更新编码器、子图投影和预测器的参数来优化模型。
研究采用5折交叉验证,并以准确率(ACC)、敏感度(SEN)、特异度(SPEC)和F1分数(F1)作为评价指标,与包括自监督学习方法和基于多图谱的图学习方法在内的9个基线模型进行了性能对比。
1. 基线比较与性能优越性 在站点20数据集上的实验结果显示,KnowMDD在所有评估指标上均展现出卓越性能。特别地,融合Harvard和Craddock图谱的KnowMDD模型取得了74.57%的准确率、78.87%的敏感度和74.06%的F1分数,显著优于次优模型(例如Lee等人的模型准确率为69.59%)。这一结果归功于多图谱跨对比学习框架,它能够利用领域知识和全局语义关系捕捉深层特征,并缓解单图谱视角的局限性。
2. 消融实验验证组件有效性 消融实验进一步证实了各组件的重要价值。基线GCN模型准确率仅为64.53%。逐步加入病理信息(准确率提升至67.59%)和注意力机制后,性能持续提升。而从完整KnowMDD模型中移除病理信息或DMN子图生成模块,准确率分别下降了3.8%和更多。值得注意的是,当同时移除这两个基于领域知识的组件时,模型性能甚至差于基础GCN模型,强有力地证明了融入领域知识是框架高性能的关键。
3. 鲁棒性与可迁移性研究 为评估模型的泛化能力,研究在其他三个样本量较大的站点(站点1、21、25)上进行了实验,结果同样表现出鲁棒性和有效性。更进一步的迁移性研究中,将在站点20上训练好的模型直接应用于数据分布不同的站点21和站点25的数据集,分别取得了64.10%和67.11%的准确率。这种强大的迁移性能归功于病理信息的整合和对比学习,它们共同显著减轻了小数据集中的噪声影响,展示了模型对异质性人群的适应性。
本研究成功提出了KnowMDD框架,这是一种新颖的、知识引导的跨对比学习方法,旨在解决fMRI数据样本稀疏和领域知识利用不足两大难题。该框架通过多图谱构建多视图脑图表示,并创造性地将DMN领域的特异性知识融入对比学习的数据增强过程中,同时利用注意力机制捕获全局语义关系,从而学习出鲁棒且具有生物学意义的表征。大量实验不仅证明了KnowMDD在MDD诊断上的有效性、优越性和鲁棒性,还通过可解释性分析揭示了其背后的神经生物学依据。此外,研究团队还开发了一个演示系统,并在当地医院进行了试用,作为诊断参考工具,这标志着该研究向真实世界部署准确可靠的MDD诊断工具迈出了有前景的一步。
本研究的核心亮点在于其方法论上的创新和对可解释性的深入挖掘。首先,KnowMDD框架巧妙地将神经科学中的领域知识(DMN)嵌入到机器学习模型的设计中,通过知识引导的子图生成,使得数据增强过程不再是盲目的,而是聚焦于具有特定病理意义的核心功能网络,这是区别于传统自监督学习方法的关键创新。其次,跨对比学习策略的设计,允许模型在不同图谱构建的互补视图之间学习一致的判别性特征,有效解决了单图谱信息有限和样本稀疏的问题。最后,研究通过显著性分析,可视化了DMN内部及与其他脑区的异常功能连接,以及注意力机制赋予不同ROI的权重,这些分析不仅验证了模型的有效性,也为MDD的神经病理学机制提供了新的洞见,例如发现了与记忆、情绪调节相关的脑区(如楔前叶、角回)的关键作用及大脑功能偏侧化现象的反映。