本研究题为《通过深度坍缩非参数冯·米塞斯-费希尔混合模型进行基于聚类的大脑功能分割》(Clustering-based brain functional segmentation via deep collapsed nonparametric von Mises-Fisher mixture models),由Wentao Fan(通讯作者)、Wenchuan Zhang、Xiao Dong以及Nizar Bouguila共同完成。四位作者分别来自北京师范大学-香港浸会大学联合国际学院(珠海)的广东省/珠海市关键实验室IRADS及计算机科学系,以及加拿大康考迪亚大学(Concordia University)的Concordia Institute for Information Systems Engineering (CIISE)。该论文已发表于《Expert Systems with Applications》期刊,并于2025年9月15日在线发布。
功能磁共振成像(functional magnetic resonance imaging, fMRI)作为一种无创的脑活动测量技术,通过检测脑血流变化产生高分辨率图像,反映局部神经激活,已确立了其在脑功能研究中的主导方法地位。fMRI数据分析是多方面的,其中一个重要方向是大脑功能分割(brain functional segmentation),旨在根据共享的功能属性将大脑皮层划分为不同的子区域。这些子区域为理解大脑组织、研究功能连接(functional connectivity)和网络动力学提供了关键洞见。
然而,传统聚类方法在处理现代fMRI数据集的高维性和复杂性方面面临日益增长的挑战。尽管已有研究将卷积神经网络(CNN)和堆叠自编码器(Stacked Autoencoders)等深度学习方法应用于fMRI分析,但大多数现有模型忽视了fMRI时间序列的时间动态性(temporal dynamics),当使用传统全连接或卷积架构时,会导致宝贵的序列信息丢失。此外,传统变分自编码器(Variational Autoencoder, VAE)通常假设潜空间服从高斯分布,这在处理经过L2归一化的球面数据(如fMRI信号)时存在局限,可能导致“原点吸引”问题(origin attraction),从而使各聚类中心向原点收敛,影响聚类效果。
因此,该研究旨在提出一个基于聚类的全脑功能分割框架,包含表示学习(representation learning)与大脑功能分割两大模块,以解决上述现存方法的不足。
该研究的整体工作流程包含三大步骤:数据预处理、表示学习、以及大脑功能分割。
步骤一:数据预处理 研究使用了公开的注意力缺陷多动障碍(Attention-Deficit Hyperactivity Disorder, ADHD)数据集。该数据集包含40名年龄在7至21岁之间的受试者的静息态fMRI数据。选择该年龄段是因为7岁前人脑已基本发育完成,脑重与成人相当,保证了实验的一致性。每个受试者的fMRI数据为四维,其中三维为61×73×61体素组成的脑图像,另一维为时间序列特征。预处理流程包括:1) 线性去趋势处理(linear detrending)以确保时间序列特征的稳定性;2) 空间平滑处理以降低磁共振图像中的随机噪声;3) 标准化处理以实现数据的L2归一化。经预处理后,体素总数为63,146。空间平滑尺寸统一设定为15毫米。
步骤二:通过球面变分递归自编码器进行表示学习 这是该研究的第一个核心模块。研究提出了名为球面变分递归自编码器(Spherical Variational Recurrent Autoencoder, SVRAE)的新型深度生成模型。
SVRAE的创新性体现在两个方面:首先,它假定潜空间的先验分布为冯·米塞斯-费希尔分布(von Mises-Fisher distribution, vMF),而非传统VAE采用的高斯分布。vMF分布非常适合对L2归一化的球面数据进行建模,将所有数据点映射到单位超球面上,从而解决了“原点吸引”问题,确保聚类中心间的间隔足够大。其次,为更好地捕捉fMRI数据中的时间相关性,SVRAE将标准全连接层替换为长短期记忆网络(Long Short-Term Memory, LSTM)。在SVRAE架构中,概率编码器(probabilistic encoder)和概率解码器(probabilistic decoder)均采用了LSTM。编码器通过LSTM网络估算潜变量z的vMF分布参数(均值方向和浓度参数),解码器同样利用LSTM网络根据采样的z生成重构数据。
模型优化采用随机梯度变分贝叶斯(SGVB)估计器和Adam优化器(学习率设为1e-3,权重衰减2.5×10⁻⁵)。为解决从vMF分布中采样的离散性问题,研究使用了基于拒绝采样(rejection sampling)的重参数化技巧。整个表示学习过程通过联合最小化证据下界(Evidence Lower Bound, ELBO)中的重构项和KL散度来完成。网络的编码器结构为:输入层(176维fMRI数据)→ LSTM层(64单元,Dropout 0.2)→ 扁平化层 → 全连接层(10维输出与softplus激活),解码器则为:输入层(10维潜变量z)→ 全连接层(176维)→ LSTM层(128单元,Dropout 0.2)→ 全连接层(最终输出)。
步骤三:通过坍缩非参数vMF混合模型进行大脑功能分割 在获得fMRI数据的低维表示(即特征向量Z)后,研究进入第二核心模块:坍缩非参数冯·米塞斯-费希尔混合模型(Collapsed Nonparametric von Mises-Fisher Mixture Model, Co-vMFMM)。
Co-vMFMM建立于贝叶斯非参数框架(Bayesian nonparametric framework)之上,具体采用狄利克雷过程混合模型(Dirichlet Process Mixture Model, DPMM),这允许模型自动适应输入数据的复杂度,无需预先指定聚类数量K。模型构建采用棍折表示(stick-breaking representation)来生成无限混合成分。参数先验采用vMF-Gamma分布。
Co-vMFMM的另一大创新是“坍缩”操作(collapsing),即在模型学习过程中,将混合系数(mixing coefficients)等参数边缘化掉(marginalized),在坍缩的参数空间中直接进行推断。这样做的好处是减少了需估计的参数数量,可提升模型性能。为此,研究开发了一种高效的坍缩变分贝叶斯(Collapsed Variational Bayes, CVB)学习算法来进行推理。在CVB中,模型采用平均场假设(mean-field assumption)对变分后验分布进行因式分解,并引入截断技术(设定一个有限的最大成分数K)以便于计算。所有变分后验参数(包括责任度r_ik、后验vMF参数的后验均值方向和标量)均有闭合形式的更新公式,推导过程中采用了0阶泰勒展开来近似对数和修正贝塞尔函数的期望,排除了自身的统计量(如n¬ik)进行计算以保证算法的正确性与效率。
研究使用Calinski-Harabasz(CH)分数和Davies-Bouldin指数(DBI)作为聚类性能的评估指标,CH值越高、DBI值越低表示性能越好。实验分为单受试者分析和组受试者分析两种设置。
在单受试者分析(前三名受试者)和组分析(前三名与前六名受试者的数据聚合)中,SVRAE+Co-vMFMM组合在所有指标上均一致且显著地优于所有比较方法。比较方法包括两大类:一类是直接对原始数据聚类(如K-means、GMM、vMFMM);另一类是先用不同深度生成模型(如AE、VAE、RAE、VRAE)学习表示,再用K-means聚类。实验结果表明,SVRAE的表示学习能力(以带星号方法,即用K-means聚类所学表示的结果衡量)本身就已超过所有其他表示学习方法,而Co-vMFMM的聚类性能(与原始数据输入的其他聚类方法比较)也表现优越。两者的结合(SVRAE+Co-vMFMM)产生了最佳的协同效应,验证了这两个模块的互补优势。
消融实验进一步证明了各模块的优势。通过可视化不同训练轮次下基于不同模型所学表示的K-means分割结果,以及展示基于SVRAE表示的各类聚类方法的效果,直观地证实了SVRAE学习和Co-vMFMM分割的优越性。
研究利用后验概率q(k|z)对大脑功能子区域进行可视化。对比结果显示,传统方法如RAE的分割结果呈现碎片化,部分子区域未被完全覆盖;VRAE虽有改进但仍存在缺陷。相比之下,本研究的方法能够清晰、准确地分割出功能子区域。在组受试者实验中,方法成功提取了四个截然不同且轮廓清晰的脑区。进一步与已知的AAL脑图谱(Automated Analytical Labeling atlas)对比,研究结果准确对应了右侧岛叶皮质(Right Insular Cortex)、右侧辅助运动区和前辅助运动区(Right SMA and pre-SMA),并能清晰区分细胞结构不同的SMA与pre-SMA,以及右侧角回(Right Angular Gyrus),证明了分割结果的解剖学准确性。
此外,研究通过Dice系数(DC)评估了分割结果的个体内可重复性和个体间差异。结果显示,不同受试者之间存在一定重叠(DC约为0.6),但个体差异依然存在;而单个受试者与组模板之间的DC值相对接近(约0.59-0.61),表明组水平分析能缓解个体差异,建立更具泛化性的脑图谱模板。
该研究成功提出了一个用于fMRI数据分析的、基于聚类的全新大脑功能分割方法。该方法的两大模块协同工作:SVRAE模块通过整合VAE与LSTM,并采用球面潜空间,有效捕获了fMRI数据中的时间依赖性和几何结构;Co-vMFMM模块则凭借非参数贝叶斯框架和坍缩变分推断,实现了无需预设聚类数目的自适应脑区分割,且学习算法具有闭式解的高效特性。
该研究的科学价值在于为高维时序神经影像数据的表示学习提供了新范式,并通过非参数贝叶斯模型解决了聚类数自动确定的核心问题。其应用价值在于为构建精确的大脑功能图谱、辅助脑疾病诊断与治疗、研究脑功能网络等提供了有力的计算工具。