本研究由西北工业大学的陈园园(Yuanyuan Chen)、夏勇(Yong Xia),上海科技大学的潘永生(Yongsheng Pan)以及香港中文大学的袁奕萱(Yixuan Yuan)共同完成。该研究成果于2023年12月发表在《IEEE Transactions on Medical Imaging》期刊第42卷第12期上。研究团队针对阿尔茨海默病(Alzheimer’s Disease, AD)多模态医学影像诊断中普遍存在的数据模态缺失问题,提出了一种名为“先解耦,后蒸馏”(Disentangle First, Then Distill, DFTD)的统一框架,旨在利用不完整的多模态数据实现高精度的疾病诊断。
在现代计算机辅助诊断中,正电子发射断层扫描(Positron Emission Tomography, PET)和结构磁共振成像(structural Magnetic Resonance Imaging, sMRI)等多模态医学影像能够提供互补性的功能和结构信息,对于阿尔茨海默病和轻度认知障碍(Mild Cognitive Impairment, MCI)的诊断具有重要意义。然而,由于放射性风险、高昂的扫描成本以及患者依从性问题,在临床实践中获取所有受试者的完整多模态数据极为困难。例如,在阿尔茨海默病神经影像学倡议(Alzheimer’s Disease Neuroimaging Initiative, ADNI)数据库中,所有受试者都有基线sMRI数据,但仅约一半的受试者拥有对应的FDG-PET扫描数据。模态缺失问题给充分挖掘不同模态间的关联带来了巨大挑战,严重阻碍了多模态诊断模型的性能。
现有解决此问题的方法主要分为三类:子空间学习、知识蒸馏和缺失数据填补(Missing Data Imputation)。子空间学习方法为模态完整和不完整的数据分别学习特征空间,但无法在一个统一模型中同时学习。知识蒸馏方法将多模态教师网络的知识传递给单模态学生网络,但同样无法直接利用模态不完整的数据来描绘模态间的相关性。缺失数据填补方法通过生成模型直接合成缺失的整张影像,再用于诊断,但这种方法存在两个主要局限:第一,使用全图进行填补会引入冗余和偏差信息,因为影像中包含了模态间相关(Inter-modality Relevant)和模态内特有(Intra-modality Specific)两种信息,后者无法在不同模态间转换,强行转换会产生噪声;第二,模态填补和疾病诊断通常是两个目标不同的、按顺序执行的子任务,这可能导致次优解。受知识蒸馏和特征解耦(Feature Disentanglement)研究的启发,本研究的目标是克服上述局限性,设计一个能够先解耦出模态间相关信息用于填补,再将多模态知识蒸馏到单模态分支上进行诊断的统一框架,从而仅利用单一模态数据即可实现多模态诊断的效果。
本研究提出的DFTD框架主要包含两个核心模块:区域感知解耦模块(Region-aware Disentanglement Module, M_RAD)和填补诱导蒸馏模块(Imputation-induced Distillation Module, M_IID)。整个工作流程分为训练和推理两个阶段。
1. 研究数据集与预处理 研究使用了来自ADNI数据库的1248名受试者的T1加权sMRI和FDG-PET影像,包含347名AD患者、417名认知正常(Cognitively Normal, CN)者和484名MCI患者。对于AD-CN分类任务,选取了所有时间点标签为AD或CN的受试者影像用于训练,但测试仅使用基线影像。对于MCI向AD的转化预测任务,受试者需在基线时被诊断为MCI,并在18个月后有明确的AD(进展型MCI, pMCI)或仍为MCI(稳定型MCI, sMCI)的诊断标签,该任务仅使用基线影像进行训练和测试。MRI数据经过了一系列预处理,包括AC-PC校正、非均匀强度归一化(N3)、由FreeSurfer软件完成的颅骨剥离和小脑移除等。PET数据则下载了ADNI数据库提供的经过共配准、平均、标准化等预处理的扫描,并使用SPM12工具箱将其配准到对应MRI影像的空间。所有影像最终被调整至256×256×256的体素大小,并进行了强度归一化。
2. 区域感知解耦模块(M_RAD) 该模块旨在将每种模态的影像解耦为“模态间相关表征”(Inter-modality Relevant Representation)和“模态内特有表征”(Intra-modality Specific Representation)。其核心创新在于引入了一个区域感知机制,以突出对诊断有判别力的脑区。 首先,模型通过两个编码器网络f_a ◦ h_a_c和f_b ◦ h_b_c分别从模态A和B中提取模态间相关表征c_a和c_b。为了学习这些表征,研究者设计了一种新颖的区域显著性加权策略。编码器f_a生成的中间特征图被划分为多个非重叠区域,每个区域都有一个可学习的权重ω_a^i,用于衡量该区域对诊断的贡献。然后,通过最大化c_a与另一模态x_b中最具疾病相关性局部区域特征的加权平均互信息(Mutual Information, MI),来优化编码器,确保提取出的c_a具有跨模态的相关性和疾病判别能力。研究采用了基于Jensen-Shannon散度(JSD)的负采样策略来估计和最大化此互信息,从而得到第一个损失函数L_rel。 其次,通过另一组编码器f_a ◦ h_a_s和f_b ◦ h_b_s提取模态内特有表征s_a和s_b。其学习目标是最大化表征与自身模态局部区域特征的加权平均互信息L_spe_MI,同时,在对抗性训练框架下,通过最小化KL散度来最小化s_a与已学到的c_a之间的互信息,确保s_a捕获的是c_a尚未包含的模态特有信息。这部分引入了对抗损失L_a_adv和L_b_adv。这种解耦策略保证只有模态间相关的、可翻译的信息c_a会被用于后续的缺失模态填补,从而避免引入偏差。
3. 填补诱导蒸馏模块(M_IID) 该模块集成了缺失模态填补和多模态知识蒸馏,是框架的另一大创新点。它由一个学生分支S、一个集成教师分支T以及一个横向模态转换单元(Lateral Inter-modality Transition unit, U_LIT)构成。 教师分支T以两种模态的全局特征f_a = [c_a, s_a]和f_b = [c_b, s_b]作为输入,并进行多模态特征融合。其中,横向模态转换单元U_LIT由一个编码器E和一个解码器D组成,它利用从模态A解耦出的模态间相关表征c_a,去估算(填补)缺失模态B的对应表征c'_b,并通过最小化L2损失L_LIT = ||c'_b - c_b||_2进行训练。然后,框架将教师分支特征、学生分支特征以及U_LIT的输在多尺度上进行深度融合。 通过这种设计,DFTD框架能够以一种端到端的方式同时优化填补和诊断任务,避免了传统方法的次优解问题。并且,学生分支S仅以模态A的全局特征f_a为输入。在训练过程中,通过两种方式将教师分支的多模态知识(包含真实和填补的特征)蒸馏给学生分支:一是最小化两个分支软标签(Soft Labels)之间的KL散度L_p_dis;二是最小化两个分支中间层特征之间的L2距离L_f_dis。最终,整个框架的总损失函数L_total包含了解耦模块的损失和IID模块的损失。 在训练阶段,首先使用模态完整的受试者数据训练整个框架,然后用模态不完整的受试者数据进行微调。在推理阶段,仅需要单个模态(如sMRI)的输入,通过训练好的M_RAD模块提取特征,再经由吸收了多模态知识的学生分支S即可完成高精度诊断。
研究者在AD-CN分类和MCI转化预测两个任务上,采用五折交叉验证,将DFTD与六种现有方法进行了性能对比,包括仅使用sMRI的3D-CNN方法、仅使用完整多模态数据的融合网络、子空间学习方法、两种基于生成对抗网络(GAN)的影像填补方法以及一种知识蒸馏方法。评估指标包括曲线下面积(AUC)、平均精度(AP)、敏感性(SEN)、特异性(SPE)和Matthews相关系数(MCC)。
在AD-CN分类任务中,DFTD框架取得了AUC 96.85%、AP 90.23%、SEN 91.73%、SPE 93.69%和MCC 84.21%,所有指标均排名第一。相较于仅使用单模态数据的方法,性能提升显著,证明了多模态信息的重要性。与子空间学习方法相比,AUC提升了4.68个百分点,表明通过填补缺失表征来增加特征的多样性是有效的。相较于两种基于GAN的图像填补方法,AUC也提升了超过1.77个百分点,验证了先解耦再进行填补蒸馏的策略能够进一步提升诊断性能。
在更富挑战性的MCI转化预测任务中,DFTD框架同样取得了最佳性能,AUC达到83.81%,显著优于其他所有方法。这表明区域感知解耦和填补诱导蒸馏的思想对于捕捉MCI到AD转化的细微变化尤为有效。
进一步的消融实验证明了各模块的有效性。当使用全局表征或模态内特有表征而非模态间相关表征进行填补时,模型性能明显下降,尤其使用模态内特有表征时最差,证实了解耦的必要性。加入区域感知机制后,AUC相比不考虑区域信息的模型进一步提高了0.87个百分点。对M_IID模块的消融研究表明,同时使用特征蒸馏和软标签蒸馏能够获得最佳性能,缺少任何一部分或U_LIT单元都会导致性能显著降低。通过特征可视化,研究展示了训练良好的M_RAD模块能够使两个模态的模态间相关表征的分布高度相似且类别边界清晰,而模态内特有表征则明显分离,成功实现了特征解耦。学习到的脑区显著性权重与脑区的实际诊断贡献度也高度一致,显示出框架能够自动定位AD相关的关键脑区。
本研究成功地解决了多模态AD诊断中的模态缺失难题,提出了创新性的DFTD统一框架。该框架的核心价值在于将特征解耦、跨模态填补与知识蒸馏巧妙融合,其科学价值在于明确了模态间与模态内信息的区分对于缺失数据填补的重要性,并提出了一种实现此目标的互信息最大化方法。其应用价值更为突出:DFTD框架在推理阶段仅需单一模态数据即可完成高性能的多模态诊断,这极大地降低了临床应用的硬件依赖和成本,提升了模型的泛化能力和实用性,为在模态缺失常见的大规模临床筛查中部署AI辅助诊断系统铺平了道路。
该研究的亮点首先体现在其独特的两阶段策略:“先解耦,后蒸馏”,从原理上解决了传统填补方法引入冗余信息的弊端。其次,区域感知解耦模块的设计,使得解耦过程聚焦于疾病判别性区域,提升了特征的纯净度和诊断效能。第三,填补诱导蒸馏模块创造性地将缺失模态填补集成到知识蒸馏的过程中,通过跨模态转换单元和多尺度特征融合,在一个统一框架内实现了从缺失数据中学习、填补并整合多模态知识的目标,最终获得一个功能强大但推理高效的单模态诊断模型。