本研究由来自多伦多大学、Sunnybrook研究所、Scripps研究所、瑞士洛桑联邦理工学院(EPFL)、洛桑大学医院(CHUV)、斯坦福大学及霍华德·休斯医学研究所等多个机构的研究人员共同完成,通讯作者为Maged Goubran。该论文发表于*Nature Methods*期刊,于2025年1月27日在线发表,收录于2025年3月第22卷。
本研究的核心科学问题是:如何在太体素(teravoxel)级光片荧光显微镜(light-sheet fluorescence microscopy, LSFM)数据中实现全脑范围内局部神经元集群的无偏三维映射。光片荧光显微镜结合组织透明化技术(如CLARITY、SHIELD、iDISCO等)已经能够以细胞分辨率对完整啮齿动物大脑进行成像,但随之而来的是数据体量极其庞大(太体素级)且高度复杂的问题。现有的分析流程如ClearMap和MIRACL主要依赖于将数据配准到标准脑图谱(如Allen Mouse Brain Reference Atlas, ARA),再基于预设脑区(region-of-interest, ROI)进行统计分析。然而,这种基于图谱的分区策略存在明显局限:一方面,图谱定义的脑区内部存在高度的细胞异质性,将整个脑区的数据进行平均化会掩盖亚区或层状结构内的局部效应;另一方面,基于体素(voxel-wise)的统计检验在太体素数据上存在假阳性率过高或统计功效不足的问题。近年来深度学习(deep learning, DL)在细胞分割领域取得了显著进展,但现有的深度学习方法(如Cellpose、StarDist、CDeep3M、Delta、cellfinder等)或基于二维模型、或训练数据受限、或仅能进行细胞检测而无法完成三维分割,且均无法提供预测不确定性的估计。针对上述不足,本研究开发了一套名为ACE(Artificial intelligence-based Cartography of Ensembles)的端到端自动化分析流程,旨在以不依赖于预设图谱区域的方式实现全脑神经元活动与形态变化的高精度三维映射。
ACE由三个主要模块构成。第一是分割模块,其核心是一种基于视觉Transformer(Vision Transformer, ViT)的三维深度学习架构,并采用蒙特卡洛dropout(Monte Carlo dropout)技术集成了50个模型的预测结果,以增强鲁棒性并生成逐体素的不确定性图。训练数据来自18只TRAP2-Ai9小鼠的LSFM图像,从中随机选取了15,200个不重复的三维图像小块(patch),每个小块尺寸为96³体素,覆盖约0.35 mm³的组织体积。为生成训练所需的“银标准”真值标签,作者开发了一套半自动标注流程,将MIRACL的分割结果与Ilastik的像素分类结果相结合并进行后处理。作者还训练了一个优化的三维U-Net作为基线模型,以与ViT模型进行比较。在测试集上,ACE的ViT集成模型在多个指标上均显著优于Ilastik,平均Dice相似系数(Dice similarity coefficient, DSC)提高了0.17(p<0.0001),95% Hausdorff距离(HD95)为4.76±3.47,而Ilastik为9.60±6.78。与检测算法cellfinder相比,ACE在检测模式下的F1分数为0.75±0.08,显著优于cellfinder的0.55±0.15。值得注意的是,对cellfinder进行重新训练反而导致整体F1分数下降至0.28±0.12。为验证模型的泛化能力,作者在两个来自不同中心的、异质分布(out-of-distribution)的数据集上进行了测试,这些数据集的细胞标记策略、成像分辨率、显微镜型号均与训练数据不同。在没有进行微调的情况下,ACE在第一个异质数据集上的DSC达到0.73±0.02,而Ilastik仅为0.45±0.12。此外,通过将ViT集成模型与U-Net集成模型组合形成“集成的集成”(ensemble of ensembles),在异质数据集上进一步将DSC平均提高2.1%,精确率提高5.2%,HD95降低15.4%。作者还展示了通过对脚本进行微调,ACE可适配其他细胞标记物(如药物靶点的亚细胞结构成像数据),微调后达到DSC 0.74±0.14。
第二是配准模块,ACE利用作者团队此前开发的MIRACL平台将LSFM全脑数据自动配准到Allen参考图谱。高分辨率分割图首先在原生空间生成,随后通过卷积滤波进行体素化(voxelization),再利用配准获得的形变场将体素化后的分割图扭曲到10 µm分辨率的ARA空间。第三是统计模块,这是ACE最具创新性的部分之一。ACE采用基于阈值自由聚类增强(threshold-free cluster enhancement, TFCE)的聚类级置换检验(cluster-wise permutation test),在体素级ANOVA统计结果的基础上,利用数据的邻域相关性结构自动发现显著聚类。这种方法无需预先定义聚类形成阈值,能够在保持高灵敏度的同时识别脑区和亚区内具有统计学意义的局部变化。ACE输出每个聚类的体积、效应强度及所覆盖的ARA脑区百分比。更重要的是,ACE包含一个原生空间聚类验证算法:将在图谱空间中得到的聚类p值图通过配准变换扭曲回每个被试的原生空间,然后基于每个被试的分割图计算聚类内的神经元数量,并进行事后非参数检验,从而验证聚类结果的可靠性。此外,ACE还能对显著聚类之间的激活进行相关性分析,揭示潜在的区域间功能连接。
在应用验证方面,作者首先将ACE应用于冷诱导觅食行为的全脑c-Fos筛查数据。在该实验中,小鼠分别暴露于4 °C或30 °C环境6小时(每组n=4)。ACE的聚类分析自动发现了先前基于ROI的分析未能识别的多个局部变化:例如位于丘脑室旁核(paraventricular nucleus of the thalamus, PVT)背侧亚区的激活簇,以及紧邻第三脑室上方、位于丘脑中线核团内对应的剑突核(xiphoid nucleus, Xi)区域的激活簇。原生空间验证表明,这些聚类内在冷暴露组的c-Fos阳性细胞数(如23±8)显著高于对照组(6±2,p<0.05)。聚类间的相关性分析还揭示了中线丘脑核团与伏隔核(nucleus accumbens)之间的显著关联,这一发现与先行研究中的顺行病毒示踪结果一致。其次,作者将ACE应用于行走与居家笼对照的小鼠全脑c-Fos数据(每组n=3)。ACE的聚类分析在初级运动区(primary motor area, MOp)和次级运动区检测到了层特异性的c-Fos激活,包括MOp第6a层,这与运动丘脑的丘脑皮层投射目标一致。同时,ACE还在外侧下丘脑区(lateral hypothalamic area, LHA)和中脑网状核中发现了ROI分析未能检测到的局部激活簇,提示这些亚区在运动调控中可能发挥作用。
本研究的主要结论是:ACE作为一种端到端的自动化流程,能够在太体素级LSFM数据中实现不依赖于预设图谱区域的、全脑范围内局部神经元集群的高保真三维映射。其深度学习分割模型在多个异质数据集上表现出优异的泛化能力,其聚类级统计方法能够以高于传统ROI分析和体素级分析的灵敏度检测出亚区及层状水平的神经元活动变化。ACE弥补了现有分析工具在无偏亚区分析和原生空间验证方面的不足,为神经科学研究中从全脑尺度揭示局部神经元集群的激活与连接提供了重要工具。该流程已作为开源资源通过MIRACL平台对外提供,广泛应用于神经科学领域的行为与认知研究。