本研究由Miao Liao(廖苗)、Ruixin Yang(杨瑞昕)、Yuqian Zhao(赵于前)、Wei Liang(梁伟)和Junsong Yuan(袁浚菘)等人完成,主要作者来自湖南科技大学计算机科学与工程学院、中南大学自动化学院以及美国纽约州立大学布法罗分校计算机科学与工程系。论文发表于IEEE Transactions on Image Processing(IEEE TIP),2025年第34卷,文献编号DOI为10.1109/TIP.2025.3602739。
本研究属于医学图像分割领域。医学图像分割在医学图像分析中占据重要地位,可用于器官、肿瘤、血管等特定结构与组织的识别和定位,帮助医疗专业人员进行损伤识别、疾病监测和治疗策略制定。然而,医学图像通常存在对比度低、噪声多、伪影明显等问题,且目标组织形状多样、强度不均、边缘模糊,这要求分割模型具备强大的特征提取和上下文理解能力,尤其是对细小目标和边缘细节的捕获能力。卷积神经网络(CNN)在医学图像分割中表现优异,但其感受野有限,难以捕获长距离依赖关系。视觉Transformer(ViT)虽然擅长建立长距离依赖,但对局部模式的关注不足。已有研究尝试将Transformer集成到CNN框架中,但大多仅进行简单组合,缺乏局部与全局特征的深度融合。此外,多尺度特征提取过程中下采样操作常导致细粒度细节丢失,而医学图像分割对细微纹理和边界特征高度敏感。针对上述问题,本文提出了一种新型混合Transformer网络,称为FocalTransNet,旨在同时实现局部与全局特征的全面提取与深度融合,并在下采样过程中保留细粒度细节。
FocalTransNet的整体结构包括一个分层的焦点增强(focal-enhanced, FE)Transformer编码器和一个级联解码器。编码器采用四阶段分层结构,每个阶段包含一个对称补丁合并(symmetric patch merging, SPM)模块和一个堆叠式FE Transformer模块。SPM模块负责下采样,其核心是一种称为“不破坏下采样”(un-ruining downsampling, URDS)的新方法。在SPM中,输入特征先经过3×3卷积和层归一化以扩展通道数,然后通过两个结构相同的并行URDS分支进行下采样,最后对两分支输出分别执行减法和加法操作。减法操作生成差异图(difference map),用于突出高频细节信号;加法操作用于保留主要特征。URDS的关键在于,它先通过步长为2的3×3卷积和GELU激活函数获得下采样特征图,然后对该下采样图进行上采样并与原始输入相减,得到丢失的细节掩码,再经过3×3核的形态学膨胀和平均池化对细节进行强化,最后将强化后的细节加回下采样特征图,从而补偿下采样过程中的信息损失。堆叠式FE Transformer模块用于特征提取,其设计采用双路径策略,融合自注意力(self-attention, SA)和焦点聚合(focal aggregation, FA)两种机制。SA模块基于十字形窗口多头自注意力(cross-shaped window multi-head self-attention, CSW-MHSA),将特征图分割为水平和垂直条带,分别进行自注意力计算以捕获长距离依赖。FA模块基于焦点调制机制,使用分层深度可分离卷积捕获短距离依赖和局部模式。FE Transformer中还设计了局部增强(local enhancement, LE)和注意力增强(attention enhancement, AE)模块,两者均用于促进双路径之间的数据交互。LE使用交叉区域学习(cross-region learning, CRL)生成交互图,AE使用全连接前馈网络(FFN)生成交互图。通过堆叠多个FE Transformer层,网络能够实现更好的特征表示。编码器输出的多尺度特征被送入级联解码器。解码器也采用四阶段结构,包含上卷积、注意力门(attention gate, AG)、卷积注意力模块(convolutional attention module, CAM)和分割头。AG利用前一阶段特征作为引导,抑制跳跃连接中的无关信息;CAM通过通道注意力和空间注意力机制增强信息丰富的通道和位置;增强后的特征经过1×1卷积生成当前阶段的分割概率图,不同阶段概率图通过加法操作汇总得到最终分割结果。
在实验部分,作者在四个公开医学数据集上对FocalTransNet进行了评估,包括UCSF-PDGM脑肿瘤分割数据集、Synapse腹部多器官分割数据集、ISIC 2018皮肤病变分割数据集和SegPC 2021细胞分割数据集。这些数据集分别涉及MRI、CT、皮肤镜和显微镜图像,分割目标各不相同,可用于验证模型的泛化能力和鲁棒性。训练采用PyTorch框架,在单张NVIDIA 3090 GPU上进行,使用交叉熵损失和Dice损失的混合损失函数,权重系数α设为0.5。不同数据集的超参数设置略有不同,如UCSF-PDGM上学习率为6e-5、批大小为6、训练20轮,Synapse上训练180轮,ISIC 2018上训练100轮,SegPC 2021上训练80轮,优化器均为AdamW,学习率调度均采用余弦退火。训练过程中使用了水平翻转、垂直翻转和随机旋转等数据增强操作,并将输入图像强度归一化到[0,1]范围。
在UCSF-PDGM数据集上,分割目标包括增强肿瘤(enhancing tumor, ET)、坏死肿瘤(necrotic tumor, NCR)和水肿(edema, ED)。FocalTransNet在平均交并比(mean intersection over union, mIoU)和Dice相似系数(dice similarity coefficient, DSC)上取得了最佳结果,在豪斯多夫距离(Hausdorff distance, HD)上排名第二。在Synapse数据集上,分割目标包括主动脉、胆囊、左肾、右肾、肝脏、胰腺、脾脏和胃八个器官。FocalTransNet取得了最佳平均DSC和HD,并在主动脉、胆囊、右肾、肝脏和胰腺上获得了最高的个体DSC。在ISIC 2018数据集上,FocalTransNet取得了95.03%的准确率、91.71%的精确率、90.38%的DSC和87.96%的mIoU,均优于对比方法。在SegPC 2021数据集上,FocalTransNet取得了91.06%的精确率、91.68%的敏感性、90.74%的DSC和91.07%的mIoU,同样优于对比方法。消融实验表明,引入SPM模块可使DSC平均提升4.00%,HD降低8.53mm;使用FE Transformer可使DSC提升2.51%,HD降低6.94mm。在解码器中,AG模块在UCSF-PDGM和Synapse上分别带来0.67%和0.36%的DSC提升,CAM模块分别带来0.71%和0.88%的DSC提升。此外,SPM与其他下采样策略(最大池化、双线性插值、步长卷积、线性投影)相比,取得了最高的DSC分数,且SPM可作为即插即用模块应用于TransUNet、UCTransNet、TransCascade、SwinUNet和MissFormer等模型中,显著提升分割性能。频率分析表明,差异图包含更多高频信号,有助于突出细节、纹理和边缘。FE Transformer与Swin Transformer、CSWin Transformer、焦点调制块和ConvNeXt块相比,在Synapse数据集上取得了最高分割精度和最低计算成本。不同交叉连接配置的实验显示,在LE和AE中同时引入交叉连接可获得最佳性能。
本研究的结论是,FocalTransNet通过SPM模块在下采样过程中保留细粒度细节,并通过FE Transformer实现局部与全局特征的全面提取和深度融合,在腹部多器官、脑肿瘤、皮肤病变和癌细胞等多种医学图像分割任务上均取得了优于现有最先进卷积网络、Transformer网络和混合网络的精确且稳定的分割结果。本研究的科学价值在于提出了一种新的CNN-Transformer混合特征提取策略和一种新的细节保留下采样方法,解决了现有混合网络中局部与全局特征融合不充分以及下采样细节丢失的问题。应用价值在于FocalTransNet可用于多种医学图像分割场景,辅助医生进行病灶识别、器官定位和疾病监测,具有较好的泛化能力和实用性。本研究的亮点包括:FE Transformer的双路径结构和密集交叉连接设计实现了局部与全局特征的深度交互;SPM模块通过URDS和差异图机制有效保留高频细节;SPM具有即插即用特性,可推广至其他分割模型;在多个公开数据集上的综合实验验证了方法的有效性和鲁棒性。
此外,作者还讨论了模型的局限性。FocalTransNet作为全监督方法需要大量标注数据,而医学图像标注成本高且质量难以控制。未来可结合无标签数据和自监督技术进一步优化模型。对于罕见疾病数据获取困难、数据集规模小的问题,作者计划引入基于条件扩散模型的生成式数据增强策略,合成多样化的罕见病例样本用于训练,并通过去噪预训练策略提高模型对罕见病例的分割精度。