本研究由Narayanam R. S. Lakshmi Prasanthi、N. Thirupathi Rao和Deva Kumar Salluri共同完成。第一作者与第三作者来自印度Vignan’s Foundation for Science, Technology & Research( deemed to be university)计算机科学与工程系,通讯作者N. Thirupathi Rao来自Vignan’s Institute of Information Technology计算机科学与工程系。该研究于2026年4月24日投稿至*Scientific Reports*,2026年6月25日被接收,以开放获取形式发表,DOI为https://doi.org/10.1038/s41598-026-60100-0。
乳腺癌的早期准确诊断依赖于乳腺X线摄影(mammography)图像中病灶的精确定位和良恶性判别。然而,乳腺病灶在二维乳腺X线图像中常表现为低对比度、不规则边界,并受乳腺密度、成像条件和采集质量等因素影响,使得病灶分割(lesion segmentation)和分类(classification)面临巨大挑战。
传统卷积神经网络(CNN)在医学图像分割中表现良好,但其局部感受野(receptive field)限制了模型对长程上下文信息的建模能力。基于Transformer的模型,如Vision Transformer和Swin Transformer,通过自注意力(self-attention)机制有效扩大了感受野,改进了医学图像分析性能。然而,现有方法在多尺度特征融合方面仍存在不足:简单的特征拼接或跳连接(skip connection)融合可能将中间层中噪声或不稳定的激活传递至解码器,尤其当病灶边缘模糊或不规则时,这一问题更为突出。
近年来,扩散模型(diffusion model)启发的去噪策略在医学图像分析中受到关注,但现有方法多用于图像合成、掩码生成或多步采样,计算开销大。为此,本研究提出Swin-DAFU框架,核心思想是在潜在特征空间(latent feature space)中而非图像或掩码层面,引入轻量级的单步扰动-去噪残差精炼机制,以提升融合特征的稳定性和病灶边界表征能力。研究旨在同时实现病灶分割与良恶性分类,并明确限定评估范围为CBIS-DDSM和RTM两个2D乳腺X线数据集,不涉及多模态数据融合。
研究使用两个乳腺X线摄影数据集。CBIS-DDSM(Curated Breast Imaging Subset of DDSM)为公开数据集,包含10,239幅数字化胶片乳腺X线图像,具有病灶标注、分割掩码及良恶性标签。RTM(Real Time Mammogram)数据集包含10,063幅数字化乳腺X线图像,来自印度安得拉邦和卡纳塔克邦约1,416名患者,图像附带放射科医生标注。所有训练-验证-测试划分均在患者/病例层面进行,以避免数据泄漏。
预处理流程包括:将图像统一缩放至512×512像素,必要时填充以保持纵横比;使用3×3核的Wiener滤波进行降噪;采用限制对比度自适应直方图均衡化(CLAHE),裁剪限值为2.0,网格大小为8×8;通过Otsu阈值法和形态学操作提取乳腺区域,消除背景和标签伪影;最后将像素强度归一化至[0,1],并对Transformer输入应用Z-score标准化。
数据增强策略包括:几何变换(旋转±15°、水平翻转、平移±10%、缩放0.9–1.1倍)、强度变换(亮度与对比度±10%调整、伽马校正0.8–1.2)、高斯噪声注入(σ=0.01)、轻度模糊(σ=0.5)、MixUp增强(Beta分布α=0.2),以及病灶感知增强(lesion-aware augmentation),针对小病灶和类别不平衡进行选择性过采样和局部变换。
输入图像被分割为16×16的非重叠图像块(patch),512×512图像产生32×32=1024个图像块,经线性投影转化为令牌嵌入(token embedding)。这些令牌通过Swin Transformer编码器的多个阶段处理,利用移位窗口自注意力(shifted-window self-attention)在多个尺度上捕获病灶相关空间模式。浅层保留精细边界和纹理信息,深层提取更抽象的病灶级语义信息。
多尺度特征首先进行空间对齐和通道投影,融合为统一的潜在表示,包含浅层边界敏感细节和深层语义信息。随后,DAFU(Denoising-Augmented Feature Fusion Unit)模块对该融合特征进行精炼。具体而言,对融合特征$f$施加受控高斯扰动:$f_n = f + \sigma\epsilon$,其中$\epsilon$为标准正态噪声,$\sigma=0.01$。扰动后的特征$f_n$通过由两个3×3卷积层、批归一化(batch normalization)和ReLU激活组成的轻量级去噪块$D(\cdot)$,并通过残差连接获得精炼特征:$f_r = f + D(f_n)$。该模块仅执行单次精炼,避免多步采样的计算开销。DAFU模块不是传统扩散模型,而是在特征空间中的扩散启发式残差去噪精炼单元。
精炼后的潜在特征输入U-Net风格解码器,通过逐步上采样和跳连接恢复空间分辨率。边界精炼块使用空洞卷积(dilated convolution)改善病灶边缘表征。最终分割头使用1×1卷积和Sigmoid激活生成像素级病灶掩码。分类头对同一精炼特征进行全局池化和全连接层处理,输出良性/恶性二分类概率。分割和分类分支共享精炼表示但具有独立的输出层和损失函数。
采用两阶段训练。第一阶段训练分割通路,使用Dice损失与二值交叉熵(BCE)的组合损失,优化器为AdamW(权重衰减0.01),初始学习率1×10⁻⁴,批大小8,训练200轮,早停20轮,dropout 0.1,梯度裁剪最大范数1。第二阶段训练分类头,使用加权二值交叉熵损失,学习率2×10⁻⁵,批大小16,训练100轮,早停15轮。同时进行5折交叉验证。所有实验在NVIDIA A100 40GB GPU上完成,总训练时间10.2小时,推理时间每样本0.42秒,模型总参数量168.5M,其中可训练参数165.2M。
在CBIS-DDSM上,模型取得Dice系数0.948、IoU 0.892、精确率0.960、召回率0.969、Hausdorff距离1.462mm。在RTM上,Dice系数0.941、IoU 0.883、精确率0.953、召回率0.963、Hausdorff距离1.608mm。两个数据集均采用5,500个测试样本。RTM的Hausdorff距离略高,提示该数据集病灶边界变异性更大。结果表明去噪增强特征融合有效改善了病灶边界表征。
CBIS-DDSM数据集(5,580个图像级样本)上,模型取得准确率0.959、精确率0.950、召回率0.945、F1分数0.947、AUC-ROC 0.995、AUC-PR 0.990。RTM数据集(5,610个样本)上,准确率0.962、精确率0.920、召回率0.910、F1分数0.915、AUC-ROC 0.992、AUC-PR 0.983。CBIS-DDSM在多数指标上略优,RTM准确率稍高,差异可能与数据集特征、图像质量和类别平衡有关。
交叉验证显示CBIS-DDSM上准确率0.988±0.004、AUC-ROC 0.996±0.003;RTM上准确率0.962±0.006、AUC-ROC 0.992±0.004。作者强调这些高AUC值可能受数据集组成、预处理流程和划分方式影响,未进行独立外部验证,结果具有数据集和划分依赖性。
组件级消融表明,移除DAFU残差去噪块导致CBIS-DDSM上准确率下降5.7%(0.959→0.902)、Dice下降3.6个百分点(0.948→0.912),为最大降幅。移除多尺度特征融合、Swin移位窗口注意力、跳连接和U-Net解码器精炼路径也均导致不同程度性能下降。RTM数据集趋势一致。扩展超参数消融显示:DAFU精炼1次为最优设置(0次和2次均较低);噪声强度σ=0.01最佳(σ=0.005和0.02性能下降);注意力引导融合优于简单拼接和相加;Swin编码器深度为“medium”时达到最佳平衡,加深可略微提升性能但增加计算成本。
Grad-CAM可视化提供了定性行为例证。定量分析显示指向游戏准确率(pointing-game accuracy)在CBIS-DDSM和RTM上分别为0.967和0.959,Brier分数分别为0.023和0.029,期望校准误差(ECE)分别为0.014和0.019,表明模型在定位和概率校准方面表现良好。
本研究证明了在潜在特征空间中进行扩散启发的残差去噪精炼可以有效提升乳腺X线病灶分割和分类性能。Swin-DAFU框架的改进并非来自单一组件,而是分层Swin Transformer编码、多尺度注意力融合、残差去噪精炼和U-Net风格解码的协同效应。科学价值在于提出了一种计算高效的中间特征精炼机制,避免了图像级或掩码级扩散采样的高开销,为医学图像分割提供了新的特征精炼思路。应用价值在于为临床乳腺X线病灶分析提供了分割与分类一体化的共享表示框架,有望辅助放射科医生进行病灶定位和良恶性判别。作者明确指出,研究结论仅限于CBIS-DDSM和RTM两个数据集的评估设置,独立外部验证是未来必要工作。
第一,DAFU模块的技术独创性在于将扩散启发的精炼操作应用于融合后的中间特征表示而非输入图像或输出掩码,以单步扰动-去噪残差块实现轻量级特征精炼,计算开销有限。第二,分割解码器与分类头共享同一精炼表示,保持了定位与诊断预测的一致性,降低了架构复杂度。第三,研究进行了扩展超参数消融,系统评估了精炼次数、噪声强度、融合策略、编码器深度、注意力窗口大小和特征维度等多个因素,明确了对性能的独立贡献。第四,研究对泛化边界进行了严格限定,明确指出未使用多模态数据、临床变量或患者元数据,为准确理解研究适用范围提供了清晰界定。