分享自:

WA-UKAN:用于医学图像分割的小波增强注意力Kolmogorov-Arnold网络

期刊:Signal Processing: Image CommunicationDOI:10.1016/j.image.2026.117534

本文提出了一种用于医学图像分割的新型网络架构WA-UKAN(Wavelet-enhanced Attention Kolmogorov–Arnold Networks,小波增强注意力柯尔莫哥洛夫-阿诺德网络)。该研究由河南师范大学计算机与信息工程学院的刘尚旺(Shangwang Liu)和王坤(Kun Wang)完成,论文发表于 Signal Processing: Image Communication 期刊第145卷,文章编号117534,于2026年3月23日在线发表,并可在ScienceDirect平台获取。

从学术背景来看,该研究属于医学图像分割领域。U-Net作为该领域的基石架构,通过引入多层感知机(MLP)已显著提升了分割性能,但现有模型在建模复杂非线性模式方面能力有限,且传统跳跃连接在编码器下采样过程中会造成局部细节丢失。近期提出的U-KAN采用KAN(Kolmogorov–Arnold Networks,柯尔莫哥洛夫-阿诺德网络)层以更好地捕获图像中的复杂非线性关系,但其核心的Spl-KAN层过度依赖B样条的局部平滑拟合特性,只能通过增加样条节点数量来提升拟合精度,导致参数冗余,且难以充分捕获数据中的高频细节信息。Wav-KAN虽然将B样条函数替换为具有时频局部化和多分辨率特性的小波函数,但其本质上仍是对MLP的替换式设计,且对小波变换的利用仅停留在逐元素映射层面,忽略了小波变换多分辨率分析的核心优势。基于上述问题,本文提出了WA-UKAN架构,旨在通过深度整合小波多分辨率分析与注意力机制,解决高层特征中细节信息丢失的问题,并在计算成本与分割精度之间取得更好的平衡。

该研究的工作流程主要包括三个核心模块的设计与集成。首先是WA-KAN模块(Wavelet-enhanced Attention Kolmogorov–Arnold Network,小波增强注意力柯尔莫哥洛夫-阿诺德网络模块),其被部署在编码器的第四和第五层,用于替代传统的标准卷积块。该模块首先对输入数据进行归一化处理,然后利用Morlet小波函数对特征进行时频编码,其公式定义为 ψ(x_Morlet) = e^(−x^2) cos(5x)。接着,经过小波变换后的特征通过尺度自适应调制机制与高频滤波器相结合,以筛选关键细节分量。每个输入节点通过多个小波函数与多个WA-KAN节点相连,节点输出由公式 x_j = Σ_i w_ji ψ((x_i − τ_ji)/σ_ji) 计算。随后,经过小波处理的输出通过批归一化(Batch Normalization)和ReLU激活函数处理。为了动态聚焦关键特征区域,该模块引入了高效通道注意力(ECA,Efficient Channel Attention)机制,通过全局平均池化(GAP)获得聚合特征,经通道维度映射自适应确定一维卷积核大小k,生成通道注意力权重,并与原始特征图逐元素相乘,最终将小波处理输出与ECA模块输出通过逐元素加法融合,从而有效结合小波变换的多尺度分析、去噪能力与注意力机制的关键特征聚焦能力。其次是LOFA模块(Low-Order Feature Aggregation,低阶特征聚合),部署于跳跃连接路径中,负责对编码器端卷积块输出的低阶特征进行聚合与精炼。该模块采用轻量化设计,由3×3深度可分离卷积层、1×1逐点卷积层、通道注意力模块和残差连接组成,在捕获低阶特征局部空间相关性的同时实现跨通道聚合,并通过通道注意力模块自适应重校准通道权重,强调高信息量低阶特征分量并抑制冗余噪声。第三个模块是WDMAF(Wavelet Dual-branch Multi-scale Attention Fusion,小波双分支多尺度注意力融合),该模块通过离散小波变换(DWT)将输入特征图沿通道维度分解为低频分量(保留全局结构)和高频分量(提取边缘、纹理等细节信息)。采用Haar小波进行一级分解后,低频部分尺寸为 H/2 × W/2 × C,高频部分尺寸为 H/2 × W/2 × 3C。高频分量进一步分解为水平细节、垂直细节和对角细节三个子带,并沿通道维拼接。随后对高频和低频分量分别进行1×1卷积调整通道数,经LayerNorm归一化后送入独立的多尺度映射模块,利用多尺度条形卷积核(1×7、1×11、1×21及其转置)进行差异化特征捕获,并生成查询(Q)、键(K)、值(V)分量。为打破传统双分支模块中高-低频信息隔离,WDMAF引入跨分支注意力机制,Q1与K2相关、Q2与K1匹配,通过点积计算注意力权重并经缩放因子√d_k归一化后与相应的值分量相乘,实现跨频特征互补。跨分支注意力输出经3×3卷积精炼后沿通道维拼接,再经深度可分离卷积进行轻量化变换,与初始特征X沿通道维拼接后经LayerNorm标准化得到最终输出。此外,不同层级的WDMAF模块之间通过高效下卷积块进行渐进下采样,实现跨尺度信息的精确对齐与互补融合,进一步提高特征表示质量。

在实验部分,该研究使用了三个公开医学图像分割基准数据集进行验证:BUSI(Breast Ultrasound Images Dataset,乳腺超声图像数据集),包含647张图像,统一调整为256×256;CVC-ClinicDB(Colorectal Cancer-Clinic Dataset,结直肠癌临床数据集),包含612张结肠镜图像,调整为256×256;GlaS(Gland Segmentation,腺体分割数据集),包含165张结直肠腺体组织图像,调整为512×512。所有实验在Python 3.10和PyTorch 1.13.0环境下运行,使用NVIDIA GeForce RTX 2080 Ti GPU(显存扩展至22G),批大小设为8,采用Adam优化器,初始学习率为0.0001,使用余弦退火策略,损失函数结合二元交叉熵和Dice损失,每个数据集按80%训练集和20%验证集随机划分,训练轮数设为400。评估指标包括IoU、DSC、Recall、Precision和HD95。对比实验涵盖了U-Net、Attention U-Net、U-Net++、U-Next、TransUNet、Rolling-UNet、U-Mamba、VM-UNet和U-KAN等多种主流方法。结果显示,在BUSI数据集上,WA-UKAN取得了IoU 67.06%、DSC 79.53%、Recall 78.37%、Precision 81.29%和HD95 4.03mm的最佳成绩,相比U-Net在DSC上提升了6.4%,相比U-KAN在IoU上提升了1.18%。在CVC-ClinicDB数据集上,WA-UKAN同样全面领先,DSC达93.21%、IoU达85.79%、Recall达91.86%、Precision达94.97%、HD95降至1.45mm。在GlaS数据集上,WA-UKAN的IoU为88.81%、DSC为94.76%、Recall为95.61%、Precision为95.57%、HD95为0.79mm,在Recall和Precision上均超过了所有对比方法。消融实验表明,使用3个WA-KAN层时模型性能最优;将WA-KAN替换为Wav-KAN或Spl-KAN均会导致各项指标显著下降,验证了WA-KAN中注意力机制与小波变换融合设计的有效性;通道数配置{32, 64, 128, 256, 512}在计算成本与性能之间取得最佳平衡。在计算复杂度方面,WA-UKAN仅需17.24G FLOPs和9.02M参数,显著低于U-Mamba(2087G FLOPs,86.30M参数)和U-Net(524.2G FLOPs,34.53M参数),虽略高于U-Next和Rolling-UNet等轻量模型,但实现了更优的模型规模与分割性能权衡。

该研究的结论表明,WA-UKAN通过将小波变换和注意力机制整合到传统U-Net框架中,有效提升了医学图像分割性能。该模型利用小波变换的多分辨率分析能力捕获并融合图像的全局结构和局部特征,在处理具有复杂纹理和细节的医学图像时表现尤为出色。注意力机制的进一步整合使模型能够在特征提取过程中动态聚焦最相关的方面,在噪声和不均匀性处理上展示了优越性能。可解释性分析显示,仅使用KAN层时模型难以准确定位关键区域,IoU较低;而整合WA-KAN层后,模型能够精确识别目标边界,激活区域与真实掩膜之间的匹配度显著提升,IoU也随之显著增强,这证明了ECA注意力机制在增强模型关键区域聚焦能力的同时提升了预测精度和模型可解释性。该研究的科学价值在于提出了一种将小波多分辨率分析与KAN和注意力机制深度融合的新范式,为可解释神经网络设计提供了新的思路;应用价值在于该模型在多个医学图像分割基准数据集上取得了最先进的性能,同时在计算效率上具有明显优势,未来可进一步优化架构、探索在其他数据集和任务上的适用性,并集成到PyTorch和TensorFlow等主流机器学习库中。该研究的亮点包括:WDMAF模块通过高-低频特征的精确解耦与互补融合有效补充了下采样过程中丢失的局部细节并稳定保留全局结构信息;WA-KAN模块将小波变换嵌入KAN中并对多尺度分量进行分解以增强非线性建模能力,同时利用ECA机制聚焦关键信息并抑制噪声;整体架构通过多模块协同特征学习机制显著提升了分割性能,并相较于现有U-Net变体和其他先进方法实现了更快的训练速度。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com