本文介绍一项名为“nes2net”的原创性研究,这是一篇发表于2024年第七届高级算法与控制工程国际会议(ICAACE)上的学术论文。作者为南京信息工程大学数学与统计学院的Zean Dai。
一、 研究背景与目的
本研究属于信号处理领域,具体聚焦于单通道盲信号分离(Single-Channel Blind Signal Separation, SCBSS)这一关键挑战。在无线通信、音频处理、生物医学信号分析等众多实际场景中,接收端往往只能获取到一个由多个源信号混合而成的单路信号。SCBSS的目标是在对源信号和混合机制几乎一无所知的情况下,仅从这一个混合信号中恢复出原始的各个源信号分量。
尽管该技术应用前景广阔,但现有方法存在明显局限。主流方法主要分为两类:一类是基于虚拟多通道的方法(如单通道独立成分分析SCICA和非负矩阵分解NMF),这类方法通常需要源信号在频域非重叠等较强的先验假设,且计算时间长、分离精度有限;另一类是数据驱动的深度学习方法(如时域音频分离网络TasNet),虽然性能有所提升,但仍普遍依赖于已知源信号数量等额外先验信息。在实际应用中,这些先验信息往往难以获得,且现有方法的分离精度仍有较大提升空间。
因此,本研究旨在提出一种更通用、高效的SCBSS方法。其核心目标是设计一个深度学习网络框架,使其在接收端仅知道混合信号、而无需任何其他先验信息(如源信号数量)的情况下,仍能实现高质量的盲信号分离。
二、 研究详细流程与方法
本研究提出了一种全新的深度学习网络框架,称为“数量估计与信号分离网络”(Number Estimation and Signal Separation Network, nes2net)。该框架由两个核心模块串联构成:数量估计模块(Number Estimation Module, NEM)和信号分离模块(Signal Separation Module, SSM)。整体工作流程如下:首先,混合信号输入NEM,该模块估计出混合信号中包含的源信号数量;随后,混合信号连同NEM估计出的数量信息一同输入SSM,由SSM执行精确的信号分离。
1. 数据集构建 为了训练和评估所提出的网络,研究团队通过仿真生成了一个专门的数据集。数据生成过程模拟了真实场景中的多种信号类型,包括正弦波信号、脉冲信号和调频连续波信号。具体步骤如下: * 随机生成每个数据样本中源信号的数量(m),该数量将作为后续分离的循环次数。 * 对于每个源信号,随机选择一种模拟信号类型,并随机设置其频率参数,生成并保存该模拟信号。 * 使用线性瞬时混合模型(公式(1))将所有生成的源信号混合,生成并保存单通道混合信号。 最终数据集包含1000个数据样本,每个样本包含三部分信息:源信号数量、多个源信号构成的矩阵以及混合信号。数据集按85%、10%、5%的比例划分为训练集、验证集和测试集。此外,为了分别训练NEM和SSM,从总训练集中创建了两个子集:D1(用于训练NEM,输入为混合信号,输出为源信号数量)和D2(用于训练SSM,输入为混合信号,输出为所有源信号)。
2. 数量估计模块(NEM)的设计与训练 NEM本质上是一个分类模型。考虑到实际场景中混合信号由有限个(设最大可能数为M)源信号组成,NEM的任务是将观测到的混合信号映射到对应的源信号数量类别(1至M类)。其网络结构基于卷积神经网络(CNN),具体包含多个卷积块(每个块由两个一维卷积层组成,后接下采样层)和一个最终的线性层。网络对输入的混合信号进行特征提取,最终输出一个1×M的判别向量,其中得分最高的类别即被判定为估计的源信号数量。 为了训练NEM,研究采用了交叉熵损失函数(公式(2))来监督训练过程,最小化预测数量与真实数量标签之间的误差。实验设置批次大小为8,训练100个周期(epoch),使用Adam优化器并配合余弦退火重启学习率调整策略。
3. 信号分离模块(SSM)的设计与训练 SSM是一个回归模型,其核心是U-Net结构。研究团队在实验中发现,若直接让一个U-Net以混合信号和源信号数量m为输入,一次性输出所有m个源信号,模型容易陷入损失函数的局部最小值,收敛到非最优解(表现为输出m个与混合信号波形相同的信号,如图2所示)。然而,若让U-Net每次只输出一个源信号,则训练后的网络能够成功从混合信号中分离出一个源信号(如图3所示)。 基于这一观察,研究团队设计了一种渐进式分离策略。SSM的工作流程是迭代式的:它使用同一个U-Net结构,在每次迭代(共m-1次)中,U-Net仅从当前的混合信号中分离出一个源信号;然后,从当前混合信号中减去这个已分离出的信号,得到一个新的、“残留”的混合信号,作为下一次U-Net迭代的输入。经过m-1次循环后,已分离出m-1个源信号,此时剩余的“残留”信号即为第m个源信号。通过这种方式,SSM逐步完成了所有源信号的分离。 为了训练这个迭代使用的U-Net,研究团队设计了一个新颖的损失函数。在每次迭代(第j次)中,损失计算分为三步:首先,计算U-Net输出的信号与所有尚未被标记的原始源信号之间的余弦相似度(公式(3));然后,将相似度最高的那个原始源信号标记为本次迭代的目标;最后,计算U-Net输出信号与这个目标信号之间的均方误差(MSE,公式(4)),作为本次迭代的损失。总损失为所有m-1次迭代损失之和(公式(5))。这种损失函数设计迫使U-Net在每次迭代中学习匹配当前混合信号中最接近其输出的那个源信号,从而实现一对一的梯度反向传播,逐步分解源信号。SSM的训练批次大小也为8,训练200个周期。
4. 对比实验设计 为了验证nes2net的优越性,研究设计了两组对比实验: * 实验1(数量估计):将NEM与经典的机器学习分类算法(支持向量机SVM和决策树)进行对比,以分类准确率为评估指标。 * 实验2(信号分离):将SSM与经典的SCBSS方法进行对比,包括SCICA、NMF和TasNet。由于这些现有方法都需要已知源信号数量,因此在已知真实数量的前提下进行比较。评估指标为均方误差(MSE,公式(6)),计算网络输出的所有源信号与真实源信号之间的整体误差。
所有实验在相同的硬件(AMD Ryzen 7 4800H CPU, NVIDIA GeForce GTX 1650 Ti GPU)和软件(Python 3.9.18, PyTorch 2.0.1)环境下进行。
三、 主要研究结果
1. 数量估计模块(NEM)的性能 实验1的结果(表III)显示,NEM在源信号数量估计任务上达到了100%的准确率,显著优于SVM(98%)和决策树(92%)。这表明,深度神经网络在处理高维时间序列数据时,凭借其更复杂的网络结构,能够提取更高级的特征,从而在该分类任务上取得了最佳性能。SVM的效果依赖于核函数的选择,而决策树在面对复杂数据时更容易过拟合。
2. 信号分离模块(SSM)的性能 实验2的结果(表IV)显示,四种信号分离方法的有效性差异很大。SSM模块取得了最好的分离效果,其MSE仅为0.120。经典的盲信号分离算法SCICA和NMF效果不佳(MSE分别为0.912和1.708),这与它们的方法局限性有关:SCICA假设源信号统计独立,NMF依赖于混合信号数据的低秩近似,而仿真生成的现实信号并不总是满足这些假设。基于深度学习的TasNet方法MSE为0.618,优于传统方法但不如SSM。研究发现,在更广泛的数据上,TasNet可能因网络设计和参数选择问题,出现了前文所述的陷入局部最小值、网络过早收敛而失效的情况(如图4所示)。
3. 整体框架(nes2net)的有效性 综合实验1和实验2的结果,由于NEM和SSM在各自的任务中都表现最佳,因此由它们串联组成的nes2net框架在完整的SCBSS任务(仅知混合信号,其他信息未知)中必然展现出优越性。论文图5展示了nes2net在两个测试案例上的实际输出示例,直观地证明了其能够有效地从单通道混合信号中分离出与真实源信号高度近似的分量。
四、 研究结论与价值
本研究创新性地提出了一种基于深度学习的单通道盲信号分离方法nes2net。该方法能够在接收端仅知晓混合信号的苛刻条件下,实现高质量的盲信号分离。其核心贡献在于通过NEM模块解决了实际场景中源信号数量未知的问题,并通过SSM模块采用渐进式U-Net迭代策略,克服了一次性输出所有源信号导致的优化难题,从而显著提升了分离精度。
该研究的科学价值在于为SCBSS问题提供了一个全新的、端到端的深度学习解决方案。它减少了对先验信息的依赖,增强了方法的通用性和实用性。在应用价值上,该框架可广泛应用于通信、雷达、音频处理、生物电信号分析等众多需要从单路观测中恢复多源信号的领域。
五、 研究亮点
六、 其他有价值的内容
论文在最后指出了未来的工作方向,包括在真实数据集和其他环境下验证模型的有效性,以及进一步优化NEM的分类能力和调整SSM的内部结构。这表明作者意识到当前研究基于仿真数据,向实际应用迁移是下一步的重要工作,同时也为方法的持续改进留下了空间。