关于《IEEE Transactions on Audio, Speech and Language Processing》2025年论文《Dual-Branch Guidance Encoder for Robust Acoustic Echo Suppression》的学术研究报告
一、 研究作者、机构与发表信息 本研究由Hyewon Han(IEEE会员)、Xiulian Peng、Doyeon Kim(IEEE学生会员)、Yan Lu以及Hong-Goo Kang(IEEE会员)共同完成。Hyewon Han、Doyeon Kim和Hong-Goo Kang隶属于韩国延世大学电子与电气工程系;Xiulian Peng和Yan Lu则来自微软亚洲研究院。该研究成果于2024年12月25日在线发表,并于2025年1月31日以最终版本形式正式刊载于《IEEE Transactions on Audio, Speech and Language Processing》第33卷。该研究得到了韩国科学和信息通信技术部(MSIT)以及微软亚洲研究院的部分支持。
二、 学术背景与研究目标 本研究属于语音信号处理领域,具体聚焦于实时语音通信中的核心挑战——声学回声消除(Acoustic Echo Cancellation, AEC)。在免提通话、远程会议等场景中,远端说话者的声音(远端语音)通过扬声器播放后,会被麦克风再次拾取,形成回声,严重损害通话质量和语音清晰度。因此,设计一个能够在各种复杂场景下有效抑制回声,同时保持近端语音质量的鲁棒AEC系统至关重要。
传统的AEC算法,如自适应滤波,虽然计算效率高,但在处理非线性失真、双端讲话(Doubletalk,即双方同时说话)等复杂场景时,往往表现不佳,且需要大量启发式参数调整。近年来,基于神经网络的AEC方法显示出更强的适应能力,能够联合处理回声、噪声和混响。然而,许多现有神经网络架构在输入信号融合策略上存在局限(如简单的早期融合或晚期融合),难以在回声抑制和近端语音保真度之间取得最佳平衡,尤其是在面对训练数据中未出现的回声失真类型时。
基于此背景,本研究旨在解决上述挑战。其核心目标是:设计一种新颖的神经网络编码器结构,能够更有效地捕捉和分离麦克风信号中的回声成分,从而引导网络生成更精确的掩码以抑制回声,同时更好地保留近端语音。研究特别关注模型在双端讲话、非线性失真、时变延迟等多种复杂且真实场景下的鲁棒性,并确保模型能够满足实时处理的要求。
三、 详细研究流程与方法 本研究提出了一种名为双分支引导编码器(Dual-Branch Guidance Encoder, DBG Encoder)的新型模块,并将其集成到一个基于U-Net的骨干网络中。整个研究流程包含网络架构设计、训练策略制定、数据集构建、实验验证与深度分析等多个环节。
1. 问题建模与骨干网络架构: 研究首先对AEC问题进行数学建模,将麦克风信号视为近端语音、经过非线性失真和房间冲激响应(Room Impulse Response, RIR)卷积的远端语音(即回声)以及背景噪声的混合。模型的目标是从对齐后的麦克风信号和远端参考信号中,重建出干净的近端语音。 研究采用在幅度谱域计算掩码的方案。输入信号首先被转换为等效矩形带宽(Equivalent Rectangular Bandwidth, ERB)谱,以更好地反映听觉特性。骨干网络基于U-Net结构,包含4层编码器和解码器,以及一个瓶颈层的频率-时间门控循环单元(Frequency-Time Gated Recurrent Unit, F-T GRU)用于时序建模。编码器采用非对称的晚期融合策略,即麦克风分支和远端语音分支使用不同数量的通道独立处理,在编码器末端进行融合。
2. 核心创新模块:双分支引导编码器(DBG Encoder): 这是本研究最核心的贡献。DBG Encoder旨在替换骨干网络中的普通编码器层,其设计灵感源于两个输入信号(麦克风信号和远端参考信号)之间的内在关系。具体工作流程分为三个关键步骤: * 引导图生成:在每个编码层,分别对麦克风分支和远端分支的潜在特征进行独立编码。然后,通过一个局部交叉注意力机制,计算一个引导图。该引导图本质上是一个注意力权重矩阵,其目标是识别麦克风特征中与回声相关的区域。计算过程涉及将两个分支的特征投影后拼接,并通过卷积层和Sigmoid激活函数生成最终的引导图。 * 分离式潜在掩码:利用生成的引导图,对麦克风分支的潜在特征进行分解。具体操作是将麦克风特征与引导图进行逐元素相乘,得到“回声相关成分”;同时,将其与(1-引导图)相乘,得到“回声抑制成分”(即更接近近端语音的成分)。这一步骤在潜在空间内实现了对混合信号中不同成分的初步分离。 * 引导块:分解后的两个成分(回声相关与回声抑制)分别与各自分支的原始编码特征进行拼接,然后通过一个点卷积层进行融合与精炼。这个过程使得编码器能够利用引导信息,更明确地学习区分回声与近端语音,从而为后续的掩码估计提供更清晰的指导。
3. 辅助模块与训练策略: 为了提升DBG Encoder的鲁棒性,研究还引入了两个辅助模块: * 远端语音处理块:包括一个远端非线性投影块(将远端信号映射到合适的潜在空间)和一个远端跟踪GRU块。后者是一个小型因果GRU网络,用于建模远端语音的时序信息,使其在存在时变延迟或失真时,仍能为引导图生成提供可靠的上下文参考。 * 状态检测模块:这是一个辅助分类器,用于在训练期间识别通话的“状态”(即远端单讲、近端单讲、双端讲话)。该模块利用各层引导图的统计信息以及远端语音特征,通过GRU和全连接层输出片段级别的状态概率。研究者采用多任务学习策略,将状态检测的交叉熵损失与主目标(信号重建)的损失相结合进行联合训练。状态检测任务作为一种正则化手段,帮助模型更好地适应不同场景。
4. 数据集构建与训练配置: 研究使用公开数据集(如Interspeech 2021 AEC挑战赛合成数据集、LibriVox、LibriSpeech)和人工模拟方法,构建了总计110小时的训练数据。模拟过程高度还原真实场景:使用真实的房间冲激响应模拟回声路径,添加硬限幅和Sigmoid函数模拟扬声器非线性失真,混合不同信回比(SER)的语音,并加入环境噪声和混响,使模型能同时处理回声消除、噪声抑制和去混响任务。评估则使用了独立的合成测试集和Interspeech 2021 AEC挑战赛的真实录音盲测集。 网络采用幅度谱掩码估计(DBG-Mag)和复数谱掩码估计(DBG-Com)两种变体。使用AdamW优化器和余弦退火学习率调度器进行训练。为了增强对未对齐信号的鲁棒性,训练时以一定概率在输入信号间引入了随机延迟。
5. 实验设计与分析流程: 研究进行了详尽的实验来验证所提方法的有效性: * 对比实验:与多种先进的AEC方法进行对比,包括基于自适应滤波的SpeexDSP,以及基于神经网络的DTLN、F-T-LSTM、DeepVQE等。所有对比模型均在相同数据集上重新训练以确保公平。 * 消融实验:系统地评估DBG Encoder各个组件(如分离式潜在掩码、远端跟踪GRU、状态检测学习)的贡献。 * 编码拓扑结构对比:将DBG编码器与早期融合、晚期融合、中期融合等其他编码策略进行对比。 * 可视化分析:对引导图在不同网络层的表现进行可视化,直观展示其如何捕捉回声特征。 * 性能评估指标:在合成数据集上,使用PESQ(感知语音质量评估)和ESTOI(扩展短时客观可懂度)评估双端讲话场景的语音质量与可懂度;在真实录音数据集上,使用AECMOS(一种基于神经网络的客观指标,包含EchoMOS评估回声抑制程度和DegMOS评估语音失真程度)以及ERLE(回声返回损耗增强)进行评估。
四、 主要研究结果 实验结果表明,本研究提出的方法在多个方面显著优于现有基线模型。
1. 在合成测试集上的性能: 如表II和图5所示,提出的DBG-Mag和DBG-Com模型在PESQ和ESTOI指标上全面领先于所有对比模型,包括参数量和计算量更大的DeepVQE-L。特别值得注意的是,在面对真实录制的回声(一种训练数据中未见的、更具挑战性的失真类型)时,DBG模型的优势更加明显。这表明DBG编码器具有出色的泛化能力和对未知失真的鲁棒性。此外,在存在白噪声或嘈杂人声干扰的复杂环境下,DBG模型性能下降幅度远小于基线模型,证明了其在噪声共存场景下的有效性。图6的谱图可视化清晰展示了DBG模型在抑制回声的同时,更好地保留了近端语音的细节。
2. 在真实录音测试集上的性能: 如表III所示,在Interspeech 2021 AEC挑战赛盲测集上,DBG模型同样取得了领先的性能。在最具挑战性的双端讲话场景中,DBG模型在DegMOS(衡量语音失真)和EchoMOS(衡量回声残留)上取得了最佳平衡,显著优于其他神经网络方法。与结合了神经对齐模块的DeepVQE相比,DBG模型以更少的参数量和计算量达到了与之相当甚至更优的性能。DBG-Com模型由于进行了相位处理,在ESTOI和DegMOS上略优于DBG-Mag,但两者在AEC核心任务上均表现出色。
3. 消融研究与组件分析: 表V的消融实验证实了各个组件的有效性。单独添加分离式潜在掩码(SLM)模块即可带来显著性能提升,证明了在潜在空间进行信号引导的有效性。进一步加入远端语音处理块(FPB),尤其是远端跟踪GRU,能进一步提升模型对真实回声和远端单讲场景的处理能力。状态检测学习作为多任务训练的一部分,被证明可以作为一种有效的正则化方法,进一步提升模型在处理未见回声类型时的鲁棒性。图8显示,状态检测模块能够有效估计通话状态,其输出概率随时间变化的轨迹与信号的实际活动情况相符。
4. 编码拓扑结构对比与可视化洞察: 表IV的对比实验表明,DBG编码器在多种信回比(SER)的双端讲话场景下,均优于早期融合、晚期融合和中期融合等传统编码策略。这证明了在编码阶段引入适度的、基于注意力的信号交互对于AEC任务至关重要。图7对引导图的可视化提供了关键洞察:在网络的浅层,引导图倾向于捕捉信号的总体能量特征;而在深层,引导图逐渐演变为更精细的比率掩码形状,更直接地服务于最终的掩码估计。这解释了为何仅在前几层使用DBG模块(DBG-Mag-MF)也能取得良好效果,但全层使用(DBG-Mag-LF)在处理真实录音回声时表现更鲁棒。
5. 实时性验证: DBG-Mag模型在标准CPU上的实时因子(RTF)为0.0368,远小于1,充分证明了其满足实时语音通信应用的要求。
五、 研究结论与价值 本研究成功提出并验证了一种用于鲁棒声学回声抑制的双分支引导编码器。该编码器通过生成引导图并在潜在域应用分离式掩码,创新性地实现了对麦克风信号中回声成分的显式建模和引导。结合远端语音时序建模和状态感知的多任务学习,所提出的神经网络架构能够在各种复杂场景(包括双端讲话、非线性失真、时变延迟和背景噪声)下,实现卓越的回声抑制性能,同时最大限度地保持近端语音质量。
本研究的科学价值在于为神经网络AEC的编码器设计提供了新思路。它超越了简单的特征融合,通过引入基于交叉注意力的引导机制,使网络能够更智能地利用远端参考信号的信息,从而学习到更具判别性的声学表示。在应用价值上,该模型以相对较低的参数量和计算复杂度,达到了业界领先的性能,并且具备实时处理能力,为实际部署在视频会议系统、智能音箱、车载通信等产品中提供了强有力的技术方案。
六、 研究亮点 1. 新颖的编码器架构:提出的双分支引导编码器是核心创新,通过“引导图生成-分离式潜在掩码-引导精炼”的流程,在特征编码阶段实现了对回声成分的针对性处理,有效平衡了抑制与保留的矛盾。 2. 对未知失真的强鲁棒性:模型在训练数据未覆盖的真实录制回声测试中表现突出,证明了其强大的泛化能力,这对于在实际多变环境中部署至关重要。 3. 多任务学习与状态感知:引入辅助的状态检测任务进行联合训练,无需在推理时显式使用,即可使模型隐式学习不同通话场景的特性,提升了整体适应性。 4. 高效的实时性能:模型在取得最优性能的同时,保持了较低的计算复杂度,满足了实时通信的严苛要求,体现了良好的工程实用性。 5. 深入的可解释性分析:通过详尽的消融实验、不同编码策略对比以及引导图的可视化,研究不仅证明了方法有效,还深入分析了其内部工作机制,为后续研究提供了清晰的见解。
七、 其他有价值内容 研究还探讨了模型对输入信号未对齐情况的鲁棒性。通过在训练中引入随机延迟增强,并结合远端跟踪GRU模块,DBG模型降低了对独立延时估计模块的依赖。实验表明,即使不依赖外部对齐算法(如SCOT),仅通过数据增强和内部GRU建模,模型也能取得优异的性能。这为构建端到端、更简洁的AEC系统提供了可能。此外,论文对复数掩码与幅度掩码的对比分析(DBG-Com vs. DBG-Mag)也为不同应用场景下的技术选型提供了参考。