本文属于类型a,即单一原创研究报告。以下是基于该文档内容撰写的学术报告。
本文的主要作者为Byeong-yun Ko、Deokki Min、Hyeonuk Nam以及通讯作者Yong-hwa Park。其中Byeong-yun Ko、Hyeonuk Nam和Yong-hwa Park来自韩国科学技术院(Korea Advanced Institute of Science and Technology),Deokki Min来自韩国科学技术研究院(Korea Institute of Science and Technology)。该研究发表于《IEEE Transactions on Instrumentation and Measurement》第74卷,文章编号为2554418,于2025年12月19日在线发表。
这项研究属于声学信号处理、深度学习和头相关脉冲响应(head-related impulse responses, HRIRs)测量交叉领域。空间音频渲染对于在虚拟现实和增强现实等元宇宙技术中再现人类对空间声场的感知至关重要,其核心在于将头相关脉冲响应应用于声源信号。然而,HRIR具有高度个体化特征,使用非个性化HRIR会导致前后混淆和头内定位等感知错误。传统静态测量方法因需要对每个方位角重新定位扬声器阵列而耗时过长。动态方法虽然利用连续旋转扬声器阵列缩短了测量时间,但基于解析模型的算法(如归一化最小均方算法和卡尔曼滤波)在旋转速度提高时精度显著下降。本研究的目标是提出一种基于深度神经网络(deep neural network, DNN)的HRIRs辨识方法,在高转速条件下仍能准确追踪HRIR的连续变化,从而大幅缩短测量时间并保持空间定位线索的准确性。
研究的工作流程主要包括仿真验证和实验验证两大环节。在仿真环节中,研究者使用了FABIAN数据库中的HRIR数据,该数据库包含了高分辨率的方位角和仰角方向HRIR,采样率为44.1 kHz,每个HRIR包含256个采样点。为模拟连续旋转,研究者利用反距离加权插值法将方位角分辨率从2°细化至0.001°,对应45°/s的旋转速度。在水平面上等间隔选择了12个扬声器,模拟了180°旋转场景,总序列长度为176,400个时间步。激励信号采用完美扫频信号,并加入信噪比为30 dB的高斯白噪声模拟麦克风噪声。在实际实验中,研究者搭建了由9个扬声器组成的弧形阵列,安装在转台上以36°/s的速度连续旋转。受试对象为GRAS 45BC KEMAR头与躯干模拟器,配备KB0065和KB0066耳模拟器。实验在截止频率为170 Hz的消声室中进行,关注频率范围为200 Hz至17 kHz。估计HRIR长度设为340个采样点,采样率为34 kHz。真值HRIR通过多重指数扫频法以1°方位角步进测量获得。此外,研究者还进行了主观听觉定位测试,使用Meta Quest 3头显和Sennheiser IE900耳塞在虚拟环境中评估所辨识HRTF的感知精度,共招募了10名听力正常的人类受试者。
该研究提出了一种新颖的基于深度神经网络的HRIRs辨识方法。其核心模型采用门控循环单元(gated recurrent unit, GRU)结构和全连接网络来处理长序列的HRIRs向量更新。模型的输入包括瞬时平方误差(instantaneous square error, ISE)梯度、扬声器激励信号的功率以及隐藏状态。与传统的固定步长更新规则不同,该方法引入了一种可学习的归一化机制,能够根据时间步自适应地调整ISE梯度的尺度以及HRIRs向量的更新速率。为了在没有训练数据集的情况下优化DNN参数,研究者设计了“全序列更新与优化方案”,即先让DNN递归更新整个序列的HRIRs估计并累积训练损失,再使用Adam优化器通过时间反向传播对DNN参数进行一次优化。该方案有效避免了模型对局部时间片段的过拟合。训练损失采用自然对数压缩后的均方误差,学习率设为10⁻⁴,动量为0.9,最大训练轮数为300轮。
仿真结果表明,所提出的DNN方法在45°/s旋转速度下实现了-25.58 dB的归一化失调(normalized misalignment, NM)和1.74 dB的对数谱失真(log spectral distortion, LSD),显著优于归一化最小均方算法、卡尔曼滤波、JO-NLMS以及Meta-AF等对比方法。在消融研究中,去除GRU的门控结构导致NM恶化了5 dB,而将可学习归一化替换为固定归一化则导致NM恶化了11 dB,验证了这些组件的重要性。通过对0.1至1毫秒关键时间范围内的HRIR进行对比分析,该方法准确捕捉了头部和耳廓反射等复杂声学特征。耳间时间差(interaural time difference, ITD)分析表明,辨识误差始终低于12微秒,在感知阈值范围内。频谱分析显示在4至16 kHz范围内保持了良好的单耳定位线索,其中14至16 kHz频段的LSD为3.45 dB。实验结果表明,在36°/s的旋转速度下,所提方法实现了-22.89 dB的NM和1.96 dB的LSD,且在十次重复实验中标准差仅为0.81 dB和0.36 dB。在ITD误差方面,前部区域的标准差为3.90微秒,侧向区域为4.18微秒,后部区域为3.55微秒,均远低于差异感知阈值。主观定位测试进一步证实,与通用HRTF相比,该方法获得的个性化HRTF使水平面的平均绝对定位误差降低了约16°,中位面降低了约39°。
本研究的结论是,所提出的基于DNN的HRIRs辨识方法能够在连续旋转扬声器阵列条件下,以高精度和鲁棒性估计随方位角连续变化的HRIRs。该方法的价值在于显著缩短了HRIR测量时间,同时保持了精确的空间听觉定位所需的时域和频域线索。其科学意义在于展示了序列到序列学习在时变声学系统辨识中的应用潜力,特别是可学习归一化和全序列优化方案为无训练数据条件下的DNN优化提供了新思路。实际应用价值体现在听觉定位训练、视障者音频导航以及虚拟现实中个性化空间音频的快速获取。该研究的亮点包括:无需训练数据集的DNN辨识框架、GRU与全连接网络结合以追踪快速变化的HRIR、可学习归一化机制稳定梯度尺度、以及客观指标和主观听感双重验证的完整评估体系。