分享自:

基于球形传声器阵列的双耳早期反射重构

期刊:声学学报DOI:10.12395/0371-0025.2024264

本文是南京大学物理学院近代声学教育部重点实验室周运佳、易婧如、李天佑、林志斌等人发表在《声学学报》(Acta Acustica)2025年第50卷第6期上的一项原创研究,通讯作者为林志斌。该研究提出了一种利用球形传声器阵列在房间内多个离散位置测量的空间房间脉冲响应(spatial room impulse response, SRIR)来重构房间一定范围内六自由度(six degrees-of-freedom, 6-DOF)双耳早期反射的方法,旨在降低双耳房间脉冲响应(binaural room impulse response, BRIR)的测量与存储成本,并提升其在动态双耳合成中的实时调用效率。

在空间声与虚拟听觉领域,动态双耳合成需要模拟听者头部在空间中平移和转动引起的双耳声压变化,传统方法依赖大量BRIR测量,数据量大、测量负担重,而参数化双耳合成方法虽然减少了测量需求,但往往只支持头部旋转自由度,且对反射声的抽象处理会破坏脉冲响应的频域特征。近年来虽然有基于Ambisonics信号的听音区域扩展方法,但性能仍有提升空间。针对这一问题,本研究聚焦于BRIR中直达声和前次早期显著反射部分的重构,因为这部分对空间听觉感知最为关键,而晚期混响在动态双耳合成中的重要性相对较低。研究采用的理论基础是将房间内早期声场抽象为等效声源簇和对应滤波器系数,在此基础上引入等效声源簇的头相关传递函数(head-related transfer function, HRTF),从而重建来自不同方向的反射声到达双耳的声压。

研究的工作流程主要包括声场建模、等效声源位置估计、滤波器系数估计和双耳重构四个主要环节。在声场建模方面,研究将直达声和早期反射声建模为以等效声源位置为中心的一组等效声源簇,每组等效声源簇包含多个在空间小范围波动的等效声源,用来模拟虚拟镜像声源的波前方向性。等效声源位置估计分为方向估计和距离估计两部分。方向估计基于以传声器阵列中心为坐标原点的平面波基函数矩阵,对以显著反射峰时刻为中心加窗后的单帧时域信号进行快速傅里叶变换,选择各频点中绝对值最大的平面波方向作为该虚拟声源的估计方向,并取所有频点中出现次数最多的方向作为最终方向估计。距离估计结合显著反射峰到达时间和等效声源方向,利用余弦定理求解等效声源到阵列中心的距离。对于多个阵列估计出的距离较近的等效声源位置,研究采用平均方法合并为一个等效声源位置。滤波器系数估计采用最小绝对收缩和选择算子(least absolute shrinkage and selection operator, LASSO)方法,通过加速近端梯度算法(accelerated proximal gradient algorithm, APGA)求解正则化问题,使滤波器系数稀疏化,降低位置估计错误的等效声源对重构的影响。双耳重构阶段,研究将等效声源到场点的传递函数与HRTF结合,在频域通过矩阵运算生成双耳声压,其中HRTF通过对球面上离散测量的HRTF进行球傅里叶变换(spherical Fourier transform, SFT)得到球谐系数,再根据声源相对于听者的方向通过逆球傅里叶变换生成。

仿真分析部分采用镜像源模型模拟了接近文献中实验场景的房间,房间尺寸为[6.20, 9.40, 3.00] m,混响时间为0.50 s,两个传声器阵列中心分别位于[2.00, 3.00, 1.50] m和[4.00, 3.00, 1.50] m,声源位于[3.00, 5.50, 1.20] m。研究比较了传声器数量分别为96、64、48、32、16的球形阵列的重构性能,阵列半径均为25 cm。客观评价指标包括归一化复数声压平方误差、双耳声级差(interaural level difference, ILD)误差、双耳时间差(interaural time difference, ITD)误差和双耳听觉互相关系数(interaural cross-correlation coefficient, IACC)误差。仿真结果表明,48通道球形传声器阵列在等效声源位置估计的精度和时间分辨率上已能达到与64、96通道阵列相当的性能,继续增加传声器数量对性能提升不显著,而32通道阵列的定位误差明显增大。在RIR重构方面,重构误差在阵列之间区域内较小,随着位置远离阵列中心而增大,阵列外侧区域误差大于内侧区域。在BRIR重构方面,传声器数量对重构误差的影响与RIR类似,但BRIR误差比RIR误差高约0.5~1.5 dB,这主要来自等效声源角度估计误差导致的HRTF选择偏差、等效声源簇中多个HRTF的插值逼近误差以及HRTF球谐系数插值本身引入的误差。对于直达声,所有阵列的ILD和ITD误差都较小,表明方法能有效保持声源的听觉方位信息。

真实房间实验在一个尺寸为[5.70, 5.70, 3.20] m、混响时间约为0.5 s的教室环境中进行,使用48通道球形传声器阵列分别在坐标原点及偏离原点±0.51 m的三个位置进行测量,同时使用3D打印的人头-躯干模型和微型传声器测量参考BRIR。主观评价实验采用MUSHRA方法,从音色保真度、外部化程度保真度和感知角度保真度三个维度比较了参考音频、本文方法、binaural-SDM(BSDM)方法、HRIR and RIR方法以及HRIR only方法。结果表明,在音色保真度方面,本文方法与BSDM方法相当,均明显优于其他方法;在外部化保真度方面,本文方法得分显著高于BSDM和其他方法;在感知角度保真度方面,本文方法得分显著最优,BSDM方法得分最低。不同声源角度下的保真度评分差异在统计上不显著,表明方法在不同角度下具有较好的稳定性。客观参量分析显示,仅30°方向的ITD和ILD误差略高于感知阈值,与该方向感知角度保真度评分略低的结果一致。

该研究的核心结论是,利用球形传声器阵列在房间多个离散位置测量的空间房间脉冲响应,结合等效声源簇模型和头相关传递函数,可以有效重构房间内两测量位置之间区域的六自由度双耳早期反射。该方法将空间连续位置的双耳房间脉冲响应测量需求转化为空间离散的多点阵列房间脉冲响应测量,显著降低了测量成本,同时将所有位置的双耳房间脉冲响应压缩为一组等效声源位置信息和滤波器系数信息,减少了存储空间,并且可以通过矩阵乘法高效地完成重构,有利于动态双耳合成中的实时调用。研究的亮点在于提出了一种新的六自由度双耳早期反射重构框架,将等效声源簇建模与HRTF结合,既保留了反射声的频域特征,又实现了听者位置外推和头部旋转的双耳合成。相比现有的参数化方法如SDM和HO-SIRR,该方法在听感上特别是感知角度保真度和外部化程度上表现出优势。研究的应用价值体现在虚拟现实、增强现实和游戏等消费电子领域中,动态双耳空间声合成对实时性和个性化有较高要求,该方法通过降低测量和存储成本、提高实时调用效率,为实际应用提供了可行方案。后续研究将进一步提升模型的重构精度和频率上限,检验可感知的重构空间范围边界,并进一步扩大重构的空间范围。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com