分享自:

基于参数滤波器模型的HRTF近似与插值的并行方法

期刊:IEEE Signal Processing LettersDOI:10.1109/lsp.2017.2741724

本文提出了一种基于参数化滤波器模型的HRTF(Head-Related Transfer Function,头相关传递函数)逼近与插值的并行实现方法。研究由German Ramos、Maximo Cobos、Balázs Bank和Jose A. Belloch合作完成,其中通信作者为Maximo Cobos。作者分别隶属于西班牙瓦伦西亚理工大学ITEAM研究所(German Ramos)、瓦伦西亚大学信息学系(Maximo Cobos)、匈牙利布达佩斯技术与经济大学测量与信息系统系(Balázs Bank)以及西班牙海梅一世大学工程与计算机科学系(Jose A. Belloch)。该论文发表于IEEE Signal Processing Letters第24卷第10期,2017年10月出版,并得到了西班牙经济与竞争力部和匈牙利人力资源部等机构的资助。

该研究属于空间音频渲染与数字信号处理交叉领域。HRTF描述了自由场声波从声源传播到听者鼓膜过程中受到的全部声学效应,包括头部、耳廓和上身躯干引起的反射、衍射以及耳间时间差(ITD, Interaural Time Difference)和耳间声级差等空间定位线索。在沉浸式电话会议、游戏、虚拟现实和三维音频回放等应用中,HRTF滤波与插值通常需要满足实时性约束,因此必须建立高效的计算结构。此前的低阶模型可以显著降低计算成本,但必须保持原始HRTF的感知特性。已有方法包括基于头部解析模型的模拟和基于数字滤波器的经验逼近。本文作者在2013年曾提出一种基于IIR(Infinite Impulse Response,无限冲激响应)参数化模型的串行结构,用低搁架滤波器(low-shelving filter)和多个峰值滤波器(peak filter)组成的二阶节(SOS,Second-Order Section)链来逼近HRTF的最小相位响应。该串行模型能够减少数据集规模,并能通过参数插值生成缺失方向的HRTF,但存在数据依赖问题,无法高效利用GPU(Graphics Processing Unit,图形处理单元)等并行处理器。本研究的目的正是克服这一局限,提出新的并行参数化模型,在保持插值能力的同时实现实时并行计算。

研究首先对原有串行SOS链模型进行了分析。该模型由一个模拟ITD的延迟线和N个SOS组成。第一个SOS为低搁架滤波器,用于拟合响应的低频相对均匀结构;其余SOS为峰值滤波器,用于合成HRTF的峰谷结构。每个SOS由数字中心频率、对数增益和品质因数三个参数定义。参数通过迭代减小与1/12倍频程平滑后HRTF之间的误差获得,误差函数在幅度和频率轴的对数域上定义,并按照从最大误差区域到最小误差区域的顺序依次拟合各SOS。为了将串行结构转换为并行结构,作者首先尝试了经典的部分分式展开(PFE, Partial Fraction Expansion)。该方法在数学上与原模型完全等价,将N个SOS的乘积转化为常数项与N个一阶分子二阶分母项之和。然而,在CIPIC数据库3号受试者方位角5°和10°两个相邻方向的实测中发现,虽然整体HRTF响应相似,但PFE后各SOS个体响应在相邻角度之间差异极大,部分频段幅度差接近20 dB,并伴随显著的直流分量差异。这种个体响应的大幅波动导致无法直接对相邻方向的参数进行简单线性插值,因而PFE模型不适用于保持原有插值能力的并行化。

针对PFE的不足,作者提出了新的参数化并行滤波器组结构。该结构将原串行模型中的低搁架滤波器替换为直通路径与低通滤波器(LP1)的组合,将峰值滤波器替换为直通路径与带通滤波器(BPi)的组合。所有滤波器仍由中心频率、增益和品质因数定义。带通滤波器的双线性变换形式在分子上只有b0和b2项,且满足b2 = -b0;低通滤波器则满足b2 = b0。这一结构使得每个带通SOS可节省两次乘法和一次累加,整体计算量相比同阶串行模型减少约40%。设计过程中,原有串行拟合算法被调整以适应新的并行方案。由于各SOS的输出直接相加,相位相互作用对整体响应的影响更为突出,优化过程需要额外考虑这一点。以方位角0°的HRTF为例,采用12个SOS的并行模型能够以±1 dB的小幅偏差拟合原始平滑HRTF响应,其中正增益SOS用于形成峰值,负增益SOS用于形成谷值。关于SOS数量的选择,研究比较了串行模型和并行模型在不同N值下的感知误差函数变化,结果显示两种模型误差曲线几乎一致;当N≥12时进一步增加SOS带来的改善非常有限。此前针对串行模型的听音测试已表明N=12时原始HRTF与近似HRTF之间的感知差异不显著。由于并行模型各SOS之间存在复杂相互作用,要达到与串行模型相同的拟合性能,尤其在极端角度附近,需要更多SOS。采用N=16时,并行模型的结果与N=12的串行SOS链模型几乎一致。即便如此,由于每个SOS所需操作更少,并行模型的总计算量仍然更低。

在插值性能方面,研究以方位角0°为起点,对一组HRTF进行了参数演化,并在相邻设计模型之间使用简单线性插值生成中间方向的模型。连接各SOS频率的曲线随角度平滑变化,插值响应与原始响应之间仅存在微小偏差,证明了该并行结构仍保留了原串行模型简便的插值能力。

为验证实际计算效率,作者基于CUDA(Compute Unified Device Architecture)架构在NVIDIA Tesla K20XM GPU上进行了实现。每个GPU线程处理一个SOS,系统最多包含32米个滤波器,其中m为声源数,每个滤波器最多16个SOS,包含左右双耳通道。实验设置音频采样率为44.1 kHz,在不同缓冲区大小(8、16、32、64样本)下对应延迟分别为0.18、0.36、0.72和1.45 ms。该并行模型在上述延迟条件下可实时处理的声源数分别为280、575、930和1230。相比之下,具有相近精度的12阶串行模型在同一GPU上最高仅能实时处理15个声源,这是因为串行模型在并行导向架构上受到严重惩罚。实验结果充分证明了所提出并行结构在多声源实时空间音频渲染中的巨大优势。

本研究的核心贡献在于提出了一种新的参数化并行滤波器组方法,用于HRTF逼近与插值。该方法在保持原串行参数模型数据库压缩能力的几乎相同拟合性能和简单插值优势的同时,消除了数据依赖,使其能够高效部署在GPU等并行处理器上。通过并行结构下每SOS所需的乘法运算更少,还以同等计算成本实现了更多SOS的拟合。实验表明,在先进GPU硬件上,该模型能够实时处理多达1230个声源,远超串行实现。这项工作为需要大量虚拟声源和实时约束的空间音频应用提供了高效的解决方案,不仅在理论上扩展了参数化HRTF建模的并行结构设计思路,也在实际应用中显著提升了系统可扩展性和计算资源利用率。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com