分享自:

基于人体测量数据的个性化HRTF预测的多阶段模型

期刊:2023 IEEE International Conference on Multimedia and Expo Workshops (ICMEW)DOI:10.1109/ICMEW59549.2023.00060

本文提出了一种基于人体测量数据(anthropometric data)和多阶段模型(multi-stage model)的个性化头相关传递函数(head related transfer function, HRTF)预测方法。研究由北京理工大学信息与电子学院的Yinliang Qiu、Zhiyu Li和Jing Wang完成,发表于2023年IEEE国际多媒体与博览会研讨会(2023 IEEE International Conference on Multimedia and Expo Workshops, ICMEW),DOI为10.1109/ICMEW59549.2023.00060。

该研究属于空间音频与虚拟现实(virtual reality, VR)领域,重点解决个性化HRTF的高效获取问题。HRTF描述了声音从空间不同方向到达人耳时,由于头部、耳廓和躯干等生理结构对声波的散射和反射作用而形成的滤波效应。在双耳沉浸式音频渲染中,使用个性化HRTF能够提供比通用HRTF更真实的听觉体验。然而,传统实验室测量方法虽然准确,但耗时较长,例如Jenny和Reuter开发的系统完成一次测量需要60分钟,其中20分钟用于测量,40分钟用于准备工作。因此,研究者们开始探索基于人工智能的个性化HRTF预测方法。已有研究包括聚类算法、主成分分析与多元线性回归、深度神经网络结合空间主成分分析等。但由于HRTF数据库通常规模较小,且HRTF数据具有高维度特性,直接使用神经网络可能会导致过拟合问题。决策树方法在应对这类小样本高维数据预测问题上具有一定优势。

本文提出的多阶段模型包含两个主要阶段。第一阶段使用LightGBM(light gradient boosting machine)算法,根据人体测量数据和声源方位角与仰角初步预测HRTF的幅度值。第二阶段使用Transformer编码器(transformer encoder)学习不同频率点之间的全局信息,以修正第一阶段预测结果中可能存在的偏差,提高预测精度。研究使用的数据集为HUTUBS数据库,该数据库包含93名受试者的实测和仿真头相关脉冲响应(head related impulse response, HRIR)数据,每名受试者测量了25项人体测量数据。研究仅使用左耳实测HRIR数据,覆盖440个方位,每个方位的采样点数为256,采样率为44.1 kHz。通过傅里叶变换获得HRTF幅度,最终选取0–20 kHz频段,对应频率间隔为0.17 kHz,截取1至116个频率点。该研究未对25维人体测量数据进行降维预处理,因为LightGBM算法内部能够处理高维数据。

在LightGBM阶段,研究针对116个频率点分别训练了116个LightGBM模型,每个模型根据输入的人体测量数据和声源方向预测某一频率点上的个性化HRTF幅度。将116个输出拼接成116维向量,作为后续Transformer编码器的输入。LightGBM基于梯度提升决策树(gradient boosting decision tree, GBDT),采用基于梯度的单侧采样(gradient-based one-side sampling, GOSS)和互斥特征捆绑(exclusive feature bundling, EFB)两种技术,能够高效处理高维稀疏特征。第二阶段使用的Transformer编码器结构最初由Vaswani等人提出,包含多头自注意力机制(multi-head self-attention)和逐位置全连接前馈网络。本文使用了5层相同的编码器层,每层包括多头自注意力机制和前馈网络,并采用残差连接和层归一化。模型维度设为116,多头注意力头数设为4。实验中将116维初步预测结果视为序列,每个维度仅含一个数据点,并输入Transformer编码器学习不同频率点之间的相关性。

在实验部分,研究采用两种数据集划分方式。第一种方式使用HUTUBS数据库前82名受试者作为训练集,剩余数据中按顺序选择5名作为验证集,4名作为测试集,记为使用90%受试者进行训练。第二种方式使用前73名受试者作为训练集,剩余18名按顺序分为验证集和测试集各9名,记为使用80%受试者进行训练。划分以受试者为单位而非随机划分,以避免同一受试者HRTF之间的强相关性导致数据泄漏。基线模型采用三个全连接层(fully connected layer, FC)替换Transformer编码器,每层后接ReLU激活函数。LightGBM的n_estimators设为50000,学习率为0.0001;Transformer的学习率为0.0001,训练迭代次数为5000,批量大小为64。实验使用Intel Core i9-10920X CPU和GeForce RTX 3090 GPU。评估指标采用谱失真(spectral distortion, SD),计算公式为SD = 1/k ∑|20log10|H(f_k)| − 20log10|Ĥ(f_k)||,其中H(f_k)和Ĥ(f_k)分别表示原始和预测HRTF。该指标符合人耳对声压级对数感知的特性,均值SD表示测试集中所有角度的SD平均值。

实验结果表明,在90%训练数据划分下,LightGBM单独模型的平均SD为5.07 dB,SPCA-DNN为4.80 dB,DNN为4.74 dB,LightGBM+FC为4.79 dB,而本文提出的LightGBM+Transformer模型平均SD为4.54 dB,优于其他方法。在80%训练数据划分下,LightGBM平均SD为5.56 dB,LightGBM+Transformer为4.69 dB,说明在更小训练集上Transformer的改进幅度更大。可视化结果显示,LightGBM预测的HRTF整体趋势较接近原始HRTF,但在3–16 kHz中高频段存在较大波动,该频段通常被认为是个性化HRTF差异最大的频段。引入Transformer编码器后,预测结果的波动得到有效抑制,谱失真值更加稳定,并且HRTF的峰谷特征(notches and peaks)预测更加准确。这些峰谷特征对垂直方向声源定位具有重要影响。在水平面上的HRTF预测结果整体接近真实值,但预测结果更为平滑,部分细节信息有所丢失。这可能是由于真实HRTF中一些不平滑点本身含有测量误差,其影响需要进一步研究。

本研究的结论是,所提出的多阶段模型结合了决策树模型和神经网络的优势,能够有效利用全局频率信息改善个性化HRTF的预测效果。与已有方法相比,本文模型在平均谱失真指标上取得更小值,证明充分利用全局信息可以在一定程度上提升HRTF预测精度。研究的科学价值在于提出了一种新的多阶段预测框架,将LightGBM的局部逐点预测能力与Transformer的全局建模能力结合起来,为小样本高维HRTF数据建模提供了有效思路。应用价值在于该方法可应用于VR设备中的个性化双耳音频渲染,在无需复杂测量的情况下获得接近个体真实HRTF的预测结果,提升沉浸式音频体验。

本文的主要亮点包括:第一,采用多阶段模型结合LightGBM和Transformer编码器,克服了单一模型在处理HRTF高维数据时的局限性;第二,利用Transformer的自注意力机制学习不同频率点之间的相关性,有效抑制了逐点预测导致的谱失真波动;第三,实验验证了在小样本条件下该方法依然具有较好的预测性能,为个性化HRTF的实际应用提供了可行方案。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com