分享自:

使用LSTM和注意力模型改进时间序列预测

期刊:Journal of Ambient Intelligence and Humanized ComputingDOI:10.1007/s12652-020-02761-x

本研究的主要作者为Hossein Abbasimehr和Reza Paki,均来自阿塞拜疆沙希德·马达尼大学(Azarbaijan Shahid Madani University),研究成果发表于《Journal of Ambient Intelligence and Humanized Computing》2022年第13卷,第673至691页,论文于2021年1月3日在线发表。

一、研究背景与目的

时间序列预测在需求预测、银行ATM现金需求预测、金融市场股票趋势预测、电力负荷预测、风能预测、自然现象预测等众多应用领域中均具有重要价值。传统的时间序列预测技术主要包括统计方法(如ARIMA、ETS)和计算智能方法(如人工神经网络、支持向量机等)。然而,现实世界的时间序列数据通常包含非线性模式与复杂特征,传统预测技术难以实现准确预测。尽管前馈神经网络等传统计算智能方法能够对样本间的复杂模式进行建模,但它们在捕捉时间序列中长期依赖关系方面存在不足。循环神经网络(RNN)及其扩展长短期记忆网络(LSTM)被引入以解决该问题,LSTM通过门控机制有效缓解了RNN的梯度消失问题,已被证明适用于序列建模任务。此外,注意力机制(attention mechanism),尤其是多头注意力(multi-head attention),在自然语言处理和语音识别等领域显著提升了模型性能。然而,在时间序列预测领域,基于多头注意力的预测模型及其与LSTM等深度学习模型的结合尚未得到全面评估。因此,本研究旨在探索注意力机制在时间序列预测中的表现,提出一种基于LSTM与多头注意力的混合模型,并利用16个公开时间序列数据集对该模型进行全面评估,同时与多种标准预测技术及文献中的混合方法进行比较。

二、研究流程与实验方法

本研究首先介绍了LSTM和多头注意力的基本原理。LSTM单元包含记忆细胞及输入门、遗忘门和输出门,通过公式(1)至(6)描述其建模过程;多头注意力机制则通过多个注意力头联合学习序列中每个位置的不同表示。所提出的混合模型架构如下:首先分别计算LSTM表示和多头注意力表示,然后将这两个表示与原始输入数据进行拼接,最后通过全连接密集层(dense layer)生成预测值。LSTM的优势在于捕捉时间序列中的长期依赖,而多头注意力能够聚焦于重要输入特征并赋予更高权重,两者结合有助于提升预测准确性。

实验使用了16个公开时间序列数据集,涵盖意外死亡、IBM股票、湖泊水位、山猫数量、污染、股票、太阳黑子、科罗拉多河流量、航空乘客、英国互联网流量、温度、失业、牛奶产量、腮腺炎、水痘和交通流量等领域。每个数据集的训练集、验证集和测试集划分直接采用Panigrahi和Behera(2017)的设置。数据预处理阶段利用滞后值l从原始序列中提取长度为l+1的子序列,前l个点作为输入,第l+1个点作为目标输出,从而构建适合LSTM训练的输入-输出样本。评估指标采用对称平均绝对百分比误差(SMAPE),定义为公式(7)。

实验分为两部分。第一部分除滞后值外,其余超参数均设为固定值:LSTM隐藏单元数为128,多头注意力的注意力头数设为滞后大小,密集层单元数为100,学习率为0.001,优化器采用Adam算法,早停机制用于确定训练轮数(epoch),最大轮数设为500。每个时间序列的最优滞后值通过网格搜索基于验证集误差确定。第二部分采用贝叶斯优化(BO)算法对滞后大小、LSTM单元数、密集层单元数和学习率进行超参数调优,超参数范围见表7。对每个数据集进行10次实验,计算平均SMAPE。基线方法包括ETS、ARIMA、MLP、Babu和Reddy(2014)提出的混合方法、Zhang(2003)提出的ARIMA-ANN混合方法以及Panigrahi和Behera(2017)提出的ETS-ANN混合方法,同时单独实现LSTM和多头注意力模型以进行对比。

三、主要实验结果与分析

在第一部分实验中,所提出的混合模型在16个时间序列中的7个上取得了最低SMAPE,表现优于ETS、ARIMA、MLP、Babu和Reddy方法、Zhang方法以及ETS-ANN方法的大多数情况。具体而言,所提方法在12个数据集上优于ETS,在12个数据集上优于ARIMA,在15个数据集上优于MLP,在13个数据集上优于Babu和Reddy方法,在11个数据集上优于Zhang方法,在9个数据集上优于ETS-ANN方法。在与单个深度学习模型的比较中,所提方法分别在11个和13个数据集上优于多头注意力模型和LSTM模型。根据各方法在每个数据集上的排名计算平均秩(AR),所提方法取得了最佳平均秩(AR=3),多头注意力模型以AR=3.25位居第二,ETS-ANN方法以AR=3.6875位居第三,而ETS和ARIMA作为统计方法表现最差,平均秩分别为6.6875和6.5625。这表明统计方法更适合线性时间序列建模,对参数选择较为敏感,而注意力机制在时间序列模式捕捉方面展现了显著优势。

在第二部分实验中,使用贝叶斯优化选择超参数后,所提方法在16个数据集中的表现进一步得到验证。与ETS、ARIMA、MLP、Babu和Reddy方法、Zhang方法及ETS-ANN方法相比,所提方法分别在13、15、15、14、11和11个数据集上取得更优的SMAPE。与多头注意力和LSTM相比,所提方法分别在11和15个数据集上表现更优。平均秩结果(表9)显示,所提方法以AR=2.375排名第一,多头注意力以AR=3.0625排名第二,ETS-ANN以AR=3.71875排名第三,LSTM的平均秩为5.3125,而ETS和ARIMA的平均秩分别为6.875和6.78125,仍为最差。这一结果与第一部分一致,进一步验证了基于注意力的方法在时间序列预测中的有效性。

为检验方法间差异的统计显著性,研究采用非参数Friedman检验及Hochberg事后检验,显著性水平设为0.05。Friedman检验的p值为4.1×10⁻⁵,表明9种方法之间存在显著差异。Hochberg检验结果显示,以所提方法作为对照,ETS、ARIMA、MLP、Babu方法、Zhang方法和LSTM的表现显著差于所提方法(p<0.05),而ETS-ANN(p=0.498)和多头注意力(p=0.796)的表现未显著差于所提方法。这说明多头注意力模型和ETS-ANN混合模型与所提方法在统计上性能相当,但所提方法仍具有最佳平均表现。

此外,研究通过可视化方式展示了各时间序列的实际值与所提方法及多头注意力模型的预测值对比。在多数数据集中,两种方法的预测值均与实际值较为接近;部分数据集如TS 1、TS 6、TS 8中,多头注意力模型表现略优;而在TS 4、TS 7、TS 14、TS 15等数据集中,所提方法的预测精度更高。总体而言,所提混合模型在大多数数据集上取得了更稳定的预测效果。

四、结论与研究意义

本研究提出了一种基于LSTM和多头注意力机制的混合时间序列预测模型。该模型通过拼接LSTM表示、多头注意力表示和原始输入数据,充分利用了LSTM捕捉长期依赖的能力和多头注意力聚焦关键特征的优势。在16个公开数据集上的实验结果表明,该混合模型在大多数数据集上优于所有基准方法,取得了最佳平均秩。多头注意力模型作为第二优方法,证明了注意力机制在时间序列预测中的强大能力。相比之下,ETS、ARIMA和MLP等传统方法表现较差。本研究的科学价值在于系统评估了多头注意力机制在时间序列预测中的潜力,并验证了其与LSTM结合的互补优势。应用价值在于为多个领域的时间序列预测提供了一种高精度的深度学习解决方案,如金融、能源、交通和公共健康等。研究的局限性在于深度学习方法需要大量超参数调优,贝叶斯优化虽然有效但可能陷入局部次优解。未来工作将考虑结合时间序列特征以优化模型参数,进一步提升预测性能。

五、研究亮点

本研究的亮点包括:第一,首次在时间序列预测领域系统评估了基于多头注意力的预测模型及其与LSTM的混合模型;第二,所提混合模型通过拼接两种深度表示与原始数据,实现了特征融合,显著提升了预测精度;第三,研究在16个多领域公开数据集上进行了全面比较,方法覆盖统计模型、传统机器学习模型、混合模型和深度学习模型,评估结果具有较强说服力;第四,通过两阶段实验(固定超参数与贝叶斯优化超参数)验证了模型性能的稳健性;第五,采用Friedman检验和Hochberg事后检验进行统计显著性分析,增强了结论的可靠性。此外,研究详细讨论了超参数对模型性能的影响,指出滞后大小和神经元数量对预测精度具有重要影响,这与已有研究的结论一致。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com