分享自:

利用机器学习方法建模金融时间序列的新见解:来自加密货币市场的证据

期刊:Expert Systems with ApplicationsDOI:10.1016/j.eswa.2023.121012

本文属于类型a,即单一原创研究的学术论文。以下是基于该文档生成的学术报告:

本研究由来自伊朗K. N. Toosi University of Technology工业工程系的Morteza Khosravi和Majid Mirzaee Ghazani共同完成,其中Majid Mirzaee Ghazani为通讯作者。该研究成果发表于国际学术期刊《Expert Systems with Applications》第234卷,文章编号为121012,于2023年7月25日在线发表,并于2023年4月10日投稿,2023年7月8日修回,2023年7月16日被接收。

本研究的学术背景主要围绕金融时间序列建模这一核心领域展开。金融时间序列预测长期以来一直是学术研究与市场实务中极为重要但高度困难的任务。金融时间序列具有接近随机游走、非平稳、高噪声、高波动、统计特征随时间变化等复杂特性,这使得传统统计方法在建模时往往难以获得令人满意的效果。近年来,随着加密货币市场的迅速崛起,比特币等加密资产因其去中心化架构、缺乏第三方案监管、没有期货市场作为基准等特点,使得价格预测问题更加复杂。同时,机器学习与深度学习方法在金融时间序列预测中的应用日益广泛,但实际建模过程中仍面临过拟合、信息泄露、非平稳性处理等关键挑战。本研究旨在通过构建一套新颖的金融时间序列建模流程,重点改进数据预处理和特征选择环节,从而降低泛化误差,提升预测准确性。

本研究提出并比较了三种不同的建模流程:传统流程、中间流程和提出的流程。整个研究围绕比特币的日收益率序列展开,样本数据覆盖2018年8月16日至2022年6月22日。研究共收集并提取了218个特征,这些特征分为五类:Google搜索指数15个、全球金融市场指数99个、比特币市场价格数据41个、区块链链上参数45个,以及大宗商品价格18个。研究采用了随机森林、XGBoost和长短期记忆网络三种机器学习与深度学习模型。整个建模过程被划分为六个主要阶段:数据收集与特征工程、观察值标注、特征选择、平稳性处理、超参数调优与模型评估。

在观察值标注阶段,传统流程采用固定时间范围标注方法,而提出的流程采用三重障碍法进行标注。三重障碍法在价格图上设定两个水平障碍(止损线和止盈线)和一个垂直障碍(时间到期限制),并根据价格首先触及哪个障碍来决定该交易日的标签。在本研究中,止损限设为1%,止盈限设为1.5%,垂直时间限制设为5天。标注结果显示,负标签有670天,其中649天因触及止损线,21天因时间到期后收益为负;正标签有663天,其中651天因触及止盈线,12天因时间到期后收益为正。

在特征选择阶段,两种流程均采用了平均精度下降法作为核心特征选择方法。但传统流程在交叉验证时使用普通K折交叉验证,而提出的流程使用清除式K折交叉验证,并辅以防泄漏操作。清除操作会移除训练集中与验证集标签存在时间重叠的观测值,而防泄漏操作则进一步排除验证集之后一段短暂时间窗口内的训练观测值,以防止序列相关性导致的信息泄露。在相同的特征影响阈值0.0002下,传统流程选择了30个特征,提出的流程选择了24个特征。特征类型分布也发生了显著变化:提出的流程中,链上特征和比特币市场特征的相对占比分别从23%和20%下降至13%和13%,而Google搜索相关特征的占比则从10%上升至17%。此外,特征分析还发现了一些对模型预测能力有负面影响的特征,如提出的流程中的num_of_txn_lag1和gold_price_lag2,以及传统流程中的index_ftse_lag4和index_fchi_lag4。

在平稳性处理阶段,传统流程采用完全阶数差分方法,即一阶差分,而提出的流程采用分数阶差分方法。分数阶差分允许以实数d作为差分阶数,而非仅取整数。以close_lag1特征为例,当d从0逐步增加至1时,差分后序列与原序列的相关系数逐渐下降。当d=0.3时,ADF检验的p值为0.00371,已能满足平稳性要求,此时相关系数仍高达94.65%。而当d=1,即完全一阶差分时,相关系数仅为2.55%,意味着失去了超过97%的原始信息与记忆。这表明分数阶差分能在实现平稳性的同时最大限度地保留时间序列的记忆,从而为模型训练提供更有价值的信息。

在超参数调优阶段,传统流程使用K折交叉验证,而提出的流程使用组合清除交叉验证方法。组合清除交叉验证通过生成多条不同的训练集与测试集路径,对模型进行更全面的验证,同时结合清除和防泄漏操作以避免信息泄露。三种模型各自设定了不同的超参数搜索空间。长短期记忆网络模型的超参数包括隐藏层数量、训练轮数、批次大小、学习率和丢弃率;随机森林模型的超参数包括估计器数量、最大深度、叶节点最小样本数、最大特征数和成本复杂度剪枝参数;XGBoost模型的超参数包括估计器数量、最大深度、学习率、子采样率、列采样率以及L1和L2正则化参数。

在性能评估阶段,研究采用了平均绝对误差、绝对误差的中位数、标准差、四分位距、最小值、最大值、均方根误差和平均绝对百分比误差等多项指标。结果显示,在随机森林模型中,提出流程的平均绝对百分比误差为11.2%,中间流程为13.2%,传统流程为24.3%;XGBoost模型中三者分别为11.2%、16.0%和26.5%;长短期记忆网络模型中分别为7.7%、11.5%和20.7%。在所有三种模型中,提出的流程均显著优于中间流程和传统流程。中间流程与传统流程使用相同的特征集,但采用分数阶差分,通过比较这两者可以观察到分数阶差分的效果;将提出流程与中间流程进行比较,由于二者均使用分数阶差分,但提出流程在特征选择和超参数调优中采用了清除与防泄漏交叉验证,因此可以量化清除和防泄漏操作对降低泛化误差的贡献。结果表明,长短期记忆网络模型在提出的流程下取得了最佳的整体预测性能,平均绝对百分比误差仅为7.7%,平均绝对误差为3000.11美元。

本研究的核心结论是,系统的数据预处理与特征选择创新能够显著降低金融时间序列建模中的泛化误差。分数阶差分方法能够在保证平稳性的前提下有效保留时间序列的记忆信息,而清除与防泄漏交叉验证方法能够有效减少因时间序列数据重叠和序列相关性导致的信息泄露问题。这些方法的综合应用使得机器学习模型在比特币价格预测中的准确性和稳健性均得到了显著提升。本研究对投资者、学术研究人员和政策制定者均具有重要的参考价值。对投资者而言,更准确的预测模型有助于优化交易策略和风险管理;对学术界而言,本研究提供了一套可复用的金融时间序列建模流程,为后续研究提供了方法学参考;对政策制定者而言,更深入理解加密资产价格动态的影响因素有助于构建更有效的市场监管框架。

本研究的亮点主要体现在三个方面。第一,提出了一套完整的六阶段金融时间序列建模流程,并将传统方法与创新方法在每一阶段进行系统对比。第二,首次在同一框架下综合应用三重障碍标注法、平均精度下降特征选择、清除与防泄漏交叉验证、组合清除交叉验证以及分数阶差分等先进技术,并清晰量化了各技术环节对最终预测性能的贡献。第三,通过构建中间流程这一研究设计,成功分离了分数阶差分方法与清除防泄漏交叉验证方法各自的效果,为理解不同预处理技术的作用机制提供了实证依据。此外,本研究还特别关注了训练集与测试集市场状态差异带来的建模挑战,训练集主要为上涨行情,而测试集则处于下跌行情,这种设计使得模型泛化能力的评估更具说服力。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com