本文是一篇关于利用机器学习与深度学习进行血压预测的方法论综述,作者为Keke Qin、Wu Huang、Tao Zhang和Shiqi Tang,发表于Artificial Intelligence Review期刊,2022年在线发表。文章系统回顾了截至2022年2月血压预测领域的最新进展,并从多个视角构建了分类体系,分析了数据集、评价指标与评价策略,并提出了面向客观模型评估的一般性建议。
文章首先指出血压估计是健康监测领域最受关注且历史悠久的课题之一。随着机器学习,尤其是深度学习技术的发展以及大规模公开数据集的发布,基于数据驱动的血压预测取得了显著进展。作者通过统计发现,2018至2021年间发表的论文数量远超2018年之前的总和,因此有必要对最新研究进行系统梳理。同时,现有综述多聚焦于传统方法如脉搏传导时间、脉搏波速度等,而深度学习方法的覆盖不足,且通常局限于特定信号源。本文的动机在于弥补这些空白,并从机器学习研究者的视角分析当前研究结果可重复性与客观评估中的关键问题。
作者提出了一个多视角分类系统,从四个维度对血压预测研究进行归类。第一是问题建模方式,包括分类问题、回归问题、信号转换、序列预测和在线或增量学习五类。分类方法将血压范围划分为若干区间,用于判断血压状态;回归方法直接预测血压值,是本领域最常用的建模方式;信号转换方法通过重建动脉血压波形间接获取血压值;序列预测方法考虑样本间的时间依赖关系;在线学习方法以流式方式逐步更新模型,以适应概念漂移等动态变化。第二是特征提取与模型构建是否同时进行,据此分为传统基于特征的机器学习方法和深度学习方法。传统方法依赖显式的信号去噪、分割、数据清洗、峰值检测、特征提取、特征选择与降维等步骤,常用算法包括线性回归、支持向量回归、随机森林和AdaBoost等。深度学习方法则能够从原始信号中直接学习表示,实现端到端训练,常用基础架构包括前馈神经网络、循环神经网络、卷积神经网络、提升神经网络和孪生网络,以及多种混合架构。第三是任务间关系是否被建模,分为单任务学习和多任务学习。多任务学习通常共享底层网络参数,同时预测收缩压、舒张压和平均血压。第四是信号来源,包括生理信号、健康行为数据、轨迹数据以及面部视频等。
在数据集与评估方面,文章指出数据驱动方法依赖大规模高质量数据,但常用的重症监护数据库中的信号常受到噪声干扰,因此数据清洗和信号质量评估是重要步骤。作者还特别关注了常被忽视的数据划分策略问题。传统机器学习假设训练集与测试集满足独立同分布,但在实际生理信号数据中,同一受试者的多个样本之间存在明显相关性。如果随机划分数据集,同一受试者的样本可能同时出现在训练集和测试集中,导致模型性能被高估。因此,作者呼吁采用按受试者划分的策略,以更客观地评估模型的泛化能力。
文章进一步讨论了血压预测中的若干实践问题与新兴技术。例如,收缩压与舒张压预测精度差异显著,收缩压预测误差通常更大;个体差异是影响模型泛化性能的关键因素;样本时长、数据增强策略和不同信号组合方案都会影响模型效果。作者还探讨了手工特征与机器学得特征之间的区别与联系,指出虽然深度学习方法常表现出更高精度,但其可解释性不足,而手工特征往往具有明确的生理意义。此外,文章介绍了自动机器学习、迁移学习、元学习、联邦学习和设备端机器学习等先进机器学习技术在血压预测中的潜在应用。这些方法有望在个性化建模、数据隐私保护以及资源受限场景中发挥作用。
在方法论层面,作者从机器学习视角对当前相关研究中的系统比较不公平性和结果不可靠性进行了批判性分析。影响结果可信度的因素包括数据预处理方式、特征选择、归一化策略、评价指标选择以及评估流程设计等。为此,作者提出了一个面向客观评估模型性能的一般性建议框架,强调应采用统一的数据划分标准、报告多种评价指标、并进行统计显著性检验。作者还讨论了“一个好的血压估计器应该具备什么特征”这一问题,认为除了精度之外,还应关注泛化能力、个体适应性、可解释性以及长期稳定性等方面。
文章的主要贡献包括:系统回顾了构建血压预测流程所涉及的各个要素;从多视角分类出发,对现有研究进行了结构化梳理;总结了数据集、评价指标和评估流程;批判性分析了当前报告结果的可靠性问题;并提出了面向客观评估的建议。作者还提供了一份包含相关资源的公开代码库,便于后续研究者参考。
总体而言,这篇综述为血压预测领域的研究者提供了全面、系统且前沿的参考。它不仅涵盖了方法与技术层面的进展,还从评估与可重复性的角度提出了重要见解。随着可穿戴设备和远程医疗的发展,基于机器学习与深度学习的无袖带血压监测有望在临床与日常健康管理中发挥更大作用。然而,要实现这一目标,仍需要在数据标准化、模型泛化性验证以及临床验证等方面进行更深入的研究。本文的价值在于为这些挑战提供了系统的分析框架与未来的研究方向。