作者 Pengqian Lu、Jie Lu、Anjin Liu 与 Guangquan Zhang 来自澳大利亚人工智能研究所(Australian Artificial Intelligence Institute, AAII),隶属于悉尼科技大学(University of Technology Sydney)。该研究发表于第三十九届 AAAI 人工智能会议(the Thirty-Ninth AAAI Conference on Artificial Intelligence, AAAI-25)。
本研究属于机器学习中的概念漂移(concept drift)检测领域,重点解决流式数据(streaming data)环境下分类模型性能退化的早期预警问题。概念漂移是指数据分布随着时间发生不可预测的变化,会显著降低模型性能。传统上,基于错误率(error rate)的检测器因其计算高效而被广泛使用,但作者指出这类方法存在本质缺陷:在漂移早期,即使数据分布已经发生变化,分类器的错误率可能仍然保持稳定,从而无法及时发出漂移警报。针对这一问题,作者提出了一种新的检测信号——预测不确定性指数(Prediction Uncertainty Index, PU-index),并基于该指数设计了相应的漂移检测器 PUDD(PU-index-based Drift Detector)。研究的核心目标是回答两个关键问题:第一,是否存在一种比错误率更有效的漂移检测信号,能够在错误率尚不变化时捕捉数据分布的变化;第二,能否从理论上证明,如果该新信号未检测到显著变化,模型的错误率也将保持稳定。也就是说,作者希望从理论上证明 PU-index 在漂移检测灵敏度上至少不弱于错误率,并且在某些情况下更优。
论文的论证结构分为理论分析和算法实现两大部分,并在实验部分进行了系统的验证。
在理论分析中,作者提出了两个关键定理。定理一指出,如果两个数据窗口中的 PU-index 直方图完全相同,并且直方图的第一个箱子包含所有被错误分类的样本,其余箱子用于划分正确分类样本,则这两个窗口的错误率和错误标准差也必然相等。定理二则从反面说明,即使两个窗口具有相同的错误标准差或错误率,它们的 PU-index 直方图中对应箱子的比例也可能不同。这两个定理共同表明:当 PU-index 分布没有变化时,错误率也一定没有变化;但反过来,当错误率没有变化时,PU-index 分布却可能发生变化。这意味着 PU-index 至少在灵敏度上等同于错误率,而在某些场景中具有更高的漂移检测潜力。
在算法实现上,PUDD 使用滑动窗口策略处理在线流式数据。具体来说,在检测到某次漂移后,系统会丢弃过时数据,避免旧分布对未来检测造成虚假警报。对于当前保留的数据子流,算法枚举所有可能的切割点,将数据划分为两个窗口,然后对这两个窗口的 PU-index 值进行统计比较。为了保证卡方检验(Pearson’s chi-square test)的有效性,算法将所有被错误分类的样本的 PU-index 强制放入同一箱子,而对正确分类样本的 PU-index 则通过自适应 PU-index 分箱算法(adaptive PU-index bucketing algorithm)进行划分。该分箱算法基于 EI-kMeans 空间划分方法,并结合 amplify-shrink 算法调整每个簇中的样本数量,以满足卡方检验对期望频数的要求。之后,PUDD 构建列联表,并利用卡方检验计算 p 值。如果在所有窗口划分中,最小 p 值低于预设的显著性阈值,则发出漂移警报。阈值的设定控制单次检验的第一类错误率,而不是整个子流的家族错误率。
实验部分使用了多个合成数据集和真实数据集,包括 airline、elec2、powersupply、sine、mixed、sea 变体以及作者自行构建的图像漂移数据集 CIFAR-10-Cd。CIFAR-10-Cd 通过马尔可夫过程模拟用户兴趣变化,初始时选择 CIFAR-10 中的三个类别作为正类,并以一定概率向其他类别转移。分类器分别采用深度神经网络(DNN)、高斯朴素贝叶斯(GNB)和 VFDT,并设置两种训练方式:增量训练(incremental training)和仅在漂移警报时重新训练(one-time training at alarm)。对比方法包括 ADWIN、DDM、EDDM、HDDM-A、HDDM-W、KSWIN、PH 等经典检测器,以及 AMF、IWE、NS、ADLTER、MCDD 等较新的方法。结果表明,PUDD 在多数数据集和分类器上取得了前三位甚至第一位的准确率,尤其在增量学习场景中表现突出。在 CIFAR-10-Cd 上,PUDD 优于所有基线方法,显示出其在图像流数据中的适用性。此外,实验发现,PUDD 在较小的显著性阈值下表现更好,说明该方法对漂移具有较高的敏感性。与 EI-kMeans 分箱方法相比,自适应 PU-index 分箱算法在多个数据集和阈值设置下均取得了更高准确率,并且在部分阈值下提升具有统计显著性。
本研究的核心贡献可以概括为三点。第一,首次对两种不同漂移检测信号进行了系统性的理论比较,明确证明了 PU-index 相对于错误率在概念漂移检测中的优越性。第二,提出了一种全新的漂移检测指标 PU-index,它测量的是分类器对真实类别预测概率的补数,即 1 减去真实类别的预测概率。第三,设计了基于 PU-index 的检测器 PUDD,其中包含自适应 PU-index 分箱算法,能够自动构建满足理论条件的直方图,并结合卡方检验实现可靠的漂移检测。
从方法特色来看,PU-index 的理论优势在于它捕捉了错误率所忽略的预测不确定性变化。错误率只关注最终的类别判断是否正确,而预测不确定性则反映了模型对样本分类的置信程度。当数据分布开始变化但尚未导致错误率上升时,模型对某些样本的预测概率往往已经发生偏移,这种偏移可以被 PU-index 捕捉到。例如在论文给出的示意图中,两个测试集的错误率相同,但预测不确定性的分布已经不同,直观地说明了 PU-index 能够在错误率不变的阶段检测到漂移。此外,作者利用卡方检验而非简单的阈值比较,可以有效控制误报率,增强检测的统计可靠性。
在应用价值方面,PUDD 为流式数据分类中的早期漂移检测提供了一种理论上有保障、实践上可行的方法。它适用于结构化数据和图像数据,在医疗分诊、时间序列预测、联邦学习等领域具有潜在应用前景。值得注意的是,该研究还公开了代码仓库(https://github.com/rocstone/pudd)以及扩展版本论文(https://arxiv.org/abs/2412.11158),便于后续研究者复现和深入扩展。
不过,作者也指出了一些局限性。当前的漂移警报阈值仍依赖人工设定,随着时间推移,固定阈值可能不再是最优选择。未来工作应关注自动确定阈值的方法。另外,在 airline 数据集中,PUDD 的性能不如 NS 和 ADLTER 等基于树集成的先进方法,原因是该数据集属性较多且更适合集成模型,而 PUDD 主要依赖在最近数据上重新训练分类器。尽管如此,在其他大多数数据集上,PUDD 仍显著优于这些方法。
总体而言,本研究通过引入预测不确定性指数,为概念漂移检测提供了新的理论视角和工程实现。PU-index 不仅克服了错误率在漂移早期不敏感的缺点,还通过定理证明和实验验证确立了其作为检测信号的优势。PUDD 检测器凭借滑动窗口、自适应分箱和卡方检验的组合,能够在保持较低误报率的同时实现对漂移的高灵敏度检测,具有重要的科学研究价值和实际应用前景。