分享自:

PANDA:针对异常检测与分割的自适应预训练特征方法

期刊:2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)DOI:10.1109/cvpr46437.2021.00283

PANDA:将预训练特征适配于异常检测与分割

本研究由Tal Reiss、Niv Cohen(共同第一作者)、Liron Bergman及Yedid Hoshen完成,作者均来自以色列耶路撒冷希伯来大学计算机科学与工程学院。该论文发表于2021年IEEE/CVF计算机视觉与模式识别会议(CVPR),论文标题为《PANDA: Adapting Pretrained Features for Anomaly Detection and Segmentation》。论文代码可在github.com/talreiss/PANDA获取。

学术背景与研究动机

异常检测是科学与工业领域中的关键任务,其核心目标是在仅给定正常训练样本的情况下,识别测试阶段出现的异常样本。近年来,深度学习方法的引入推动了该领域的发展,但现有主流方法几乎全部依赖自监督特征学习,即仅利用有限的正常训练数据来学习表征。这种做法基于两点动机:一是担心在辅助域上训练的特征无法泛化到目标域;二是出于学术好奇心,探究完全不使用外部数据集所能达到的性能上限。

然而,在计算机视觉的其他分支中,使用在大规模外部数据集上预训练的特征已成为提升下游任务性能的常规手段。本研究团队提出了一个合理的假设:图像异常检测与分割同样可以从预训练特征中获益。更重要的是,他们发现尽管多类分类任务中的迁移学习方法已相当成熟,但单类分类设置下的特征适配研究却十分有限。naive的适配方法在监督学习中通常有效,但在单类分类设置下往往导致灾难性坍缩,即所有样本(包括异常样本)被映射到同一特征点,使预训练特征的判别能力完全丧失。本研究的目标正是建立简单有效的基线方法,并提出能够避免灾难性坍缩的特征适配方案。

研究流程与实验设计

论文提出了一个三阶段通用框架来系统考察多种基于适配的异常检测方法。第一阶段为初始特征提取:使用在ImageNet等外部数据集上预训练的深度神经网络作为特征提取器ψ₀;第二阶段为特征适配:在目标正常训练数据上对特征提取器进行微调,得到适配后的特征提取器ψ;第三阶段为异常评分:提取全部训练样本的特征后,学习一个评分函数来度量测试样本的异常程度。

在此框架下,作者首先提出了两个极其简单的基线方法。在异常检测基线“深度最近邻”中,特征提取器直接使用ImageNet预训练的大型ResNet,以测试样本特征到k个最近邻正常训练样本特征的距离作为异常分数。在异常分割基线“语义金字塔异常检测”中,同样使用ImageNet预训练的ResNet提取逐像素特征。由于低层高分辨率特征和高层语义低分辨率上下文对于判断像素是否异常都至关重要,该方法将来自深度神经网络多个层的像素特征表示进行拼接,并以该像素特征描述子到所有训练图像像素特征的k近邻距离为异常分数。两个基线均跳过了适配阶段。

在特征适配方面,论文首先回顾了两种现有方法。DeepSVDD通过最小化紧凑性损失使训练样本特征向固定中心c靠拢,但为防止平凡解ψ=c的出现,该方法要求移除网络所有层的偏置项。联合优化方法则要求保留约5万个原始ImageNet训练样本,在适配时同时优化紧凑性损失和原始分类损失,这带来了存储开销大和可能损害异常检测精度的问题。

针对上述方法的不足,论文提出了PANDA方法。该方法同样使用紧凑性损失来适配预训练特征,但直接应对灾难性坍缩问题而非通过架构约束或引入外部数据来规避。作者提出了三种具体方案:其一是简单早停,在固定迭代次数后停止训练,例如在CIFAR-10上训练15个epoch;其二是样本级早停,该方法在训练过程中每隔固定间隔保存网络检查点,对每个检查点计算训练集样本到中心的平均距离sₜ,在推断时用各检查点模型对测试样本计算距离并用sₜ归一化,取最大比值作为该样本的异常分数,从而在无需验证集的情况下自适应地为每个样本选择最优停止时机;其三是受持续学习启发的弹性权重巩固,该方法在预训练阶段结束后计算网络所有权重参数的Fisher信息矩阵对角元素,将其作为权重重要性的度量,在适配训练时在紧凑性损失上增加一个正则化项,对重要性高的权重施加更强的变化约束,延缓特征坍缩的发生。

在异常评分阶段,除非特别说明,PANDA使用k近邻距离进行密度估计。对于离群暴露设置,当存在与异常样本相似的辅助数据集时,PANDA-OE直接训练一个线性分类层w,以w·ψ(x)作为异常分数。实验评估覆盖了CIFAR-10、CIFAR-100、Fashion-MNIST、CatsVsDogs、DIOR、MVTec、WBC、Oxford Flowers、Birds等多个数据集,涵盖不同规模、域、分辨率和对称性。对比方法包括One-Class SVM、DeepSVDD、Multi-Head RotNet、Joint Optimization以及异常分割领域的AE-SSIM、AE-L2、AnoGAN、CNN Dict、CAVGA-RU和Student-Teacher等方法。评估指标主要为ROC AUC百分比,分割任务额外使用PRO指标。

主要实验结果与发现

在高层结果方面,论文在表2中展示了各方法的平均ROC AUC性能。在CIFAR-10上,DN2基线达到92.5%的ROC AUC,PANDA进一步提升至96.2%,而当前最先进的Multi-Head RotNet仅获得90.1%;加入离群暴露后,PANDA-OE达到98.9%,显著优于RotNet-OE的95.6%。在CIFAR-100、Fashion-MNIST、CatsVsDogs和DIOR上,仅使用预训练特征的DN2已超越所有自监督方法,PANDA的适配进一步带来了约1%至2%的性能提升。表3的结果表明,即使在Birds、Flowers、MVTec和WBC等小规模或与ImageNet差异极大的数据集上,预训练特征的DN2仍以绝对优势超越所有自监督方法,例如在Birds上DN2达到95.3%而MH-RotNet仅64.4%。在异常分割任务中(表4),SPADE以96.2%的像素级ROC AUC和92.1%的PRO大幅领先于此前最佳方法Student-Teacher的85.7% PRO。

关于特征适配的分析揭示了几个关键发现。从表6可以看出,PANDA-EWC在CIFAR-10上达到96.2%的ROC AUC,优于联合优化的93.2%;在CatsVsDogs上,简单早停在部分类别上出现崩溃导致性能骤降至91.9%,而PANDA-SES通过样本级早停恢复至95.7%,PANDA-EWC则进一步达到97.3%。对DeepSVDD的消融分析表明,其通过去除偏置项的特征适配效果与简单的线性白化相当(64.8%对64.6%),说明其性能优势主要来自预训练特征而非架构约束。

论文还深入分析了自监督与预训练特征的差异。表5显示,预训练特征同时提高了正常样本和异常样本在旋转预测等辅助任务上的表现,实际上缩小了两类样本之间的泛化差距,从而削弱了基于自监督泛化差距的异常检测方法的判别能力。这一发现解释了为何RotNet类方法无法从预训练特征中获益。此外,k近邻评分相比到中心距离的评分带来约2%的平均提升(CIFAR-10上94.2%对96.2%),而k-means加速在异常分割任务上实现了从2.7帧每秒到41帧每秒的显著提速,仅损失约0.5%的ROC AUC。

研究结论与价值

本研究最重要的结论是:使用ImageNet预训练特征结合简单异常检测方法,能够以极大优势超越所有基于自监督学习的现有方法,这一结论在包括灰度图像、航拍图像、医学图像和工业图像在内的广泛域上均成立。论文进一步表明,通过针对单类分类设置量身定制的特征适配方法,性能可以获得进一步提升,而早停——特别是样本级早停——和弹性权重巩固是克服灾难性坍缩的有效手段。

该研究的科学价值在于系统性地揭示了预训练特征在异常检测任务中的巨大潜力,挑战了该领域长期以来的“自监督优先”范式,并明确指出了DeepSVDD等方法的适配机制实际上并未超越简单的数据白化。在应用价值方面,论文提供的DN2和SPADE基线方法实现极为简单且无需任何训练,可被工业界直接采用;PANDA方法在效果与计算开销之间取得了良好平衡,k-means加速证明了其实时应用的可行性。论文同时指出了工作的主要局限——对强预训练特征提取器的依赖,并展望了通用特征提取器在表格数据等领域的未来发展方向。

研究亮点

本研究具有三重亮点。其一,发现之重要:首次实证确立了预训练特征在图像异常检测和分割中对自监督特征的压倒性优势,且这一优势在不同规模、不同域的九个数据集上均成立。其二,方法之新颖:PANDA-SES的样本级早停机制是首个在无需验证集异常样本的情况下,通过训练集距离归一化来为每个样本自适应选择停止时机的方案;PANDA-EWC将持续学习中的弹性权重巩固首次引入单类分类特征适配,利用Fisher信息矩阵量化权重重要性以延缓特征坍缩。其三,分析之深刻:论文通过表5的辅助任务精度对比,巧妙揭示了预训练特征反而缩小正常与异常样本之间泛化差距这一反直觉现象,为理解自监督异常检测方法的局限性提供了机制性解释。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com