分享自:

基于光场焦栈融合2D纹理与3D几何特征的可靠虹膜呈现攻击检测

期刊:IET BiometricsDOI:10.1049/bme2.12092

本研究由来自中国科学技术大学自动化系的Zhengquan Luo和Zilei Wang,以及中国科学院自动化研究所智能感知与计算研究中心(CRIPAC)、模式识别国家重点实验室(NLPR)的Yunlong Wang和Nianfeng Liu合作完成。研究成果以论文形式发表于期刊《IET Biometrics》,文章于2021年12月30日收到,2022年6月4日修订,2022年8月5日接受,最终在线发表。

这项研究属于生物特征识别安全领域,具体聚焦于虹膜呈现攻击检测(Presentation Attack Detection, PAD),即区分真实活体虹膜与伪造的虹膜攻击样本(如打印的纸张、照片或电子屏幕显示的图像)。虹膜识别系统虽已广泛应用,但其安全性面临各种呈现攻击仪器(PAI)的持续威胁。传统的软件检测方法多依赖于二维平面图像的色彩、纹理等差异,但难以捕捉活体虹膜与伪造品在三维几何结构上的本质区别。而基于硬件的检测方法(如分析角膜反射、瞳孔动态)通常需要额外设备,成本高且不便。近年来,光场(Light Field, LF)成像技术因其能单次曝光捕获场景的四维(空间-角度)信息,从而蕴含丰富的三维几何结构信息,为PAD提供了新思路。然而,现有的光场虹膜PAD研究多依赖于手工设计特征,且公开的光场虹膜数据稀缺,难以训练数据饥渴的深度学习模型。因此,本研究旨在解决两个核心问题:一是如何有效结合虹膜的二维纹理与三维几何特征进行更可靠的活体检测;二是在缺乏大规模训练数据的情况下,如何构建一个高性能且泛化能力强的检测框架。本研究的目标是提出一种融合光场成像与深度学习优势的框架,利用预训练模型提取的“现成”(off-the-shelf)深度特征,结合支持向量机(SVM)分类器,实现高效、鲁棒的虹膜呈现攻击检测。

本研究的工作流程包含几个关键步骤:数据准备与预处理、特征提取(分为二维纹理特征和三维几何结构特征两条分支)以及特征融合与分类。实验在Song等人收集的光场虹膜数据集上进行。该数据集使用实验室自制的基于微透镜阵列的光场相机在近红外(NIR)照明下采集,包含14位受试者的504个样本(230个真实虹膜,274个攻击样本)。攻击类型包括打印纸、打印光面照片和电子显示屏显示。每个光场样本被解码为空间分辨率128x96、角度分辨率7x7的子孔径图像(SAI)集合。通过数字重聚焦技术,以前述最佳聚焦平面为中心,在深度范围[α* - 0.2, α* + 0.2]内以步长δα = 0.0028渲染出包含145个切片(slice)的焦堆栈(focal stack),作为后续处理的基础。

特征提取采用双分支架构。第一分支用于提取二维空间纹理特征。研究首先需要从焦堆栈中选取最能清晰呈现虹膜纹理的切片。为此,采用Tenengrad梯度方差(TGV)作为聚焦度量函数,通过粗到精的策略计算每个切片的聚焦能量,找到能量最大的切片,即最佳聚焦虹膜图像Iα*。随后,使用在ImageNet上预训练的平面导向(planar-oriented)深度学习模型(包括ResNet50、InceptionV3和MobileNetV2)作为特征提取器,从Iα*中提取高维纹理特征向量f2d。这些模型未经任何虹膜数据微调,直接使用其“现成”的深度特征。

第二分支用于提取三维几何结构特征。研究利用整个焦堆栈序列{ Iα }来编码虹膜区域的深度布局信息。真实虹膜与平坦或简单曲面的攻击样本(如纸张、屏幕)在焦堆栈相邻切片间的离焦模糊变化模式上存在本质差异。为了捕捉这种序列中的时空模式,研究采用了在大型视频数据集(Sports-1M, Kinetics-400)上预训练的序列导向(sequence-oriented)三维卷积神经网络模型(包括C3D和P3D)作为特征提取器。将145个切片的焦堆栈作为输入序列,模型输出三维几何结构特征向量f3d。同样,这些预训练模型也未经目标数据微调。

在获得两种特征后,进行特征融合与分类。为确保两种特征在融合时贡献平衡,首先使用主成分分析(PCA)将高维的纹理特征f2d降维至与f3d相同的长度(512维),得到f‘2d。随后,将f‘2d与f3d在特征级别进行拼接,形成融合特征向量。该融合特征被送入支持向量机(SVM)分类器进行二分类(真实 vs. 攻击)。研究中采用了5折交叉验证来优化SVM的参数(核函数选择RBF,并设置tol=1e-6, C=1000.0),并使用网格搜索进行超参数选择。此外,研究还对比了仅使用纹理特征、仅使用几何特征、特征级融合和分数级融合等多种策略的性能。

本研究进行了四组实验来验证框架的有效性。第一组是比较实验,将所提框架的多种变体(不同预训练模型组合)与现有的虹膜PAD方法进行对比。评价指标包括攻击呈现分类错误率(APCER)、真实呈现分类错误率(BPCER)、平均分类错误率(ACER)、在固定APCER下的BPCER10/BPCER20以及等错误率(EER)。结果显示,最佳变体MobileNetV2+C3d取得了显著优于其他方法的性能,其平均ACER为1.19%,平均EER为1.05%。它甚至超过了在同一数据集上经过微调的先进方法(如ft_D-NetPAD),而后者需要调整数百万权重参数,本研究仅需优化SVM的少量参数,更为高效。

第二组是消融研究,旨在验证特征融合的有效性。实验结果表明,无论是特征级还是分数级融合,其性能(EER更低,DET曲线更优)均显著优于单独使用纹理分支或几何分支。例如,单独使用MobileNetV2和C3d的EER分别为1.81%和4.25%,而融合后(MobileNetV2+C3d)的EER降至1.05%。这证明了二维纹理与三维几何特征在虹膜活体检测中具有互补性,融合能有效提升检测性能。研究还发现,与P3d结合的变体性能普遍不如与C3d结合的变体。

第三组是多类别攻击分类实验,用于评估框架对未知攻击类型的泛化能力。采用留一法协议,即每次训练时保留一种攻击类型的所有样本和一半真实样本作为测试集,其余数据用于训练。使用最佳变体MobileNetV2+C3d进行测试。结果显示,对于未见过的攻击类型(如电子显示屏),其平均EER为8.66%,而对打印纸和打印照片的检测EER分别为3.33%和0.82%,整体平均EER为4.27%。这表明该框架在面对新型攻击时仍具有良好的泛化能力。

第四组是鲁棒性分析,测试框架在图像质量退化情况下的稳定性。通过向焦堆栈切片中添加不同程度的对角运动模糊或零均值高斯噪声来模拟实际采集中的退化因素。实验表明,随着模糊或噪声水平的增加,MobileNetV2+C3d的性能下降平缓,EER波动保持稳定,证明了该框架对运动模糊和噪声等退化因素具有较强的鲁棒性,这对于实际应用至关重要。

本研究的结论是,成功提出并验证了一个结合二维纹理与三维几何特征的光场虹膜呈现攻击检测框架。该框架的创新之处在于,它巧妙地利用了光场成像能提供丰富三维信息的特性,并通过对预训练深度学习模型的“现成”深度特征进行提取与融合,克服了光场虹膜数据稀缺的瓶颈。仅需优化轻量级的SVM分类器,即可达到甚至超过需要大量数据微调的深度模型的性能。研究证实了纹理与几何特征融合的有效性和必要性,显著提升了检测精度。同时,该框架展现出对未知攻击类型的良好泛化能力以及对图像退化的强鲁棒性,为其在实际虹膜识别系统中的部署提供了可能。

本研究的亮点主要体现在以下几个方面:首先,方法新颖性高,首次将面向视频分析的预训练3D CNN模型用于从光场焦堆栈中提取隐含的三维几何特征,并与2D CNN提取的纹理特征进行融合,思路独特。其次,实用性强,提出的方案是一种“现成”解决方案,无需针对特定任务收集海量数据并重新训练庞大的CNN模型,资源效率高,易于移植。再次,性能卓越,在标准评测指标上显著超越了基于2D平面图像、基于光场手工特征乃至经过微调的先进深度学习PAD方法。最后,验证全面,不仅进行了常规的二分类性能比较,还通过消融实验、多类别攻击检测和鲁棒性测试,从多个维度充分验证了框架的有效性、泛化能力和稳定性。

此外,本研究还有以下有价值的内容:一是公开了实验所用的光场焦堆栈数据以及源代码,促进了该领域研究的可重复性与进一步发展。二是在理论层面,通过公式推导分析了焦堆栈相邻切片间的差异与场景深度梯度的关系,为使用序列模型捕捉几何特征提供了理论依据。三是详细讨论了不同类型呈现攻击(如2D平面攻击与3D模拟攻击)在纹理和几何特性上的固有缺陷,从原理上解释了所提双分支框架的有效性。这些工作共同为光场成像在生物特征安全领域的应用提供了重要的理论支撑和实践范例。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com