本文属于类型a,是一篇关于夜间图像增强质量评估的原创性研究论文。以下是对该研究的学术报告。
本研究由Xuejin Wang、Leilei Huang、Hangwei Chen、Qiuping Jiang、Shaowei Weng和Feng Shao等学者共同完成。主要作者分别来自福建理工大学和宁波大学。该论文于2024年4月22日发表在IEEE Transactions on Multimedia(《IEEE多媒体汇刊》)第26卷上。
从学术背景来看,夜间图像增强(Night-time Image Enhancement, NIE)旨在提升低光照区域的亮度,同时抑制夜间图像中的噪声或光照伪影。随着人工智能、5G和云计算技术的成熟,计算机视觉在自动驾驶、视觉监控等领域的应用日益广泛,对夜间图像质量提出了更高要求。然而,由于夜间图像增强任务中缺少完美的参考图像,如何公平地比较不同NIE算法的性能、从候选增强结果中选出最佳结果,一直是一个具有挑战性的难题。现有的NIE性能评价主要依赖定性比较和通用质量指标,但这些方法往往与人类视觉感知不一致。此前虽然已有少量针对增强夜间图像(Enhanced Night-Time Images, ENTIs)的质量评价数据集和指标,但存在以下局限:主观研究仅关注算法对低光照区域亮度的提升能力,忽视了不同光照条件下夜间场景的影响;只涉及传统NIE算法而未纳入基于深度学习的新兴算法;现有质量指标的鲁棒性不足。针对这些问题,本研究致力于构建一个新的ENTIs质量评价基准数据集,并提出一种综合考虑图像内在属性和损伤属性的客观排序方法。
在研究流程方面,本研究包含两个主要阶段:数据集构建和客观排序方法设计。首先,研究者构建了一个新的真实世界夜间图像增强质量评估数据集,命名为RNTIEQA(Real-world Night-time Image Enhancement Quality Assessment)。数据集的源图像共200张真实夜间图像,涵盖人物、车道线、车辆、交通标志、街景、交通站、建筑等多种场景,选自ExDark、DarkFace、HDR-Real、LLIV-Phone和NightCity等公开数据集。根据夜间场景的主要退化类型,源图像被划分为两个子集:极低光照(Extremely Low Light, EL)样本和光照不均(Uneven Light, UL)样本。研究者选取了10种具有代表性的NIE算法来生成增强结果,包括监督方法(MBLLEN、DSLR、URetinexNet)、半监督方法(DRBN)和无监督方法(EnlightenGAN、Zero-DCE、RUAS、Night-Enhancement、SCI、PairLIE)。每张夜间图像通过这10种算法分别生成10个增强结果,因此数据集共包含2000个ENTIs。在主观用户研究中,研究者采用了成对比较(Pairwise Comparison)方法。每对来自同一场景但由不同算法生成的ENTIs同时显示在屏幕上,受试者需要投票选出感知质量更好的图像。整个数据集被分为10组,每组包含20个夜间场景对应的200个ENTIs,每组邀请15名受试者参与测试,共150名受试者,最终获得135000张投票。为分析主观结果的统计特性,研究者进行了收敛性分析和全局排名分析。收敛性分析表明,投票数量和图像数量均足够大,可以获得稳定的主观分数。全局排名方面,研究者采用Bradley-Terry模型(B-T模型)从成对比较结果中推导主观分数,获得每个ENTI的B-T分数作为主观排名分数,分数越高表示质量越好。此外,相关性分析表明EL子集和UL子集之间B-T分数的相关性较低,验证了数据集划分的有效性,能够区分不同NIE算法在不同光照条件下的性能差异。
在客观排序方法部分,研究者提出了一种新的基于深度学习的质量评价方法。整体框架包含训练阶段和测试阶段。在训练阶段,训练ENTIs对首先通过图像分解网络分解为反射率分量(Reflectance Component)和光照分量(Illumination Component)。图像分解网络基于Retinex理论,以UHD-NID数据集上不同曝光水平的成对夜间图像作为输入,在没有真实标签的情况下进行预训练,通过反射率一致性损失、反射率平滑损失、光照互一致性损失、光照相对平滑损失和重建损失等混合损失函数进行约束。然后,分解结果和ENTIs对作为孪生网络(Siamese Network)的输入进行特征提取。特征提取包含两个模块:内在感知特征提取模块(Intrinsic Perceptual Feature Extraction, INPFE)和损伤感知特征提取模块(Impairment Perceptual Feature Extraction, IMPFE)。INPFE模块基于Retinex理论设计,由光照重建网络和反射率网络组成,用于挖掘ENTIs中包含的内在信息;IMPFE模块采用类似VGG-16的卷积神经网络结构,用于提取增强过程中引入的退化相关信息。两个模块提取的多级特征图被拼接并通过全局平均池化进行融合。最后,采用成对排序(Pair-wise Ranking)策略,以偏好标签作为监督信号训练排名模型。在测试阶段,测试ENTIs对经过类似的流程,通过排名模型预测偏好标签,进而构建偏好标签矩阵,计算每个ENTI的排名分数。
在实验结果方面,研究者采用五折交叉验证策略,使用PLCC(Pearson线性相关系数)、SRCC(Spearman秩相关系数)、KRCC(Kendall秩相关系数)和RMSE(均方根误差)作为评价指标。他们将所提方法与13种代表性的盲图像质量评价指标进行了比较,包括NIQE、IL-NIQE、SNP-NIQE、NIQMC、BRISQUE、OG-IQA、FRIQUEE、NBIQA、BLIINDS-II、PIQE、NUIQ、CNNIQA、VCRNet和DBCNN。实验结果表明,所提方法在整个数据集和两个子集上的SRCC均优于所有对比指标,表明其在排序ENTIs质量方面的优越性。深度学习方法的性能普遍优于传统学习方法,但仍不如所提方法,这是因为它们忽略了人类在比较同一场景的两张ENTIs时所利用的差异信息。大多数质量指标在EL子集上的性能优于UL子集,说明光照不均场景下ENTIs的退化特性更为复杂。研究者还进行了针对不同NIE算法的排名实验,将B-T分数和不同质量指标预测的排名结果进行了对比。结果表明,CNNIQA在整体数据集和EL子集上获得了与B-T分数完全一致的排名结果,而所提方法在整体数据集、EL子集和UL子集上的排名不一致数分别为2、3和2,性能与VCRNet和DBCNN相当,仅次于CNNIQA,但优于其他大多数质量指标。消融实验验证了INPFE模块、IMPFE模块、图像分解网络和成对排序策略每个组件的贡献,去除任何一个组件都会导致性能下降。特别是将成对排序策略替换为传统的逐点学习策略后,性能下降明显,表明成对排序策略生成的预测结果与人类视觉感知更为一致。多级特征消融实验表明,利用四个级别的特征信息可以获得最优性能。运行时间比较显示,所提方法效率很高,预测一张1024×1024分辨率图像的质量仅需不到0.02秒。
在应用价值方面,研究者展示了所提方法在NIE算法自动参数调优中的应用。以PIE算法为例,该算法含有可调参数,通过改变参数可以生成不同视觉质量的ENTIs。所提方法能够评估不同参数设置下的ENTIs质量,且评估结果与人类视觉基本一致,展示了其自适应确定NIE算法最优参数的潜力。此外,研究者还进行了人脸检测实验,使用YOLOv7检测器在RNTIEQA数据集上进行测试。结果表明,排名分数较高的增强结果能够检测到更多的人脸或获得更高的检测精度,检测精度的排序基本符合所提方法预测的排名分数,说明所提方法有潜力用于评估高层计算机视觉任务中NIE的性能。
研究的结论指出,本文解决了ENTIs主观和客观质量评估问题。首先构建了新的真实世界夜间图像增强质量评估数据集RNTIEQA,考虑了极低光照和光照不均两种典型夜间场景,包含200张真实夜间图像、2000个由10种代表性NIE算法生成的ENTIs以及每个ENTI的主观排名分数。随后提出了一种新的成对排序方法,综合考虑图像内在属性和损伤属性。实验结果表明,所提方法优于现有的竞争指标。未来的工作将进一步研究ENTIs特别是光照不均场景下的退化特性,并开发更好的特征学习策略来平衡不同的质量因素。
本研究的主要亮点包括:构建了首个同时考虑极低光照和光照不均两类夜间场景的ENTIs质量评估数据集,且纳入了基于深度学习的最新NIE算法;采用了成对比较和Bradley-Terry模型获得更可靠的主观质量标签;提出了综合考虑内在属性和损伤属性的双模块特征提取网络;采用成对排序策略模拟人类比较同一场景两张图像的判断过程,更符合人类视觉感知特性。这些贡献为夜间图像增强算法的基准测试和优化提供了有力工具,也为计算机视觉高层应用中的质量评估提供了新思路。