本研究由Bo Hu、Yuanyuan Hu、Leida Li、Ke Gu 及 Xinbo Gao 等人完成。其中,第一作者 Bo Hu 与第二作者 Yuanyuan Hu 来自重庆邮电大学图像认知重庆市重点实验室;Leida Li 来自西安电子科技大学人工智能学院;Ke Gu 来自北京工业大学信息学部;通讯作者 Xinbo Gao 同时隶属于重庆邮电大学图像认知重庆市重点实验室与西安电子科技大学电子工程学院。该论文发表于 IEEE Transactions on Image Processing(《IEEE图像处理汇刊》)第35卷,于2026年6月正式刊出。
本研究属于图像质量评价(Image Quality Assessment, IQA)与低光图像增强(Low-Light Image Enhancement)的交叉领域。低光图像增强算法(Low-Light Image Enhancement Algorithms, LIEAs)的目标是提升在暗光或夜间环境中拍摄图像的可见性与视觉质量。然而,现有算法在提升亮度与对比度的同时,往往引入色彩失真、噪声放大、曝光不均等新问题,导致增强后的低光图像(Enhanced Low-Light Images, ELIs)质量参差不齐。目前,针对ELIs的质量评价研究较为匮乏:主观层面,已有数据集仅提供整体质量分数,缺乏对亮度、噪声、曝光等多属性的细粒度标注以及文本描述等多模态信息;客观层面,现有方法大多仅依赖单一视觉模态,未充分利用文本语义与属性间结构化关系,导致预测性能受限。基于此,本研究旨在构建首个多标注、多模态的低光图像增强质量数据集,并提出一种属性引导的视觉-语言图推理网络,以实现对ELIs质量的准确预测与可解释分析。
本研究包含两大核心环节:主观数据集构建与客观质量评价模型设计。
(一)MLE数据集构建流程
首先,研究者从 LOLv2、ExDark、LOLv1、LSRW、DICM 等公开数据集及用户上传图像中收集了100幅低光图像,并将其划分为建筑、室内、人物、路灯、风景与车辆六类场景,确保场景多样性与亮度分布均衡。随后,选取了十种代表性LIEAs——包括 Zero-DCE、LLFormer、RUAS、SCI、URetinexNet、GSAD、DDNet、PAIRLIE、PPFormer 和 DiffLL——对每幅低光图像进行增强处理,共得到1000幅ELIs。在主观实验中,采用单刺激法(Single-Stimulus, SS),招募22名参与者(15男7女),在标准光照与校准显示器环境下,要求其对每幅图像的整体质量(0–10分)以及光照、色彩、噪声、曝光、自然度、内容恢复六个属性(1–5分)进行评分。经异常值检测剔除2名参与者后,最终保留20人的有效数据。除数值评分外,研究者还构建了文本描述:首先将每个属性的连续分数映射为低、中、高三个离散语义等级,并对应预定义语言描述(如亮度:昏暗/适中/明亮),随后由训练有素的标注者结合图像实际视觉表现进行措辞细化与空间信息补充,形成结构化、感知对齐的文本描述。最终数据集被称为 MLE(Multi-annotated and Multimodal Low-Light Image Enhancement),包含1000幅增强图像、6000个属性评分及对应文本描述。
(二)AVGR-Net模型设计流程
所提出的属性引导的视觉-语言图推理网络(Attribute-guided Vision-Language Graph Reasoning Network, AVGR-Net)由四部分构成:特征提取模块(FEM)、属性感知图推理网络(AGRN)、跨模态对齐与融合模块(CAFM)以及回归模块(RM)。在特征提取阶段,视觉属性提取器以预训练 ResNet-50 为共享骨干网络,通过五个并行的轻量分支分别提取亮度、色彩对比度、噪声、曝光条件与自然外观五个属性特征;文本属性提取器则基于预训练 BERT 模型,对每个属性的三档细粒度子描述进行编码并平均池化。全局视觉与文本语义分别通过 CLIP 的图像与文本编码器获取,并附加多尺度适配器模块以增强任务适应性。在属性感知图推理阶段,构建视觉级属性图与文本级属性图。视觉图的节点由全局视觉特征与五个属性特征构成,邻接矩阵基于全数据集上属性分数间的斯皮尔曼等级相关系数(SRCC)设定阈值生成;文本图则采用可学习邻接矩阵,通过图注意力网络(GAT)自适应捕捉语义依赖。在跨模态对齐与融合模块中,先通过基于 Transformer 的注意力机制对视觉与文本特征进行对齐,并利用置信度加权机制生成融合表示;随后通过交叉注意力 Transformer 块进一步建模细粒度跨模态依赖,最终获得鲁棒的多模态融合特征。回归模块采用两层全连接网络以 L1 损失进行质量分数预测。训练时,CLIP 编码器除视觉端最后三个 Transformer 块外均保持冻结,输入图像裁剪为224×224像素,采用 Adam 优化器进行35轮训练,并在8:2的训练/测试划分下进行十次随机分割取平均结果。
(一)数据集可靠性验证
MLE数据集的 MOS 分布近似正态且覆盖完整质量范围,表明样本具有较好的多样性与代表性。属性相关性热力图显示,色彩、噪声、曝光、自然度与内容恢复均与整体质量呈强正相关,而光照属性的影响相对较弱。此外,基于 CLIP 框架的对比实验表明,仅使用图像特征时 SRCC 为0.7015,而加入文本信息后预测性能进一步提升,验证了文本模态作为辅助信息源的有效性。
(二)LIEAs性能分析
在十个增强算法中,DDNet 与 DiffLL 生成的高分图像比例最高,表明其更符合人眼主观期望;PAIRLIE 与 RUAS 的得分分布偏低,存在明显质量问题。在属性层面,DDNet 与 LLFormer 在光照、色彩、曝光等维度表现优异;Zero-DCE 与 GSAD 在曝光控制上较强,但在色彩与噪声方面不足;所有算法在噪声属性上得分普遍偏低,说明噪声抑制仍是低光增强任务中的共性难点。
(三)客观模型性能对比
在 MLE 全数据集上,AVGR-Net 取得了最高 SRCC(0.8425)与 PLCC(0.8415),显著优于 AGAIQA(SRCC=0.8127)、PINet(SRCC=0.7822)等已有方法。在 MLE-均匀光照与 MLE-不均匀光照子集上,AVGR-Net 同样保持领先,尤其在不均匀光照子集上较最佳基线提升超过4%。消融实验表明,文本分支移除会导致 SRCC 显著下降;文本图推理模块的作用大于视觉图推理模块;适配器模块与 ResNet 微调均对最终性能有积极贡献。跨场景评估显示,AVGR-Net 在六类场景中的五类上 SRCC 超过0.80,表现出较强泛化能力。跨数据集评估中,在 RNTTIQA 数据集上测试时,AVGR-Net 仍取得最佳 SRCC,证实了其跨域鲁棒性。
本研究系统性地解决了低光增强图像质量评价中标注粒度不足与模态单一的问题。MLE 数据集为社区提供了首个同时包含多属性评分与感知对齐文本描述的低光增强质量基准,有助于后续模型训练与评估。AVGR-Net 通过显式建模属性间图关系与跨模态对齐融合,实现了对复杂失真模式的有效表征,提升了无参考图像质量评价的准确性与可解释性。该成果可应用于夜间监控、驾驶辅助、手机摄影等场景中低光增强算法的自动筛选与优化,也可为多模态感知建模提供新思路。
本研究的亮点在于:首次构建多标注、多模态低光增强质量数据集;提出属性引导的视觉-语言图推理框架,将文本语义与视觉属性结构化结合;通过图注意力机制动态建模属性间依赖,增强模型可解释性。然而,实验也表明,AVGR-Net 在极低质量图像(MOS 0–3)的精细排序上仍存在局限,SRCC 仅为0.5672,未来需要进一步改进对严重退化图像质量差异的判别能力。