分享自:

基于对比均值教师模型的鲁棒低光图像增强

期刊:International Journal of Computer VisionDOI:10.1007/s11263-026-02928-7

本文提出了一种用于鲁棒低光图像增强(Low-Light Image Enhancement, LLIE)的对比均值教师(Contrastive Mean Teacher, CMT)框架。该研究由张凯妮(Zhangkai Ni)、韩梦琳(Menglin Han)等来自同济大学、鹏城实验室、美团及岭南大学的研究者共同完成,通讯作者为杨文瀚(Wenhan Yang)和王涵丽(Hanli Wang)。论文发表于 *International Journal of Computer Vision*(2026年)第134卷,DOI 为 10.1007/s11263-026-02928-7,并于2026年7月13日在线发表。

低光图像增强是计算机视觉领域中的一个长期且具有挑战性的问题。由于环境光照不足、光照不均匀或曝光时间受限,低光图像常出现严重欠曝、噪声和低对比度等复杂退化,不仅影响视觉质量,也阻碍图像分割、识别等下游任务。现有方法主要分为监督式和无监督/自监督式两类。监督式方法依赖成对的低光-正常光训练数据,能够有效抑制噪声并保留细节,但成对数据采集成本高、场景受限,导致泛化能力不足;无监督或自监督方法可利用大量未配对数据,在全局光照和色彩分布学习上更具适应性和泛化性,但因缺少真实参考(Ground Truth),往往在色彩保真度和细节恢复方面表现欠佳。半监督方法试图结合两类数据的优势,但现有方法通常采用简单的伪标签或一致性约束,难以提供充分的监督信号,且主要关注域内性能,对跨域泛化关注不足。针对上述问题,本文提出的CMT框架旨在通过统一的均值教师架构,融合成对与非成对数据的互补知识,同时提升光照、色彩恢复与噪声抑制能力,并增强跨域泛化性能。

CMT框架的核心设计包括三个层面:数据层、监督层和理论层。在数据层面,研究采用了CutMix数据增强策略,将来自成对域的低光图像与来自非成对域的低光图像进行混合,生成混合域训练样本。不同于传统的固定比例采样,作者设计了一种基于课程学习的CutMix比例调度策略:在训练初期,混合比例从均匀分布中采样,随着训练推进,逐渐增大非成对域内容的比例,从而引导学生模型从有监督的成对域向多样化的非成对域平滑迁移知识。在监督层面,研究提出了像素中间对比损失(Pixel Intermediate Contrastive, PICO),该损失直接在像素空间中计算对比相似度,避免了传统潜在空间对比学习对低光增强任务目标的偏离。PICO损失分为成对PICO损失和非成对PICO损失,分别利用真实参考图、教师模型输出、亮度调整后的输入等作为正负样本进行训练。此外,框架还包含监督损失(结合LPIPS与SSIM)和一致性损失,用于约束学生模型与教师模型在混合域输出上的差异。在理论层面,作者通过经验风险最小化分析,推导了对比损失和一致性损失的经验风险上界与下界,并据此提出了四个设计结论:正样本应尽可能接近真实参考;负样本应明确错误但需与正样本保持适当差距以形成“困难负样本”(Hard Negative);正负样本差距过大可能导致退化解;减少混合域与目标域之间的分布差异可降低一致性损失上界。这些理论结论指导了正负样本的选择和CutMix比例调度策略的设计。

实验部分采用了多组数据和多种骨干网络对CMT的有效性进行了验证。实验使用LOLv2数据集的实拍部分作为成对训练集,SID低光图像作为非成对训练集,并在SDSD、SMID和LSRW-Huawei三个未参与训练的未见数据集上进行跨域评估。骨干网络包括Restormer(Transformer架构)和NAFNet(卷积神经网络架构),并进一步将CMT应用于多个专为低光增强设计的网络。在训练设置上,学生模型先进行数轮成对数据预训练,再引入非成对数据;教师模型通过指数滑动平均(EMA)更新参数,衰减率设为0.99。所有图像裁剪为192×192进行训练,测试时不裁剪。优化器采用AdamW,初始学习率2e-4,余弦退火至1e-6。实验结果显示,CMT在所有骨干网络和数据集上均显著提升了性能。在域内测试集LOLv2上,Restormer配合CMT的PSNR从22.89提升至24.11,SSIM从0.8886提升至0.9018,LPIPS从0.1078降至0.0935;NAFNet配合CMT的PSNR从20.87提升至22.76。在跨域测试集SID上,Restormer配合CMT的PSNR从17.33提升至18.32,NAFNet配合CMT的PSNR从15.80提升至17.59。更重要的是,CMT显著提升了三个未见数据集上的性能,表明该方法有效缩小了域间差距,增强了模型对未知域的泛化能力。与现有方法对比,CMT在LOLv2和SID上均优于多种无监督、监督和半监督方法。例如,在SID上,Restormer配合CMT的PSNR达到18.32,而其他监督方法如Retinexformer仅为15.00,半监督方法DRBN为14.62。可视化结果表明,CMT在色彩恢复、细节保留和噪声抑制方面均优于对比方法,能够有效避免过曝和伪影。MDA可视化进一步显示,CMT引导网络提取的特征分布更加紧凑有序,说明特征表示质量更高。

消融实验验证了各损失组件的必要性。移除任一损失组件均导致性能下降,其中监督损失、一致性损失、成对PICO损失和非成对PICO损失均对域内和跨域性能有贡献。负样本选择实验中,成对PICO损失以教师模型输出为负样本、非成对PICO损失以亮度调整输入为负样本时性能最佳,这与理论分析中“困难负样本”的结论一致。CutMix策略消融表明,使用课程式比例调度比均匀采样更能提升跨域性能;在像素空间进行对比学习优于在潜在空间进行对比学习,表明像素级对比更直接地对齐低光增强任务目标。超参数敏感性分析显示,CMT在合理的超参数范围内均能稳定提升性能,推荐λ∈(0,0.2],γ∈[1,20],m∈[-0.5,0.5]。

本研究的核心价值在于提出了一种理论指导下的半监督低光图像增强框架,通过CutMix域混合与像素中间对比损失的结合,实现了成对数据的高保真知识与非成对数据的多样性分布之间的有效融合。该方法显著缓解了监督方法泛化性差和无监督方法细节恢复不足的问题,为低光增强领域的跨域适应提供了一种新的技术路径。实验结果在多个数据集和多种骨干网络上的广泛验证,证明了CMT的鲁棒性和通用性,对推动低光图像增强在实际复杂环境中的应用具有重要的科学价值和工程意义。此外,论文提供的代码、预训练权重和数据集链接进一步增强了研究的可复现性与影响力。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com