分享自:

基于可学习冯·克里斯色适应变换的设备无关低光图像增强

期刊:IEEE Transactions on Circuits and Systems for Video TechnologyDOI:10.1109/TCSVT.2026.3700071

本文提出了一种面向低光照图像增强(low-light image enhancement, LLIE)的新型框架 CatFormer,其核心思想是将图像增强任务重新定义为基于设备无关颜色科学(device-independent color science)的色适应变换与感知解耦恢复问题。该研究由吉林大学仪器科学与电气工程学院的吴坤阳、刘洋、张冠宇等人,联合中国工程院林君、辽宁科技大学李正鹏和苗佳伟等研究者共同完成,发表于 IEEE Transactions on Circuits and Systems for Video Technology 2026 年第 36 卷第 9 期。

在学术背景方面,低光照图像增强一直是底层视觉领域的基础性难题。传统方法如直方图均衡和伽马校正虽然计算高效,但难以适应复杂光照变化;深度学习方法则常以 Retinex 理论为基础,将图像分解为反射分量和光照分量。然而,该文指出 Retinex 分解本质上是一个不适定问题,而且缺乏对目标光照的物理定义,导致网络在学习从暗到亮的映射时缺少有效的物理锚点,从而容易产生严重的色偏。同时,现有大多数方法在 sRGB 颜色空间中处理图像,但 sRGB 中亮度与色度高度耦合,增强亮度时容易引起色相偏移和噪声放大。虽然 HSV 等颜色空间被尝试用于解耦,但 HSV 存在色相通道拓扑不连续和明度通道感知不均匀的问题。针对上述问题,该研究将设备无关的颜色管理原理引入低光照图像增强,提出通过可学习的 von Kries 色适应变换(chromatic adaptation transform, CAT)将信号锚定到标准 D65 白点,并在 CIELAB 空间中进行亮度和色度的解耦恢复。

在方法设计上,CatFormer 包含三个核心模块:动态白点适应(dynamic white point adaptation, DPA)模块、双分支解耦恢复(dual-branch decoupled restoration, DDR)网络以及基于锚点的核注意力(anchor-based kernel attention, AKA)机制。DPA 模块首先通过一个专用网络估计每个像素的色适应变换矩阵,即从场景中的未知局部光源映射到标准 D65 光源所需的 XYZ 三刺激值缩放因子。该模块采用了全局到局部自适应卷积(global-to-local adaptive convolution, GLAC)作为主干结构,GLAC 包含空间分支和通道分支,空间分支通过降采样和 AKA 捕获全局光照上下文,通道分支则在高分辨率特征上建模局部通道依赖,二者结合生成内容自适应的动态卷积核,从而实现对空间变化光照的逐像素适应。DPA 输出适应后的 XYZ 信号,然后将其转换为 CIELAB 颜色空间,得到解耦的亮度分量 L* 和色度分量 a*、b*。DDR 网络以双分支 U-Net 形式分别处理亮度和色度退化,并将估计的 CAT 先验图拼接至每个分支输入,以约束恢复过程。DDR 的基本构建模块为交互式专家混合(interactive mixture-of-experts, IMEX)模块,该模块利用 AKA 实现亮度与色度分支之间的双向交叉注意力,并通过软专家混合(soft mixture-of-experts, SoftMoE)动态合成针对每个像素局部特性的恢复函数。AKA 机制通过有限维正特征投影近似 softmax 指数核,利用矩阵乘法结合律将注意力计算复杂度从 O(n²) 降低到 O(n),同时保持全局空间依赖建模能力。该方法在训练中采用多分量损失函数,包括 sRGB 重建损失、CIELAB 辅助恢复损失以及变换一致性损失,以保证 CAT 先验在恢复网络中不被改变。

在实验部分,该研究在 LOLv1、LOLv2-real、LOLv2-syn、LSRW-Huawei 和 LSRW-Nikon 五个成对数据集上进行了定量和定性评估。在 LOLv2-real 数据集上,CatFormer 取得了 24.926 dB 的 PSNR,比基于扩散模型的 Diff-Retinex++ 高出 1.51 dB,比 HVI-CIDNet 高出 0.82 dB,同时 LPIPS 指标在全部五个数据集上均达到最优。该框架仅需 4.80M 参数和 4.35G FLOPs 即可处理 256×256 图像,计算效率远高于 Diff-Retinex++ 的 617.32G FLOPs。在极端真实场景数据集 LLRW-Xiaomi 和 LLRW-Vivo 上,CatFormer 在 MUSIQ 指标上也达到了最优,进一步验证了其在无参考条件下的泛化能力。此外,用户主观评价显示 CatFormer 在胜率、Elo 评分和 Bradley-Terry 强度方面均优于对比方法。消融实验表明,DPA 模块和 CIELAB 颜色空间的协同作用显著提升了色彩保真度;在 RGB 空间中使用 DPA 仍会使 PSNR 下降 2.103 dB。对 DPA 网络结构的分析显示,逐像素 GLAC 比全局变换或静态卷积分别提高 1.03 dB 和 0.35 dB。对比不同色适应公式发现,在 XYZ 空间进行对角缩放比 Bradford CAT 和 CAT02 CAT 更稳定,因为后者光谱锐化矩阵中的负系数会放大极低光条件下的噪声方差。对注意力机制的分析表明,AKA 在 LOLv2-real 上比 IG-MSA、Performer、InLine 和 Flowformer 分别高出 0.475 dB、0.363 dB、0.344 dB 和 1.363 dB。此外,该研究还评估了 CatFormer 在下游视觉任务中的表现,在 ExDark 低光目标检测中取得最高 mAP@0.50 和 mAP@0.50-0.95,在 ACDC 夜间语义分割中取得最高 mIoU 和 F-score,表明该框架不仅能提升图像视觉质量,还能有效改善机器感知性能。

该研究的核心结论是,通过将低光照增强锚定到标准 D65 光源,并在感知均匀的 CIELAB 空间中独立恢复亮度和色度,能够从根本上避免传统 Retinex 方法中目标光照不明确导致的色偏问题。其科学价值在于提出了一个具有物理可解释性的增强框架,将设备无关颜色科学中的色适应原理引入深度学习低光照增强任务,为解决颜色失真问题提供了新的理论视角。应用价值方面,CatFormer 在多个基准数据集上达到最优性能,并显著降低计算复杂度,适用于对效率和色彩一致性要求较高的实际场景,如自动驾驶、移动端图像处理和夜间视觉任务。该研究的亮点包括:提出了可学习的 von Kries 色适应变换模块 DPA,实现了逐像素的物理白点锚定;设计了双分支解耦恢复网络 DDR,在 CIELAB 空间中分离亮度与色度退化;开发了线性复杂度的 AKA 注意力机制,在保持全局上下文建模能力的同时大幅降低计算成本;并通过大量实验验证了框架在跨传感器泛化、极端低光场景以及下游视觉任务中的优越性能。同时,作者也指出该方法仍存在一定局限性,例如 XYZ 对角缩放是色适应过程的一阶近似,在混合光照或饱和高光场景下可能出现残余色偏;在极暗输入中,恢复质量受限于可用光子信号,残留噪声和弱纹理恢复仍是一个挑战,未来可结合信噪比感知恢复和生成式纹理补全进一步改进。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com