本文提出并系统分析了对比表示学习(contrastive representation learning)中的两个关键性质:对齐性(alignment)与均匀性(uniformity),并通过理论证明与实验验证揭示了对比损失(contrastive loss)实际上在渐近意义上同时优化这两个性质。作者为Tongzhou Wang与Phillip Isola,来自MIT计算机科学与人工智能实验室(CSAIL)。该论文发表于第37届国际机器学习会议(International Conference on Machine Learning,ICML),收录于PMLR 119,2020年。
对比表示学习近年来在图像、文本等无监督表示学习任务中取得了显著成功,通常将特征向量限制在单位超球面(unit hypersphere)上。已有研究普遍认为表示应当对正样本对(positive pairs)保持不变性并尽可能保留信息,但此前缺乏对对比损失具体行为的严格刻画。本文的核心动机在于,从理论上阐明对比损失究竟在优化什么,并将这一行为与下游任务性能建立联系。
作者首先给出对齐性与均匀性的形式化定义。对齐性指正样本对的特征应彼此接近,即对不必要噪声因素具有不变性;均匀性指特征在单位超球面上应近似均匀分布,从而保留最大信息量。为了量化这两个性质,作者提出了两个可优化的度量:对齐损失(alignment loss)定义为正样本对特征之间欧氏距离的期望的负值;均匀性损失(uniformity loss)定义为高斯势核(Gaussian potential kernel)平均成对值的对数。高斯势核较一般点积或欧氏距离更适合度量均匀性,因为其极小值在分布意义下唯一对应均匀分布,且与广泛研究的最优点配置问题(如Thomson问题、Riesz势极小化问题)有深刻联系。文中通过命题1与命题2给出了均匀分布的唯一最优性以及有限点集经验分布弱收敛到均匀分布的结论。
随后,作者通过定理1证明,当负样本数趋于无穷时,对比损失(减去常数log m)渐近收敛为两项:第一项是正样本对特征内积的负期望,其唯一极小化条件是完美对齐;第二项是若干负样本与正样本之间softmax项的对数期望,若存在完美均匀编码器,则这些编码器恰好是该第二项的极小值点。这一结果说明对比损失在无限负样本极限下确实是在同时优化对齐性与均匀性。此外,第二项与基于von Mises-Fisher核的熵估计有联系,并可视为对特征分布微分熵的重新代入估计,揭示了对比损失与信息最大化(informax)原则之间的关系。作者同时指出,均匀性损失在形式上避免了softmax操作,计算更简单,且与对比损失的极限形式共享相同的极小值点。
在实验部分,作者在四个标准基准上训练了大量编码器,包括STL-10、NYU-Depth-v2、ImageNet-100和BookCorpus,任务涵盖图像分类、深度预测、句子情感分类等。训练过程系统变化了对比损失、对齐损失与均匀性损失的权重组合,以及温度、批量大小、嵌入维度、训练轮数、初始化等超参数。实验显示,对齐性与均匀性指标与下游任务性能强烈相关:表现最好的编码器总是位于对齐性与均匀性均较低的区域。更重要的是,仅直接优化对齐损失与均匀性损失的编码器在下游任务上常常优于仅使用对比损失训练的编码器,这表明在有限负样本的实际设定下,直接优化这两个性质可能更有效。
作者还通过从次优温度初始化的对比学习编码器进行微调实验,验证了因果性:只优化对齐性或均匀性单一指标会导致另一个指标和下游性能下降,而同时优化两者则能持续提升性能。这一结果进一步支持对齐性与均匀性是表示质量的关键因素,而不仅仅是与性能相关的伴随现象。
此外,作者还将分析扩展到其他对比表示学习变体,包括MoCo和Quick-Thought Vectors。尽管这些方法在实现机制上与标准对比损失有显著差异(如动量编码器、记忆队列、双编码器结构等),实验仍表明对齐性与均匀性指标与下游任务性能存在一致的相关性,直接优化这两个指标也能取得可比或更好的性能。这说明该结论具有较强的普适性,并不局限于特定对比损失形式。
在讨论部分,作者指出单位超球面作为表示空间的优势尚未被完全严格证明,未来可以进一步形式化球面上良好聚类集合的近线性可分性质及其与解耦表示的关系。作者还提出,对齐性与均匀性可能适用于比对比学习更广泛的表示学习方法,因为许多现有方法也隐式或显式地使用了单位超球面归一化,并表现出与均匀分布相关的目标。
本文的主要贡献在于:提出了量化对齐性与均匀性的可优化度量;证明对比损失在渐近意义下优化这两个性质;通过大规模实验确认这两个指标与下游任务性能之间的强一致性;并证明直接优化这两个度量可获得与对比学习相当或更好的表示。研究对理解对比表示学习的机制、设计更有效的无监督表示学习目标具有重要的理论价值和实际指导意义。