关于全秩相关矩阵上黎曼网络的研究报告
一、研究概述与作者信息
本篇学术报告基于Ziheng Chen等人发表于《第43届国际机器学习会议论文集》(Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026)的原创研究论文《全秩相关矩阵上的黎曼网络》(Riemannian Networks over Full-rank Correlation Matrices)。研究团队由来自特伦托大学信息工程与计算机科学系(University of Trento)、蒂宾根马克斯·普朗克智能系统研究所(Max Planck Institute for Intelligent Systems)以及江南大学人工智能与计算机科学学院的科研人员组成,通讯作者为Ziheng Chen。该研究聚焦于深度学习与几何学的交叉领域,首次系统性地将深度神经网络的基础层结构扩展到了全秩相关矩阵这一未被充分探索的黎曼流形上。
二、研究背景与科学问题
在机器学习领域,基于对称正定(Symmetric Positive Definite, SPD)流形的表示方法已在众多应用中取得显著成功,并衍生出多种深度网络架构。然而,作为SPD矩阵的归一化替代方案,全秩相关矩阵流形尽管在统计学上更为紧凑,却在深度学习中长期被忽视。直到最近,David与Gu(2019)才将全秩相关矩阵识别为SPD流形的一个商流形,即相关流形(Correlation Manifold)。针对该商流形几何在黎曼对数与弗雷歇均值(Fréchet Mean)等运算上缺乏唯一性和闭式解的问题,Thanwerdas与Pennec (2022b)提出了三种理论简洁、计算方便的黎曼度量:欧几里得-乔列斯基度量(Euclidean–Cholesky Metric, ECM)、对数-欧几里得-乔列斯基度量(Log-Euclidean–Cholesky Metric, LECM)和多双曲-乔列斯基度量(Poly-Hyperbolic-Cholesky Metric, PHCM)。此后,Thanwerdas (2024)又引入了两种高效的置换不变度量:非对角对数度量(Off-Log Metric, OLM)和对数缩放度量(Log-Scaled Metric, LSM)。这些新型几何结构为将欧几里得空间(Euclidean Space)深度学习的基本层,如多项逻辑回归(Multinomial Logistic Regression, MLR)、全连接(Fully Connected, FC)层和卷积(Convolutional)层,系统性地推广至相关流形提供了坚实的数学基础。本研究旨在填补相关流形上深度网络构建的空白,利用上述五种最新的相关几何,系统性地扩展这些基础层,并验证其相对于现有SPD网络和格拉斯曼网络(Grassmannian Network)的有效性。
三、研究核心方法与技术路线
本研究的核心工作分为三个紧密相连的部分。首先,研究团队系统构建了基于四种零曲率流形(ECM, LECM, OLM, LSM)的相关MLR、全连接和卷积层。这四种度量均通过微分同胚(Diffeomorphism)映射与欧几里得空间等距,因此被统称为对数-欧几里得度量(Log-Euclidean Metrics)。通过深入利用这一等距性质,作者以几何内蕴的方式推导出了各基础层的闭式表达式。例如,对于MLR层,研究通过定理将流形上的分类问题转化为在等距欧几里得空间中的超平面距离计算,并结合各微分同胚在原点(单位矩阵)处的微分,得到了清晰高效的分类逻辑值公式。对于全连接层,该研究创新性地将其定义为一种基于流形超平面(Margin Hyperplane)和符号距离(Signed Distance)映射的特征维度变换操作。具体来说,一个将输入维度从n变换为m的相关全连接层,其输出的m维相关矩阵是通过在目标流形上求解d = m(m-1)/2个关于超平面距离的方程得到的。得益于对数-欧几里得度量的等距性,这个隐式定义方程组同样被成功解析,得到了直接映射输入相关矩阵到输出相关矩阵的显式公式。卷积层则遵循类似逻辑,通过将传统卷积操作的每个感受野(Receptive Field)内的仿射变换(Affine Transformation)替换为对应的相关全连接层变换来实现。这一部分的推导构成了整个理论框架的基石。
其次,研究处理了非零曲率(Non-zero Curvature)的多双曲-乔列斯基度量(PHCM)的情形。PHCM几何由多重双曲空间(Hyperbolic Spaces)的乘积诱导产生。作者巧妙地将相关流形通过乔列斯基分解(Cholesky Decomposition)与半球(Open Hemisphere)等距同构,再利用半球与庞加莱球(Poincaré Ball)的等距关系,最终将PHCM下的相关流形同一个多重庞加莱空间(Poly-Poincaré Space)联系起来。鉴于此,研究没有从零推导,而是直接适配了已有的庞加莱MLR、全连接和卷积层。特别是在卷积层中,研究引入了庞加莱β-连接(β-concatenation)这一技巧,以确保在连接多通道特征时保持向量的范数稳定。这一工作流展示了一种通过将复杂流形上的问题简化为更简单、已解决的流形上的问题来进行研究的强大方法论。
最后,研究开发了针对OLM和LSM两种几何下黎曼计算的准确反向传播(Backpropagation)方法。在OLM和LSM的微分同胚映射中,涉及两个关键的迭代算法:计算对角矩阵的d(h)函数和d⋆©函数。虽然Pytorch的自动微分(Autograd)可以通过迭代过程进行近似梯度回传,但效率较低且数值不稳定。为此,作者通过深入分析这些迭代算法的数学结构,提出了准确、稳定且高效的反向传播替代方案,这对于基于梯度优化的深度网络训练至关重要。整个理论体系的构建最终形成了所谓的相关网络(Correlation Networks, CorNets)。
四、实验设计与主要结果
为验证所提方法的有效性,研究团队在四个公开数据集上进行了严格的实验评估:用于雷达信号分类的Radar数据集,以及用于人体动作识别的HDM05、FPHA和NTU120数据集。每个CorNet由一层相关卷积层和一层相关MLR层组成,并与一系列代表性的SPD网络(如SPDNet, SPDNetBN, RResNet, GyroSPD++)和格拉斯曼网络(如GrNet, GyroGr)进行了基准对比。实验结果显示,CorNets在不同度量下均展现出优越性能。例如,CorNet在Radar、HDM05、FPHA和NTU120数据集上,分别以高达98.40%、82.26%、92.17%和65.04%的准确率,显著超越了经典SPDNet(对应93.25%, 64.57%, 85.59%, 51.25%)和最佳格拉斯曼网络。这一卓越表现证实了相关嵌入(Correlation Embedding)及其专用网络架构的有效性。另一个关键发现是,最优度量在不同数据集上有所不同,表明几何结构的选择是黎曼网络中的一个关键超参数,而本研究提供的统一框架恰恰可实现不同相关几何的灵活切换与公平比较。在效率方面,得益于相关流形上计算的轻量性,CorNets在训练时间上普遍优于或可比于同类SPD网络,其中基于ECM的CorNet效率最高。此外,一系列消融实验(Ablation Studies)进一步揭示了深刻的洞见。混合几何实验表明,对卷积层和MLR层使用一致的度量通常能取得最佳性能。将SPDNet的SPD输入简单替换为相关矩阵的实验,则同时展现了相关表示的潜力和设计尊重其独特几何结构的专用网络的必要性:在HDM05上性能提升,而在其他数据集上下降,这恰恰说明了若忽视其内禀几何可能会适得其反。
五、研究结论与价值
本研究结论性地指出,通过系统地扩展全连接、卷积和多项逻辑回归层至全秩相关矩阵流形,能够成功地构建有效且高效的黎曼深度网络。该工作在科学层面填补了相关流形上深度网络的理论空白,为这一长期被忽视的流形奠定了网络构建的基础框架。在应用层面,实验证实相关网络能够在多种任务中超越主流的SPD和格拉斯曼网络,这表明相关矩阵不仅可以作为SPD矩阵在统计学上更紧凑的替代方案,更可以凭借其独特的几何特性为模型带来性能增益和计算效率的双重优势。
六、研究亮点与创新性
本研究的亮点与创新性主要体现在四个方面。第一是开拓性:这是首个系统性地在相关流形上定义并实现深度网络基本层(MLR, FC, 卷积)的工作,开辟了黎曼深度学习的一个新方向。第二是完备性:研究覆盖了五种最新、最具代表性的相关几何,包括零曲率和非零曲率情形,提供了一个全面且统一的框架。第三是方法的几何内蕴性:所有层的定义和推导都严格基于黎曼几何原理(如超平面、测地距离、等距映射),而非简单的启发式扩展,确保了对流形数学结构的有效利用。第四是计算贡献:针对OLM和LSM提出的精确反向传播算法解决了实际训练中的关键优化难题,对于推动这些理论几何在深度学习中的实际应用至关重要。最后,通过丰富的实验和可视化对比,清晰展示了不同几何结构对决策边界的影响,为理解几何在深度学习中的作用提供了直观依据。这些基础层的建立为未来在相关流形上构建更复杂的架构,如残差网络、循环神经网络及Transformer,开启了大门。