分享自:

GraphSMOTE:基于图神经网络处理图上不平衡节点分类的新框架

期刊:Proceedings of the Fourteenth ACM International Conference on Web Search and Data MiningDOI:10.1145/3437963.3441720

关于GraphSMOTE的学术研究报告:图数据中基于图神经网络处理类别不平衡节点分类问题的新框架

一、 研究作者、机构与发表信息 本项研究由来自美国宾夕法尼亚州立大学信息科学与技术学院的Tianxiang Zhao, Xiang Zhang, Suhang Wang共同完成。该研究成果以题为“GraphSMOTE: Imbalanced Node Classification on Graphs with Graph Neural Networks”的论文形式,发表于2021年3月8日至12日举办的第十四届ACM国际网络搜索与数据挖掘会议(WSDM ‘21),并收录于该会议的论文集。

二、 学术背景与研究动机 本研究属于图机器学习领域,具体聚焦于图神经网络在节点分类任务中的应用。近年来,图神经网络在节点分类任务上取得了最先进的性能,但其研究与实践大多基于一个假设:不同类别的节点样本数量是均衡的。然而,在众多现实场景中,图数据的节点类别分布往往是高度不平衡的。例如,在社交网络中进行虚假账户(机器人)检测时,恶意账户的数量远少于正常用户;在网页主题分类中,某些小众主题的网页数量也远少于流行主题。这种类别不平衡问题会导致直接训练的GNN分类器在损失函数中被多数类样本主导,从而过度偏向多数类,对少数类样本的分类性能严重下降,限制了GNN在诸多重要现实应用(如恶意账户检测、少数群体发现)中的有效部署。

尽管在传统机器学习领域,针对独立同分布数据的类别不平衡问题已有深入研究,其方法主要分为数据层面(如过采样、欠采样)、算法层面(如代价敏感学习)和混合方法三类。其中,合成少数类过采样技术因其有效性和稳定性而被广泛认为是效果最佳的方法之一。然而,这些方法无法直接应用于图数据,原因有二:第一,它们无法为合成的新节点样本生成关系(边)信息,而关系信息是图学习的关键;第二,直接在原始高维节点属性空间进行过采样(如插值)容易生成偏离真实数据分布的“域外”样本,损害分类器性能。因此,本研究旨在解决这一研究空白,探索如何将合成少数类过采样技术有效地扩展至图结构数据,以提升GNN在不平衡节点分类任务上的性能。

本研究的目标是开发一个名为GraphSMOTE的新型框架,该框架能够为图数据生成高质量的少数类合成节点及其关系信息,从而构建一个类别平衡的增强图,以训练出性能更优、对少数类更敏感的GNN分类器。

三、 研究详细工作流程 GraphSMOTE框架包含四个核心组件:基于GNN的特征提取器(编码器)、合成节点生成器、边生成器以及基于GNN的分类器。其工作流程是一个端到端的训练过程,具体步骤如下:

  1. 特征提取器构建与预训练(可选)

    • 研究对象与处理:输入为属性图 G = {V, A, F},其中V是节点集,A是邻接矩阵,F是节点属性矩阵。研究使用了三个数据集:Cora(引文网络)、BlogCatalog(社交网络)和Twitter(虚假账户检测)。Cora数据集通过人工下采样少数类来模拟不平衡场景;BlogCatalog和Twitter本身具有天然的不平衡分布。
    • 方法与流程:特征提取器的核心作用是将原始高维、稀疏的节点属性与图拓扑结构共同编码到一个低维、稠密的嵌入空间中。在这个空间中,同类节点应彼此靠近,异类节点应相互远离,从而为后续的插值生成提供高质量的基础。本研究选择GraphSAGE作为特征提取器的基础架构,因其能有效学习局部拓扑结构且泛化能力强。具体操作如公式所示:通过聚合节点自身属性及其邻居信息,经过非线性变换得到节点的初始嵌入表示 h1_v。为了获得一个良好的嵌入空间,框架允许对特征提取器和边生成器进行预训练,仅使用边预测损失(重构邻接矩阵)来优化,使模型首先学会捕捉图的结构信息。
  2. 合成节点生成

    • 流程:在特征提取器产生的嵌入空间(h1)中,对每个少数类进行过采样。具体采用经典的SMOTE算法思想:对于每一个少数类样本节点v,在嵌入空间中找到其同类的最近邻节点nn(v)。然后,在这两个节点的嵌入向量之间进行随机线性插值,以生成新的合成节点v’的嵌入表示 h1_v’ = (1 - δ) * h1_v + δ * h1_nn(v),其中δ是[0,1]间的随机数。通过控制“过采样比例”这一超参数,可以为每个少数类生成足够数量的合成节点,使各类别训练样本量趋于平衡。
  3. 边生成器预测关系

    • 问题与创新方法:合成节点最初是孤立的,没有与图中现有节点的连接关系。为了将其整合进图中以供GNN分类器使用,必须为其生成边。这是本研究的关键创新点之一。研究者设计了一个边生成器来建模节点间边的存在概率。
    • 工作流程:边生成器采用加权内积形式,基于两个节点的嵌入表示来预测它们之间存在连接的概率 e_v,u。该生成器在训练阶段使用真实节点和真实边进行训练,损失函数为预测的边概率矩阵E与真实邻接矩阵A之间的Frobenius范数误差。训练好的边生成器可用于为合成节点预测其与所有现有节点(包括其他合成节点)的连接。
    • 策略:研究尝试了两种边处理策略:一是“硬”策略,设定一个阈值η,将概率高于阈值的预测边设为1,否则为0,形成二值邻接矩阵;二是“软”策略,直接使用预测的连续概率值作为边的权重。后者允许梯度从分类器反向传播至边生成器,实现联合优化。
  4. 构建增强图与节点分类

    • 流程:将原始节点的嵌入表示与合成节点的嵌入表示拼接,形成增强的节点表示集 h̃1。同时,使用边生成器预测的边来扩展原始邻接矩阵A,形成增强的邻接矩阵 Ã。由此,得到了一个类别分布更平衡的增强图 G̃ = {Ã, h̃1}。随后,使用另一个GNN模块(同样是GraphSAGE块)接一个线性层作为分类器,在增强图G̃上进行节点分类训练。分类器通过消息传递机制聚合邻居信息,最终输出每个节点的类别概率分布,并通过交叉熵损失进行优化。
  5. 联合优化与训练算法

    • 整体目标函数:GraphSMOTE的最终目标函数是节点分类损失和边预测损失的加权和:min L_node + λ * L_edge。其中λ是平衡两项损失的超参数。
    • 训练流程:如算法1所述,框架支持两种模式:一是从头开始联合训练所有组件;二是先预训练特征提取器和边生成器,再对所有组件进行微调。在每一轮训练中,先通过特征提取器获得嵌入,然后进行SMOTE过采样,接着用边生成器预测合成节点的边以构建增强图,最后用分类器在该图上计算损失并反向传播更新所有参数。

四、 主要研究结果 研究通过在三类数据集(Cora, BlogCatalog, Twitter)上的广泛实验,并采用准确率(Acc)、平均AUC-ROC分数和平均F值(F-score)作为评估指标,系统地验证了GraphSMOTE的有效性,并深入分析了其特性。

  1. 不平衡分类性能对比:GraphSMOTE的多个变体(GraphSMOTE_T, GraphSMOTE_O, GraphSMOTE_preT, GraphSMOTE_preO)与多种基线方法(原始GNN、简单过采样、重加权、原始SMOTE、Embed-SMOTE)进行了比较。实验数据表明:

    • 所有GraphSMOTE变体在所有数据集和所有评估指标上均显著优于未使用任何不平衡处理技术的“原始”模型。
    • GraphSMOTE显著优于直接应用传统过采样方法(如SMOTE和Embed-SMOTE)的基线。例如,在Cora数据集上,GraphSMOTE_preO在AUC-ROC上比Embed-SMOTE提高了约0.02,在F值上提高了约0.054。这强有力地证明了在专门构建的图嵌入空间中进行插值,并辅以边生成器提供关系信息,比在原始特征空间或普通GNN嵌入层进行过采样更为有效。
    • 在GraphSMOTE的变体中,经过预训练的版本(GraphSMOTE_preT和GraphSMOTE_preO)性能通常优于未预训练的版本。这证实了拥有一个能良好编码节点相似性的高质量嵌入空间对于生成可靠合成样本至关重要。
  2. 过采样比例的影响分析:在Cora数据集上控制不平衡比率,研究过采样比例的影响。结果表明,当过采样比例小于1.0(即尚未完全平衡类别)时,增加合成样本数量能持续提升分类器性能,因为新样本不仅平衡了数据分布,还引入了额外的监督信息。当比例达到或超过1.0(即类别已平衡或过平衡)后,性能趋于稳定或略有下降,因为过多的相似合成样本可能带来冗余信息,对模型提升有限。这为实践中的超参数设置提供了指导:将过采样比例设置到使类别大致平衡的程度通常是一个好的选择。

  3. 不平衡比率鲁棒性分析:在Cora数据集上固定过采样比例,改变不平衡比率(从0.1到0.6)。结果显示,GraphSMOTE在不同不平衡比率下均能保持最佳或接近最佳的性能。特别地,当类别不平衡非常极端(如比率为0.1)时,GraphSMOTE相比基线方法的提升幅度更为显著。这证明了该框架在处理严重不平衡问题上的强大能力。同时,预训练在极端不平衡情况下显得更加重要。

  4. 基础模型泛化能力:研究将GraphSMOTE框架的基础GNN模型从GraphSAGE替换为另一种广泛使用的GCN模型。实验结果表明,GraphSMOTE的各个变体在GCN基础上同样有效,且均优于相应的基线方法。这证明了GraphSMOTE框架具有良好的通用性,不依赖于特定的GNN架构。一个有趣的发现是,在GCN上预训练的必要性似乎低于在GraphSAGE上,作者推测这可能是因为GCN的表达能力相对较弱,因此对嵌入空间初始质量的要求略低。

  5. 超参数敏感性分析:研究了平衡损失项的超参数λ的影响。结果显示,性能随着λ增大先升后降,在1e-6到4e-6之间通常能取得较好效果。λ过大(如1e-5)会导致性能显著下降,原因可能是边预测损失的尺度远大于节点分类损失。预训练使得模型对λ的变化更加不敏感,提高了稳定性。

五、 研究结论与价值 本研究成功提出并验证了GraphSMOTE,这是第一个专门针对图数据中不平衡节点分类问题、并有效集成合成少数类过采样技术的通用框架。其核心贡献在于解决了将SMOTE类方法应用于图数据的两大挑战:通过在专门学习的图嵌入空间中进行插值来保证合成样本的质量(“真实性”),以及通过训练一个边生成器来为合成样本提供可靠的关系信息。

该研究的科学价值在于,它首次系统性地探索并解决了图神经网络应用中的一个重要但被忽视的实际问题——类别不平衡,拓展了图神经网络的研究边界。它提供了一种将成熟的传统不平衡学习技术与前沿的图表示学习相结合的新范式。

其应用价值十分显著。框架在引文网络、社交网络和虚假账户检测等真实场景数据集上均取得了显著优于现有方法的效果,表明其能够直接提升诸如恶意用户检测、小众社区发现、罕见事件预警等关键实际任务的性能,具有广泛的实用前景。

六、 研究亮点 1. 问题新颖性:首次明确聚焦并系统研究图数据上的节点类别不平衡分类问题,填补了该领域的研究空白。 2. 方法创新性:提出了一个创新的两阶段生成框架:(a)在GNN构建的嵌入空间而非原始特征空间进行SMOTE过采样,以生成高质量、同分布的新节点特征;(b)引入可训练的边生成器,为合成节点预测边信息,从而构建出可用于GNN训练的完整增强图。这一设计巧妙地解决了图数据过采样的核心难题。 3. 框架通用性与有效性:GraphSMOTE是一个通用框架,其组件(特征提取器、分类器)可以替换为不同的GNN模型,边生成策略也可调整。实验充分证明了其在多种数据集、不同不平衡程度、以及不同基础GNN模型上的有效性和鲁棒性。 4. 深入全面的分析:研究不仅展示了性能提升,还通过详实的消融实验和参数分析,深入探讨了过采样比例、不平衡比率、预训练策略、超参数敏感性和基础模型选择等因素的影响,为后续研究和应用提供了宝贵的经验指导。

七、 其他有价值内容 论文还对未来工作方向进行了展望,指出了一些值得进一步探索的路径,例如:将GraphSMOTE的思想扩展到其他图学习任务(如边类型预测、节点表示学习);探索在节点类别标签不明确情况下的不平衡学习问题;以及将该框架应用于更多样化的应用领域(如网站文档分析)。这些展望为相关领域的后续研究指明了潜在方向。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com