分享自:

用于社交机器人检测的周边增强图神经网络

期刊:Expert Systems with ApplicationsDOI:10.1016/j.eswa.2025.127294

关于《PEGNN:用于社交机器人检测的外围增强图神经网络》的学术研究报告

本文由顾启天(Qitian Guyan,中国人民警察大学消防工程系)、刘耀文(Yaowen Liu,中国人民警察大学智慧警务系)、刘静(Jing Liu,华北航天工业学院文理学院)和张鹏(Peng Zhang,通讯作者,中国人民警察大学智慧警务系)共同完成。该研究于2025年3月15日被接受,并发表在期刊 Expert Systems with Applications 第278卷(2025年),文章编号为127294。

本研究属于人工智能与网络安全交叉领域,具体聚焦于社交媒体平台上的社交机器人(Social Bot)检测问题。随着社交网络的快速发展,由自动化程序控制的社交机器人被广泛用于传播虚假信息、干预舆论甚至选举,严重威胁网络生态和社会稳定。因此,开发高效的社交机器人检测技术至关重要。现有的主流方法之一是图神经网络,它能够有效建模用户间的交互关系。然而,当前研究多集中于改进GNN的架构,而忽视了对社交网络图结构本身的深入分析。基于此背景,本研究旨在填补这一空白,通过对社交图结构的深入分析,揭示其内在特性,并提出一个针对性的新型检测框架,以提升检测性能。

本研究的工作流程系统而严谨,主要包含以下几个关键步骤:

第一,现象发现与任务重定义。 研究团队首先深入分析了社交网络图的构建过程。他们发现,在通过“种子用户-广度优先搜索(BFS)”等方式爬取社交关系图时,会自然形成一种图分层(Graph Stratification)现象。具体而言,被选为源节点、主动扩展了邻居的节点(称为“爬取节点”或中心节点)构成了相互连接的网络核心;而那些仅作为邻居被引入、但自身未作为源节点进行扩展的节点(称为“观察节点”或外围节点)则只与中心节点相连,彼此之间没有连接。这导致整个社交图呈现出中心密集、外围放射状的拓扑结构。基于这一现象,研究提出了两个核心论点:1) 外围节点的邻域完整性极低,不适合作为检测目标;2) 社交图的构建逻辑是以中心节点为核心的。因此,将社交机器人检测任务聚焦于中心节点分类任务更具合理性和现实性。研究进一步指出,现有GNN框架在处理此任务时,默认的图聚合操作会导致外围网络的信息被完全忽略,这不仅破坏了中心节点的邻域完整性,也造成了计算资源的浪费。

第二,提出PEGNN框架。 为了解决现有框架无法有效利用外围网络信息的问题,本研究提出了外围增强图神经网络(Peripheral-Enhanced Graph Neural Network, PEGNN)框架。该框架的核心是一个外围增强模块,旨在提取并融合中心网络与外围网络的信息。其工作流程如下:首先,构建以用户为节点、交互为边的社交图,并依据上述标准区分中心节点与外围节点。接着,使用两层图聚合层(如GCN或RGCN)作为编码器,将图的结构信息聚合到节点特征中。随后,PEGNN通过协同优化三种损失函数来利用外围信息:1) 中心节点分类损失,基于中心节点的标签计算二元交叉熵损失;2) 外围节点分类损失,基于外围节点的(预测)标签计算二元交叉熵损失;3) 跨网络域自适应损失,使用多核最大均值差异(Multi-Kernel Maximum Mean Discrepancy, MK-MMD)来衡量并最小化中心节点与外围节点特征分布之间的差异,以促进两个网络信息的融合。最终的总损失是这三个损失的加权和。由于真实数据集中通常缺乏外围节点的标签,本研究采用了弱监督学习框架Snorkel,结合中心节点的标签来为外围节点生成伪标签,从而使得外围节点分类损失的计算成为可能。

第三,数据集分析与调整。 为了验证图分层现象并测试PEGNN框架,研究选取了两个广泛使用的基于图的社交机器人检测基准数据集:Twibot-20Twibot-22。研究首先对这两个数据集的结构进行了统计分析,通过将“所有有出边的节点”定义为中心节点,验证了图分层现象在这两个数据集中确实存在。数据显示,外围节点的数量远多于中心节点(例如在Twibot-22中,中心节点约1万,外围节点约99万),且外围节点的平均度远低于中心节点,这支持了“外围节点不适合检测”的论点。接着,研究对原始任务进行了调整:对于Twibot-20,由于其标注节点与中心节点高度重叠,直接将其任务视作中心节点分类任务;对于Twibot-22,其原始任务是对所有节点分类,研究将其重新划分为仅针对中心节点的训练、验证和测试集。这些调整为公平评估PEGNN在中心节点分类任务上的性能奠定了基础。

第四,实验验证与结果分析。 研究进行了详尽的实验来评估PEGNN的有效性。实验将PEGNN框架与多种基线模型(包括同质和异质GNN模型,如GCN、GAT、BotRGCN、RGT、Simple-HGN、HGT等)在调整后的Twibot-20和Twibot-22数据集上进行了对比。关键实验结果如下:在Twibot-20数据集上,应用PEGNN增强后的最佳模型(HGT)相比原始模型,准确率平均提升了1.30%,F1分数平均提升了1.37%;在Twibot-22数据集上,提升更为显著,准确率平均提升了2.46%,F1分数平均大幅提升了5.91%。其他指标如精确率和召回率也有明显改善。这强有力地证明了PEGNN通过有效利用外围网络信息,能够显著提升中心节点分类的性能。此外,消融实验证实了外围节点分类损失和域自适应损失各自对性能提升的重要贡献,且两者存在协同作用。超参数分析表明,仅需随机选取少量外围节点(如300-500个)进行计算,即可获得大部分性能增益,且中心与外围损失权重(α)及域自适应损失权重(β)需要合理平衡以达到最佳效果。可视化分析通过t-SNE算法展示了PEGNN-HGT相比原始HGT能够生成更具判别性的特征表示,减少了人类用户被误判为机器人的情况。复杂度分析表明,PEGNN带来的额外计算开销非常小,因为它本质上是在利用传统框架中已被处理但被浪费的外围节点信息。

本研究的主要结论是:首次系统性地揭示并形式化了社交网络图中的图分层现象,并据此提出了将社交机器人检测任务聚焦于中心节点分类的新视角。针对此任务,创新性地提出了PEGNN框架,该框架通过设计外围增强模块,巧妙地利用外围节点分类损失和跨网络域自适应损失,有效地提取并融合了外围网络中的信息,从而显著提升了现有GNN模型在中心节点分类任务上的性能。实验在两大基准数据集上验证了该框架的有效性和通用性。

本研究的价值与亮点体现在多个方面:首先,在理论贡献上,它突破了以往仅关注GNN架构改进的思路,从图数据本身的结构特性出发,提出了“图分层”这一新颖且重要的观察,为社交网络分析提供了新的理论基础。其次,在方法创新上,PEGNN框架设计巧妙,通过引入弱监督标签生成和域自适应技术,解决了外围节点无标签和分布差异的难题,为处理具有类似核心-外围结构的图数据任务提供了可借鉴的范式。第三,在应用价值上,该研究直接提升了社交机器人检测的准确性和鲁棒性,对于维护健康的网络环境具有现实意义。最后,研究对现有基准数据集进行了深入分析和适应性调整,为未来在该领域进行公平、科学的模型比较提供了重要参考。

研究的未来方向包括:探索更高效的无监督方法来利用外围网络信息,以及研究比MK-MMD更有效的跨网络信息融合机制。总体而言,这项研究是一项将数据洞察、问题重构与算法创新紧密结合的优秀工作,为图神经网络在社交安全领域的应用开辟了新的路径。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com