分享自:

LGB:语言模型与图神经网络驱动的社交机器人检测

期刊:journal of latex class files

LGB:语言模型与图神经网络驱动的社交机器人检测研究学术报告

一、 研究团队与发表信息

本研究报告基于一篇发表于 journal of latex class files 期刊(第14卷第8期,2021年8月)的学术论文。该研究由清华大学计算机科学与技术系的周明、张丹、王远东、董宇晓、唐杰(IEEE Fellow)以及北京交通大学计算机科学与技术系的耿杨力傲共同完成。论文题为“LGB:语言模型和图神经网络驱动的社交机器人检测”,旨在提出一种新颖的多模态框架以解决现有社交机器人检测方法面临的挑战。

二、 研究背景与目的

本研究属于网络安全与社交媒体分析交叉领域,具体聚焦于社交机器人检测。社交机器人是由计算机程序控制的自动化账户,近年来其恶意活动(如传播虚假信息、操纵舆论、干预选举等)已严重威胁社会安全与稳定。因此,开发有效的检测技术至关重要。

现有的检测方法主要分为三类:基于特征的方法、基于内容的方法和基于图的方法。基于特征的方法依赖人工设计的特征,可扩展性差且易受特征伪造攻击。基于内容的方法利用自然语言处理技术分析推文内容,但随着大型语言模型(Large Language Models, LLMs)的发展,机器人生成人类化文本的能力增强,削弱了此类方法的有效性。基于图的方法将社交账户视为节点、社交关系视为边构建图,利用图神经网络(Graph Neural Networks, GNNs)聚合邻居信息进行检测,在检测群体攻击方面表现出色,已成为当前最先进的方法。

然而,本研究通过分析真实社交网络数据集(如Twibot-22)发现,网络中存在着大量孤立节点(无任何邻居,占比高达30.62%)和稀疏连接节点(仅有一个邻居,占比约24.71%)。对于这些节点,传统的基于图的方法因缺乏足够的邻居信息以供聚合,导致检测性能显著下降。这些稀疏连接的机器人可能在执行恶意任务时才被快速激活并与人类建立联系,危害极大且难以检测。

因此,本研究的目标是解决图方法在检测稀疏连接节点时的瓶颈。研究团队观察到,语言模型(Language Models, LMs)在理解文本语义方面能力强大,而图神经网络擅长捕捉网络结构信息。基于此,本研究旨在探索并设计一种融合节点语义(通过LM获取)与网络结构(通过GNN获取)的多模态检测框架,以提升对稀疏连接和密集连接节点的整体检测性能。

三、 研究流程与方法详述

本研究工作流程主要包括数据准备、模型设计与训练、在线检测与反馈三大阶段,具体细节如下:

1. 数据预处理与统一用户文本序列构建 研究使用了两个公开的真实社交网络数据集:Twibot-22和Twibot-20。数据预处理的核心是将异构的用户信息转化为适合模型输入的格式。 * 图数据收集:通过选择种子用户、利用广度优先搜索进行图扩展,并收集每个节点的社交信息(属性、推文等)。 * 构建统一用户文本序列:为了适配语言模型的文本输入,研究设计了一种将用户多维信息序列化的方法。如图5所示,序列按固定格式拼接了用户档案(如姓名、粉丝数)、个人描述和推文历史,各部分之间用特殊分隔符</s>隔开。此外,对文本中的表情符号、@提及、#话题标签和网址链接进行了规范化处理(如替换为@user#hashtaghttpurl等),以减少噪声对语言模型理解的干扰。这些序列构成了后续模型训练的语义基础。

2. LGB框架的离线模型训练 LGB框架的核心创新在于其双模态(LM与GNN)协同的离线训练架构,如图4和图6所示。整个训练过程分为三个主要步骤: * 步骤一:语言模型的监督微调:针对图方法对稀疏连接节点检测不佳的问题,研究首先利用在线标注数据(包含用户反馈和先前检测结果)对预训练的语言模型(如RoBERTa)进行监督微调。具体而言,将构建好的统一用户文本序列输入LM,获得节点语义表征向量X,然后通过一个多层感知机(MLP)和Softmax层预测账户类别(人类或机器人)。优化目标是最小化预测结果与真实标签之间的交叉熵损失。此步骤旨在让LM更好地理解社交账户的语义信息,为后续融合提供高质量的初始节点表征。 * 步骤二:图神经网络的图对比学习预训练:为了解决标注数据稀缺的问题,研究采用图对比学习(Graph Contrastive Learning, GCL)对GNN进行预训练,以从大规模无标签数据中学习有价值的网络结构知识。具体流程为:首先,将经过监督微调的LM编码得到的节点特征矩阵X与社交关系邻接矩阵A结合,构成图G=(X, A)。然后,通过对原始图进行随机边丢弃,生成两个增强视图G̃1G̃2。将这两个视图输入GNN编码器,得到包含结构信息的节点表征H(1)H(2)。对比学习的目标是:对于同一个节点在不同视图下的表征(正样本对),最大化其相似性;对于不同节点的表征(负样本对),最小化其相似性。损失函数采用InfoNCE损失,同时考虑了视图内和视图间的负样本对。此阶段的目标是最小化对比损失,使GNN学会提取鲁棒的网络结构特征。 * 步骤三:基于多模态融合的GNN微调:这是实现信息融合的关键阶段。将在线标注数据同时输入到已监督微调的LM已预训练的GNN中。LM输出语义表征X,GNN接收XA,输出融合了网络结构信息的表征H。为了融合两种模态的信息,研究采用拼接(concat)操作XH合并,然后将合并后的表征输入一个MLP进行最终分类。此阶段的优化目标同样是最小化交叉熵损失。通过这种方式,模型能够同时利用账户的文本语义和其在社交网络中的结构关系进行联合判断。

3. 在线检测与智能反馈系统 为了应对社交机器人的快速演化并实现系统在实际环境中的部署,研究设计了一个包含离线训练和在线检测的双子系统架构(图4)。 * 在线实时检测:用户可通过Web界面提交待检测账户。系统在线管理器会实时构建该账户的自我中心网络(Ego Network),并调用训练好的LGB模型进行分析,生成包含该账户及其邻居风险状况的检测报告。 * 智能反馈机制:这是该系统的一个重要创新点。当专家用户对检测结果存疑时,可以通过界面提交反馈。经过机器和人工审核确认有效的反馈,会被记录到检测结果数据库中。这些带有新知识的反馈数据将在下一轮离线模型训练中被使用,从而使模型能够持续学习最新的机器人特征,实现自我进化。论文第V-C节的在线智能反馈研究实验证实,随着反馈样本(k-shot)的增加,模型在新数据集上的检测准确率持续上升,验证了该机制的有效性。

四、 主要研究结果与分析

研究进行了广泛的实验来验证LGB框架的有效性、鲁棒性及其各个组件的贡献。

1. 核心发现与动机分析(对应论文第III节) 在构建LGB模型之前,研究首先进行了深入的数据分析,为模型设计提供了关键依据: * LM与GNN的性能对比分析:在Twibot-22数据集上,比较了监督微调后的RoBERTa(LM)和GIN(GNN)对不同邻居数量节点的检测准确率(图2)。结果显示:对于孤立节点和只有一个邻居的节点,LM的检测准确率高于GNN;而对于拥有两个及以上邻居的节点,GNN的表现优于LM。这直观地证明了LM在缺乏结构信息时依赖语义的有效性,以及GNN在信息充足时利用结构关系的优势。这一发现直接启发了融合两种模态的思路。 * 社交关系结构与机器人概率的关联分析:通过分析用户自我中心网络中邻居(人类邻居、机器人邻居、总邻居)所形成的连通分量(Connected Components, CC)数量与用户是机器人概率的关系(图3),发现了一个关键模式:机器人概率与邻居形成的连通分量数量呈负相关。即,邻居圈子结构越紧密(连通分量少),该账户是机器人的概率越高。这从社会学角度(利于信息传播和机器人协作)解释了网络结构信息对于检测任务的重要性,进一步支撑了引入GNN捕捉结构信息的必要性。

2. 整体性能对比实验(对应论文第V-B节) 在两个数据集(Twibot-22, Twibot-20)上,LGB与12个基线模型进行了对比,包括经典GNN模型(GCN, GIN)、先进GNN模型(GCNII, GPR-GNN等)、最新的专用社交机器人检测模型(SIRAN, CBD)以及大型语言模型(Vicuna-7B, ChatGLM3-6B)。实验结果表明: * LGB模型(使用GCN, GIN, GAT作为其GNN组件)在各项指标上均取得了最佳或次佳性能。 * LGB (GCN) 在Twibot-20和Twibot-22上的检测准确率分别达到85.09%和80.42%,相较于各自数据集上最好的基线模型(SIRAN和MixHop),准确率提升了10.95%9.98%。 * 与大型语言模型相比,LGB的优势更为显著,准确率提升超过58%。这充分证明了融合网络结构与增强语义信息对于提升检测性能的有效性

3. 消融实验(Ablation Study)(对应论文第V-D节) 为了验证LGB各组成部分的贡献,研究进行了系统的消融实验: * 移除LM监督微调:性能大幅下降(在Twibot-22上准确率下降12.30%-15.70%)。这证实了对于大量稀疏连接节点,注入增强的语义信息至关重要。 * 移除GNN微调:性能急剧下降(下降35.67%-50.35%)。这表明若不通过微调将LM的语义信息与GNN的结构信息进行对齐和融合,模型无法有效工作,凸显了多模态融合的关键作用。 * 移除GNN预训练:性能略有下降,说明从无标签数据中通过对比学习获取的结构知识对最终性能有贡献。 * 替换融合方式:将默认的拼接(concat) 操作改为平均(average)最大化(max) 池化,模型性能出现不同程度下降,证明了拼接操作在融合两种模态信息时的优越性。 * 仅使用监督微调的LM:相比完整LGB模型,性能有所下降,说明网络结构信息对提升检测准确率具有不可替代的作用。

这些结果层层递进地证实了LGB框架中每个模块(LM监督微调、GNN预训练、GNN多模态融合微调)都是必要且有效的,且其特定的设计(如拼接融合)是最优选择。

4. 鲁棒性研究(Robustness Study)(对应论文第V-E节) 为了评估模型在真实场景下面临数据稀缺或噪声时的稳定性,研究进行了三项鲁棒性测试: * 标签鲁棒性:仅使用0.1%-1%的少量标注数据训练模型,LGB性能仍显著优于基线模型(至少2.64%),且随标签量增加持续提升。这得益于GNN预训练阶段从无标签数据中学到的知识,降低了模型对标注数据的依赖。 * 边鲁棒性:随机采样10%-100%的边(社交关系)进行训练,LGB在不同比例下均大幅领先基线模型(超过10.11%),且表现稳定。这表明当结构信息稀疏时,LM提供的语义信息能有效支撑检测。 * 特征鲁棒性:以10%-100%的概率随机丢弃用户文本序列的10%内容以模拟信息缺失或伪造,LGB性能依然稳健且大幅优于基线(超过9.10%)。这说明当文本信息被破坏时,GNN提取的网络结构信息能保障检测的有效性。

鲁棒性实验全面证明了LGB模型在标注数据稀缺、社交关系不完整、用户文本信息噪声大等挑战性场景下,依然保持强大且稳定的检测能力。

五、 研究结论与价值

本研究成功提出并验证了LGB,一个新颖的、由语言模型和图神经网络双驱动的社交机器人检测框架。其核心科学价值在于: * 理论贡献:首次通过实证分析揭示了图神经网络方法在社交机器人检测中的性能瓶颈源于网络中大量存在的孤立与稀疏连接节点,并发现了LM和GNN分别在不同连接密度节点上的性能优势。提出了通过多模态信息融合来协同利用节点语义和网络结构,以同时提升对稀疏和密集连接节点检测性能的创新思路。 * 方法贡献:设计了一套完整的、包含离线两阶段训练(LM监督微调 + GNN对比学习预训练 & 多模态融合微调)在线智能反馈的系统性解决方案。该方法不仅提升了检测精度,还通过智能反馈机制赋予了模型持续进化的能力。 * 应用价值:研究团队已将LGB系统在线部署(https://botdetection.aminer.cn/robotmain),为公众提供了识别恶意社交机器人的实用工具,有助于净化网络空间,对抗虚假信息传播,具有重要的社会安全意义。

六、 研究亮点

  1. 问题洞察新颖:首次系统性地分析了社交网络节点连接度的分布,明确指出并量化了图方法在稀疏连接节点检测上的短板,为研究方向提供了新的切入点。
  2. 多模态融合创新:创造性地将强大的语义理解模型(LM)与结构关系模型(GNN)深度融合,通过监督微调、图对比学习、特征拼接等策略,实现了1+1>2的检测效能。
  3. 系统设计完整:不仅提出了算法模型,还设计了包含离线训练、在线检测、智能反馈闭环的完整系统架构,体现了从研究到应用的贯通思维。
  4. 实证分析扎实:研究包含了深入的动机分析(LM vs. GNN对比、结构关联分析)、全面的性能对比、细致的消融实验以及严格的鲁棒性测试,论证过程严谨,结论可信。
  5. 实用性强:模型在多个真实数据集上表现卓越,且具备良好的鲁棒性,并通过在线系统实现了成果的即时转化和应用。

七、 其他有价值内容

论文还简要回顾了社交机器人检测的相关工作(特征基、内容基、图基方法),清晰定位了本研究的贡献。同时,作者也指出了当前工作的局限性:由于数据获取成本高且不同社交平台用户数据分布差异大,LGB尚未支持跨平台的联合检测,这将是未来重要的研究方向。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com