本文属于类型a,即单项原创研究的学术报告。
本研究由南京工业大学计算机与信息工程学院(人工智能学院)的Hang Shen、Xiang Li、Yan Wang、Tianjing Wang和Guangwei Bai共同完成,发表于《Peer-to-Peer Networking and Applications》期刊2025年第18卷第113号,DOI为10.1007/s12083-025-01939-4,并于2025年2月18日被接收。
在学术背景方面,本研究聚焦于5G移动网络与物联网融合环境下的网络安全问题。5G网络不仅提供更高的带宽和更低的时延,还通过5G物联网支持海量设备接入,导致网络结构日益复杂且开放。随着这些设备嵌入关键基础设施,攻击面不断扩大,使5G物联网网络更易遭受安全威胁。渗透测试作为评估网络安全的重要技术,通过模拟真实攻击场景帮助网络管理员发现系统漏洞和潜在攻击路径,从而设计针对性的防御策略。传统的渗透路径构建方法大多依赖单一智能体或仅考虑单一类型网络,无法全面评估群体攻击行为和系统漏洞组合对安全性的影响。为应对这一不足,本研究提出了一种基于多智能体深度强化学习的协同路径渗透方法,旨在利用多个攻击智能体的协作机制提升攻击路径的整体质量和渗透效率。研究面临三方面主要挑战:协同环境感知、环境信息共享以及协调与一致性。这些挑战源自5G物联网网络的异构性、智能体间信息共享的实时性需求以及不同智能体在移动性、隐蔽性和攻击能力方面的差异。
在方法层面,研究构建了5G物联网网络场景,包含隔离区(DMZ)、下一代无线接入网(NG-RAN)、5G核心网(5GC)和应用核心区。攻击图(AG)使用Mulval工具自动生成,以有向图形式建模漏洞与攻击路径。问题被形式化为在攻击图中寻找初始节点与目标节点之间攻击增益最大的路径,攻击增益综合考虑漏洞评分和攻击持续时间。核心算法采用多智能体深度确定性策略梯度(MADDPG),架构上采用集中训练与分散执行的方式。训练阶段,所有智能体的策略网络和价值网络由中央控制器统一调度,价值网络以全局状态和所有智能体的动作为输入,评估动作质量;执行阶段,各智能体仅依靠本地观测独立决策,不依赖中央控制器。在任务分配方面,方法集成了合同网协议(CNP),主智能体发布渗透任务,各从智能体根据自身能力投标,主智能体选择最优投标者执行任务。在经验回放方面,方法引入了优先经验回放(PER)机制,根据时序差分(TD)误差的绝对值计算样本优先级,使高价值样本被更频繁地采样训练,同时通过重要性采样权重(ISW)修正由于优先采样引入的估计偏差。训练算法以最大回合数和训练轮数为循环条件,在每轮中更新策略网络和值网络参数,直至学习到最优策略。
实验准备方面,研究设计了多种基线方法进行对比,包括三种关系设定下的比较:合作型、利己型和竞争型;以及三种算法变体:基于A2C的方法、不含CNP和PER的MADDPG、仅含CNP的MADDPG和仅含PER的MADDPG。智能体数量从2到10变化,竞标轮数从1到5变化,折扣因子γ设为0.9,优先权调整参数α设为0.1,常数ε设为0.01。评估指标包括平均奖励、任务完成率、失败率、攻击收益和通信成本。
实验结果分为两大部分。第一部分考察合作模式的影响。在平均奖励方面,合作关系设定下平均奖励随训练迭代缓慢增长并趋于稳定,加入CNP和PER后主智能体与从智能体能够高效分配任务并优先学习关键经验,因此提出的方法获得比A2C更高的平均奖励;利己关系下奖励增长较低且不稳定,竞争关系下奖励波动大且收敛不稳定。奖励概率密度分布显示,所提方法的分布整体右移,表明其奖励值更高。在失败率方面,合作和利己关系下失败率随训练迭代呈缓慢下降趋势,合作关系的失败率普遍较低,验证了协作机制在复杂渗透任务中的有效性;竞争关系下失败率出现显著波动,原因在于智能体之间的资源竞争导致系统资源分配不合理,渗透策略难以收敛到全局最优。在攻击收益方面,合作关系下生成的渗透路径在不同路径长度上均具有更高的攻击收益值,这得益于信息共享、策略协调以及集中训练对路径质量的全局优化,而竞争和利己关系下由于缺乏合作与信息共享,难以发现隐藏的高价值目标。在通信成本方面,随着智能体数量和竞标轮数增加,通信成本呈线性增长,当竞标轮数从1增加到5时,通信成本显著上升。
第二部分为消融实验。在任务完成率方面,随着漏洞数量增加,所有方法的任务完成率均出现一定程度下降,但所提方法在不同漏洞数量下始终保持较高的任务完成率,这归因于全局信息引导、智能体间相互理解与高效决策以及优势函数估计对即时与长期回报的平衡。在路径探索效率方面,各方法的探索步骤与漏洞数量正相关,但所提方法的探索步骤显著低于所有基线方法,表明其能更快收敛至最优策略。CNP任务分配机制使主控智能体能基于当前状态发布需求并接受其他智能体的承诺,高效分配任务和资源;PER的样本优先级排序确保各智能体获得最有价值的学习样本,使模型对当前状态和动作的评估更加确定和稳定。在失败率及其概率密度分布方面,联合优化帮助智能体在合作环境中学习互利的行动策略,通过集中训练、联合优化和经验回放促进信息共享和资源利用,使智能体能够捕获复杂的攻击与防御动态,提高路径规划的针对性和鲁棒性。
研究在结论部分指出,所提出的基于多智能体深度强化学习的协同渗透路径方法,通过多个攻击智能体的合作提升了攻击路径生成效率和防御策略精度。该方法建立在集中训练与分布执行基础上,促进智能体之间的协同,从而开发和实施精确的路径规划与渗透策略。通过集成CNP,中央控制器改善了训练期间的任务分配,确保智能体间有序协作;PER机制增强了对渗透策略的定向学习。与传统方法相比,所提解决方案为5G物联网网络渗透测试提供了显著改进,突破了单智能体路径规划的局限,提升了可扩展性和动态环境下的灵活性。
本研究的亮点体现在以下几个方面:其一,首次将CNP与MADDPG深度融合用于多智能体渗透测试场景,构建了主从式角色结构和任务竞标机制,实现了渗透任务的动态分配与协同执行;其二,在MADDPG经验回放池中引入PER机制并根据TD误差进行样本优先级排序,加速了策略收敛并提升了路径生成的稳定性;其三,设计了多组不同关系设置下的对比实验和消融实验,系统验证了协作机制、CNP和PER各组件对整体性能的贡献;其四,所提出的方法在攻击效率、决策稳定性和任务完成率方面均优于主流深度强化学习基线方法,为5G物联网复杂网络环境下的多路径渗透测试提供了新的技术思路。此外,研究指出当前探索的智能体间互动仍处于较初步的阶段,未来工作将致力于让不同智能体在渗透过程中承担不同角色和任务,进一步提升多智能体系统的灵活性与适应性。