本文属于类型a,即单项原始研究论文的学术报告。
本文的主要作者为Zahir Abbas、Shihe Xu、Xiaohan Wu以及通讯作者Xinming Zhang,全部来自中国科学技术大学计算机科学与技术学院。该研究发表于《IEEE Transactions on Mobile Computing》第25卷第6期,出版时间为2026年6月,论文于2025年12月30日在线发表。
从学术背景来看,本文的研究领域属于车载边缘计算(Vehicular Edge Computing, VEC)与空天地一体化网络(Space-Air-Ground Integrated Networks, SAGIN)的交叉方向。随着自动驾驶、增强现实、虚拟现实以及飞行汽车等智能车载应用的快速兴起,车载用户对低时延和高性能计算资源的需求日益增长。传统地面网络虽然能够提供较高的数据传输速率和较低时延,但在全球覆盖、城乡连接以及应对自然灾害等方面存在明显不足。为此,研究人员提出将低地球轨道(Low Earth Orbit, LEO)卫星和自主空中飞行器(Autonomous Aerial Vehicles, AAV)作为动态边缘计算节点,为地面车载用户提供通信和计算服务。然而,在异构网络中如何高效地管理用户不可预测的任务需求,并为不同类型的计算任务匹配合适的计算资源,仍然是一个复杂的挑战。已有研究大多分别关注卫星或空中飞行器的计算卸载问题,较少考虑任务优先级和用户调度,尤其是在连续动作空间下的部分卸载问题。因此,本文旨在提出一种基于用户调度的部分任务卸载框架,结合异构任务优先级机制,将时延敏感任务卸载至AAV,将计算密集型任务卸载至LEO卫星,并利用深度强化学习算法在动态环境中优化通信与计算资源分配,以最小化任务执行时间与能耗的加权总和。
从研究流程来看,本文首先构建了LEO-AAV-地面一体化车载边缘计算系统模型。系统由多个LEO卫星、多个AAV以及地面车载用户组成,每个LEO卫星配备车载边缘计算服务器。时间被划分为离散时隙,在每个时隙内假设车辆位置保持稳定。系统采用正交频分多址(Orthogonal Frequency Division Multiple Access, OFDMA)接入方式以消除用户间干扰。任务生成模型将每个任务定义为其数据量、所需CPU周期数和最大容忍时延,并将任务分为时延敏感型和计算密集型两类。用户关联模型允许同一车辆同时关联LEO卫星和AAV,分别卸载不同类型的任务。在卫星覆盖模型方面,本文详细推导了仰角、地心角与覆盖弧长之间的几何关系,并考虑了卫星动态位置变化对覆盖时间的影响。通信模型分别建立了车辆到LEO卫星和车辆到AAV的上行传输速率公式,采用香农容量公式计算速率,信道增益采用自由空间路径损耗模型。计算模型涵盖本地计算、卫星计算和AAV计算三种模式。对于本地计算,时延取决于本地CPU频率,能耗取决于有效电容系数;对于卫星计算,总时延包括卸载时延和计算时延,能耗主要考虑传输能耗;对于AAV计算,同样包括卸载时延和计算时延,其能耗也主要考虑传输能耗。此外,本文还单独建模了AAV和LEO卫星的运行能耗,包括AAV的悬停能耗、飞行能耗和机载计算能耗,以及LEO卫星的计算能耗,并给出了各层能量预算约束。在此基础上,本文构建了一个以最小化加权时延与能耗总和为目标的混合整数非线性规划(Mixed-Integer Nonlinear Programming, MINLP)问题。由于该问题是非凸的,难以用传统数值优化方法直接求解,因此本文将二进制卸载变量松弛为连续变量,使其转化为凸问题,并利用深度强化学习进行求解。
针对松弛后的连续优化问题,本文将其建模为马尔可夫决策过程(Markov Decision Process, MDP),并提出了基于双延迟深度确定性策略梯度(Twin Delayed Deep Deterministic Policy Gradient, TD3)的部分任务卸载算法,称为TD3-PTO。在该框架中,动作空间包括用户调度变量、任务卸载比例、以及可见卫星的过渡角;状态空间包括车载用户任务负载、AAV位置和LEO卫星位置;奖励函数设置为所有用户的时延与能耗加权和的负值。TD3算法使用双评论家(Critic)网络以减小Q值过估计偏差,并通过目标策略平滑和延迟策略更新来提高训练稳定性和收敛速度。具体训练过程中,动作由演员(Actor)网络生成,并加入裁剪后的高斯噪声以促进探索。两个评论家网络分别通过最小化时序差分(Temporal Difference, TD)误差进行更新,目标Q值取两个目标评论家网络输出的最小值。演员网络则根据评论家网络提供的策略梯度进行更新。所有目标网络均采用软更新方式更新参数。算法通过经验回放缓冲区存储状态转移样本,并从中采样小批量样本进行训练。在复杂度分析方面,用户调度阶段的时间复杂度为O(tmax·v),其中tmax为时隙数,v为用户数;TD3-PTO训练阶段的时间复杂度为O(tmax·bs·Σ yi·y{i+1}),其中bs为批大小,y_i为各网络层神经元数。与Q学习、DQN、Actor-Critic等基线方法相比,TD3-PTO在保持相似或更低的计算复杂度的同时,能够有效处理连续动作空间并提高收敛稳定性。
在仿真实验中,本文采用Python平台和TensorFlow 2.10进行实现,硬件平台为Intel Core i7-13700KF处理器和NVIDIA GeForce RTX 3060 Ti GPU。实验设置了小规模网络(30个地面用户)和大规模网络(50个用户)两种场景,并与DDPG、DQN、Actor-Critic、Q学习等基线算法进行了对比。结果表明,在小规模网络中,随着LEO卫星带宽从100 MHz增加到900 MHz,平均加权消耗逐渐下降并趋于稳定;AAV带宽从100 MHz增加到500 MHz时,由于AAV更接近地面用户且路径损耗更低,其对系统性能的改善更为显著。此外,任务尺寸增大时,平均加权消耗也相应增加。在大规模网络中,带宽增加同样能降低平均加权消耗,但由于用户密度更大、任务量更高,系统性能略低于小规模网络。任务尺寸增大时,平均加权消耗呈现阶梯式上升。本文还专门对比了是否采用任务优先级机制的卸载方案。在非优先级方案中,所有任务被统一处理并卸载至LEO卫星,导致较高的时延和能耗;而优先级方案通过将时延敏感任务分配给AAV、将计算密集型任务分配给LEO卫星,显著提高了资源利用效率并降低了平均加权消耗。此外,实验还分析了LEO卫星数量和地心角变化对网络性能的影响。结果表明,较小的地心角配合更密集的卫星部署可以更好地分布计算负载,降低时延,但需要更多卫星;而较大的地心角可以增加单颗卫星的覆盖时长,减少所需卫星数量,但每颗卫星需要处理更多任务,导致计算和能耗需求增加。在运行时间方面,推理时间随着车辆密度增加保持稳定,环境步长时间近似线性增长,训练时间每回合仅温和上升,验证了所提算法的可扩展性。峰值内存使用量为0.43 MB,表明算法资源消耗可控。
本文的结论指出,所提出的TD3-PTO算法能够联合优化用户调度、部分任务卸载和LEO卫星动态过渡,并在满足带宽、飞行时间和能量等系统约束的前提下,显著降低平均时延和能耗,同时加快收敛速度。该研究填补了空天地一体化网络中基于任务优先级进行用户调度与部分卸载的空白,为高动态车载环境下的异构资源协同优化提供了有效方案。从科学价值来看,本文将用户调度、任务分类、部分卸载与卫星动态覆盖等要素统一到同一个MDP框架中,并通过TD3算法实现连续动作空间上的高性能决策,为后续SAGIN和VEC交叉领域的研究提供了方法论参考。从应用价值来看,该框架有望应用于真实的车联网和应急通信场景,为远程地区和城市密集环境中的车辆用户提供无缝连接和高性能计算服务。本文的亮点在于:第一,提出了三种层级任务优先级分类与调度机制;第二,构建了包含LEO卫星、AAV和地面车辆的统一系统模型,并详细推导了卫星覆盖几何关系;第三,将TD3算法引入部分任务卸载问题,解决了连续动作空间下的动态优化难题;第四,通过与非优先级方案的对比实验,验证了任务优先级对系统性能的重要影响。未来工作将包括使用真实世界数据集进行验证、引入AAV混合能量收集技术以及扩展多优先级调度机制。