分享自:

面向车联网边缘计算中协作推理的模型划分与早退点选择联合优化

期刊:IEEE Transactions on Parallel and Distributed SystemsDOI:10.1109/tpds.2026.3652171

本文于2026年3月发表在《IEEE Transactions on Parallel and Distributed Systems》第37卷第3期上,作者包括Chunlin Li、Jiaqi Wang、Kun Jiang、Cheng Xiong以及Shaohua Wan。其中,Chunlin Li来自武汉理工大学计算机与人工智能学院及四川省警用融合计算重点实验室,Jiaqi Wang、Kun Jiang和Cheng Xiong来自武汉理工大学计算机与人工智能学院,Shaohua Wan来自电子科技大学深圳高等研究院。该研究得到了国家自然科学基金、四川省警用融合计算重点实验室、湖北省重点研发计划、广东省自然科学基金以及深圳市科技计划等多个项目的资助。

在学术背景方面,本文聚焦于车载边缘计算(Vehicular Edge Computing, VEC)中深度神经网络(Deep Neural Networks, DNN)推理任务的加速问题。随着智能网联汽车和车联网的快速发展,DNN被广泛用于实时路径规划、高级驾驶辅助系统和环境感知等智能应用。然而,这类任务通常计算密集且延迟敏感。尽管车载系统级芯片(如Tesla HW4和NVIDIA Orin Drive)已能提供数百TOPS的AI性能,但在面对鸟瞰图感知网络和大规模多模态模型等大型任务时,车辆本地计算资源仍然不足。同时,自动驾驶对功耗有严格限制,进一步制约了车载计算能力的发挥。因此,借助边缘服务器进行协同推理成为降低延迟和能耗的重要途径。已有的模型划分与任务卸载研究通常假设边缘服务器具备充足计算资源,而实际场景中,路侧单元(Roadside Unit, RSU)的计算资源往往有限,并可能面临多车同时卸载造成的任务堆积问题。此外,传统DNN模型不具备样本复杂度区分能力,所有样本都必须经过完整网络,导致计算资源的浪费。为了应对这些挑战,多出口DNN模型被引入,通过在网络中间层设置分类器,使部分任务能够在较浅层提前退出,从而减少计算开销和传输开销。然而,如何在动态VEC环境中为每辆车的DNN任务选择最优划分点和提前退出口,并在保证推理精度的前提下最小化平均推理延迟,仍然是一个尚未充分解决的问题。

针对上述问题,本文提出了一种名为MEOCI的边-车协同推理加速机制,即模型划分与提前退出口选择联合优化(Model Partitioning and Early-Exit Point Selection Joint Optimization for Collaborative Inference)。该机制的目标是在推理精度约束下最小化平均推理延迟。由于模型划分点和提前退出口的选择会显著影响推理延迟并可能造成精度损失,该优化问题被建模为时间序列混合整数非线性规划问题,具有NP-hard复杂度。为此,作者将其转化为马尔可夫决策过程(Markov Decision Process, MDP),并设计了自适应双池对偶深度Q网络(Adaptive Dual-Pool Dueling Double Deep Q-Network, ADP-D3QN)算法来求解。

在系统模型方面,本文构建了一个包含RSU和多辆车的城市交通场景。RSU搭载边缘服务器,车辆通过车到路侧单元(Vehicle-to-RSU, V2R)和车到车(Vehicle-to-Vehicle, V2V)通信链路进行协同。系统假设在短时间内信道和拓扑保持不变,但在不同时隙间可以变化。DNN模型采用逐层划分机制,车辆在本地完成浅层推理并将中间特征传输到RSU,由RSU继续执行剩余层级的推理并返回结果。多出口DNN模型以AlexNet和VGG16等为例,在主干网络之外增加多个分支,每个分支对应一个提前退出口,通过设定置信度阈值来决定任务是否提前退出。每个出口的推理精度和提前退出概率通过离线和在线计算获得。

在通信模型上,本文考虑了路径损耗和信道衰落,信道增益与车辆到RSU的距离平方成反比。传输速率根据香农定理计算。在延迟模型上,本文不仅考虑了车辆本地处理延迟和中间特征传输延迟,还特别引入了边侧排队延迟。由于RSU的计算资源有限,来自多辆车的任务需要在边缘服务器上排队,因此采用M/D/1排队模型来描述服务过程,其中服务率与分配给任务的计算资源及各层计算量有关。此外,通过引入多出口机制,计算延迟被表示为各层提前退出概率与该层累积计算延迟乘积之和的期望值。能耗模型主要考虑车辆和边缘服务器的计算能耗,忽略由于中间特征较小且传输速率较高而相对较小的传输能耗。优化问题的目标是最小化所有车辆任务的平均推理延迟,并需要满足延迟容忍约束、发射功率约束、能耗约束和推理精度约束等。

在算法设计方面,ADP-D3QN相比传统D3QN做了两方面改进。第一,改进了ε-贪婪探索策略,使探索概率ε随训练迭代轮次线性降低,从而在训练初期鼓励更多探索,在后期更倾向于利用已学到的策略。第二,采用了双经验池重放机制,将经验按照Q值高低分别存入两个经验池,并在网络更新时以不同的概率从两个池中采样,既提高了高价值样本的利用率,又保留了部分低价值样本以避免陷入局部最优。在训练过程中,智能体根据当前状态选择模型划分点和任务退出概率的动作,执行动作后获得奖励,奖励定义为平均推理延迟的负值。状态空间包括推理任务精度、边缘服务器等待队列长度、边缘节点剩余计算资源和车辆任务到达率。动作空间由模型划分点和提前退出概率共同构成。状态转移概率由精度、队列长度和剩余资源等条件概率相乘得到。算法通过不断迭代更新网络参数,最终收敛到最优的策略。

在实验部分,作者使用K3s作为边缘计算平台,在四种多出口DNN模型(AlexNet、VGG16、ResNet50和YOLOv10n)上进行了评估。训练数据来自BDD100K数据集。实验环境包括树莓派4B和Jetson Nano两种不同计算能力的车辆终端,以及由主控节点和三个计算节点组成的边缘服务器集群。实验比较了ADP-D3QN与Vehicle-only、Edge-only、DINA、Neurosurgeon、FedAdapt、Edgent、LBO和LYMDO等基准算法。性能指标包括平均推理延迟、任务完成率、推理精度和能耗。配对t检验结果显示,ADP-D3QN相比各基准算法的延迟降低在统计上显著。

实验结果首先验证了算法的收敛性,ADP-D3QN相比D3QN、自适应D3QN和双经验池D3QN具有更高的奖励和更稳定的收敛过程,且运行时延最低。在多出口模型的退出概率和精度方面,AlexNet配置了四个提前出口,VGG16配置了五个提前出口,各出口的推理精度依次提高,且大多数样本能够在分支提前退出而不必完成全部推理过程,精度损失相比原始DNN约1.2%,处于可接受范围内。在异构设备实验中,MEOCI在Jetson Nano上比树莓派4B上表现出更低的推理延迟,说明该方法对不同计算能力的车辆终端均具有适应性。在车辆数量影响方面,随着车辆数量增加,ADP-D3QN相比其他算法保持了更低的延迟和更高的任务完成率,尤其在车辆数量超过15时优势更加明显。在传输速率影响方面,所有依赖卸载的算法随带宽增加延迟有所下降,ADP-D3QN始终取得最低延迟和最高完成率。在延迟约束影响方面,放宽延迟约束有助于提升基于提前退出机制算法的任务完成率;在VGG16模型200 ms约束下,ADP-D3QN的任务完成率达到99.47%,优于所有基准算法。在能耗限制影响方面,相比Edge-only和LYMDO,ADP-D3QN在严格能耗限制下依然能保持较低的推理延迟和能耗。在可扩展性实验中,ADP-D3QN在不同交通密度和边缘服务器负载下均表现出最低的延迟,验证了其动态适应能力。

研究结论指出,MEOCI机制通过联合优化模型划分和提前退出口选择,有效缓解了VEC中DNN任务卸载过程中的边缘服务器过载和推理延迟过大问题。ADP-D3QN算法通过改进探索策略和经验重放机制,提升了收敛速度和稳定性。在实际VEC场景中,该方法显著降低了推理延迟,提高了任务完成率,并能适应异构车载设备。本文的主要亮点在于:第一,综合考虑了通信带宽和能耗约束,克服了现有方法只关注单一约束的不足;第二,提出了双经验池差异化采样机制,提高了强化学习样本利用效率;第三,在异构车载设备和动态交通密度条件下验证了方法的有效性和可扩展性。未来研究将关注多边缘服务器同时为多车辆提供服务的场景下的任务迁移策略和负载均衡方法。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com