分享自:

车联网中大小模型协同推理的动态模型与节点选择

期刊:2025 IEEE International Conference on Web Services (ICWS)DOI:10.1109/icws67624.2025.00037

本文提出了一种面向车联网中大小模型协同推理的动态模型与节点选择策略。研究由复旦大学计算机科学技术学院的郑梦柯(Mengke Zheng)、卢志辉(Zhihui Lu)及石景华(Shijing Hu),宾夕法尼亚州立大学信息科学与技术系的段强(Qiang Duan),以及内蒙古大学计算机学院的黄宝琦(Baoqi Huang)共同完成。该论文发表于2025年IEEE国际网络服务会议(2025 IEEE International Conference on Web Services, ICWS),DOI为10.1109/ICWS67624.2025.00037。

从学术背景来看,该研究属于车联网边缘智能与协同推理交叉领域。随着智能网联汽车的发展,自动驾驶环境感知和智能座舱多模态交互等应用越来越依赖大规模人工智能模型,如SAM(Segment Anything Model)和CLIP,以获得高精度推理结果。然而,车辆本身的计算和存储资源有限,难以直接部署这些大模型。传统纯云端推理方式在高速移动场景下容易因无线连接不稳定而产生较大时延,而纯边缘部署又缺乏处理复杂任务的算力。因此,云端大模型、边缘小模型和车载微型模型之间的协同推理成为兼顾精度与效率的重要方案。在该架构中,车载YOLOv7-tiny模型(参数量约600万)处理常规检测任务,边缘DETR-ResNet-101模型(参数量约6000万)处理中等复杂度任务,云端SAM模型(参数量约6.36亿)处理高复杂度任务。然而,现有方案大多基于深度强化学习(Deep Reinforcement Learning, DRL),存在决策延迟和模型与节点选择次优的问题,且未充分考虑异构模型能力与任务复杂度的动态匹配。本研究旨在通过主动推理(Active Inference)理论,设计一种能够快速适应车联网动态环境的模型与节点选择策略,并兼顾模型更新机制。

在研究流程方面,本文首先构建了“云—边—端”三层协同推理系统模型。云端包含推理中心和离线训练中心,边缘层由边缘决策节点和边缘工作节点组成,车辆端部署微型模型。边缘决策节点运行主动推理模型,维护车辆运动信息(速度、航向、坐标)以及所辖边缘工作节点和云节点的资源状态。系统通过心跳包周期性更新节点资源状态。车辆本地模型无法满足任务需求时,向边缘决策节点发送任务信息,由其决定卸载到边缘工作节点或云端。任务复杂度通过输入分辨率、目标数量、遮挡率和资源需求等特征进行量化。系统优化目标包括最小化总时延、优化资源匹配、保持负载均衡和最大化推理精度。总时延由决策时延、传输时延和执行时延构成,其中传输时延基于香农公式和路径损耗模型计算,执行时延与计算负载和节点算力相关。此外,系统引入备份节点选择机制以应对车辆高速移动导致的连接中断。

在此基础上,本文提出了基于主动推理的模型与节点选择方法。该方法将系统建模为包含隐状态空间、观测空间和动作空间的三元组。隐状态空间包括预测时延、节点负载、任务复杂度、信道状态和性能退化五个维度。观测空间包括系统时延估计、连接稳定性、能量消耗估计和负载均衡熵。动作空间由候选节点集合、资源分配权重、传输参数和任务特征约束组成。边缘决策节点通过最小化自由能函数实现决策优化,自由能函数由时延预测误差、能量消耗、负载不均衡度和推理精度损失加权构成。在线学习过程中,系统根据自由能梯度动态更新参数,自适应学习率机制可在梯度变化剧烈时自动降低学习率以避免震荡。当预测误差超过观测时延的20%时,触发贝叶斯更新进行模型重校准。算法首先对候选动作进行过滤,然后计算各候选动作的自由能,选择自由能最小的动作作为最优执行策略。

模型更新机制方面,云端训练中心对大模型和小模型进行离线训练,并通过周期性更新和紧急更新两种方式同步参数。周期性更新每30秒进行一次,边缘工作节点和云端推理中心从云端训练中心拉取最新参数,更新比例δp设置为0.2。当推理精度低于85%阈值时触发紧急更新,更新比例δe设置为0.8,以快速恢复模型性能。更新通信开销与更新次数、参数量及元数据大小相关。

实验部分采用SUMO与CARLA联合仿真构建交通场景,使用NS-3模拟5G-V2X网络。交通场景包含200辆动态车辆,速度范围30至120 km/h,边缘工作节点每500米部署一个。模型配置方面,车载YOLOv7-tiny在NVIDIA Jetson AGX平台上时延为15毫秒,边缘DETR-ResNet-101在Intel Xeon Gold平台上时延为22毫秒,云端SAM在AWS EC2 P4平台上时延为110毫秒。实验对比了FCL-Offload、DRL-VEC和AI-LLM三种现有方法,每项实验重复10次并计算95%置信区间。

主要实验结果显示,本方案在综合性能上优于所有对比方法。平均时延为152.3毫秒,相比DRL-VEC降低23.2%;任务失败率为4.2%,相比FCL-Offload降低67%;负载均衡熵为0.87,推理精度为89.7%。在200%流量激增测试中,本方案时延仅为168.2毫秒,失败率为5.1%,负载均衡熵为0.82,表现出较强的动态适应能力。在主动推理特性验证中,稳态流量场景下系统在30次迭代内收敛,时延预测RMSE为8.2毫秒;突发拥塞场景下需要60次迭代收敛;网络闪烁场景下通过冗余机制逐步恢复,能量RMSE最终为2.7焦耳。模型参数更新影响分析表明,当同步周期为30秒且更新比例为0.2时,达到精度89.7%和通信开销32.8 MB的最佳平衡。模型更新消融实验显示,完整更新策略在稳态流量、突发拥塞和72小时长期运行三种场景下分别达到89.7%、87.3%和85.4%的精度,均优于仅周期性更新、仅紧急更新和无更新机制。

本研究的结论是,基于主动推理的动态模型与节点选择策略能够有效解决车联网中大小模型协同推理的决策延迟和次优选择问题。该方法通过贝叶斯信念更新最小化自由能,无需奖励函数即可快速适应动态环境。实验证明该框架在降低时延、减少失败率和提升负载均衡方面均具有显著优势,同时混合更新策略能够在长时间运行中保持较高精度。其科学价值在于将主动推理理论引入车联网协同推理场景,为异构模型协作提供了新的决策范式;应用价值在于可支撑自动驾驶和智能交通系统中的实时推理任务,满足高动态环境下的精度与效率需求。

本研究的亮点包括:首次将主动推理应用于车联网中大小模型与节点的联合选择;设计了结合车辆运动学预测和备份节点机制的容错执行方案;提出了时间驱动与精度触发相结合的模型更新策略;在多种动态场景下验证了系统的鲁棒性和适应性。此外,未来工作将探索支持更多样化模型架构以及在更大规模车联网中的可扩展性,并研究联邦学习技术的集成以增强模型更新和隐私保护。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com