本文提出了一种面向车联网边缘计算(Vehicular Edge Computing, VEC)场景的大型语言模型(Large Language Model, LLM)与小型语言模型(Small Language Model, SLM)协同推理框架,旨在解决推理时延与推理精度之间的权衡优化问题。该研究由重庆师范大学计算机与信息科学学院的周新杰、郑程程、刘伟伟、胡文辉、高丽萍以及肖柯(通信作者)共同完成,肖柯同时隶属于重庆市高校优化技术与智能车辆重点实验室。论文发表于 IEEE Internet of Things Journal 第13卷第15期,出版时间为2026年8月1日。
在学术背景方面,随着车联网的快速发展,车辆作为具备感知、通信和计算能力的移动节点,正在支撑自动驾驶、交通监控和智能人机交互等时延敏感与安全关键型应用。这些应用越来越依赖先进的人工智能模型从海量异构数据中提取高层语义信息。以ChatGPT和Gemini为代表的LLM在推理、泛化和多模态融合方面展现出强大能力,但其庞大的计算与内存需求使得车载终端难以独立部署。云端部署虽然可行,但长距离传输带来的高时延和隐私风险使其难以满足车联网的实时性要求。VEC通过将LLM部署在靠近数据源的路侧边缘服务器上,在一定程度上缓解了时延问题,但对于毫秒级响应的应用仍显不足。相比之下,SLM具有轻量级、低时延和低资源消耗的优势,适合车载本地部署,但在处理复杂任务时推理精度往往不足。LLM的推理时延通常在数百毫秒到数秒之间,而SLM推理可在数十毫秒内完成,由此形成了时延与精度之间的内在矛盾。现有研究大多采用非对称优化策略,将时延或精度其一作为约束条件而非优化目标,或采用固定标量化的加权和方法,缺乏对两者动态权衡的系统刻画。针对上述问题,本文的目标是提出一个能够在VEC范式下显式建模时延与精度冲突,并通过多目标优化获得帕累托最优解集的协同推理框架。
在研究工作流程方面,本文首先构建了LLM-SLM协同推理系统模型。系统包含一个VEC服务器和一组车辆,每辆车配备车载SLM,VEC服务器部署高精度LLM。车辆通过路侧单元(Roadside Unit, RSU)与VEC服务器通信。每个车辆生成一个推理任务,任务由输入数据量、计算密度、优先级权重、最低可接受精度和最大容忍时延五个参数定义。系统引入了卸载比例αi,表示任务数据中卸载到VEC服务器的比例,剩余部分在本地由SLM处理。这种部分卸载模型为时延与精度的动态调节提供了细粒度控制能力。在通信模型方面,采用准静态信道模型和正交频分复用技术,根据香农定理计算上行传输速率,进而得到传输时延。本地推理时延由本地处理数据量、SLM计算强度和车辆计算能力共同决定,本地推理精度采用Sigmoid函数建模,以反映精度随数据量增加而逐渐饱和的学习曲线特性。边缘推理时延由卸载数据量、LLM计算强度和VEC服务器分配的计算资源决定,边缘推理精度同样采用Sigmoid函数建模。在此基础上,由于本地推理与边缘推理并行执行,任务总时延取两者的最大值。系统总加权时延为所有任务加权时延之和。推理精度方面,将SLM精度与LLM精度进行加权融合,权重由卸载比例和两个模型的相对精度共同决定。最终形成了以最小化总加权时延和最大化平均期望精度为目标的多目标优化问题,约束条件包括卸载比例范围、单任务资源分配上限、服务器总资源限制、最大容忍时延和最低精度要求。
针对该非凸且高度耦合的多目标优化问题,本文提出了混沌与模拟退火嵌入的粒子群优化算法(Chaos and Simulated Annealing-embedded Particle Swarm Optimization, CSAPSO)。该算法在标准多目标粒子群优化(Multiobjective Particle Swarm Optimization, MOPSO)框架基础上进行了两项关键改进。第一,在种群初始化阶段采用Logistic混沌映射生成初始解,以提高种群遍历性和多样性。第二,在每次全局迭代后引入基于模拟退火(Simulated Annealing, SA)的局部搜索算子,通过概率接受劣解来增强算法跳出局部最优的能力。具体流程包括:利用混沌映射初始化粒子位置和速度;利用惩罚函数法将约束优化问题转化为无约束问题,并通过动态惩罚因子逐步加强约束满足;采用自适应惯性权重更新粒子速度和位置;对违反边界约束的解执行截断与归一化修复;通过非支配排序和拥挤距离维护精英解集;最后通过改进的Metropolis准则对帕累托解集进行模拟退火局部搜索。复杂度分析表明,CSAPSO算法的时间复杂度为多项式级,主要由帕累托解集的维护和模拟退火局部搜索主导。
在性能评估方面,本文使用RayCloudSim仿真平台构建了包含单个VEC服务器和10至30辆车的仿真场景。对比方案包括全本地执行方案(ALS)、全卸载方案(AOS)、随机卸载方案(ROS)、传统MOPSO方案(MPS)和基于NSGA-II的多目标遗传算法方案(MGS)。实验结果显示,CSAPSO在不同车辆数量下均能实现平滑收敛,且收敛后的帕累托前沿在时延-精度平面上分布更广、更均匀,并明显优于对比方案。在超体积(Hypervolume, HV)指标上,CSAPSO在所有场景下均取得最高值,且95%置信区间与基准方案不重叠,表明性能提升具有统计显著性。在不同本地计算资源条件下,CSAPSO实现了最低的时延和除AOS外最高的精度;在不同VEC服务器计算资源条件下,CSAPSO的时延仅次于MGS,但精度显著高于MPS和MGS;在任务数据量和任务时延要求变化的情况下,CSAPSO均表现出最佳的时延-精度综合权衡能力。当任务精度要求从0.7提高到0.85时,CSAPSO在保证满足精度约束的同时,时延增长幅度显著低于其他自适应方案。
本文的主要结论是,在车联网边缘计算环境中,LLM与SLM的协同推理可以通过显式多目标优化实现时延与精度的有效平衡。所提出的CSAPSO算法通过混沌初始化和模拟退火局部搜索的协同作用,能够在高度非凸的搜索空间中有效逼近帕累托最优前沿,并在收敛性、解集多样性和整体权衡性能方面优于现有基准方法。本研究的科学价值在于提供了一个系统化的多目标优化框架来刻画异构模型协同推理中的时延-精度折中关系,弥补了现有方法将精度作为约束或固定加权目标的不足。在应用价值方面,该框架可支持动态车联网环境下的灵活卸载决策和资源分配,适用于目标检测、语义分割等可分割的感知型任务,并为未来多VEC服务器场景、移动性感知优化以及提示路由和置信度感知模型切换等更复杂的协作范式奠定了基础。论文的亮点包括:显式建模时延与精度两个冲突目标并获得帕累托最优解集;提出结合混沌映射与模拟退火的改进MOPSO算法;通过复杂度分析和广泛的仿真实验验证了算法的有效性和实用性。