分享自:

边缘SLM与云LLM的协同推理与学习:算法、执行与开放挑战综述

期刊:ACM Computing SurveysDOI:10.1145/3838593

本文属于类型b,即一篇科学综述论文。

本篇综述的作者包括来自华中科技大学计算机科学与技术学院的Senyao Li、Haozhao Wang(通讯作者)及Ruixuan Li,香港科技大学综合系统与设计学部的Wenchao Xu,清华大学深圳研究生院的Rui Zhang,香港科技大学计算机科学与工程系的Song Guo,武汉理工大学交通物联网湖北省重点实验室的Jingling Yuan与Xian Zhong,以及南洋理工大学计算机科学与工程学院的Tianwei Zhang。该文发表于《ACM Computing Surveys》,在线发布日期为2026年8月,DOI为10.1145/3838593。文章题为《Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges》,系统综述了边缘小型语言模型与云端大语言模型在推理与训练两个层面协同工作的算法、执行机制与开放性挑战。

文章的核心论点是:随着大语言模型(LLMs)能力的不断演进,单纯依赖云端部署或对边缘设备进行模型压缩已难以同时满足延迟、隐私、成本与个性化方面的需求。因此,边缘部署的小型语言模型(SLMs)与云端LLMs之间的协作范式成为实现高效、可信且可扩展智能服务的关键路径。文章围绕这一核心论点,从推理协作与训练协作两个维度展开,提出了统一的分类体系,并对现有方法进行了系统梳理。

第一个主要观点是推理阶段的协作策略可以按照任务分配、任务划分与混合策略三个视角进行分类。任务分配策略通过路由机制决定一个请求完全由边缘SLM处理还是交由云端LLM处理,其优点是简单快速、通信开销低,但硬切换可能误路由不确定输入且缺乏联合推理能力。作者列举了资源与不确定性感知的分配方法,如EdgeLLM采用价值密度优先的调度算法以支持抢占与批量执行,PerLLM将个性化调度与约束满足相结合以联合优化部署与资源使用。此外,基于智能体(agent)的调度与基于专家混合(MoE)的架构也被归入任务分配范畴,如AgentVerse部署边缘协调器按任务意图组装云端专家,LiteMoE通过识别并合并关键专家来降低推理成本。任务划分策略将执行过程分解为不同模块或阶段,典型范式包括路由、计算卸载与提前退出(early exit)。路由方法如FrugalGPT通过级联路由降低API成本,Tabi利用校准置信度分数在轻量模型与强大LLM之间做出选择。计算卸载关注在推理过程中根据运行时条件动态决定不同计算阶段的执行位置,结构化模型划分与运行时自适应调度是两类主要方法。提前退出策略允许在中间层根据系统负载或模型置信度终止推理,如EE-LLM针对三维并行化LLM集成令牌级退出机制。混合策略在任务级与令牌级两个粒度上融合任务分配与任务划分,任务级混合如Minions将边缘侧分解与云端聚合流水线化,令牌级混合则以推测解码(speculative decoding)为代表,边缘SLM快速生成草稿,云端LLM进行验证与修正,从而在保持输出质量的同时显著降低延迟。

第二个主要观点是训练阶段的协作可以通过蒸馏、参数融合、适配器模块化训练、SLM驱动的监督以及云端引导的能力注入五类范式实现。文章指出,训练协作的核心挑战在于结构异质性、非独立同分布(non-IID)数据分布与隐私约束。在蒸馏与低秩近似方面,作者区分了任务与领域自适应蒸馏、架构解耦与代理学习、双向反馈蒸馏三类方法。例如,ATKD将蒸馏沿任务导向与多样性导向两个维度重新表述,并引入不确定性系数量化令牌级难度;DC-CCL垂直划分基础模型并蒸馏轻量代理以最小化通信开销。量化与剪枝策略同样构成轻量化部署的基础,如EfficientLLM在预训练阶段集成渐进式结构化剪枝,MergeNet利用低秩分解与注意力引导融合解决LLM与SLM之间的结构不兼容问题。多SLM参数融合方法如GRAFT通过兼容性引导的拼接机制,仅集成相互兼容的参数,从而缓解结构不匹配问题。适配器模块化设计以PEFT为代表,将LoRA类模块作为通信桥梁,客户端仅更新适配器权重,服务器利用监督调优与KL正则化进行双向提取。双向协作学习中的代表性方法包括CrossLM,边缘SLM本地训练并提供反馈以提示云端LLM生成和过滤伪样本,双方再在合成数据上进行精炼;Duet通过云端通用元网络生成以边缘分布为条件的设备特定参数。这些方法在知识流动方向、通信粒度与隐私保障上各有侧重,共同构成从单向迁移到模块化调优再到迭代反馈的递进式设计空间。

第三个主要观点是评估协作LLM-SLM系统需要专门的基准与数据集,而现有标准化资源的匮乏是制约该领域发展的关键瓶颈。传统NLP基准假设独立同分布数据与集中式执行,与真实部署中SLM运行于个性化、非独立同分布工作负载的实际情形严重脱节。文章汇总了若干代表性资源,如LEAF提供用户级划分的联邦学习数据集以评估统计异质性与个性化能力,iNaturalist-user与Landmarks-user分别以上传者ID与GPS元数据进行非独立同分布划分,PersonaDialog包含5600万条带有人口统计属性的对话数据。在平台方面,FedML提供模块化通信与执行框架,Flower可扩展至数百万虚拟客户端,TensorFlow Federated支持跨数亿设备的联邦学习。文章还指出,分层评估指标对于协作系统至关重要,例如在计算机视觉任务中需同时报告加权全局准确率与本地SLM准确率,在自然语言生成任务中全局BLEU/ROUGE需与用户级困惑度互补。

第四个主要观点是隐私保护与垂直领域应用构成了协作范式走向实际部署的两个关键维度。在训练层面,DCPR采用分层扩散方案,云端学习全局模式、边缘学习区域偏好、设备端学习用户个性化;联邦学习方法仅传输加密更新。在推理层面,RemoteRAG在嵌入空间中引入语义差分隐私度量,仅返回相似度阈值以上的索引;POST利用公共模型草稿与优化密码学原语加速隐私保护的推测解码。在垂直领域,文章列举了工业级框架如Walle支持300余项任务与每日超100亿次调用,Luoxi采用“慢-快”学习策略由云端生成辅助表示以支持边缘快速推理,IniGUIagent通过两阶段微调实现多模态GUI交互的分层推理。具体应用场景涵盖视频监控中的关键帧特征提取与云端多模态分类、机器人片段匹配与云端排序、生成式搜索中的边缘几何先验注入与云端纹理合成、个性化推荐中的云端候选生成与边缘重排序等。

文章的主要意义与价值在于:这是首篇同时考虑推理时协作与训练时协调的综述,提出了跨越任务分配、任务划分与混合策略的统一分类体系,将算法设计与系统需求相连接,为异质、资源受限环境下的边缘-云端LLM系统提供了系统性的方法论基础。文章指出,当前系统往往依赖临时性的置信度阈值或令牌级概率来触发提前退出与模型切换,未来应发展基于证据的不确定性估计方法,分解认知不确定性与随机不确定性,并结合强化学习与元学习策略实现自适应协作,从而推动从静态规则向自优化行为的演进。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com