本文题为《Onboard Decisions and Cloud-scale LLM Planning: Split Reasoning and Collaborative Intelligence for Autonomous Driving》,由Meng Ma、Shuyang Li、Kaicong Huang、Talha Azfar、Naigang Wang以及Ruimin Ke共同完成。前四位作者及通讯作者Ruimin Ke隶属于Rensselaer Polytechnic Institute(伦斯勒理工学院),Naigang Wang来自IBM T.J. Watson Research Center。该研究发表于SEC ‘25(The Tenth ACM/IEEE Symposium on Edge Computing,第十届ACM/IEEE边缘计算研讨会),会议于2025年12月3日至6日在美国弗吉尼亚州阿灵顿举行,论文DOI为https://doi.org/10.1145⁄3769102.3774637。
自动驾驶系统面临一个根本性矛盾:安全关键决策需要极短响应时间,而长时域规划又需要复杂的语义推理能力。纯车载解决方案受到车辆计算资源和能耗预算的严格限制,通常只能部署轻量级模型,虽然推理时间可控制在每帧10至30毫秒,但往往以精度下降和模型性能退化为代价。相反,将感知与决策完全卸载至云端虽然可以运行大规模自动驾驶模型,但网络延迟和传输可靠性成为瓶颈——即使在稳定的5G连接下,往返延迟通常也在80至200毫秒之间,拥塞网络中更可能超过300毫秒,难以满足驾驶场景中的实时响应要求。
近年来,大型语言模型和多模态大语言模型的出现为自动驾驶场景理解带来了新范式。DriveGPT4、GPT-Driver和Talk2Drive等系统证明了端到端运行的可行性,能够理解场景语义、生成并解释驾驶决策,甚至直接输出底层控制指令。然而这些模型计算资源需求巨大、推理延迟显著,不适合边缘部署;纯云端方案则面临通信延迟和可靠性问题。
轻量级视觉语言模型通过压缩、量化和知识蒸馏等技术可以在边缘设备上高效推理,输出延迟达到秒级甚至毫秒级,满足紧急避障或短时域风险预测等“硬实时”要求。然而受限于模型容量,小型模型通常只能处理简单的二元风险判断等识别任务,难以捕捉复杂交通场景、长尾事件和不规则行人行为,缺乏时空一致性,不足以支撑长时域规划或高层语义推理。STSBench评测基准的研究也证实,当前视觉语言模型在时空推理和复杂交通动态理解方面存在明显不足。
针对上述挑战,本研究提出了一个层次化的云-边协同闭环控制框架,其核心目标是通过分割推理和协同智能两种互补机制,实现边缘快速安全响应与云端深度策略优化的有机统一。
该研究提出了一种双时间尺度的控制架构。在边缘侧,轻量级车载视觉语言模型以较高频率运行,回答二元风险查询并输出即时控制修正量δcontrol,用于调整油门、转向或制动以缓解短时域风险。在云端,大型视觉语言模型以较低频率并行运行,执行多模态感知、高层语义理解和全局轨迹规划。当云端模型在每个时间戳产生输出时,可以覆盖或优化边缘端生成的动作序列。这种“不可等待”的即时反应保留在车载端,而“需要深入思考”的任务(如意图推理、轨迹细化和解释生成)则分配给云端强大模型,体现了边缘优先反射与云端深度推理的有机融合。
边缘端采用SmolVLM2,一个专为视频分析设计的多模态轻量级模型,参数量仅22亿,显存需求约5.2 GB,非常适合边缘计算设备的资源约束。在CARLA仿真环境中,自车配备四台同步RGB相机,分别安装于前、后、左、右四个方位,提供多视角输入。边缘模型接收多视角相机数据x = {I_front, I_rear, I_left, I_right}。由于边缘侧模型主要处理快速响应的安全场景,如紧急制动或变道等需要立即执行的动作,不需要进行复杂的语义场景理解,因此将问题简化为一组二元风险查询Q,例如“是否有车辆正在接近自车视野?”。当模型输出为“是”时,立即生成修正控制动作δu = (δu_throttle, δu_steering, δu_brake),包含对油门、转向和制动的调整量。时间步t的整体控制量为上一时间步的基础控制加上修正量,即u_edge_t = uedge{t-1} + δu。
该研究特别关注了车载视觉语言模型输入信息的选择问题。研究团队参考了人类驾驶员注视行为的研究成果,选择了预定的观察角度而非上下文相关的自适应注视策略。具体而言,轻量级视觉语言模型以水平线以下40度的视角观察世界,以便专注于更近的道路标线和危险因素。
云端部署GPT-5大型语言模型,负责低频但高层次的感知、规划和控制任务。大规模视觉语言模型接收与边缘端相同的多视角相机数据,同时结合最近时间步的边缘模型控制信号,以及包含检测到的交通规则、长时域意图推理和全局上下文的提示词。其输出为全局层面的控制指令u_cloud_t = f_lg(x, r, uedge{t-δt})。由于SmolVLM2推理能力有限,其输入提示被简化为一个二元问题——基于提供的视频片段判断是否有车辆正在接近自车或是否存在紧急情况,模型输出布尔响应。而云端GPT-5则被要求生成高层驾驶指令并附带简要推理以增强可解释性,其输入包括左视、前视和右视相机图像。控制提示词中明确限定了转向、加速和制动的幅度范围以保证安全可控运行,并明确禁止同时踩油门和制动等无效操作以最小化幻觉风险。提示词要求模型仅返回严格的JSON格式输出,包含转向量(-1到1)、油门量(0到1)、制动量(0到1)和简要推理说明,并规定了在无障碍直行时油门约0.35至0.6、有障碍物或红灯时油门归零且制动不小于0.5、转向角绝对值不超过0.3(除非明确转弯)等规则。
令u_edge_t为边缘模型产生的即时控制量,u_cloud_t为云端模型的全局控制量。在云端模型产生新输出的每个时间戳,最终执行的控制量通过优化边缘决策获得:当云端更新不可用时,执行边缘控制量;当云端更新到达时,执行αuedge{t-δt} + (1-α)u_cloud_t的加权融合,其中α ∈ [0,1]是平衡短时域反射性控制与长时域语义规划的权重因子。这种双时间尺度闭环设计确保在重叠时间戳上,最终控制量不是对边缘控制的重置,而是对最近边缘控制量的细化,从而在保持历史控制信号的同时融入云端模型的全局视野,保证整体控制过程的稳定性和平滑性。
研究团队在CARLA仿真器中构建了实验平台,所有模型和仿真器部署在单台NVIDIA RTX 5090 GPU上以确保实验环境的一致性。SmolVLM2作为边缘端模型在本地运行,GPT-5通过官方OpenAI API调用。自车配备四台同步RGB相机,捕获的帧同时输入给SmolVLM2执行高频二元风险查询和即时修正控制输出,而在低频时间戳上GPT-5处理相同的多模态输入和边缘模型的控制信号以生成全局层面的感知、推理和规划输出。
实验设计了两组验证,分别聚焦制动能力和转向能力。第一组实验中,自车加速至10 m/s的目标速度,测试其在15米范围内检测障碍物并执行紧急停车的能力,将GPT-5+SmolVLM2框架与仅使用GPT-5的基线配置进行对比。第二组实验在自车前方75米处设置静止车辆,考察组合系统能否在更远距离识别障碍物并及时执行规避机动以避免碰撞,并与仅使用SmolVLM2的模型进行对比。
制动测试结果以图4展示。实验记录了自车速度(m/s)、与障碍物的距离(m)、油门输入(0-1)和制动输入(0-1)随时间的变化,分别在有SmolVLM2辅助和无SmolVLM2辅助两种条件下进行对比。结果清晰表明,在没有SmolVLM2的情况下,仅靠GPT-5无法及时启动制动,最终与前方静止车辆发生碰撞。相反,当SmolVLM2集成到控制回路中后,自车更早开始减速,并在距离障碍物约5米处成功停车。这一改进归因于SmolVLM2对接近车辆的快速视觉识别能力,而仅靠GPT-5在其不足2秒的控制周期内无法检测到障碍物——在10 m/s速度下15米的距离对应的时间窗口正短于此周期。该结果直接证明了高速安全场景中边缘端快速响应模型的不可替代性。
转向实验结果如图5所示。当仅依靠SmolVLM2时,自车成功检测到前方静止车辆并执行制动操作以避免碰撞。而在GPT-5+SmolVLM2协同框架下,自车能够在更远距离识别静止障碍物并提前启动转向动作以执行规避机动。值得注意的是,由于转向启动存在轻微延迟,SmolVLM2同时识别到潜在碰撞风险并发出制动指令以维持安全距离。这次次级干预导致自车速度在避障过程中暂时降至接近零。避障机动完成后,车辆恢复加速并返回右侧车道,成功绕过障碍物且未发生接触。这一结果揭示了协同系统中一个有趣的安全冗余机制:边缘模型的保守制动干预虽然在一定程度上影响了行驶流畅性,但为云端全局规划策略的实施提供了必要的安全保障,体现了分层控制体系中“安全优先”设计原则的实际价值。
两组实验结果形成了清晰的逻辑链条:制动测试证明了边缘端快速响应模型在紧急场景下的不可替代性,转向测试则证明了云端大规模模型在长距离感知和全局路径规划方面的优势。二者结合验证了协同框架相较于任一单一模型架构的优越性。
该研究提出了一个面向自动驾驶的层次化云-边协同闭环控制框架,其中边缘模块确保快速、安全关键的响应,云端模块专注于高层驾驶策略优化。实验结果表明,所提出的云-边协同方案优于仅使用大型视觉语言模型或仅使用小型视觉语言模型的配置,验证了该框架在基于视觉语言模型感知与推理的实时自动驾驶中的有效性。
研究核心科学价值在于揭示了一个重要设计原则:在自动驾驶视觉语言模型的实际部署中,关键问题不仅是模型对多模态输入的推理能力,更在于计算任务在何处执行、何时执行。轻量级模型适合边缘设备以确保毫秒到秒级的实时安全响应,大规模模型适合云端或边缘服务器以提供高层语义推理、全局规划能力和可解释性。通过分割推理和协同智能两种互补机制,该框架为解决视觉语言模型在自动驾驶中的容量-延迟矛盾提供了一种切实可行的架构范式。
在应用价值层面,该框架展示了云-边协同与视觉语言模型相结合作为可扩展、可解释且可靠的自动驾驶架构基础的潜力,为实车部署和车路云一体化系统设计提供了参考路径。同时,该研究对边缘模型输入信息选择策略的探索——即通过固定观察角度聚焦近距道路信息——为轻量级视觉模型在驾驶场景中的高效信息利用提供了实用经验。
本研究的核心亮点包括:提出了显式的双时间尺度权限设计——高频车载风险门控负责即时安全控制,低频云端视觉语言模型以更丰富的语义细化或覆盖控制指令;在真实通信约束下实现了边缘优先反射与云端深度推理的有机统一;通过CARLA仿真验证了协同框架在安全性与规划能力上的双重优势。特别值得关注的是,转向测试中边缘模型制动干预与云端转向规划的同时触发,生动展示了分层协同架构中多时间尺度决策交互的复杂性和安全冗余价值。
然而研究也明确指出了若干局限:当前模型在处理复杂或非结构化交通场景时缺乏鲁棒性;所用的大型和小型模型均为通用视觉语言模型,未针对自动驾驶进行领域微调;评估仅限于CARLA仿真而缺乏真实道路测试。未来工作将聚焦于领域特定的微调以融入驾驶相关知识,并将框架扩展到真实世界实验和更复杂的环境中。