分享自:

AdaDrive:面向语言引导自动驾驶的自适应快慢系统

期刊:IEEE/CVF International Conference on Computer Vision (ICCV)DOI:10.1109/iccv51701.2025.00486

AdaDrive:面向语言引导自动驾驶的自适应快慢系统

主要作者与研究机构

本文的主要作者包括Ruifei Zhang、Junlin Xie、Wei Zhang、Weikai Chen、Xiao Tan、Xiang Wan和Guanbin Li。其中,Ruifei Zhang和Junlin Xie来自香港中文大学(深圳)(The Chinese University of Hong Kong, Shenzhen)与深圳市大数据研究院(Shenzhen Research Institute of Big Data),Guanbin Li来自中山大学(Sun Yat-sen University)与广东省大数据分析与处理重点实验室(Guangdong Key Laboratory of Big Data Analysis and Processing),Wei Zhang和Xiao Tan来自百度公司(Baidu Inc.)。该研究发表于2025年IEEE/CVF国际计算机视觉大会(ICCV),论文标题为《AdaDrive: Self-Adaptive Slow-Fast System for Language-Grounded Autonomous Driving》。

学术背景

自动驾驶长期以来是学术界和工业界的研究热点。近年来,随着大语言模型(Large Language Models, LLMs)及多模态大语言模型(Multimodal Large Language Models, MLLMs)的兴起,研究者开始将LLMs引入自动驾驶系统,以增强车辆的认知推理与决策能力。早期方法如LMDrive和AD-H采用同步且高度耦合的顺序架构,LLM在每一个驾驶步骤中持续参与决策过程。尽管这些方法提升了驾驶智能性,但带来了巨大的内存开销和推理延迟,在高速动态环境中难以实现实时部署。后续研究如AsyncDriver和DriveVLM探索了异步策略,以预定义的时间间隔激活LLM,以平衡性能与效率。然而,这种固定调度严重限制了模型的适应性,因为在不同驾驶场景中,对LLM干预的需求差异很大:在安全关键场景中,LLM可能无法在最需要时被调用;而在简单场景中激活LLM则可能造成计算资源的浪费。

针对上述问题,本文提出了AdaDrive,一个自适应的协作式快慢(slow-fast)框架,旨在最优地决定LLM何时参与决策以及如何参与决策。具体而言,AdaDrive致力于实现两个目标:第一,动态决定何时激活LLM,确保LLM仅在对其有益的场景中做出贡献,避免不必要的计算开销;第二,自适应地控制LLM的影响程度,因为研究发现二元开关式激活并以全权重(如1.0)并不总是最优,连续的按比例缩放集成(如0.7的权重)往往能取得更好的效果。

详细工作流程

AdaDrive的系统架构由通用多模态特征提取和并行的快慢两条路径组成,两条路径通过所提出的Connector-W和Connector-H组件自适应集成,分别决定何时激活LLM以及如何将LLM集成到轨迹预测中。

第一,多模态特征提取。对于给定的流式视频片段序列,每个帧数据包含多视角相机图像和点云数据。系统采用预训练的视觉编码器(Visual Encoder)提取并融合每一帧的多模态视觉特征,构建特征序列。随后,长短Q-Former(Long-Short Q-Former, LS-QFormer)进一步聚合特征令牌,同时考虑长程和当前帧信息。

第二,快手路径的轨迹预测。轻量级规划器(Planner)以高频在每一个时间戳激活,仅依赖当前帧特征生成航点(Waypoints)预测。该规划器采用4层Transformer架构,参数规模约为300万。

第三,慢手路径的逻辑推理。与规划器不同,LLM被赋予访问长程上下文信息的能力,以充分利用其指令理解和推理能力。为了防止内存使用和计算复杂性的无界增长,系统在特征序列之上维护一个流式内存缓冲区(Streaming Memory Buffer),该缓冲区保持固定容量k,存储最近k帧的特征。LLM处理这k帧上下文信息,输出当前时间戳的集成特征。

第四,自适应连接器(Adaptive Connector)。Connector-W负责确定自适应的LLM激活。给定由LS-QFormer提取的当前驾驶上下文特征,系统通过MLP函数预测一个置信度分数θt,该分数决定LLM的激活。连续的概率分布θt通过Gumbel-Softmax重参数化转换为离散的二元决策πt∈{0,1},从而保证端到端的可微性。由于缺乏用于最优激活时机的黄金标准或真值监督信号,本文提出了一种新颖的基于比较学习的自适应激活损失(Adaptive Activation Loss)。在训练阶段,系统执行两次轨迹预测的前向传递:一次有LLM辅助产生wllm_t,一次无LLM辅助产生wt。然后分别计算两个预测的轨迹损失(L1损失)。在预热阶段两者损失收敛到稳定值后,其比较差异反映了当前时间步LLM对轨迹预测的贡献大小。通过将二元决策πt与轨迹损失关联,构造自适应激活损失:当有LLM辅助的损失更低时,优化目标自然促使πt=1,反之则为0。此外,为在性能增益与计算开销之间取得最佳平衡,系统在LLM辅助轨迹损失中引入惩罚项γ,确保仅当LLM辅助损失显著低于无LLM损失一定边际d时才激活LLM。Connector-H则负责动态缩放LLM的贡献程度。它利用预测的置信度分数θt作为融合系数,对特征进行加权集成,生成第三个轨迹预测wfuse_t = p(f’_t + θt * f”_t)。该预测的轨迹损失引导模型学习最优的贡献缩放。在推理阶段,Connector-W预测置信度分数θt和对应的二元决策πt。若LLM被激活,Connector-H利用θt作为动态权重系数,调制LLM特征f”_t对基础特征f’_t的贡献。

第五,长短特征建模。传统Q-Former作为连接视觉编码器和LLM的通用连接件,独立处理每一帧而忽略了长程时序信息。本文提出的LS-QFormer受群组机制启发,将可学习令牌划分为两组:qm传播到下一帧以聚合长程信息,ql则类似于传统Q-Former关注当前帧。通过此机制,LS-QFormer同时提取当前帧的关键特征并建模时序特征演化。

第六,流式内存缓冲区。为管理历史驾驶数据,本文提出固定大小的流式内存缓冲区与传播式记忆融合(Propagative Memory Fusion, PMF)策略。与先进先出(FIFO)策略相比,PMF通过将待逐出帧的特征合并到其前一帧中,在保持紧凑缓冲区的同时实现信息的前向传播,保留了关键历史上下文。

在实验设置方面,研究使用LangAuto数据集进行训练,该数据集包含64k条指令遵循序列,每条序列包含同步的多视角相机图像和激光雷达点云。模型采用预训练的视觉编码器(保持冻结),语言模型采用TinyLlama(11亿参数),规划器采用4层Transformer。LS-QFormer采用20个可学习令牌和20个记忆令牌,流式内存缓冲区容量k设为10。训练使用AdamW优化器和余弦学习率调度器,初始学习率为1×10^-5,训练15个轮次,自适应激活损失中的边际d设为0.3。

主要研究结果

在封闭环路驾驶性能方面,AdaDrive在LangAuto-Tiny、LangAuto-Short和LangAuto三个基准上均表现出优于现有方法的性能。在LangAuto-Tiny上,AdaDrive的驾驶得分(Driving Score, DS)达到80.9%,路线完成率(Route Completion, RC)为87.6%,违规得分(Infraction Score, IS)为0.90,相比第二好的方法AD-H分别高出12.9%和13.2%。在LangAuto-Short上,AdaDrive同样以70.6%的DS显著超越AD-H的54.3%。在完整的LangAuto基准上,AdaDrive以42.9%的DS优于AD-H的41.1%,同时内存占用从LMDrive的26.91GB大幅降至6.79GB,推理时间也从526ms降至189ms。

消融实验结果如表3所示。从基线(使用原始Q-Former和规划器,无连接器)的DS为67.4%开始,替换为LS-QFormer后DS提升至71.9%,验证了LS-QFormer有效捕捉时序依赖的能力。进一步通过Connector-W集成LLM后,DS提升至77.9%。最后加入Connector-H控制的动态LLM贡献缩放策略后,DS达到80.9%。在特征建模方法的对比中(表4),LS-QFormer以80.9%的DS优于Q-Former(75.8%)、SeqQ-Former(77.6%)和Q-Former加性累积(77.4%),证明了分组机制融合长程历史信息与当前帧内容的有效性。

对自适应协作机制的分析(图5)表明,更高的固定激活频率通常带来更稳定鲁棒的驾驶性能,但AdaDrive的自适应激活机制以平均仅0.28的激活频率,达到了与连续激活(频率=1.0)相当的性能。与频率为0.25的固定间隔方案相比,AdaDrive在GFLOPs减少62%的同时,DS提高了5.6%。LLM激活频率的分布分析(图6)显示,激活频率范围在0.1至0.5之间,在LangAuto-Short和LangAuto上的平均激活率分别为0.28和0.33。在具有挑战性的路线(如密集城市街道、夜间条件或山路)上观察到更高的激活频率。时间分布分析(图7)表明,LLM激活主要集中在复杂操作(如转向和穿越路口)期间,而在常规巡航阶段保持休眠。

结论与价值

AdaDrive探索了LLM驱动的语言引导自动驾驶,聚焦于两个根本问题:LLM的最优激活时机和有效利用策略。该框架采用自适应快慢架构,根据驾驶情况自适应调度LLM激活,同时基于预测置信度分数动态调制其贡献权重。这一策略显著提升了模型的灵活性和鲁棒性,同时保持可控的计算开销。此外,研究引入了定制的LS-QFormer用于有效的历史上下文聚合,以及带传播式记忆融合策略的流式内存缓冲区用于高效管理无界时序数据。大量实验表明,该方法在有效性和效率方面均显著优于现有方法,验证了其在实际应用中的潜力。其科学价值在于提出了一种新的LLM与自动驾驶系统协作范式,从“是否激活”和“贡献多少”两个维度实现了精细化的自适应控制;应用价值则体现在显著降低的内存占用和推理延迟,使得LLM增强的自动驾驶系统更接近实时部署的现实需求。

研究亮点

本研究的亮点主要体现在以下三个方面。第一,提出了首个面向LLM增强自动驾驶的自适应快慢架构,实现了基于实时驾驶上下文的动态LLM激活,突破了固定频率激活的限制。第二,新颖的自适应集成机制同时解决了“何时激活”和“贡献多少”两个问题:通过比较学习机制自动学习最优激活时机,通过置信度驱动的融合策略实现LLM贡献的连续缩放。第三,LS-QFormer和PMF机制的引入有效增强了时序特征聚合能力,在保持紧凑内存表示的同时保留了关键历史信息。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com