本研究题为《Dare to Navigate: Spatiotemporal Dynamic Augmented Lidar Encoder for Obstacle Detection and Avoidance in Crowded Environments》,由厦门大学航空航天学院的Jinyang Lai、Zejie Jiang和Yunlong Liu(通讯作者)共同完成,其中Jinyang Lai与Zejie Jiang为同等贡献作者。该论文发表于2026年2月出版的IEEE Robotics and Automation Letters期刊第11卷第2期(页码1930-1937),并于2025年12月17日在线发表。研究受到中国国家自然科学基金(项目号61772438)的资助。
在移动机器人广泛应用的前景中,如何利用低成本传感器和轻量级控制器在同时存在静态障碍物和密集行人流的动态环境中安全导航,一直是一个核心挑战。其中,仅凭传感器读数来定位和跟踪动态障碍物,是制约系统性能的关键瓶颈。
2D激光雷达(LiDAR)因其成本低廉且仿真到现实(Sim2Real)的迁移差距较小,成为移动机器人感知的重要选择。然而,2D激光雷达的固有局限在于:单帧激光雷达扫描数据仅包含轮廓信息(如行人腿部轮廓或箱体轮廓),难以区分动态与静态障碍物;即使利用连续扫描序列,由于机器人自身运动导致的视角偏移,也可能使静态物体表现出动态特征。现有方法主要依赖手工设计的动态表征或状态特征,如占用体素(occupancy voxels)、占用网格地图(occupancy grid maps)以及基于聚类的时间累积群描述符(temporal accumulation group descriptor)等。这些方法虽然能在预设条件下表现良好,却引入了额外的处理阶段,增加了误差传播风险,可能在非标准场景中丢失关键的导航信息,并恶化仿真到现实的迁移性能。此外,在实际部署时,此类框架给资源受限的机器人平台带来了显著的计算负担。
为解决上述问题,作者提出了动态增强激光雷达编码器(Dynamic Augmented Lidar Encoder,简称DARE),一个仅基于2D激光雷达的轻量级编码器架构,具备时空表征能力,能够便捷地集成到现有的强化学习框架中,用于增强动态障碍物的感知与避障决策。
研究将导航任务建模为无模型的强化学习问题,包含连续状态空间S和连续动作空间A。在每个时间步t,机器人处于状态st,从环境接收观测ot,并根据策略π执行动作at,环境随之转移到下一状态st+1,同时产生奖励rt。强化学习的目标是寻找最优策略π*以最大化期望累积奖励。
观测空间由两部分组成:ob为策略函数和价值函数的输入,包括当前360个扫描点的2D激光雷达测量值ct、目标路径点数据op以及上一时间步的指令速度ov(使用模型输出的at-1而非真实速度测量值,以缩小仿真到现实差距);oe为DARE编码器的输入,由当前和前一时刻经过处理的激光雷达读数{ĉt, ĉt-1}组成。动作空间由连续的线速度和角速度(v, w)构成,其中v∈[0,1] m/s,w∈[-1,1] rad/s。
DARE模块的核心设计理念在于从连续两帧激光雷达扫描中高效提取动态信息。其工作流程如下:
预处理阶段:首先对前一帧扫描ct-1执行迭代最近点(Iterative Closest Point,ICP)配准。这一操作使得静态物体在配准后保持相对静止,而动态物体因其自身运动而呈现显著差异。随后,对ICP配准后的数据应用最小池化操作,将维度从360降至60,以平衡性能与网络复杂度,同时缓解ICP过程可能产生的角度偏差,并保留离机器人最近障碍物的信息。
差分网络架构:DARE的主编码器f(o)采用孪生式差分网络架构。两个激光雷达输入首先通过共享参数的全连接层投影到共享的潜在空间,以缓解ICP配准带来的角度偏差并提供抽象的语义和结构信息;然后对投影后的输入进行差分操作,生成动态增强嵌入zo,着重刻画障碍物运动所引起的变化。这种设计使网络能够从潜在空间中的残差差异中显式捕获动态信息,并为后续的时空表征学习提供信息丰富且可微的中间表示。
梯度解耦与在线更新:值得注意的是,DARE模块不接受来自强化学习任务的梯度,以避免潜在的梯度干扰。它通过独立的时空表征学习任务进行训练,并在训练过程中在线更新,为强化学习流程提供任务相关的动态信息补充。训练过程中引入层归一化(Layer Normalization)以减轻差分操作的影响,并稳定嵌入表示的变化对策略训练的潜在冲击。
为增强对空间关系的理解,特别是在获取行人位置和邻近信息方面,研究引入了空间风险预测(Spatial Risk Prediction,SRP)这一监督学习任务。具体实现方式为:将机器人周围空间划分为nr=12个角度扇区,在每个扇区i中,空间风险定义为与机器人距离的函数。当最近行人距离dih大于最大考虑距离dmax=5.0m时风险为零;否则风险值随距离减小而加速增长,函数形式为min(e^0.5(dmin-dih), 1),其中dmin=0.35m为机器人碰撞半径。空间风险预测器h(z)将zo投影到预测空间,通过最小化预测值与仿真环境提供的真值之间的均方误差进行优化。
时间信息(如行人速度和轨迹)对于动态环境中的避障决策至关重要。为隐式捕获此类时间信息并实现有预见性的导航,研究采用了基于状态转移过程的前向动态预测方法。具体而言,状态-动作预测器g(z, a)以当前动作和zo为输入,生成对下一时间步的预测嵌入zto,a。该预测嵌入同时被纳入强化学习框架中。预测器与主编码器通过预测嵌入与实际下一嵌入之间的均方误差进行联合训练。为鼓励编码器学习与任务相关的表征,还对zto,a执行一步奖励预测,使用奖励解码器r(z)输出预测奖励,并与真实奖励rt+1计算均方误差。DARE的总损失函数为三项损失之和:Ldare = Lpred + Lreward + Lsrp。
奖励函数由四项组成:碰撞相关惩罚rct,根据机器人与障碍物的最小距离db设计,碰撞时给予大额负奖励,安全距离内按距离线性惩罚;目标达成奖励rgt,根据到达目标的距离变化或成功/超时与否给予奖励;线速度惩罚rvt,鼓励机器人在安全区域维持高于vmin=0.5 m/s的速度;轨迹平滑奖励rwt,在安全区域惩罚过大的角速度。
框架基于软演员-评论家(Soft Actor-Critic,SAC)算法构建。DARE中的四个网络均采用全连接层实现,隐藏层维度分别为f(o)和g(z,a)的{128,128,64}、h(z)的{128,12}以及r(z)的{128,1},激活函数采用ELU。为缓解DARE在线更新带来的训练不稳定性,维护一个其移动平均副本(固定编码器)为演员和评论家网络提供稳定输出;目标评论家网络则使用固定编码器的另一个移动平均版本(目标固定编码器)。演员网络将ct和{op, ov}分别编码后与zo拼接,经全连接层输出高斯动作分布的均值和方差。评论家网络接收zo和zto,a,由两个独立的Q网络构成。
训练在Gazebo仿真环境中结合Pedsim库进行,该库基于社会力模型仿真行人行为,行人速度设定为1.2 m/s。机器人仅配备360线2D激光雷达获取障碍物距离信息。训练使用四个16m×16m的室内动态导航环境:走廊、交叉口、办公室和教室,各环境中布置不同数量的行人和随机放置的箱体。机器人随机选择场景和起始终点对,起始距离初始化为[3,6]m,当成功率超过75%后递增至[6,9]m。推理与控制时间步长δt=0.2s,所有参数采用Adam优化器以3×10^-4学习率优化,批次大小为128,回放缓冲区容量为100,000,训练总环境步数为150,000。
评估阶段除四个训练环境外,还引入了一个未参与训练的复杂大厅世界环境(Lobby World),分别设置15、25和35个行人进行泛化性能测试。对比基线包括:TAGD(基于时间累积群描述符和注意力机制的方法)、DRL-based(利用三帧连续激光雷达扫描和1D卷积网络的方法)、PAS(基于占用网格地图和行人检测模块的方法)以及传统方法TEB规划器。
在E1-E4训练环境的评估中(每环境100回合),DARE在成功率和路径最优性方面均一致优于所有基线方法。更重要的是,在未参与训练的大厅世界环境中,DARE在不同行人密度(15、25、35人)的设置下均保持了较高的成功率和导航效率,展现出优越的鲁棒性和泛化能力。
相比于依赖手工激光雷达特征提取的TAGD或外部行人检测模块的PAS,DARE的表示学习框架提供了更轻量级和灵活的解决方案,能更好地适应多样化的导航场景,这凸显了表示学习在捕获动态信息方面的能力。与简单堆叠历史激光雷达扫描作为额外输入通道的DRL-based方法的对比表明,时间表征无法通过直接的多帧堆叠充分捕获,而DARE将表示学习与ICP配准技术相结合,有效提取了连续激光雷达扫描中的时空信息,同时减轻了输入中不相关干扰的影响。
为明确各组件的贡献,研究设计了三种消融模型:A1移除了时间动态预测模块,仅使用空间风险预测目标训练主编码器;A2移除了空间风险预测模块,仅使用时间动态预测目标;A3为不含DARE的原始强化学习框架。结果表明,移除任一模块均导致各指标性能下降,尤其在未训练的大厅世界环境中退步明显,验证了各模块对最终性能的重要性。值得注意的是,A1模型倾向于快速到达目标,在拥挤环境中常不愿等待或绕行行人,故其在成功轨迹中导航时间较低。
梯度解耦的影响:非解耦版本(DARE w/ grad,价值函数梯度传播至DARE模块)虽能加速早期学习,但后期表现较差,支持了过度辅助任务可能阻碍收敛到最优策略的观点,从实证上确认了梯度解耦通过实现更稳定有效的学习过程来增强收敛质量的假设。
冻结训练的影响:在不同训练步数(37,500、75,000、112,500)冻结编码器的模型在大厅世界(35行人)的评估中均未能超越完整模型,表明随着DARE编码器产生的表示不断演化,可以学习到更稳定且与任务相关的表征,从而改善强化学习策略的性能。
缓冲区大小与网络结构的选择:缓冲区容量100,000在样本新鲜度和训练效率之间取得平衡。直接拼接当前与先前激光雷达观测的隐藏状态的备选网络设计表现不如所提出的差分编码结构,证实了差分设计的有效性。
在推理速度方面,研究记录了TAGD、PAS和DARE从原始2D激光雷达读数生成观测以及从观测到动作的推理所需时间(10回合平均值)。结果显示,ICP配准等预处理步骤并未显著减慢推理速度;实际上,DARE相比手工特征方法实现了速度提升。在真实机器人上的部署评估表明,ICP配准平均耗时为13ms,足以支持超过20Hz的实时推理;结合2D激光雷达的扫描速率,实际推理频率设定为15Hz。
训练好的控制器被迁移部署到配备Slamtec S2L 2D激光雷达和NVIDIA Jetson Orin NX平台的Scout Mini机器人上。在走廊和交叉口等真实场景中,机器人能够检测并平滑避让移动行人,并在拥挤的静态箱体间导航。在走廊中,机器人成功绕行从前方和后方的来行人并无碰撞地进入目标房间。在交叉口场景中(如图1所示),当行人出现在即将到达的交叉口时,机器人执行恰当的避让机动并保持稳定的轨迹。
本研究提出了一个仅基于2D激光雷达并具备时空表征的轻量级编码器架构DARE,用于拥挤动态环境中的导航。该方法引入了与强化学习任务解耦的在线编码器模块,实现了空间风险预测和时间动态预测的整合。广泛的实验表明,该方法优于当前最先进的基线方法,详尽的消融研究验证了各模块的贡献。最终,该方法被成功部署到真实世界场景中。
从科学价值来看,本研究提出了一种新颖的时空表征学习范式,通过梯度解耦机制解决了表示学习与强化学习联合训练中的梯度干扰问题,丰富了机器人感知与控制交叉领域的理论体系。所设计的孪生式差分网络架构为实现从连续激光雷达数据中高效提取动态信息提供了新的思路。从应用价值来看,DARE的轻量级设计使其特别适用于资源受限的移动机器人平台,仅依赖低成本的2D激光雷达即可实现鲁棒的动态避障导航,为移动机器人在服务、物流、巡检等领域的广泛应用提供了重要的技术支撑。
本研究的亮点主要体现在以下几个方面:第一,提出了一种与强化学习解耦的动态增强组件,可作为即插即用模块集成到现有基于2D激光雷达的导航算法中,而不干扰原有训练流程。第二,创新性地将空间风险预测和时间动态预测相结合,通过监督和无监督混合的表示学习方式,使编码器能同时获取空间位置风险和时序状态转移的双重信息。第三,所采用的孪生式差分架构和在线更新的编码器设计,在保持网络简洁的同时实现了对行人动态信息的有效捕获与表征。第四,在多个公开基准上的系统实验充分验证了方法的有效性和泛化能力,并成功展示了从仿真到真实世界的无缝迁移。