分享自:

BEV-OSP:鸟瞰视角下的障碍物状态预测以实现动态环境中的避障与导航

期刊:IEEE Robotics and Automation Letters

基于鸟瞰视角障碍物状态预测的深度强化学习动态环境导航框架研究报告

研究作者与发表信息

本研究由来自厦门大学航空航天学院的Zejie Jiang、Jinyang Lai以及通讯作者Yunlong Liu共同完成,其中Zejie Jiang和Jinyang Lai为同等贡献作者。该研究成果被预收录于《IEEE Robotics and Automation Letters》期刊,预印本于2026年4月被接收。研究得到了国家自然科学基金(项目号:61772438)的资助。

研究背景与研究目标

在室内导引、快递配送和仓库物流等应用中,移动机器人在充满静态与动态障碍物的非结构化动态环境中实现安全、无碰撞的自主导航,是一项核心需求。现有主流的深度强化学习(Deep Reinforcement Learning, DRL)方法,特别是端到端(End-to-End, E2E)的导航策略,虽然能直接从原始传感器数据中学习,但其“黑箱”特性使得全局规划与局部避障等子任务难以平衡,且原始数据中的任务无关信息(如纹理、颜色)会引入噪声,干扰策略学习。尽管部分研究通过引入外部目标检测框架(如YOLO)或构建鸟瞰视角(Bird‘s-Eye View, BEV)特征来改善感知,但这些方法要么高度依赖第三方工具的检测精度,要么缺乏对场景的全局感知能力,在密集动态环境中性能退化严重。

为了解决上述挑战,本研究提出了一个名为BEV-OSP(Obstacle State Prediction in Bird’s-Eye View)的高效感知框架。其核心目标是设计一种不依赖任何第三方检测模块的中间表征,有效过滤传感器噪声与静态背景,同时增强智能体对动态障碍物运动的感知与预测能力,并解决全局规划器失效时的持续导航问题,最终提升机器人在复杂动态环境中的导航成功率和效率。

研究工作流程与核心方法

BEV-OSP框架主要由三个核心模块构成:动态环境感知模块(Dynamic Environment Perception, DEP)、潜在障碍物状态预测模块(Latent Obstacle State Prediction, LOSP)和可插拔的子目标预测模块。整个导航过程被形式化为一个马尔可夫决策过程(Markov Decision Process, MDP),并采用软演员-评论家(Soft Actor-Critic, SAC)算法进行下游导航策略的学习。

1. 动态环境感知(DEP)模块与BEV-DEP表征的构建 研究的第一步是构建一个名为BEV-DEP的新型中间表征。该过程首先将深度相机图像和二维激光雷达(LiDAR)数据融合,投影为一个统一的三维点云。随后,以机器人为中心,构建一个尺寸为10×10米、分辨率为0.2米的网格地图,形成了一个50×50的占据栅格。每个栅格内填充了三个通道的信息: * BEV-高度(BEV-height):记录栅格内点云的最大Z坐标,以编码障碍物的空间几何信息。 * BEV-速度X与BEV-速度Y(BEV-vel x 和 BEV-vel y):通过将机器人的自身运动状态(速度)编码进地图,并利用旋转矩阵变换,计算每个栅格中心相对于机器人坐标系的相对速度,生成两个速度特征通道。

此模块的独特之处在于,它仅从原始传感器和机器人自身运动数据出发,不依赖YOLO等第三方检测工具,一步到位地生成了滤除纹理、光照等任务无关细节,同时显式保留了障碍物位置、几何形状和相对速度等关键空间动态信息的BEV表征。

2. 潜在障碍物状态预测(LOSP)辅助任务 为了进一步增强编码器对环境动态变化的感知能力,研究者设计了一个基于BYOL(Bootstrap Your Own Latent)自监督对比学习框架的辅助预测任务LOSP。该框架包含一个在线分支和一个动量目标分支。训练时,回放缓冲区(Replay Buffer)提供三组对齐的序列:原始观察序列、动作序列以及带标注的未来观察序列(BEV-vel*,即带有障碍物真实速度标注的速度图)。 * 在线分支:编码器 ( f\theta ) 将原始观察映射为潜在状态,然后一个基于Transformer的解码器 ( g\phi ) 结合动作序列和时序位置编码预测未来的潜在状态,最后由投影头和预测头输出预测结果 ( \tilde{y} )。 * 目标分支:使用动量编码器处理带标注的未来观察,生成目标潜在表征 ( \bar{y} ) 作为监督信号。目标分支的参数通过指数移动平均(Exponential Moving Average, EMA)方式从在线分支更新。 * 损失函数:LOSP的目标是最小化预测结果 ( \tilde{y} ) 与目标表征 ( \bar{y} ) 在潜在空间中的余弦距离,其损失函数为 ( \mathcal{L}{aux} = 1 - \frac{1}{k}\sum{i=1}^{k}\frac{\tilde{y}{t+i}}{|\tilde{y}{t+i}|2}\frac{\bar{y}{t+i}}{|\bar{y}_{t+i}|_2} )。此任务使得编码器在优化导航目标的同时,隐式地学习预测障碍物运动状态,从而提升其对环境动态的感知能力。

3. 可插拔的子目标预测模块 为解决全局规划器不可用或不可靠的情况,并克服纯黑箱E2E方法的局部最优问题,研究引入了一个可插拔的子目标预测模块。该模块以导航目的地和当前BEV观察作为输入,并利用全局规划器生成的子目标作为监督信号进行训练。它与DRL网络共享编码器,其优化损失函数 ( \mathcal{L}{pred} ) 由预测子目标与真实子目标之间的距离误差 ( \mathcal{L}{dist} ) 和方向一致性误差 ( \mathcal{L}_{angular} ) 加权求和构成。训练早期,DRL网络接收真实子目标以确保策略稳定学习;待智能体具备基本导航能力后,再切换至使用预测的子目标,从而实现了模块化的端到端导航架构。

实验设置与主要结果分析

研究团队在GAZEBO仿真环境中对提出的方法进行了详尽的评估,并在真实世界进行了部署验证。仿真训练仅在名为“大厅”(Lobby)的环境中进行,但评估则在“大厅”和一个全新的“小城”(Small City)环境中展开,后者包含丰富的建筑物和植被纹理,用于测试泛化能力。实验中设置了不同行人密度(15/35/55人),并与多种SOTA方法对比,包括DWA、TEB、DRL-VO和BEVNav。同时,设计了多个消融模型:SAC-A(移除LOSP和子目标预测模块)、SAC-B(仅用单通道BEV-高度进行感知)和SAC-E2E(直接以目标点为输入的纯端到端框架)。

1. 综合性能对比与消融实验 在“大厅”世界的对比实验中,无论行人密度如何,BEV-OSP在所有评估指标上均匹配或超越了SOTA方法。例如,在35个行人的环境下,BEV-OSP的成功率(Success Rate, SR)达到0.84,相比表现最好的DRL-VO(0.73)提升了15.07%;碰撞率(Collision Rate, CR)仅为0.16,远低于BEVNav的0.36。消融研究表明,完整BEV-OSP的性能始终优于SAC-A和SAC-B,特别是在55人的高密度场景下,BEV-OSP的SR比SAC-A高出近10%,证实了DEP与LOSP模块协同作用对提升动态环境导航性能的关键作用。此外,BEV-OSP-E2E的成功率与完整BEV-OSP相当,但路径效率(SPL)等指标较低,这验证了子目标预测模块在没有先验地图时指导探索的有效性;而SAC-E2E性能的显著下降,则凸显了子目标预测模块在全局地图信息缺失时的重要性。

2. 泛化能力与模块性能分析 在具有45个不同速度行人的“小城”全新环境泛化测试中,BEV-OSP和BEV-OSP-E2E依然表现强劲。BEV-OSP-E2E实现了0.88的SR和0.11的CR,相比DRL-VO成功率提升22.22%,碰撞率降低60.71%,有力证明了模型对不同环境的优秀泛化能力,无论是否使用全局规划器。通过对编码器输出的注意力热图进行可视化分析,可以直观看到引入LOSP后,模型对BEV地图中的关键动态区域给予了更高的关注度。定量评估显示,基于Transformer的潜在状态解码器在预测未来观察的余弦相似度上达到了平均0.8995,远高于基于GRU的结构,证明了其预测准确性。子目标预测模块的评估也表明,其预测结果与真实子目标的对齐程度高,平均距离误差仅为0.25米,角度误差为0.075弧度,且对障碍物密度变化表现出鲁棒性。

3. 真实世界部署 训练好的策略被成功部署到配备了NVIDIA Jetson Orin NX、SLAMTEC S2L激光雷达和Intel RealSense D435i深度相机的Scout Mini机器人上。在真实环境测试中,系统仅使用轻量级的hector_mapping和AMCL进行建图与定位。混合规划器能在全局规划器失效时动态切换至子目标预测模块,充分展示了框架在非结构化真实环境中的适应性和可靠性。

研究结论、价值与创新点

本研究提出的BEV-OSP框架,创新性地融合了BEV动态环境感知与潜在空间障碍物状态预测,为移动机器人在动态环境下的导航提供了一种高效、鲁棒的解决方案。其主要意义与价值体现在: * 科学价值:提出了一种新颖的BEV-DEP中间表征生成方法,无需外部检测器即可有效融合多传感器信息,过滤任务无关噪声。更重要的是,引入BYOL式对比学习辅助任务来预测潜在障碍物状态,为增强DRL编码器的环境动态感知能力提供了新范式。 * 应用价值:设计了一个可插拔的子目标预测模块,形成了模块化端到端架构,使得机器人在无先验地图或全局规划器失效时仍能自主导航,显著提升了系统的实际部署可靠性与适应性。该方法在仿真和真实环境中的优越性能,为其在室内导引、物流配送等领域的实际应用奠定了坚实基础。

本研究的核心亮点可总结为:其一,创造性地构建了融合深度图像、激光雷达和自身运动状态的BEV-DEP表征,从源头上优化了动态环境的感知;其二,巧妙设计LOSP自监督辅助任务,使智能体能够“预测”障碍物动态,而不仅仅是“感知”当前状态;其三,提出了可灵活插拔的子目标预测模块,解耦了全局规划与局部避障,提供了一种更为灵活和强大的导航框架。该框架未来有望扩展至多机器人协同导航任务中。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com