本文介绍了一项将昆虫路径整合与目标导向导航行为进行神经计算建模的原创性研究。该研究由Dennis Goldschmidt、Poramate Manoonpong和Sakyasingha Dasgupta完成,分别来自德国哥廷根大学伯恩斯坦计算神经科学中心、葡萄牙尚帕利莫未知科学研究中心、丹麦南丹麦大学具身人工智能与神经机器人实验室、日本IBM研究院及日本理化学研究所脑科学中心。该论文于2017年4月12日发表在期刊《Frontiers in Neurorobotics》上,标题为《A Neurocomputational Model of Goal-Directed Navigation in Insect-Inspired Artificial Agents》。
该研究所处的学术领域为神经机器人与计算神经科学,核心关注社会性昆虫高效导航行为背后的神经计算机制。沙漠蚂蚁和蜜蜂等社会性昆虫虽然脑部极小,却能在复杂环境中进行长距离觅食并准确返回巢穴。它们依赖一种被称为路径整合(path integration, PI)的过程,对指南针线索和里程计线索进行连续积分,从而持续估计自身相对于巢穴的位置,这个位置以“归巢向量”(home vector, HV)的形式表示。此外,它们还可基于路径整合状态学习与食物位置相关的“全局向量”(global vector, GV)记忆。已有计算模型虽然能复现部分行为,但缺乏在神经层面解释向量表征如何获得、存储和提取的统一框架。本研究的目标正是提出一个模块化闭环控制模型,将路径整合、奖赏调节学习、随机搜索与动作选择整合在一起,以解释昆虫式目标导向导航的神经基础,并在仿真智能体中验证其有效性。
该模型的实现由四个功能模块构成。第一模块为神经路径整合机制,采用多层神经网络的圆形阵列表示向量方向与长度。其输入包括罗盘传感器提供的方向角φ和里程计提供的速度信号s,且φ和s分别处于[0, 2π)和[0, 1]区间。第一层为头朝向(head direction, HD)层,以余弦响应函数对方向进行群体编码,神经元数量n设为18,每个神经元的偏好方向均匀分布于整圆。第二层为门控层,将速度信号s加性地调制到头朝向活动上,通过f(x)=max(0, x)的非线性限制激活。第三层为记忆层,通过自循环突触对经速度调制的头朝向信号进行时间累积,其泄漏率λ控制积分衰减程度。第四层为解码层,使用余弦权重核将记忆层活动映射为路径整合状态,形成单一活动峰值,该峰值在阵列中的位置表示归巢向量角度θhv,其幅值表示向量长度lhv。归巢信号通过正弦补偿生成:mhv = lhv·sin(θhv − φ − π)。模型的第二个模块为全局向量的奖赏调节学习规则。学习电路包含一个上下文依赖单元σ(出巢时为1,返巢时为0)、一组可塑突触wgv和代表全局向量的圆形阵列。学习规则为Δwgv_i = μgv·r(t)·σ(t)·(xpi_i(t) − xgv_i(t)),其中μgv=2为学习率,r(t)为食物奖赏信号,定义为r(t)=max(0, 1−5d(t)),d(t)为智能体与喂食器之间的距离。该规则本质上为异突触的奖赏调节delta规则,只有在出巢状态下且获得食物奖赏时,可塑权重才会朝当前路径整合状态收敛,从而将瞬时位置信息固化为长期向量记忆。第三模块为随机搜索,建模为相关高斯随机游走,其探索率ε(t)=σ(t)·exp(−β(t)·v(t)),其中v(t)为对历史食物奖赏的低通滤波信号。β参数通过学习规则Δβ=μβ[1/(βΔt)+μv·v(t)·ε(t)]自适应调整,实现对探索-利用平衡的调节。第四模块为动作选择机制,最终马达指令为Θ=(1−ε)(σ·mgv+mhv)+mε,其中mgv=l_gv·sin(θgv−φ),表示沿全局向量前进的转向信号。出巢时行为由全局向量引导与随机搜索共同决定,返巢时则完全由归巢信号驱动。
在仿真实验中,作者对该模型进行了多方面的验证。在路径整合噪声鲁棒性实验中,智能体以随机觅食路径外出,在1000秒后切换到返巢状态,仅依据路径整合机制回巢,实验重复1000次,平均每轮的随机觅食距离为9.3±5.0米,巢穴成功半径为0.2米。结果显示,在5%的感觉噪声水平下,平均位置误差约为0.35米,在10%噪声下约为1.16米;而在5%噪声水平下若将觅食距离限制在5±3米,误差降至约0.07米。对不相关噪声的测试也显示出相似的鲁棒性趋势。在神经元数量对精度的影响实验中,当每层神经元数从6增加到18时,位置误差显著下降,但超过18之后误差变化很小,在16到32之间进入平台期。该平台区间恰好对应昆虫中央复合体(central complex)椭球体(ellipsoid body)中功能性柱状结构的数量,提示神经系统可能采用该数量以实现精度与代谢成本的最优权衡。在系统误差复现实验中,模型通过调节记忆层泄漏率λ,拟合了Müller和Wehner(1988)对沙漠蚂蚁L形路径归巢系统偏差的经典行为学数据,最优λ≈0.0075,表明泄漏积分机制可以解释动物路径整合中的系统性角度误差。表1将本模型与Haferlach等人(2007)、Kim和Lee(2011)的模型及Cataglyphis fortis蚂蚁的行为数据进行比较,显示本模型在嘈杂环境下依然具有相当的精度优势。
在全局向量学习与目标导向导航实验中,作者首先在单一喂食器条件下测试了模型的学习性能。喂食器位于距巢10米、角度90°的位置,智能体初始时以随机搜索为主,第1次试验(trial)因未找到食物而直接返巢,第2次试验找到喂食器后,通过奖赏调节学习规则快速习得全局向量的突触权重分布,其估计角度在后续试验中稳定在90°附近。随着每次试验中奖赏信号的不断积累,探索率ε持续下降,最终使智能体在最后几次试验中沿接近直线的路径到达喂食器。作者进一步在100个随机生成的多喂食器环境中进行了100次学习循环的统计实验,每个环境中以均匀分布随机放置50个喂食器,距离范围为1到40米。结果显示,在1000秒觅食时间条件下,平均归巢成功率始终为1,而平均目标成功率在约20次试验后收敛至1,学习过程稳定。当觅食时间从200秒增加到1000秒时,目标成功率逐渐逼近1且方差减小,但习得全局向量距离与最近喂食器距离的比值却随觅食时间增加而下降,表明存在收敛速度与奖赏最大化之间的权衡。这种权衡与沙漠蚂蚁野外觅食时间随经验增加而渐增并最终饱和的现象一致。
本研究的核心结论是,基于群体编码的神经路径整合与奖赏调节联想学习相结合,可赋予人工智能体在嘈杂环境中进行鲁棒、高效的目标导向导航能力,并能复现昆虫行为学中的关键特征。其科学价值在于首次将路径整合、向量记忆的获取与提取整合到统一神经计算框架中,为理解昆虫中央复合体在空间导航中的功能提供了可直接检验的假设。模型预测全局向量可能以群体编码形式存储于中央复合体的柱状结构中,且16–32个功能柱是兼顾精度与成本的最优方案。其应用价值在于为自主机器人的长距离导航提供了无需全局地图的轻量级解决方案,尤其适合资源受限的微型机器人平台。该研究将行为学观察与神经机制建模紧密结合,为后续行为学和神经生物学实验提供了明确的方向性预测。