本文属于类型a,即单项原创研究报告。以下是根据文档内容撰写的学术报告。
一、作者、机构与发表信息
本文的主要作者为Xian He、Shuai Zhang、Jian Chu、Tongyu Jia、Lantao Yu与Bo Ouyang。其中,Xian He和Shuai Zhang为共同第一作者,Bo Ouyang为通讯作者。Xian He、Shuai Zhang、Jian Chu和Bo Ouyang来自合肥工业大学管理学院及过程优化与智能决策教育部重点实验室;Tongyu Jia来自中国人民解放军总医院第三医学中心泌尿外科;Lantao Yu为美国加州圣何塞的独立研究者。该论文发表于Cyborg and Bionic Systems期刊,2025年4月14日在线出版,文献DOI为https://doi.org/10.34133/cbsystems.0114。
二、研究背景与目的
本研究属于自主机器人手术与软组织操控交叉领域。术中软组织操控是自主机器人手术中的一个关键挑战。与传统衣物或绳状可变形物体不同,软组织在体内环境中受到筋膜、周围器官及手术器械等多种约束,这些约束可能因牵拉和切割操作而发生变化。此外,手术过程中还需要避开周围组织或器械。既往研究通常假设抓取点已知、目标变形可实现,并假定软组织约束在手术过程中保持恒定且周围无障碍物。然而,这些假设在实际手术场景中往往不成立。
为了解决上述问题,作者提出了一种基于Soft Actor-Critic(SAC)算法的直觉引导深度强化学习框架,命名为ID-SAC。该框架旨在应对未知约束条件下的软组织操控。与既往方法不同,ID-SAC不依赖示范数据初始化策略,而是将一种直觉操控(Intuitive Manipulation,IM)策略与SAC网络相结合,并引入一个调节因子作为智能体的动作之一,用于协调直觉模式与深思模式之间的权重分配。此外,作者还提出了一种自主抓取点选择神经网络,用于避免选择不切实际的抓取点,确保抓取点能够到达目标位置,同时避开病灶区域和受限区域。
三、研究流程与实验设计
本研究主要包括两个核心步骤:抓取点选择与评估,以及基于强化学习的融合操控策略。
第一步是抓取点选择与评估。作者将初始抓取点选择问题建模为上下文赌博机(Contextual Bandit)问题,并采用深度Q网络(Deep Q-Network,DQN)学习抓取策略。网络输入为高维状态,输出为每个候选抓取点的动作值。抓取点对应最大动作值的点被选为初始抓取点。同时,研究者设计了一个抓取点质量评估网络,该网络基于多层感知机(Multilayer Perceptron,MLP)结构,输入包括抓取点位置、软组织上的特征点位置和目标点位置,输出为0到1之间的成功率。在测试过程中,若成功率低于0.8,则触发抓取点重新选择。
为了评估抓取点的质量,作者定义了四个指标:rd衡量特征点与目标点之间误差的变化;rg评估抓取点与反馈点之间的应变;rg0约束初始抓取点不应距离反馈点过远;rt评估操作回合的长度。此外,还引入了一个安全约束指标zs,用于在软组织过度变形时终止操作任务。
第二步是基于深度强化学习的融合操控策略。状态s(t)由反馈点、目标点、抓取点、障碍物以及恒定位置约束组成。动作at被设置为抓取器的三维运动。框架包含两种思维模式:直觉模式和深思模式。直觉模式采用简单的比例控制策略,即根据目标点与特征点的位置差直接生成运动指令。深思模式则使用SAC算法训练操控策略。为了实现两种模式的协调,作者将调节因子λ(t)设计为动作的一部分,最终抓取器运动由两种模式加权求和得到。
奖励函数设计方面,当特征点到达目标区域时,智能体获得正奖励ra;当抓取器超出边界时,获得惩罚rb;在其余情况下,智能体根据特征点与目标点之间的距离获得负奖励。对于多目标点任务(如基于曲线或区域的变形),奖励信号采用所有特征点中误差最大者进行计算。
实验在基于仿真开放框架架构(Simulation Open Framework Architecture,SOFA)的人体肝脏模型上进行。实验设置了四种场景:无障碍物且无未知动态干扰(NOND)、无障碍物但有未知动态干扰(NOWD)、有障碍物但无未知动态干扰(WOND)、以及有障碍物且有未知动态干扰(WOWD)。所有网络均为包含两个隐藏层的MLP,每个隐藏层包含256个单元,使用ReLU激活函数和Adam优化器进行训练,学习率为0.001,折扣因子为0.99,批量大小为64。实验还定义了训练速度和任务完成时间等评估指标。
四、主要结果
在抓取点选择与评估方面,实验结果表明,并非肝脏模型上的所有可抓取点都能成功完成操控任务。作者提出的算法能够识别出具有高奖励值和高成功率的抓取点。以第137个抓取点和第67个抓取点为例,它们分别位于目标点不可达的位置或肝脏后方,因此成功率较低。而第14、第15和第17个抓取点则符合医生抓取直觉,表现出更高的成功率。在存在未知动态约束的NOWD任务中,智能体同样能够选择合适的抓取点完成操控任务。此外,当存在类似肿瘤区域的不可抓取区域时,即使最优抓取点位于该区域内,智能体也能够在该区域之外找到具有高奖励值和高成功率的替代抓取点。
在自主软组织操控方面,ID-SAC算法在四种场景下均能成功完成基于位置的变形操控任务。在存在障碍物的WOND和WOWD场景中,智能体能够有效避开障碍物并到达目标点。在有未知动态干扰的情况下,智能体依然能够成功避开障碍物。训练过程中的平均奖励曲线显示,随着训练的进行,所有任务的平均奖励逐渐稳定,表明算法在四种场景中均收敛。
与SAC算法的对比结果表明,ID-SAC在四种基于位置的操控任务中均获得了更高的平均奖励,并且训练速度更快、任务完成时间更短。SAC算法在远距离高维操控任务中探索能力不足,而ID-SAC通过引入直觉操控模式增强了智能体对远处区域的探索能力。
调节因子的变化曲线进一步验证了融合策略的有效性。在WOND任务中,智能体在初始阶段采用直觉操控模式接近目标;当软组织接近障碍物时,调节因子增大,智能体切换到深思模式以避开障碍物;避开障碍物后,调节因子减小,智能体恢复直觉操控模式以快速完成操控任务。这种模式切换行为类似于人类医生的认知决策过程。
在基于曲线和基于区域的变形操控任务中,ID-SAC同样能够成功操控多个目标点到达目标曲线和区域。在泛化能力方面,在NOND和NOWD任务中,智能体对±0.2误差范围内随机生成的目标点完成任务的成功率为100%;在±0.4误差范围内,NOND和NOWD任务的成功率分别为100%和96%;在±0.6误差范围内,成功率分别为97%和91%。在存在障碍物和未知干扰的场景中,泛化能力有所下降,但仍表现出一定的任务完成能力。
此外,研究还将智能体生成的操控轨迹与人类独立操控轨迹进行了对比。结果表明,智能体在任务完成时间和总操控距离方面均优于人类。在轨迹平滑度方面,智能体在NOND和NOWD任务中的轨迹平滑度优于人类;在WOND和WOWD任务中,智能体的轨迹平滑度略低于人类,但任务完成时间和总距离仍更短。整体而言,智能体在操控效率上优于人类,同时保持了相当的轨迹质量。
五、结论与价值
本研究提出了一种名为ID-SAC的直觉引导深度强化学习框架,用于未知约束条件下的软组织操控。该框架通过引入调节因子,将直觉操控策略与SAC算法相结合,实现了机器人自主决策能力的提升。同时,作者提出的自主抓取点选择算法能够有效识别适合操控的抓取点,并评估其成功率。实验结果表明,ID-SAC算法在存在障碍物和未知动态干扰的复杂场景中均能成功完成基于位置、曲线和区域的软组织变形操控任务,且训练速度更快、完成时间更短、泛化能力较好。与人类操控相比,智能体生成的轨迹在任务完成时间和总距离方面更具优势。
本研究的科学价值在于:提出了一种新的融合框架,将专家直觉知识以策略形式嵌入强化学习过程,解决了高维远距离操控任务中探索不足的问题;将抓取点选择问题建模为上下文赌博机问题并联合训练,为软体操控中的初始操作点选择提供了新思路。应用价值在于:该框架有望提高手术机器人在复杂体内环境中的自主操控能力,减少对医生遥操作的依赖,提升手术质量和效率。
六、研究亮点
本研究的亮点主要包括:第一,首次将直觉操控策略与强化学习通过可学习的调节因子进行融合,实现了类似人类双系统认知的操控行为;第二,提出了自主抓取点选择与评估算法,能够在考虑病灶和约束区域的情况下选择最优抓取点;第三,设计了统一的奖励函数,适用于基于单点、多点和区域的目标变形任务;第四,在仿真环境中验证了算法在存在障碍物和未知动态干扰下的鲁棒性与泛化能力。
七、其他有价值的内容
研究还探讨了安全约束指标的设计,用于防止软组织过度变形。这一机制为实际手术中的安全性保障提供了参考。此外,作者指出,该框架可以潜在地用于协调医生与机器人在手术中的协同操作,为未来人机协作手术提供了技术基础。