本文为类型a,是一篇原始研究论文。
本研究由香港中文大学计算机科学与工程系的Yonghao Long、Anran Lin、Qi Dou等,以及Cornerstone Robotics Ltd.的Zerui Wang等、香港中文大学外科学系的Hon Chi Yip等、约翰斯·霍普金斯大学的Peter Kazanzides和Russell H. Taylor等多位研究者共同完成。论文发表于*Science Robotics*,时间为2025年7月16日,文章编号eadt3093。
研究属于医疗机器人与具身智能(embodied intelligence)的交叉领域。长期以来,手术机器人已在全球完成数百万例微创手术,但大多数系统仍依赖外科医生的直接操控。自主化被认为是下一代手术机器人的关键方向,能够提高效率、稳定性和人的生产力。传统方法往往基于特定任务的工程化规则,难以在不同手术场景间泛化。人工智能方法提供了通用任务学习的新路径,但在外科领域,由于缺乏可供强化学习(reinforcement learning, RL)使用的高质量开源仿真基础设施,以及仿真到现实(sim-to-real)转移的技术瓶颈,具身智能的应用仍十分有限。本研究的目标正是构建一个面向手术机器人的开源具身智能仿真环境,并提出一种基于视觉的通用学习范式,实现从仿真训练到真实手术机器人上的零样本(zero-shot)迁移,最终在多种手术辅助任务中验证其普适性与可靠性。
研究的整体工作流程可分为四个主要阶段。第一阶段是构建手术具身智能仿真环境。研究团队开发了名为SurRoL的开源手术机器人学习模拟器。SurRoL以da Vinci Research Kit(dVRK)为数字孪生对象,包含患者侧机械臂(patient-side manipulator, PSM)、内窥镜相机机械臂(endoscopic camera manipulator, ECM)等机器人模型,支持正向与逆向运动学求解,并提供与dVRK主操作器(master tool manipulators, MTMs)及其他触觉设备的人机交互接口。仿真器内部使用Bullet物理引擎处理刚体碰撞与动力学,同时集成了基于Taichi的移动最小二乘物质点法(moving least squares material point method, MLS-MPM)进行软组织形变模拟。为了提升场景真实感,研究团队还开发了基于3D高斯泼溅(3D Gaussian splatting, 3DGS)的数据驱动场景重建方法,可从真实立体手术视频中自动重建三维手术场景并导入SurRoL。这些功能使SurRoL不仅支持刚体和软体交互,还能帮助研究人员训练并测试强化学习策略。
第二阶段提出了一种名为VPPV的视觉学习范式。该范式由四个模块顺序组成:视觉解析(visual parsing)、感知回归器(perceptual regressor)、策略学习(policy learning)和视觉伺服控制器(visual servoing controller)。视觉解析使用FastSAM进行目标分割,并使用IGEV进行立体深度估计,从内窥镜图像中获得目标的语义掩膜和深度图。感知回归器接收分割图与深度图,通过预训练的ResNet-18提取语义和几何嵌入,再经全连接层融合为一个9维状态向量,包含目标接触点的三维位置和姿态以及目标与器械末端在相机坐标系下的相对位置。该状态向量是策略学习的输入,避免了仿真图像与真实图像之间的视觉外观差异对策略泛化的影响。在策略学习阶段,研究使用DDPG算法训练连续动作策略。奖励函数采用稀疏奖励设计,训练时仅以任务是否成功作为奖励依据。为了增强策略对环境扰动的鲁棒性,训练过程中对深度图加入高斯噪声,并对分割掩膜进行随机像素剔除。最终,视觉伺服控制器基于手眼标定结果和实时视觉反馈执行末端抓取等低层操作。这种“数据驱动策略学习+经典控制器末端执行”的混合模式使策略能够专注于高层轨迹规划,同时利用传统控制方法保证末端操作精度。
第三阶段是在仿真环境与dVRK机器人上进行任务自动化验证。研究团队在SurRoL中创建了七项基于da Vinci技能训练课程的任务,包括NeedleReach、NeedlePick、GauzeRetrieve、PickAndPlace、PegTransfer、MatchBoard和NeedleRegrasp。这些任务模拟了从简单器械到达、拾取到双手协调等不同难度的手术基础技能。在仿真中,VPPV在多数任务上达到100%的成功率,在较难的MatchBoard任务上为83%,NeedleRegrasp为96%。在真实dVRK平台上,对50次独立试验进行测试,七项任务的平均成功率较仿真仅下降8%,其中NeedleReach为100%,GauzeRetrieve为96%,PegTransfer为86%,MatchBoard为80%。相比之下,ALOHA和Diffusion Policy等端到端视觉策略在仿真中虽可完成学习,但无法实现有效的零样本迁移。这表明VPPV通过将高维视觉输入压缩为可解释的紧凑状态表示,显著降低了仿真到现实的视觉域差异带来的影响。
第四阶段是在离体动物组织上使用另一台商用手术机器人——Sentire手术系统(Cornerstone Robotics)验证任务泛化能力。研究团队设计了五项手术辅助任务:内窥镜相机操控、针抓取、纱布拾取、软组织牵拉和血管夹闭。实验使用三个猪胃标本,每个标本保留了左右胃网膜动脉。实验过程中,标本方向和位置随机变化,并改变光照、器械类型、物体尺寸,甚至模拟手术烟雾等复杂环境。在内窥镜相机操控任务中,成功率95%(21次尝试中20次成功);针抓取为83%(24次尝试中20次成功);纱布拾取为91%(22次尝试中20次成功);软组织牵拉为91%(22次尝试中20次成功);血管夹闭为87%(23次尝试中20次成功)。运动学数据表明,RL策略生成的轨迹接近最优路径,平均偏差在3.3至9.1毫米之间,说明策略在执行任务时冗余运动很小。这些结果证明同一套VPPV学习框架无需大量任务特定改造,即可迁移到不同机器人平台和不同手术任务中。
第五阶段是活体动物试验。研究团队在香港多尺度医疗机器人中心的混合手术室内,使用同一台Sentire系统对活猪模型进行了三项任务验证:纱布拾取、软组织牵拉和血管夹闭。试验采用“监督自主”(supervised autonomy)模式,由认证胃肠外科医生实施机器人辅助胃游离操作,并随时准备接管。纱布拾取任务完成6次试验,成功率83%,与离体结果相当。软组织牵拉任务成功率77%(13次试验中10次成功),失败原因主要是夹持器未能充分压住组织表面。血管夹闭任务的活体表现明显更困难,成功率为67%(6次试验中4次成功)。失败因素包括呼吸运动导致的目标组织动态变化、手眼标定精度不足以及夹子跨越血管的末端确认步骤缺失。系统推理速度方面,目标分割每帧耗时40毫秒,立体深度估计每帧300毫秒,策略预测7毫秒,视觉伺服控制2毫秒,整体端到端部署速度可达3帧每秒。考虑到安全监督要求,实际任务完成时间分别约为纱布拾取19.2秒、软组织牵拉17.0秒、血管夹闭8.3秒。这表明深度神经网络推理不是当前学习型手术自动化的速度瓶颈。
研究还开展了一项关于触觉辅助技能培训的用户实验。研究人员将dVRK的MTMs从被动设备改造为主动引导设备,利用RL生成的运动轨迹作为参考路径,为新手的PegTransfer任务训练提供力反馈引导。8名无手术机器人操作经验的参与者被随机分为触觉辅助训练组和自主练习组。训练15分钟后,触觉辅助组平均任务完成时间为10.5±2.2秒,显著快于自主练习组的20.2±1.8秒(p<0.01),表明AI生成轨迹结合触觉辅助可以提升手术技能学习效率。
本研究的核心结论是:手术具身智能可以通过开源仿真平台与视觉学习范式的结合,在不依赖真实手术数据的情况下训练可泛化的任务自动化策略,并实现跨平台、跨任务的零样本迁移。其科学价值在于提出了一种将视觉基础模型、感知回归器和强化学习策略与经典视觉伺服控制相结合的通用范式,有效化解了手术场景中高维视觉输入与低维控制策略之间的仿真到现实差距。应用价值则体现在五项手术辅助任务的离体和活体验证结果,特别是软组织牵拉和血管夹闭等对外科医生负担较重的重复性动作,展示了将“第三只机器臂”自动化的可行性。此外,研究还指出,在监督自主模式下,当AI控制一条机械臂时,外科医生的认知负荷分配和异常检测能力仍是一个尚待解决的人因问题。
本研究的亮点集中在三个方面:第一,它首次在dVRK和商用手术机器人上同时验证了基于视觉的零样本仿真到现实迁移,并覆盖了七项模拟任务和五项真实手术辅助任务;第二,它开发了具有软体模拟、3D数据驱动场景重建和人机交互接口的SurRoL开源平台,为后续研究提供了完整基础设施;第三,它明确展示了混合型控制架构——学习型策略负责高层运动规划,经典视觉伺服负责末端精细操作——在手术自主化路径中的现实优势。该工作也为后续手术具身智能研究提供了伦理与工程层面的重要参考。