研究者 Jiahe Chen、Etsuko Kobayashi、Ichiro Sakuma 与 Naoki Tomii 来自日本东京大学工学部,在 IEEE Robotics and Automation Letters 2024 年第 9 卷第 11 期发表了题为 “SurgEM: A Vision-Based Surgery Environment Modeling Framework for Constructing a Digital Twin Toward Autonomous Soft Tissue Manipulation” 的研究。该研究提出了一种完全基于视觉的手术环境建模框架 SurgEM,用于构建面向自主软组织操作的数字孪生(Digital Twin)。研究动机在于机器人手术中自主软组织操作仍面临关键挑战:软组织在器械作用下会发生非刚性形变,导致基于术前 CT 或 MR 的导航失效,并使得器械与组织的相对位置控制变得困难。为了不依赖额外硬件,作者关注基于视觉的形变恢复方法,并认为现有方法在器械遮挡区域、接触区域深度估计以及连续四维时空建模方面仍存在不足。因此,本研究旨在同时重建和跟踪手术钳与软组织,利用基于模型的位姿估计和基于场景流(Scene Flow)的网格优化,建立能够持续建模工具-组织交互并监测组织表面形变与应变的数字孪生。
研究的工作流程包括多个模块。首先是场景流估计。作者采用传统的两步法,利用双目图像进行立体匹配和光流跟踪。立体匹配使用 Lipson 等人提出的 RAFT-Stereo,从左侧图像重建每个像素的三维点;光流则使用 Hui 等人提出的 LiteFlowNet3 跟踪左侧图像中像素在帧间的二维位移,从而计算原始三维位移场。这些信息被组织为场景流图(Scene Flow Map),其定义为从二维像素空间到三维位移空间的映射。
接着是器械位姿估计与约束图生成。为了获得纯视觉信息,作者使用了带有二进制圆柱标记(Binary Cylindrical Marker)的钳子。该标记由周向编码的线和环图案组成,相比以往的视觉标记方法,能够在 360 度范围内识别滚转角,并提供更高的六自由度位姿估计精度。系统从双目图像中检测标记并解码图案,估计器械坐标系到相机坐标系的变换,即器械位姿。在已知器械形状和位姿后,作者将器械模型投影到左图像,生成器械掩膜(Instrument Mask)和约束图(Constraint Map)。器械掩膜为二值图,表示左图像中器械是否存在;约束图则记录每个像素沿相机投影光线与器械模型相交部分的最大深度,若不相交则记录为零。
场景流过滤是保证组织形变恢复准确性的关键步骤。系统首先将场景流图映射到上一帧网格的每个顶点,通过双线性插值获得逐顶点场景流向量。然后执行两类过滤。第一类基于器械掩膜:如果顶点在上一帧被器械遮挡,或加上场景流后在当前帧被器械遮挡,则对应场景流被标记为无效。第二类基于连续性约束:利用网格连接关系和逐顶点场景流计算局部应变,如果应变超过经验阈值 1,则相应场景流被视为无效。经过过滤后,每个顶点的场景流被标记为有效或无效,为后续网格优化提供可靠观测。
器械位姿引导的网格优化是本研究的核心创新之一。由于并非所有顶点都具有有效场景流,系统不能直接更新全部顶点位置。作者先在最小二乘意义下求解一个线性模型。该模型一方面约束具有有效场景流的顶点必须接近其更新位置,另一方面引入基于网格边的平滑项,以保持相邻顶点的相对位置。然而,该初始解在接触区域精度不足。为此,作者引入约束图进行引导。他们将初始解中的每个顶点投影到图像中,并查询约束图对应深度值,假设组织应始终位于遮挡器械的下方,因此添加顶点深度大于约束图深度的不等式约束。基于该约束,作者重新求解关于深度坐标 z 的约束最小二乘问题,从而提升接触区域形变恢复精度。纹理重映射随后进行,利用左图像为网格顶点赋予颜色。如果顶点在当前帧未被器械遮挡,则使用当前帧左图像的颜色更新纹理;若被遮挡,则保留上一帧纹理,以实现结构和外观的逼真重建。
在上述模块基础上,系统构建数字孪生。通过持续跟踪器械位姿并恢复组织网格形变,数字孪生在同一坐标系中同时表示器械 CAD 模型和组织表面模型。它可以实时计算器械尖端与组织表面之间的距离(Tip-Surface Distance, TSD),用于接触检测和距离优化。同时,由于网格顶点在帧间具有连续对应关系,系统能够通过比较顶点间距离的变化计算组织表面柯西应变(Cauchy Strain)。该信息可用于评估组织生物力学状态,并反馈至机器人控制或手术导航。
实验部分采用离体(Ex Vivo)牛肉组织,分别执行牵引(Traction)和触诊(Palpation)两类工具-组织交互。在形变恢复评估中,作者使用三维扫描仪获取变形组织表面的真值。在触诊实验中,由于遮挡严重,组织从背面扫描;在牵引实验中,则从正面扫描。通过迭代最近点算法(Iterative Closest Point, ICP)配准扫描表面与恢复网格,并计算表面距离(Surface Distance, SD)。结果显示,本方法总体表面距离为 0.38 ± 0.30 mm;在遮挡区域,本方法表面距离为 0.33 ± 0.22 mm,而对比方法则为 2.26 ± 1.52 mm。热图可视化显示,对比方法在遮挡区域存在较大误差,而本方法未出现明显偏差,证明其在遮挡条件下仍可准确恢复变形表面。位姿估计实验使用 NDI Polaris 光学跟踪系统获得真值,并通过手眼标定确定各坐标系间变换。结果显示旋转误差为 0.85 ± 0.57 度,平移误差为 2.09 ± 1.41 mm。尽管旋转误差略高于某些已有方法,但所用标记在工作空间角度范围上扩展至 ±180 度,较此前的 ±82 度具有更大优势。接触检测实验中,系统监测整个过程中 TSD 的变化。结果在两个关键帧处 TSD 分别测得为 0.09 mm 和 0.00 mm,在接近与离开阶段则为 0.31 mm 和 0.79 mm,满足接触前后非零及接触时约等于零的假设,证明系统能够准确检测接触状态。表面应变估计结果显示,在牵引实验中应变分布较为均匀,符合近似仿射形变特征;而在触诊实验中应变主要集中于接触区域,符合非仿射形变预期,从而验证了数字孪生在监测生物力学状态方面的潜力。
研究的结论指出,SurgEM 框架能够仅依赖双目腹腔镜视觉输入,同时实现手术器械跟踪与遮挡鲁棒的组织形变恢复。其提出的融合器械位姿的网格优化模型显著提升了接触区域的重建精度。基于 SurgEM 构建的数字孪生能够动态建模器械与组织,并持续监测工具-组织交互引起的表面应变。该系统在离体实验中从结构精度、相对定位和生物力学分布等多个角度得到了定性和定量验证。研究意义在于为自主软组织操作提供结构信息和生物力学反馈,有望用于指导机器人优化操作、避免组织损伤,并为外科医生提供变形风险区域的可视化预警。当前系统运行于 NVIDIA 3090Ti GPU 平台上,处理一帧 1280×720 图像约需 8 秒,尚未达到术中实时要求,但作者表示未来可通过算法优化、分布式并行计算以及引入运动学或力传感等冗余手段提升实时性与安全性。