本文提出了一种用于非刚性组织学图像配准的无监督深度学习框架,称为迭代关键点对应引导(Iterative Keypoint Correspondence-Guided,IKCG)网络。该研究由Xingyue Wei、Lin Ge、Lijie Huang、Jianwen Luo和Yan Xu等人完成,主要作者来自清华大学生物医学工程学院和北京航空航天大学生物科学与医学工程学院。论文发表于IEEE Transactions on Medical Imaging第44卷第1期,2025年1月出版,并于2024年8月21日在线发表。
组织学图像配准是组织学图像分析中的基础任务,其主要挑战来自不同染色方式导致的巨大外观差异。传统的基于强度相似性的无监督深度学习配准方法难以处理多染色组织学图像,因为强度模式在多种染色之间存在很大变化。为了应对这一问题,研究者引入了关键点对应(keypoint correspondences),即匹配的关键点对,来引导无监督深度学习配准方法。然而,手工设计的关键点描述子(如SIFT)的判别能力有限,可能产生不准确的对应关系,从而误导无监督架构的训练。深度特征因其深层次、层次化的表示能力而在许多图像处理任务中优于手工描述子。预训练深度网络提取的固定深度特征(fixed deep features)和针对特定任务训练得到的可学习深度特征(learnable deep features)是两类重要的深度描述子。本文旨在结合固定与可学习深度特征,并采用迭代训练策略,提升组织学图像配准的精度,特别是解决由组织切片撕裂等误操作引起的局部非刚性大位移问题。
该研究的核心工作流程包括预处理、非刚性配准、关键点检测与对应建立、迭代训练以及最终配准性能评估。预处理阶段与SFG方法一致,包括将全玻片图像(whole slide images,WSIs)转换为灰度图像,利用Sobel算子和中值滤波器计算梯度图像,将梯度图像下采样至1024×1024像素,再进行仿射配准。非刚性配准在仿射配准后的下采样梯度图像上进行。骨干网络选择MaskFlownet-S,该网络包含特征金字塔结构和非对称遮挡感知特征匹配模块。关键点检测采用ORB算法,在固定图像和移动图像中检测关键点,这些关键点在整个方法过程中保持不变。对于每个关键点,取其邻域图像块,经缩放和旋转后输入预训练的VGG-16网络,从倒数第三个全连接层提取固定深度特征嵌入,并采用多尺度策略增强鲁棒性。基于固定深度特征嵌入,通过余弦相似度和互反对应策略建立初始关键点对应。这些初始对应作为伪真值,其距离损失用于训练MaskFlownet-S。训练收敛后,从网络特征金字塔的最深层提取192维可学习深度特征嵌入。固定深度特征嵌入提取自VGG-16的倒数第三层,因为该层比倒数第二层包含更鲁棒和通用的特征。可学习深度特征嵌入的提取过程与固定深度特征嵌入类似,但输入邻域尺寸需调整为64×64像素以适应MaskFlownet-S的感受野。利用可学习深度特征嵌入建立新的关键点对应,并用这些对应的距离损失对网络进行微调。整个流程——可学习深度特征提取、关键点对应建立和网络训练——被迭代重复三次,以逐步提升可学习深度特征的判别能力和网络配准性能。在关键点对应建立阶段,对于位移较小的关键点采用半径为40像素的圆形搜索区域;对于位移较大的关键点,即预处理后图像对的归一化互相关小于0.7的情况,采用半径为60至160像素的扇形搜索区域。此外,还引入了非极大值抑制策略以避免相邻像素的错误匹配。损失函数由多个部分组成:基础部分包括归一化互相关损失和扩散正则化项;基于固定深度特征的初始关键点对应距离损失;基于可学习深度特征的新关键点对应距离损失;稠密SIFT特征图相似性损失;以及在迭代过程中构建的迭代距离损失。最终损失函数为上述各项的加权和。
实验在ANHIR和ACROBAT两个公开挑战数据集上进行。ANHIR数据集包含481对多染色全玻片图像,其中251对作为评估数据集,其余作为训练数据集,每对图像平均有86对人工标注匹配关键点。ACROBAT数据集更大且更具挑战性,包含3406张来自750个病例的全玻片图像用于训练,200张来自另100个病例的全玻片图像用于验证。由于外部网站提交次数限制,研究设计了三个内部评估数据集:ANHIR评估数据集-6关键点、ANHIR训练即评估数据集和ACROBAT评估数据集-15关键点。在ANHIR网站上,IKCG排名第一(截至2024年8月6日),在平均-中位rTRE和中位-中位rTRE等指标上优于其他算法,平均最大rTRE达到0.0238,平均鲁棒性达98.74%。与SFG方法相比,IKCG在多个关键点基指标上表现更好或相当。在ACROBAT数据集上,使用ACROBAT训练集训练的IKCG在ap90TRE、mp90TRE和aatre等指标上取得最低值,使用ANHIR训练集训练的IKCG在sp90TRE上最低。消融实验表明,固定深度特征和可学习深度特征的引入均优于SIFT特征,二者的结合进一步降低关键点基误差,加入稠密结构相似性后性能继续提升,迭代训练策略的加入带来了最终的性能增益。可学习深度特征优化后能够正确匹配具有大位移的关键点而不会引入离群点,这解释了IKCG能够解决大位移问题的原因。针对大位移关键点对的专门分析表明,IKCG和KCG在不同位移阈值下均获得比SFG更低的平均rTRE或TRE。迭代训练策略的移植性实验显示,将迭代策略直接应用于baseline网络同样可以提升性能。多尺度策略对比表明,多尺度IKCG显著优于单尺度IKCG。输入图像尺寸实验表明,1024×1024像素输入的配准性能优于512×512像素输入。骨干网络可替代性实验表明,使用PWC-Net作为骨干网络时,所提方法仍然有效。在有限训练数据集上的实验证实了该方法在小样本条件下的有效性。
研究的主要结论是,基于固定和可学习深度特征的迭代关键点对应引导无监督网络IKCG能够有效解决非刚性组织学图像配准问题。其核心创新在于利用固定深度特征建立初始关键点对应,利用可学习深度特征建立更准确的对应,并通过迭代训练策略同时优化特征和网络参数,从而形成良性循环。该方法在ANHIR和ACROBAT两个公开挑战中均排名第一,证明了其先进性和泛化能力。此外,该方法具有重要的应用价值,可为临床医生在组织学图像分析中提供更好的配准结果支持。研究的亮点包括解决了SFG未能解决的大位移问题,提出了将固定和可学习深度特征结合用于关键点描述的具体流程,以及证明了迭代训练框架在关键点对应引导配准中的有效性。源代码已公开,便于其他研究者复现和进一步开发。未来工作方向包括将所提方法扩展到仿射变换,并构建包含仿射和非刚性变换的端到端配准流程。