本文所述研究由牛津大学工程科学系的Xiaoqing Guo、Mohammad Alsharid、He Zhao、Yipei Wang、J. Alison Noble以及牛津大学纳菲尔德妇女与生殖健康系的Jayne Lander、Aris T. Papageorghiou等人共同完成,发表于Nature Biomedical Engineering。该研究旨在开发一款名为SonoMate的人工智能助手,用于辅助操作者在胎儿超声检查过程中进行实时交互与决策支持。
自由手法(freehand)胎儿超声检查是一项高度依赖操作者技能的临床技术,需要操作者同时掌握复杂的扫描手法和图像解读能力。一名新晋超声医师成长为资深专家通常需要数年时间,这种技能差距(skill gap)导致了全球范围内资深超声医师的严重短缺。在此背景下,该研究探索了如何利用人工智能技术来弥合这一技能鸿沟,具体而言,即开发一个能够理解并解读超声数据的“智能”超声助手。
现有的大多数视觉语言预训练模型(Vision-Language Pre-training, VLP),如CLIP(Contrastive Language-Image Pre-training),虽然在通用领域图像分类、检索及视觉问答(Visual Question Answering, VQA)等下游任务中表现出色,但由于生物医学图像及其专业词汇与通用网络内容存在显著差异,这些模型在生物医学应用中并不适用。同样一个词(如“head”),在自然图像和胎儿超声图像中的视觉外观截然不同,导致CLIP在胎儿超声解剖结构检测任务中性能不佳。尽管后续出现了如BiomedCLIP等在生物医学数据上训练的模型,但它们主要关注图像内容的解释,且其训练所用的图像说明文字(image captions)与超声医师的实际口语表达存在较大差距。因此,为超声AI助手有效运作,它必须从超声扫描和超声医师的视角出发,不仅包含基于视频的分析,还需融入该领域特定的沟通风格和领域知识。
为应对上述挑战,本研究开发了SonoMate——一个专为胎儿超声视频理解而构建的视觉基础语言模型(visually grounded language model)。该模型的构建基于一个包含525个真实临床胎儿超声扫描过程中录制的视频-音频对的大型多模态数据集。这些数据采集自2019年1月至2023年2月期间,在英国一家三级医院诊所进行的常规产科超声检查,涵盖早孕期(167例)、中孕期(194例)和晚孕期(164例)扫描。音频通过WhisperX转录为文本,共获得79,885个句子,每个句子都带有开始和结束时间戳。
SonoMate的核心技术创新在于其独特的视频-文本对齐策略,该策略有效解决了真实超声视频-音频数据中存在的两大根本性挑战:(1)异质性语言(Heterogeneous Language):超声医师在扫描过程中会说出许多与当前视觉信号无关的语句,如与患者交流,且不同医师的说话风格和用词习惯各异,数据集中仅约三分之一的句子与视觉内容相关;(2)时间异步性(Temporal Asynchrony):超声医师可能在执行某个动作之前就先对其进行解释,导致文本描述和视觉实体之间存在时间差。
为构建能够从超声医师视角理解超声视频的语言模型,本研究提出了联合粗粒度与细粒度对齐的训练方法。首先,模型采用一个粗粒度的视频-文本对齐(Coarse-grained Video-Text Alignment)方法,遵循CLIP模型的思路,将配对的视频特征和文本特征在特征空间中“拉近”,同时将未配对的“推远”。其中,视频特征由经过残差块优化的视觉编码器(Vision Transformer, ViT-B/16)提取,文本特征则由BERT文本编码器生成。考虑到一个超声视频中往往包含多种解剖结构检查或生物测量,研究进一步提出了细粒度的图像-句子对齐(Fine-grained Image-Sentence Alignment)方法,将句子特征与其对应时间戳内发生的视频帧特征进行对齐,优化一个文本-视觉相似度矩阵。
针对上述两大挑战,细粒度对齐中引入了两项关键策略。首先,解剖学感知对齐(Anatomy-aware Alignment)通过建立一个胎儿超声词汇集(包含大量视觉相关词汇),从每个句子中提取关键词并将其重组为简化的模板句,再与对应帧特征对齐,从而抑制与视觉无关的语音内容对模型训练的干扰。其次,对齐标签校正(Alignment Label Correction)旨在解决时间异步带来的标签噪声问题。该方法包含两种技术:上下文标签校正(Context Label Correction)将当前句子之后的几帧也视为正样本,以增加口语词汇与相应视频事件相匹配的概率;自适应标签校正(Adaptive Label Correction)基于深度学习模型早期学习正确语义信息、后期才记忆噪声标签的观察,在训练初期依赖给定的对齐标签,随后逐渐过渡到信任模型自身预测的文本-视觉相似度矩阵,以此动态校正对齐标签。
通过联合粗粒度和细粒度对齐,SonoMate实现了图像与文本特征空间的有效对齐。跨模态特征可视化结果显示,与基线模型BiomedCLIP相比,SonoMate的图像特征和文本特征分布高度一致,且能生成更具判别性的解剖类别文本特征。在文本-视觉相似度矩阵的可视化中,SonoMate展现出更清晰、更接近真实对齐标签的时序对齐模式,能有效忽略如“对不起”、“没关系”等视觉无关语句,并能自动校正异步内容,如在超声医师说出“接下来看股骨”后,模型在与语句时间戳稍后的帧上检测到了较高的相似度得分。
SonoMate在多项下游任务中展示了卓越性能。在解剖结构检测任务中,SonoMate无需在任何人工标注数据上重新训练或微调,即可对超声图像进行分类。研究分别在早孕期数据集(5类)、中孕期数据集(8类)和一个开源的母胎超声数据集(6类)上进行了评估。结果表明,SonoMate显著优于CLIP、PubMedCLIP和BiomedCLIP。在中孕期图像分类中,SonoMate的召回率达到77.2%,远超CLIP(13.3%)和BiomedCLIP(33.2%)。尤其值得注意的是,该模型在外部数据集上也表现出色,证明了其在不同超声设备、操作者和国家之间的良好泛化能力。在标注数据少于1000张时,其零样本分类性能甚至超越了SimCLR、SonoNet、PulseNet等全监督模型,展现了无需收集大量标注数据的巨大灵活性。与人类表现相比,SonoMate优于仅看过少量示例的非专业组,但与经验丰富的专家相比仍有差距,在区分外观相似的“股骨”与“脊柱”、“头围平面(HCP)”与“枕下前囟平面(SOB)”等任务上存在挑战。在融入解剖学知识图谱后,通过将同类别的亚结构词汇连接成一个句子来生成类别文本嵌入,模型性能得到进一步提升。
为支持超声机器与用户之间的实时交互,SonoMate集成了一个多模态解码器,具备了视觉问答(VQA)能力。研究利用转录音频和数据集中的注释生成了大规模的图像级和视频级VQA数据集。对于图像级VQA,SonoMate在五项任务(生物测量、孕期判断、早孕期解剖、中孕期解剖、开放式解剖识别)中取得了平均84.15%的准确率。对于视频级VQA,SonoMate在解剖检查序列预测、生物测量序列预测、缺失解剖结构检测、特定解剖结构前后检查项查找以及操作者技能评估等五项任务上,均优于BiomedCLIP基线模型。
为确保模型部署的安全性,研究还构建了安全护栏(Guardrails)。首先,开发了一个分布外(Out-of-Distribution, OOD)问题检测网络,能有效过滤训练问题分布之外的提问,并触发“SonoMate无法回答此问题”的提示。其次,采用问题释义生成策略,通过ChatGPT扩展提问模板并对输入问题进行同义改写,增强了模型对不同措辞和语言风格的鲁棒性。在模拟释义和拼写错误等极端测试中,该机制能保持高精度和接近原始数据的VQA准确率。
在计算效率方面,模型在仅使用CPU时,完成一次解剖检测推理需约100毫秒,使用GPU+CPU则仅需约7.9毫秒。对于视频级VQA,处理一个4分钟的视频提问,在GPU+CPU设置下仅需约9.3秒,满足实时交互的需求。
本研究提出的SonoMate是首个专为理解胎儿超声视频而设计的视觉基础语言模型,也是首个将视频-文本对齐引入医学影像语言模型的探索。其科学价值在于提出了一套完整的解决方案,通过解剖学感知对齐和自适应标签校正等创新方法,有效应对了真实临床数据中存在的异质性语言和时间异步性挑战,实现了稳健的跨模态特征对齐。在应用价值层面,SonoMate为超声扫描培训和新晋医师的独立操作提供了前所未有的数字化辅助。它可以实时验证图像质量、确认所有必需的解剖切面是否采集完成,从而减少遗漏和重复扫描,降低认知负荷,增强操作者信心,最终有望缓解全球范围内资深超声医师短缺的困境。研究同时指出,该模型并非用于替代专家诊断,其设计初衷是教育和早中期职业支持,而对于高年资专家,其辅助价值可能有限。未来的工作将集中解决因解剖结构视觉相似、图像伪影、非标准切面等因素导致的识别失败问题,并提升模型对不完整或错误外部知识的鲁棒性。