本研究由来自北京交通大学(Beijing Jiaotong University)医学智能研究所的董鑫(Xin Dong)、郑毅(Yi Zheng)、舒梓鑫(Zixin Shu)等学者,以及清华大学(Tsinghua University)自动化系的杨扩(Kuo Yang)共同完成。通讯作者为杨扩与周雪忠(Xuezhong Zhou)。该研究成果于2022年2月17日发表在《BioMed Research International》期刊上,是一篇关于中医药智能化研究的原始研究论文(Research Article)。
中医药(Traditional Chinese Medicine, TCM)在临床诊疗中扮演着不可或缺的角色。TCM的治疗过程可概括为“理-法-方-药”,即根据患者的临床信息(如症状表型)确定病因病机,随后制定治法,并最终为患者选择个性化的处方和草药。处方的质量直接决定了TCM的疗效,也是医生临床经验和医学知识水平的最佳体现。然而,目前海量的TCM临床处方数据并未得到充分利用,且经验丰富的临床医生数量与患者数量之间存在严重的不平衡。因此,利用人工智能方法,基于现有TCM临床数据进行智能处方推荐,对于辅助医生诊疗具有重要意义。
尽管已有学者在TCM处方推荐领域开展了相关工作,例如使用主题模型(Topic Model)从大规模数据中提取症状-草药组合关系,或利用序列到序列(Seq2Seq)模型和知识图谱(Knowledge Graph)进行处方生成,但现有方法仍面临挑战。主要难点在于,患者电子病历(Electronic Medical Records, EMR)中的临床表型记录具有主观性,总会存在一些未被预编码的症状术语,即未记录术语(Unrecorded Terms)。由于许多临床表型存在同义关系,如何有效地将新术语映射到现有医学术语体系,并充分利用其中的TCM语义和医学知识,是本领域的一个关键问题。
为解决上述问题,本研究提出了一个基于子网络的症状术语映射方法(Subnetwork-based Symptom Term Mapping, SST法),并在此基础上构建了一个中医处方推荐方法——TCMpr。其研究目标在于,通过更好地利用症状特征的潜在信息,特别是针对未记录症状术语的表示学习,来提升处方推荐的性能,从而潜在地促进TCM精准医疗的临床诊疗。
本研究的工作流程主要包含四个关键环节:构建草药-症状相关知识图谱与症状网络、利用SST方法进行症状术语映射与特征表示、构建并训练TCMpr处方推荐模型,以及进行全面的实验评估。
首先,研究团队构建了草药-症状相关知识图谱(Herb-Symptom-related Knowledge Graph, HSKG)。该知识图谱的数据来源包括《中华本草》、“中国药典2015”、症状本体(Symptom Ontology)等多个权威渠道。构建完成的HSKG包含症状、草药、功效、性味、归经共计5类18,537个实体,以及草药-症状、草药-功效、草药-性味、草药-归经、症状-症状共5类102,120条关系。基于HSKG,研究者通过词拆分和元路径(Metapath)方法构建了一个症状网络(Symptom Network)。例如,将“脚酸痛”拆分为“脚”和“酸”、“痛”等词,并建立症状与词之间的关联;同时,利用“症状1-草药1-功效-草药2-症状2”这样的元路径,直接构建基于共同功效、性味或归经的症状-症状关系。最终形成的症状网络包含症状和症状词两类实体,以及基于同义、词拆分、功效、性味、归经共五种关系,总计约16.8万条关系。
其次,研究提出了核心创新方法——SST法来解决症状术语映射问题。其核心思想是将症状术语拆解成词,然后通过之前构建的症状网络进行传播和拼接,将获得的子网络(Subnetwork)作为映射结果。具体步骤为:以症状术语“脚酸痛”为例,首先将其拆分为词集合{“脚”, “酸”, “痛”};然后,在症状网络中查找每个词的一阶邻居节点,得到邻居集合如{“脚痒”,“手酸”,“脚酸”,“脚痛”}等;接着,计算每个邻居节点出现的频率,并保留频率大于阈值(如>1)的节点;最后,用这些保留下来的节点(如“酸”-“脚酸”-“脚”-“脚痛”-“痛”)构成的子网络来代表原始的输入术语“脚酸痛”。这个子网络即作为该症状术语的映射概念集。通过这种方式,SST法能够将未记录的症状术语与已有术语关联起来,并充分挖掘其语义关联的潜在信息。得到映射概念集后,研究人员采用平均池化(Average Pooling)或最大池化(Max Pooling)等特征融合(Feature Fusion)方法,将该集合中所有概念的嵌入向量进行聚合,形成原始症状术语的综合性特征表示向量。
接着,研究构建了SST法驱动的TCM处方推荐模型(TCMpr)。模型输入为患者的所有症状,每个症状通过SST方法被映射成一个子图,并转化为一个固定维度的嵌入向量。这些向量经过一个注意力(Attention)层,学习不同特征的重要性权重。随后,数据被送入一个含多个卷积核的卷积神经网络(Convolutional Neural Network, CNN)中进行训练。经过平均池化层(Average Pooling Layer)处理,得到患者的综合症状嵌入表示。最后,该向量通过一个三层全连接网络(Fully Connected Network, FCN)进行学习,并由Softmax激活函数输出每种草药被推荐的概率,从而获得预测处方。
最后,实验环节使用了来自150多个期刊来源和753位名老中医经典医案的临床病例数据。经过去敏化和人工标准化,并筛选掉症状数大于40、草药数大于20的病例后,最终得到8,218例数据作为实验数据集,并按8:2的比例随机划分为训练集和测试集。研究以Top@k的精确率(Precision)、召回率(Recall)和F1值(F1-score)作为评价指标,与MLkNN和ML-DT两种多标签分类基线(Baseline)方法进行了比较。同时,还设计了系列消融实验和超参数实验,以考察不同的特征嵌入方法(DeepWalk、Node2Vec、LINE、TransE、One-Hot)、特征融合方式(平均池化、最大池化)、特征维度(100至500维)和子网络过滤阈值(1, 2, 3)对模型性能的影响。
实验结果显示,本研究提出的TCMpr方法在各方面性能上均优于基线方法。
首先,在与基线方法的对比中,TCMpr展现了最佳性能。在Top@15指标下,TCMpr相较于MLkNN_1,精确率提升了29.1%,召回率提升了35.3%,F1值提升了31.7%。随着k值增加,所有方法的准确率呈下降趋势,而召回率呈上升趋势,F1值在k=12附近趋于稳定并略有下降,这与实验数据中平均草药数约为11.31的数据特征相符。
其次,在不同实现方式和超参数的对比实验中,本研究获得了一系列重要发现: 1. 特征嵌入方法:DeepWalk、Node2Vec、LINE等能保留网络结构信息和语义关联的方法,其性能显著优于TransE和One-Hot。其中,DeepWalk获得了最佳性能。这表明,在向量空间中保持语义相近的词语位置接近,对于SST方法中的术语映射和融合至关重要。 2. 特征融合方法:平均池化方法的性能优于最大池化。这可能是因为最大池化会丢失部分信息,而平均池化对所有特征的处理更为公平。 3. 特征维度:当向量维度从100增加到500时,对性能影响不大,但维度为200时,训练时间相对最小(每轮约9秒),因此被认为是一个相对较好的选择。 4. 子网络过滤阈值:这是一个关键的影响因素。当阈值设为2时,效果最佳。阈值为1时虽然保留了最多相关术语,但因信息噪声过多而性能不佳;阈值为2时过滤掉了部分噪声,保留了较重要的节点,性能获得较大提升;阈值为3时则因筛选后节点过少(大多为症状词),导致信息丢失,性能略有下降。这证明了适度的子网络结构筛选对提升特征表示质量的重要性。
本研究得出的主要结论是:基于子网络症状术语映射(SST方法)的中医处方推荐方法(TCMpr)能够有效处理未记录症状术语的特征构建问题,其处方推荐性能显著优于现有先进方法。
该研究的科学价值在于,它创新性地将知识图谱的语义网络分析与深度学习相结合。通过引入网络科学中的“元路径”和“子网络”概念,SST方法为复杂、稀疏的临床表型术语,特别是未曾出现过的症状组合,提供了一种动态生成富含语义上下文信息的特征表示方法。这为其他生物医学文本挖掘和术语标准化任务提供了新的思路。
其应用价值则更为直接。TCMpr方法具有高性能的处方推荐能力,能够充分利用海量的TCM临床数据,有效辅助临床医生,尤其是经验尚浅的年轻医生进行处方决策,从而提高临床资源利用率,推动医院信息化和智能化建设,最终为TCM精准医疗的临床诊断与治疗提供有力支持。
本研究的亮点集中体现在以下几个方面: 1. 创新性的方法论:提出的SST方法(基于子网络的症状术语映射)是最大的亮点。它巧妙地解决了TCM领域中由于临床症状描述多样性和同义词导致的新术语无法在现有知识库中找到匹配的“未记录术语”问题,通过构建局部语义子网络来动态、精准地表达症状含义。 2. 对知识图谱的深度利用:研究并未停留在构建简单的实体关系上,而是通过“元路径”思想,将复杂的多实体知识图谱简化为仅包含症状的关联网络,挖掘并保留了功效、性味、归经等深层次的TCM理论知识,实现了领域知识的高效融合。 3. 优异的模型性能与充分的实验验证:TCMpr模型在与传统机器学习基线的对比中取得了显著优势。通过全面的超参数和消融实验,不仅证明了SST方法的有效性,还详尽分析了特征嵌入、融合方式、子网络筛选阈值等环节对最终性能的影响,为方法的细节设置提供了有力依据。
作者团队也指出了研究的局限性及未来方向。尽管方法已取得了较高性能,但在Top@k指标上的表现仍不完美。未来,他们将考虑结合迁移学习(Transfer Learning)技术以进一步提高精度和召回率。此外,草药-症状知识图谱和临床病例数据的数量及质量仍有提升空间,团队将持续收集更多高质量数据,以优化和训练出性能更优的模型。