基于属性知识嵌入的LDA模型在中药推荐中的应用——学术研究报告
一、研究概述与背景
本项研究由陈亮、孙卫强等来自上海交通大学电子信息与电气工程学院,以及邓宏勇、孙文宇等来自上海中医药大学协同创新中心的研究人员共同完成。该研究成果于2024年7月发表在《academic journal of shanghai university of traditional chinese medicine》第38卷第4期上。研究团队聚焦于中医药现代化中的一个关键挑战:如何利用人工智能和数据挖掘技术,从海量处方数据中学习诊疗规律,从而为医生推荐更精确、科学的药材组合。研究的核心目标,是提出一种能够深度融合中医领域知识的新型主题模型(Topic Model),以克服传统数据挖掘方法在中医药非结构化数据上的局限性。
中医药数据大多以文本方式记录,语义复杂,结构化程度和数据质量较低,因此分析挖掘面临巨大挑战。首先,中医诊断从症状到开方,高度依赖医生的个人经验和深刻的专家知识,这使得数据中存在的“规律”具有高度的不确定性和随机性。其次,中医强调整体观,认为症状之间相互影响,药物之间也存在“相生相克”的复杂关系,而非简单的对症下药。然而,此前在中医处方分析中被广泛应用的潜在狄利克雷分配主题模型(LDA, Latent Dirichlet Allocation)及其变体,如Link-LDA等,虽然在挖掘症状与药物的共现模式上取得了一定成效,但它们存在一个根本缺陷:这些模型仅将症状和药材视为孤立的词语,只考虑它们在文档中的共现频率,完全忽略了现实世界中药物本身的属性(如药性、归经、功效)以及药物之间先验性的相互关系。
为了弥补这一缺陷,本研究提出了一种名为NE-HCTM(Network Embedding-Herb Compatibility Topic Model,网络嵌入-药材配伍主题模型)的新方法。该方法的核心创新在于,它将一个包含丰富中药属性的知识网络,通过嵌入的方式,作为先验知识融入到了主题模型中,从而引导模型学习到更符合中医理论知识的主题和药材配伍规律。
二、研究流程与方法详解
本研究可以分解为三个主要步骤:数据预处理、中药属性知识网络的构建与嵌入,以及NE-HCTM模型的构建与评估。
第一步:数据预处理与数据集构建。 研究的原始数据来源于中文文献记载的处方记录。研究团队根据干预措施、数据完整性和是否包含穴位治疗等进行筛选,并根据《中华人民共和国药典》将处方中的中成药分解为独立的药物组合。经过上述处理,最终形成了包含24,127条处方记录的数据集,其中涵盖了2,574种症状和1,103种药材。这个数据集随后被划分为训练集(19,302条处方)和测试集(剩余的处方),用于模型的训练和性能评估。
第二步:构建中药属性知识网络并获取嵌入向量(Embedding Vector)。 这是本研究最关键的技术创新环节。研究人员从“中草药专业知识服务系统”、“A+医学百科”、“中药大全”三个权威数据源,系统性地采集了药物的属性信息,构建了一个异构的、非结构化的中药属性知识网络。这些属性被分为两类: * 离散属性:包括归经(如胃经、脾经)、药性(如温、平、寒、凉、热)、药味(如甘、苦、辛)和毒性。这些属性维度较低,采用独热编码(One-hot Encoding)进行处理。 * 连续属性:包括功效和相关研究。功效属性类别多达上百种,直接使用独热编码会造成维度爆炸,因此使用了特征哈希编码进行降维。而“相关研究”这类宽泛属性,则使用词频-逆文档频率(TF-IDF, Term Frequency-Inverse Document Frequency)算法进行特征提取和降维。
在完成属性编码后,研究人员没有直接使用这些向量,而是设计了一个深度学习方法来自动学习药物的嵌入表示。该方法采用多层感知机(MLP, Multilayer Perceptron)来模拟药物网络的结构邻近性和属性邻近性。模型通过Node2Vec算法控制随机游走,广度优先和深度优先相结合,从而捕捉药物在网络中的高阶邻近关系。同时,模型强制具有相似属性的药物在嵌入空间中彼此靠近,以此来模拟属性的同质效应。通过负抽样和Adam优化器最大化所有药物的连接概率,最终为每一种药物生成了一个融合了其自身属性及网络结构信息的低维稠密向量,即属性知识嵌入向量。
第三步:构建网络嵌入处方主题模型并评估。 本研究以中医“理-法-方-药”的诊疗过程为基础,构建了一个主题模型。模型将处方视为文档,症状和药物视为词语,证候和诊疗方法视为潜在主题。生成每个症状和药物的主题时,通过吉布斯采样(Gibbs Sampling)进行参数推断,并引入了加权机制以规避频繁模式的影响。模型的革新之处在于,它将上一步得到的药物属性知识嵌入向量与主题模型中“诊疗方法-药物”分布的狄利克雷多项式分量进行融合,构建了最终的NE-HCTM模型。一个超参数λ(混合权重)控制着知识网络嵌入对模型的影响程度,取值范围在0.0到1.0之间,0.0表示完全不使用嵌入知识,1.0表示完全依赖嵌入知识。
为了全面评估模型性能,研究人员将NE-HCTM与四种基线模型进行了对比,分别是ATM、Block-LDA、Link-LDA和Link-PLSA-LDA。评估指标包括: * 困惑度(Perplexity):衡量模型对测试集中处方的预测能力,数值越低代表模型推断水平越高。 * 精确度(Precision@N) 和召回率(Recall@N):评估模型推荐的前N种药物中,预测正确的比例,直接反映推荐的准确性。 * 曲线下面积(AUC, Area Under Curve):通过ROC(Receiver Operating Characteristic,接收者操作特征)曲线来综合判断模型的诊断价值,AUC值越接近1,代表预测准确率越高。
三、主要研究结果与分析
实验首先探究了超参数λ对模型性能的影响。结果显示,NE-HCTM的精确度和召回率在λ为0.0和1.0时均为最差,这说明完全依赖语料库共现或完全依赖知识网络,都无法获得最佳效果。当λ从0.0增加到0.6时,模型性能逐步提升,在λ=0.6时,模型的Precision@5和Recall@5均达到最优值。这表明,最佳方案是从基于处方的主题模型与基于先验知识网络的潜在特征之间取一个平衡点。当λ超过0.6后,嵌入知识的主导作用过强,压制了从真实数据中学习的共现信息,导致性能下降。
在确定了λ=0.6这一最佳嵌入系数后,研究团队全面比较了不同主题数量下,各模型的性能。在预测困惑度方面,NE-HCTM在主题数k从5到40的范围内,其困惑度均显著低于其他四个基线模型。这意味着,在给定一组症状时,NE-HCTM能更“确定”地预测出对应的药材组合,其内部推断与真实处方更为一致。在预测精确度方面,NE-HCTM同样表现出色,其平均性能优于其他模型,这直接证明了融入属性知识能够有效提升中药推荐的准确性。在模型的平均AUC值评估中,经过约200到300次迭代后,所有模型的AUC值趋于稳定。其中,NE-HCTM的平均AUC值稳定在0.91附近,显著优于其他基线模型,显示出其优秀的分类预测能力。
为了直观地展示模型的优越性,研究以肺部疾病和心脏与养心安神两类主题为例,对比了各模型推荐的药物列表。在针对“燥热咳嗽、肺虚咳嗽”等肺部疾病症状的推荐中,基线模型如ATM和Link-LDA仅能发现2种正确药材,而NE-HCTM则成功发现了9种,例如冬瓜子(清肺排脓)、党参(健脾益肺)、杏仁(降气止咳平喘)、枇杷叶(清肺止咳)、白果(敛肺定喘)。这些推荐的药物组合不仅对症,更体现了配伍的合理性。在对“心悸、心神不安”等症状的推荐中,NE-HCTM同样找到了人参、茯苓等9种核心药材,而基线模型的推荐结果则包含较多无关药材。这强有力地证明,嵌入药材属性知识网络,能引导模型发现更符合中医理论、更专业的药物组合,而不仅仅是依赖统计学上的共现关系。
四、结论与价值
本研究得出的核心结论是,所提出的基于属性知识网络嵌入的NE-HCTM主题模型,在稳定性、药材推荐准确度方面,相较于现有基线主题模型均有更优的表现。该方法的科学价值在于,它为如何将结构化的领域知识与非结构化的文本大数据进行深度融合,提供了新的视角和有效的技术途径。它证明了将先验知识(如药物属性网络)作为一种“智能引导”,可以有效弥补纯数据驱动模型在专业领域知识上的匮乏,尤其适用于如中医学这样知识体系高度复杂的领域。其应用价值在于,该方法不只是一个预测工具,更能“挖掘诊疗模式”。它推荐的结果不仅仅是单一药物,而是具有良好兼容性的药物组合,这能帮助中医医师、尤其是经验尚浅的医师,在真实临床实践中获得更精确、更智能的数据支持,为制定科学治疗方案提供可靠参考。
五、研究亮点
本研究的主要亮点可以归纳为两点。第一是方法学的创新。 研究首次将中药的属性网络通过图嵌入技术与主题模型在模型层面进行融合,创造性地解决了传统主题模型忽略词汇间语义和相关性关系的难题,这是基于知识的主题模型在中医数据挖掘领域的一次成功应用。第二是实验验证的充分性和说服力。 研究不仅对混合权重λ的影响进行了精细度高的参数敏感性分析,找到了最佳平衡点,还通过困惑度、准确度、AUC值等多个维度的指标,以及在具体疾病主题上药物推荐结果的定性对比,全面且有力地证明了新模型的优越性。
(字数:1987)