一、 研究概况
本研究由王淑慧、李燕、王超三位研究者共同完成,第一作者王淑慧为硕士研究生,通信作者李燕为教授,他们均来自甘肃中医药大学医学信息工程学院。该研究成果以论文形式发表于期刊《计算机技术与发展》(*Computer Technology and Development*),预计刊载于2026年7月的第36卷第7期。文献标识码为A,文章编号为1673-629X(2026)07-0143-08。该研究受中国高校产学研创新基金、甘肃省自然科学基金及甘肃中医药大学创新创业基金等多个项目资助。
二、 研究背景与研究目的
本研究属于中医药信息学与人工智能的交叉领域,具体聚焦于智能中药处方推荐。传统中医诊疗依赖医者经验进行方剂配伍,存在知识传承和临床决策的局限性。随着中医药现代化的发展,构建高效的推荐模型以辅助临床组方意义重大。现有基于图卷积网络的推荐方法虽然取得了一定进展,但仍面临三大核心挑战:一是语义建模薄弱,难以有效处理中医症状和中药术语的多义性和语境依赖性;二是对图稀疏性处理不足,处方数据中实体间的关联稀疏,导致模型训练不充分,难以挖掘复杂模式;三是特征融合粗糙,未能充分区分和协同利用不同关系图谱(如症状共现、症药对应、中药配伍)的异质语义。针对上述问题,本研究旨在提出一个优化的中药处方推荐模型,通过增强语义表征、优化稀疏图上的邻居聚合机制,以及实现多源图特征的差异化融合,来提升处方推荐的准确性和合理性。
三、 研究方法与工作流程
本研究的实验流程可分为数据处理、语义嵌入、多图构建、图表示学习、特征融合与预测五个主要步骤。
数据准备与预处理:研究采用Yao等人提出的公开数据集PTM。依据《中医症状鉴别诊断学》和《中医药主题词表》中定义的标准症状集(603种)和中药集(970种),对原始98,334条处方数据进行筛选和标准化,最终保留了33,765条同时包含标准症状和中药的有效处方。该数据集包含390种症状和805味中药,并按照6:2:2的比例划分为训练集、测试集和验证集。中药的属性信息(如药性、药味、归经)则提取自《中华人民共和国药典》。
MedBERT语义嵌入:为解决中医术语的语义建模难题,研究引入并微调了MedBERT模型。该模型是一种在中文医学语料上预训练的语言模型。研究团队进一步在包含48,665条中医临床问诊记录的语料库上,对MedBERT进行了15轮的继续预训练(采用掩码语言模型与下一句预测任务),使其更能适配中医的语言特点和逻辑。在随后的处方推荐任务中,采用分层参数控制策略进行联合微调:冻结底层Transformer编码层以保留通用医学语义知识,开放高层语义整合层与输出投影层参与训练(学习率设为1e-5),从而获得症状、中药及属性文本的、蕴含丰富中医语境的统一语义向量表示。
多图及知识图谱构建:为区分不同关系的语义,模型构建了四个独立的图结构。
重要性采样的图卷积表征学习(PinSAGE-KGCN):这是本研究的核心技术创新点。研究在知识图卷积网络(KGCN)框架中引入了PinSAGE重要性采样机制。对于每个目标节点,PinSAGE并非聚合其所有邻居,而是利用随机游走统计邻居的重要性权重,筛选出高相关性的邻居进行加权聚合。这一机制有效缓解了图稀疏性导致的邻居冗余和过度平滑问题,使模型能更精准地捕捉核心关联信息。症状节点和中药节点分别在各自所属的图谱中,通过两层的PinSAGE-KGCN进行层次化嵌入更新,得到蕴含结构信息的特征向量。
特征融合与预测层:模型采用多头注意力机制来动态融合来自不同图的多源特征。在症状侧,将症状-症状图与症状-中药图的输出特征进行加权融合;在中药侧,将中药-中药图与中药属性图的输出特征进行加权融合。消融实验中的权重分析表明,不同的注意力头能够差异化地关注共现关系、治疗关联或配伍结构。随后,融合后的症状特征通过多层感知机(MLP)编码为统一的症状集合表示,并与融合后的中药特征进行相似度计算,最后通过Sigmoid函数输出每味中药针对给定症状集的推荐概率。模型以多标签二元交叉熵损失函数作为优化目标。
四、 主要实验结果与分析
研究通过多组实验验证了所提模型的有效性,并采用精确率(Precision@K)、召回率(Recall@K)及F1分数(F1-score@K,K取5,10,20)作为评估指标。
模型对比实验:与KGAT、LightGCN、SMGCN、MGCN、KDHR及LAMGCN等主流通用推荐模型和中药专用推荐模型相比,本研究提出的模型在所有指标上均取得了最优性能。具体而言,在F1-score@5、@10和@20上,相较于次优的LAMGCN模型,本研究模型分别提高了9.25%、8.58%和9.07%。这一结果表明,通过MedBERT增强语义、结合多图(包括属性图)结构,并利用PinSAGE优化邻居聚合,能显著提升推荐的准确性。
消融实验:用于验证各核心组件的贡献。实验结果证实:
阈值敏感性分析:针对中药共现阈值𝜃_h的敏感性分析表明,模型性能随阈值增大呈先升后降趋势,在𝜃_h=35时达到最优。这证明了合理设置阈值对于平衡图结构的信息量与稀疏度至关重要。
推荐实例分析:通过具体医案展示,即使模型推荐的中药未在真实处方中直接命中,但其功效往往与真实药材高度相似,可作为临床合理的替代或补充方案,体现了模型在语义层面的泛化推理能力。
五、 研究结论与价值
本研究成功构建了一个基于重要性采样多图卷积的中药处方推荐模型,形成了从“语义理解”到“结构推理”的端到端智能推荐框架。其科学价值在于:提出了一个将领域预训练语言模型、异构知识图谱与重要性采样图卷积网络深度融合的新范式,有效解决了当前处方推荐中语义、结构和融合三个层面的核心难题。应用价值在于:该模型在处方推荐的准确性与合理性上较现有方法有显著提升,为中医药临床辅助决策系统提供了有效的技术路径,有望帮助医生,尤其是经验尚浅的医生,进行更精准的辨证论治和方剂配伍,推动中医药诊疗的智能化发展。
六、 研究亮点
本研究的亮点主要体现在三个方面: 1. 方法创新:首次将PinSAGE重要性采样机制引入中药处方推荐的KGCN框架中,专门针对图结构稀疏、邻居质量不均的痛点进行优化,提升了图学习的鲁棒性。 2. 语义增强:使用经过中医语料继续预训练和任务微调的MedBERT模型,为症状和中药提供了动态、上下文相关的语义初始化,显著优于传统的静态词向量方法。 3. 知识整合:系统性地构建了包含症状共现、症药治疗、中药配伍和中药属性(性味归经功效)四类异构关系的图结构,并通过多头注意力机制实现差异化融合,更全面地模拟了中医组方逻辑。
七、 研究局限与展望
尽管成果显著,作者也坦承了研究的局限性。其一,数据来源于公开方剂文献,样本分布可能存在偏向性,对临床罕见病症覆盖不足。其二,模型尚未纳入患者的个体特征、证候动态演变和治法差异等实时诊疗要素。未来研究可探索引入时间序列模型或因果推理方法,构建动态图网络,以进一步提升模型的临床解释性和泛化能力。