本文发表于 *Science of Traditional Chinese Medicine*(2026年第4卷第2期),通讯作者为北京交通大学计算机科学与技术学院、南京中医药大学及江苏康缘药业股份有限公司的周雪忠(Xuezhong Zhou),以及重庆中医药学院智能中医研究院的赵宗耀(Zongyao Zhao)。第一作者为董鑫(Xin Dong)、潘格燕(Geyan Pan)及唐菊贤(Juxian Tang)等。
本文是一篇系统的文献综述,旨在全面回顾中医(Traditional Chinese Medicine, TCM)草药处方推荐(Herbal Prescription Recommendation, HPR)领域的计算模型与方法进展。随着人工智能(Artificial Intelligence, AI)技术的飞速发展,将AI用于从临床数据中学习处方规律并生成个性化治疗方案已成为中医现代化的重要方向,但目前缺乏对该领域AI驱动方法的系统性梳理。
综述将现有方法系统地归为以下五个主要技术范式,并逐一进行了介绍与比较。
其一,传统机器学习方法。该方法通常将草药处方推荐构建为一个多标签分类问题,基于患者的症状特征,独立地预测每味草药作为标签,而忽略了草药之间复杂的配伍与协同关系。例如,Mi等人曾探索使用逻辑回归、K近邻、决策树和随机森林等经典算法进行处方预测,为HPR任务建立了性能基准。
其二,主题模型方法。这类方法将每一张处方视为一个“文档”,将症状和草药看作“词语”,而潜在的“主题”则对应着治疗模式。它们通过建模症状与草药在处方中的共现关系,来揭示临床数据中潜藏的治疗结构。代表性工作包括Zhang等人提出的用于分析糖尿病处方的症状-草药-诊断主题模型,以及Yao等人构建的处方主题模型(Prescription Topic Model, PTM),后者模拟了经典中医理论指导下的处方生成过程,是该领域的一个关键基准模型。此外,Wang等人通过引入知识图谱嵌入,实现了对统计关系和语义关系的联合捕获。
其三,深度学习和图结构方法。随着图神经网络(Graph Neural Networks, GNNs)和知识图谱技术的成熟,研究者利用图结构来表示症状、草药、证候等实体间的复杂关系,以增强特征学习的可解释性和推荐准确性。例如,Jin等人提出的SMGCN模型利用多图卷积网络进行证候感知的草药推荐;Dong等人提出的PresRecST模型则通过整合症-证-治-方的步骤化推理策略,模拟中医临床辨证论治的完整过程。后续研究还进一步通过融合大规模语义信息与草药分子属性、引入对比学习框架、结合强化学习优化慢性病长期治疗策略等方式,持续推进该领域的发展。
其四,序列生成模型方法。该方法将处方生成视为一个序列建模任务,通常采用带有注意力机制的序列到序列架构,根据症状信息有序地生成草药序列,从而捕获草药间的依赖性和配伍规则。代表性模型包括Wang等人提出的基于Transformer的TCM-Translator、引入双重注意力机制的AttentiveHerb,以及利用指针网络融入草药功效知识的Herb-Know等。
其五,大语言模型(Large Language Models, LLMs)方法。近年来,LLMs在中医领域发展迅速,通过大规模预训练和指令微调,模型能够整合海量中医知识,应对辨证推理的复杂性。例如,专为中医优化的大语言模型“岐伯”(Qibo)通过两阶段训练框架衔接中医理论与现代医学;“BianCang”则采用知识注入和输出对齐的两阶段训练策略,提升了诊断准确性。同时,研究者也建立了多个中医专项评测基准,如MTCMB、TCM3CEval等,用于评估LLMs在中医知识理解、诊断推理和处方生成等多个维度的能力,揭示了通用模型在中医特定任务中仍存在局限。
在方法论述之外,本文还提供了基于公开数据集的基准模型实验对比。研究选用了五个涵盖不同临床场景的中医数据集,包括来自临床的肺系疾病(TCM-Lung)、中风(TCM-Stroke)、失眠(TCM-Insomnia)数据集,以及来自教材知识的内妇外儿(ISGP)和《中医处方辞典》的知识型数据集(TCM-PD)。评估采用了Precision@K、Recall@K和F1-Score@K等多重指标。实验结果表明,专门为中医任务设计的结构化推荐模型在整体性能上具有显著优势。例如,在结构化特征明显的TCM-Lung和中风TCM-Stroke数据集上,具备分步推理能力的PresRecST模型表现最优;在数据异质性高的ISGP数据集上,构建症状子图的TCMpr模型泛化性能最佳;而在TCM-Insomnia数据集上,经典的PTM模型展现了在症状-草药关系建模上的强大能力。相比之下,Qwen3、DeepSeek-R1等通用大语言模型虽然在某些指标上具备竞争力,但因缺乏结构化的中医知识表示,在多数数据集上的稳定性和覆盖度较差,难以生成贴合临床逻辑的处方。
最后,综述指出了该领域面临的五个关键挑战和未来方向:构建反映“理-法-方-药”完整诊疗逻辑的高质量数据集;增强模型的推理能力和可解释性,采用神经-符号推理框架使决策过程透明化;在模型中贯穿“症-证-治-方-药”的语义链,实现更精准的辨证处方;利用大语言模型进行知识泛化与迁移,开发融合结构化知识的中医专用LLMs;推动轻量化部署、动态知识更新与临床集成,通过模型剪枝、联邦学习等技术促进智能处方系统在真实医疗环境中的落地应用。
本文的学术价值在于,它不仅为中医智能化处方推荐领域提供了一个清晰、统一的技术分类视角,还通过详尽的基准实验,对横跨不同技术代际的代表性模型进行了客观的实证比较,揭示了各类方法的适用场景与局限性。其实践意义在于,为研发更可靠、可解释、可用于临床的中医辅助诊疗系统梳理了明确的发展脉络与前进方向,对促进中医现代化和智能化转型具有重要的指导价值。