本研究由台北市立联合医院林森中医昆明院区的黄柏瑜(Poyu Huang) 医生主导,联合中原大学的王启能(Chihnung Wang)、吕绍宏(Shaohung Lu) 等多位研究人员共同完成。该论文发表在 《Journal of Medical and Biological Engineering》 期刊上,于2025年10月24日在线发表,论文卷号为45,页码695至710。
本研究属于中医人工智能(Traditional Chinese Medicine Artificial Intelligence) 与医学信息学(Medical Informatics) 的交叉领域。中医学的核心原则是“辨证论治(Syndrome Differentiation and Treatment)”,即根据患者的具体症状、体质和病理特征,综合分析后确定相应的治疗方案。在中医学中,方剂与证型之间存在着复杂的对应关系,这被称为“方证相应(Correspondence between Formulas and Syndromes)”理论。该理论是中医应用的科学基础,但由于中医文献浩如烟海,对于学生和新手医生来说,高效地检索并应用这些知识极具挑战性。
近年来,大型语言模型(Large Language Model, LLM)和检索增强生成(Retrieval-Augmented Generation, RAG)等技术在知识整合方面展现出巨大潜力。然而,现有的LLM主要依赖传统方剂和文献知识进行训练,忽视了在亚太及北美地区临床实践中广泛使用的中药浓缩制剂(Finished Herbal Product)。此外,睡眠障碍作为一种影响广泛的现代健康问题,其全球患病率普遍超过10%,且与心血管疾病、代谢紊乱等多种健康风险密切相关。
因此,本研究旨在将LLM与RAG技术相结合,开发一个聚焦于睡眠障碍的生成式人工智能(Generative AI)中医系统。该系统的主要目标有两个:一是建立一个能够根据方剂组合推断证型,以及根据证型反向推演方剂组合的“疾病-方剂-证型(Disease-Formula-Syndrome)”推理模型;二是打造一个便捷的中医诊疗学习工具和临床辅助诊断支持工具。
本研究的工作流程主要分为四个核心部分:数据准备与知识库构建、RAG系统架构搭建、评估方案设计以及反向验证。
1. 数据准备与知识库构建
研究团队首先从台北市立联合医院中医科病例数据库(2016-2023年) 中提取数据。病例筛选标准为:主要ICD疾病代码为G47或F51,即排除其他合并症的单纯性睡眠障碍病例。通过此方法,共筛选出6747例门诊病例,并匹配了其对应的治疗处方记录。
由于原始病例数据库不直接包含证型数据,研究团队邀请了经验丰富的中医执业医师,将这些处方中的单味药(Single-Herb, SH)和复方药(Compound-Herb, CH)匹配到其对应的证型上。所形成的“疾病-方剂-证型”数据被处理成纯文本(txt)文件。在这里,数据格式的选择成为了研究的第一个技术关键点。团队发现使用CSV格式会导致LLM回答准确率低下,因为该格式将每行数据视为一个文本块,提供的上下文不充分。而转换为TXT格式(TXT Format) 后,每个方剂-证型条目作为一个独立的文本块(Chunk),包含约30-60个中文字符,显著提升了向量化效率与检索精确度。最终,这些文本文件被转换并存储在一个向量数据库(Vector Database)中,形成了轻量且高效的RAG知识库。
2. RAG系统架构搭建
在技术架构层面,研究团队使用了LangChain框架(LangChain Framework) 来构建LLM应用。LangChain的核心功能在于能够将LLM与外部数据源(即本研究的向量数据库)整合,协调检索与生成过程。将文本知识库数据转换为语义向量的嵌入模型(Embedding Model),团队最终选定了ganymedenil/text2vec-large-chinese模型,原因在于该模型专门针对中文场景优化,在中文语义理解、分词和上下文分析方面表现优异,优于之前测试的多项多语言模型。用于存储和检索向量的数据库则选用了Chroma,因为它能无缝集成于LangChain框架。
作为核心推理引擎,研究采用了NVIDIA AI Foundation Models 套件中的 Llama 3.1 405B 大模型。为了在医疗健康这类高风险领域最大程度减少随机性与错误,模型的温度参数(Temperature Parameter) 被设置为0.0,以确保生成输出的完全确定性和精确性。
为了精确引导模型行为,提示词设计(Prompt Design)至关重要。研究中针对不同任务设计了特定的提示词。例如,在由方剂推证型时,提示词设定为:“你是一位资深的中医师。请优先依据向量库参考文档的上下文资讯回答。提供20个字以内的证型,无需解释,并严格使用繁体中文回应。”这确保模型仅输出核心证型,排除了功效介绍、证候演变等无关信息,也避免了输出混杂简体中文的情况。
3. 评估方案设计
论证评估部分,研究首先对6747个病例的用药频率进行排序,选出使用率最高的五种SH和五种CH作为评估样本。五种高频SH分别为:夜交藤(Ye Jiao Teng)、远志(Yuan Zhi)、丹参(Dan Shen)、茯神(Fu Shen)和石菖蒲(Shi Chang Pu)。五种高频CH分别为:加味逍遥散(Jia Wei Xiao Yao San)、天王补心丹(Tian Wang Bu Xin Dan)、温胆汤(Wen Dan Tang)、酸枣仁汤(Suan Zao Ren Tang)和甘麦大枣汤(Gan Mai Da Zao Tang)。
这些样本被组合成三种模式进行测试: - 一CH + 一SH - 一CH + 二SH - 二CH + 一SH
将上述组合提交给RAG-LLM,让其生成对应的证型,并将生成结果与由资深中医师提供的实际证型进行比较。评分工作由两位拥有超过20年临床经验的中医师完成,采用一套用于评估医学生处方能力的评分标准进行打分。例如,在“一CH + 一SH”组合中,若生成的CH证型与实际CH证型匹配得80分,SH证型匹配得20分,满分100分。
4. 反向验证
除了根据方剂推断证型,研究还设计了反向验证(Reverse Query)环节。即,使用相同的知识库,向RAG-LLM提求证型组合,检验其是否能反向生成正确的方剂组合,从而双向评估系统的准确性和可靠性。
1. 由方剂推断证型的结果
在“一CH + 一SH”的25种组合中,仅有甘麦大枣汤与石菖蒲(cf5 + sf5)这一组合的CH证型生成了错误结果,得分为20分。其实际证型应为“心脾血虚夹脏躁”和“痰湿阻心胃”,而模型却将前者误判为“心脾气虚夹湿困”。其余24种组合均正确匹配,获得满分,准确率高达96%。
在“一CH + 二SH”的50种组合中,绝大多数获得了90分以上的高分。90分意味着系统成功生成了复方的证型和两个单味药中的一种证型。有4种组合仅得到了10至20分,完全识别错误或仅识别出一种SH证型。这些错误多集中在温胆汤、甘麦大枣汤等与其他药物配对时,模型对核心CH证型的辨识出现偏差。
在“二CH + 一SH”的50种组合中,有9种组合得到80分,原因是对SH证型的识别有误,而对至少一种CH证型的识别是正确的。其余41种组合均获得满分。总体来看,系统在绝大多数情况下能够提供完整的证型对应,至少也能提供主要的CH方剂证型(得分高于80分)。
2. 反向验证结果
在由证型反向推断方剂的测试中,系统同样展现了良好的性能。在“一CH + 一SH”的反向查询中,3种组合因CH识别错误导致仅得20分,1种组合因遗漏了SH导致得80分。在“一CH + 二SH”的50种组合中,有4种因SH辨识错误得到90分,1种CH辨识错误得20分,其余均满分。在“二CH + 一SH”的50种组合中,仅3种组合因SH识别错误得到80分,其余均为满分。
这些结果表明,尽管在少数案例中,模型在单味药的辨识或复方药物的完整性上存在疏漏,但其整体性能表现卓越,无论是在正向推断证型还是反向推演方剂的任务中,都能展现出高度的临床相关性和准确性。
本研究成功开发了一个基于检索增强生成与大型语言模型的“疾病-方剂-证型”推理方法,并将其应用于中医睡眠障碍领域。该研究具有以下重要价值:
此外,研究还揭示了技术实现过程中的关键细节对LLM输出准确性的重大影响,包括RAG知识库的文件格式、嵌入模型的选择、向量数据库的类型以及提示词的精确配置。这些发现为构建高效且准确的生成式AI系统提供了宝贵的实践经验和见解。
本研究的亮点主要体现在三个方面。首先,在创新性结合上,它将中医“方证相应”理论与前沿的生成式AI技术相融合,开发出能双向推理的“疾病-方剂-证型”框架,为中医的数字化与智能化提供了新范式。其次,在方法学的技术细节探索上,研究并非单纯应用技术,而是通过对比实验,详细论证了TXT文件格式、中文专属嵌入模型、以及严格提示词工程对提升中医这一垂直领域模型准确率的决定性作用,对后续研究具有重要的参考意义。最后,在研究对象特殊性上,该研究直接聚焦于临床上广泛使用但常被模型训练忽略的“中药浓缩制剂(Finished Herbal Product)”,弥补了这一领域的空白,使得研究成果更具临床转化潜力与实际应用价值。