分享自:

一种具有自进化能力的多智能体大语言模型框架,用于自主、工具感知的生物医学数据分析

期刊:Nature Biomedical EngineeringDOI:10.1038/s41551-026-01634-6

本文属于类型a,是一篇关于新型人工智能框架BiomedAgent的原创研究论文。以下是基于原文内容的学术报告。


研究概述

该研究由中国科学院计算技术研究所的Dechao Bu、Jingbo Sun、Yi Zhao,广州国家实验室的Kun Li、Gen Li、Kang Zhang,以及中国科学院生物物理研究所的Runsheng Chen等来自多家知名机构的科研人员共同完成。这项成果发表于国际顶级学术期刊 nature biomedical engineering,文章于2025年5月17日投稿,2026年2月13日被接收。通讯作者为Kang Zhang、Runsheng Chen和Yi Zhao。

研究背景与目的

生物医学领域正经历史上最大的数据爆炸,基因组学、转录组学、蛋白质组学等多组学(multi-omics)数据以及数字病理学、电子健康记录等产生的海量数据,为疾病研究和药物开发提供了前所未有的机遇。然而,分析这些大规模生物医学数据需要整合生物信息学、人工智能、软件编程和统计学等多种复杂计算技能,这对缺乏计算背景的生物医学专家构成了巨大挑战。尽管Galaxy、Nextflow等现有平台试图简化工作流程,但它们仍受限于预定义模板、缺乏自然语言交互以及无法生成可解读性摘要等缺陷。近年来,大型语言模型(Large Language Models, LLMs)驱动的AI智能体(AI agents)为解决这些限制带来了希望,但现有智能体大多局限于特定任务,无法灵活使用多样的生物信息学工具并将其链接成可执行的工作流。

为克服这些局限,研究团队旨在开发一个能够像“虚拟数据科学家”一样,通过自然语言指令自主执行复杂、多步骤生物医学数据分析的通用、自我进化(self-evolving)框架。此框架名为BiomedAgent,其核心目标是让没有计算背景的生物医学专家也能直接参与数据分析和解读。

研究设计与工作流程

该研究共包含以下几个关键环节:

1. 构建BiomedAgent多智能体框架 研究团队首先设计了一个利用GPT、DeepSeek、Gemini等LLMs生成多样化智能体的多智能体(multi-agent)协作框架。BiomedAgent通过“规划(Planning)—编码(Coding)—执行(Execution)”三阶段协作流程来完成任务。在规划阶段,多个智能体协同解读用户需求、选择合适工具并设计分析工作流;在编码阶段,智能体生成必要的代码来调用本地工具或网络应用程序编程接口(Web APIs)实现每一步;在执行阶段,则运行代码并产生结果。该框架的核心创新之一是其工具感知灵活性(tool-aware flexibility):它包含一个工具管理器智能体(tool manager agent),能够通过阅读工具文档来学习如何使用本地部署的67个专业生物信息学工具(如BWA、GATK等),而无需重新编写代码。当所需工具缺失时,它还能生成自定义工具代码(custom tool code, CTC)来填补空白。

2. 引入自我进化机制 为赋予系统自我进化能力,BiomedAgent整合了交互式探索算法(Interactive Exploration, IE)记忆检索算法(Memory Retrieval, MR)。IE算法模仿人类团队协作,让智能体在遇到新问题时,通过多轮次的交互反馈和讨论来优化规划和编码,从而扩展探索空间、寻找潜在解决方案。MR算法则让系统记录成功的工具选择、工作流和执行代码,形成工具记忆、规划记忆和编码记忆。当遇到类似任务时,它会通过语义相似度查询来复用过去的成功经验,从而减少重复探索。研究还对比了两种记忆更新策略:持续记忆累积(continuous memory accumulation, CMA)迭代记忆遗忘(iterative memory forgetting, IMF),发现IMF策略能更快收敛并达到更优性能,同时占用更少记忆空间。

3. 建立Biomed-AQA基准测试集 为全面评估BiomedAgent的性能,研究团队手动构建了名为Biomed-AQA的基准测试集,包含327个生物医学数据分析问题。这些问题覆盖了五大类别:组学分析(Omics analysis, O)、精准医学支持分析(Precision medicine, P)、机器学习(Machine learning, M)、统计分析(Statistical analysis, S)和数据可视化(Visualization, V),涉及DNA测序、单细胞RNA测序(scRNA-seq)、分类、回归等17种任务类型。每道题都标注了必要的执行步骤和里程碑。题目还分为明确了步骤的“清晰步骤型(clear-step)”和只说明目标的“开放步骤型(open-step)”。评估采用了创新的“获胜分数(win score)”体系,结合了人工评估和一个与人工评估一致性达92.3%的自动评分智能体(autoscoring agent),并专门开发了包含172道多选题的子集(Biomed-AQA-MCQ)以支持完全自动化的客观评估。

4. 真实世界应用验证 除了基准测试,研究还将BiomedAgent应用于三项复杂的真实生物医学研究场景中,以验证其实用性。第一项是针对非小细胞肺癌(NSCLC)的跨组学分析(cross-omics analysis),整合了67个样本的批量RNA测序(bulk RNA-seq)数据和22个单细胞RNA测序矩阵文件。第二项是复现一项发表于《自然-医学》(Nature Medicine)的研究,利用循环肿瘤DNA(ctDNA)数据构建机器学习模型,预测癌症患者静脉血栓栓塞(VTE)的风险。第三项是整合分辨率增强工具MIHATP v.1.0,改进病理图像中的细胞分割与分类(cell segmentation and classification)。

主要研究结果

1. 总体性能评估 BiomedAgent在Biomed-AQA基准测试上取得了77%的总体成功率,显著优于其他LLM智能体。在五大任务类别中,它在组学分析(O)上取得94%的成功率,在机器学习(M)上取得90%,在精准医学(P)上为78%,数据可视化(V)为65%,统计分析(S)为59%。即使面对平均包含6个规划步骤的精准医学(P)等复杂任务,其性能也保持稳健。当使用不同底层LLM(如DeepSeek V3和Qwen3)时,BiomedAgent保持了鲁棒性(robustness),成功率分别达到77%和75%,显示出模型无关的通用性。

2. 模块效能分析 - 本地工具使用(Local tool usage, LTU):是否使用专业工具是成功的关键。有LTU的任务其“获胜分数”显著高于无LTU的任务。在全部成功任务中,46.25%的任务仅使用了LTU,28.85%的任务仅使用了CTC,24.90%的任务两者结合使用。 - 多智能体协作与IE算法:IE算法使平均成功率从无IE策略的28%近乎翻倍提升至52%。超过30.5%的成功任务在规划阶段需要额外交互,48.6%在编码阶段需要额外交互。这证明了协作智能在修复错误、优化方案中的关键作用。 - 自我进化与MR算法:经过三轮迭代学习的自我进化(self-evolving)后,成功率从52%进一步提升至77%。在组学分析(O)类别中,成功率从66%提高到94%。重要的是,在一个只使用70%问题的记忆学习后,系统在未见过的30%问题上成功率仍能达到69%,显著高于学习前的52%,这证实了其自我进化能力具有可泛化性,而非简单的答案记忆。

3. 泛化能力与外部验证 在不依赖领域特定工具、仅凭CTC的情况下,BiomedAgent在外部基准测试Bixbench(包含50多个真实场景和296个问题)上亦表现出色,在开放问题上的准确率达到49%,显著优于基准提供的基线智能体(37%),验证了其强大的泛化能力。

4. 真实世界应用效果 - 跨组学分析:BiomedAgent成功通过三个自然语言指令,自动完成了从原始测序数据的修剪、比对、定量到细胞聚类、标记物识别,再到跨组学整合的完整流程。它识别出1831个差异表达基因(DEGs),其中78%与官方在线工具GEO2R的结果一致,并成功追踪到关键基因ABCC3、SERINC2和SEZ6L2的细胞起源主要为上皮细胞,结论与已发表文献相符。 - 机器学习建模:系统自动生成并执行了完整的机器学习管道,复现了原研究结论,即基于液体活检的模型(C-index为0.730.74)在预测癌症患者VTE风险方面显著优于Khorana评分模型(C-index为0.61)。 - 病理图像分析:通过整合分辨率增强算法,BiomedAgent改善了四种细胞类型的细胞分割精度,整体Dice分数绝对增益为+0.86%,相较于理论上限的剩余差距闭合了29.9%。

结论与价值

BiomedAgent的诞生标志着向自主化、以数据为中心的生物医学分析迈出了重要一步。它将LLMs重塑为能够执行端到端数据工作流的专业化、交互式智能体,而非仅仅是提供文本或代码片段的问答系统。其科学价值在于,它开创性地解决了通用智能体在专业科学领域中工具集成、多步骤推理和自我进化的核心难题。其应用价值更为深远,通过自然语言交互,它真正“赋能”了缺乏计算专长的生物医学研究人员,使他们能够直接驾驭复杂的生物信息学分析,有望极大地加速科学发现过程。此外,其本地部署和分享机制为构建围绕特定研究主题的生物医学数据分析社区奠定了基础。

研究亮点

  1. 首创性与通用性:BiomedAgent是首个将工具感知、交互式多智能体探索和基于记忆的自我进化能力融为一体的框架,能够在一个系统中处理从组学到可视化的五大类生物医学数据分析任务。
  2. 工具使用的灵活性:独创地结合了本地专业工具使用(LTU)和自定义代码生成(CTC)双重机制,既保证了在成熟场景下的稳定性和可靠性,又确保了对新任务的高度适应性。
  3. 自我进化的可泛化性:其记忆检索(MR)算法被证明并非简单记忆答案,而是通过积累和复用规划、编码等通用经验实现能力的可泛化提升,是实现“AI数据科学家”持续进步的关键设计。
  4. 系统化的评估体系:研究本身发布的Biomed-AQA基准测试集,包含人工标注、自动评分和多选题等多种评估方式,为该领域的可重复、可比较的评估建立了新标准。
上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com