本研究由北京大学医学部、上海人工智能实验室和北京大学前沿交叉学科研究院的科研团队联合完成。主要作者包括张立生、王立龙、孙祥宇、唐伟、苏浩洋等,通讯作者为王晓松、白磊和谢正伟。该论文于2026年4月2日发布在bioRxiv预印本平台上,题为《MolClaw: An Autonomous Agent with Hierarchical Skills for Drug Molecule Evaluation, Screening, and Optimization》。
计算药物发现(computational drug discovery)是当代药物研发中资源消耗最为密集的环节之一。一款新药从概念到上市通常需要10至15年时间,投入超过10至20亿美元,而进入I期临床试验的候选药物中最终能够上市的比例不足十分之一。早期计算药物发现流程包含靶点结构测定、结合口袋识别、虚拟筛选、从头分子生成、分子对接、结合自由能估算、ADMET(吸收、分布、代谢、排泄、毒性)分析以及迭代先导化合物优化等多个步骤。每一步都依赖专门的软件工具,且输入输出格式各异、参数空间复杂、学习曲线陡峭,一个典型的基于结构的虚拟筛选项目往往需要数天的人工操作来协调格式转换、参数调整和各阶段之间的质量控制。
近年来大语言模型(LLM)的快速发展为自动化此类复杂科学工作流开辟了新路径。工具增强的LLM——即AI智能体(AI agent)——能够超越文本生成,规划和执行多步计算任务。然而,现有的AI智能体在高度复杂场景中仍难以维持稳健性能:ChemCrow局限于简单的单步工具调用;BioMNI依赖于每次任务临时编写Python脚本的代码执行范式,缺乏结构化、可复用的工作流抽象;DrugAgent仅聚焦于机器学习模型训练;TxAgent完全在临床药理学领域运作。这些系统均未整合基于结构的药物发现所需的完整专业计算化学工具谱系,也缺乏系统的多维基准评测。
为应对这一根本性挑战,研究团队开发了MolClaw——一个基于三层分层技能架构(hierarchical skill architecture)的自主AI智能体。其核心目标是将计算药物发现领域专家知识编码为可复用、可组合、与模型无关的技能模板,从而将LLM从不可靠的临时规划者转变为经过专家验证的协议的合规执行者。
MolClaw的构建围绕三个核心组件展开。
在工具生态层面,MolClaw整合了超过30个专业计算工具,覆盖早期药物发现的完整流程:ESMFold和Chai-1用于蛋白质结构预测,FPocket和P2Rank用于结合口袋识别,Vina-GPU 2.0、DiffDock和KarmaDock用于分子对接,REINVENT 4用于从头分子生成和骨架跃迁,PLIP和ProLIF用于蛋白-配体相互作用指纹分析,EquiScore用于基于结构的打分,Boltz-2用于结合亲和力预测,GROMACS和OpenMM用于分子动力学模拟,gmx_MMPBSA用于MM-PBSA结合自由能分解,ADMET-AI用于药代动力学性质预测,ProteinMPNN用于蛋白质序列设计,RDKit用于通用化学信息学操作。所有工具通过科学上下文协议(Science Context Protocol, SCP)统一标准化,该协议与模型上下文协议(Model Context Protocol, MCP)兼容,提供GPU集群调度、并发任务管理和标准化访问控制。
分层技能架构是MolClaw的方法论核心,包含三层:工具层(L1)包含超过58个细粒度任务特定模板,包装单个工具或功能相关工具族,标准化调用、输入输出验证和质量控制;工作流层(L2)包含11个任务特定框架,将已验证的L1模块组合为端到端工作流,定义工具选择、质量门和失败恢复策略,同时交叉引用L3原则以确保科学严谨性;学科层(L3)是一份综合方法论文档,编码25条正式科学原则,在任何执行前完整加载,建立通用科学治理框架而不指定具体工具调用。这一分层抽象类似于操作系统中的系统调用、库和应用分层,关键在于将专家领域知识编码为独立于底层LLM的可复用模板。
为系统评估MolClaw并建立社区基准资源,团队引入了MolBench,包含三个互补层级:MolBench-MS(分子筛选)评估智能体基于理化约束和活性预测正确过滤和排序分子的能力;MolBench-MO(分子优化)评估智能体在保持核心骨架的同时通过结构修饰改善分子性质的能力;MolBench-E2E(端到端发现)呈现3个综合挑战,每个要求智能体自主执行跨8至50余次连续工具调用的扩展多阶段工作流。
MolClaw在所有MolBench评估维度上均取得了最先进性能。在分子性质过滤任务中,所有基于智能体的系统均达到≥96%的准确率,表明工具访问而非技能设计是性能瓶颈。然而在结合亲和力比较任务中,情形发生了根本性改变:独立LLM平均准确率仅为43.6%,普通智能体框架与最佳LLM相比没有改善(均为51.4%),而MolClaw在Claude Code平台上达到81.1%的准确率,较最佳非MolClaw基线高出24.3个百分点。分子对接筛选任务中,MolClaw-CC实现了0.80的最高平均命中数,而BioMNI完全无法产生有效对接输出。
分子优化任务进一步验证了迭代优化技能的价值。在分子编辑任务中,MolClaw-CC达到100%的完美准确率。在理化性质优化这一最具挑战性的任务中——需要同时改善QED(定量药物相似性估计)、logP和logS三个指标——MolClaw-CC实现了最高的优化增量Δ=1.724,是Claude Code普通版本的两倍,同时保持100%的成功率。
消融实验和统计分析证实分层技能是性能的主要驱动力。在Claude Code平台上,MolClaw的分层技能将结合亲和力准确率从51.4%提升至81.1%(+29.7个百分点),对接命中数从0.56提升至0.80,优化增量从0.866提升至1.724。Friedman检验显示MolClaw-CC在12种方法中取得最佳平均排名(1.5/12),在四项任务中的三项排名第一。
端到端发现挑战揭示了MolClaw在长时间任务中的适应能力。在EGFR激酶结构域的粗粒度构象采样任务中,智能体在遭遇五次工具失败的情况下,通过技能治理的恢复动作自主完成了GōCA和OpenAWSEM双力场模拟及PULCHRA全原子重建,产生了20个经过全部16项数据完整性检查的全原子结构。QED驱动的迭代优化任务中,智能体在单轮内达到QED目标(0.727),通过将丁酯侧链替换为游离羧酸,单次修饰捕获了五轮总QED改善的82.9%。最终推荐分子达到QED=0.799,较基线改善112%。对厄洛替尼的结构引导迭代先导优化任务中,智能体执行了六轮策略-生成-对接-评估循环,将对接分数从-6.9 kcal/mol改善至-8.9 kcal/mol的目标,在七个评估标准上获得满分100/100。值得注意的是,54个对接分子中20个来自REINVENT 4生成,34个来自智能体自主设计的硬编码类似物列表,两者在轮次胜者上呈现3:3的平局。
本研究最具启发性的发现不在于MolClaw超越了基线,而在于它在哪里超越、在哪里没有超越。分层技能在性质过滤上带来了零收益,在分子编辑上带来边际改善,但在结合亲和力比较和理化优化上产生了变革性增益。这一随任务复杂度单调递增的技能驱动改善关系揭示了一个对科学AI智能体设计具有广泛启示的概念性区分:工具访问(tool access)和工作流编排能力(workflow orchestration competence)是根本不同的能力,后者构成多步计算工作流的主要性能瓶颈。
MolClaw通过三层技能间的实时协作解决了分子优化智能体缺乏结构化收敛机制的持久局限:L3方法层要求每轮优化遵循评估→诊断→设计→验证循环;L2工作流层通过计数门和映射门检查点将此要求操作化;L1工具层确保每个计算步骤以经验证的参数执行。三层并非孤立运作——L2在决策点交叉引用L3原则,L1将错误信号向上传播触发L2回退协议,将LLM从不可靠的规划者转变为指南合规的执行者。
在科学价值层面,MolClaw的端到端任务揭示了基于结构的优化范式:对接嵌入每次迭代中,锁定参数确保分数差异归因于结构修饰而非设置变化。残基水平分析鉴定Met769(铰链区)为唯一具有统计学意义的亲和力驱动因素(Δmean = -0.41 kcal/mol, p = 0.007),而两个达到目标分数的分子通过不同的氢键网络(DFG邻近通路和催化赖氨酸通路)实现相同分数,揭示了优化景观中的简并极小值。
在应用价值层面,MolClaw的模型和平台无关设计具有重要实际意义:技能层在不同LLM后端和智能体运行时之间充当性能均衡器,这意味着MolClaw的能力将随着LLM和智能体平台的进步自动提升,无需修改技能定义本身。研究团队还指出了当前局限——包括Ames致突变性恶化从未被标记的注意力偏差、静态技能层缺乏从先前执行中学习的能力、以及启发式收敛标准——并提出了面向未来的研究方向,如“未监测终点警报”和将贝叶斯优化采集函数整合到迭代循环中。这些发现和设计原则有望从药物发现推广至材料发现、合成生物学和气候建模等任何需要多工具、多步骤、多目标编排的科学领域。