主要作者与机构:本文的第一作者为陈展涛(Zhantao Chen),其所属机构包括斯坦福大学材料与能源科学研究所(Stanford Institute for Materials and Energy Sciences)、SLAC国家加速器实验室(SLAC National Accelerator Laboratory)的林纳科相干光源(Linac Coherent Light Source)以及德克萨斯大学奥斯汀分校(The University of Texas at Austin)。通讯作者为陈展涛和Joshua J. Turner。该研究于2026年7月1日在线发表于《Nature Machine Intelligence》期刊第8卷,页码为1075至1086。
学术背景与研究目的:在当代大型科学装置(如同步辐射X射线光源、中子源和自由电子激光设施)中开展实验,通常需要大量人类专家的监督与操作。尽管AI在模拟、预测和数据分析方面已显示出巨大潜力,但让AI系统自主规划并执行物理实验,仍是通往全自主科学发现之路上的核心难题。本文旨在解决这一难题,其核心目标不是提出全新的学习算法或智能体架构,而是利用现有具备推理能力的大语言模型(Large Language Model, LLM),通过结构化工具调用和闭环迭代,在真实同步辐射光束线上自主完成X射线单晶样品对准这一关键实验步骤。研究团队首先在虚拟实验环境中开发并验证了“AI X射线科学家”的工作流程,随后将其成功部署到斯坦福同步辐射光源(Stanford Synchrotron Radiation Lightsource, SSRL)的BL7-2光束线上。该研究为大型散射设施中的多样化实验环境实现自主操作迈出了重要一步。
详细工作流程:本研究的方法体系由三大部分构成:虚拟光束线模拟器的构建、模型上下文协议(Model Context Protocol, MCP)工具框架的开发,以及基于LLM的智能体引导与实验执行。研究团队在Python中构建了一个虚拟光束线,该模拟器使用You等人提出的算法计算每个探测器像素对应的动量转移矢量(momentum transfer vector,q),并利用pymatgen库中的实现计算衍射强度。模拟器对峰形施加高斯展宽和非各向同性拉伸(在h、k、l方向分别乘以1.0、1.5和0.75的相对因子),并加入死像素、热像素和读出噪声等伪影,使生成的探测器图像在视觉上更接近真实数据。实验对象为磁性外尔半金属Co₃Sn₂S₂单晶样品,其晶体结构属于菱方空间群R-3m(编号166),在六方晶胞中晶格参数为a = b ≈ 5.36 Å,c ≈ 13.02 Å。该虚拟光束线模拟了六圆衍射仪(six-circle diffractometer),包括两个探测器电机(δ和ν)和四个样品电机(φ、χ、η和μ),其电机限位直接取自SSRL BL7-2光束线的实际参数。AI智能体通过MCP服务器提供的工具与虚拟或真实光束线交互。MCP工具包括execute_command(执行终端命令)、get_sample_information(查询样品信息)、read_log(读取终端日志)、read_and_plot_image(读取并绘图探测器图像)等。智能体可以调用一系列终端命令,如umv(移动电机至指定位置)、dscan(执行线性扫描)、pd exposure(获取探测器图像)、ca(计算给定米勒指数对应的电机位置)、or0和or1(设置主次参考反射)以及setlat(设置晶格参数)等。在虚拟实验中,AI智能体直接通过MCP工具执行所有命令,无需人工干预。在真实光束线实验中,出于安全考虑,AI智能体生成命令后由人类实验员原样传递执行,人类仅作为被动安全中介,不影响AI的决策过程。
在引导框架方面,研究团队采用上下文学习(in-context learning)方法,通过精心设计的长提示和短提示引导LLM。长提示提供详细的工作流程文档和工具使用说明,短提示则包含工作目录、结构文件位置和关键提醒。样品对准工作流程分为三个主要阶段:设置阶段、主参考反射搜索与优化阶段、次级参考反射搜索与优化阶段。在设置阶段,AI智能体获取X射线波长、晶格参数和可访问反射列表。在主反射搜索阶段,智能体根据目标反射的2θ角计算理论电机位置,然后通过η、χ和δ扫描优化峰强度并居中布拉格峰。在次级反射搜索阶段,由于需要解决面内取向,通常需要足够宽的φ扫描。重要的是,该高层工作流程仅作为概念框架,而非硬编码执行脚本:AI智能体自主决定调用哪些工具、何时在阶段间转换以及如何根据中间观察结果配置电机扫描。
在虚拟验证实验中,研究者对两种LLM——Claude Sonnet 4和Gemini 2.5 Flash——进行了基准测试。每个模型执行10次独立运行,每次运行中引入了随机电机偏移(δη服从均值为0.0°、标准差为0.5°的正态分布,δφ服从均值为0.0°、标准差为1.5°的正态分布)。此外,智能体获得的名义晶格参数为a = b = 5.36 Å、c = 13.02 Å,而虚拟光束线实际使用的模拟强度是基于更大的晶格参数a = b = 5.5 Å、c = 13.2 Å生成的,以增加任务难度。评估指标包括对准误差(alignment error,定义为预测取向矩阵与真实取向矩阵之间的相对角偏差)和晶格参数c的绝对误差。
主要结果:在虚拟实验中,两个模型均在大多数情况下成功对准了样品。Claude Sonnet 4在10次运行中有10次实现了对准误差≤15°(成功标准),Gemini 2.5 Flash也在10次运行中取得了10次成功。多数运行的对准误差低于5°。较大的对准误差主要源于AI智能体在调整δ和χ电机时峰居中不够精确,但即使在这些情况下,智能体仍能成功在探测器上定位峰。在晶格参数估计方面,两个模型均在超过半数试验中将c参数的绝对误差控制在0.01 Å以下。为进一步评估鲁棒性,研究团队在多种挑战性场景下评估了Gemini 2.5 Flash:基线条件、更大电机偏移、多晶粒衍射、缩减推理预算(512个token的思考预算)和降低的LLM采样温度。结果表明,在成功运行中,智能体通常能合理准确地恢复样品取向和晶格参数,但在对抗性条件下性能有所下降,特别是当推理深度受限时。
在真实光束线实验中,研究团队使用更强的模型Claude Opus 4,以最大化鲁棒性并最小化有限光束时间内的操作风险。实验在SSRL BL7-2光束线上进行,入射X射线能量为16.0 keV(波长约0.7749 Å)。AI智能体被提供了与虚拟实验相同的引导提示,但增加了一条安全约束:智能体必须以“execute command: [命令]”的格式输出其意图执行的终端命令,由人类实验员原样传递执行。对Co₃Sn₂S₂样品,AI智能体首先选择了镜面反射(0, 0, 6)作为主参考反射,将η和δ电机设置到理论值后捕获探测器图像,发现一个微弱峰。随后执行η扫描并优化强度。值得注意的是,AI智能体识别出约1.22°的意外η偏移(可能由铜样品架的不平整表面引起),在其推理中突出显示这一偏差并相应更新η值,展示了适应实验缺陷的能力。接着,AI智能体通过χ和δ扫描完成居中过程,最终获得高质量对准。在次级参考反射阶段,AI智能体基于计算的角距离和峰强度选择了(1, 0, 10)反射,并考虑到先前发现的η偏移,将目标η值调整为0.84°。尽管AI智能体事先未获得任何关于样品面内取向的信息,但峰在φ扫描之前就已出现(由于样品初始放置较好)。AI智能体仍执行了足够宽的φ扫描(-30°到30°),最终确定了正确的面内取向(φ≈-2.88°),并完成了峰居中和强度优化。在整个过程中,AI智能体始终聚焦于布拉格峰,有效忽略了探测器图像中出现的强衍射环。
研究团队还使用单晶硅样品进行了真实实验演示,AI智能体在存在1.5°显著电机偏移和极尖锐峰值的挑战性条件下成功对准了样品。这些真实世界演示提供了概念验证证据,表明AI X射线科学家能够在真实实验环境中可靠灵活地运行。
结论与意义:本研究展示了一种通过虚拟实验准备智能体AI X射线科学家并在真实同步辐射X射线仪器上验证其性能的方法。该AI系统在虚拟基准测试中展示了良好性能,并在真实实验中成功对准了具有尖锐峰的高质量硅单晶和具有较宽峰的Co₃Sn₂S₂样品。特别值得注意的能力是AI智能体在后续对准步骤中识别并复用与意外电机偏移相关的经验校正,展示了超越固定脚本工作流的自适应推理和短期实验记忆。本研究的核心贡献在于证明:当与结构化工具接口、持久实验状态和迭代上下文推理相结合时,现有推理型LLM能够在真实科学环境中执行多步自主实验工作流。该研究将样品对准作为广泛相关的实验前提任务,为同步辐射X射线、X射线自由电子激光和中子实验的自主化奠定了基础。未来方向包括开发元智能体以帮助构建和优化仪器特定的引导提示、改进工具接口、引入检索增强推理和数据驱动的实验规划等。研究团队设想,自主AI系统未来将不仅作为自动化工具,而且作为科学助手甚至合作者,提高复杂设施的效率并开启全新的实验模式。
研究亮点:本研究的核心亮点在于:(1)展示了LLM驱动的智能体在真实同步辐射光束线上自主执行闭环实验的能力,而不仅仅是在模拟环境中;(2)开发了虚拟光束线模拟器与MCP工具框架,使AI智能体能够在虚拟环境中充分准备后再迁移到真实实验,大幅降低了对稀缺光束时间的依赖;(3)AI智能体在真实实验中展示了识别并补偿意外电机偏移的自适应能力,以及在存在强衍射环干扰时保持对目标布拉格峰专注的鲁棒性;(4)该工作流程不依赖于特定的LLM,而是采用现成的推理模型,降低了部署通用AI X射线科学家的门槛,为未来整合基于学习的组件提供了基础框架。