分享自:

电催化模拟中机器学习工具的教程

期刊:ACS Materials AuDOI:10.1021/acsmaterialsau.5c00232

本文作者为Bruno Inácio da Silva Roux Leite、Anna Stepanova、Timmo-Hendrik Pukk、Denis Savchenko、Thor Kongstad Madsen、Nadezda Kongi和Vladislav Ivanistsev,分别来自University of Tartu(塔尔图大学)和University of Latvia(拉脱维亚大学)。文章以教程(tutorial)形式发表于ACS Materials Au,属于“Integrating Machine Learning in Modelling Catalysis at the Nanoscale”特刊,于2026年6月23日被接收,可通过DOI: 10.1021/acsmaterialsau.5c00232访问。

本文属于类型b:科学论文但并非单一原创研究报告,而是一篇教程式文章。文章旨在为电催化领域的研究者提供关于机器学习(machine learning, ML)工具实际应用的实用指导。其核心背景是:密度泛函理论(density functional theory, DFT)作为电催化模拟的主流方法,虽能可靠描述吸附结构、吸附能和结构−活性趋势,但其高昂的计算成本严重限制了可探索的化学空间和动力学时间尺度。机器学习正逐渐成为补充和扩展传统DFT模拟的重要途径,然而关于这些方法在真实催化工作流中如何操作的实际指导仍然有限。为此,作者围绕铂基催化剂上的氧还原反应(oxygen reduction reaction, ORR),通过七个可复现的Python notebook教程,展示了七种机器学习方法如何加速或增强DFT模拟,并明确指出各类方法在何处能提供明确收益,何处受限于底层训练数据,以及如何与标准DFT工作流集成。

文章的第一项主要内容是对整体框架的界定。作者明确区分了三个概念:方法(approach)定义机器学习与DFT交互以加速、替代或扩展DFT的策略;工具(tool)是实现该策略的可执行代码;模型(model)是用于演示思想的化学体系,例如Pt(111)表面。所有教程模型均有意简化,保留正确的配位、键合模式和表面终止,以便直接解释和通过notebook复现,但不代表生产级表面模型。七个教程在标准DFT工作流中分别对应不同阶段:教程1针对电子描述与能量计算,教程2针对位置生成器,教程3和4针对原子构型,教程5至7针对力计算以运行分子动力学(molecular dynamics, MD)模拟。这一框架将机器学习介入DFT的不同层面清晰地映射到计算流程中,为后续各教程的定位提供了逻辑基础。

文章的第二项主要内容是机器学习交换关联泛函(machine-learned exchange–correlation functionals)。交换关联泛函是DFT中主要的近似来源,机器学习方法旨在提高其精度和可迁移性。教程1使用Cider型泛函对Pt@MnO₂体系进行单点计算,该体系代表负载在二氧化锰表面的铂活性位点。文章指出,Cider23x_nl_gga泛函能够在保持常规DFT计算效率的同时改善电子相互作用描述。此类机器学习泛函可作为常规DFT泛函的直接替代,且由于解析力可用,还可用于几何优化和分子动力学。然而,其可迁移性和跨化学空间的泛化能力仍是主要挑战,精度常会在训练域之外下降。文章同时提及Microsoft Research开发的SKALA泛函,其当前版本更适合主族化学而非过渡金属化学,但训练数据库的扩展可能提升其可迁移性。

文章的第三项主要内容是高斯过程结构优化。在电催化模拟中,寻找稳定原子结构通常需要多次昂贵的DFT计算。高斯过程回归(Gaussian process regression)通过从少量初始计算中学习原子构型、能量和力之间的关系来减少计算次数。教程2使用GPmin算法(实现于GPAtom和ASE)对铂-石墨相氮化碳催化剂(PtC₆N₈)上的OH中间体进行几何优化,以确定最稳定吸附构型。GPmin构建能量表面的代理模型,并在每一步估计能量及其不确定性,引导下一计算走向信息量最大的构型。文章指出,GPmin在简单体系中并不总是优于基于梯度的方法,因为初始训练循环可能占据优化的很大比例;但其已进一步被实现于微动弹性带(nudged elastic band)方法和分子构象搜索算法中。该方法特别适用于吸附研究、表面重构和团簇优化中的全局能量极小值搜索。

文章的第四项主要内容是贝叶斯统计在能量极值搜索与构型搜索中的应用。映射表面与吸附剂组合体系的完整能量景观是DFT建模的核心挑战之一,而贝叶斯优化(Bayesian optimization)提供了高效定位能量极值的统计途径。教程3使用BOSS(Bayesian Optimization Structure Search)方法确定OH中间体在PtN₄-碳单原子催化剂上的优先吸附位点。BOSS从少量初始DFT结果构建能量表面的概率模型,并通过贝叶斯采集函数平衡对不确定区域的探索和对低能构型的优化。教程4使用BEACON(Bayesian Exploration of Atomic Configurations)方法对13原子Ag−Pd−Pt−Ru纳米颗粒(Ag₃Pd₂Pt₃Ru₅)进行全局构型优化,以研究其脱合金行为并确定最稳定原子排列。BEACON通过全局结构指纹表征组成和几何,适用于多金属纳米颗粒中元素分布对稳定性和催化性能有强烈影响的体系。然而,作者也指出BOSS在实际使用中收敛可能缓慢、文档不完整、缺乏近期维护等问题,反映了机器学习代码普遍存在的可靠性问题。

文章的第五项主要内容是机器学习原子间势(machine learning interatomic potentials, MLIPs)及其在催化表面模拟、真实界面模拟和分子动力学中的应用。这是作者着墨最多的部分,包含教程5至7以及专门的MLIPs章节。教程5使用通用原子模型(Universal Model for Atoms, UMA)对1/4覆盖度OH的Pt(111)表面进行结构优化。UMA由Meta的Open Catalyst Project开发,在OC20、OC22、OC25和OMol25等数据集上训练,其核心优势在于速度——相对于DFT可将结构优化和筛选加速数个数量级,同时保持训练数据的精度。教程6使用SpookyNet模拟Pt−OH−H₂O界面。SpookyNet是一种混合机器学习力场,通过自注意力机制引入电子自由度和非局域相互作用,能够捕捉电荷转移和长程极化等量子效应。优化的结构揭示了水分子与金属表面OH中间体之间的氢键作用,再现了预期的界面行为。教程7使用MACE(Message Passing Atomic Cluster Expansion)执行Pt(111)−OH−水界面的分子动力学模拟。MACE将团簇展开的物理与消息传递神经网络相结合,能够高效处理多体相互作用和化学环境,实现近DFT精度下的大规模动力学模拟。模拟体系包含三层Pt(111)平板和32个水分子,轨迹显示了界面水的动态行为以及吸附OH在表面的稳定性。

文章在专门的MLIPs章节中通过表格对UMA、SpookyNet和MACE进行了比较,涵盖主要用途、体系规模、时间尺度、相互作用类型和典型应用。UMA适用于快速结构弛豫和筛选,描述短程相互作用;SpookyNet适用于含电子效应的反应性模拟,可描述短程和长程静电;MACE适用于大规模分子动力学,可模拟表面、界面和体相体系至数十纳秒。文章进一步指出,UMA和MACE共享一个根本局限:它们依赖固定截断半径内的局部原子环境,无法全局平衡化学势。在带电金属/电解质界面,短程MLIP可能在能量误差很低的情况下产生错误的取向和离子分布,因为全局表面电荷位于描述符感受野之外。此外,UMA和MACE的训练目标仅为总能量和力,损失函数中不含电荷分配信息,因此无法可靠捕捉氧化还原事件中的氧化态变化。文章特别指出,教程7与其他大多数MLIP、力场和DFT基MD模拟一样,在恒定表面电荷而非恒定电势模式下运行。2026年时,大多数模拟仍使用恒定表面电荷方法,直接恒定电势方法(constant potential method, CPM)仍处于早期采用阶段,但其与广义计算氢电极(generalized computational hydrogen electrode, GCHE)框架的结合是未来方向。

文章的第六项主要内容是结论部分。作者指出撰写本教程的两个简单目标:一是识别开箱即用的机器学习工具,二是检验这些工具能在多大程度上推进标准模拟。在准备notebook的过程中,作者观察到领域内的持续进步与许多软件包的脆弱性并存——一些工具一年前可用但现已不再受支持(如OCP和Fairchem),代码演进常超前于文档(如BOSS),访问限制增加系统测试的摩擦(如UMA)。尽管如此,作者认为方向是鼓舞人心的:机器学习原子间势已经能以改变探索能力的速度提供DFT一致的能量和力;机器学习密度泛函如Cider通过非局域项追求改进的物理;贝叶斯工具有助于以比传统搜索更高效的方式探索构型空间;机器学习力场使模拟能在笔记本电脑上运行,而其DFT类比则需要超级计算机。作者强调,虽然本文聚焦电催化,但所讨论的机器学习方法同样适用于多相催化、光催化和半导体界面建模等其他表面与材料科学领域。所有notebook通过GitHub和Zenodo开放获取,并可在Google Colab和MyBinder上运行,适合研究使用及研讨会或小组培训。

本文的价值在于以实用为导向,弥补了机器学习方法在电催化实际工作流中操作指导不足的空白,同时保持了对方法局限性的清醒认识。文章不仅展示了方法的实现细节,还结合作者的实际使用经验指出了各类工具的可靠性问题、适用边界和未来发展方向,为读者提供了一个平衡而可操作的入门指南。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com