晶体图卷积神经网络用于材料性质的准确且可解释预测
作者Tian Xie与Jeffrey C. Grossman来自麻省理工学院材料科学与工程系,该研究发表于《Physical Review Letters》第120卷第145301号,于2018年4月6日正式刊出。
本研究的学术背景植根于材料信息学与机器学习交叉领域。长期以来,利用机器学习方法加速晶体材料设计面临一个根本性挑战:晶体系统的原子排布具有任意尺寸和周期性特征,而绝大多数机器学习算法要求输入为固定长度的向量。传统解决方案有两种路径:其一是人工构建基于简单材料性质的固定长度特征向量,其二是设计原子坐标的对称性不变变换。然而,前者需要针对不同性质进行逐案设计,后者则因复杂变换导致模型难以解释。在此背景下,作者提出了晶体图卷积神经网络(Crystal Graph Convolutional Neural Networks, CGCNN)框架,旨在直接从晶体中原子的连接关系学习材料性质,同时实现预测精度与原子尺度的化学可解释性。该研究的目标是建立一个通用且可解释的晶体材料表示方法,使模型经过约一万个数据点的训练后,能够以接近密度泛函理论(Density Functional Theory, DFT)计算精度的水平预测多种晶体性质。
研究的工作流程围绕CGCNN的构建、训练、验证与可解释性展示展开。第一步是晶体图的构建。作者将晶体结构转化为无向多重图,其中节点表示晶胞中的原子,边表示原子间的键合连接。与分子图不同,晶体图因周期性而允许同一对端节点之间存在多条边。每个节点由特征向量表示,编码对应原子的性质信息;每条边由特征向量表示,编码对应的键合信息。原子连接性的判定方法在补充材料中详细说明。第二步是神经网络架构的设计。在晶体图之上构建的卷积神经网络由卷积层和池化层两大核心组件构成。卷积层通过非线性图卷积函数迭代更新原子特征向量,其核心公式为v_i^(t+1) = conv(v_i^(t), vj^(t), u(i,j)^k),其中v代表原子特征向量,u代表边特征向量,t为卷积层序号。经过r次卷积后,网络自动学习到每个原子包含其周围环境信息的特征向量。池化层将晶体中所有原子的特征向量聚合为一个整体特征向量vc,需满足原子索引的置换不变性和晶胞选择的大小不变性。本研究中采用归一化求和作为池化函数。在卷积层和池化层之外,还加入了两层全连接隐藏层以捕捉晶体结构与性质之间的复杂映射,最后由输出层给出目标性质的预测值。模型的训练通过最小化预测值与DFT计算值之间的代价函数实现,使用反向传播和随机梯度下降进行权重更新。在研究过程中,作者发现卷积函数的形式对预测性能影响最大。最初采用简单卷积函数,即对邻居原子向量与边向量的拼接进行加权求和并加上自权重项,验证集平均绝对误差为0.108 eV/atom。该函数的局限在于对原子i的所有邻居使用共享的卷积权重矩阵,忽略了不同邻居间相互作用强度的差异。为此,作者设计了一种改进的卷积函数:先拼接原子向量和边向量形成z(i,j)^k,然后通过sigmoid函数学习到的权重矩阵对邻居交互进行差异化处理,并加入残差连接v_i^(t)以利于深层网络训练。改进后的验证集平均绝对误差降至0.039 eV/atom,实现了显著提升。
研究的主要结果体现在多个层面。在预测性能方面,使用Materials Project数据库中46,744种无机晶体材料,涵盖87种元素、7种晶系和216个空间群。对于形成能的预测,在9,350个测试晶体上,简单卷积函数和改进卷积函数分别取得了0.136 eV/atom和0.039 eV/atom的平均绝对误差,90%的晶体预测误差分别在0.3和0.08 eV/atom以内。相比之下,DFT计算相对于实验测量的误差为0.081–0.136 eV/atom,表明CGCNN在形成能预测上已达到与DFT相当的可靠性。在多种性质的预测中,CGCNN同样表现出色:绝对能量的平均绝对误差为0.072 eV/atom,带隙为0.388 eV,费米能为0.363 eV,体模量为0.054 log(GPa),剪切模量为0.087 log(GPa),泊松比为0.030。值得注意的是,对于弹性性质,CGCNN在仅使用约2,000个训练数据的条件下,其误差水平与使用相同数据的统计学习方法的均方根误差相近,且当面对新上传的1,585个具有弹性性质的晶体时,模型的体模量和剪切模量平均绝对误差分别为0.077和0.114 log(GPa),展现了良好的泛化能力。在离散性质预测方面,通过将输出层替换为softmax激活函数并使用交叉熵代价函数,CGCNN实现了金属与半导体分类,接收者操作特征曲线下面积达到0.95,总体预测准确率为0.90。在可解释性方面,作者通过将最后一个原子特征向量映射为标量并采用线性池化直接预测目标性质,从而在不使用第二隐藏层的情况下学习每个局部化学环境对整体性质的贡献。在钙钛矿(perovskite)案例中,研究使用了包含18,928个钙钛矿晶体的数据库,A位和B位可为任意非放射性金属,X位可为一个或多个来自O、N、S、F的元素。线性池化CGCNN在3,787个测试钙钛矿上的总能量高于凸包(energy above hull)预测平均绝对误差为0.130 eV/atom。模型学习到的A位和B位能量分布显示:A位上最稳定的元素为具有较大离子半径的元素,因为12配位需要较大空间;B位上第4、5、6族元素最为稳定,这可由晶体场理论解释。有趣的是,第13–15族的大原子在A位也表现出稳定性,这一发现超出了传统认知中仅第1–3族元素适合A位的范围。
基于上述化学洞察,作者对使用第13–15族元素作为A位、第4–6族元素作为B位的钙钛矿进行了组合搜索。考虑到DFT计算的理论误差以及亚稳相可能被温度、缺陷和衬底稳定的事实,作者将潜在可合成性的能量截止值设为0.2 eV/atom。在全部378种候选钙钛矿中发现33种落在该阈值内,其中测试集58种中有8种在阈值内。这些化合物中许多已通过实验合成,如PbTiO3、PbZrO3、SnTaO3和PbMoO3。在全部18,928种钙钛矿数据库中,仅有228种具有潜在可合成性,而化学洞察使搜索效率提升了7倍。
本研究的核心结论是,晶体图卷积神经网络为材料性质预测和设计知识提取提供了一个灵活的机器学习框架。该框架仅需约10^4量级的训练数据即可对多种结构类型和化学组成的无机晶体的八种性质提供可靠的DFT计算估计。在知识提取方面,以钙钛矿为例展示的信息与常规化学认知一致,并显著缩小了高通量筛选的搜索空间。该研究的科学价值在于证明了直接从晶体结构中端到端学习材料性质的可行性,避免了手工特征工程和复杂坐标变换的局限。其应用价值体现在预测精度的可靠性和可解释性所带来的设计指导能力,以及模型对新材料的良好泛化能力。研究的亮点在于:首次将图卷积网络应用于晶体性质预测;设计了一种改进的卷积函数,通过学习的权重矩阵区分不同邻居的相互作用强度,显著提升了预测精度;通过分离卷积层和池化层实现了模型的可解释性,使局部化学环境对全局性质的贡献可以从训练好的模型中直接提取;在钙钛矿案例中发现了第13–15族元素作为A位的潜在稳定性,并据此大幅提升了筛选效率。此外,CGCNN代码已在GitHub上公开,可供研究社区使用。