Kamal Choudhary 和 Brian DeCost 作为共同第一作者,均来自美国国家标准与技术研究院(National Institute of Standards and Technology),其研究成果《Atomistic Line Graph Neural Network for Improved Materials Property Predictions》发表于 npj Computational Materials 期刊2021年第7卷,文章编号185。该研究提出了一种名为“原子线图神经网络”(Atomistic Line Graph Neural Network,ALIGNN)的新型图神经网络(Graph Neural Network,GNN)架构,旨在通过显式引入键角信息来提升材料性质预测的精度。
从学术背景来看,图神经网络在原子尺度材料表示与建模领域已展现出相较于传统描述符机器学习模型的显著性能优势。然而,大多数已有的原子级GNN模型,如SchNet、晶体图卷积神经网络(Crystal Graph Convolutional Neural Networks,CGCNN)和材料图网络(Materials Graph Network,MEGNet),主要依赖原子间距离和键价等边特征进行消息传递,并未显式编码键角信息。许多材料性质,尤其是带隙等电子性质,对键角和局部几何畸变极为敏感。已有研究表明,在手工构造的经典力场启发描述符(Classical Force-Field Inspired Descriptors,CFID)中显式引入角度信息可以提升模型性能。因此,该研究的核心目标是开发一种能够高效且显式地整合键角信息的GNN架构,以期在多个原子级性质预测任务上实现优于现有模型的精度与训练效率。
在方法学上,ALIGNN模型的核心创新在于同时对一个原子键图(atoms为节点,bonds为边)及其对应的线图(line graph)进行边门控图卷积(edge-gated graph convolution)消息传递。对于晶体材料,构建周期性的12-近邻图,并扩展至第12近邻壳层内的所有原子。原子节点特征包含9维元素属性,如电负性、族数、共价半径、价电子数、第一电离能、电子亲和能、区块和原子体积;初始边特征为原子间键距的径向基函数(Radial Basis Function,RBF)展开。线图中的节点对应原图中的边,即化学键;线图中的边对应三原子角,初始特征为键角余弦值的RBF展开。ALIGNN的一个更新层由两个步骤组成:首先在线图上执行边门控图卷积,更新键(pair)和三原子(triplet)特征,并将更新后的键消息传播至原原子图的边;随后在原图上执行边门控图卷积,结合原子特征进一步更新键和原子表示。模型整体架构包含4层ALIGNN更新和4层图卷积(GCN)更新,节点和边特征分别嵌入至64维,隐藏维度为256,使用Sigmoid线性单元(SILU)激活函数,并采用批量归一化(batch normalization)、AdamW优化器、one-cycle学习率策略和64的批大小。训练目标为回归任务的最小均方误差(Mean Squared Error,MSE)损失或分类任务的负对数似然损失。
数据方面,研究使用了三个数据集:Materials Project(MP)2018.6.1版本的69,239种材料,包含PBE泛函带隙和形成能;JARVIS-DFT 2021.8.18版本的55,722种材料,包含OptB88vdW带隙、形成能、介电常数、MBJ带隙、弹性和压电性质、热电系数、二维材料剥离能、电场梯度等多种性质;以及QM9分子数据集中的130,829个分子,包含HOMO、LUMO、能隙、偶极矩等11种性质。MP数据集的划分采用60,000训练、5,000验证、4,239测试;JARVIS-DFT采用80%:10%:10%划分;QM9采用110,000:10,000:10,829划分。
在模型性能方面,ALIGNN在MP数据集上实现形成能平均绝对误差(Mean Absolute Error,MAE)0.022 eV/atom,相较于CGCNN、MEGNet和SchNet分别降低43.6%、21.4%和37.1%;带隙MAE为0.218 eV,优于CGCNN(0.388 eV)和MEGNet(0.33 eV)。在JARVIS-DFT的29个回归目标上,ALIGNN的MAE均低于CFID和CGCNN,例如形成能MAE为0.033 eV/atom,总能量MAE为0.037 eV/atom,MBJ带隙MAE为0.31 eV。此外,在QM9数据集上,ALIGNN在HOMO(0.0214 eV)和偶极矩(0.0146 Debye)上优于SchNet、MEGNet和DimeNet++,其他性质与SchNet相近。值得强调的是,所有ALIGNN模型使用同一套在JARVIS-DFT带隙任务上调控得到的超参数,展现了跨数据集和材料类型的鲁棒性。
在模型分析部分,消融实验表明,不含任何图卷积层时,形成能和带隙的MAE分别比默认模型高1248.5%和453.6%;仅含GCN层的模型在形成能任务上达到44 meV/atom的饱和MAE,而仅含ALIGNN层的模型达到34 meV/atom,相对降低29.14%。至少需要两次ALIGNN更新才能获得峰值性能。计算开销方面,ALIGNN-2/GCN-2配置在获得峰值性能的同时,计算开销约为GCN-4配置的2倍。学习曲线分析显示,在完整训练集规模(44,577)下平均验证MAE为0.0316±0.0004 eV/atom,且未观察到边际收益递减迹象,表明随着数据规模增大模型性能可能进一步提升。
该研究的核心贡献在于将线图神经网络用于原子尺度材料表示,首次在固体和分子体系中同时构建无向原子图及其线图,并通过交替消息传递实现了键角信息的显式传播。ALIGNN不仅在多个数据库上显著优于以往GNN模型,而且训练速度与已有方法相当或更快。该模型已作为JARVIS基础设施的一部分开源,并提供交互式网页应用,便于其他研究者直接使用。
研究的亮点可归纳为三点:第一,通过线图显式编码键角,解决了此前GNN对多体相互作用表征不足的问题;第二,边门控图卷积机制同时更新节点和边特征,使得键角和键距信息能够在原子与键表示之间双向流动;第三,统一的超参数配置在固体和分子多种性质上均表现优异,证明该架构具有较好的泛化能力。
此外,作者还提供了详细的代码、数据和训练配置,全部可通过GitHub和Figshare获取,有利于后续研究的复现与扩展。