AllCCS2(allccs2)是由Haosong Zhang、Mingdu Luo、Hongmiao Wang、Fandong Ren、Yandong Yin和Zheng-Jiang Zhu等人于2023年9月4日发表在《Analytical Chemistry》上的研究成果。该研究由中国科学院上海有机化学研究所、中国科学院大学及上海市衰老研究重点实验室等机构共同完成。研究团队针对离子迁移谱-质谱联用技术(IM-MS)在小分子分析中的关键需求,开发了升级版的碰撞截面(CCS)数据库与预测工具AllCCS2,旨在提升小分子CCS值预测的准确性和覆盖范围。
离子迁移谱-质谱联用技术近年来在小分子分析领域,如代谢组学、脂质组学和暴露组学研究中发挥了重要作用。在离子迁移分离过程中,分子离子在电场作用下与中性缓冲气体发生相互作用,产生不同的漂移时间,而CCS值正是描述这种相互作用的物理化学参数。CCS值具有高度的跨仪器、跨实验室重现性,已成为小分子注释中重要的物理化学性质。然而,实验测量CCS值受限于覆盖范围小、成本高;理论计算则面临效率和准确性的挑战。因此,基于机器学习训练和预测的方法逐渐成为构建CCS参考数据库的主流策略。2020年,Zhu等人构建了第一代AllCCS数据库,为小分子CCS值预测提供了重要资源。但随着漂移管离子迁移谱(DTIMS)、行波离子迁移谱(TWIMS)和俘获离子迁移谱(TIMS)等多种仪器平台的发展,对CCS数据库的跨平台兼容性和预测精度提出了更高要求。为此,研究团队开发了AllCCS2,通过扩充训练数据并引入更全面的分子表征方法,进一步提高预测性能。
AllCCS2的构建流程包括数据库整理、分子表征生成和预测模型训练三个主要环节。首先,研究团队从文献和自建数据中收集了来自11个独立实验室、69个数据集、涵盖3种仪器平台的10,384条实验CCS记录,包含4,326个化合物。经过五步标准化流程(元信息收集、质量检查、异常值剔除、统一CCS值计算和置信度赋值),最终获得7,713个统一CCS值。其中,正离子模式5,139个,负离子模式2,574个。按置信度分级,包括586个一级、978个二级、5,701个三级和448个冲突级数据。用于模型训练的数据进一步筛选了7种加合物类型([M+H]+、[M+Na]+、[M+NH4]+、[M−H2O+H]+、[M−H]−、[M+Na−2H]−、[M+HCOO]−),剔除冲突级数据后得到6,452个统一CCS值,按9:1比例划分为训练集(5,806个)和验证集(646个)。此外,研究团队还构建了独立的外部测试集,包含DTIMS平台915个、TIMS平台667个、TWIMS平台155个,共计1,737个CCS值,用于模型评估和基准比较。
在分子表征生成方面,AllCCS2整合了三类特征:质谱特征(MS features)、分子描述符特征(MD features)和图特征(graph features)。MS特征包括m/z、加合物类型和电离极性,反映离子在迁移分离中的固有属性。MD特征通过RDKit和Mordred软件包从SMILES结构计算得到,并采用递归特征消除与交叉验证(RFECV)算法进行特征筛选。研究团队在不同训练集比例(50%至90%)下重复进行500次RFECV,最终筛选出27个分子描述符。图特征则利用图卷积网络(GCN)从分子图结构中提取拓扑结构信息。具体方法为:定义20个节点特征和6个边特征构建分子图,通过图卷积层提取图矩阵,再经平均池化获得一维图特征。经过参数优化,图特征数量确定为355个。三类特征共385维,拼接后输入多层感知机(MLP)模型进行训练。模型训练采用ReLU激活函数、L2正则化、Adam优化器和Huber损失函数。通过贝叶斯优化方法调整超参数,并训练50个模型,选取验证集MedRE最低的前10个模型构建集成模型,以10个模型预测值的中位数作为最终输出。
AllCCS2的性能评估结果显示其在训练集、验证集和测试集上的中位相对误差(MedRE)分别为0.31%、0.72%和1.64%。在测试集中,73.46%的预测CCS值相对误差低于3%,92.40%的预测值相对误差低于5%。按电离极性区分,正离子模式MedRE为1.76%,负离子模式为1.58%。在跨平台兼容性方面,DTIMS、TIMS和TWIMS测试集上的MedRE分别为1.69%、1.78%和1.17%。在化学结构层面,利用ClassyFire分类系统将测试集化合物划分为七个主要超类,其中六个超类的MedRE低于1.7%,展示了良好的结构普适性。与现有工具的比较进一步证明了AllCCS2的优势。研究团队将AllCCS2与AllCCS、CCSBase、CCSP2.0、DeepCCS、DarkChem和ISiCLE进行了基准测试。结果表明,AllCCS2在MedRE、平均相对误差(MeanRE)、中位绝对误差(MedAE)、平均绝对误差(MeanAE)和均方根误差(RMSE)等多项指标上均优于其他工具。AllCCS2的MedRE比其他工具低0.22到3.57个百分点。在七种化学超类中,AllCCS2在六个超类中表现最优。值得注意的是,基于理论计算的ISiCLE表现显著差于机器学习模型,与实验值存在较大偏差。
在模型改进分析中,研究团队通过控制变量法考察了训练数据扩充和新模型架构的独立贡献。使用旧训练集搭配旧模型时MedRE为2.09%,仅扩充训练集后MedRE降至2.04%,RMSE从6.81 Ų降至5.85 Ų,表明数据扩充主要减少了异常预测。单独应用新模型后,所有评估指标均显著改善。同时应用新训练集和新模型(即AllCCS2)带来了最大提升。此外,AllCCS2训练集覆盖范围的扩大显著提高了代表性结构相似度(RSS)指标。测试集中RSS≥0.8的化合物比例从AllCCS的51%提升至AllCCS2的72%。RSS与相对误差显著相关,大RSS组的MedRE从AllCCS的2.01%降至AllCCS2的1.59%。
研究团队还系统分析了预测不确定性的两个来源:训练集覆盖范围和预测模型本身。前者通过RSS表征,后者通过新引入的模型预测变异度(MPV)表征。MPV定义为10个集成模型预测CCS值的相对标准偏差。测试集化合物的中位MPV为1.4%,90%的MPV值低于2.5%。MPV与相对误差显著相关(p值=6.73×10⁻¹⁴),高MPV组(>2.5%)的MedRE为2.01%,低MPV组的MedRE为1.59%。同时,MPV与RSS呈显著负相关(p值=6.32×10⁻⁷¹)。综合来看,具有高RSS和低MPV的化合物预测精度最高,MedRE仅为1.57%。例如,omega-muricholic acid的RSS为0.9730、MPV为0.53%,预测相对误差仅0.35%;而2-piperidone的RSS为0.5851、MPV为3.47%,预测相对误差高达4.52%。