本文发表于 *Environmental Science & Technology*,题为《Prediction of Collision Cross-Section Values for Extractables and Leachables from Plastic Products》,作者为 Xue-Chao Song、Nicola Dreolin、Elena Canellas、Jeff Goshawk 和 Cristina Nerin。通讯作者 Cristina Nerin 来自西班牙萨拉戈萨大学分析化学系及阿拉贡工程研究所 I3A,Nicola Dreolin 和 Jeff Goshawk 来自 Waters Corporation,Elena Canellas 同样来自萨拉戈萨大学。该研究于 2022 年 6 月 22 日在线发表。本文属于单篇原创研究,旨在利用机器学习方法构建塑料制品中可提取物和可浸出物(extractables and leachables)的碰撞截面积(Collision Cross-Section, CCS)预测模型,以提高未知物鉴定效率。
塑料制品在生产过程中会添加增塑剂、阻燃剂、抗氧化剂、光稳定剂等多种低分子量化合物,同时在使用和回收过程中还可能产生非有意添加物(non-intentionally added substances, NIAS)。这类化学物质可通过迁移进入环境和食品,从而对人类健康和生态系统造成潜在风险。传统基于高分辨质谱(high-resolution mass spectrometry, HRMS)的筛查方法虽然灵敏,但在缺少标准品时难以对未知物进行结构确证。近年来,离子迁移谱(ion mobility separation, IMS)与 HRMS 联用逐渐成为复杂样品分析的重要工具。IMS 可根据离子的大小、形状和电荷进行分离,得到与化合物三维构象相关的 CCS 值。CCS 值不受色谱和质谱条件及样品基质影响,可作为化合物鉴定的附加结构描述符,用于减少假阳性并提高鉴定置信度。然而,目前塑料相关化学品的实验 CCS 值仍十分匮乏,制约了 IMS 在塑料污染物筛查领域的应用。机器学习预测为这一瓶颈提供了可行替代方案,本文即以此为出发点,收集更多与塑料相关的实验 CCS 数据,构建更加准确的 CCS 预测模型,并考察不同分子描述符(molecular descriptors, MDs)和算法对模型性能的影响。
研究工作流程首先涉及 CCS 数据收集与整理。作者从七篇近期文献中收集了 2145 个实验 CCS 值,其中 1425 个为 [M + H]+ 离子,720 个为 [M + Na]+ 离子。这些数据主要来源于塑料食品包装相关化学品、农药、药物以及有机磷阻燃剂等化合物。对重复记录通过 InChIKey 进行合并,采用中位数作为该化合物的 CCS 值,最终获得 1076 个 [M + H]+ 和 645 个 [M + Na]+ 的 CCS 值。数据集中化合物通过 ClassyFire 分类,主要包括苯类化合物、有机杂环化合物、脂质及类脂分子、有机酸及其衍生物等。
在分子描述符的计算与筛选方面,研究比较了 AlvaDesc、CDK 和 RDKit 三类描述符。作者首先剔除方差接近零的描述符,再计算各描述符与 CCS 值的相关系数(r),仅保留 r > 0.6 的描述符。对于 AlvaDesc 描述符,进一步结合极端梯度提升(XGBoost)重要性进行筛选,保留对模型贡献累计达到 95% 和 99% 的前若干描述符。经过筛选,[M + H]+ 数据使用 72 个 AlvaDesc 描述符或 84 个 CDK 描述符或 33 个 RDKit 描述符;[M + Na]+ 数据使用 193 个 AlvaDesc 描述符或 207 个 CDK 描述符或 125 个 RDKit 描述符。
模型构建采用支持向量机(support vector machine, SVM)和 XGBoost 两种算法。数据按 7:3 随机分为训练集和测试集。XGBoost 模型通过 10 折交叉验证对 eta、max_depth、min_child_weight、subsample、colsample_bytree 等参数进行网格优化,并利用最小交叉验证均方根误差(RMSECV)确定最佳迭代轮数。SVM 采用径向基核函数,并对惩罚参数 C 和核参数 γ 进行网格搜索。模型性能通过预测决定系数(rp²)、预测均方根误差(RMSEP)、中位相对误差(MRE)以及预测误差小于 2%、3% 和 5% 的分子比例进行评价。此外,作者还将所建模型与三种公开 CCS 预测工具(CCSondemand、AllCCS 和 CCSBase)在相同测试集上进行比较。
模型结果显示,基于 CDK 描述符的 SVM 模型对 [M + H]+ 加合物的预测性能最优,rp² 为 0.9786,RMSEP 为 4.90 Ų,MRE 为 1.42%,93.3% 的 CCS 值预测误差小于 5%。对 [M + Na]+ 加合物,同一模型同样表现最佳,rp² 为 0.9618,RMSEP 为 5.53 Ų,MRE 为 1.76%,95.0% 的 CCS 值预测误差小于 5%。与作者此前基于 488 个化合物构建的模型相比,钠加合物的预测性能显著提高,尤其对于卤代化合物的预测准确率明显改善。作者进一步验证了训练集化学多样性对模型性能的影响:若从训练集中剔除卤代化合物,测试集中卤代化合物的预测误差显著增大,表明训练集结构与预测对象的相似性对 CCS 预测精度至关重要。与公开工具相比,该 SVM 模型在 [M + Na]+ 加合物上体现出明显优势,而在 [M + H]+ 上则与 CCSondemand 表现相近。
为验证预测 CCS 值在实际环境筛查中的应用效果,作者将模型应用于化学品-塑料包装数据库(CPPdb)和食品接触化学品数据库(FCCdb)的 CCS 值预测,共覆盖 2883 和 6508 个化合物。随后将预测 CCS 值整合入 Ebro 河地表水样品的怀疑筛查工作流程。样品经前处理后采用 Vion IMS-QTOF 质谱仪分析,获得 m/z、保留时间(retention time, RT)和 CCS 值等特征。通过设置 m/z 偏差小于 5 ppm、CCS 偏差小于 5% 的过滤条件,候选化合物数量从 376 个减少至 204 个,假阳性比例下降约 45.7%。最终共初步鉴定出 98 种塑料相关化学物质,其中 26 种通过标准品确认。鉴定出的物质包括增塑剂、阻燃剂、抗氧化剂、润滑剂、染料、表面活性剂以及 NIAS。其中含量最丰富的是三(2,4-二叔丁基苯基)磷酸酯,即常用抗氧化剂 Irgafos 168 的降解产物,其预测 CCS 值与实验值偏差小于 2%。对于缺乏标准品或裂解信息不足的化合物,预测 CCS 值在结构推断中发挥了关键作用,例如 1,4,7-三氧杂环十三烷-8,13-二酮和 Antiblaze V6 的鉴定均受益于 CCS 值的比对。
研究结论认为,基于 CDK 描述符的 SVM 模型能够较准确地预测塑料相关化学品的 CCS 值,对正离子加合物预测误差大多在 5% 以内。模型性能受训练集化学多样性影响较大,增加卤代化合物和有机磷阻燃剂等不同结构类型的数据有效提升了预测能力。同时,结合预测 CCS 值的怀疑筛查流程能够显著减少假阳性,并在缺少标准品或质谱裂解信息不足时提高鉴定置信度。研究还讨论了将 DTCCS 和 TWCCS 数据合并用于建模的合理性,发现两者间差异小于不同实验室间 TWCCS 值的差异,合并使用未对模型产生不利影响。对于 CDK 描述符间的共线性问题,作者通过方差膨胀因子(VIF)评估后认为当前模型复杂度可接受,未进一步删减描述符。文章最后指出目前模型仅覆盖正离子模式,未来需开发负离子 CCS 预测模型,并通过扩充数据库和提升实验 CCS 重现性进一步提高预测精度。
本文的主要亮点在于:(1)构建了面向塑料相关化学品的 CCS 预测模型,并系统比较了多种描述符和机器学习算法的组合;(2)通过整合额外卤代化合物及阻燃剂等数据,显著改善了对 [M + Na]+ 和卤代化合物的预测性能;(3)将预测 CCS 值成功应用于实际河水样品中塑料污染物的怀疑筛查,展示了其在减少假阳性和提高鉴定置信度方面的实用价值。