本研究由来自中南大学化学化工学院的Fan Xiaqiong、Ming Wen、Huitao Zeng、Zhimin Zhang及Hongmei Lu完成,通讯作者为Zhimin Zhang和Hongmei Lu。该研究作为原创性研究论文发表在学术期刊《Analyst》上,发表于2019年,第144卷,页码1789至1798,文献DOI为10.1039/c8an02212g。
该研究属于分析化学与化学计量学交叉领域,聚焦于拉曼光谱(Raman spectroscopy)混合物组分识别问题。拉曼光谱作为一种分子指纹技术,因其快速、无损及无需预处理等优势被广泛用于分子鉴定。然而,混合物拉曼光谱中同时包含多个组分的信息,并伴有噪声和仪器干扰,传统的基于数据库搜索、相似度或距离计算以及特征峰比对的方法,往往依赖复杂的光谱预处理,且易受搜索算法和相似度标准选择的影响,准确性和灵敏度难以保证。尤其是在低浓度组分识别和复杂混合物体系中,传统方法存在较高的假阳性率和假阴性率。为了克服这些局限,作者提出了基于深度学习的组分识别方法,称为DeepCID(deep learning-based component identification,基于深度学习的组分识别),目标是直接从原始拉曼光谱中学习特征并预测混合物中各组分的存在情况,避免预处理的引入并提高识别准确率和灵敏度。
该研究的工作流程包括数据准备、模型构建、模型训练、模型测试与性能评估等几个主要环节。首先,研究使用的数据库包含167种纯化合物的拉曼光谱,这些化合物是制药工业中常见的原料,光谱由B&W Tek i-Raman光谱仪采集,光谱分辨率为4.5 cm⁻¹,拉曼位移范围为175 cm⁻¹至3200 cm⁻¹。针对训练样本数量有限的问题,作者采用了数据增强(data augmentation)策略为每种化合物生成模拟混合物光谱。对每种化合物,分别生成10000条包含该化合物的正样本光谱和10000条不包含该化合物的负样本光谱,正样本中该化合物的比例在0.1至1.0之间随机生成,干扰化合物的比例在0.0至1.0之间随机生成;负样本则由其他化合物的随机比例叠加而成。增强后的数据集进一步被划分为训练集15000条、验证集2500条和测试集2500条,并在每个拉曼位移上进行零均值和单位方差标准化。
模型构建方面,DeepCID为数据库中的每种化合物分别建立了一个二分类卷积神经网络(convolutional neural network,CNN)模型,用于预测该化合物是否存在于混合物中。研究中使用的CNN为四层一维网络:前两层为卷积层(convolutional layer),分别输出32和64个特征图;后两层为全连接层(fully connected layer),节点数分别为1024和2。在卷积层之后使用池化(pooling)操作以降低维度和增强峰值位移鲁棒性。激活函数采用修正线性单元(rectified linear unit,ReLU),最后一层使用Softmax函数进行分类。网络训练使用Adam优化器,损失函数为交叉熵(cross entropy),初始学习率为10⁻⁴,批大小为100,训练轮数在200至300之间,权重初始化采用截断正态分布,偏置初始化为0.1,并在卷积层和全连接层中均应用了dropout以防止过拟合。
模型性能评估使用了三个数据集:模拟测试集、液体和粉末混合物数据集以及三元混合物数据集。液体和粉末混合物数据集包含6个样本,其中液体样品由甲醇、乙醇和乙腈按不同比例混合,粉末样品由聚丙烯酰胺、乙酸钠和碳酸钠按不同比例混合;三元混合物数据集包含94个由甲醇、乙腈和蒸馏水按不同体积百分比组成的光谱。此外,研究还将DeepCID与L1正则化逻辑回归(logistic regression with L1-regularization)、K近邻(K-nearest neighbor,KNN)、随机森林(random forest,RF)、反向传播人工神经网络(back propagation artificial neural network,BP-ANN)以及全连接神经网络(fully connected neural network,FCNN)等方法进行了比较。
研究的主要结果显示,在模拟测试集上,DeepCID对167种化合物模型的准确率均达到98.8%以上,其中160个模型准确率超过99.5%。对于甲醇、乙醇、乙腈、聚丙烯酰胺、乙酸钠和碳酸钠等代表性化合物,DeepCID的准确率分别为99.2%、99.5%、99.6%、99.7%、99.9%和99.9%,显著优于KNN和BP-ANN,也略优于RF和FCNN,与L1正则化逻辑回归接近。受试者工作特征曲线(receiver operating characteristic curve,ROC曲线)显示DeepCID的曲线完全包络了其他方法的曲线,表明其总体分类性能最佳。在液体和粉末混合物数据集上,DeepCID对所有6个样本均实现了100%的真阳性率(true positive rate,TPR)和0%的假阳性率(false positive rate,FPR),无任何假阴性和假阳性;相比之下,RF、L1正则化逻辑回归、KNN、BP-ANN和FCNN分别产生了8、24、224、37和70个假阳性。在三元混合物数据集上,DeepCID能检测甲醇的最低体积百分比为4%,而FCNN、L1正则化逻辑回归、BP-ANN、RF和KNN的最低检测浓度分别为13%、16%、20%、23%和33%,说明DeepCID在低浓度组分识别中具有显著更高的灵敏度。研究还表明,DeepCID能够有效纠正不同仪器之间拉曼位移的漂移和强度的差异,例如数据库与三元混合物数据集中甲醇拉曼峰的位移存在2 cm⁻¹的偏移且最大强度相差近两倍,但DeepCID仍能正确识别甲醇。
研究的结论指出,DeepCID是一种有前景的混合物拉曼光谱组分识别方法。与传统方法相比,DeepCID无需光谱预处理,可直接从原始光谱中提取特征并建立模型,从而避免预处理引入误差和变异。卷积层在特征提取中起到了关键作用,移除卷积层后模型性能显著下降,证实了卷积层的重要性。模型训练在NVIDIA GeForce GTX Titan X GPU上约需5分钟,预测阶段对6条混合物光谱的识别可在2分钟内完成,若预先加载167个模型则可在1秒内完成,具有较高的计算效率。DeepCID还表现出良好的稳定性和可重复性,对乙腈和甲醇模型进行了100次重复训练,测试集准确率分布近似高斯分布且方差较小。此外,DeepCID可视为预训练模型,当有新样本可用于微调时,可进一步提高识别性能。由于训练数据是基于数据库增强生成的,DeepCID的流程具有通用性和可移植性,未来可用于如具有代谢组学生物标志物的疾病快速诊断等场景。
本研究的亮点包括:首次将深度卷积神经网络直接应用于拉曼光谱混合物组分识别,提出了无需预处理的DeepCID方法;通过数据增强策略有效解决了训练样本不足的问题;在模拟、液体粉末和三元混合物数据集上均表现出优于传统化学计量学方法的准确率和灵敏度;在低浓度组分识别方面展现出显著优势,最低检测浓度远低于对比方法;卷积层确保了对拉曼位移漂移和强度差异的鲁棒性,增强了跨仪器应用的泛化能力。这些发现为拉曼光谱的自动化和智能化组分解析提供了新的技术路径。