分享自:

从所有视角学习:用于代谢物注释的多视图对比框架

期刊:Analytical ChemistryDOI:10.1021/acs.analchem.5c05675

本文提出了一种名为多视图投影(Multiview Projection,MVP)的新型代谢物注释框架,其核心创新在于利用多视图对比学习,在分子与质谱之间学习一个联合嵌入空间。该研究由Yan Zhou Chen和Soha Hassoun完成,作者均来自塔夫茨大学(Tufts University)计算机科学系及化学与生物工程系。论文发表于《Analytical Chemistry》期刊,于2026年2月23日正式刊出。

研究背景与目的

非靶向代谢组学(untargeted metabolomics)借助高通量质谱技术,能够对数千种代谢物进行大规模分析,为理解细胞代谢、疾病机制和生物标志物提供了重要手段。然而,该领域面临一个核心瓶颈:代谢物注释(metabolite annotation),即将实验获得的LC-MS/MS谱图与化学结构进行匹配的过程,仍然充满挑战。由于参考谱库(如NIST、GNPS、MoNA)的覆盖率有限,注释率长期处于较低水平。为了提高注释效率,研究人员开发了多种机器学习方法,这些方法大致可分为三类:逆向映射方法(如从头生成分子结构和指纹预测)、前向映射方法(从分子模拟谱图)以及对齐方法(学习分子与谱图的联合嵌入空间)。其中,对齐方法在实现良好的情况下已被证明优于映射方法,例如JESTR模型。然而,现有的对齐模型仅探索了每种模态的部分可用视图。分子可以用SMILES/SELFIES、指纹、预训练模型的嵌入、基于结构的碎裂树、化学式或三维结构表示;谱图也可以用谱图基序、基于化学式的碎裂树、亚化学式标签、预训练模型嵌入或共识谱(consensus spectra)描述。作者假设,结合多种视图能够使模型同时捕捉互补信息和共享信息,同时减轻视图特有的伪影,从而最终改善跨模态对齐效果。基于此,作者提出了MVP框架,旨在系统性地联合学习分子和谱图的多个视图,以提升候选分子排序的性能。

研究方法与工作流程

MVP框架使用了四种视图:分子图(molecular graph)、分子指纹(molecular fingerprint)、单个谱图(spectrum)和共识谱图(consensus spectrum)。分子图将原子作为节点、化学键作为边,节点特征包括原子类型、原子质量、价态、环成员关系、形式电荷、自由基电子、手性、度、氢原子数和芳香性等,边特征包括键型、环成员关系、共轭性和立体构型。分子指纹采用二进制摩根指纹(Morgan fingerprint),设定nbit=1024,半径r=5,通过RDKit计算。对于谱图表示,MVP采用了与MIST类似的方法,首先使用MIST的峰化学式注释代码,基于已知的化学式进行枚举,保留给定谱图中丰度最高的60个峰,并使用±20 ppm的质量容差。每个峰被编码为一个15维向量,前14维表示元素(C, H, O, N, P, S, Cl, F, Br, I, B, As, Si, Se)的原子计数,最后一维表示归一化强度。原子计数通过除以训练集中对应元素的最高观测计数进行缩放。共识谱图通过合并同一分子身份的所有谱图的峰构建而成,若多个峰共享相同的化学式,则保留一个化学式并取强度最大值。

MVP包含四个独立的编码器,每个视图对应一个。分子图编码器与JESTR相同,采用三层图卷积网络(GCN),随后是池化层和两层全连接的多层感知机(MLP),生成结构嵌入。指纹编码器为一个三层MLP。谱图和共识谱图使用相同架构的编码器,首先通过三层MLP编码每个峰,然后将峰集合输入由2个注意力头组成的Transformer编码器,输出谱图嵌入。模型使用Adam优化器训练1500个周期,学习率为7.0×10⁻⁵,批次大小为64,对比损失温度为0.05。对比学习的目标是使同一数据点的不同视图在共享嵌入空间中靠近,同时确保不匹配的视图相互远离。MVP在所有成对视图组合上优化对比损失,总损失函数为四个视图(z_mol, z_fp, z_s, z_cs)的两两对比损失之和。每个成对对比损失对称计算,遵循CMC框架,使用余弦相似度衡量嵌入之间的相似性,并通过温度超参数τ调节模型区分正负样本的锐度。

在推理阶段,MVP支持多种“排序视图”:分子图-谱图(mol-s)、指纹-谱图(fp-s)、分子图-共识谱图(mol-cs)和指纹-共识谱图(fp-cs)。研究评估了两种利用每个分子多个谱图的策略:先聚合后排序(aggregate-then-rank)策略,即在候选排序之前合并谱图信息;以及先排序后聚合(rank-then-aggregate)策略,即先对每个单独谱图排序候选分子,再聚合排序结果。研究在MassSpecGym基准数据集上训练和评估MVP,该数据集包含194,119个训练谱图、19,429个验证谱图和17,556个测试谱图,对应25,046个训练分子、3,386个验证分子和3,170个测试分子。候选分子按质量(分子质量在目标分子10 ppm以内)或按化学式(与目标分子具有完全相同的化学组成)提供,每个分子最多关联256个候选分子。

主要研究结果

在排序视图的比较中,mol-cs排序视图在按质量和按化学式候选两种情况下均一致取得最佳性能。使用共识谱图相较于单个谱图(mol-cs与mol-s对比,fp-cs与fp-s对比)的性能提升,表明在推理时利用共识谱图内的多种碎裂模式具有显著影响。此外,分子图视图始终优于指纹视图,表明分子图与谱图之间可能共享更多的互信息。

与现有注释工具的比较中,MVP的mol-cs排序视图在按质量和按化学式候选的所有指标上均优于MIST、ESP和JESTR。对于按质量候选,MVP(mol-cs)取得了36.0%的rank@1,与MIST相比提升了147%,与JESTR相比提升了135%;MCES@1降低了40%(相对于MIST)和54%(相对于JESTR)。对于按化学式候选,MVP(mol-cs)取得了14.0%的rank@1,较MIST提升46%,较JESTR提升18%;MCES@1降低了19%(相对于MIST)和11%(相对于JESTR)。使用mol-s排序视图时,MVP在按质量候选上同样优于其他方法,但在按化学式候选的rank@1和rank@5上略逊于JESTR,尽管其MCES@1更小,表明MVP排在第一位的候选分子在总体上与目标结构更相似。研究认为,按质量候选的改进更为显著,可能是因为化学式注释的峰有助于区分质量相同但化学式不同的候选分子。

在聚合策略的比较中,MVP的mol-cs排序实现了先聚合后排序范式。作为替代方案,先排序后聚合范式利用mol-s排序视图为每个候选分子提供排名,然后采用平均排名法或倒数排名法聚合。研究限制了测试集中恰好有三个谱图的分子(共1531例),结果显示先排序后聚合方法的表现不如先聚合后排序方法。与CFM-ID 4.0的比较中,CFM-ID在按化学式候选上仅达到2.0%的rank@1,而MVP达到13.9%,进一步证明了先聚合后排序策略的优势。当利用每个分子的所有可用谱图时,MVP进一步提升至14.4%的rank@1。

在谱图表征的比较研究中,MVP的化学式谱图表示(formula-based spectra, formSpec)与分箱表示(binned spectra, binnedSpec)进行了对比。对于按质量候选,使用formSpec在mol-s和mol-cs排序视图上均取得了显著改进:mol-s的rank@1从12.3%提升至26.4%,mol-cs的rank@1从16.6%提升至36.0%。化学成分式表示使谱图编码器能够更好地区分目标分子与候选分子。对于按化学式候选,使用binnedSpec训练在rank@1上优于formSpec,但在较高排名上formSpec表现更好。在仅使用[M+H]+子集时,formSpec在所有指标上均优于binnedSpec,表明[M+Na]+谱图中可能不准确的峰标签是导致formSpec在rank@1上表现较差的一个因素。此外,使用formSpec时,同一分子的不同谱图之间的排名变异性显著更小,表明化学式使谱图编码器能够为相同分子学习更一致的谱图表示。

在训练视图的消融研究中,当在完整的MassSpecGym数据集上训练时,四个模型(mol-fp-s-cs、mol-s-cs、mol-fp-s、mol-s)之间没有明显的优劣模式。然而,当仅在[M+H]+子集上训练时,使用全部四个视图的mol-fp-s-cs模型始终优于使用较少视图的模型。移除指纹视图会一致地降低性能。例如,按质量候选使用mol-s视图时,从mol-fp-s-cs模型中移除指纹视图导致rank@1从29.7%降至25.6%。这表明指纹视图提供了对于排序至关重要的细微信息。

在培养肉与常规肉的代谢物差异分析案例研究中,MVP被应用于最近一项比较传统鸡肉(CON)、肌肉卫星细胞(CIC)和肌管形成细胞(CAC)代谢组谱的研究。使用标准代谢组学工作流程,MVP注释了640个谱图,对应146个独特分子。其中73个为新注释的代谢物。MVP的注释涵盖了原始研究报告的所有通路,并显示出氨基酸和肽在常规肉中显著更丰富。此外,萜类、生物碱、莽草酸和苯丙烷类通路中的几个代谢物在培养肉样品中表现出一致的升高或降低。

研究结论与意义

MVP是一种新颖的框架,用于学习分子与谱图的联合嵌入空间,利用了分子图、分子指纹、谱图和共识谱图四种数据模态。与先前将多种模态作为多任务或通过拼接结合的方法不同,MVP联合地从视图之间的互信息中学习。MVP是首个设计用于支持基于共识谱图进行注释的工具。共识谱图视图作为同一分子不同谱图的锚点,促进了模型学习一致的谱图表示。研究证明,先聚合后排序范式优于先排序后聚合范式,且使用mol-cs视图的注释优于所有其他视图。在MassSpecGym基准数据集上,MVP的mol-cs排序视图在按质量候选上达到36.0%的rank@1,分别比MIST和JESTR提高了147%和135%;在按化学式候选上达到14.0%的rank@1,分别提高了46%和18%。对实际工作者而言,能够基于查询共识谱图排序候选分子具有重要价值,因为他们通常会为同一代谢物提取多个测量值。使用MVP无需决定如何聚合和解释各个组成谱图的排序结果。此外,比较和消融研究表明,纳入峰化学式对于按质量排序候选分子是有利的,且从全部四个视图学习比从较少视图学习能获得更好的性能。最后,MVP在与现有代谢组学工作流程的实际整合中展示了潜力,在培养肉与常规肉的比较研究中揭示了培养肉中氨基酸和肽水平的降低,并发现了73个推定的代谢物。MVP证明了利用谱图及其对应分子结构之外的额外信息可以改善分子-谱图匹配的表示质量。未来的改进方向包括更准确的峰标记、纳入更多视图、引入优先考虑候选分子排序的损失函数,以及将MVP扩展到相关任务如骨架排序和类似物识别。研究的数据、模型脚本和预训练模型可在GitHub上获取,同时还提供了一个基于Hugging Face Spaces的Web界面,方便研究人员上传MGF文件和候选JSON文件进行注释。

研究亮点

本研究的亮点在于:第一,MVP是首个系统性地利用多个分子和谱图视图进行联合对比学习的框架,区别于先前的拼接或多任务方法;第二,MVP是首个设计用于支持共识谱图注释的工具,并证明了先聚合后排序策略的优越性;第三,在MassSpecGym基准上取得了显著的性能提升,特别是按质量候选时rank@1较现有最佳方法提升了超过一倍;第四,通过消融研究验证了纳入指纹视图和峰化学式信息的价值;第五,通过实际代谢组学案例研究展示了MVP在扩展代谢物注释覆盖范围方面的应用潜力。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com