这是一项由捷克有机化学与生物化学研究所(Institute of Organic Chemistry and Biochemistry of the Czech Academy of Sciences)和捷克技术大学(Czech Technical University)的Roman Bushuiev、Anton Bushuiev、Raman Samusevich、Corinna Brungs、Josef Sivic及Tomáš Pluskal等研究人员共同完成的原创性研究,于2025年3月31日被接收,并于2025年5月23日在线发表于《Nature Biotechnology》期刊上。研究团队开发了一种名为DREAMS(Deep Representations Empowering the Annotation of Mass Spectra)的、基于Transformer架构的深度神经网络,旨在从根本上突破串联质谱(tandem mass spectrometry, MS/MS)数据解析中长期存在的瓶颈。
研究的背景是小分子与代谢物的发现与鉴定,其对于药物开发、环境分析和疾病诊断等多个科学领域至关重要。目前,液相色谱-串联质谱联用(LC-MS/MS)是分析生物与环境样品分子组成的主要手段。然而,对非靶向代谢组学实验中产生的串联质谱(MS/MS)进行结构注释极具挑战。传统方法严重依赖规模有限的参考质谱库和硬编码的人类专业知识,这导致在典型的非靶向实验中,仅有不到10%的MS/MS谱图能被有效地注释为分子结构,极大地限制了未知化学空间的探索。为了克服这一局限,研究团队旨在通过自监督学习(self-supervised learning),从海量的、无注释的实验质谱数据中直接学习分子结构的表征,从而构建一个无需依赖先验知识即可适用于多种质谱注释任务的基础模型(foundation model)。
研究的核心工作流程分为三个步骤:大规模数据集的构建、自监督预训练和下游任务的微调与评估。 第一步,研究团队构建了一个名为GEMS(GNPS Experimental Mass Spectra)的大规模、高质量串联质谱数据集。他们从全球天然产物社会分子网络(Global Natural Products Social Molecular Networking, GNPS)公共数据库中挖掘了约250,000个LC-MS/MS实验的714亿张MS/MS谱图。接着,他们开发了一套严格的质量控制流程,包括评估仪器质量精度、过滤低质量信号和储存元数据,将谱图分为质量递降的三个子集:GEMS-A、GEMS-B和GEMS-C。其中最高质量的GEMS-A子集中有97%的谱图来自Orbitrap质谱仪。为解决数据冗余问题,他们采用局部敏感哈希(Locality-Sensitive Hashing, LSH)算法,以近似余弦相似度的方式对谱图进行高效聚类,并限制了每个簇中的谱图数量,从而创建出如GEMS-A10(每个簇最多10张谱图)等多个规模和质量不同的数据集变体。最终,所有谱图数据被整合并存储为专为深度学习设计的紧凑二进制格式,其规模远超现有谱图库,为后续的仓库级(repository-scale)研究创造了条件。 第二步,研究团队基于GEMS-A10数据集,通过自监督方式预训练DREAMS模型。模型的核心是BERT风格的“谱图到谱图”掩码建模(masked modeling)。具体而言,他们将每张谱图表示为一系列(质荷比m/z, 强度intensity)的二维峰。预处理中,他们利用一种改良的“傅里叶特征”(Fourier features)方法,将高分辨率的m/z值分解为正弦和余弦频率的组合,并与经前馈网络(feed-forward network)处理的强度值拼接,作为模型输入。模型的骨干是一个7层的Transformer编码器,包含多头自注意力(multi-head self-attention)机制。为让模型直接关注分子断裂产生的中性丢失(neutral losses)信息,他们借鉴Graphormer架构,将任意两个峰之间傅里叶特征的差异显式地输入给自注意力头。预训练有两个训练目标:一是预测被随机掩码(30%)的m/z值,该任务被设计为在离散化质量区间上的分类问题以建模预测不确定性;二是预测同一LC-MS/MS实验中两张谱图的色谱保留时间(chromatographic retention time)顺序。这一阶段的输出是一个1024维的、包含分子结构信息的谱图嵌入向量(embedding),即DREAMS表征。 第三步,研究团队将预训练好的DREAMS模型作为基础模型,在多个下游任务上进行微调(fine-tuning)和评估。他们设计了一种新的基于Murcko直方图(Murcko histogram)的数据集分割方法,以确保训练集和验证集之间的分子在结构上完全独立,从而严格评估模型的泛化能力。他们为每个任务增加一个简单的线性层或浅层前馈网络,并端到端地微调整个神经网络。
研究成果展现了DREAMS模型的卓越性能。在自监督预训练阶段,研究者通过线性探测(linear probing)观察到,随着训练的进行,模型逐步发现了分子片段(molecular fragments);对注意力头的分析也显示,模型学会了优先关注代表分子结构的信号峰而忽略噪声。在谱图相似性(spectral similarity)任务上,未经微调的DREAMS表征的零样本(zero-shot)余弦相似度,在预测分子谷本(Tanimoto)相似度上的表现就已经超越了有监督模型MS2Deepscore。经过针对难例三元组(由参考谱图、同一分子的不同谱图和质量极为接近的不同分子谱图组成)的对比微调后,模型在谱库检索和类似物搜索任务中的表现均显著优于包括MS2Deepscore和余弦相似度在内的44种标准谱图相似度算法。在分子指纹(molecular fingerprints)预测和从PubChem数据库中检索分子结构的任务上,DREAMS仅需一次前向传播,从原始谱图直接进行预测,其性能与依赖峰上分子式标注的顶尖模型MIST持平。在预测药物相关化学性质和分子复杂性(Bertz complexity)的任务上,DREAMS同样达到了业界领先水平,尤其是在高复杂性分子的预测上表现出色。在检测含氟分子(fluorine detection)这一极具挑战性的任务上,DREAMS在17,000张内部测试谱图上的精度达到了0.91,远超传统方法SIRIUS,并展现出强大的泛化能力,能准确预测与训练集结构差异显著的分子。
基于以上成果,研究团队构建了DREAMS Atlas(梦图集)——一个包含2.01亿张MS/MS谱图的分子网络。他们将来自整个GEMS-C数据集的2.01亿张谱图,经过LSH和DREAMS相似度双重聚类,精简为3400万个代表性节点,并以DREAMS嵌入的相似度作为边,构建了一个近似三近邻图(3-NN graph)。该图集具有高度连通性,99.7%的节点属于同一个连通分量,且大多数边的相似度高于0.8。分析发现,尽管标注谱库规模有限,但从任意一个未被注释的节点到最近的谱库节点,路径中位长度仅为6步,这表明DREAMS Atlas能有效实现从已知分子到未知分子的插值。研究团队展示了通过DREAMS Atlas的多跳邻居来生成研究假设的能力,例如揭示牛皮癣(psoriasis)与杀菌剂嘧菌酯(azoxystrobin)之间的潜在关联。
本研究的突破性价值在于,它证明了无需依赖任何人工编写的规则或化学先验知识,仅通过从海量原始实验质谱数据中进行自监督学习,Transformer模型就能涌现出对分子结构的深度理解。这一创新方法将研究范式从为每个具体问题设计特定算法,转变为提供一个通用的、数据驱动的基础模型,可被微调以解决几乎任何质谱注释任务。其科学价值在于为探索未知的“代谢组学暗物质”(metabolomics dark matter)提供了强大的新工具,而其应用价值则体现在构建的DREAMS Atlas作为一个公开资源,不仅可以用于快速查询和解释未知质谱,还为药物片段设计、发现具有新颖作用模式的化合物等计算化学挑战提供了新的视角。研究的核心亮点包括:首次将BERT式自监督学习成功应用于小分子MS/MS谱图;发明的改良傅里叶特征方法有效处理高精度质量数;以及通过构建前所未有的超大规模分子网络,揭示了环境暴露与疾病之间的潜在联系,为数据驱动的生物医学发现铺平了道路。