分享自:

基于扩散生成模型进行蛋白质结构抗原特异性抗体设计与优化

期刊:bioRxivDOI:10.1101/2022.07.10.499510

这是一项关于利用基于扩散的生成模型进行抗体设计的原创性研究。该预印本于2022年10月16日发布在bioRxiv上。

主要作者及研究机构 该研究由石同洛(Shitong Luo,Helixon Research)、苏玉峰(Yufeng Su,University of Illinois Urbana-Champaign)、彭星钢(Xingang Peng,北京大学智能学院)、王晟(Sheng Wang,University of Washington Paul G. Allen计算机科学学院)、彭健(Jian Peng,Helixon Research / University of Illinois Urbana-Champaign)和马剑竹(Jianzhu Ma,Helixon Research / 清华大学智能产业研究院)共同完成。

学术背景与研究目的 抗体(antibodies)是免疫系统中至关重要的Y形蛋白质,能够通过特异性结合病毒、细菌等抗原(antigens)来保护宿主。抗体与抗原的结合能力主要由抗体上的六个互补决定区(complementarity-determining regions, CDRs)决定,其中包括重链上的H1、H2、H3和轻链上的L1、L2、L3。因此,设计能够与特定抗原结合的CDR是开发治疗性抗体的核心步骤。传统的计算方法主要依赖基于生物物理能量函数的采样算法,但这类方法耗时且易陷入局部最优。近年来,深度生成模型开始应用于抗体设计,但此前的工作要么未显式地考虑抗原的3D结构,要么未能在原子分辨率级别对氨基酸(amino acids)的侧链(side-chain)取向(orientation)进行建模,并且无法应用于抗体优化的现实场景。为了弥补这一空白,本研究旨在开发一种全新的深度生成模型,能够同时满足三大设计原则:第一,模型应显式地以抗原的3D结构为条件,生成在三维空间上互补的CDRs;第二,模型必须能够对氨基酸的位置及其侧链取向进行建模,因为抗体-抗原相互作用主要发生在侧链原子上;第三,模型不仅要能从头设计(de novo design),还应能对已存在的抗体进行优化,以提升其结合亲和力。

详细研究方法与流程 为实现上述目标,该研究提出了名为DiffAb的模型,其核心是基于扩散概率模型(diffusion probabilistic models)和等变神经网络(equivariant neural networks)的序列-结构联合生成框架。研究的整体流程分为数据处理、模型构建与训练、以及多样化的采样与应用。

在数据准备阶段,研究团队从SAbDab数据库(The Structural Antibody Database)中获取抗体-抗原复合物结构数据。他们首先剔除了分辨率低于4埃的结构以及针对非蛋白质抗原的抗体。随后,根据CDR-H3序列以50%的序列同一性进行聚类,并手动从中选取了五个聚类作为独立的测试集,其中包含19个针对SARS-CoV-2、MERS、流感等病原体抗原的复合物结构,其余的聚类则用作训练集。

在模型构建与训练环节,研究者将一个蛋白质复合物中的氨基酸表示为其氨基酸类型(si,20种离散类型)、Cα原子坐标(xi,连续的三维坐标向量)和侧链取向(oi,SO(3)空间中的元素),并提出了一种新颖的多模态扩散过程。模型的输入是抗原和抗体框架结构的上下文信息(context),目标是生成CDRs的序列与结构。 前向扩散过程(forward diffusion process)通过一个马尔可夫链(Markov chain)逐步向真实数据添加噪声。对于离散的氨基酸类型,采用基于多项分布的扩散(multinomial diffusion),逐步增加将氨基酸类型重置为均匀分布的概率。对于连续的Cα坐标,采用高斯扩散过程,通过缩放和位移将坐标分布标准化为标准正态分布,并按公式逐步添加高斯噪声。对于侧链取向,则定义了一种在SO(3)流形上的扰动-去噪(perturb-denoise)方案,利用各向同性高斯分布(Isotropic Gaussian distribution on SO(3), IGSO(3))进行扩散。 生成扩散过程(generative diffusion process)则从采样的先验分布(均匀类型、标准正态坐标、均匀取向)开始,通过学习到的神经网络一步步逆转前向过程。该研究采用多层感知机(MLPs)生成单个氨基酸和氨基酸对的嵌入向量,编码了类型、扭转角、所有重原子的3D坐标以及氨基酸对间的欧氏距离和二面角等信息。随后,采用AlphaFold2中引入的不变性点注意力网络(Invariant Point Attention, IPA),这是一种能处理取向信息的旋转-平移不变(roto-translation invariant)网络,将嵌入向量转化为隐藏表示(hidden representations)。这些表示最后被送入三个特定的MLP,分别预测去噪后的氨基酸类型分布、局部坐标系下的坐标偏移(左乘当前取向矩阵转换回全局坐标系以确保等变性)以及一个右乘当前取向的SO(3)旋转矩阵(rotation matrix),从而更新取向。整个网络的去噪函数满足关键的旋转-平移等变(equivariance)属性,确保了物理合理性。训练目标是最小化所有时间步上,氨基酸类型的KL散度、坐标的均方误差以及取向矩阵的内积差异的期望总和。

在采样与应用算法方面,研究展示了模型的“瑞士军刀”能力。完成去噪后,通过理想局部坐标重建N、Cα、C、O和Cβ原子,并使用Rosetta软件中的侧链填充(side-chain packing)算法构建全原子结构,最后用OpenMM中的Amber99力场进行结构精修。针对三大任务,采样方式各有不同: 1. 序列-结构协同设计:从完全随机的噪声开始,迭代运行完整的生成扩散过程直到t=0,同时生成CDR的序列和3D结构。 2. 固定骨架的序列设计:给定已知的骨架结构(坐标和取向),将其固定在输入中,仅在每一步采样扩散过程中的氨基酸类型。 3. 抗体优化:首先,使用前向扩散过程对天然抗体的CDRs施加t步噪声进行扰动,使其偏离原始构象;然后,从第(T-t)步开始执行生成扩散过程,去噪并优化到一个具有更高结合亲和力的新序列与结构。

主要研究结果 研究团队通过多项实验评估了DiffAb的性能。在序列-结构协同设计任务中,以RosettaAntibodyDesign (RAbD)为基线,DiffAb在氨基酸恢复率(amino acid recovery rate, AAR)上全面超越RAbD,显示出更强的序列学习能力。在CDR-H3上,DiffAb生成的结构均方根偏差(root-mean-square deviation, RMSD)更高(3.597埃),表明其结构多样性更丰富。在结合能改进百分比(percentage of improved binding energy, IMP)指标上,DiffAb在H3上与RAbD持平,在其他CDRs上略低,但考虑到该指标本身由基线采用的Rosetta能量函数计算,DiffAb在没有显式能量函数监督下能取得接近的分数,表现出了竞争力。通过可视化分析,研究者发现结合能更低的生成CDR确实与抗原展现了更好的几何互补性。

在固定骨架的序列设计任务中,与Rosetta的FixBB对比,DiffAb在所有六个CDRs上均取得了显著更高的AAR,例如H1从37.14%提升至87.83%,H3从30.74%提升至59.48%,这证明了模型在给定骨架结构下对序列条件概率的强大建模能力。此外,模型通过固定序列还能预测CDR结构,其对H1、H2、L1、L2、L3的预测RMSD均在1.5埃以内,但对高度可变的H3预测精度较低,且随着序列长度超过10个氨基酸,准确度下降。

在抗体优化任务中,通过控制扩散步数,DiffAb能在保持序列与原抗体高度相似的前提下提升结合能。当优化步数t=4时,优化后CDR的IMP分数接近从头设计,而序列同一性(sequence identity)仍保持在91.16%,RMSD仅为1.290埃,成功实现了在结构扰动最小的前提下改进结合亲和力,这在药物化学中极具应用价值。

此外,研究还展示了一个极具挑战性的应用:在没有已知结合姿态的全新抗原-抗体对中设计抗体。他们以SARS-CoV-2 Omicron RBD为靶点,使用HDOCK软件将一个去除了H3的通用人抗体模板对接到抗原上,从而构建出模拟的结合框架。基于该对接结构,DiffAb成功生成了多个结合能分布合理的CDR-H3,表明可与分子对接方法结合,将模型推广至更一般化的场景。

研究结论、价值与亮点 本研究的核心结论是,首个能够显式考虑抗原3D结构,并在此条件下完成抗体CDR序列与结构协同设计的深度学习模型。其科学价值在于,它首次在一个统一的扩散-等变框架内,同时解决了序列、坐标和侧链取向的生成问题,实现了旋转-平移等变的、原子分辨率的抗体设计。在应用价值上,模型集成了序列-结构协同设计、固定骨架设计与抗体优化三大功能,为计算抗体药物发现提供了一套灵活高效的工具,特别是抗体优化功能,紧密贴合了从动物或患者体内获取先导抗体后进行改造的实际药物开发流程。 本研究的亮点集中体现在其方法学的突破性和功能的全面性上。第一,它不同于以往任何仅依赖序列或忽略抗原结构的方法,第一个将抗原结构作为必要条件引入生成过程。第二,对氨基酸取向SO(3)的精确建模是该领域内的一项开创性工作,解决了决定侧链相互作用的关键几何因素。第三,通过精妙地利用扩散过程的扰动特性,该方法实现了传统从头设计模型不具备的“抗体优化”功能,能够在保持高序列相似度的前提下有效提高亲和力,具有极大的实际意义。第四,模型内在的等变性保证了生成结构在物理上的合理性,这是可靠蛋白质设计的重要基石。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com