分享自:

2022 ProtGPT2 is a deep unsupervised language model for protein design

期刊:nature communicationsDOI:10.1038/s41467-022-32007-7

关于ProtGPT2:一种用于蛋白质设计的深度无监督语言模型的学术研究报告

一、 主要作者、机构及发表信息 本研究由德国拜罗伊特大学(University of Bayreuth)生物化学系的Noelia Ferruz、Steffen Schmidt和Birte Höcker共同完成。其中,Noelia Ferruz为第一作者兼通讯作者。该研究成果以题为《ProtGPT2 is a deep unsupervised language model for protein design》的论文形式,于2022年发表在学术期刊《自然·通讯》(*Nature Communications*)上。

二、 研究背景与目标 学术领域: 本研究属于计算生物学、人工智能与蛋白质工程的前沿交叉领域,具体聚焦于利用深度学习进行从头蛋白质设计de novo protein design)。

研究背景与动机: 蛋白质设计旨在为特定目的定制新型蛋白质,在解决生物医学和环境问题方面潜力巨大。近年来,基于Transformer架构的自然语言处理(NLP)模型(如GPT系列)在生成类人文本方面取得了突破性进展。研究人员注意到蛋白质序列与人类语言之间存在深刻的类比关系:蛋白质序列由20种天然氨基酸(字母)按特定顺序排列,形成二级结构(“单词”)、结构域(“句子”)并最终实现功能(“语义”)。这种序列本身即完整编码了结构与功能信息的特性,使其成为语言模型的理想应用对象。尽管已有一些基于BERT架构的蛋白质语言模型(如ESM、ProtTrans)用于序列嵌入和预测任务,但在生成全新、可行的蛋白质序列方面,基于自回归(autoregressive)训练的生成式模型(如GPT)展现出独特优势。此前已有如Progen、RITA等蛋白质自回归模型的研究,但研究者希望探索能否训练一个生成模型来:(1)有效学习“蛋白质语言”;(2)生成稳定、可折叠的蛋白质;(3)理解这些生成序列与天然蛋白质的关系,并探索其是否能够采样蛋白质空间中未被探索的区域。

研究目标: 开发并验证一个名为ProtGPT2的大规模自回归Transformer语言模型,该模型能够高效生成符合天然蛋白质原则的从头蛋白质序列,并系统评估这些生成序列在氨基酸组成、结构倾向性、进化距离、折叠状态及结构新颖性等方面的特性。

三、 详细研究流程与方法 本研究包含模型构建、序列生成、多维度评估和数据分析等一系列严谨步骤。

1. 模型构建与训练 * 数据准备: 研究使用UniRef50数据库(2021_04版本)作为训练集,该数据库是在50%序列一致性下聚类的UniProt数据,包含约5000万条非注释序列,覆盖了整个蛋白质空间,包括“暗蛋白质组”。研究随机抽取10%的序列作为验证集,最终训练集和验证集分别包含4490万和490万条序列。 * 词汇编码: 采用字节对编码(Byte-Pair Encoding, BPE)算法对序列进行子词(sub-word)分词,使用Swiss-Prot数据库训练得到一个包含50,256个令牌(token)的词汇表,平均每个令牌对应约4个氨基酸,这比单氨基酸编码更能捕捉序列模式。 * 模型架构与训练: ProtGPT2采用纯解码器(decoder-only)的Transformer架构,共36层,参数量达7.38亿,与GPT-2 Large模型规模相当。模型权重被重新初始化。训练采用自回归目标,即通过最小化整个数据集的负对数似然,让模型学习根据序列中前面的氨基酸预测下一个氨基酸的概率。训练在128块NVIDIA A100 GPU上使用DeepSpeed进行并行化处理,耗时4天完成。

2. 序列生成与采样策略优化 * 生成策略比较: 由于从训练好的语言模型中采样序列需要解码策略,研究系统比较了贪婪搜索(Greedy Search)、束搜索(Beam Search)和随机采样(Random Sampling)等策略。研究发现,贪婪和束搜索会产生重复、确定性高的非自然序列,而随机采样(从概率最高的k个候选词中随机选择)能产生更自然的序列。 * 参数优化: 通过系统性地改变采样参数(如top_k值、重复惩罚系数),并对比生成序列与天然序列的氨基酸倾向性,研究确定了最优采样参数:top_k = 950,重复惩罚系数 = 1.2。以此参数生成了用于后续分析的ProtGPT2序列数据集。

3. 多维度评估数据集构建 为全面评估ProtGPT2,研究构建了三个数据集,各包含10,000条序列: * ProtGPT2数据集: 使用上述最优参数从模型中采样生成。 * 天然数据集: 从UniRef50中随机选取,其长度分布与ProtGPT2数据集匹配。 * 随机数据集: 通过随机拼接25种出现在UniRef50中的氨基酸字母(包括20种标准氨基酸和X、B等非标准字符)生成,作为阴性对照。

4. 序列与结构特性分析流程 研究对上述三个数据集进行了多层次、多角度的生物信息学分析和计算模拟: * 氨基酸倾向性与无序性预测: 计算并比较三个数据集的氨基酸组成频率。使用IUPred3软件预测蛋白质内在无序区域(IDR),并计算各数据集中球状结构域的比例及有序氨基酸残基的比例。 * 二级结构预测: 使用PSIPRED软件预测并比较天然数据集与ProtGPT2数据集的α-螺旋、β-折叠和卷曲结构含量。 * 进化距离评估(同源性检测): 使用高灵敏度远程同源性检测工具HHblits,将每个数据集的序列与UniClust30数据库进行比对。记录每个序列在数据库中能找到的最高一致性比对,并以HSSP曲线为阈值,分析各数据集序列与已知天然蛋白质的进化关系(是位于“安全区”还是“模糊区”)。 * 结构折叠与稳定性评估: * AlphaFold2结构预测: 使用ColabFold对每个序列进行5次结构预测,获取每个残基的局部距离差异测试(pLDDT)置信度分数,该分数与结构有序性相关。计算各数据集的平均pLDDT分数及高分(>70)序列比例。 * Rosetta能量计算: 使用Rosetta Relax协议,以AlphaFold2预测的最佳结构为起点,进行蒙特卡洛优化,计算每个结构的Rosetta能量单位(REU),并归一化为每残基能量,评估蛋白质的热力学稳定性。 * 分子动力学(MD)模拟: 从每个数据集中随机选择12个结构(pLDDT均值无统计学差异),每个结构进行3次重复、每次100纳秒的分子动力学模拟,总计108条轨迹、10.8微秒模拟时间。计算均方根偏差(RMSD)以评估结构的动态波动特性。 * 蛋白质空间探索与结构新颖性分析: * 相似性网络构建: 将ProtGPT2生成的序列与SCOP 2.07数据库(95%一致性过滤后)的已知结构域序列合并。为每个序列生成隐马尔可夫模型(HMM)谱,使用HHsearch进行全对全比对。以序列为节点,当两条序列间存在至少20个氨基酸长度且HHsearch概率≥70%的比对时,在节点间建立连接,构建蛋白质相似性网络。 * 结构比对与功能位点分析: 使用FoldSeek工具,将选定的ProtGPT2生成蛋白质的AlphaFold2预测结构与蛋白质数据库(PDB)进行快速结构比对,寻找最相似的自然结构。通过视觉检查叠加结构,分析配体结合口袋等关键功能位点的氨基酸残基保守情况。

四、 主要研究结果 1. ProtGPT2有效学习了蛋白质语言并生成类天然序列: 通过优化采样策略,ProtGPT2生成的序列在氨基酸组成频率上与天然序列高度相似。这表明模型并非简单记忆和重复训练数据,而是掌握了氨基酸组合的统计规律。

2. 生成序列编码球状蛋白质: 无序性预测(IUPred3)显示,ProtGPT2生成的序列中,87.59%被预测为球状结构域,与天然数据集(88.40%)的比例非常接近。在氨基酸水平,ProtGPT2序列的有序残基比例为82.59%,也与天然序列(79.71%)相当。二级结构预测(PSIPRED)结果显示,ProtGPT2序列的α-螺旋(48.64%)、β-折叠(39.70%)和卷曲(11.66%)含量与天然序列(45.19%, 41.87%, 12.93%)高度一致。这些结果表明ProtGPT2生成的序列具有与天然蛋白质相似的结构组织倾向。

3. 生成序列与天然序列既相似又遥远: HHblits同源性搜索结果显示,93%的ProtGPT2序列能在UniClust30数据库中找到高于HSSP曲线阈值的同源物,表明它们与天然蛋白质存在遥远的进化关系。然而,与天然数据集相比,ProtGPT2序列比对的平均序列一致性更低(分布范围更集中于32.9–64.1%),且在高一致性(>90%)区域,ProtGPT2的比对长度极短(<15个氨基酸),而天然序列则有更长的显著比对。这强有力地证明ProtGPT2并非复制训练数据,而是生成了与天然蛋白质远缘相关但新颖的序列。

4. 生成序列可折叠为有序且稳定的结构: * AlphaFold2预测: ProtGPT2数据集的最佳预测结构的平均pLDDT为63.2,37%的序列pLDDT > 70,表明大部分序列能折叠成有序结构。这显著优于随机数据集(平均pLDDT 44,仅7.4% > 70),但略逊于天然数据集(平均pLDDT 75.3,66% > 70)。 * Rosetta能量评估: ProtGPT2生成结构的平均Rosetta能量为-1.73 REU/残基,与天然数据集(-1.90 REU/残基)同处于稳定蛋白质的典型范围(-1 到 -3 REU/残基),而随机序列的能量接近零(0.13 REU/残基),表明其不稳定。 * 分子动力学模拟: ProtGPT2结构的平均RMSD(3.12 Å)与天然蛋白质(2.93 Å)无统计学显著差异,且远低于随机序列(9.41 Å)。这表明ProtGPT2生成的蛋白质具有与天然蛋白质相似的动态柔性,而非刚性或过度不稳定的结构。

5. ProtGPT2探索了蛋白质空间的未知区域: 相似性网络分析包含59,612个节点(序列),其中ProtGPT2序列(白色节点)广泛分布在网络中,连接了不同SCOP类别的蛋白质簇,甚至将一些原本分离的“岛屿”状集群连接起来,显著增大了网络最大连通分量的大小。这表明ProtGPT2能够生成序列,填充天然蛋白质空间中未被充分探索或“黑暗”的区域。从不同SCOP类别(全α、全β、α/β、α+β、膜蛋白)中选取的生成结构示例显示,ProtGPT2能够产生具有复杂特征(如长环、不规则表面)的非理想化折叠,这与许多传统从头设计方法产生的过于规则、理想化的结构形成鲜明对比。例如,生成的蛋白质4266,其拓扑结构在PDB中未找到明确匹配(与最相似结构5b48的DALI Z-score仅为5.4),展示了新颖的折叠可能。

6. 生成序列保留了潜在的功能热点: 结构叠加分析发现,尽管序列一致性很低(~30%),一些ProtGPT2生成的蛋白质在其配体结合口袋中,与天然同源物相比,保留了关键的功能性氨基酸残基(相同或性质相似的替换)。例如,序列357与蓝光传感器蛋白(PDB:1x0p)叠加后,其FAD配体的五个侧链相互作用残基中有三个完全相同,两个发生了可形成相同相互作用的保守替换。这表明ProtGPT2在零样本(zero-shot,即未针对特定折叠进行微调)生成过程中,可能无意中捕捉到了维持功能的结构约束。

五、 研究结论与价值 本研究成功开发并验证了ProtGPT2,一个基于Transformer的深度无监督生成式语言模型,它能够高效地生成具有天然蛋白质特性、可折叠且稳定的从头蛋白质序列。

科学价值: 1. 证明了NLP生成模型在蛋白质设计中的强大能力: 研究将蛋白质序列视为一种“语言”,成功地将最先进的文本生成模型架构应用于蛋白质序列生成,为蛋白质工程开辟了一条全新的、数据驱动的途径。 2. 探索了“黑暗蛋白质组”: ProtGPT2能够生成与已知天然蛋白质远缘相关但新颖的序列,并预测其能折叠成复杂、非理想化的结构,这有助于探索进化未触及的蛋白质序列空间,发现全新的蛋白质折叠和功能。 3. 揭示了生成模型对功能结构的隐含学习: 尽管模型仅在序列水平训练,未接触任何三维结构或功能注释,但其生成的序列不仅可折叠,还在某些情况下保留了功能位点的关键特征,暗示模型从序列中学习到了更深层次的结构与功能约束。

应用价值: 1. 高效高通量蛋白质设计平台: ProtGPT2可在普通工作站上于几秒钟内生成蛋白质序列,极大加速了蛋白质设计的初始构思和筛选阶段。 2. 可定制的设计起点: 模型可以通过在用户指定的序列家族上进行微调(fine-tuning),实现针对特定折叠、功能或家族的定向生成,用于蛋白质功能优化、改造或创造全新功能。 3. 推动实验研究: 为合成生物学、酶工程、生物材料开发和治疗性蛋白质设计提供了丰富的、经过计算初步验证的候选序列,可作为后续实验表征和功能验证的起点。

六、 研究亮点 1. 方法创新性: 首次将GPT-2规模的自回归Transformer模型大规模应用于整个蛋白质序列空间的训练,并系统优化了适用于蛋白质生成的解码采样策略。 2. 评估全面性与严谨性: 研究不仅进行了常规的序列和结构预测分析,还引入了进化距离分析(HHblits/HSSP曲线)、大规模结构预测(AlphaFold2)、能量计算(Rosetta)、分子动力学模拟以及蛋白质空间网络可视化等多维度、多层次的评估体系,为生成序列的质量提供了强有力的证据链。 3. 结果突破性: 明确证明ProtGPT2生成的是远缘相关但新颖的序列,而非训练集的简单记忆;生成的蛋白质具有复杂、非理想化的自然特征(如长环、不规则表面),突破了传统从头设计方法往往产生过于规则结构的局限;暗示了模型对功能位点的隐含学习能力。 4. 资源开放性: 研究将训练好的模型、代码及相关数据集在Hugging Face等平台公开,极大地促进了该领域的研究和应用。

七、 其他有价值内容 研究还详细讨论了与之前蛋白质语言模型(如ESM、ProtTrans等基于BERT的模型,以及Progen、RITA等自回归模型)的对比,突出了ProtGPT2在生成能力上的定位。同时,文章也坦诚指出了当前模型的局限性,例如生成序列的平均pLDDT分数仍低于天然蛋白质,以及未来可通过引入条件标签(conditional tags)来实现对特定功能或属性的可控生成等改进方向。这些讨论为后续研究提供了清晰的路线图。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com