分享自:

2020 Identification and Analysis of Natural Building Blocks for Evolution-Guided Fragment-Based Protein Design

期刊:Journal of Molecular BiologyDOI:10.1016/j.jmb.2020.04.013

基于进化指导的蛋白质设计:Fuzzle数据库的构建与蛋白质片段网络分析

作者与发表信息 本研究由德国拜罗伊特大学(University of Bayreuth)生物化学系的Noelia Ferruz、Francisco Lobos、Dominik Lemm、Isaac N. Toledo-Patino、José Arcadio Farías-Rico,以及马克斯·普朗克发育生物学研究所(Max Planck Institute for Developmental Biology)和拜罗伊特大学计算生物化学系的Steffen Schmidt与Birte Höcker共同完成。该研究于2020年发表于《Journal of Molecular Biology》期刊。

学术背景 本研究隶属于结构生物学、计算生物学与蛋白质工程交叉领域。蛋白质是生命活动的核心执行者,其复杂多样的三维结构由其氨基酸序列编码。长期以来,蛋白质结构域被认为是基本的进化单元。然而,近年来越来越多的证据表明,自然界中庞大的蛋白质宇宙(protein universe)很可能是通过更小的、亚结构域大小的蛋白质片段(fragment)的复制、重组和分化进化而来。例如,研究团队此前已成功通过将来自不同折叠(fold)的片段(如(βα)8-桶状折叠和类黄素氧还蛋白折叠的片段)进行重组,设计出了具有稳定结构的新型嵌合蛋白质。这为蛋白质设计提供了新思路:借鉴自然进化的策略,识别并重新组合那些在进化史上被反复成功使用的、具有内在稳定性和可折叠性的“乐高积木”式蛋白质片段。

然而,我们对这些“进化成功”的片段在整个蛋白质宇宙中的分布、多样性和相互关系仍缺乏全局性的认识。因此,本研究的核心目标是:1)系统地识别和编目存在于所有已知天然蛋白质折叠之间的、具有序列和结构相似性的保守同源片段;2)理解这些片段如何连接不同的蛋白质折叠,从而揭示蛋白质折叠之间潜在的进化关系;3)建立一个公开可用的资源,为结构生物学家、进化生物学家以及蛋白质工程师提供用于蛋白质设计的“原材料”。

详细工作流程 本研究是一个综合性的生物信息学分析,其核心流程可分为四个主要步骤:数据库构建、片段识别与数据存储、网络构建与分析,以及网络服务器的开发。

第一步:数据库构建与全对全比较。 研究以权威的蛋白质结构分类数据库SCOP(Structural Classification of Proteins)为基础,使用其去除冗余的SCOP95子集(95%序列同一性聚类),包含28,010个结构域。对于数据库中的每一个结构域,研究团队使用PSI-BLAST工具,以NR20数据库为参考,生成了其多序列比对(Multiple Sequence Alignment, MSA),并据此为每个结构域构建了一个轮廓隐马尔可夫模型(profile Hidden Markov Model, profile HMM)。随后,他们使用HHsearch软件,关闭二级结构评分以避免结构约束带来的偏差,对这28,010个结构域进行了全对全(all-against-all) 的profile HMM两两比较。这一步骤旨在发现超越“暮光区”(twilight zone)的、远缘的序列相似性关系。

第二步:片段识别、结构比对与Fuzzle数据库创建。 对于HHsearch比较中发现的每一对具有显著相似性的结构域(称为一个“hit”或匹配),研究团队进行了两项结构比对分析:1)严格使用序列比对中匹配的残基进行结构叠合并计算均方根偏差(RMSDseq);2)使用TM-align软件,在序列比对确定的片段内进行基于结构的最优叠合并计算TM-score和RMSDtm。这些经过序列和结构双重验证的、在不同折叠间共享的蛋白质片段,被定义为“片段”(fragment)。最终,这一流程产生了超过810万个成对的“hit”,构成了一个庞大的数据集。所有这些数据——包括查询和目标的SCOP标识符、分类信息、HHsearch统计量(如概率值)、TM-score、RMSD以及片段起止位置等——都被整合存储在一个名为Fuzzle(Fold Puzzle) 的定制数据库中。这是本研究的一个核心产出,也是一个新颖的资源。

第三步:网络构建与全局分析。 为了从全局视角理解这些片段如何连接不同的蛋白质折叠,研究团队将Fuzzle数据库中的数据转化为一个相似性网络(similarity network)。在构建网络前,他们首先对数据进行了筛选和聚类处理。 1. 数据筛选:应用了严格的阈值,包括HHsearch概率≥70%、TM-score ≥ 0.3、RMSDtm ≤ 3 Å、片段长度在10-200个氨基酸之间,并且要求匹配的片段必须来自不同的SCOP折叠。最终得到208,944个高质量的成对匹配。 2. 区域聚类:由于一个蛋白质结构域可能包含多个不同的、与不同折叠共享的片段区域,研究者使用基于密度的聚类算法(DBSCAN),根据片段在每个结构域序列上的起始和结束位置,对每个结构域内的片段区域进行了聚类。例如,文中举例的转铁蛋白结构域(d1jnfa2)被聚类为三个不同的片段区域,分别与不同折叠的结构域共享。这一步骤确保了网络分析中能够区分同一结构域内不同的进化片段。 3. 网络构建:网络中的每个节点(node)代表一个“聚类后的结构域片段”(即一个特定的片段在一个特定结构域中的实例)。如果两个节点所代表的片段出现在同一个高质量的成对匹配中,则用一条边(link)将它们连接起来。最终构建的网络包含24,999个节点和162,852条边。这个网络是无向、无权、简单且不连通的。网络中的每个连通子图(connected component)被称为一个“组件”(component),代表了一组来自不同折叠但共享同一个同源蛋白质片段的结构域。因此,每个组件对应一个被进化反复利用的“片段”。

第四步:网络服务器开发。 为了使研究成果能够被科学界广泛利用,研究团队开发了一个交互式网络服务器(fuzzle.uni-bayreuth.de)。用户可以根据自己的需求(如特定的折叠、概率阈值、长度范围等)动态过滤Fuzzle数据库,生成定制化的相似性网络、矩阵或表格,并可视化共享片段的结构叠合图。所有数据和分析结果均可在线查看和下载。

主要研究结果 1. 数据库内容概览与片段分布特征: Fuzzle数据库包含了超过810万个跨折叠的片段匹配。分析发现,超过180万个匹配(约占总数的20%)连接了SCOP中先前被认为不相关的不同折叠,这强有力地支持了蛋白质片段在进化中被广泛重用的假说。对高质量匹配(概率>70%,TM-score>0.3)的分析显示,大多数共享片段较短(≤40个氨基酸),但也存在相当数量长度在50-70个氨基酸的片段,甚至少数超过100个氨基酸,这为蛋白质设计提供了不同尺度的“构建模块”。

2. 蛋白质宇宙的网络视图: 网络分析揭示了蛋白质空间的整体图景。应用严格阈值构建的网络包含1337个独立的“组件”(即1337个不同的共享片段),覆盖了SCOP数据库中1221个折叠中的519个。网络呈现出不连通的特性,这正是研究者的预期:每个独立的“组件”代表一个独特的、被重复利用的进化片段。网络中度分布(degree distribution)呈现幂律分布(power-law distribution),即少数节点(“枢纽”, hubs)拥有大量的连接,而大多数节点连接数很少。这与社交网络、万维网等复杂网络的特征一致,表明蛋白质进化中片段的重用也遵循“优先连接”的规律。

3. 主要组件(Fragment 0)及其意义: 网络中存在一个主要组件(Major Component, 文中称为Fragment 0),它包含了网络中59.4%的节点(14,856个),连接了162个不同的折叠,涉及490种不同的折叠对。这个巨大的连通区域主要包含α/β类(73.6%)和全α类(19.0%)的折叠。这一发现并非由于数据库中这些类别结构域的过度表达,因为随机抽样分析也证实了这一点。它强烈暗示,某些特定的蛋白质片段(或片段组合)在进化早期出现,并因其内在的优良特性(如折叠性、稳定性)而被极其广泛地重用于构建大量不同的蛋白质结构,尤其是催化功能丰富的α/β类和全α类蛋白质。这个主要组件内部又可分为两个相对密集的区域,并通过461条边相互连接,表明α/β类和全α类折叠在进化历史上存在着深刻的联系。

4. 具体片段实例与进化关系验证: 研究详细分析了主要组件中的几个高连接度折叠对,这些实例验证并扩展了先前的研究发现: * (βα)8-桶状折叠(c.1)与类黄素氧还蛋白折叠(c.23):网络分析显示,这两个折叠的域对分布在两个不同的区域,对应于(βα)8-桶的两个“半桶”。这直接支持了(βα)8-桶状折叠可能通过一个类似半桶的祖先片段复制融合演化而来的假说。 * Rossmann折叠(c.2)与甲酰转移酶样折叠(c.65):这两个折叠在网络的中心区域有两个离散的连接区域,共享的片段长度不同,可能意味着存在一个更小的祖先亚片段发生了复制分化,或者存在两次独立的进化事件。 * DNA/RNA结合3-螺旋束折叠(a.4)与λ阻遏蛋白样DNA结合域折叠(a.35):这是全α类折叠中最常见的连接,共享的片段对应于螺旋-转角-螺旋(Helix-Turn-Helix, HTH) 基序,这是一个经典的DNA结合模体。这印证了Alva等人先前发现的一个古老肽段。 * 研究还确认了其他已知的进化联系,如组氨酸磷酸载体蛋白激酶(c.91)与磷酸烯醇式丙酮酸羧激酶(c.37)之间的相似性,以及核糖激酶(c.72)与NAD(P)结合Rossmann折叠之间的关联。

5. 片段的重组与进化启示: 研究在数据集中发现了1155个结构域包含至少两个长度超过40个氨基酸且不重叠的片段。文中列举了两个典型例子: * 一个来自类黄素氧还蛋白折叠(c.23)的结构域,其N端片段与甲酰转移酶折叠(c.65)共享,C端片段与(βα)8-桶状折叠(c.1)共享。 * 一个四肽重复(TPR)样结构域(a.118.8),其N端和C端片段分别与不同的折叠(a.4和e.61)共享。 这些例子直观地展示了现代蛋白质如何通过重组(recombination) 不同的进化成功片段而构建,为蛋白质设计提供了直接灵感。此外,研究还发现,Alva等人鉴定出的40个古老肽段中的37个都包含在Fuzzle的片段集中,并且许多肽段以不同长度的变体形式存在,周围可能附加了额外的序列(“装饰”),这体现了片段在进化中通过延伸和修饰而多样化的过程。

结论与意义 本研究通过大规模的计算分析,系统地绘制了蛋白质宇宙中进化保守片段的分布图,并建立了公开可用的Fuzzle数据库和网络分析平台。研究证实了蛋白质进化中“片段重用”的普遍性,揭示了大量先前未被认识的蛋白质折叠之间的同源关系,特别是通过一个巨大的连通网络(Fragment 0)展示了α/β类和全α类折叠在进化上的紧密联系。

科学价值:该研究为理解蛋白质折叠的起源和进化提供了全局性的、数据驱动的视角。它将蛋白质宇宙视为一个由共享片段连接起来的复杂网络,为进化生物学研究提供了新的范式和分析工具。研究结果支持了“现代蛋白质起源于较小肽段的复制、分化和重组”这一假说。

应用价值:Fuzzle数据库和服务器为蛋白质工程和设计提供了宝贵的“原材料库”。它使得研究者能够便捷地识别那些在自然进化中被反复验证的、具有内在稳定性和可折叠潜力的蛋白质片段,并将其作为“构建模块”进行理性重组,以设计具有新结构或新功能的人造蛋白质。这种“进化指导的蛋白质设计”策略,模仿了自然进化的成功路径,为克服从头设计(de novo design)的挑战提供了强有力的补充方案。

研究亮点 1. 规模与系统性:首次对代表所有天然折叠的蛋白质结构域进行了全对全的、基于profile HMM的序列与结构联合分析,规模空前(超过810万对匹配),系统性地揭示了跨折叠的片段共享现象。 2. 创新性资源:构建了Fuzzle这一综合性数据库和交互式网络服务器,将原始数据、分析工具和可视化界面整合在一起,极大地方便了科学界的使用和探索。 3. 网络视角的洞察:采用复杂网络理论分析蛋白质进化关系,直观地揭示了蛋白质空间的拓扑结构,识别出被广泛重用的核心片段(如主要组件Fragment 0)和关键枢纽节点,提供了全局进化图景。 4. 为蛋白质设计提供直接蓝图:不仅验证了已知的进化关系,更重要的是发现了大量新的、可用于设计的片段组合实例(如包含两个不同片段的域),直接启发了通过异源片段重组进行蛋白质设计的策略。 5. 方法学严谨性:结合了最灵敏的远缘同源检测方法(profile HMM比较)和严格的结构验证(TM-align),并进行了数据聚类以区分同一蛋白内的不同片段区域,确保了分析结果的可靠性。

其他有价值内容 研究还讨论了这些进化成功片段在古老折叠中的富集现象。在Caetano-Anollés等人提出的24个最古老折叠中,Fuzzle片段覆盖了其中的22个。这进一步支持了所识别出的片段很可能在折叠蛋白质起源的早期就已出现,并在后续进化中被反复利用的观点,增强了它们作为稳定“构建模块”的价值。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com