分享自:

2021 Fuzzle 2.0 Ligand Binding in Natural Protein Building Blocks

期刊:Frontiers in Molecular BiosciencesDOI:10.3389/fmolb.2021.715972

关于 Fuzzle 2.0 网络资源:天然蛋白质构建模块中配体结合信息的学术报告

一、 研究基本信息 本研究由德国拜罗伊特大学生物化学系的 Noelia Ferruz 和 Birte Höcker 作为共同通讯作者领导,团队成员包括 Florian Michel, Francisco Lobos 以及 Steffen Schmidt。该研究以论文形式《Fuzzle 2.0: ligand binding in natural protein building blocks》发表于期刊 *Frontiers in Molecular Biosciences*,并于 2021 年 8 月 18 日正式在线发表。

二、 学术背景与研究目标 本研究隶属于计算结构生物学、蛋白质进化与蛋白质工程领域。其核心背景是现代蛋白质被认为是通过亚结构域大小的片段(subdomain-sized fragments)经过复制和重组进化而来。研究团队此前开发了名为 Fuzzle 的数据库和网络接口,用于识别和分析在不同蛋白质折叠(fold)间共享的、超过 1000 个这样的保守进化片段。该资源为结构生物学家、进化生物学家提供了识别蛋白质保守部分的分析工具,也为蛋白质工程师提供了通过片段组合进行设计的“构建模块”。

然而,蛋白质的一个主要功能是结合其他分子(配体),而配体结合模式在进化中通常是保守的,这为追溯共同进化起源提供了关键线索。原版 Fuzzle 数据库缺乏配体结合信息,限制了其在研究片段功能进化以及指导基于功能的蛋白质工程方面的潜力。因此,本研究的主要目标是发布 Fuzzle 网络资源的升级版本——Fuzzle 2.0。此次升级的核心扩展是整合了蛋白质-配体复合物的非共价相互作用信息。具体目标包括:1)使研究人员能够系统性地搜索与特定配体结合的蛋白质片段;2)更好地理解蛋白质片段的进化,尤其是配体结合功能的保守与分化;3)为蛋白质工程应用(如将结合口袋移植到其他蛋白质支架中,或通过重组特定片段转移功能位点)提供直接的数据支持。

三、 详细研究流程与方法 本研究本质上是开发并展示一个增强型生物信息学数据库和网络工具。其工作流程主要包含数据库构建、功能扩展、网络界面开发以及一个具体的应用案例演示。

1. 数据库构建与数据整合: * 研究基础与更新: Fuzzle 2.0 的核心数据基于 SCOP(Structural Classification of Proteins)数据库。本研究首先将数据库更新至 SCOP 版本 2.07。保守的亚结构域片段识别方法沿用先前工作:为 SCOP95 2.07 中的每个结构域创建隐马尔可夫模型(Hidden Markov Model, HMM)谱,使用 HH-suite 进行全对全(all-against-all)比对,并通过 TM-align 进行结构叠加以计算基于 Cα 原子的均方根偏差(RMSD)。数据存储为 ‘SCOP 2.07 PSI’。 * 筛选标准: 从不同折叠(folds)中筛选出共有片段(hits)的标准包括:RMSD < 3 Å,HHsearch 概率 > 70%,片段长度在 10 到 200 个氨基酸之间,TM-score > 0.3。序列比对长度允许比结构比对长最多 25%。 * 配体信息整合: 这是 2.0 版本的关键新增步骤。由于 SCOP 本身不包含配体坐标,研究团队从原始的蛋白质数据库(PDB)条目中检索配体坐标。他们设定了一个 4 Å 的距离截断值(任何重原子),若配体(PDB 中定义为 HETATM 条目,包括修饰残基)与蛋白质域的任何原子在此距离内,即认为存在相互作用。当一个配体在多个域之间结合时,它会出现在所有满足截断值条件的域记录中。

2. 网络服务器功能开发与升级: * 搜索功能增强: 新版本实现了两种配体搜索方式:通过 PDB 三字母代码(如 ATP)或通过 SMILES 字符串。SMILES 搜索不仅支持查找完全相同的配体,还能通过计算拓扑指纹和 Tanimoto 相似性系数,找到相似度超过 70% 的配体,甚至能识别化合物的子结构或超结构(例如,搜索 ATP 的子结构会返回所有结合腺苷或无机磷酸的片段)。 * 数据可视化与分析工具: 片段分析页面增加了包含片段统计信息的表格(如代表性结构域、包含该片段的域数量、平均长度、涉及的折叠、结合的配体)。新增的详细视图允许用户使用 NGL 查看器在片段背景下可视化蛋白质-配体相互作用,并可切换不同的相互作用类型(如 π-π 堆积、氢键)、计算距离和显示表面图。 * 数据导出与交互: 包含配体信息的分类关系表和网络图可以 CSV 或 JSON 格式下载。片段的结构叠合文件可作为 PyMOL 会话文件获取。此外,实现了可根据配体、SCOP 类别或长度进行片段搜索的功能。 * 技术栈: 网站后端使用 Django 和 PostgreSQL,前端使用 JavaScript 并基于 Bootstrap 框架,同时整合了 jQuery、graph_tool、DataTables 和 D3.js 等库以实现数据交互和可视化。

3. 应用案例研究:以周质结合蛋白样片段为例 为了展示 Fuzzle 2.0 的新功能,研究团队选择了一个具体的蛋白质片段进行深入分析。 * 研究对象: 选择来自 Thermotoga maritima 的核糖结合蛋白(TmRBP,结构域标识符 d2fn9a),它属于 SCOP 中的周质结合蛋白样 I 折叠(Periplasmic Binding Protein-like I fold, c.93)和超家族(c.93.1)。 * 片段识别与网络分析: 通过 Fuzzle 2.0 的域中心网络视图,分析 d2fn9a 与其他结构域共享的片段。在标准筛选条件下,该域与 136 个其他域存在 153 个共有片段连接,这些连接可聚类为 18 个簇(clusters),映射到蛋白质的不同区域。 * 关键片段聚焦: 其中,簇 13(Cluster 13) 是 d2fn9a_ 中连接度最高的片段,与 63 个结构域共享,涉及 8 个不同的折叠和 12 个超家族。该片段结构上包含 N 端的三个螺旋和四个 β 折叠片。 * 配体结合分析: 研究团队重点分析了这 63 个含有簇 13 片段的域中,哪些结合了配体,并去除了结晶添加剂等非特异性配体。他们下载了所有包含簇 13 的域的结构叠合文件,并利用 Fuzzle 2.0 的新功能详细检查了配体与片段之间的相互作用模式。

四、 主要研究结果 1. Fuzzle 2.0 平台的成功构建与功能实现: 研究成功开发并上线了 Fuzzle 2.0(https://fuzzle.uni-bayreuth.de/2.0)。该平台在原有进化片段数据库的基础上,整合了来自 PDB 的配体结合信息,并提供了强大的搜索(支持 PDB 代码和 SMILES)、可视化(NGL 查看器)和分析工具。数据量因 SCOP 2.07 的引入而增加,但片段连接的分布特征(幂律分布,存在高度连接的主成分)保持不变。 2. 案例研究揭示片段的功能多样性与工程潜力: 对 TmRBP(d2fn9a_)的簇 13 片段的分析取得了以下具体结果: * 广泛的进化关联性: 簇 13 片段在 12 个不同的蛋白质超家族中被发现,包括 C.93.1(周质结合蛋白样 I)、C.23.13(II 型 3-脱氢奎宁酸脱水酶)、C.23.6(钴胺素结合)、C.5.1(MurC/D N 端结构域样)等。这强有力地支持了该片段是一个被自然界重复使用的古老“构建模块”的假说。 * 多样的配体结合能力: 在分析的 63 个域中,有 22 个域(分布于 7 个超家族)结合了具有生物学意义的配体(见表 1)。例如: * C.93.1 超家族: 主要结合氨基酸(如酪氨酸、苯丙氨酸、亮氨酸)和苯甲酰甲酸,配体结合在由两个蛋白叶定义的裂隙中,簇 13 片段(位于 N 端叶)通过少数保守残基(如 Tyr/Phe 和 Ser/Tyr/Ala)参与相互作用。 * C.23.13 超家族: 结合作为抗菌剂的人工药物分子(如 3-脱氢莽草酸),其中两个关键相互作用残基(Ala82 和 Asn79)位于簇 13 片段内且高度保守。 * C.23.6 超家族: 结合钴胺素(维生素 B12)及其衍生物,配体的大部分相互作用发生在簇 13 片段内,特别是 β1 和 α1 之间的环区,以及 His610、Asp611、Ser655 等残基。 * 其他超家族: 如 C.5.1 使用不同的结合模式(配体结合在螺旋之间),C.16.1 结合的配体所有相互作用都包含在片段内。 * 配体结合模式的异同: 分析表明,尽管这些蛋白质共享一个结构保守的片段,但不同超家族中配体的结合模式可能不同(如 C.5.1)。然而,配体相互作用经常发生在片段对应的相似空间位置,这为通过片段转移进行功能工程提供了结构基础。 3. 为蛋白质工程提供直接线索: 研究明确指出,簇 13 片段是一个极佳的蛋白质工程候选模块。由于它在不同超家族中结合多种不同配体(如 B12、INI 等),但结构高度保守,因此理论上可以将 TmRBP 中的该片段替换为来自另一个超家族(如结合 INI 的 C.16.1 超家族域)的同源片段,从而可能将新的配体结合能力“移植”到 PBP 支架上。这种“嵌合体生成”策略已被先前的研究(如 PBP-黄素氧还蛋白样嵌合体 4qwv)证明可行。

五、 研究结论与价值 本研究成功推出了 Fuzzle 2.0,这是一个集成了配体结合信息的、用于分析天然蛋白质进化构建模块的增强型网络资源。其科学价值在于:1)进化生物学方面: 通过将配体结合信息与进化保守的亚结构域片段关联,Fuzzle 2.0 为研究者提供了更强大的工具来追溯蛋白质功能的进化起源,为“现代蛋白质由更小的、可重复使用的片段组装而成”的理论提供了新的、基于功能的证据。2)蛋白质工程与设计方面: 该资源具有直接的应用价值。它使蛋白质工程师能够系统地识别那些在进化中已被“预验证”的、可转移的配体结合片段,从而为理性设计蛋白质嵌合体、将特定结合口袋或功能位点移植到新的蛋白质支架中提供了数据宝库和设计灵感。这为创造具有新功能的蛋白质(如新型生物传感器、酶)开辟了一条基于自然进化原理的工程路径。

六、 研究亮点 1. 功能创新性: Fuzzle 2.0 的核心亮点是将蛋白质进化片段数据库与详细的配体结合信息进行了系统性整合,填补了原版工具在功能关联分析方面的空白。 2. 技术实用性: 提供了用户友好的网络界面,支持灵活的配体搜索(包括基于 SMILES 的相似性和子结构搜索)、交互式可视化(蛋白质-配体相互作用)以及丰富的数据导出选项,极大提升了工具的易用性和科研价值。 3. 案例研究的深度与启发性: 通过对一个具体片段(TmRBP 的簇 13)的深入分析,生动演示了如何利用 Fuzzle 2.0 来探索一个保守结构模块在不同蛋白质背景下的功能多样性,并直接推导出具有可行性的蛋白质工程方案,将工具的应用潜力具体化。 4. 跨领域桥梁作用: 该研究及所开发的资源在蛋白质进化基础研究和蛋白质工程应用研究之间架起了桥梁,体现了“从理解自然进化到指导人工设计”的研究理念。

七、 其他有价值的内容 论文还提及了与 Fuzzle 2.0 配套使用的蛋白质设计工具 Protlego,该工具可用于实际执行基于片段替换的嵌合蛋白质设计。这形成了从数据库分析(Fuzzle 2.0)到实际设计操作(Protlego)的完整工作流程。此外,作者在讨论部分也谨慎指出,由于 Fuzzle 基于非冗余的 SCOP 数据集,某些配体信息可能不完整,深入分析时仍需查阅文献或其他数据库。这种对工具局限性的说明体现了研究的严谨性。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com