分享自:

2021 Protlego A Python package for the analysis and design of chimeric proteins

期刊:BioinformaticsDOI:10.1093/bioinformatics/btab253

本文档属于类型a,即报告了一项原创性研究。以下是为中国读者撰写的关于该研究的学术报告。

关于蛋白质嵌合体自动化设计与分析工具Protlego的学术报告

一、 研究团队与发表信息

本研究由德国拜罗伊特大学生物化学系的Noelia Ferruz、Jakob Noske和Birte Höcker*(通讯作者)共同完成。研究论文题为“Protlego: a python package for the analysis and design of chimeric proteins”,于2021年4月26日在线发表于生物信息学领域的知名期刊《Bioinformatics》(第37卷,第19期,第3182-3189页)。该研究得到了欧洲研究理事会(ERC Consolidator Grant)和大众汽车基金会(Volkswagenstiftung)的资助。

二、 学术背景与研究目标

本研究属于结构生物信息学蛋白质工程的交叉领域。自然界中蛋白质的惊人多样性,部分源于蛋白质片段的复制与重组。受此启发,通过重组天然蛋白质片段来设计嵌合蛋白质已成为一种有前景的蛋白质工程新策略,并在实验中取得了成功。然而,当前针对这些嵌合蛋白质的计算机建模与分析过程仍高度依赖人工操作,需要大量专业知识,且难以实现高通量研究。此外,对设计蛋白质进行能量和结构分析通常需要使用多种工具,这些工具往往基于不同的编程语言或网络服务器,技术门槛较高。

因此,本研究旨在开发一个名为Protlego的、易于使用的Python软件包,以实现嵌合体设计的自动化、高通量流程及其后续的结构分析。具体目标包括:1)从内置的进化保守片段数据库中检索信息;2)通过网络可视化展示进化关系;3)通过片段重组自动构建嵌合体模型;4)使用标准力场对设计的嵌合体进行能量评估和优化;5)提供一系列工具对嵌合体或天然蛋白质进行详细的结构特征分析。研究者希望通过Protlego为蛋白质设计社区提供一个强大的新工具。

三、 详细研究流程与方法

本研究的工作流程主要围绕Protlego软件包的五大核心功能模块展开,并以探索P-loop和Rossmann这两种α/β超折叠之间的关系、构建并表征其嵌合体后代作为案例进行展示。

1. 从Fuzzle数据库获取相关片段 Protlego内置了一个轻量级的Fuzzle数据库,该数据库是通过对SCOP 2.07版本中的所有结构域进行全对全的轮廓隐马尔可夫模型(profile Hidden Markov Model, HMM)比较(使用HHsearch工具)构建而成。它包含了超过28000个独特结构域之间的超过1000万个“命中”(hits),每个“命中”记录了两个结构域共享一个同源片段的信息,包括查询和主题结构域标识、共享片段的起止位置、HHsearch概率、RMSD等。 在研究案例中,研究者使用fetch_group函数,以SCOP折叠标识符(P-loop为c.37,Rossmann为c.2)为条件,从数据库中提取了所有P-loop与Rossmann折叠之间的“命中”。他们设置了过滤条件:HHsearch概率 > 70%,RMSD < 3 Å,片段长度在10到200个氨基酸之间,TM-score低于0.3。最终获得了1737个“命中”,涉及432个不同的独特结构域。这些“命中”的平均长度为37.9 ± 17.0个氨基酸,平均RMSD为2.3 ± 0.3 Å,平均HHsearch概率为77.0 ± 5%。

2. 通过网络可视化展示进化关系 Protlego利用graph-tool软件包将“命中”数据转化为相似性网络进行可视化。在网络图中,节点代表蛋白质结构域,连接线(边)则表示两个结构域共享一个同源片段。这种可视化有助于研究者直观地理解复杂的进化关系。在P-loop与Rossmann折叠的案例中,生成的网络包含460个节点和1213条边,并形成了17个大小不一的“岛屿状”组件(即连通子图)。每个组件代表一组共享特定同源片段的蛋白质结构域。研究者重点分析了其中三个最显著的组件(组件1、2、4),它们分别对应不同长度、位置和家族组成的片段。例如,最大的组件1包含361个节点,共享一个平均长度约34个氨基酸的N末端β1α1β2片段,该片段包含了Walker A模体和甘氨酸富集模体。

3. 自动构建嵌合体模型 这是Protlego的核心创新功能。其嵌合体构建流程完全自动化: * 输入与映射:以一个“命中”记录作为输入,利用其中的HHsearch序列比对信息作为模板。 * 结构比对:将比对上的氨基酸序列映射到两个亲本蛋白质的PDB结构坐标上,并仅使用片段内的Cα原子,通过TM-align工具进行结构叠合。Protlego提供了两种叠合模式:全局最小化RMSD,或针对长片段进行分步的局部叠合(例如按βα模体划分)。 * 寻找融合点:计算叠合后每一对Cα原子之间的距离。距离较近(默认阈值< 1 Å,用户可调)的位置被认为是理想的重组融合点,因为在此处连接两个亲本对结构的扰动最小。 * 构建与筛选:在每个融合点,可以产生两种组合的嵌合体:组合1(N端来自查询蛋白,C端来自主题蛋白)和组合2(反之)。Protlego会自动构建所有可能的嵌合体,并利用MoleculeKit包处理PDB文件,自动检测并剔除那些存在主链-主链空间冲突的模型。 在案例研究中,研究者对1693个“命中”(剔除了一个错误分类的结构域后)尝试构建嵌合体。使用全局比对模式仅从5%的“命中”中成功构建了1158个嵌合体。而采用分步局部比对模式后,成功率提升至27%,从1693个“命中”中总共构建了2503个嵌合体,整个过程在桌面工作站上耗时约3小时。特别地,他们详细展示了从组件2的代表性结构域d1wa5a_(P-loop家族c.37.1.8)和d2dfda1(Rossmann家族c.2.1.5)构建嵌合体的过程。该“命中”片段长101个氨基酸,通过局部比对划分为6个部分,在101个可能融合点中找到了32个距离小于1 Å的点,最终成功构建了21个无主链冲突的嵌合体

4. 能量评估 Protlego集成了OpenMM包的功能,允许用户使用CHARMMAMBER力场对嵌合体模型进行势能评估和能量最小化计算,并支持GPU加速。这为在实验验证前快速评估和排序大量设计模型提供了可能。在上述21个嵌合体的案例中,研究者使用AMBER力场(允许主链柔性)对所有嵌合体进行了评分和最小化。结果显示,嵌合体的能量得分分布较广,其中得分最高的四个嵌合体均来自组合2,且具有较高的P-loop亲本含量。有趣的是,两个亲本蛋白的能量得分分别位于这个分布的两端,P-loop亲本d1wa5a_得分最好,而Rossmann亲本d2dfda1得分最差。

5. 结构分析 Protlego提供了一套全面的结构分析工具,可以对设计的嵌合体或天然蛋白质进行多种特征计算。这包括: * 疏水簇分析:通过重新实现的CSU算法高通量计算疏水簇。 * 氢键网络与盐桥分析:利用部分MDTraj包的功能和自定义方法。 * 溶剂可及表面积计算。 * 接触序接触图分析。 * 氢键图绘制。 * 与VMD集成,实现结构特征的可视化。 在案例中,研究者选取了能量得分较高的一个嵌合体(comb1_72,其N端来自Rossmann亲本,包含来自两个亲本各三个β链)进行了详细分析。结果表明,该嵌合体形成了两个主要的疏水簇,尽管与亲本有所不同,但能连续跨越重组区域。其盐桥数量(9个)介于两个亲本之间,且大部分继承自P-loop亲本。接触图分析显示,其1-71号残基区域与Rossmann亲本相似,71-165号残基区域则与P-loop亲本相似。该嵌合体的接触序(15.2%)和溶剂可及表面积(8470 Ų)均处于两个亲本蛋白的数值之间,这些特征都暗示其可能是一个折叠良好的结构。

四、 主要研究结果

  1. 成功开发并发布了Protlego软件包:这是一个功能完整的Python工具,实现了从进化片段检索、可视化、嵌合体自动构建、能量评估到结构分析的全流程自动化。
  2. 揭示了P-loop与Rossmann折叠间的具体进化关联:通过Fuzzle数据库和网络分析,发现并非所有这两个超折叠的家族间都存在同源片段。主要同源关系集中在特定家族之间,如P-loop的c.37.1.10家族与Rossmann的c.2.1.2家族(共享N末端β1α1β2片段),以及c.37.1.8与c.2.1.5家族(共享更长的包含前五个β链和四个α螺旋的片段)。网络分析清晰地将不同长度、位置和家族归属的片段分离到不同的组件中。
  3. 验证了高通量自动嵌合体构建的可行性:针对P-loop和Rossmann折叠的1693个“命中”,使用分步局部比对模式成功构建了2503个嵌合体,证明了该方法的效率。对代表性亲本对(d1wa5a_和d2dfda1)的详细构建过程表明,算法能有效识别融合点并筛选出无空间冲突的合理模型。
  4. 展示了嵌合体的能量与结构特征分析能力:对21个嵌合体的能量评估提供了快速排序设计模型的依据。对选定嵌合体comb1_72的深入结构分析显示,其具有类似天然蛋白质的结构特征(如形成连续的疏水核心、合理的接触序和溶剂可及表面积),这为其可能具备正确折叠和稳定性的假设提供了初步的计算机证据。
  5. 案例研究为两个古老超折叠的进化关系提供了新见解:通过Protlego的分析,直观展示了P-loop和Rossmann折叠之间通过共享特定子结构域片段(如包含结合模体的βαβ单元)可能存在的进化联系,为“蛋白质乐高”式的进化路径提供了具体例证。

五、 研究结论与价值

本研究的核心结论是成功开发了Protlego这一开源工具,它显著降低了蛋白质嵌合体计算设计与分析的技术门槛,实现了该过程的高通量化与自动化。

其科学价值在于: * 方法论贡献:为“基于片段重组”的蛋白质设计策略提供了一个强大、集成的计算平台,将此前分散、繁琐的步骤整合到一个连贯的工作流中。 * 进化生物学洞察:通过内置的Fuzzle数据库和网络可视化工具,Protlego本身也是一个探索蛋白质宇宙中进化关系(特别是跨折叠的同源片段)的有力工具。对P-loop和Rossmann折叠的案例研究深化了我们对这些古老且功能多样的超折叠之间进化联系的理解。 * 推动蛋白质设计领域:通过自动化构建和提供丰富的分析指标,Protlego使得研究人员能够快速生成并筛选大量嵌合体设计,从而指导实验验证,加速新型定制化蛋白质的发现与工程化。

其应用价值在于: * 提高设计效率:使蛋白质工程师能够专注于设计逻辑和结果分析,而非耗时的建模与软件操作细节。 * 促进数据积累与基准测试:随着更多通过Protlego设计并经过实验验证的嵌合体数据的积累,未来可以基于这些数据对嵌合体评分函数进行基准测试和进一步开发,形成设计-验证-优化的良性循环。 * 开源与可扩展性:软件以Python包形式在GitHub和Conda上开源,鼓励科学社区使用、测试和贡献,具有良好的可扩展性和可持续性。

六、 研究亮点

  1. 功能集成与自动化:Protlego的主要亮点在于它将蛋白质嵌合体设计流程中的多个关键步骤——数据库检索、进化关系可视化、模型构建、能量评估和结构分析——整合到一个统一的、自动化的Python框架中,解决了该领域工具碎片化的问题。
  2. 创新的嵌合体构建算法:其嵌合体构建模块采用基于HHsearch比对和TM-align结构叠合的自动化流程,并创新性地引入分步局部比对模式以处理长片段,显著提高了嵌合体的构建成功率(从全局比对的5%提升至27%)。
  3. 内置进化片段数据库与可视化:集成轻量级Fuzzle数据库和基于graph-tool的网络可视化,使用户能够直接从进化信息中获取设计灵感,并以直观的方式理解复杂的蛋白质空间关系。
  4. 详尽的结构分析工具箱:提供了从能量计算到多种结构描述符(疏水簇、接触图、盐桥、SASA等)的全面分析功能,并集成VMD实现可视化,为深入评估设计质量提供了丰富维度。
  5. 以重要科学问题为案例:选择P-loop和Rossmann这两个在进化上备受关注且具有重要功能的超折叠作为展示案例,不仅验证了工具的有效性,其分析结果本身也具有独立的科学意义。

七、 其他有价值内容

研究论文提供了详细的补充材料,包括软件所有可用方法的概述表、重现案例结果的代码与计算成本说明、片段长度分布图、家族间“命中”数量热图、嵌合体构建结果统计图、所有21个嵌合体的结构图示、亲本与嵌合体的疏水簇与盐桥分析图、接触图等。这些材料极大地增强了研究的可重复性和透明度。此外,论文还讨论了现有嵌合体设计算法(如SCHEMA、RASPP、Sewing等)的背景,并明确了Protlego在适用范围(不限于全α结构)和流程整合度上的优势与特色。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com