蛋白质设计新纪元:深度学习驱动从序列到功能的结构探索
作者与发表信息 本文由Noelia Ferruz (西班牙赫罗纳大学信息学与应用研究所,德国拜罗伊特大学生物化学系)、Michael Heinzinger (德国慕尼黑工业大学信息学、生物信息学与计算生物学系)、Mehmet Akdel、Alexander Goncearenco、Luca Naef (以上三位来自美国纽约VantAI公司) 以及Christian Dallago (德国慕尼黑工业大学信息学、生物信息学与计算生物学系,德国慕尼黑英伟达公司) 共同撰写。文章以“From sequence to function through structure: Deep learning for protein design”为题,作为一篇迷你综述(Mini Review)发表于期刊《Computational and Structural Biotechnology Journal》第21卷(2023年),于2022年11月19日在线发布,遵循CC BY开放获取许可协议。
论文主题与主旨 本文是一篇聚焦于人工智能(AI)与生物学交叉领域前沿进展的综述性论文。其核心主题是系统梳理和评述过去三年(约2019-2022年)中,深度学习(Deep Learning, DL)技术在蛋白质设计领域引发的范式转变和取得的突破性进展。文章旨在为研究者提供一个清晰的“路标”,帮助他们理解和运用这些新兴工具,并展望该领域未来的挑战与机遇。文章不仅停留在理论综述,还通过构建一个实用的计算流程(pipeline)并展示一个具体应用案例,来阐明如何将前沿的生成模型与预测模型结合,快速实现从蛋白质序列生成到功能特性筛选的完整流程。
主要观点阐述
1. 蛋白质设计范式的根本性转变:从物理化学力场到深度学习模型 文章开篇即指出,蛋白质设计领域正在经历一场快速而深刻的变革。传统方法主要依赖于“结构优先”的策略,即基于已知蛋白质结构进行重新设计,或通过优化物理化学能量函数来寻找能够折叠成目标结构的序列。这种方法本质上是求解一个高维、计算上难以处理(NP-hard)的优化问题,严重依赖于启发式算法和简化的成对势能函数。
深度学习技术的引入彻底改变了这一局面。文章强调,这种转变的核心驱动力来自两个方面:一是以AlphaFold 2为代表的蛋白质结构预测方法的巨大成功,证明了深度学习模型能够从序列中学习到复杂的结构规律;二是自然语言处理(NLP)技术在蛋白质序列建模中的应用。蛋白质语言模型(Protein Language Models, PLMs)通过在海量蛋白质序列数据库上进行无监督训练,学会了蛋白质的“语言”规律,能够生成具有自然蛋白质特性的全新序列。这种“序列优先”或“序列-结构协同设计”的新范式,使得快速、大规模地生成具有复杂功能的蛋白质序列成为可能,为可控、有条件的蛋白质设计打开了新的大门。
2. 深度学习蛋白质设计方法的分类学与代表性工作 文章的核心贡献之一是对过去三年涌现的大量DL蛋白质设计工具进行了系统性的分类和梳理(总结于其Table 1中)。作者根据这些方法试图解决的核心问题,将其分为四大类,并通过图1进行了直观展示:
第一类:固定骨架序列设计(Fixed-backbone design)。这是对传统蛋白质设计问题的DL求解,即给定一个目标蛋白质三维骨架结构,模型需要找出能稳定折叠成该骨架的氨基酸序列。评估指标通常是天然序列恢复率(Natural Sequence Recovery, NSR)。代表性工作包括:
第二类:结构生成方法。这类方法的目标是直接生成蛋白质的三维结构编码(如接触图、距离图)或原子坐标,从而探索全新的蛋白质拓扑结构。代表性工作包括:
第三类:序列生成方法。这类方法主要受NLP进展启发,利用自回归语言模型直接从序列数据中学习并生成全新的、具有自然蛋白质特性的氨基酸序列。代表性工作包括:
第四类:序列与结构的协同设计(“幻觉”方法)。这类方法旨在同时优化序列和结构,通常以一个随机序列或一个结构基序为起点,通过迭代优化使预测的结构(如距离图)与目标分布(如天然结构背景分布)之间的差异最小化。代表性工作包括:
3. 实践应用:一个从生成到筛选的离线流程与案例研究 为了展示这些前沿工具的实用价值,作者构建并演示了一个具体的计算流程。 * 流程构建:该流程结合了第三类方法中的序列生成模型(ProtGPT2)和作为“预言家”(oracle)的预测模型(ProtT5)。首先,使用ProtGPT2无条件生成了10万个蛋白质序列。然后,利用ProtT5等模型为这些生成序列快速预测了包括二级结构、基因本体(Gene Ontology, GO)术语、小分子/金属结合位点、亚细胞定位、跨膜拓扑、残基保守性、无序区域和CATH家族在内的十余种结构和功能特征。整个过程仅需约3.5小时。 * 结果分析:通过将生成序列、从UniRef50采样的自然序列以及随机重排的序列进行对比,作者发现生成序列在预测特征的分布上更接近于自然序列,而非随机序列。这初步证明了ProtGPT2生成序列的“自然性”。 * 交互式筛选工具:作者提供了一个Jupyter笔记本,允许用户使用类似自然语言的查询(例如,“筛选长度大于200个残基、α螺旋含量超过30%、且定位于细胞外膜的蛋白质”),从10万条生成序列中快速筛选出候选者,并通过LambdaPP网络服务器进行三维结构预测和可视化。 * 案例研究:筛选用于生产“分子胶”的蛋白质工厂。作者利用该流程进行了一项概念验证研究。目标是筛选可能参与合成“分子胶”(一类能稳定蛋白质-蛋白质相互作用的小分子药物,如植物激素)的生物合成基因簇(BGC)蛋白。首先,他们使用基于嵌入的注释转移(Embedding-based Annotation Transfer, EAT)方法,筛选出与“次级代谢物生物合成过程”GO术语相关的生成序列。然后,进一步过滤掉与已知BGC数据库(MIBiG)中序列过于相似的条目。最终,获得了234条具有潜力的候选序列。作者重点分析了一条与参与合成fusicoccin A(一种植物毒性分子胶)的短链脱氢酶相似的生成序列,并通过结构比对展示了其与天然同源蛋白的相似性。此案例表明,该流程可用于快速生成和筛选具有特定功能潜力的蛋白质序列,为后续的体外实验(如定向进化)提供高质量的起点。
4. 面临的挑战与未来展望 文章最后对领域现状进行了批判性讨论,并展望了未来。 * 挑战: * 从计算到市场的鸿沟:尽管DL设计工具取得了巨大进步,但距离设计出可直接投入市场(如成为上市药物)的生物制剂仍有很长的路。模型训练所依赖的数据(如静态结构)无法完全捕捉蛋白质的动态性和复杂的体内环境。 * 功能定义的模糊性:蛋白质功能是多元且分层次的,基于序列或结构设计功能远比设计稳定的折叠更具挑战性。 * 缺乏统一的评估基准:与蛋白质结构预测领域有CASP这样的权威评估不同,蛋白质设计领域缺乏衡量设计工具性能的标准化基准。当前常用的天然序列恢复率(NSR)并不能完全反映模型生成多样且功能优良序列的能力。 * 未来方向: * 自动化实验与数字孪生:将DL模型与自动化实验室、云实验室结合,形成可微分的“设计-构建-测试-学习”闭环,是加速迭代的关键。数字孪生技术有望弥合数字系统与物理实验在通量上的差距。 * 建立严谨的评估体系:需要建立类似CASP的社区挑战,设定明确的设计目标(如特定功能、可开发性),并推动数据标准化,以公正地衡量不同方法的进展。新的基准(如ProteinGym)应侧重于:1) 在少量数据下进行外推;2) 评估多功能泛化能力;3) 设计自然界未观察到的功能。 * 可控与多功能设计:最终目标是开发能够根据用户指定的一系列生物物理和工业相关属性(如热稳定性、催化活性、结合特异性),端到端地输出满足所有条件的蛋白质序列或结构的模型。
论文的意义与价值 本文不仅是一篇及时、全面的技术综述,更是一份面向蛋白质工程社区的行动指南。其价值体现在: 1. 系统性梳理:首次清晰地将爆炸式增长的DL蛋白质设计方法归纳为四大类别,为研究者理解不同工具的目标和适用范围提供了框架。 2. 实用性导向:通过构建并开源一个从序列生成到功能预测、筛选和可视化的完整流程,降低了领域门槛,展示了如何将前沿AI模型转化为实际的发现工具。 3. 前瞻性视野:明确指出当前领域在基准测试、功能定义和临床转化方面的核心挑战,并提出了建立评估标准、结合自动化实验等具体的发展方向,对引导领域未来研究具有重要指导意义。 4. 跨领域桥梁:文章成功地将深度学习、自然语言处理、计算机视觉等领域的最新进展与蛋白质工程、药物发现等生物医学应用紧密连接,促进了学科交叉与合作。
这篇综述清晰地描绘了深度学习如何将蛋白质设计从一个依赖专家经验和物理模拟的领域,转变为一个数据驱动、自动化、高通量的工程学科,并为我们展望了一个能够按需设计具有复杂功能蛋白质的未来。