TargetP 2.0:利用深度学习检测靶向肽中的序列信号
主要作者与发表信息
本文的主要作者包括Jose Juan Almagro Armenteros、Marco Salvatore、Olof Emanuelsson、Ole Winther、Gunnar von Heijne、Arne Elofsson和Henrik Nielsen。其中,Jose Juan Almagro Armenteros和Marco Salvatore为共同第一作者,通讯作者为Arne Elofsson和Henrik Nielsen。研究团队来自丹麦技术大学(Technical University of Denmark)、斯德哥尔摩大学(Stockholm University)、瑞典皇家理工学院(KTH—Royal Institute of Technology)以及哥本哈根大学(University of Copenhagen)等机构。该研究于2019年9月30日在线发表于*Life Science Alliance*期刊,DOI为10.26508/lsa.201900429。
研究背景与目的
蛋白质在细胞内的定位是蛋白质功能的基本决定因素之一。特定的分选信号(sorting signals)驱动蛋白质的亚细胞定位,其中最常见的一类是N端靶向肽(N-terminal targeting peptides)。这些信号负责将蛋白质分选至分泌途径(secretory pathway)、线粒体(mitochondria)、叶绿体(chloroplasts)或其他质体(plastids),以及叶绿体内部的类囊体(thylakoids)等区室。信号肽(signal peptides, SPs)负责将蛋白质转运至内质网以进入分泌途径;线粒体转运肽(mitochondrial transit peptides, mTPs)负责靶向线粒体基质;叶绿体转运肽(chloroplast transit peptides, cTPs)参与蛋白质向叶绿体基质的转运;而类囊体腔蛋白则具有双分型前序列结构,在cTP被切割后,腔体转运肽(luminal transit peptide, lTP)被识别并将蛋白质进一步转运至类囊体。
准确预测这些信号在蛋白质序列中的存在至关重要。过去二十年间,已有多种基于机器学习的方法被开发出来,包括TargetP 1.1、PredSL、Predotar、TPpred 3、MitoFates和SignalP 5.0等。其中TargetP 1.1是最常用的方法之一,它使用前馈神经网络和位置权重矩阵处理氨基酸窗口。然而,随着深度学习的发展,循环神经网络(recurrent neural networks, RNNs)因其处理序列数据和建模长程依赖关系的能力而受到关注。特别是双向长短期记忆网络(bidirectional LSTM, BiLSTM)已被成功应用于信号肽和线粒体转运肽的预测。DeepLoc使用BiLSTM预测蛋白质的亚细胞定位,但不预测N端分选信号的存在和切割位点(cleavage site, CS)的位置。基于此,研究者开发了TargetP 2.0,使用BiLSTM和多注意力机制(multi-attention mechanism),旨在同时预测信号肽、线粒体转运肽、叶绿体转运肽和类囊体转运肽的存在及其对应的切割位点位置。
研究流程与方法
TargetP 2.0的开发包括数据集构建、模型架构设计、模型训练与评估,以及对模型学习到的生物学特征的分析。
首先,在数据集构建方面,研究者从UniProt数据库2018_04版本中提取蛋白质数据。负数据集包含来自细胞核、细胞质和质膜(不含信号肽)的蛋白质,且具有实验注释(ECO:0000269)的亚细胞定位信息。正数据集包含具有实验注释的分泌蛋白、线粒体蛋白、叶绿体蛋白和类囊体腔蛋白。最终数据集包含9,537个无靶向肽蛋白(noTP)、2,697个信号肽蛋白、499个线粒体转运肽蛋白、227个叶绿体转运肽蛋白和45个类囊体腔转运肽蛋白。数据集按照真核生物界划分为绿色植物(Viridiplantae)、后生动物(Metazoa)、真菌(Fungi)和其他真核生物四组。使用PSI-CD-HIT对每个蛋白质的前200个残基进行聚类(20%同一性或10⁻⁶ E值),并进行严格的同源性划分,将每个同源蛋白质簇分配到五个交叉验证组之一,以确保相似蛋白质不会在不同数据集之间混合。
在模型架构方面,TargetP 2.0的输入是蛋白质的前200个氨基酸,这一阈值基于已知转运肽的最大长度162个氨基酸。氨基酸使用BLOSUM62替换矩阵编码。模型第一层是全连接层,对每个氨基酸输入特征进行特征变换,具有32个隐藏单元。接下来是BiLSTM层,前向和后向各有256个隐藏单元。BiLSTM的第一个隐藏状态是一个包含组信息的向量,表示蛋白质是植物还是非植物蛋白。BiLSTM输出的512维拼接向量用于计算多注意力矩阵,注意力大小为144个单元,注意力矩阵输出数量为13。其中4个注意力向量用于预测SP、mTP、cTP和lTP的切割位点位置。注意力矩阵进一步将整个序列编码为上下文矩阵(512×13),该矩阵通过具有256个单元的全连接层处理,最后输入到具有5个单元和softmax激活的输出层。模型使用Adam优化器和交叉熵损失进行训练,损失对肽类型预测和切割位点预测取平均。唯一使用的正则化技术是层间dropout。模型采用五折嵌套交叉验证进行训练和优化。
在性能评估方面,研究者将TargetP 2.0与TargetP 1.1、DeepLoc、PredSL、Predotar、TPpred 3、MitoFates、SignalP 5.0以及一个简单的多层感知机MLP-20进行比较。评估指标包括精确率(precision)、召回率(recall)、F1分数和Matthews相关系数(MCC)。切割位点预测的准确性以召回率衡量,同时允许最多五个残基的位置偏移。
此外,为了分析模型学习到的生物学特征,研究者检查了注意力层的最大输出。他们发现对于大多数具有靶向肽的蛋白质,存在两个强信号位置:一个非常靠近N端(第2位),另一个对应于切割位点附近的位置。随后,研究者通过将蛋白质按预测的切割位点或N端进行对齐,生成序列标识(sequence logos)来分析氨基酸频率。
主要结果
TargetP 2.0在靶向肽识别方面优于所有竞争方法。对于信号肽的识别,TargetP 2.0的F1分数达到0.98,与SignalP 5.0相当(0.99),但优于TargetP 1.1(0.91)和DeepLoc(0.87)。在线粒体转运肽识别中,TargetP 2.0的F1分数为0.86,显著优于TargetP 1.1(0.48)、DeepLoc(0.83)和MitoFates(0.80)。对于叶绿体转运肽,TargetP 2.0的F1分数为0.88,明显优于TargetP 1.1(0.54)和DeepLoc(0.80)。在类囊体腔转运肽识别中,TargetP 2.0的F1分数为0.75,而PredSL仅为0.56。对于无靶向肽蛋白,TargetP 2.0的F1分数为0.98。值得关注的是,仅使用前20个N端氨基酸的简单多层感知机MLP-20在mTP和SP识别上与前代方法表现相当,表明N端序列信息的重要性。
在切割位点预测方面,信号肽的切割位点预测召回率为83%,与TargetP 1.1相同,但略低于SignalP 5.0的86%。当允许最多五个残基的位置偏移时,性能达到96%。线粒体转运肽和叶绿体转运肽的切割位点预测召回率分别为46%和49%,相比TargetP 1.1有显著提升。类囊体腔转运肽的切割位点预测召回率为60%,远优于PredSL的11%。
研究者将TargetP 2.0应用于多个真核生物蛋白质组的注释,共注释了288,964个蛋白质。对于注释最好的蛋白质组(人类、小鼠、酿酒酵母和拟南芥),TargetP 2.0与UniProt在细胞器蛋白质的预测一致性约为80%,信号肽的一致性超过90%。
通过分析注意力层,研究者发现第2位氨基酸对分类有显著影响。在叶绿体转运肽和类囊体腔转运肽中,约三分之二的蛋白质在第2位为丙氨酸(alanine),而其他植物蛋白质中该比例为20%。在真菌和单细胞真核生物中,少于30%的靶向肽在第2位具有允许N端甲硫氨酸被切除的氨基酸,而无靶向肽蛋白质中该比例为60%。第2位的重要性可能与甲硫氨酸氨肽酶(methionine aminopeptidase, MAP)对N端甲硫氨酸的共翻译切除有关。
在切割位点附近的序列特征方面,信号肽、叶绿体转运肽和类囊体腔转运肽的−1位主要由丙氨酸主导,而线粒体转运肽的−1位主要由酪氨酸和苯丙氨酸主导。线粒体转运肽在−2、−3和−10位富含精氨酸。研究者发现TargetP 2.0对−3位精氨酸的预测过度,对−10位精氨酸的预测不足,这可能与线粒体中间肽酶(mitochondrial intermediate peptidase)切割位点的识别困难有关。
结论与意义
TargetP 2.0是一个基于深度学习的N端分选信号预测工具,使用BiLSTM和多注意力机制,能够同时预测信号肽、线粒体转运肽、叶绿体转运肽和类囊体腔转运肽的存在及其切割位点。在所有N端分选信号的识别中,TargetP 2.0均优于现有方法。该工具运行速度快(每蛋白质约0.20秒),可在数小时内注释完整蛋白质组,具有重要的实际应用价值。
更重要的是,通过对注意力层的分析,研究揭示了一个此前未被强调的生物学特征:蛋白质第2位氨基酸对靶向肽分类的重要影响。这一发现表明,甲硫氨酸氨肽酶的特异性可能辅助蛋白质的共翻译靶向进入细胞器,为理解蛋白质分选的分子机制提供了新的见解。
研究亮点
本研究的亮点包括:第一,TargetP 2.0首次实现了对类囊体腔转运肽的预测,并在所有靶向肽类别中均取得了最优性能;第二,利用多注意力机制同时预测肽类型和切割位点是该研究的方法学创新;第三,通过分析注意力层发现第2位氨基酸的重要性是一个意外的生物学发现,此前未被强调;第四,研究者证明了简单的MLP-20方法仅使用N端20个氨基酸即可与前代方法性能相当,突显了N端信息的预测价值。