本研究由Yoshinori Fukasawa、Junko Tsuji、Szu-Chin Fu、Kentaro Tomii、Paul Horton及Kenichiro Imai等人完成,主要隶属于东京大学前沿科学研究科计算生物学系及产业技术综合研究所(AIST)计算生物学研究中心。该研究成果发表于《Molecular & Cellular Proteomics》期刊,2015年在线发表,卷号为14,页码1113–1126,DOI为10.1074/mcp.M114.043083。
研究背景与目的
线粒体不仅承担ATP合成功能,还参与氨基酸与脂质代谢、铁硫簇生物合成、细胞信号传导及凋亡等多种关键生命过程。线粒体功能障碍与肌肉疾病、神经退行性疾病、心血管疾病、糖尿病及癌症等多种疾病密切相关。因此,获得完整的线粒体蛋白质组对于全面理解线粒体在健康与疾病中的作用至关重要。此前通过大规模蛋白质组学分析,已在酵母中鉴定约900种、在小鼠中鉴定约1100种线粒体蛋白,但据估计真菌和动物线粒体分别含有约1000和1500种不同蛋白,表明仍有相当数量的线粒体蛋白未被发现。由于大部分线粒体蛋白由核基因编码,并通过N端可切割靶向信号(presequence,前序列)或内部非切割信号导入线粒体,其中约70%的酵母线粒体蛋白含有前序列,因此提高前序列及其切割位点的预测精度,有助于发现新的线粒体蛋白。然而,已有预测工具如MitoProt、TargetP、Predotar和TPpred2的准确性仍不理想,尤其是切割位点预测误差较大。本研究旨在开发一种改进的预测方法MitoFates,以更准确地识别线粒体前序列及其切割位点。
研究方法与工作流程
MitoFates将前序列预测建模为二分类问题,采用支持向量机(support vector machine, SVM)分类器。研究团队构建了包含759个含前序列线粒体蛋白的正训练集及6310个非线粒体蛋白和108个非切割酵母线粒体蛋白的负训练集。切割位点预测数据来自酵母、拟南芥和水稻的蛋白质组学实验,并经过40%序列同一性去冗余,最终获得酵母104个、植物76个、动物161个MPP切割位点。独立测试集包含78个含前序列线粒体蛋白和8934个非线粒体蛋白,训练与测试数据间序列同一性低于25%。
MitoFates集成了多种经典与新型序列特征。经典特征包括前30个N端残基的氨基酸组成、二肽及跳跃二肽频率、物理化学性质等。新型特征之一是正电荷两亲性评分(positively charged amphiphilicity score, PA score),该评分在传统疏水矩基础上引入正电荷矩,以更好地反映Tom20和Tom22识别前序列时对疏水面和正电荷面的双重需求。研究通过训练数据优化了缩放参数和螺旋角参数,分别确定为8.5和96°。另一新型特征为前序列基序,利用简化氨基酸字母表(疏水、碱性、酸性、极性、二级结构破坏者)在N端90个残基内搜索六聚体基序,通过Fisher精确检验及LAMP多重检验校正,最终发现14个具有统计显著性的六聚体,且全部位于前30个残基内。此外,MitoFates还构建了MPP、Oct1和Icp55切割位点的位置权重矩阵(position weight matrices, PWM),并利用Dirichlet混合模型对观测频率进行平滑处理。前序列长度分布采用伽马混合模型建模,酵母使用1分量模型,植物和后生动物使用3分量模型。SVM分类器采用LIBSVM 3.0及RBF核实现。切割位点预测时,MitoFates计算每个位置的得分,以最高分位置作为MPP切割位点,再利用Oct1和Icp55的PWM预测是否发生二次切割。对于植物,MitoFates不考虑Oct1切割的可能性。
主要结果
在独立测试集上,MitoFates的平均精度为84%,优于TPpred2(81%)、Predotar(79%)、TargetP(78%)和MitoProtII(74%)。在召回率50–80%区间,MitoFates的平均精度达91%,显著高于其他工具。ROC曲线下面积(AUC)也优于其他预测器。在假阳性率1.7%时,MitoFates的真阳性率达76%,McNemar检验显示此差异具有统计显著性。此外,MitoFates在人类线粒体基质蛋白数据集上也取得最佳表现。
切割位点预测方面,在酵母数据集的10倍交叉验证中,MitoFates的准确率达71%,明显高于TPpred2的54.7%。在植物和人类数据集上,MitoFates分别正确预测72.2%和51.9%的切割位点,亦优于第二名预测器的55.0%和43.0%。通过分析预测误差偏移距离,MitoFates对Icp55和Oct1二次切割的预测能力更强,而其他工具在偏移0到1及6到8个残基时表现出明显的准确率跃升,反映了对二次切割事件的误判。值得注意的是,尽管MitoFates的PWM主要基于酵母数据训练,其在植物和动物上的良好表现表明MPP切割机制在物种间高度保守。
特征重要性分析显示,MPP切割位点评分是最具判别力的特征(F-score为0.250),其次为N端30个残基中精氨酸组成(0.217)、六聚体基序总分(0.159)、亮氨酸-精氨酸二肽组成(0.126)和PA评分(0.126)。新型PA评分相较于传统疏水矩在区分前序列与非前序列方面表现出更好的分离度。六聚体基序分析发现,大部分基序具有高于90百分位的PA评分,推测可能与Tom20结合相关。其中基序φφβσφφ(φ为疏水,β为碱性,σ为极性)匹配MPP-Oct1切割位点,而另外两个基序常出现在N端起点,提示其可能作为线粒体靶向信号发挥作用。
聚类分析将243个酵母前序列分为三个簇。簇I包含144个典型前序列,富含精氨酸、几乎不含负电荷残基、长度集中在25个残基左右、PA评分和MPP切割评分较高。簇II包含64个较长前序列(平均60个残基),净电荷较低,MPP切割评分显著低于簇I,部分成员为内膜蛋白酶M-AAA和IMP的已知底物。簇III包含35个进化保守性高的前序列,40%具有负净电荷,与双定位线粒体蛋白的特征一致。这些结果揭示了前序列的异质性,也为未来改进预测方法指明了方向。
在人类蛋白质组分析中,MitoFates对42217个人类蛋白(含异构体)进行预测,发现1167个基因至少有一个异构体含前序列,其中580个基因未被UniProt或Gene Ontology注释为线粒体蛋白。此外,MitoFates识别出517个候选基因具有差异定位异构体,其中约90%的异构体间最大得分差超过0.4。在Hasson等人关于Parkin转位调控因子的筛选数据中,MitoFates预测出72个新的线粒体蛋白候选,包括SIAH3和RHBDL3的一种异构体。在人类疾病突变分析中,MitoFates预测31个新候选基因的266个突变与40种疾病相关,其中PDHA1的R10P突变和POLG的R3P突变均位于PA评分最高区域,提示这些突变可能通过破坏两亲性螺旋导致蛋白错误定位。
结论与意义
MitoFates在前序列检测和切割位点预测两方面均显著优于已有方法,尤其在切割位点预测准确率上实现了大幅提升。其成功得益于新型特征(PA评分、六聚体基序)的引入、更新且高质量的训练数据以及PWM对MPP、Oct1和Icp55切割过程的显式建模。该方法在植物和动物上的良好跨物种表现说明了线粒体前序列加工机制的高度保守性。MitoFates提供开源软件和网页服务器(http://mitf.cbrc.jp/mitofates/),可方便研究人员使用。该工具在鉴定新的线粒体蛋白、研究蛋白异构体差异定位以及分析疾病相关突变方面具有重要应用价值,有助于优先生物实验验证候选蛋白,深入理解线粒体在健康与疾病中的作用。
研究亮点
本研究的亮点在于:第一,提出了正电荷两亲性评分,改进了传统疏水矩对前序列识别能力的不足;第二,系统发现了14个具有统计显著性的前序列六聚体基序,部分基序与MPP-Oct1切割位点及N端靶向信号相关;第三,显式建模了MPP、Oct1和Icp55的连续切割过程,显著提高了切割位点预测精度;第四,通过聚类分析揭示了酵母前序列的异质性,为理解不同类别前序列的加工机制提供了新视角;第五,大规模人类蛋白质组分析产生了大量候选线粒体蛋白及疾病相关候选基因列表,为后续实验研究提供了丰富资源。