分享自:

2025 A Validated Proteomic Signature of Basal-like Triple-Negative Breast Cancer Subtypes Obtained from Publicly Available Data

期刊:cancersDOI:10.3390/cancers17162601

关于基底样三阴性乳腺癌亚型蛋白组学特征的验证研究

一、 主要作者、机构及发表信息 本研究由来自荷兰瓦赫宁根大学与研究中心(Wageningen University & Research)系统与合成生物学实验室的Cristina Furlan、Maria Suarez-Diez和Edoardo Saccenti(通讯作者)合作完成。研究论文题为“A Validated Proteomic Signature of Basal-Like Triple-Negative Breast Cancer Subtypes Obtained from Publicly Available Data”,于2025年8月8日发表于学术期刊 Cancers (卷17, 期16, 文章号2601)。该论文遵循知识共享署名(CC BY)许可协议开放获取。

二、 学术背景与研究目的 乳腺癌是全球女性中最常被诊断出的恶性肿瘤,其分子层面具有高度异质性。三阴性乳腺癌(Triple-Negative Breast Cancer, TNBC)因其雌激素受体(ER)、孕激素受体(PR)和人表皮生长因子受体2(HER2)均不表达,缺乏有效的靶向治疗手段,患者预后通常较差。基底样乳腺癌(Basal-Like Breast Cancer, BLBC)是乳腺癌的一种高度侵袭性分子亚型,与TNBC有很高的重叠度(约50-75%的TNBC具有基底样表型),同样预后不良。

传统的乳腺癌分子分型(如基于50个基因的PAM50签名)主要依赖于转录组(RNA)数据。然而,基因表达的变化并不总是与蛋白质丰度直接对应,而蛋白质是细胞功能的主要执行者。因此,基于蛋白质表达谱的分类可能更准确地反映驱动肿瘤异质性的功能性表型差异,并有助于发现新的治疗靶点。此前已有研究利用蛋白质组学数据探索乳腺癌的异质性,但针对基底样TNBC这一特定高危亚型内部的蛋白组学异质性,仍有待深入挖掘。

本研究旨在利用公开可用的蛋白质组学数据,深入探究基底样TNBC患者内部的潜在异质性。具体目标包括:1)识别基底样TNBC中是否存在基于蛋白质表达谱的、可复现的亚组;2)鉴定区分这些亚组的特异性蛋白特征;3)通过生物信息学分析揭示这些差异蛋白所涉及的生物学通路和分子功能,从而为改进TNBC的分类、预后评估和潜在治疗策略提供新的分子依据。

三、 详细研究流程与方法 本研究是一项基于公共数据的生物信息学分析,其核心流程(如图1所示)包括数据获取与处理、亚组发现与验证、差异蛋白分析以及功能注释。

1. 实验数据获取与预处理: 研究使用了来自临床蛋白质组肿瘤分析联盟(Clinical Proteomic Tumor Analysis Consortium, CPTAC)的两个独立、公开的乳腺癌患者蛋白质组学数据集作为发现队列和验证队列。 * 发现数据集:源自Anurag等人的研究(2022),原始包含71个ER阴性、HER2阴性乳腺癌样本。本研究从中筛选出30个经PAM50方法分类为“基底样”的TNBC样本。该数据集通过串联质谱标签(TMT)标记结合质谱(MS)分析,测量了11,062种蛋白质的丰度。经过质控和过滤(缺失值>25%的蛋白质被移除),最终用于分析的矩阵维度为30个样本 × 8,873种蛋白质。 * 验证数据集:源自Krug等人的研究(2020),原始包含122个乳腺癌样本。本研究从中筛选出23个分类为基底样TNBC的样本。该数据集同样采用TMT-MS技术,测量了10,054种蛋白质的丰度。处理后矩阵维度为23个样本 × 9,173种蛋白质。 * 数据处理:对两个数据集中剩余的缺失值,研究采用了基于K近邻(KNN)的插补方法(使用R包impute中的knn.impute函数),生成了1000个插补数据集并取平均,得到最终用于分析的完整数据集。

2. 样本聚类分析与亚组识别: 为了探索基底样TNBC内部的潜在亚组,研究对两个数据集分别进行了无监督聚类分析。 * 方法:采用K均值聚类(K-means clustering)算法,使用Hartigan-Wong算法,对K值从2到8的多种聚类方案进行测试。 * 最优聚类数确定:结合“肘部法则”(观察组内平方和WCSS随K值增加的变化拐点)和“轮廓系数法”(评估聚类分离度,值越接近1越好)两种方法,确定两个数据集中最优的聚类数均为K=2。 * 聚类稳定性验证:为确保所识别簇的可靠性,研究采用了重采样和自助法(Bootstrap)对聚类结果的稳定性进行评估,使用Jaccard相似性指数进行量化。结果显示,发现数据集和验证数据集中两个簇的Jaccard指数均表明聚类结构是稳定的(多数>0.70,部分>0.85)。

3. 簇的生物学匹配: 由于在两个数据集中独立发现的“簇1”和“簇2”标签是任意的,需要确定验证集中的哪个簇对应发现集中的哪个簇,以统一后续分析的方向。 * 方法:计算每个簇的质心(即簇内所有样本蛋白质丰度的均值向量),选取每个质心中丰度最高的前25%的蛋白质。对这些高丰度蛋白质集合分别进行基因本体(Gene Ontology, GO)富集分析(涵盖分子功能MF、细胞组分CC、生物过程BP三类)。通过比较发现集簇与验证集簇之间在GO富集术语上的重叠程度,进行生物学意义上的匹配。结果显示,验证集的簇1v(Cluster 1v)与发现集的簇1d(Cluster 1d)在生物学内容上对应,验证集的簇2v对应发现集的簇2d。后续分析中统一称为簇1和簇2。

4. 随机森林模型验证聚类区分能力: 为了评估基于蛋白质表达谱区分这两个簇的预测能力,研究使用了随机森林(Random Forest)分类模型。 * 方法:将K均值聚类得到的簇标签作为分类目标,使用所有蛋白质的丰度数据作为特征来构建预测模型。为解决类别不平衡问题,对样本较少的簇进行了95%的欠采样,并重复100次。通过计算准确率、灵敏度、特异度和受试者工作特征曲线下面积(AUROC)来评估模型性能。同时,通过1000次标签置换检验来评估模型性能的统计显著性。 * 结果:在发现数据集上构建的模型表现出非常稳健的分类性能(高AUROC),表明蛋白质特征能够有效区分两个亚组。验证数据集上的模型性能虽略弱,但多维尺度分析(MDS)图仍显示两个簇有良好的分离趋势,支持了聚类结果的可推广性。

5. 差异蛋白质丰度分析: 为了鉴定区分两个簇的特异性蛋白质标志物,研究对两个数据集分别进行了差异丰度分析。 * 方法:使用双侧Wilcoxon秩和检验比较簇1和簇2之间每个蛋白质的丰度差异。在验证数据集中,由于两个簇大小不同(15 vs 8),为避免偏差,对较大的簇进行了1000次重采样(每次采样8个样本),并与小簇进行差异分析,然后使用调和平均法合并1000次检验的p值。 * 筛选与交集:在发现集和验证集中,分别筛选出p值<0.05且log2倍数变化(log2FC)绝对值>0.05的差异表达蛋白质。最终,取两个数据集中差异表达蛋白质的交集,得到一组“已验证的”蛋白质标志物,包括256个在簇1中上调的蛋白质和99个在簇1中下调的蛋白质。

6. 功能富集与蛋白互作网络分析: 对已验证的差异蛋白质集合进行深入的功能学解读。 * GO富集分析:使用clusterProfiler R包对上调及下调蛋白质集合分别进行GO富集分析(MF, BP, CC),采用Benjamini-Hochberg方法进行多重检验校正,FDR < 0.05视为显著富集。 * 蛋白质-蛋白质相互作用(PPI)网络分析:使用STRING数据库(v12.0)构建已验证差异蛋白质的PPI网络。仅考虑置信度>0.9且FDR<0.01的物理相互作用(即同一物理复合物内的相互作用)。使用DBSCAN算法对网络中的蛋白质进行功能模块聚类。

7. 样本元数据分析: 为了排除所发现的蛋白组学亚组是由已知的临床或病理特征(如种族、肿瘤分期、免疫评分等)驱动,研究比较了两个簇之间所有可用的样本元数据。使用Wilcoxon秩和检验,并对验证数据集中的不平衡问题采用与差异蛋白分析相同的重采样策略。经多重检验校正后,未发现任何元数据特征在两组间存在统计学显著差异,表明所识别的亚组是基于独特的蛋白质表达模式,而非已知的混杂因素。

四、 主要研究结果 1. 基底样TNBC中存在两个可复现的蛋白组学亚组: 聚类分析在发现数据集(30个样本)和验证数据集(23个样本)中均一致地识别出两个清晰的基底样TNBC亚组(簇1和簇2)。聚类稳定性评估和随机森林分类模型均支持这两个亚组是真实且可区分的。重要的是,元数据分析表明,这两个亚组的划分不能由患者的种族、肿瘤负荷、突变负荷、免疫微环境评分等已知临床或分子特征解释,提示这是一种新的、基于蛋白质组的分类维度。

2. 鉴定出可区分亚组的已验证蛋白特征: 差异表达分析在两个独立数据集中共同鉴定出一组核心的、可重复的差异蛋白质。具体而言,与簇2相比,簇1中有256个蛋白质表达上调,99个蛋白质表达下调。这355个蛋白质构成了一个经过验证的蛋白组学签名,能够可靠地区分基底样TNBC的两个亚型。

3. 差异蛋白质的功能富集揭示 distinct 的生物学过程: * 上调蛋白质的功能:GO富集分析显示,在簇1中上调的蛋白质显著富集于与细胞骨架组织和细胞外基质(ECM)相关的功能,例如“肌动蛋白结合”、“细胞外基质结构成分”等分子功能,以及“细胞外基质组织”、“RNA剪接”等生物过程。这提示簇1亚型可能具有更强的细胞迁移、侵袭能力和ECM重塑活性,同时剪接体功能可能发生改变。 * 下调蛋白质的功能:在簇1中下调的蛋白质则富集于“ATP水解活性”、“蛋白质折叠伴侣活性”、“未折叠蛋白结合”等分子功能,以及“端粒酶RNA定位至卡哈尔体”等生物过程。这表明簇1亚型在能量代谢、蛋白质质量控制以及某些核内RNA加工定位方面可能存在功能减弱。

4. 蛋白质互作网络分析揭示关键功能模块: PPI网络分析进一步将差异蛋白质组织成具有明确生物学意义的功能集群。 * 上调蛋白网络:网络显示存在一个由四种胶原蛋白亚基(COL1A1, COL1A2, COL3A1, COL11A1)组成的紧密互作簇,与肿瘤进展和转移相关。另一个关键枢纽是剪接体核心蛋白SNRPG,它与BUD13, CWC15, SNRNP70, ZMAT2等伙伴蛋白互作,形成了一个U2型剪接体复合物相关的簇,强烈提示两个亚组间存在剪接活性的差异调控。 * 下调蛋白网络:网络中最突出的是一个由7个蛋白质组成的紧密互作簇,包括T复合物蛋白1(TCP1)和6个伴侣蛋白含TCP1亚基(CCT2, CCT3, CCT4, CCT5, CCT6A, CCT7)。该复合物负责肌动蛋白和微管蛋白的正确折叠。此外,微管相关蛋白TUBA1C和TUBB也发生下调。另一个重要的下调簇涉及氨基酰-tRNA合成酶(DARS1, IARS1, KARS1),它们参与蛋白质翻译。

五、 研究结论与意义 本研究通过对两个独立公共蛋白质组学数据集的深入分析,首次在基底样三阴性乳腺癌内部鉴定并验证了两个具有不同蛋白表达谱的分子亚组。这一发现揭示了基底样TNBC并非一个均一的实体,其内部存在显著的蛋白组学异质性。

研究鉴定出的355个差异蛋白(256个上调,99个下调)构成了一个新颖的、经过验证的蛋白组学特征。功能分析表明,这两个亚组在多个关键生物学通路上存在分歧: 1. 剪接体失调:簇1中剪接体核心成分SNRPG及其互作蛋白的上调,提示该亚组可能具有独特的RNA剪接异常,这可能是驱动其恶性表型的新机制。 2. 细胞外基质与细胞骨架重组:胶原蛋白的上调与CCT/TCP1伴侣复合物及微管蛋白的下调并存,表明簇1亚型的肿瘤微环境更具促侵袭性,且细胞骨架动力学可能发生改变,这可能与化疗耐药性有关。 3. 代谢与翻译重编程:氨基酰-tRNA合成酶的下调可能影响蛋白质合成,而线粒体相关蛋白的下调则提示能量代谢途径的差异。

这些发现具有重要的科学价值和应用潜力: * 科学价值:深化了对TNBC,特别是基底样亚型内部异质性的理解,将蛋白质组学层面观察到的分子特征与潜在的生物学功能(如剪接、ECM重塑、蛋白质折叠)联系起来,为后续机制研究提供了明确的线索和靶点。 * 临床应用潜力:所鉴定的蛋白特征(如SNRPG、特定胶原蛋白、CCT复合物成员等)有望成为改进基底样TNBC分层的生物标志物,用于预后预测(例如,区分更具侵袭性或潜在耐药性的亚型)。更为重要的是,这些蛋白(如SNRPG、胶原蛋白、KARS1等)可能成为开发新的靶向治疗策略的候选靶点,为目前治疗选择有限的TNBC患者带来新的希望。

六、 研究亮点 1. 数据驱动的发现与严格验证:研究完全基于公开数据,通过严谨的生物信息学流程(包括稳定性评估、独立验证、随机森林建模和置换检验)发现并验证了基底样TNBC的新亚组,结论可靠。 2. 聚焦蛋白组学与功能关联:不同于多数基于基因组或转录组的分型研究,本研究从功能执行者——蛋白质的角度出发,揭示了可能与肿瘤表型直接相关的生物学通路改变。 3. 鉴定出新颖的候选生物标志物和靶点:研究不仅复现了已知与癌症相关的蛋白(如胶原蛋白),更重点指出了一些在TNBC中研究尚不充分的蛋白(如SNRPG及其互作蛋白、KARS1等)的潜在重要性,为领域提供了新的研究方向。 4. 深入的功能模块分析:通过整合差异分析、GO富集和PPI网络分析,不仅列出了差异蛋白名单,更阐释了这些蛋白如何通过相互作用形成功能模块,从而更系统地解读了亚组间的生物学差异。

七、 其他有价值的内容 研究也坦诚地指出了其局限性:样本量在分亚组后相对较小,可能限制了检测更细微差异的统计效能;研究是探索性的,所发现蛋白特征的功能作用和临床意义需要在未来的实验研究和包含纵向治疗反应数据的独立队列中进一步验证;缺乏其中一个队列的转录组或基因组数据整合,限制了多组学层面的综合分析。作者建议未来可基于本研究发现的蛋白相关性模式,构建共表达网络并进行跨簇比较,以识别核心调控枢纽。所有分析代码和数据均已公开在GitHub上,确保了研究的可重复性和透明性。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com