本研究由Aravind Subramanian、Rajiv Narayan、Steven M. Corsello等来自Broad Institute of MIT and Harvard等机构的研究人员共同完成,发表于2017年11月30日的《Cell》期刊。研究报道了新一代连接图谱(Connectivity Map, CMap)——L1000平台及其首批1,319,138个基因表达谱的构建与应用。
研究背景
传统基因表达谱技术如Affymetrix微阵列和RNA测序(RNA-seq)虽然信息丰富,但成本高昂,难以支撑大规模扰动实验。为此,研究团队早前曾提出连接图谱的概念,即通过共同的基因表达特征将基因、药物和疾病状态关联起来。然而,初代CMap仅包含164种药物在3种癌细胞系中的表达谱,规模有限。本研究旨在开发一种低成本、高通量的基因表达谱检测方法,并据此构建一个覆盖百万级扰动样本的全面连接图谱资源。
研究方法与流程
研究首先通过分析公共数据库中12,031个Affymetrix表达谱,利用数据驱动的方法筛选出978个能够最大程度代表全转录组信息的“地标”转录本(landmark transcripts),并证明1,000个地标足以恢复全转录组82%的信息。地标基因的选择不基于生物学功能偏好,而是以信息量最大化为原则;后续分析也表明地标基因不存在特定功能类别的富集。
在此基础上,研究团队开发了L1000检测平台。该平台采用连接介导扩增(ligation-mediated amplification, LMA)技术,在384孔板中裂解细胞并捕获mRNA,反转录后用带独特条形码和生物素标记的探针进行扩增,再将产物与荧光微球杂交,通过Luminex扫描仪同时检测微球颜色(识别基因身份)和荧光强度(定量表达水平)。由于商品化微球仅500种颜色,团队设计了双条形码策略,使一种颜色可识别两个转录本,最终构建了包含1,058个探针(978个地标转录本和80个对照转录本)的L1000检测体系,试剂成本约2美元。技术验证显示,955个shRNA敲低实验中88%的目标基因在被敲低时其表达水平排所有实验的前1%,证明了探针的特异性。L1000重现性方面,88%的技术重复配对Spearman相关系数大于0.9,批内和批间变异相近。与RNA-seq的跨平台比较中,3,176个样本的中位自相关达0.84,98%的样本能正确匹配到同一样本的RNA-seq谱。
进一步,团队利用8,555个RNA-seq样本训练推断模型,用地标基因表达值预测其余转录本。结果显示11,350个被推断基因中81%(9,196个)的推断准确度达到高置信标准。综合地标测量和基因推断,L1000平台可覆盖全转录组83%的基因。
利用该平台,团队构建了CMap-L1000v1数据集,共包含42,080种扰动原(perturbagens)产生的1,319,138个表达谱,对应473,647个整合重复后的特征签名(signatures)。扰动类型涵盖19,811种小分子化合物、18,493个shRNA、3,462个cDNA和314种生物制剂。注释明确的扰动原在9种核心细胞系中系统检测,构成参考数据集“Touchstone v1”;未注释化合物在3至77种细胞系中检测,构成“Discovery v1”。所有数据可通过GEO(GSE92742)和CLUE云平台(https://clue.io)获取。查询分析方法采用加权连接评分(weighted connectivity score),通过Kolmogorov-Smirnov富集统计量计算查询签名与参考签名之间的相似度,并生成名义p值、错误发现率(FDR)和标准化连接分数τ。
主要研究结果
通过分析18,493个shRNA谱,研究发现shRNA的脱靶效应显著大于其靶向效应——共享种子序列(seed sequence)的不同基因shRNA之间的相关性远高于靶向同一基因的不同shRNA之间的相关性。为此,团队开发了“共识基因签名”(consensus gene signature, CGS)算法,整合靶向同一基因的多个shRNA的共同表达变化,有效降低了脱靶噪声,显著提高了与已知靶基因的小分子之间的连接强度。
在小分子作用机制(mechanism of action, MOA)验证中,团队关联了1,902个化合物与其蛋白靶标及通路成员,共构建58,820个预期连接关系。ROC分析显示,单一细胞系平均可恢复45%的预期连接,跨9个细胞系汇总后恢复率提升至63%。为增强生物学解释力,研究定义了171个高置信的“扰动原类别”(perturbagen classes, PCLs),即共享相同MOA或靶向同一基因家族的化合物或遗传扰动原集合。验证中,137个独立测试化合物对其所属PCL的连接恢复率达76%(41/54类别在多种细胞系中成功连接)。PCL分析还揭示了许多药物的脱靶或次生效应:如PKC抑制剂enzastaurin同时强连接至GSK3抑制剂PCL,后续生化实验证实其对GSK3的Kd为8 nM。HDAC抑制剂PCL的内部聚类显示,泛HDAC抑制剂与选择性HDAC6或HDAC1/3/8抑制剂形成不同亚群。
在未注释化合物发现方面,团队对16,527个未优化化合物进行转录活性评分(transcriptional activity score, TAS),仅15%具有高转录活性,而92%的已知药物具有高活性。抗菌药物显著富集在低TAS类别中,符合其不靶向人类蛋白的预期。未注释化合物BRD-2751强连接至ROCK激酶抑制剂PCL,后续激酶组结合实验证实其对ROCK1的Kd为56 nM。更重要的发现是化合物BRD-1868:团队以CSNK1A1基因敲低的签名查询CMap,发现该未注释化合物在两种细胞系中均与CSNK1A1缺失表型高度相似。激酶组特异性分析证实BRD-1868高度选择性地结合CSNK1A1(Kd 2.2 μM),酶活实验显示其抑制CSNK1A1的IC50为12.9 μM——这是首次报道的选择性CSNK1A1小分子抑制剂。
在遗传变异功能注释应用中,CMap成功区分了FBXW7肿瘤相关等位基因的功能影响:过表达野生型FBXW7强连接至MYC敲低签名,而6个位于底物识别口袋的突变等位基因丧失了该连接,4个远离活性位点的等位基因则保留了连接。类似结果在KEAP1和PTEN等位基因系列中也得到验证。
在临床试验数据解读中,团队分析了黑色素瘤患者接受BRAF/MEK抑制剂治疗前后的活检表达谱。治疗中活检显示对MAP激酶抑制签名的强正连接,而复发时多个患者显示对该签名的强负连接,提示MAP激酶通路再激活——与已知的耐药机制一致。在CDK抑制剂PHA-793887的I期试验中,治疗中与治疗前的差异签名对CDKN1A/CDKN2A过表达和CDK4敲低均显示连接,且连接强度与患者治疗持续时间正相关。
结论与价值
本研究证明了大规模功能扰动表达谱数据库的可行性,建立了全球最大的公开细胞扰动资源。L1000平台的低成本优势使得百万级谱检测成为可能,而基于地标基因的推断算法成功回收了81%非测量转录本的表达信息。CMap-L1000v1不仅可恢复已知药物靶标、发现未注释化合物的MOA、识别shRNA脱靶效应,还能功能注释癌症相关等位基因、解读临床试验中的靶标结合和耐药机制。该资源及配套CLUE云平台为药物研发、功能基因组学和疾病机制研究提供了重要基础设施。研究的局限性包括:部分化合物未能恢复预期连接(37%)、shRNA与CRISPR扰动方式的差异、以及细胞系选择性对签名的影响等。未来扩展方向包括增加小分子数量、引入更多细胞类型和患者来源细胞、整合高内涵成像和蛋白组学等多维读出来补充转录组信息。