本文属于类型b,即一篇科学论文,但并非单一原创研究的报告,而是一篇综述文章。以下是根据文档内容撰写的学术报告:
本文题为《Advanced deep learning strategies in nanopore RNA sequencing》(纳米孔RNA测序中的先进深度学习策略),发表于《RNA Biology》期刊,于2026年2月16日在线发表。文章作者为Crystal Ling、Benjamin Lebeau、Kwoh Chee Keong和Melissa Fullwood,来自新加坡南洋理工大学(Nanyang Technological University),其中Kwoh Chee Keong隶属于计算与数据科学学院,Melissa Fullwood隶属于生物科学学院。该综述系统总结了深度学习在纳米孔直接RNA测序(direct RNA sequencing)中用于RNA修饰检测的最新进展。
文章首先介绍,表观转录组(epitranscriptome)由RNA分子上的化学修饰构成,在共转录和转录后基因调控中发挥关键作用,超过170种化学修饰已被鉴定,其中N6-甲基腺苷(m6A)、5-甲基胞嘧啶(m5C)、假尿苷(ψ)和腺苷到肌苷(A-to-I)编辑等受到广泛关注。这些修饰的失调与癌症、代谢性疾病、心血管疾病和精神疾病等多种疾病相关,显示出其作为诊断生物标志物和治疗靶点的潜力。纳米孔测序作为第三代测序技术,通过让多聚腺苷酸化的天然RNA分子穿越纳米孔,产生与碱基序列对应的离子电流信号,实现了单分子分辨率下多种RNA修饰的同时分析。然而,信号的复杂性要求先进的计算机方法进行解读,深度学习因而成为该领域的核心工具。
在深度学习的训练范式方面,文章归纳为监督学习(supervised learning)和半监督学习(semi-supervised learning)两大类。训练数据的来源包括体外转录(in vitro transcription, IVT)、体内敲除/敲低(knockout/knockdown, KO/KD)模型以及正交高通量测序(high-throughput sequencing, HTS)数据集。IVT可提供受控的训练数据,但序列和修饰多样性有限;KO/KD策略可能引入脱靶效应;体内转录可捕捉天然修饰环境,但获取难度更大。弱监督策略也被用于缺乏精确标签的场景,例如m6anet利用免疫沉淀实验获得的位点级标签来预测读取级别的修饰概率,nanodoc2则采用监督训练结合无监督聚类的方法进行修饰位点的新发现。
经典深度学习方法方面,卷积神经网络(CNN)和循环神经网络(RNN)及其变体(如LSTM、GRU)在碱基识别后分析中应用最广。CheUI采用两阶段CNN,使用IVT来源的9-mer序列训练独立模型以识别m6A和m5C共修饰,能够在单分子分辨率下输出每个读取的修饰概率及位点级化学计量。Dena使用双向LSTM(BiLSTM),在拟南芥体内转录数据上训练,能够检测天然修饰化学计量下的m6A位点,并具有同工型(isoform)感知能力。NanoSPA则利用多层感知器(multilayer perceptron)在碱基识别错误特征上训练,同时预测m6A和ψ。此外,RNAkinet采用混合CNN-RNN框架区分5-乙炔基尿苷(5-EU)标记的新生转录本与成熟转录本,用于RNA动力学研究。Transformer架构虽然主要用于basecalling模型,但在后续分析中也有应用潜力。
专用学习框架部分介绍了三种重要策略。多实例学习(multiple instance learning, MIL)将标签分配给信号组而非单个实例,m6anet利用这一框架从位点级标签推断读取级修饰概率,解决了单分子水平标签缺失的问题。单类分类(one-class classification)策略被nanodoc2采用,该模型使用WaveNet架构的CNN仅在未修饰信号上训练,将修饰检测框定为异常检测任务,从而实现对多种修饰类型的新发现(de novo discovery),但其化学身份鉴定需要正交验证。迁移学习(transfer learning)则被TandemMod采用,该模型先在IVT的m5C数据上预训练,再用极少量的其他修饰数据集进行微调,能够检测m6A、m5C、m1A、hm5C、m7G、ψ和肌苷(inosine)等多种修饰类型,并在水稻及人类数据上验证了跨物种泛化能力。
集成深度学习策略部分阐述了集成学习在RNA修饰检测中的应用。集成学习通过组合多个模型来减少过拟合、提高准确性和泛化能力,包括bagging(装袋法)、boosting(提升法)和stacking(堆叠法)三种主要策略。混合权重神经装袋(mixed-weight neural bagging)框架将基于特征的LightGBM模型与基于原始电流信号的LSTM模型相结合,通过神经网络分配优化权重,用于检测低丰度的SARS-CoV-2病毒RNA中的m6A修饰。文章还讨论了序列级集成方法,如DeepPromise、EMDLP、Gene2Vec和EDLm6Apred等,这些方法虽不直接利用纳米孔信号,但通过多编码集成策略区分m6A与其结构类似的m1A异构体,在未来与纳米孔信号特征融合可能提高异构体分辨率和跨物种泛化能力。
文章的核心观点可归纳为:第一,深度学习相较于统计方法和经典机器学习能自动从原始信号中提取特征,适合处理纳米孔数据中固有的噪声、变异性生物差异和细微的修饰信号差异;第二,专门的深度学习框架如多实例学习、单类分类和迁移学习有效缓解了数据稀缺、标签缺失和跨修饰泛化等瓶颈;第三,集成学习策略通过组合互补模型提高了低丰度、高噪声场景(如病毒RNA)中修饰检测的稳健性;第四,未来需要在多修饰同时检测、标准化基准测试、可解释性模型以及单细胞分辨率多路复用检测方面继续突破。
文章的价值和意义在于,它系统梳理了纳米孔直接RNA测序中深度学习方法的演进脉络,从经典CNN/RNN架构到专用学习框架和集成策略,清晰地展示了人工智能如何从碱基级修饰检测扩展到多修饰共分析、从体外合成数据适配到体内天然数据,并逐步克服数据稀缺、噪声干扰和低丰度转录本检测等实际挑战。文章提出的多任务学习、元学习、课程学习、贝叶斯深度集成和混合专家模型等未来方向,为后续算法开发提供了明确的路线图。此外,文章强调标准化基准测试和正交生物学验证的必要性,对推动整个领域的可重复性和可靠性具有重要的方法论指导意义。