PlantCaduceus:利用预训练DNA语言模型实现单碱基分辨率植物基因组跨物种建模
植物基因组跨物种建模的里程碑:PlantCaduceus DNA语言模型的创建与突破性应用 一、学术背景与研究动因 在过去二十年里,伴随高通量测序技术的飞速发展,超过1000种植物基因组已经发表,预计未来这一数字还将持续激增。然而,对这些庞大基因组的功能元素进行注释、理解它们在转录和翻译层面的表达调控,以及分析不同遗传变异对于生物个体适应性和性状的影响,一直是植物基因组学乃至作物改良领域中亟需突破的“瓶颈”问题。 相较于动物和人类,植物基因组拥有更复杂的结构,表现为基因组大小巨大、重复序列比例极高、物种间多样性极强,甚至同属同种内部亦具有极大变异。因此,基于单一物种构建的深度学习(deep learning,DL)模型,往往只在特定物种内表现良好,难以跨物种泛化。这极大限制了新测序植物(尤其...