本文属于类型a,是一篇关于苜蓿多组学数据库ModMS的原创研究论文。
该研究由兰州大学草地农业科技学院、草种创新与草地农业生态系统全国重点实验室的Longfa Fang、Zhipeng Liu等人,以及中国热带农业科学院热带作物品种资源研究所的Yuling Han合作完成。通讯作者为Zhipeng Liu(lzp@lzu.edu.cn)。论文于2023年11月27日在线发表于*Horticulture Research*,2024年1月1日正式收录于第11卷,文章编号uhad245。
一、研究背景
紫花苜蓿(Medicago sativa L.)是全球重要的豆科牧草作物,因其蛋白质含量高、环境适应性强、栽培容易且生长迅速,被誉为“牧草之王”。随着全球对肉、蛋、奶等畜禽产品需求的持续增长,苜蓿的经济价值日益凸显。在中国,苜蓿广泛种植于北方干旱和半干旱地区,但多样的环境胁迫常限制其产量与品质。因此,解析苜蓿关键农艺性状和胁迫响应的分子机制具有重要意义。
近年来,高通量测序技术推动苜蓿多组学数据快速积累。过去三年中,已发布四个高质量苜蓿基因组组装,包括中苜1号、中苜4号、新疆大叶和Medicago sativa ssp. *caerulea*。大量转录组数据也已发表,涵盖生物胁迫、非生物胁迫和重要农艺性状等研究方向。同时,蛋白质组学和代谢组学数据也在逐步积累。基因组变异,包括单核苷酸多态性(SNPs)、插入缺失(InDels)和结构变异(SVs),在植物适应性进化和多样化中发挥关键作用,但苜蓿中这些变异的群体分布和频率仍缺乏系统调查。
此前已有多个相关数据库,如tvir、HSFdb、CitGVD、CottonMD和GRAND等,但针对苜蓿的数据库多基于蒺藜苜蓿(*Medicago truncatula*),且大多仅包含单一组学数据,缺乏对栽培苜蓿多组学数据的整合。为填补这一空白,研究团队构建了一个名为ModMS(Multi-Omics Database of *M. sativa*)的综合数据库,旨在整合多参考基因组、注释、比较基因组学、转录组、基因组变异、蛋白质组学和代谢组学数据,以促进苜蓿功能基因组学研究。
二、研究流程与数据库构建方法
ModMS数据库部署在Ubuntu 20.04操作系统上,使用MySQL数据库管理系统进行数据存储和管理,以Slick 3.3.2作为中间件优化查询性能,采用JBrowse 1.16.6实现基因组可视化,网站界面基于Bootstrap 4.6.0和Play框架2.8.7构建。
在基因组模块中,整合了四个苜蓿品种和一个*M. truncatula*的基因组组装及注释数据。预测基因使用EggNOG-mapper 5.0和KOBAS 3.0分别对EggNOG和KEGG数据库进行全基因组水平注释,以获得GO条目和KEGG直系同源信息。
转录组模块收集了18个转录组数据集,涵盖不同组织和处理条件。原始数据从NCBI数据库下载后,使用FastQC(版本0.11.2)过滤低质量读段,用HISAT2(版本2.1.0)将clean reads比对到中苜1号参考基因组,利用featureCounts(版本2.0.2)计算TPM值。共表达网络使用WGCNA(版本1.70-3)构建,通过加权相关矩阵衡量不同样本间基因表达模式的相关性,并用Cytoscape(版本3.6.1)进行可视化。
变异模块基于本实验室产生的200个苜蓿个体的全基因组重测序数据。过滤低质量读段和接头后,使用BWA(版本0.7.10-r789)比对到中苜1号参考基因组,用SAMtools(版本0.1.19)进行排序,利用Genome Analysis Toolkit(GATK)过滤低比对质量的变异(QUAL < 30.0 || MQ < 50.0 || QD < 2),最后用VCFtools(v.0.1.16)剔除MAF < 0.01或缺失率 > 0.1的SNPs和InDels。
蛋白质组模块提供12个蛋白质组数据集,代谢组模块收集13个代谢组数据集,gRNA模块基于CRISPR-Cas9系统提供gRNA序列设计及脱靶效应评估。工具模块包含BLAST、引物设计、富集分析、MUSCLE、LASTZ、GeneWise、SNP热图和组学网络分析等8个分析工具。
三、数据库功能与主要结果
ModMS数据库由七个主要部分组成:基因组学、转录组学、变异、蛋白质组学、代谢组学、gRNA和工具模块。
基因组模块提供基因搜索、序列获取、共线性区块、JBrowse基因组浏览器、浏览和基因组下载功能。用户可通过基因ID或染色体位置查询目标基因,获取GO和KEGG功能注释、CDS、蛋白和启动子序列。共线性分析支持任意两个苜蓿基因组及*M. truncatula*基因组之间的比较,并可生成可视化共线性图谱。注释信息中特别标注了Helitron、LTR和TIR转座元件序列。
转录组模块通过热图或折线图展示目标基因在不同组织或处理条件下的表达模式,并提供共表达网络信息,展示与目标基因相关性最高的基因关联图谱。
变异模块以中苜1号为参考基因组,展示SNPs、InDels和SVs在染色体不同区域的分布。用户可按基因ID或位置检索,变异信息以三角形大小表示等位基因频率,同时显示变异在基因结构中的位置及上下游区域。
蛋白质组模块可视化所选基因旁系同源物在蛋白水平上的表达模式,可生成热图。代谢组模块支持用户输入处理条件和苜蓿品种来识别差异代谢物,并基于热图展示代谢物差异。gRNA模块通过输入目标基因序列和邮箱地址,设计特异性靶向该基因的gRNA序列,并提供潜在脱靶效应信息和替代gRNA序列推荐。
四、案例研究
为验证ModMS功能,研究团队以细胞分裂素氧化脱氢酶6(CKX6)为例进行了系统演示。细胞分裂素是调控根形态建成和根瘤形成发育的关键内源激素,CKX6是负责其不可逆降解的主要酶。在工具模块的BLAST界面提交从TAIR网站获取的CKX6蛋白序列进行同源BLASTP搜索,在中苜1号中鉴定出6个同源基因。选择最佳匹配基因“MSG0880047397.01”后,基本信息区域显示其基因组定位、基因结构、EggNOG和KEGG注释信息;Block列显示该基因在*M. truncatula*、M. sativa ssp. *caerulea*和新疆大叶基因组中分别有1、1、4个同源基因,并以Circos图展示;RNA-seq列提供该基因在不同条件或发育阶段的表达模式;Variation列显示该基因内的多态性变异,包括SNPs、InDels和SVs;Seqs列提供CDS、蛋白和上游区域序列。共表达网络展示了与该基因相关性最高的基因,富集分析显示这些共表达基因在KEGG泛素介导的蛋白水解通路以及GO磷酸根离子转运、砷酸根离子跨膜转运蛋白活性和磷酸根离子跨膜转运蛋白活性等功能条目中显著富集。
五、研究意义
ModMS是首个提供苜蓿综合遗传变异分析的数据库,对发现潜在候选变异或基因具有重要意义。该数据库提供多种常用生物信息学分析工具和用户友好的检索功能,支持基因组学、转录组学、蛋白质组学和代谢组学等多维数据的整合分析。此外,其gRNA工具可辅助研究人员设计特异性靶向基因的单一gRNA序列,对苜蓿基因编辑领域具有特殊价值。总体上,ModMS有助于功能验证,并为旨在提高作物或畜牧业生产力的育种策略开发提供指导。
六、研究亮点与展望
本研究的主要亮点包括:首次系统整合了栽培苜蓿的多组学数据,填补了以往数据库主要基于*M. truncatula*的空白;构建了包含200个苜蓿个体的基因组变异数据集,为群体遗传学和适应性进化研究提供了重要资源;开发了面向基因编辑的gRNA设计工具,拓展了数据库在功能基因组学研究中的应用场景。
未来,研究团队计划纳入更多种质资源和组织的组学数据,并采用更强大的统计方法以提高分析的准确性和可靠性,持续扩展ModMS数据库的内容和功能。