分享自:

跳蛛科 Spartaeus platnicki 的染色体水平基因组组装

期刊:Scientific DataDOI:10.1038/s41597-026-07685-3

本文属于类型a,即单一原创研究论文。以下是基于原文内容生成的中文报告:

本研究由河北大学动物系统学与应用重点实验室的杨志勇、陈爱蝶、张锋和张俊霞等人完成。该论文于2026年6月19日被Scientific Data接收发表,文章标题为“Chromosome-level genome assembly of the jumping spider Spartaeus platnicki”。通讯作者为张锋(Feng Zhang)和张俊霞(Junxia Zhang),研究团队隶属于河北大学生命科学学院、河北省生物互作基础科学中心以及京津冀生态安全与保护工程研究中心。

跳蛛(jumping spiders,Salticidae)是蜘蛛目中最具物种多样性的类群之一,已描述物种近七千种。跳蛛以其高度特化的视觉系统、复杂的求偶行为和广泛的生态适应性而闻名,是研究动物感觉系统演化、行为生态学以及表型演化的理想模型。然而,高质量的跳蛛基因组资源长期匮乏,严重限制了对这些关键性状的遗传基础研究。现有的跳蛛系统发育框架将跳蛛科划分为七个亚科,其中Salticinae亚科占据了超过90%的物种多样性,其余六个亚科被统称为“基部谱系”或“非Salticinae类群”,其物种多样性不足10%。虽然Salticinae亚科的基因组研究已取得一定进展,但基部谱系的高质量基因组数据仍然缺乏,这阻碍了对整个跳蛛科进化历史的全面理解。本研究选择的Spartaeus platnicki隶属于基部亚科Spartaeinae,该物种常见于中国南方山地森林的岩石缝隙中。与Salticinae亚科物种相比,S. platnicki具有明显更大的后中眼,并且会构建中等大小的丝质片层来辅助捕食,这一行为在大多数不结网捕食的跳蛛中较为罕见。因此,S. platnicki是理解跳蛛形态与行为演化的关键模型。本研究的目标是构建S. platnicki的染色体水平参考基因组,填补跳蛛基部谱系的基因组资源空白,为整个跳蛛科的比较进化和功能基因组研究奠定基础。

本研究采用了多平台测序策略,结合了PacBio HiFi长读长测序、Illumina短读长测序、RNA-seq以及Hi-C技术。研究材料为2024年采集自中国广西壮族自治区花坪国家级自然保护区的S. platnicki成年雌性和雄性个体。样本采集后立即用液氮速冻,并储存于−80°C。物种鉴定通过对比标本的体表及生殖器特征与权威分类学文献完成。基因组DNA采用CTAB法提取,并通过琼脂糖凝胶电泳评估完整性和分光光度法检测纯度。短片段配对末端文库(200–400 bp)分别构建自雌性和雄性个体,使用Agencourt AMPure XP-Medium试剂盒制备,并在DNBSEQ-T7平台测序,主要用于k-mer分析以估算基因组大小、杂合度和重复序列含量,同时用于组装校正和注释支持。雄性样本的测序深度差异还用于推断性染色体。长读长测序使用PacBio Sequel Revio平台,基因组DNA经Megaruptor打断至约20 kb片段,使用SMRTbell Express Template Prep Kit 3.0构建文库,并通过SageELF或BluePippin进行片段筛选。Hi-C测序用于获取染色质三维构象信息,文库构建包括甲醛交联、MboI酶切、末端修复、生物素标记、邻近连接和解交联等步骤,最终在DNBSEQ-T7平台完成测序。转录组测序方面,利用TRIzol试剂提取总RNA,使用VAHTS mRNA-seq V2 Library Prep Kit构建链特异性文库;同时利用RNAprep Pure Plant Plus Kit和SQK-PCS109及SQK-PBK004试剂盒构建ONT PromethION全长转录组文库,用于精确的基因模型注释。

基因组组装流程包括多个步骤。使用fastp v0.23.4对原始BGI测序数据进行质控和修剪,去除低质量碱基、重复序列和poly-G/X尾巴。基于k-mer分析(k=21),估算单倍体基因组大小为3.63 Gb,杂合度为1.46%,重复序列比例为58.91%。HiFi reads使用pbccs v6.4.0生成,并通过yak v0.19构建k-mer频谱。使用hifiasm v0.24.0进行从头组装,参数“-l 3”用于去除覆盖度低于3×的contig。组装结果使用NextPolish2 v0.2.1进行迭代校正,第一轮使用HiFi reads比对结果,随后两轮使用Illumina双端reads。冗余contig使用Purge_dups v1.2.5基于序列相似性和覆盖深度去除。染色体水平组装通过Hi-C数据辅助完成。Hi-C reads使用chromap v0.2.6进行比对、去重和有效互作对提取。使用yahs v1.2进行两轮scaffolding,第一轮后使用Juicebox v1.11.08根据Hi-C互作热图进行人工校正,校正后的组装再输入第二轮yahs scaffolding,最终得到染色体规模组装。组装完整性通过BUSCO v5.7.1对照arachnida_odb10数据库评估,同时利用Merqury v1.3估算一致性质量值。最终组装大小为3.71 Gb,其中99.36%的序列被锚定到15条假染色体上,scaffold N50达到262 Mb,BUSCO完整性为98.60%。

重复序列注释方面,使用RepeatModeler v2.0.5构建de novo重复序列文库,并与Dfam 3.7和RepBase-20181026数据库合并。使用RepeatMasker v4.1.5进行重复序列识别和掩蔽。结果显示重复序列总长度为2.44 Gb,占基因组的65.57%。其中未分类元件最为丰富(28.47%),其次为DNA转座子(21.88%)、LTR逆转录转座子(8.86%)、LINE(5.18%)和SINE(1.18%)。TE景观分析基于Kimura双参数散度计算,结果表明S. platnicki的转座元件可能经历了三轮扩张事件。非编码RNA注释方面,使用Infernal v1.1.5比对Rfam数据库鉴定rRNA、snRNA和miRNA,使用tRNAscan-SE v2.0.12预测tRNA,共注释得到14,600个非编码RNA。蛋白编码基因的预测使用MAKER v3.01.04流程,整合了从头预测、转录组证据和蛋白同源性支持。从头预测使用BRAKER v3.0.6和GeMoMa v1.9,其中BRAKER整合了RNA-seq和节肢动物蛋白序列进行自动训练,GeMoMa利用蛋白同源性和内含子位置保守性进行预测。转录组证据通过HISAT2 v2.2.1比对RNA-seq reads,并使用StringTie v2.2.1组装转录本。蛋白同源性证据来自包括果蝇、大型溞、森林革蜱、二斑叶螨、横纹金蛛和Uloborus diversus在内的六种节肢动物的蛋白序列。最终共注释到15,660个蛋白编码基因,平均每个基因含8.80个外显子,平均外显子长度354.80 bp,平均内含子长度8,829.40 bp。预测蛋白通过DIAMOND比对UniProtKB数据库进行功能注释,使用InterProScan和EggNOG-mapper进一步注释保守结构域、GO条目、KEGG和Reactome通路信息。基因功能注释结果显示95.20%的基因在UniProt数据库中获得了匹配,82.78%在InterProScan中有功能域注释,89.44%在EggNOG中获得了注释。

本研究成功构建了首个跳蛛基部谱系的染色体水平高质量参考基因组。该基因组填补了蜘蛛基因组学中一个重要的系统发育空白,为整个跳蛛科关键性状的遗传基础研究和表型演化分析提供了基础性资源。相比此前仅有的Salticinae亚科参考基因组,本研究的S. platnicki基因组覆盖了跳蛛科的系统发育基部位置,为开展跨亚科的比较基因组学研究提供了关键的对照数据。研究结果揭示了该物种基因组中高比例的重复序列(65.57%)以及转座元件可能的多轮扩张事件,这为理解蜘蛛基因组大小演化和重复序列动态提供了新线索。此外,本研究的数据均已提交至NCBI SRA和GenBank公共数据库,注释文件可在Science Data Bank获取,为后续研究社区提供了可直接利用的数据资源。

本研究的亮点包括:首次实现跳蛛基部谱系的染色体水平基因组组装;整合了PacBio HiFi、Illumina、Hi-C、RNA-seq和ONT全长转录组等多平台数据,确保了组装和注释的高质量;基因组包含15条假染色体,其中包括X1和X2两条性染色体,为研究跳蛛性染色体演化提供了重要材料;BUSCO完整性高达98.60%,表明基因组组装质量优异;基因注释的BUSCO完整性达到97.60%,为后续功能研究提供了可靠基础。研究还通过TE景观分析揭示了转座元件的扩张历史,为理解基因组结构演化提供了线索。这些成果不仅在分类学上具有重要价值,也为蜘蛛行为、视觉系统演化以及比较基因组学研究提供了宝贵的数据平台。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com