蒙古牛起源于蒙古高原,是中国北方地区的代表性品种之一,具有严格的
Bos taurus形态特征。在海拔较高、气候干旱的内蒙古地区,经过长期的自然选择和人工选择,蒙古牛形成了耐粗饲、抗寒、耐旱及抵御不良环境的能力,能够适应恶劣的生态环境
[1-2]。蒙古牛基因组中蕴含丰富的遗传信息,对于牛这一物种的进化、品种改良及其环境适应机制等方面的研究具有重要意义。依托于快速发展第三代长读长测序技术(如PacBio和Oxford Nanopore),优化了二代测序技术在基因组组装中的不足,成功获得了一些高质量的蒙古牛基因组。西北农林科技大学的研究团队成功组装出高质量染色体水平的蒙古牛基因组,并将其作为东亚普通牛(
Bos taurus)的代表性品种,为深入探究其遗传特性奠定了基础
[3]。此外,结合当前多种先进的测序技术,蒙古牛T2T水平的高精度参考基因组序列图谱已经获得。
检索NCBI数据库发现,有相当数量的蒙古牛基因组已发表,但这些组装利用的方法较单一,目前缺少有关利用不同的组装软件对蒙古牛基因组进行分析评价的相关工作。这让研究者面对海量的数据不知如何从中挖掘出有用的信息并从中选择最适于获得最佳组装的工具或流程。目前已存在许多的基因组组装软件,在原理、效率、使用的内存以及处理的数据类型上(HiFi或ONT)有显著的区别。这些不同的组装策略使用相同的原始数据生成的结果在连续性、完整性和准确性等层面上会有差别,有必要比较系统地对现有的几种组装软件在蒙古牛中的使用表现进行评价。本研究目的在于多层次评价不同软件对于蒙古牛基因组的组装效果,筛选出最佳的适用流程,以用于后续建立高质量的蒙古牛参考基因组并开展相关深入研究。通过提供高质量的蒙古牛参考基因组作为基础数据,可支撑未来该重要家畜类群功能性分子标记发掘、相关疾病诊断以及生产实践中的分子育种等多个领域的应用。
1 材料与方法
1.1 蒙古牛的文库构建和测序
采集蒙古牛的新鲜血液并立即置于液氮中冷冻。为获取适用于三代测序(TGS)的高质量DNA,DNA提取根据血液/细胞/组织基因DNA提取试剂盒(DP304,TIANGEN)的操作手册进行。提取后的DNA,采用SMRTbell Express Template Prep Kit 2.0试剂盒构建PacBio HiFi测序文库,并在PacBio Sequel Ⅱ测序平台上通过CSS HiFi测序方案进行测序。在开展后续分析前,首先对所有测序数据集进行质量评估与过滤:使用FASTQC v0.11.8软件
[4]评估数据质量,通过Trimmomatic v0.39软件
[5]过滤低质量读段(质量值Q30以下)和短读段(长度小于2 000 bp);同时,采用HiFiAdapterFilt v3.0.1软件
[6]去除含有PacBio接头序列的读段。
1.2 蒙古牛基因组组装
在进行基因组组装前,使用GenomeScope 2.0 v1.0软件
[7]和jellyfish v2.2.8软件
[8]进行基因组大小估算与杂合度分析。分别使用Canu v2.2、Flye v2.9-b1774、Hifiasm v0.16.1-r375及Raven v1.8.1的默认参数进行基因组组装
[9-14]。针对Canu与Flye的组装结果,手动去除被软件标注为环状或重复元件的contig。完成组装后,利用Purge_Dups软件
[15]剔除单倍型冗余序列。之后选取在组装指标上表现最优的两个结果,借助quickmerge工具
[16]进行合并,其中连续性最佳的组装作为查询序列,连续性次优的作为参考序列。最终,以牛的基因组(ARS-UCD2.0,GCF_002263795.3)作为参考,采用RagTag软件
[17]的默认参数对不同工具的组装结果进行支架构建,该过程未启用序列修补程序。挂载后的基因组序列通过Liftoff软件进行注释迁移。
1.3 组装质量评估
采用一套标准化流程,对本研究中得到的4个蒙古牛基因组组装进行综合质量评估,包括组装结果的连续性、完整性和准确性3个方面。首先,使用Assembly-stats软件快速计算总的基因组长度、Contig N50和L50等基础指标对组装的连续性进行初步的评估。为了评估组装的完整程度,利用BUSCO软件
[18]及其专属mammalia_odb10数据库检测保守单拷贝直系同源基因的占比。最后,使用Merqury软件
[19]结合
k-mer图谱分析并计算出碱基的质量值。
2 结果与讨论
2.1 蒙古牛基因组组装结果
蒙古牛HiFi数据组装流程如1.2节所述,使用PacBio HiFi技术获得90 Gb的蒙古牛基因组测序数据,读长长度集中在20 000 bp,见
图1(a)。对其进行
k-mer(
k=19)频率分布分析,如
图1(b)所示,其
k-mer主要分布在30.00左右。据此估计蒙古牛基因组大小约为2.29 Gb,杂合度约0.82%,重复序列的比例为33.72%。使用这些数据对4个主流组装软件Canu、Flye、Hifiasm和Raven在结果评估和冗余度等方面进行了比较(
表1)。通过简单的质量预估和测试发现,4个组装软件都有不同程度的冗余,在冗余度指标上,Canu、Flye组装结果最差,尤其在未经过校正前,Canu组装得到一个高达3.70 Gb大小的原始组装,而Flye甚至多达3.92 Gb,远超过从
k-mer值估计出来的大约2.29 Gb的基因组大小,表明组装中有很多无效或错误的部分被引入基因组序列中,这样可能会影响后续工作的效率,增加计算量和内存消耗。就连续性方面来看,Hifiasm远远超过了其他几款软件,它校正后获得了91.21 Mb的Contig N50,最少的Contigs数量(267条),Contig的最长长度是162.81 Mb,其组装后的总组装长是2.95 Gb,距离预估的基因组大小也很接近,连续性和完整率均很好。Canu校正后各项性能指标也有大幅增长,Contig N50从原始组装的15.12 Mb提高到校正后所得的28.09 Mb,且其冗余也有所减少,但仍有部分冗余数据没有清除掉。Hifiasm和Raven组装后的基因组在连续性方面有较好的表现,并且每个Contig包含的序列都具有良好的完整性和可读性;Flye得到的结果则极度碎片化,经校正后仍有大量短片段组成的Contigs,连续性非常差。综合前面3个结果来看,在构建蒙古牛参考基因组方面,Hifiasm具有最为优良的综合性能;相比之下Canu虽然也有较好的连续性,但产生的冗余序列相对较多,经过比较后在资源可以承担的范畴内还是建议尝试使用该方式深度探索拼接,至于Flye和Raven则不适合应用于这类中型或更大型的基因组。
2.2 基于参考基因组的序列挂载
我们使用RagTag软件和牛的参考基因组对4种软件的组装结果进行了染色体水平的挂载。结果(
表2)显示,在挂载后的基因组总长度上,Hifiasm的组装完整性最好,总长度为2.77 Gb,是4种软件中最高的;Canu为2.74 Gb,Raven为2.61 Gb,Flye的总长最短,只有2.53 Gb。另外,Hifiasm产生的Gap数量最少,只有235个,而Flye、Raven和Canu分别有10 108、2 159和892个。这说明Hifiasm的组装结果在结构上更连贯,序列中的断裂和空缺明显更少。但Raven的挂载率最高(99.51%),Flye和Hifiasm分别为94.72%和93.99%,Canu最低(91.48%)。需要注意的是,挂载率可能与初步组装基因组的大小有关。Raven 的初步组装总长为2.65 Gb,与参考基因组大小接近,所以挂载率较高;而Hifiasm初步组装总长为2.95 Gb,经过挂载校正后调整为2.77 Gb,更接近参考基因组的预期长度,说明该软件在拼接时既保持了连续性,也保证了碱基准确性。虽然Hifiasm的挂载率略低于Raven,但它的Gap数量极少,总长度最高,这充分说明其组装结果在结构完整性和序列准确性上更有优势,能更完整、更精确地匹配到染色体框架。总的来说,在基于参考基因组的挂载分析中,Hifiasm在基因组总长、Contig连续性和Gap数量等多个方面都表现最佳,表明它在高精度基因组组装中具有较高的科学应用价值和结构可靠性。
2.3 组装结果的完整性比较
关于基因组组装完整性的评估分析,本研究采用了两种不同的检测方法。利用基因注释工具Liftoff得到的结果见
图2(a),蛋白编码基因数量较高的是Canu和Hifiasm两款软件(分别是24 651和24 636),初步说明其组装完整度最高且最为准确,可能与二者挂载后基因组总长更长(
表2)有着密切关系。又分别利用哺乳动物保守基因数据库“mammalia_odb10”(共9 226基因)对各个组装版本做了BUSCO检测,结果见
图2(b)。对于不同软件组装出来基因组之间的结果表现出了较大差异:其中完整比例最大的BUSCOs存在于Canu和Hifiasm这两个软件所得出的结果中(分别为98.3%和98.2%),表明二者组装的基因组完整性更好,包含了更多的保守基因;之后是通过Raven获得的组装结果较为突出,为98.1%。Flye软件得到的组装尽管达到了整体标准(96.7%),仍然与以上3组之间相差明显(
表3),这可能是与Flye软件在组装过程中的连续性较差有关(总的Contig数量为10 140,N50为0.45 Mb),因此会引入更多的片段化基因。各组的完整单拷贝基因占比均达到95%以上,其中Raven软件的组装表现最为优异(96.5%),其冗余控制能力与高完整性的平衡得以体现(
表3)。所有组装中重复基因和断裂基因片段均小于2%,均具有一定水平的连接性与连续性(
表3)。Canu和Hifiasm软件在本研究所涉及的环境下,可以提供最多的完整基因的数量,同时其他各项数据表现比较均衡,可以使用Canu或者Hifiasm的结果对蒙古牛全基因组进行注释、比对和进化分析。
2.4 基因组组装准确性评估
采用专门用于高质量测序数据集的Merqury软件,对不同基因组组装的序列准确度进行比较。首先使用
k-mer计算组装的数据,利用上面的结果计算碱基的质量值之后进行评估(
表4)。可以看出不同的组合产生不同的组装软件结果,碱基的质量值中Canu是最大值(75.09),对应的错误碱基率是3.100 85×10⁻⁸,意味着3.2×10⁷碱基中有且只有一个错误碱基;Hifiasm组装的质量值为69.63,略低于Canu得到的值。Flye和Raven呈现出52.56和44.10之间的差异,低于三代测序期望的60。Hifiasm软件组装结果的95.07%序列可以被原始测序数据成功覆盖,而Canu软件只有94.97%,Raven软件为94.24%,Flye软件最低为91.01%。这说明每种方法具有自己特定的正确性与覆盖率,在使用不同程序完成高精度组装的准确性上,Canu软件是恰当的,而在完整的覆盖率方面选择Hifiasm软件则更具优势。
2.5 组装软件的综合评分比较
4款基因组组装软件的综合性评分结果如
表5所示,Hifiasm在连续性、挂载结果及覆盖度等维度表现突出,Canu在基因组初步组装总长、完整性与准确性等核心指标上优势显著,Raven在挂载率方面得分较高,而Flye在多数指标中均表现欠佳。总分排序依次为:Hifiasm(38分)、Canu(35分)、Raven(21分)、Flye(16分)。综合来看,Hifiasm整体组装性能最优,Canu次之,二者组装效果显著优于Raven与Flye。
3 结论
本研究从多维度评价了Canu、Flye、Hifiasm和Raven这4种软件的基因组组装效果,研究结果表明:Hifiasm组装质量优良,可为蒙古牛的遗传育种、品种改良及关键生理性状的分子机制解析提供有力的数据支撑;Canu可作为次优软件选择。
内蒙古自治区科技重大专项(2021ZD0009)