肠道菌群是人体的重要组成部分,作为一种巨大且复杂的微生态系统,对宿主健康有非常重要的影响。检测与分析肠道菌群的群落结构、物种丰富度和多样性,对发现差异菌群及其与疾病的关联具有十分重要的参考价值。传统的肠道微生物研究主要依赖细菌分离培养技术,然而,大多数肠道微生物对生长环境要求苛刻、营养要求高,难以实现分离培养
[1]。此外,培养组学方法耗时长,工作量大,难以对多个样本进行分析。随着细菌遗传组学技术的发展,高通量测序技术由于其高效性和普适性而逐渐成为研究肠道菌群结构的重要手段,被广泛应用于多种疾病与肠道菌群的关联研究
[2-3]。
目前,肠道微生物检测多采用16S rRNA基因进行高通量测序,由于当前2代16S高通量测序方法的读取长度不能覆盖16S rRNA基因的全长,因此通常选择一个或几个较短的高变区域作为替代。然而,16S rRNA基因不同区域的保守度不一致,扩增区域的选择会影响微生物多样性和丰富度的分析结果
[4-6]。常见的用于微生物多样性分析的V区主要分为2类:一类是单个V区,如V3区、V4区、V5区、V6区和V7区等;另一类是连续V区,如V1~V2区、V1~V3区、V3~V4区、V3~V5区、V1~V8区和V6~V9区等
[7]。目前对于肠道菌群测序主要选择V3~V4区或V4区。然而,上述2个不同V区测序是否会产生差异,以及该差异在不同类型人群样本中是否不同尚不清楚。宏基因组测序是以特定环境下微生物群体基因组为研究对象,利用新一代高通量测序技术,直接提取环境样本DNA进行测序,准确性较高,但是宏基因组测序价格高昂,其应用广泛性不如16S rRNA基因测序。本研究拟选择肥胖非酒精性脂肪肝病(non-alcoholic fatty liver disease,NAFLD)儿童和单纯肥胖儿童为研究对象,分别选择高变区V3~V4和V4进行检测,比较不同高变区扩增后的α和β多样性及菌群结构差异。此外,从中选取部分标本进行宏基因组测序,比较宏基因组与16S rRNA基因V3~V4和V4区测序结果差异,评价V3~V4和V4区测序区域优劣性,为科学评估肥胖NAFLD儿童肠道菌群检测结果提供依据。
1 对象与方法
1.1 伦理声明
本研究已获得中南大学湘雅公共卫生学院伦理委员会批准(审批号:XYGW-2021-20)。
1.2 对象
选择2020年1月至2021年9月在湖南省儿童医院儿童保健中心和肝病中心门诊就诊的肥胖儿童为研究对象,肥胖NAFLD儿童为病例组,单纯肥胖儿童为对照组。根据国家卫生计生委2018年发布的《学龄儿童青少年超重与肥胖筛查》
[8]标准,不同年龄、性别儿童体重指数(body mass index,BMI)界值点不同,BMI超过相应年龄、性别的BMI界值点的儿童可判定为肥胖。NAFLD诊断标准为无饮酒史且在以下影像学诊断中具备任意2项腹部超声表现:1)肝脏超声表现近场回声呈弥漫性增强,强于肾脏;2)肝脏超声表现存在远场回声逐渐减弱;3)肝内管道结构不清晰。
病例组纳入标准:1)由儿科医生首次诊断为NAFLD的肥胖儿童,知晓本研究且自愿参加,其父母或法定监护人均已签署书面知情同意书者;2)年龄6~17周岁。排除标准:1)存在饮酒史,包括1年内任何形式的酒精摄入;2)患有其他可能导致脂肪肝的特定疾病;3)服用药物导致的脂肪肝;4)合并其他疾病如感染性疾病、过敏性疾病和2型糖尿病等;5)样本采集前1个月内用过胃肠动力药、激素类制剂、抗生素、益生菌等可能干扰肠道正常微生态的药物或制剂。
对照组纳入标准:1)单纯性肥胖;2)肝脏B超影像正常;3)肝功能正常;4)年龄6~17周岁。对照组排除标准:1)存在饮酒史,包括1年内任何形式的酒精摄入;2)未同时提供血液或者粪便样本;3)合并其他疾病如感染性疾病、过敏性疾病和2型糖尿病等;4)样本采集前1个月内用过胃肠动力药、激素类制剂、抗生素、益生菌等可能干扰肠道正常微生态的药物或制剂。
最终,将92例儿童纳入病例组,53例儿童纳入对照组,采集所有儿童粪便样本分别进行V3~V4区和V4区测序,并随机选择7例病例组儿童进行宏基因组测序。
1.3 方法
1.3.1 样本采集
采集肥胖2组儿童10 g左右的粪便样本。进行分装后,置于-80 ℃超低温冰箱保存,用于基因组DNA提取。
1.3.2 基因组DNA提取和聚合酶链式反应
采用十六烷基三甲基溴化铵法(cetyltrimethylammonium bromide,CTAB)提取样本基因组DNA,经琼脂糖凝胶电泳检测合格后,取适量DNA于离心管中,稀释至1 ng/μL。以稀释后的基因组DNA为模板,分别采用515F/806R和341F/806R对16S rRNA基因的V4区和V3~V4区进行聚合酶链式反应(polymerase chain reaction,PCR)扩增。对于宏基因组测序样本,将提取的DNA经过超声破碎,得到150~300 bp长度的片段。使用高保真PCR预混液(含GC缓冲液)进行PCR扩增,降低扩增错误率,提高扩增稳定性。PCR反应条件:98 ℃ 1 min;98 ℃变性10 s,50 ℃退火30 s,循环30次;72 ℃ 5 min。
1.3.3 PCR产物纯化、文库构建和上机测序
PCR产物使用2%的琼脂糖凝胶进行电泳检测;采用超顺磁珠对检测合格的PCR产物进行纯化,以确保快速富集DNA,并去除杂质。采用酶标定量法,根据PCR产物浓度进行等量混样,使用德国Qiagen公司的胶回收试剂盒回收目的条带。使用TruSeq® DNA PCR-Free Sample建库试剂盒构建DNA文库,将构建好的文库经高通量核酸分析仪检测合格后,采用NovaSeq6000平台进行测序。V3~V4区和V4区操作分类单元(operational taxonomic units,OTUs)序列物种注释比对数据库分别为SILVA138和Greengenes 13.8。
1.4 统计学处理
采用SPSS 26.0和STAMP 2.1.3统计学软件及OmicShare平台进行数据分析。病例组与对照组儿童的年龄、BMI以中位数(第1四分位数,第3四分位数)表示,组间比较采用Wilcoxon秩和检验;性别、民族、居住地以例数和构成比表示,组间比较采用χ2检验。V3~V4区和V4区测序获得的α多样性指标(Shannon指数、Chao 1指数)以均数±标准差表示,组间比较采用2样本t检验。采用主成分分析(principal component analysis,PCA)和主坐标分析(principal coordinates analysis,PCoA)评价不同人群采用V3~V4区和V4区测序在门、纲、目、科、属各水平的菌群β多样性,观察不同组间菌群整体差异,并分别进行Anosim分析和Adonis分析检验组间差异是否有统计学意义。采用Welch’s t检验分析不同人群采用V3~V4区和V4区测序在各水平的差异性菌群,通过Benjamini-Hochberg错误发现率(false discovery rate,FDR)法进行多重校正。分别采用V3~V4区和V4区测序对病例组和对照组进行线性判别分析效应大小(linear discriminant analysis effect size,LEfSe)分析,以发现组间差异物种。此外,选取7例病例组粪便样本进行宏基因组测序,对V3~V4区及V4区测序结果进行敏感性分析,分别比较α多样性、β多样性及菌群相对丰度在V3~V4区和V4区测序与宏基因组测序中的差异。P<0.05为差异有统计学意义。
2 结 果
2.1 病例组和对照组基本信息比较
病例组儿童[包括53例单纯性脂肪肝(non-alcoholic fatty liver,NAFL)患儿和39例非酒精性脂肪性肝炎(non-alcoholic steatohepatitis,NASH)患儿]年龄为11.00(10.00, 12.00)岁,BMI为27.93(25.70, 31.60) kg/m
2,其中男童72例(78.3%),汉族84例(91.3%),居住地为城市65例(70.7%)。对照组儿童(单纯性肥胖)年龄为11.00(9.50, 12.00)岁,BMI为27.71(26.60, 28.72) kg/m
2,其中男童40例(75.5%),汉族48例(90.6%),居住地为城市36例(67.9%)。病例组和对照组上述指标差异均无统计学意义(均
P>0.05,
表1)。
2.2 16S rRNA基因测序概况
对V3~V4区测序数据进行优化后共得到11 548 919条有效序列,测序深度指数为99.3%,共获得16 977个OTUs。对V4区测序数据进行优化后共得到12 216 439条有效序列,测序深度指数为99.9%,共获得3 362个OTUs。
2.3 不同测序区域获得的菌群α多样性指数
Shannon指数:总人群V3~V4区(5.49±1.11)与V4区(4.98±0.65)、对照组V3~V4区(5.77±1.16)与V4区(4.98±0.70)、病例组V3~V4区(5.33±1.06)与V4区(4.98±0.63)比较,差异均有统计学意义(均
P<0.05),且V3~V4区大于V4区(
图1)。Chao 1指数:总人群V3~V4区(1 843.04±580.78)与V4区(379.59±47.27)、对照组V3~V4区(1 967.02±591.57)与V4区(398.09±43.51)、病例组V3~V4区(1 771.62±565.40)与V4区(368.93±46.25)比较,差异均有统计学意义(均
P<0.001),且V3~V4区大于V4区(
图2)。
2.4 不同测序区域获得的菌群β多样性
在门、纲、目、科、属各水平使用基于欧式距离(Euclidean distances)的应用方差分解对样本进行PCA,发现总人群V3~V4区和V4区测序获得的细菌群落结构不完全重叠,存在分离现象(
图3,附
图1,
https://doi.org/10.57760/sciencedb.36325)。Anosim分析结果显示,各组间差异大于组内差异,差异均有统计学意义(
P<0.001,
表2)。病例组与对照组V3~V4区及V4区PCA结果表明,病例组V3~V4区测序与V4区测序、对照组V3~V4区测序与V4区测序获得的菌群在各水平差异均有统计学意义(均
P<0.001)。病例组与对照组的V3~V4区测序结果在各水平的差异均无统计学意义(均
P>0.05),病例组与对照组V4区测序在门、纲、科水平的差异均无统计学意义(均
P>0.05),在目、属水平的差异均有统计学意义(均
P<0.05),但是差异很小(
图4、
表3、附
图2,
https://doi. org/10.57760/sciencedb.36325)。进一步PCoA结果显示,总人群V3~V4区和V4区测序获得的样本显著分离(
图5)。Adonis分析表明V3~V4区和V4区差异有统计学意义(
P=0.001,
表4)。病例组与对照组V3~V4区及V4区PCoA结果表明,病例组V3~V4区测序与V4区测序、对照组V3~V4区测序与V4区测序获得的菌群差异均有统计学意义(均
P<0.001,
图6、
表4)。
2.5 不同测序区域获得的菌群相对丰度
Welch’s
t检验结果表明,总人群V3~V4区和V4区在门水平存在2种相对丰度有统计学差异的微生物(附
图3,
https://doi.org/10.57760/sciencedb.36325)。在纲水平存在9种相对丰度有统计学差异的微生物(附
图4,
https://doi.org/10.57760/sciencedb.36325)。在目水平存在35种相对丰度有统计学差异的微生物(附
图5,
https://doi.org/10.57760/sciencedb.36325)。在科水平存在33种相对丰度有统计学差异的微生物(附
图6,
https://doi.org/10.57760/sciencedb.36325)。在属水平存在72种相对丰度有统计学差异的微生物(
图7)。病例组2种不同测序区域在门、纲、目、科、属水平分别存在1、9、32、35、66种相对丰度有统计学差异的微生物(
图8、附图
7~
10,
https://doi.org/10.57760/sciencedb. 36325)。对照组2种不同测序区域在纲、目、科水平分别存在7、27、21种相对丰度有统计学差异的微生物,在门和属水平不存在相对丰度有统计学差异的微生物(附图11~13,
https://doi.org/10.57760/sciencedb. 36325)。
2.6 不同测序区域获得的菌群组成
LEfSe分析结果显示,V3~V4区测序方法共发现29种菌群与NAFLD有关,其中,16种在对照组富集(如
Lachnospiraceae_NK4A136_group、
Parasutterella、
Ruminococcaceae_UCG_002、
Sarcina、
Firmicutes等),13种在病例组富集(如
Enterobacteriaceae、
Enterobacteriales、
Proteobacteria、
Gammaproteo-bacteria、
Escherichia _Shigella等)(
图9)。V4区测序方法共发现7种菌群与NAFLD有关,其中,3种(
Faecalibacterium、
Clostridia、
Firmicutes)在对照组富集,4种(
Enterobacteriaceae、
Enterobacteriales、
Escherichia_Shigella、
Escherichia_coli)在病例组富集(
图10)。
2.7 敏感性分析
α多样性分析表明,Shannon指数的宏基因组测序(6.39±0.42)与V3~V4区测序(5.41±1.62)差异无统计学意义(
P=0.169),而宏基因组测序与V4区测序(4.89±0.94)差异有统计学意义(
P<0.01),且宏基因组测序大于V4区测序(附图14,
https://doi.org/10. 57760/sciencedb.36325)。Chao 1指数的宏基因组测序(3 092.71±505.89)与V3~V4区测序(1 889.92±781.73),宏基因组测序与V4区测序(362.41±35.22)差异均有统计学意义(均
P<0.001),且宏基因组测序大于V3~V4区测序和V4区测序(附图15,
https://doi.org/10.57760/sciencedb.36325)。β多样性分析显示,宏基因组测序与V3~V4区测序在门、纲、目水平差异均无统计学意义(均
P>0.05),在科和属水平差异均有统计学意义(均
P<0.05);宏基因组测序与V4区测序在门、纲、目、科水平差异均无统计学意义(均
P>0.05),属水平差异有统计学意义(
P<0.05,附图16~19、
附表1,
https://doi.org/10.57760/sciencedb.36325)。进一步Welch’s
t检验分析表明,宏基因组和V3~V4区测序在目、科、属水平分别存在1、2、4种相对丰度差异具有统计学意义的微生物(附图17~19,
https://doi.org/10.57760/sciencedb.36325)。宏基因组和V4区测序在科、属水平分别存在1种和8种相对丰度差异具有统计学意义的微生物(附图20、21,
https://doi.org/10.57760/sciencedb.36325)。
3 讨 论
本研究分别采用16S rRNA基因V3~V4区和V4区对肥胖NAFLD及单纯肥胖儿童肠道菌群进行测序,结果显示,与V4区测序相比,V3~V4区测序能检测出更多的OTUs,且无论是对照组还是病例组,V3~V4区测序均有更高的Shannon指数和Chao 1指数。此外,β多样性分析也表明,相同样本2种不同测序区域之间获得的菌群丰度总体上存在差异,在PCA图中表现为不完全重叠,在PCoA图中表现为显著分离。这可能是因为基于引物338F和806R的V3~V4区测序可获得约470 bp的扩增子,而基于引物515F和806R的V4区测序只能获得约300 bp的扩增子。序列信息越长,可用于反映种属亲缘关系的位点数越多,检测到的微生物种类也越多。如Klindworth等
[9]通过计算机模拟在SILVA数据库中研究了175条引物和512对引物对细菌的扩增效率,发现使用Illumina miseq平台对扩增长度为464 bp的V3~V4区测序的细菌覆盖度最高。Liu等
[10]同样发现,V3~V4区测序覆盖率高于其他区域,能检测出91%的菌门和96%的菌属。然而,另一方面,也有研究
[11]发现V4区引物通用性是所有高变区中最高的,且在门水平可以提供与16S rRNA基因全长精度相同的信息。此外,Youssef等
[12]发现V4区对微生物丰度及菌属水平测序结果与全长16S rRNA基因序列分析结果更相似。Sun等
[13]发现V4区测序的基因组内异质性最低,能减少对菌群丰度的高估。作为地球微生物组计划和人类微生物组计划建议使用的测序区域,当前许多肠道菌群研究选择V4区测序
[14-16],但也有部分学者选择V1~V3区
[17]、V2区
[18]、V5~V6区
[19]对人体肠道菌群进行测序。由此可见,在肠道菌群16S rRNA基因测序的V区选择策略方面还存在较大争议,限制了研究之间的可比性和连续性。
本研究进一步通过组间差异物种分析发现,无论是门、纲、目、科、属哪一水平,V3~V4区测序和V4区测序都存在相对丰度差异显著的菌群,病例组2种测序方法获得的相对丰度有差异的微生物种类远多于对照组。尤其是在菌属水平,病例组2种测序方法获得的差异性菌属有66种,而对照组2种测序方法不存在差异性菌属,可见对NAFLD儿童而言,不同测序区域对测序结果影响较大。这可能是因为NAFLD病例组人群肠道致病菌种类相对更多
[20],既往研究
[21]表明V3区对致病菌菌属丰度估计较为准确,尤其是肠道致病菌
[22],其结果与16S rRNA基因全长最接近。因此,上述结果提示V3~V4区与V4区在检测一般儿童样本时,检出的菌群丰度差异较小,而对于NAFLD儿童,采用V3~V4区测序可能获得相对准确的菌群丰度信息。先前已有多项研究
[23-26]表明,
Klebsiella、
Fusobacterium、
Collinsella、
Lachnospiraceae_
NK4A136_group、
Parasutterella、
Ruminococcaceae_
UCG_002和
Sarcina相对丰度在NAFLD组和对照组之间存在显著差异,提示上述菌属丰度可能与NAFLD的发生、发展相关。本研究采用V3~V4区测序同样发现了这些菌属的组间差异,而V4区测序并未发现这种差异,表明V3~V4区测序可能更易发现NAFLD相关菌属。
16S rRNA测序是针对标记基因序列的测序,无法获取细菌完整的基因组信息,宏基因组测序技术是以特定环境中的所有微生物群落作为研究对象,提取样品中全部微生物的总DNA进行测序。因此,与16S rRNA基因测序相比,宏基因组测序能获得更加全面的微生物信息
[27],该技术能在物种鉴定深度、精确性及物种功能分析方面弥补16S rRNA测序的不足,可作为高通量测序方法的金标准。本研究选取了7份样本进行宏基因组测序,将测序结果与相同样本V3~V4区和V4区测序结果进行比较,发现宏基因组测序获得的菌群Shannon指数高于V4区,与V3~V4区并无差异,而Chao 1指数远高于V3~V4区和V4区,且V3~V4区高于V4区,表明V3~V4区测序对物种分布均匀度有较准确的估计。β多样性分析结果显示,宏基因组测序与V3~V4区和V4区测序获得的菌群聚类均较为分散,样本间距离较远,可能是由于肥胖儿童个体之间有较高的肠道微生物群落异质性
[28]。Anosim分析表明,在菌属水平,宏基因组测序与V3~V4区和V4区测序组间均存在整体差异,但具体而言,宏基因组测序与V3~V4区测序差异菌属数目少于宏基因组测序与V4区测序差异菌属数目。上述结果均提示,V3~V4区测序能获得与宏基因组测序更相近的结果。
目前关于16S rRNA基因不同高变区测序的比较研究多集中在环境样本或人群样本其他疾病,尚无研究比较16S rRNA基因不同高变区测序对儿童NAFLD病例组与对照组差异性肠道菌群的影响。本研究创新点在于对完全相同的NAFLD儿童粪便标本分别选择V3~V4区和V4区进行检测,比较上述2种区域测序结果差异,为肠道菌群与儿童NAFLD的关联研究方法提供参考。此外,应用宏基因测序作为金标准,评判V3~V4区和V4区的数据质量,使结论更加可靠。然而,本研究也存在一定的局限性。首先,宏基因组测序样本量较小,可能无法检出所有菌群,难以代表总体样本。其次,2种测序方案注释物种所使用的数据库不同,尽管一些研究发现,Greengenes和Silva数据库注释获得的OTUs数量几乎一致
[29],且采用不同数据库对分类一致性影响十分有限
[30],但使用不同数据库可能会在后续分析中产生一定的系统误差。
综上所述,同一样本16S rRNA基因的V3~V4区和V4区测序获得的菌群α多样性与β多样性存在显著差异,V3~V4区较V4区能检出更多的物种,与宏基因组测序结果更接近。此外,V3~V4区测序能发现更多与儿童NAFLD相关的菌属,这提示对于NAFLD儿童,16S rRNA基因的V3~V4区是更合适的测序区域。对肠道菌群16S rRNA基因测序,目前没有一个统一的V区选择标准,尽管16S全长测序能覆盖所有高变区,并鉴定到菌种水平,然而,这种方案每个样本成本是单个V区测序的2~5倍,且耗时更长。因此,选择合适的高变区进行测序,仍然是肠道菌群整体特征研究优先选择的方案。鉴于目前仍没有任何一个单一的或多个连续的V区可以代替全长16S rRNA基因,且不同V区测序结果仍存在较大异质性。因此,16S rRNA基因测序区域的选择应慎重,可根据研究目的和样本特征综合选择检测区域及方法。未来仍需更多的研究探讨更加科学的16S rRNA基因测序方案。
国家自然科学基金(82304171)
湖南省自然科学基金(2022JJ40668┫。This work was supported by the the National Natural Science Foundation ┣82304171)
the Natural Science Foundation of Hunan Province(2022JJ40668)