哮喘是一种以慢性炎症为特征的呼吸疾患,涉及免疫系统与气道上皮细胞间的复杂相互作用,引发气道炎症、支气管高反应性、气道狭窄、重塑及敏感性增加
[1,2]。全球超过3亿人受哮喘影响,其典型临床表现为对非特异性刺激如冷空气和运动的异常敏感,常表现为反复发作的呼吸困难和胸闷
[3‑5]。相较于以往过敏性与非过敏性哮喘的简单分类
[6,7],现代研究揭示了哮喘的不同表型具有独特的病理、生理特征。因此,对哮喘亚型的精确诊断、治疗和研究显得尤为重要
[8‑10]。这些亚型在遗传倾向、环境风险、发病年龄、临床表现、预后以及对治疗的反应上存在差异,识别特定亚型的生物标志物对哮喘的诊断和治疗至关重要。
在生物体内,除了编码蛋白质的基因(mRNA)外,还存在大量不编码蛋白质的RNA,即非编码RNA(ncRNA),包括microRNA、长链非编码RNA(lncRNA)和环状RNA(circRNA)。人类基因中仅有少量编码蛋白质的基因,有研究显示ncRNA在转录组中占据主导地位
[11]。这些ncRNA在遗传调控中扮演着关键角色,核心功能之一是调控基因表达
[12]。内源竞争RNA(competing endogenous RNAs, ceRNA)机制表明,lncRNA和circRNA可通过与miRNA竞争性结合来调节mRNA的表达。构建ceRNA网络对于识别关键基因、深入研究分子调控机制和疾病发病机制具有重大意义。然而,哮喘中关于ncRNAs的研究尚不充分,ceRNA调控网络在哮喘中的作用还需进一步探索。
基于此,本研究利用GEO数据库和生物信息学分析构建并分析了哮喘相关的ceRNA网络,并在哮喘细胞模型中验证了网络中关键因子的表达。这项研究对于识别哮喘的潜在诊断标志物、治疗靶点和阐明分子机制具有重要价值。
1 材料与方法
1.1 数据检索
从基因表达综合数据库(
http://www.ncbi.nlm.nih.gov/GEO)中下载本研究所需的数据集。利用筛选关键词“Asthma”在GEO数据库中搜索数据集,共计53个数据集。从这些数据集中挑选样本类型为外周血,且包括正常对照与哮喘病例组来筛选数据集。最终下载哮喘相关数据集GSE134544(芯片平台:GPL10558 Illumina HumanHT‑12 V4.0表达微珠芯片;包含21例健康人群及40例哮喘病例的全血样本)、GSE182503(芯片平台:GPL21185 Agilent‑072363 SurePrint G3 Human GE v3 8x60K微阵列芯片039494;包含21例健康人群及50例哮喘病例的静脉血样本)和GSE222894[芯片平台:GPL20712 Agilent‑070156 Human miRNA (miRNA 版本);包含5例健康人群及10例哮喘病例的血清样本]。
1.2 关键基因的鉴定
1.2.1 加权基因共表达网络分析
对GSE134544数据集进行表达差异分析,使用SangerBox网站(
http://sangerbox.com/tool.html)绘制火山图可视化与哮喘相关的表达差异基因。筛选GSE134544数据集中方差大于0.5的基因利用R软件的“WGCNA”包根据幂函数曲线选出合适的软阈值以构建无尺度基因共表达网络,进而进行加权基因共表达网络分析(weighted gene co‑expression network analysis,WGCNA)。将WGCNA分析得到的与临床特征相关的基因与表达差异基因取交集,并绘制韦恩图。
1.2.2 基因集变异分析
本研究应用基因集变异分析(gene set variation analysis,GSVA),使用数据集的基因表达数据来推断通路活性变化
[13]。从MSigDB数据库中下载包含KEGG信息的相关数据进行GSVA分析。利用交集基因的基因表达矩阵计算每个样本在不同通路中的GSVA评分。随后使用“limma”包对通路进行差异分析,将校正后
P<0.05且|log
2FC|>0.5的通路定义为差异通路。
1.2.3 关键基因筛选及验证
从MSigDB数据库下载与活性通路相关的基因,并将其与哮喘相关的表达差异基因取交集。随后绘制交集基因在GSE134544数据集中表达水平的箱线图并绘制接收者操作特征曲线(receiver operating characteristic curve,ROC)。最后验证关键基因在验证数据GSE182503中的表达差异,并绘制ROC曲线。
1.3 关键基因靶向microRNA的筛选
通过在线数据库miRDB(
https://www.mirdb.org/)、TargetScan(
https://www.targetscan.org/vert_80/)和starBase3.0(
https://rnasysu.com/encori/)预测关键基因靶向的microRNA。随后将3个数据库预测的microRNA取交集。最后在GSE222894数据集中针对上述交集的microRNA进行表达差异分析。基于内源竞争性RNA假说的概念,最终选择与关键基因表达趋势相反的microRNA来用于构建ceRNA网络。
1.4 ceRNA网络的构建
基于关键基因靶向的microRNA,结合LncBase数据库(
https://diana.e-ce.uth.gr/lncbasev3)
[14]和ENCORI数据库(
https://rnasysu.com/encori/)
[15]探索上述microRNA靶向的lncRNA。鉴于ceRNA网络主要在细胞质中发挥作用,利用RNALocate数据库(
http://www.rna-society.org/rnalocate/)确定lncRNA的亚细胞定位,并排除任何仅定位于细胞核或细胞外空间的lncRNA
[16]。最后,构建整合mRNA、microRNA和lncRNA的ceRNA网络。
1.5 哮喘细胞模型的建立
本研采用不同浓度TNF‑α处理人气道上皮细胞(16‑HEB)12、24 h。利用CCK‑8试剂盒(InCellGene,货号:IC‑1519)检测细胞活力,选择最适浓度的TNF‑α建立哮喘细胞模型。利用Elisa试剂盒(江莱生物,货号:JL14113和JL13662)检测哮喘细胞模型中炎症相关因子的水平,利用凋亡试剂盒(Muse,货号:MCH100105)在流式细胞仪上检测细胞凋亡程度,综合评价哮喘细胞模型是否构建成功。
1.6 实时荧光定量PCR
首先使用液氮研磨细胞样本,使之成为粉末状,随后加入Trizol裂解液提取总RNA。通过紫外吸收光谱法对提取的RNA进行浓度和纯度检测。接着,利用Prime Script™ RT Master Mix试剂盒(Perfect Real Time,Takara,中国)按照说明书指导进行总RNA的反转录,以获得cDNA。最后,采用TB Green
® Premix Ex Taq™ Ⅱ试剂盒(Takara,日本)进行qRT‑PCR实验。qRT‑PCR所需的引物详细信息见
表1。
1.7 统计学处理
所有数据计算和统计分析使用R软件(4.2.1版)进行。使用R软件的“limma”包进行表达差异分析,鉴定标准为|log
2FC|>0.5和
P<0.05。通过计算各基因间的邻接值构建出拓扑重叠矩阵进行WGCNA分析:根据软阈值利用拓扑重叠矩阵(topology overlap matrix,TOM)相似性函数将邻接值转换为具有适当功率值的TOM矩阵,进而将基因分为不同的共表达模块。设置最小模块基因数目为100,用动态树剪切法将模块剪切高度为0.2的模块合并,最终将所有基因划分为数个模块。分别计算每个模块与临床特征的相关性,挑选出相关性绝对值最大的模块作为与临床特征相关共表达模块用于进一步分析。利用R软件“GSVA”包进行基因集变异分析。采用最大团中心度(maximal clique centrality,MCC)作为Cytoscape插件的一部分来鉴定排名靠前的ceRNA网络使其可视化
[17]。本研究中统计结果
P<0.05为差异具有统计学意义。
2 结果
2.1 表达差异分析
本研究使用R软件中的“limma”包对GSE134 544数据集进行了差异表达分析,结果表明在哮喘组与对照组中共有787个表达差异基因(|log
2FC|>0.5,
P<0.05)。其中,370个基因上调,417个基因下调,火山图所示(
图1)。
2.2 哮喘相关共表达模块的识别及功能富集
针对GSE134544数据集中方差大于0.5的基因(共61个样本、7 837个基因)进行WGCNA分析。首先针对样本进行聚类分析,结果显示未识别出样本离群值(
图2A)。基于无尺度拓扑原则,当选择5作为最合适的软阈值时各基因模块的平均连接度高(
图2B、C)。利用TOM矩阵和动态树法将所有基因划分为不同的模块(
图2D)。基于Pearson相关性检验,WGCNA算法计算出各个基因共表达模块与临床特征的关联性。在所有模块中,共有3个模块与哮喘明显相关(MEmagenta:
P=0.000 6;MEblue:
P=0.004;MEbrown:
P=0.000 3,
图2E),其中以“brown”模块展示出最强的相关性和显著性(
r=0.45),该模块共包含1 142个基因(
图2F)。
随后将该模块内的基因与数据集中的表达差异基因取交集后,得到224个交集基因用于富集分析(
图3A)。利用224个交集基因的基因表达矩阵计算每个样本在不同通路中的GSVA评分,并进行差异分析。结果显示这些交集基因富集通路中共27条为差异通路,且大多为代谢相关通路。诸如:烟酸和烟酰胺代谢途径(nicotinate and nicotinamide metabolism)、药物代谢其他酶途径(drug metabolism by other enzymes pathway)、嘧啶代谢途径(pyrimidine metabolism pathway)、花生四烯酸代谢途径(arachidonic acid metabolism pathway)以及细胞色素P450介导的外源物代谢途径(metabolism of xenobiotics by cytochrome p450 pathway)等(
图3B)。
2.3 关键基因的鉴定及验证
基于功能富集结果,从MSigDB数据库下载与代谢相关通路基因,共计1 029个。将它们与224个差异基因取交集后得到7个交集基因:
CBS、
NADK、
CA4、
CDA、
PFKFB2、
DGAT2和
AKR1C3(
图4)。表达差异分析结果显示这7个基因在数据集GSE134544的哮喘患者和对照组中的表达水平都具有明显差异性(
图5A)。ROC结果显示
NADK的曲线下面积最高(AUC=0.828),提示
NADK对哮喘具有最佳的诊断价值(
图5B)。此外,在验证数据集GSE182503中,只有
CBS、
NADK和
PFKFB2在哮喘和正常对照组中的表达水平具有明显差异性,但只有
NADK在两个数据集中的表达趋势相同(
图5C)。并且ROC结果显示
NADK也对哮喘具有较好的诊断价值(
图5D)。
2.4 关键基因靶向microRNA的鉴定
3个数据库预测的microRNA取交集后共得到6个
NADK靶向的microRNA,分别是hsa‐miR‐30e‐5p、hsa‑miR‑214‑3p、hsa‑miR‑3619‑5p、hsa‐miR‐30a‐5p、hsa‑miR‑761和hsa‑miR‑30d‑5p(
图6A)。同时hsa‑miR‑30e‑5p和hsa‑miR‑214‑3p在GSE222894数据集的哮喘和对照组中的表达水平具有明显差异(
图6B),且它们与
NADK在哮喘病例中的表达趋势相反,符合内源竞争性RNA假说。
2.5 ceRNA网络构建
使用hsa‑miR‑30e‑5p和hsa‑miR‑214‑3p预测lncRNA(
图7),通过LncBase和ENCORI数据库的组合鉴定出75个lncRNA。由于lncRNAs的内源性竞争主要发生在细胞质中,故排除了62个主要位于细胞核或细胞外间隙的lncRNA,总共保留了13个lncRNA用于后续分析。最终本研究构建了由
NADK、2个microRNA和13个lncRNA组成的ceRNA网络。应用cytoHubba插件中的MCC算法识别了ceRNA网络中排名靠前的关键因子,包括NADK、hsa‑miR‑214‑3p和EPB41L4A‑AS1。
2.6 实行荧光定量PCR验证
本研究利用不同浓度的TNF‑α处理16HBE细胞后发现与未经处理的细胞相比,20 ng/mL TNF‑α处理后明显抑制了细胞活力(
图8A)。与正常对照细胞相比,用20 ng/mL TNF‑α处理16HBE细胞后IL‑1β、IL‑6表达升高(
图8B、C),且明显促进了细胞凋亡(
图8D~F)。上述实验结果说明哮喘细胞模型构建成功。随后利用实行荧光定量PCR法检测了ceRNA网络中关键因子的表达水平。结果表明与正常对照细胞相比,
NADK(
图9A)和
EPB41L‑AS1(
图9B)在哮喘细胞模型中表达水平明显升高,而
miR‑214‑3p表达水平明显降低(
图9C)。
3 讨论
哮喘是一种常见的慢性呼吸系统疾病,全球发病率很高,影响着数百万人的生活。它表现出复杂的表型和内型,每种表型都有不同的病理生理机制,需要不同的治疗方法。因此,鉴定不同内型的特异性生物标志物在哮喘的诊断和管理中非常重要。本研究基于GEO数据库通过生物信息学鉴定了与哮喘相关的关键基因NADK。同时利用多种软件、在线数据库、模型及算法构建了ceRNA网络“NADK‑hsa‑miR‑214‑3p‑EPB41L4A‑AS1”。最后利用人气道上皮细胞系构建了哮喘细胞模型,利用qRT‑PCR方法验证了ceRNA网络中关键因子的表达水平,且实验结果进一步验证了生物信息学分析结果。本研究结果有望为哮喘的早期诊断、病情监测及预后评估提供新的生物标志物。同时,网络枢纽基因或关键调控分子可能成为哮喘的潜在靶点,为制定新的治疗方案提供理论依据。
在本研究中,功能富集分析结果表明哮喘和健康对照组中表达差异基因主要富集的通路大多为代谢相关通路。而这些代谢途径在哮喘的发生、发展中起着潜在作用。一项痰液代谢组学分析揭示了与哮喘患者炎症表型相关的代谢途径包括烟酸和烟酰胺代谢、组氨酸代谢和甘油磷脂代谢途径等
[18]。本研究通过对哮喘和对照组中的差异表达基因进行富集分析发现与哮喘相关基因富集在烟酸和烟酰胺代谢途径,且具有统计学意义。这些差异基因富集的代谢通路中花生四烯酸代谢途径的紊乱也被证实在调控哮喘炎症中起着潜在作用
[19]。结合本研究富集分析结果和前人研究,本研究从在线数据库下载与代谢相关通路基因并与哮喘相关差异基因取交集,并经过验证后最终确定了与哮喘相关的枢纽基因
NADK。
NAD激酶(NADK)在细胞合成代谢过程的调节和抗氧化防御中非常重要
[20]。NADK磷酸化是可以产生NADP的机制
[21]。研究表明白细胞介素33刺激后,包括NADK在内的多种蛋白激酶磷酸化水平发生改变,可成为哮喘等免疫相关疾病的治疗靶点
[22]。在本研究中,
NADK在哮喘细胞模型中的表达水平明显高于其在正常对照人群中的表达水平。hsa‑miR‑214‑3p被报道与多种疾病有关,包括类风湿性关节炎
[23]、肝癌
[24]、帕金森病
[25]以及甲状腺状癌等
[26]。有研究发现lncRNA EPB41L4A‐AS1与其海绵分子microRNA之间的调控作用参与多种疾病,包括胃癌
[27]和胶质瘤
[28]。目前尚未有关hsa‑miR‑214‑3p和lncRNA EPB41L4A‑AS1与哮喘相关的研究被报道。本研究发现了hsa‐miR‐214‑3p、lncRNA EPB41L4A‑AS1与NADK之间的调控作用对哮喘的影响。本研究发现与正常对照细胞相比,NADK和lncRNA EPB41L‑AS1在哮喘细胞模型中表达水平明显升高,而miR‑214‑3p表达水平明显降低。根据ceRNA网络假说,本研究构建的NADK‑hsa‑miR‑214‑3p‑EPB41L4A‑AS1的调控作用可能在哮喘的发生、发展中发挥潜在作用。本研究有望为揭示哮喘发病机制的分子基础提供有价值的见解。
然而,本研究存在一定局限性。首先,样本量相对较小,可能会引入潜在的偏倚。在未来的研究工作中,加强招募工作并扩大样本量,以提高研究的整体可信度和稳健性。其次,进一步的功能验证试验是必须的,如引入RNA结合蛋白免疫沉淀、RNA测序和细胞功能等实验来进一步探索ceRNA网络之间的关系将进一步支持本研究结果。
作者贡献度说明:
黄琳惠:实验设计,实验内容统筹与规划,生物信息学分析,实验操作,数据统计分析,撰写论文;丁毅鹏、张晓宇:实验设计,实验内容统筹与规划;丁秀秀、李积威、彭国彪:实验操作与指标检测;朱轶轲、韩花桂:实验标本采集,查阅相关文献、整合资料。
所有作者声明不存在利益冲突关系。
海南省自然科学基金资助(823RC559)