基于拓扑图编码与图卷积网络的双功能RNA识别

鲍娜 ,  马秀盼 ,  白涛 ,  李富星

延安大学学报(自然科学版) ›› 2026, Vol. 45 ›› Issue (2) : 112 -118.

PDF (2356KB)
延安大学学报(自然科学版) ›› 2026, Vol. 45 ›› Issue (2) : 112 -118. DOI: 10.13876/J.cnki.ydnse.250104
数学与计算机科学

基于拓扑图编码与图卷积网络的双功能RNA识别

作者信息 +

Dual-function RNA recognition based on topological graph encoding and graph convolutional network

Author information +
文章历史 +
PDF (2411K)

摘要

双功能RNA在基因调控和个体发育中具有蛋白质编码和非编码双重功能。针对现有识别方法假阳性率高且特征提取能力有限的问题,提出一种基于图卷积神经网络的识别方法BiF-GCN。该方法通过引入拓扑图结构增强RNA序列表征,融合序列层面特征与图结构特征,并使用图卷积网络模型进行预测。研究结果表明,BiF-GCN在多个评估指标上优于现有方法,准确率达到0.898 4,马修斯相关系数为0.799 3,F1分数为0.894 3,同时降低了假阳性率,提升了分类性能,进一步验证了序列特征与图结构特征融合的方法在双功能RNA识别任务中的有效性。

Abstract

Dual-function RNA has both protein-coding and non-coding functions during gene regulation and organismal development. In response to the problems of high false positive rate and limited feature extraction ability of existing recognition methods, a recognition method BiF-GCN based on graph convolutional neural network is proposed. This method enhances RNA sequence representation by introducing topological graph structures, combines sequence-level features with graph structural features, and uses the graph convolutional network model for prediction. Results show that BiF-GCN performed better than existing methods in several evaluation areas, achieving an accuracy of 0.898 4, Matthews correlation coefficient of 0.799 3, and F1-score of 0.894 3. It reduced the false positive rate and improved the classification performance, providing an effective approach for bifunctional RNA recognition. The study confirms that integrating sequence and graph structural features is an effective approach for identifying bifunctional RNAs.

Graphical abstract

关键词

双功能RNA / 图卷积神经网络 / 拓扑图编码

Key words

Dual-function RNA / graph convolutional neural network / topological graph encoding

引用本文

引用格式 ▾
鲍娜,马秀盼,白涛,李富星. 基于拓扑图编码与图卷积网络的双功能RNA识别[J]. 延安大学学报(自然科学版), 2026, 45(2): 112-118 DOI:10.13876/J.cnki.ydnse.250104

登录浏览全文

4963

注册一个新账户 忘记密码

双功能RNA是一类特殊的转录本,既可作为蛋白质编码的信使RNA(mRNA),又能发挥具有非编码RNA的调控功能1。例如,在某些特定条件下,部分mRNA可以在不依赖翻译的情况下调控基因表达2。此外,一些非编码RNA(ncRNA)包含小开放阅读框(ORFs),能够编码蛋白质3。长非编码RNA(lncRNA)虽然主要通过与mRNA相互作用发挥调控等非编码作用,但也可能包含可翻译为功能性蛋白质的小ORFs4。双功能RNA已在多种生物体中被发现,包括细菌、植物、动物及人类,并在增强RNA介导的调控网络复杂性中发挥着重要作用5。因此,开发高效的双功能RNA识别方法对于推动生物学研究和促进药物靶点设计具有重要意义6
随着生物信息学与高通量测序技术的发展,研究人员已通过实验手段构建了多个双功能RNA的数据库,如cncRNAdb7、NONCODE8和LNCipedia9。然而,完全依赖湿实验方法识别双功能RNA存在过程耗时、成本高昂的局限性。因此,计算预测方法逐渐发展成为一种高效且经济的方案10。现有双功能RNA预测方法主要分为机器学习方法和深度学习。例如,IRSOM211整合多源生物学数据进行监督学习,但其性能在很大程度上依赖于高质量的数据集,这一限制削弱了其全面捕捉RNA功能复杂性的能力。类似的,LncReader12是基于多头注意力方法用于双功能lncRNA识别,其往往过度预测正样本,导致假阳性率偏高,从而降低了预测准确性。
为了解决上述问题,本文提出一种基于图卷积神经网络的识别方法BiF-GCN,其核心在于将RNA序列建模为图结构数据,并构建并行多分支架构实现多层次特征融合,从而在根本上区别于现有方法。首先,BiF-GCN利用图卷积网络提取RNA的拓扑结构特征,能够有效表征残基间复杂的相互关系;其次,引入分层卷积网络与投影注意力机制,分别用于捕获局部序列模式与全局关键特征;最终,将各模块的表征结果进行融合与整合,实现对双功能RNA的精准识别。研究结果表明,BiF-GCN在测试集上的多个评价指标中表现优异,尤其在ACC、MCC和F1分数上明显优于现有方法。

1 方法与模型

1.1 模型概述

本文提出BiF-GCN模型采用并行架构,架构如图1所示。该模型主要由4个部分构成。第一部分,输入阶段将RNA序列中的碱基先被转换为特征矩阵,然后将特征矩阵分别输入到层次化卷积和投影注意力。层次化卷积通过多尺度卷积逐步提取局部至全局的特征,捕捉RNA的多层次模式;注意力机制则自适应地加权重要特征,增强对关键判别信息的感知。第二部分,基于碱基序列构建de Bruijn图13以增强结构信息的表达,de Bruijn是一个有向图G=(V,E),其中节点集V由序列中所有唯一的K-mer构成,边集E由相邻且重叠(k-1)个碱基的K-mer连接形成。然后,将de Bruijn图拓扑信息输入至图卷积模块,用于构建序列片段之间的拓扑关系。第三部分,将层次化卷积、投影注意力与图卷积进行协同融合,实现对RNA序列多源特征的联合提取。第四部分,经全连接层对提取到的特征进行学习预测,并输出预测结果。

1.2 特征提取

本研究分别从序列信息和结构信息两个维度提取双功能RNA的特征。具体如下。

1)序列特征:提取9种生物学序列特征,包括ORF长度、ORF覆盖率、K-mer频率、GC含量、Hexamer评分、Fickett评分、组成转换与分布(CTD)、等电点(pI)以及电子-离子相互作用势(EIIP)11-12。各个特征的维度分布如下:ORF长度、ORF覆盖率与GC含量均为1维;Fickett评分与pI为2维;K-mer频率为84维;Hexamer评分为4维;CTD为30维;EIIP为8维。所有序列特征共同构成一个133维的特征向量x,其公式可表示为

x=Ct(ORF,K-mer,,EIIP)

其中,Ct 代表横向拼接。

2)结构特征:基于RNA序列构建de Bruijn图13,以刻画其碱基关联与拓扑结构,并通过图嵌入方法将结构信息转化为低维向量表示。

1.3 神经网络架构模块

BiF-GCN模型架构采用多分支设计,主要由层次化卷积分支、投影注意力分支、图卷积分支以及全连接层组成。

1.3.1 层次化卷积层

为充分挖掘序列特征中的局部模式,引入卷积神经网络分支。该分支采用两层一维卷积结构,第一层卷积使用32个大小为3的卷积核,通过零填充保持序列长度不变;第二层卷积使用64个大小为3的卷积核,同样进行零填充处理。每层卷积后接激活函数和最大池化操作。这种组合保留了关键的信息,又在一定程度上实现了特征增强。卷积操作能够自动学习具有判别性的局部模式,而池化操作则是通过降采样突出主要信息并降低计算复杂度。设输入序列为xt|t=1,,L,其中,L为序列长度,卷积计算的公式如下:

zi,tj=ReLUk=02wi,kjxt+k-1+bij, j=1,2

其中,wi,kjbij分别为第j层中第i个卷积核的权重和偏置,zi,tj表示第j层第i个特征映射在位置t处的输出。随后,采用最大池化对特征进行下采样:

fCNN=pi,tj=maxzi,2t-1j,zi,2tj, j=1,2

1.3.2 投影注意力层

为了更好地捕获序列的全局重要特征,BiF-GCN引入一种基于投影的注意力机制。该机制设置注意力头数为4,隐藏层维度为64,值向量( V )维度为32。与传统的多头注意力机制不同,传统方法中查询( Q )、键( K )和值具有相同维度,且输出通过线性投影进行融合,BiF-GCN将 V 的维度与 QK 解耦,并直接将多个注意力头的输出14进行拼接。其计算公式定义如下:

Q=xWQ+bQ
K=xWK+bK
V=xWV+bV

其中,WQRdin×dk*h,WKRdin×dk*h,WVRdin×(dv*h)din表示输入特征的维度,dv表示每个注意力头的值向量维度,h表示注意力头的数量,dk表示隐藏层的大小。注意力分数的计算公式如下:

Ai,j=QiKjTdh

其中,Ai,j表示第iQ 与第jK 之间的注意力得分,dh表示每个注意力头的维度。注意力权重的计算公式如下:

αi,j=exp(Ai,j)j=1Lexp(Ai,j)

其中,exp()表示指数函数。加权求和的计算公式如下:

Ci=j=1Lαi,jVi,j

其中,Ci表示第i个样本的上下文向量,αi,j表示第i个样本在位置j的注意力权重,Vi,j表示第i个样本在位置j的数值向量。

最终输出是通过连接h个注意力头的输出获得,其公式如下所示:

fattn=Ct(C1,,Ch)

1.3.3 图卷积层

图卷积网络15通过聚合节点与其邻居的特征,能够有效捕获图数据中的结构依赖关系。在本研究中,首先将RNA序列转换为图结构,随后采用两层图卷积操作,学习其特征表示,最终利用全局注意力池化得到图级特征。

H(0)RN×din表示初始节点特征矩阵,其中,N=|V|为节点数,din为输入特征维度。在第l层图卷积中,节点特征更新公式为

H(l)=ReLUA˜Hl-1Wl-1, l=1,2

其中,A^=A+I是添加了自环的邻接矩阵,A为原始图的邻接矩阵,I为单位矩阵。A˜=D˜-1/2A˜D˜-1/2是对A^进行对称归一化后的矩阵,D˜A˜的度矩阵,W(l-1)为可学习权重矩阵15

为获得图级表示,引入基于注意力的全局池化机制:

αi=expq'hi2j=1Nexpq'hj2
fGraph=i=1Nαihi2

其中,hi(2)是节点i的表示,q是可学习参数向量,q'代表q的转置。

1.3.4 全连接层

完成多分支特征提取后,模型通过拼接分支的输出,得到融合后的特征表示:

f=Ct[fCNN;fAttn;fGraph]

为进一步对高维特征进行非线性组合与判别,BiF-GCN采用三层全连接神经网络作为分类器。并通过Sigmoid激活函数将输出映射为概率值:

h1=Dropout(ReLUW0BNf+b0)
y=σW1h1+b1

其中,W0b0W1b1为可学习参数,BN表示批归一化,σ表示Sigmoid函数。

2 实验设置

2.1 数据集

本文采用LncReader12的方法流程构建数据集。正样本来源于cncRNAdb7数据库,共获取1 358条可以翻译的ncRNA序列,采用CD-HIT-EST16以90%序列相似度去除冗余,最终保留1 280条非冗余序列。负样本从Ensembl17数据库提取,共获得58 730条有Havana注释的人类ncRNA,移除与正样本相同的序列,并以90%相似度去除内部冗余后,得到44 687条非冗余序列。将正负样本合并后,按8∶2比例随机划分训练集与测试集。为缓解训练阶段的类别不平衡问题,对负样本进行下采样,将正负样本比例调整为1∶1。

2.2 评价指标

本文采用5个评价指标,包括马修斯相关系数(Matthews Correlation Coefficient,MCC)δMCC、灵敏度(Sensitivity,Sn)δSn、特异性(Specificity,Sp)δSp、准确率(Accuracy,ACC)δACC以及F1分数(F1 score,F1)。这些指标能够综合评估预测模型的性能,同时兼顾预测效果与类别不平衡问题。

2.3 参数设置

在实验中,采用Adam优化器和二元交叉熵损失函数进行模型训练。当设置批处理大小为8、学习率为0.003 5、训练轮数为1 000时,模型性能达到最优。该模型使用PyTorch18实现,并在NVIDIA RTX 20270s GPU上运行。

3 实验结果与分析

3.1 泛化性能评估与结果

本研究在训练集上采用五折交叉验证,以评估BiF-GCN的泛化性能。将训练集随机分为5个子集,其中,4个子集用作训练,1个子集用作验证。如表1所示,五折评价指标总体稳定,表明BiF-GCN具有良好的鲁棒性与泛化能力。

3.2 与基准方法对比

为了更全面地评估BiF-GCN在双功能RNA分类任务中的性能,本文在完全一致的实验设置下,将BiF-GCN与以下5种基准方法进行对比,包括DNN19、SVM20、Random forest21、IRSOM211和LncReader12。实验结果的详细数据见表2

实验结果表明,相较于其他方法,本文所提方法在各项性能指标上均表现优良。特别是,除Sn和Sp指标外,BiF-GCN在其他关键指标上均取得了最佳结果。结果表明,BiF-GCN在Sn指标上略低于LncReader,说明单纯的多头注意力对长序列的RNA具有更强的敏感度,尽管将RNA分子序列转化为图结构来增加对长序列完整性的识别,但是BiF-GCN仍然无法完全获取长序列RNA的所有有效特征,进而影响了Sn的性能。SVM在Sp上的准确率达到99.61%的现象,主要原因是短序列更容易被SVM识别。相比其他模型,BiF-GCN能有效平衡正负样本的识别,这充分体现了其在整体预测能力和稳定性上的优势。

3.3 不同网络层输出可视化

为进一步验证多分支融合策略的有效性,本文采用t-SNE22对各独立分支的输出特征及模型最终融合特征的分布进行了可视化。通过二维散点图,呈现各分支在预测为“双功能RNA”与“非双功能RNA”的正负样本在对应输出层及最终融合层的分布,从而评估不同分支提取特征的有效性。

图2所示,融合特征后输出的正负样本在二维空间中呈现出更明显的类内聚合趋势,与其他独立分支提取的表征相比,融合后的表征在预测双功能RNA方面具有显著的优势,表明该特征融合方法能够有效提升双功能RNA的预测性能。研究表明,本文所采用的多源特征融合方法有效提升了双功能RNA的预测能力,从而验证了多特征融合策略的有效性。

3.4 不同网络层对BiF-GCN的影响

为探究各模块对性能提升的贡献,本文进行了消融实验。实验结果见表3。实验表明,层次化卷积、投影注意力与图卷积模块均能提升预测性能。移除任一模块均会导致性能下降,进一步证明了3个模块良好的协同作用。其中,层次化卷积与投影注意力模块构成了强大的基础模型,表明局部细节特征和全局特征是预测的核心。引入图卷积模块构建的BiF-GCN在Sn指标上实现了进一步提升,有效降低了假阳性率。即证明,通过图卷积将RNA序列转化为拓扑结构信息所提取的特征,为BiF-GCN提供了有效的表征特征。由此可见,BiF-GCN的并行融合架构有效融合了不同视角的序列特征表示,进一步提升了双功能RNA的性能。

3.5 不同特征对BiF-GCN的影响

为探究序列特征和图结构信息特征对模型性能的影响,本文进行了特征层面的消融实验,所得结果见表4。实验结果表明,序列特征与图特征均为BiF-GCN预测双功能RNA提供了有效支撑。移除序列特征导致模型性能全面下降,表明了序列信息是预测双功能RNA任务中重要组成部分。值得注意的是,在序列特征基础上融合图特征后,BiF-GCN在Sn指标上实现了提高,证明了长序列的图结构信息比单纯的序列信息,能提取更具有判别力的有效特征表示。

3.6 五折模型下不同曲线下面积

在五折交叉验证下,本文进一步绘制了接收者操作特征曲线下面积(ROC曲线)和精确率-召回率曲线下面积(PR曲线)。如图3所示,ROC曲线反映了真阳率与假阳率之间的权衡关系,而PR曲线则强调精确率与召回率之间的平衡性,用于衡量类别不平衡情况下的性能优劣。通过五折的AUC(图3A)和AUPR(图3B)显示,BiF-GCN在分类准确性、稳定程度等方面均表现良好。五折的ROC和PR曲线之间相差甚小,说明BiF-GCN在不同数据划分下均性能稳定,且能够有效平衡精确率与召回率。95%置信区间(95% CI)的统计分析也说明模型具有稳定性,验证了BiF-GCN在双功能RNA识别任务中的可靠性。

4 结论与展望

双功能RNA在多种调控过程中发挥着关键作用,且在特定条件下可以翻译成短肽,在药理学研究中展现出重要的应用潜力。本文提出一种新的计算框架BiF-GCN来识别双功能RNA,五折交叉验证和分析结果均表明BiF-GCN能有效地预测双功能RNA。

BiF-GCN获得较好的预测性能主要是依赖以下几个方面:第一,创新性地引入de Bruijn图对RNA序列进行拓扑建模,将序列信息转化为有顺序的结构关系表征,解决了以往方法因缺乏对RNA结构关联的显式建模而导致的性能局限;第二,通过并行将层次化卷积、投影注意力机制与图卷积网络同时进行提取特征的方法,实现了从局部到全局、从序列到结构的多层次信息融合,减少了串行带来的忽略细节特征问题,增强了分类决策的鲁棒性与准确性;第三,构建真正的多视角学习架构,用序列不同的表示形态来提取特征,使模型能够利用不同视角的特征进行学习,提高对双功能RNA的预测能力。

当然,BiF-GCN仍然存在一些缺陷,需要在未来的工作中解决。比如,图结构计算的引入增加了模型的复杂度,未来工作可通过轻量化图构建、结合RNA功能区特征等方法降低计算负担;此外,现有训练数据主要基于人类转录组,可能制约模型在其他物种中的适用性,未来可构建跨物种的双功能RNA基准数据集,以提升模型的生物学可解释性与跨物种泛化能力。

参考文献

[1]

SAMPATH KEPHRUSSI A. CncRNAs:RNAs with both coding and non-coding roles in development[J]. Development2016143(8):1234-1241.

[2]

LIU ZBAI TLIU Bet al. MulStack:An ensemble learning prediction model of multilabel mRNA subcellular localization[J]. Computers in Biology and Medicine2024175:108-289.

[3]

RANSOHOFF J DWEI YKHAVARI P A. The functions and unique features of long intergenic non-coding RNA[J]. Nature Reviews Molecular Cell Biology201819(3):143-157.

[4]

MATTICK J SAMARAL P PCARNINCI Pet al. Long non-coding RNAs:definitions,functions,challenges and recommendations[J]. Nature Reviews Molecular Cell Biology202324(6):430-447.

[5]

CHENG JLIN YXU Let al. ViRBase v3. 0:a virus and host ncRNA-associated interaction repository with increased coverage and annotation[J]. Nucleic Acids Research202250(D1):D928-D933.

[6]

O’CONNOR OMCVEIGH T P. Increasing use of artificial intelligence in genomic medicine for cancer care-the promise and potential pitfalls[J]. BJC Reports20253(1):20.

[7]

HUANG YWANG JZHAO Yet al. cncRNAdb:a manually curated resource of experimentally supported RNAs with both protein-coding and noncoding function[J]. Nucleic Acids Research202149(D1):D65-D70.

[8]

ZHAO YLI HFANG Set al. NONCODE 2016:an informative and valuable data source of long non-coding RNAs[J]. Nucleic Acids Research201644(D1):D203-D208.

[9]

VOLDERS P-JANCKAERT JVERHEGGEN Ket al. LNCipedia 5:towards a reference set of human long non-coding RNAs[J]. Nucleic acids research201947(D1):D135-D139.

[10]

ZHANG XWANG YWEI Qet al. DRBPPred-GAT:Accurate prediction of DNA-binding proteins and RNA-binding proteins based on graph multi-head attention network[J]. Knowledge-Based Systems2024285:111354.

[11]

POSTIC G,TAV C, PLATON Let al. IRSOM2:a web server for predicting bifunctional RNAs[J]. Nucleic Acids Research202351(W1):W281-W288.

[12]

LIU TZOU BHE Met al. LncReader:identification of dual functional long noncoding RNAs using a multi-head self-attention mechanism[J]. Briefings in Bioinformatics202324(1):bbac579.

[13]

LI MZHAO BYIN Ret al. GraphLncLoc:long non-coding RNA subcellular localization prediction using graph convolutional networks based on sequence to graph transformation[J]. Briefings in Bioinformatics202324(1):bbac565.

[14]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[C]//Advances in Neural Information Processing Systems. Red Hook:Curran Associates Incorporated, 2017:5998-6008.

[15]

DENG CTANG YZHANG Jet al. RNAGCN:RNA tertiary structure assessment with a graph convolutional network[J]. Chinese Physics B202231(11):118702.

[16]

LI WGODZIK A. Cd-hit:a fast program for clustering and comparing large sets of protein or nucleotide sequences[J]. Bioinformatics200622(13):1658-1659.

[17]

RUSSEL JPINILLA-REDONDO RMAYO-MUñOZ Det al. CRISPRCasTyper:automated identification,annotation,and classification of CRISPR-Cas loci[J]. The CRISPR Journal20203(6):462-469.

[18]

PASZKE AGROSS SMASSA Fet al. Pytorch:An imperative style,high-performance deep learning library[C]//Advances in Neural Information Processing Systems. Red Hook:Curran Associates Incorporated, 2019:8024-8035.

[19]

DEGENHARDT M FDEGENHARDT H FBHANDARI Y Ret al. Determining structures of RNA conformers using AFM and deep neural networks[J]. Nature2025637(8048):1234-1243.

[20]

LI Y HXU J YTAO Let al. SVM-Prot 2016:a web-server for machine learning prediction of protein functional families from sequence irrespective of similarity[J]. PLOS ONE201611(8):e0155290.

[21]

TOUW W GBAYJANOV J ROVERMARS Let al. Data mining in the life sciences with random forest:a walk in the park or lost in the jungle[J]. Briefings in Bioinformatics201314(3):315-326.

[22]

HUSNAIN MMISSEN M M SMUMTAZ Set al. Visualization of high-dimensional data by pairwise fusion matrices using t-SNE[J]. Symmetry201911(1):107.

基金资助

国家自然科学基金项目(62462062)

AI Summary AI Mindmap
PDF (2356KB)

71

访问

0

被引

详细

导航
相关文章

AI思维导图

/