基于深度随机游走与改进密度聚类的多组学异质网络整合方法

戴银飞 ,  张天悦 ,  卢世豪 ,  樊杰 ,  乔梦娇

吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1332 -1342.

PDF (1940KB)
吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1332 -1342. DOI: 10.13229/j.cnki.jdxbgxb.20251069
计算机科学与技术

基于深度随机游走与改进密度聚类的多组学异质网络整合方法

作者信息 +

A multiomics heterogeneous network integration method based on deep random walk and improved density clustering

Author information +
文章历史 +
PDF (1986K)

摘要

针对异质数据类型之间结构差异巨大,传统整合方法难以在统一框架下提取可解释特征的问题,提出了一种计算生物学导向的多组学融合方法改进算法。该算法通过将基因组、转录组和蛋白质组构建为多层异质网络,并依次引入深度随机游走特征建模、改进的迭代DBSCAN密度聚类算法与跨层关系预测模型,实现多组学网络的统一表征与关联推断。在公开的水稻-稻瘟菌互作数据上,本文构建了基因共表达关系、miRNA-mRNA调控关系和蛋白互作关系。深度随机游走模型可在4步邻域内捕获92%的层内结构特征(较Node2Vec提升14%);改进的迭代DBSCAN聚类算法在Silhouette系数和Calinski-Harabasz指数上分别提升28%与35%;异质节点关系预测AUC达到0.87,高于SNF的0.76与iCluster+的0.70。本方法可为复杂跨物种或跨组学研究提供高可解释性和可复现的计算框架。

Abstract

In response to the significant structural differences between heterogeneous data types and the difficulty of traditional integration methods in extracting interpretable features within a unified framework, this study proposes an improved computational biology oriented multi-omics fusion algorithm. By constructing a multi-layer heterogeneous network consisting of the genome, transcriptome, and proteome, and sequentially introducing deep random walk feature modeling, an improved iterative DBSCAN density clustering algorithm, and a cross layer relationship prediction model, a unified representation and association inference of multi-omics networks are achieved. Using public datasets of rice Magnaporthe oryzae interactions, we generated co-expression links, miRNA-mRNA regulatory links, and protein interactions. The deep random walk model captures 92% of local hierarchical structures within four steps, outperforming Node2Vec by 14%. The improved DBSCAN achieved 28% and 35% gains in Silhouette and Calinski-Harabasz scores, respectively. Cross-layer link prediction reached an AUC of 0.87, exceeding SNF (0.76) and iCluster+ (0.70). GO and KEGG analyses confirmed the biological validity of predicted key factors, with enriched pathways related to protein ubiquitination and endoplasmic reticulum stress response. This method provides an interpretable and reproducible computational framework for heterogeneous multi-omics integration, with broad applicability to complex biological interaction studies.

Graphical abstract

关键词

多组学整合 / 深度随机游走 / 密度聚类 / 异质网络 / 关系预测 / 计算生物学

Key words

multi-omics integration / deep random walk / density-based clustering / heterogeneous network / link prediction / computational biology

引用本文

引用格式 ▾
戴银飞,张天悦,卢世豪,樊杰,乔梦娇. 基于深度随机游走与改进密度聚类的多组学异质网络整合方法[J]. 吉林大学学报(工学版), 2026, 56(5): 1332-1342 DOI:10.13229/j.cnki.jdxbgxb.20251069

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

随着高通量测序技术的快速发展,生命科学研究已全面进入多组学时代1。基因组学、转录组学、蛋白质组学等多维度数据的积累,为系统解析生物过程的复杂调控机制2提供了前所未有的机遇。然而,多组学数据整合3面临严峻挑战:不同组学层在数据结构、噪声分布和拓扑特征等方面存在显著差异。例如,基因表达数据通常呈现连续值分布4,miRNA-mRNA调控网络具有方向性和稀疏性5,而蛋白质互作网络则表现出高聚类系数和小世界特性6。这种结构性差异使跨组学信息难以在统一数学空间中进行有效融合。

现有多组学整合方法可归为3类,但各自存在明显短板。基于矩阵分解的模型(如iCluster+[7])虽然能通过联合分解不同组学矩阵获取共享潜变量,但对生物分子网络的拓扑结构利用不足,难以捕获局部邻域特征。基于图融合的方法(如相似性网络融合SNF8)通过迭代传播实现多网络融合,但其基于统一相似度度量的策略难以适应结构迥异的异质组学数据。深度学习方法(如MOGONET)利用图卷积网络学习跨组学表示,但对数据规模和标签质量依赖性较高,且模型可解释性有限。由于上述方法均未充分考虑多组学数据的异质拓扑特性与跨层语义鸿沟,但在基因-miRNA-蛋白质等异构网络场景中的性能显著下降。

针对上述挑战,本文提出一种创新的多组学异质网络整合计算框架,其方法学贡献主要体现在3个层面:理论框架层面,本文建立了异质网络表示学习的统一形式化模型。通过定义类型感知的随机游走策略9,解决了跨组学层节点语义对齐的基础性问题。该模型将异质网络表示为有向类型图G=(VEφψ):节点集合V涵盖基因、miRNA和蛋白质三类生物分子实体,并携带对应组学层的高维特征;边集合E包含层内的共表达、物理互作关系以及层间的调控与对应关系;ψVA将每个节点映射至其组学来源类型(A={mRNA,miRNA,protein});ψER则将每条边映射至具体的关系类型(R={co-expression,regulation,interaction,cross-layer mapping})。该模型通过明确定义节点与边的异质性,为多组学数据提供了精确的数学基础与统一表示空间,从而解决了跨组学层节点语义对齐的基础性问题。算法创新层面,本文提出了包括多项核心技术突破:设计深度随机游走特征建模机制,通过引入层类型感知的转移概率控制策略,在保持层内拓扑特征的同时实现跨层语义对齐;开发卷积特征增强的DBSCAN聚类算法10,利用一维卷积核进行特征表示学习,显著改善高维稀疏数据的聚类稳定性;构建异质节点关系预测模型,创新性地融合拓扑相似性、簇结构一致性和嵌入距离等多源信息,突破了对大量标注数据的依赖。理论价值层面:①建立了异质网络表示学习的形式化框架;②提出了适应生物数据特性的新型机器学习算法;③发展了多组学数据整合的方法学基础。

通过将计算方法创新与生物学问题深度融合,本文为突破多组学数据整合的瓶颈问题提供了新的技术路径,对推动计算生物学领域的发展具有重要理论意义和方法学价值。

1 材料与方法

本文提出了一种面向多组学异质网络整合的计算方法,该方法的核心在于将结构各异的基因组、转录组与蛋白质组数据映射为统一的多层异质网络,进而通过一系列创新的算法步骤,实现跨组学特征的统一表征与关联关系推断。方法的整体流程如图1所示,主要包括数据预处理与网络构建、深度随机游走特征建模、卷积增强的密度聚类12以及异质节点关系预测四个核心模块。

1.1 数据来源与预处理

实验数据来源于公开的水稻(Oryza sativa)与稻瘟菌(Magnaporthe oryzae)互作研究。为构建多层异质网络,本文整合了以下3类组学数据。

基因组数据:从GEO数据库获取基因表达数据(GSE95394),涵盖感染前后多个时间点(12 h, 24 h, 48 h, 72 h)的样本。采用R语言生态进行质量评估与标准化,使用DESeq213进行差异表达分析,得到基因表达矩阵 E

转录组数据:miRNA测序数据(GSE43277)经过质控、去接头和比对后,利用TargetFinder、psRNATarget等工具预测稻瘟菌miRNA与水稻mRNA的靶向关系14。对不同预测工具的结果取交集,并依据期望值(Expectation)计算调控关系权重:Weight_edge=1/Expectation,以确保高置信度互作获得更高权重。

蛋白质组数据:从STRING和BioGRID数据库获取蛋白质互作信息。筛选置信度≥0.7的互作对,并进行归一化处理,将权重映射至[0,1]区间15。所有分子标识符(基因、蛋白)均通过RAP-DB、MSU7和UniProt数据库进行统一对齐,确保跨组学层实体映射的一致性。

1.2 多层异质网络构建

基于预处理后的数据,本文构建了一个包含3种节点类型(基因、miRNA、蛋白质)和3种边类型(共表达、调控、互作)的异质网络16

基因共表达网络:以基因为节点,计算其表达谱间的Spearman相关系数,保留|ρ|>0.6的显著关联作为边,并将相关系数线性映射至[0,1]作为边权。

miRNA-mRNA调控网络:构建二分图,节点为稻瘟菌miRNA和水稻mRNA,边权为前述计算的标准化调控强度。

蛋白质互作网络:节点为水稻和稻瘟菌蛋白质,边权为归一化后的数据库置信度。

跨层连接:WGCNA作为基于多样本表达数据构建基因共表达模块的基础分析方法。该算法根据感染前后表达模式差异对强相关基因进行聚类,将簇模块与生物表型性状联系起来。WGCNA的一个关键假设是基因遵循无尺度分布,即网络中少数节点的连接性高于一般节点。这一网络特性使算法能基于权重值建立功能相关节点的集群,有效捕捉基因组层面的共表达关系。WGCNA通过实体对齐建立跨层连接,例如,通过基因与蛋白质的ID映射建立基因节点与蛋白节点间的对应关系17

1.3 深度随机游走特征建模

本文所提“深度随机游走”(Deep random walk,DRW)与经典DeepWalk算法18在概念上存在本质区别:经典DeepWalk的“深度”源于其借鉴深度学习中的Skip-gram模型进行节点嵌入,而本文DRW的“深度”则特指3个层面——网络结构的深度,即游走运行于包含基因、miRNA、蛋白质的多层异质网络之上,需穿透不同组学层以捕获层内拓扑与跨层语义双重信息,而非局限于单一同构网络;游走策略的深度,即区别于Node2Vec仅通过超参数控制游走倾向的做法,DRW引入层类型权重矩阵 Φ,使转移概率能根据生物学先验知识对不同层间跳转施加差异化偏好(如强化miRNA→mRNA的跨物种调控连接),引导游走路经聚焦于生物意义明确的深层关联模式;特征建模的深度,即DRW生成的路径序列不仅编码节点ID,更融合节点特征(如表达量)与边权(如互作置信度),使得后续学习到的嵌入向量能反映多层异质网络中的深层拓扑与语义特征。以下详述DRW的算法设计与执行流程。在完成多层异质网络构建的基础上,本文设计了一个3阶段的分析流程(图2),以解决异质网络整合的核心挑战:跨层特征对齐与高维稀疏关系推断。首先,通过深度随机游走(DRW)提取并对齐不同组学层的节点特征;其次,利用卷积特征增强的DBSCAN聚类对高维特征进行去噪与功能模块识别1920;最后,构建一个融合多源信息的评分函数,实现跨层生物关系的精准预测21

首先,为解决异质网络中节点语义与拓扑结构差异大的挑战,本文提出了深度随机游走模型进行特征学习。本文深度随机游走算法的性能评估重点在于其在多组学网络中捕捉分层特征的能力,同时保持计算效率。该算法基于对生物共表达网络的实证分析,采用了严格筛选的参数,采用4步的步长,既能最佳地捕捉有意义的生物关系,又保持计算效率。与传统方法不同,DRW在转移概率中引入了层类型惩罚因子,以引导游走路径更倾向于生物意义明确的跨层跳转。

给定节点v,其层类型记为Lv),到其邻居u的转移概率定义为:

P(vu)=Wv,uΦ(L(v),L(u))u'N(v)wv,u'Φ(L(v),L(u'))

式中:Wv,u为边权;u'为遍历Nv)中的每一个邻居节点;Φ为层类型权重矩阵,用于提升如miRNA→mRNA等关键跨层跳转的概率,同时抑制可能引入噪声的连接(如直接连接不相干的基因与蛋白)。

每个节点生成50条长度为20的随机游走序列,形成一个富含跨层结构信息的“路径语料库”。随后,采用Skip-gram模型学习节点的128维向量表示 Z

为进一步消除不同组学层间的分布差异2223,本文采用最大均值差异(Maximum mean discrepancy,MMD)损失对嵌入向量进行后处理对齐,得到对齐后的特征矩阵Z',作为下游分析的统一表征。

1.4 建模卷积特征增强的DBSCAN聚类

为解决异质网络中节点语义与拓扑结构差异大的挑战,本文提出了深度随机游走模型。与传统方法不同,DRW在转移概率中引入了层类型权重矩阵 Φ,以引导游走路径更倾向于生物意义明确的跨层跳转。该矩阵基于生物学先验知识进行赋值,例如:设定 Φ (miRNA,mRNA)=1.5以强化对跨物种调控关系的关注,设定 Φ (Gene,Protein)=0.7以保留同物种内的功能关联,而将可能引入噪声的非直接关联(如Gene与miRNA)的权重设为默认值1.0。

高维嵌入特征Z' 仍存在噪声与稀疏性问题。为提升聚类效果,本文引入一维卷积神经网络进行特征增强。具体地,使用大小为5、通道数为32的卷积核对特征进行平滑处理,再经过步长为1的最大池化层,将特征维度压缩至64维。此操作能有效捕获局部特征模式并抑制噪声。

本文聚类框架的一个关键方面在于系统地确定最优聚类数量(K)。选择K显著影响计算效率和生物学解释性。本文提出了一个3层次的K值优化假设框架。

二元分离假说H₁:交互空间可初步二分为C₁经过验证的相互作用(实验验证);C₂潜在/未知关系;K=2(基线分析);损失最小化假说:H₂:最优K在防止过拟合的同时最小化簇内方差:

Loss(k)=i=1kxjCi||xj-μi||2+λK

式中:xj为特征向量;μi表示簇质心;λ控制复杂性惩罚。

生物多样性假说H₃:K必须容纳已知的相互作用多样性,K≥∑label_true+1。其中:label_true为不同验证交互类型的数量;+1为考虑潜在的新交互模式。

在提出假设后,本文进行了系统性实验验证。在K=2的初步测试中揭示了二元聚类的显著局限:经过验证的交互链路大致均匀分布在两个大型聚类之间,表明简单的二元分类无法捕捉异构网络关系的固有复杂性。这一观察支持了本文的假设:生物相互作用具有内在的多样性,无法用二元分类充分表述。

为了确定最佳K值,本文根据第二个假设进行了迭代分析。如图3所示,本文绘制了从每个点到其对应簇中心在不同K值上的距离之和。分析显示,当K接近10时,出现一个明显的拐点,代表了额外的聚类在解释数据方差时递减收益的过渡点。这一拐点表明了聚类粒度与模型复杂度之间的最佳权衡。

在此基础上,采用改进的DBSCAN算法进行密度聚类。为解决传统DBSCAN算法在处理密度不均匀数据集时效果不佳的问题,本文设计了新的ε计算策略。

在初始预聚类阶段,确定初始ε参数时,使用k-距离图。具体做法是:给定一个k值(计算所得K=10),数据集中每个点p计算其到第k个最近邻的距离(即k-距离),然后将所有点的k-距离按升序排序并绘制折线图,图中拐点(斜率突然增加的点)对应的距离值通常可以作为初始ε的一个良好估计。在得到初始聚类结果后,需要评估每个簇的密度。一个简单有效的方法是计算簇内所有点的平均k-距离的平均值。这个值越小,表明该簇的整体密度越高。通过比较不同簇的簇密度,就可以识别出哪些是“过高密度”簇,哪些是“过低密度”簇。

对于高密度簇,即增大该簇的ε,使其能吸纳更多点或内部更连通,从而降低密度。对于低密度簇,即减小该簇的ε,使其分裂成更紧凑的子簇,从而提高局部密度。在迭代过程中或最终评估时,可以使用轮廓系数衡量整体聚类效果:

εnew=εold+α(Densityglobal-1|C|pCdistak(p))

式中:distak(p)为对于任意节点pk-最近平均距离;C为节点簇;α=1.5为学习率或调节因子,用于控制调整的步长,防止一次调整过大导致震荡。

该策略能根据数据局部密度动态调整邻域半径,使聚类在稠密与稀疏区域均保持稳定。改进的DBSCAN算法能有效识别功能一致的分子模块,并为后续关系预测提供结构信息。

1.5 异质节点关系预测模型

本文构建了一个综合性的评分函数预测跨层节点间(如miRNA-mRNA、基因-蛋白)的潜在关系24。该函数融合了3类信息:①嵌入相似度:基于对齐后特征Z'的余弦距离;②簇结构一致性:衡量两节点是否属于同一聚类模块或其模块间的距离;③局部拓扑相似性:结合Jaccard系数与PathSim计算拓扑结构的相似性。

关系评分函数定义为:

S(i,j)=λ1cos(Zi',Zj')+λ2Clust(i,j)+λ3Top(i,j)

权重参数λ₁、λ₂、λ₃采用网格搜索策略在验证集上联合优化。搜索范围设定为λ₁∈{0.1,0.2,…,0.9},λ₂与λ₃以0.05为步长在[0,1-λ₁]区间内遍历,且满足λ₁+λ₂+λ₃=1。以五折交叉验证下的平均AUC为评价准则,最终确定最优组合为λ=(0.5,0.3,0.2)。训练时,正样本由已知的生物学互作关系构成,负样本则采用随机负采样并结合度匹配(Degree-based Filtering)策略生成,以减少偏差。最终的关系预测采用逻辑回归模型,并通过五折交叉验证评估性能,如图4所示。

1.6 算法复杂度分析

以下对本文框架的3个核心模块分别进行时间复杂度与空间复杂度的理论分析,并讨论在大规模多组学网络场景下的可扩展性。

给定异质网络G=(VE),设节点数为n=V,边数为m=∣E∣,嵌入维度为d,每个节点生成的游走序列数为r,游走长度为l

深度随机游走模块。转移概率计算中,层类型权重矩阵 Φ 的查表操作为常数时间Ol),边权Wvu​为预计算值,因此单步游走的采样时间为O(1),单条游走序列生成时间为Ol)。全部r×n条序列的总生成时间为Or×l×n)。Skip-gram嵌入训练采用负采样策略,设负采样数为k,每个节点-上下文对的计算复杂度为Od×k),总训练复杂度为Or×l×n×d×k)。该模块的空间复杂度由嵌入矩阵 Z ∈ℝn×d主导,为On×d)。

改进DBSCAN聚类模块。一维卷积特征增强阶段,对n个节点的d维特征进行卷积核大小为f的平滑操作,复杂度为On×d×f),池化后维度压缩至d′,复杂度可记为On×d)。DBSCAN聚类在KD树索引下的平均时间复杂度为On×logn),最坏情况为On2)。自适应ε迭代调整需在每次迭代后重新计算各簇的局部密度与全局参考密度,设迭代收敛次数为T(实验中T通常不超过10次),则该阶段复杂度为OT×nlogn)。聚类模块总时间复杂度为On×d+T×nlogn)。该模块的空间复杂度主要包括特征矩阵与邻域索引结构,为On×d)。

异质节点关系预测模块。评分函数中,嵌入相似度(余弦距离)计算为Od);簇结构一致性基于预聚类结果的查表操作为Ol);局部拓扑相似性包含Jaccard系数与PathSim计算,Jaccard系数计算两节点邻域交集,复杂度为节点度数的线性函数,PathSim基于元路径实例计数,最坏情况下为On2),但本文限定元路径长度不超过4且仅对候选节点对进行计算。设实际计算中候选节点对数量为p(通常pn2),平均节i点度数为D,则该模块总时间复杂度为Op×(d+D))。逻辑回归分类器的训练复杂度为Op×d),可忽略。空间复杂度为候选对评分矩阵的存储Op)。

总体复杂度。综合以上3部分,本文框架的总体时间复杂度如下所示:

O(rlndk)+O(nd+Tnlogn)+O(pd)

空间复杂度如下所示:

O(nd+m+p)

上述分析表明,本框架的核心计算瓶颈在于深度随机游走的嵌入训练阶段,其复杂度与节点数n呈线性关系,与嵌入维度d和游走参数rl呈乘积关系。在本文实验数据(n=8 004,m=27488,d=128,r=50,l=20)下,深度随机游走耗时156 s,总耗时约196 s。当网络规模扩展至数万节点量级时,可通过并行化游走序列生成(各节点游走独立)、Mini-batch Skip-gram训练以及GPU加速嵌入学习等手段实现线性扩展;当节点数达到数十万量级时,可采用层次化聚类策略或锚点采样方法降低DBSCAN算法的邻域查询开销。因此,本框架在常规计算资源下具备处理大规模多组学网络的能力。

2 结 果

为验证本文提出的多组学异质网络整合方法的有效性,在公开的水稻-稻瘟菌互作数据集上进行系统评估。评估内容涵盖关键因子识别、网络分析、算法性能比较和生物意义验证等多个方面。

2.1 关键因子识别结果

通过多组学整合与网络预测,本文共识别出265个显著的异质节点连接,涉及54个稻瘟菌miRNA、113个水稻靶向mRNA、22个稻瘟菌蛋白、154个水稻蛋白以及4个水稻基因。采用双标准筛选策略(基于miRNA感染前后差异表达水平与蛋白互作权重排名前50%的节点),最终确定54个稻瘟菌miRNA、85个水稻mRNA、6个稻瘟菌蛋白及136个水稻蛋白为核心关键因子。这些因子在各自组学层及整合网络中均表现出重要性,为后续通路分析提供依据。

2.2 网络分析结果

多层网络构建结果如表1所示。本文的筛选过程识别出基因共表达网络中9,705对显著的相互作用对。网络可视化利用节点大小表示感染期间表达水平的差异,色彩渐变表示表达变化。上调的基因以红色表示,下调的基因以蓝色表示,直观地展示了宿主-病原体相互作用中的表达模式。转录组层展示了M.oryzae miRNA与稻mRNA之间的复杂相互作用。在应用严格的过滤标准后,保留了381条高置信度相互作用。网络可视化将M.oryzae miRNA表示为圆形节点,稻mRNA为三角形节点,边缘厚度对应相互作用权重,有效捕捉分子结合强度。本文通过String数据库在蛋白质组层中观察到广泛的蛋白质-蛋白质相互作用。稻米蛋白网络由662个节点组成,参与11 430次相互作用,而M.oryzae蛋白网络由102个节点组成,参与679次相互作用。这一全面的蛋白质相互作用网络为感染过程的分子机制提供了关键见解。异质网络整合后生成265个跨层连接,形成统一的多组学互作图谱。

2.3 深度随机游走算法评估

性能评估聚焦于两个关键方面:特征提取的准确性和计算效率。深度随机游走算法在特征提取准确性方面显著优于传统方法。如表2所示,本文方法在特征提取准确率上达到92%,较Node2Vec(78.3%)和基础DeepWalk(83.5%)提升显著。链接预测任务的AUC-ROC值为0.87,高于对比方法。算法时间复杂度为O(|V|dk),在处理8 004个节点、27 488条边的网络时仅需156 s,体现高效性。

随机游走路径特征融合了节点权重(如表达量)与边权(互作置信度),生成维度为2k-1的特征向量(k为游走长度)。通过跨层对齐策略,算法成功识别31%的新型互作关系,并经实验验证。算法时间复杂度为O(|V|dk)。如表2所示,在处理包含8 004个节点和27 488条边的网络时,本方法在特征提取和总耗时上均显著优于对比算法,体现了其高效性,为处理更大规模生物网络提供了可能。

与DBSCAN聚类模块的集成展现了特殊的协同效应,本文深度随机游走算法提取的高质量特征,使异构节点关系预测相比传统聚类方法(传统DBSCAN、HDBSCAN、分区聚类、分层聚类)提升了45%。

2.4 改进DBSCAN聚类评估

基于卷积特征提取的改进DBSCAN算法在聚类质量上显著提升。为评估模型稳健性,本文分析了深度随机游走长度L和DBSCAN近邻数k对性能的影响。结果表明,当L在15和25之间时,链接预测的AUC值保持在0.85以上,性能稳定。当k在8和12的范围内,聚类轮廓系数变化平缓(波动<5%)。这验证了本文选择L=20和k=10的合理性,表明方法对参数波动不敏感,具有较好的鲁棒性。通过三层次K值优化假设(二分分离、损失最小化与生物多样性假设),确定最优聚类数K=10(见图5)。如图6所示,本文方法在Silhouette系数与Calinski-Harabasz指数上分别较传统DBSCAN和HDBSCAN提升28%与35%,有效缓解高维数据噪声影响。

聚类过程中,卷积核(大小5)对游走特征进行平滑处理,输出特征H直接对应生物实体(如基因簇),支持后续富集分析。密度估计函数引入自适应带宽参数σ,实验结果显示,该模型在4步邻域内可捕获92%的层内结构特征,表明其具有优异的局部特征捕获能力。

2.5 关键因子的生物意义验证

通过GO与KEGG富集分析验证关键因子的生物功能。GO分析显示,水稻关键因子主要参与细胞过程、代谢过程、小分子结合等分子功能,以及细胞内细胞器等位置;稻瘟菌关键因子则靶向水稻的刺激响应与磷酸化过程,如丝氨酸/苏氨酸激酶活性等。

KEGG通路分析表明关键因子显著富集于mRNA监视通路、氨基酸生物合成、蛋白质泛素化(p<0.001)和内质网应激响应(p<0.01)等途径。其中泛素化通路因子富集度最高,揭示其在稻瘟菌侵染中的核心作用。

GO/KEGG富集分析结果显示,预测的关键因子显著富集于已知的胁迫响应通路(p<0.01),这为本方法在生物机制推断方面的有效性提供了支持性证据。

2.6 与现有多组学整合方法比较

本文方法与iCluster+、SNF及MOGONET的比较结果如表3所示。本文方法精确率为0.87,召回率为0.83,F1得分为0.85。这一表现显著优于现有方法,与传统方法相比,精确率提升了15%~20%,召回率提升了12%~15%。高F1得分(0.85)表明精准度与召回性在准确性之间达到了良好平衡,这对于可靠识别植物-病原体相互作用中的关键分子因素至关重要。次优方法是MOGONET,精准率为0.81,召回率为0.77,F1评分为0.79,其次是SNF(精确率0.75,召回率0.71,F1评分:0.73)和iCluster+(精确率0.72,召回率0.68,F1评分:0.70)。虽然这些方法在多种多组学集成任务中取得了成功,但在植物与病原体相互作用的特定情境下,其表现仍不及本文专业化的方法。结果表明本文方法在异质网络整合中的优势。

3 讨论与结论

3.1 方法创新性讨论

本文的核心创新在于提出了一个计算生物学导向的多组学异质网络整合框架,通过深度随机游走特征建模、卷积增强的DBSCAN聚类以及异质节点关系预测模型,解决了传统方法在异质数据类型整合中的3大挑战:结构差异大、特征对齐困难以及可解释性不足。以下从技术层面详细分析创新点。

3.1.1 深度随机游走中的层类型惩罚因子机制

传统随机游走方法(如Node2Vec)主要关注同构网络,难以处理异质网络中的语义差异。本文在转移概率中引入层类型权重矩阵 Φ,例如设定 Φ (miRNA,mRNA)=1.5以强化跨物种调控关系, Φ (Gene,Protein)=0.7以保留同物种功能关联。这种设计基于生物学先验知识,使游走路径更倾向于生物意义明确的跨层跳转,从而在特征提取阶段实现跨组学语义对齐。式(1)中的权重调整不仅提升了局部拓扑特征的捕获能力(4步邻域内捕获92%层内结构特征),还减少了噪声引入,较Node2Vec提升14%。深度随机游走通过路径编码动态捕捉局部网络结构,生成的特征向量融合了节点权重(如表达量)和边权(互作置信度),为下游分析提供了高保真度的统一表征。

3.1.2 卷积特征增强与自适应DBSCAN聚类的协同优化

高维嵌入特征常存在噪声和稀疏性问题,本研究创新性地将一维卷积神经网络(卷积核大小5,通道数32)应用于特征平滑处理,通过最大池化压缩特征维度至64维,有效捕获局部模式并抑制噪声。改进的DBSCAN算法采用自适应ε估计策略(),通过迭代式参数动态调整邻域半径,解决了传统DBSCAN算法在处理密度不均匀数据集时效果不佳的问题。聚类过程中,通过3层次K值优化假设(二分分离、损失最小化和生物多样性假设),确定最优聚类数K=10,使轮廓系数和Calinski-Harabasz指数分别提升28%、35%。卷积输出特征直接对应生物实体(如基因簇),支持功能模块识别。这种设计提升了聚类鲁棒性,并为关系预测提供了稳定的结构信息。

3.1.3 异质节点关系预测模型的多源信息融合:关系评分函数(式4)融合了嵌入相似度、簇结构一致性和局部拓扑相似性三类信息,权重参数通过网格搜索优化(λ=(0.5,0.3,0.2))。与传统方法依赖大量标注数据不同,本模型采用随机负采样结合度匹配策略生成负样本,减少了偏差。这使跨层关系预测AUC达到0.87,显著优于SNF(0.76)和iCluster+(0.70)。该模型不仅突破了同构网络限制,还提供了高可解释性的预测结果,如关键因子在生物通路中的富集验证。与现有方法(如iCluster+、SNF和MOGONET)相比,本方法在理论框架、算法设计和生物可解释性上均实现了突破。例如,MOGONET虽利用图卷积网络,但对数据规模和标签质量依赖性强;而本方法通过无监督/弱监督学习范式,降低了标注需求,更适用于生物大数据场景。

3.2 结果意义分析

实验结果从多个维度验证了本方法的有效性和生物意义,以下结合数据深入分析。

关键因子识别与网络构建的生物学价值:通过多组学整合,本研究识别出265个显著的异质节点连接,包括54个稻瘟菌miRNA、113个水稻mRNA等核心因子。这些因子在基因共表达网络、miRNA-mRNA调控网络和蛋白互作网络中均表现出重要性。网络可视化中,节点大小和颜色编码(如红色表示上调基因)直观展示了宿主-病原体互作中的表达模式,例如稻瘟菌侵染早期基因表达变化显著。

算法性能优势的计算与生物验证:深度随机游走模型在特征提取准确率(92%)和计算效率(156 s)上均优于对比方法,其关键在于游走路径融合了生物权重(如表达量),避免了纯拓扑分析的偏见。改进DBSCAN算法的聚类质量提升进一步验证了卷积增强特征对高维噪声的适应性,例如在K=10时轮廓系数最优,表明聚类粒度与生物多样性匹配。

生物通路富集分析的可解释性:GO和KEGG分析显示,关键因子显著富集于mRNA监视通路、蛋白质泛素化(p<0.001)和内质网应激响应(p<0.01)等途径,这与已知的稻瘟菌侵染机制一致(如泛素化通路在病原体效应蛋白递送中的作用)。例如,水稻关键因子参与细胞代谢过程,稻瘟菌因子靶向刺激响应通路,表明方法能自动捕获生物胁迫相关信号。这种富集结果不仅验证了预测关系的生物可信度,还揭示了潜在的新机制,如内质网应激在侵染后期的角色。

与现有方法的比较意义:本方法在精确率(0.87)、召回率(0.83)和F1得分(0.85)上均领先,其优势源于异质网络专属设计。例如,SNF基于统一相似度度量,难以适应结构迥异的组学数据;而本方法通过类型感知随机游走,实现了跨层语义对齐。这为复杂生物系统(如跨物种互作)研究提供了更可靠的计算工具。

3.3 局限性及未来工作

本方法的局限性主要体现在3方面:①miRNA筛选阈值偏严格,可能导致弱信号调控关系遗漏;②跨物种组学关系数据完整性不足,限制了更深层次互作网络构建;③关系预测模型对负样本采样策略敏感。未来工作将聚焦于引入多源先验知识库(如PHI-base)优化网络构建,开发半监督学习框架减少对标注数据的依赖,并将方法扩展至小麦锈病、玉米霉病等作物病害体系,验证其普适性。

综上所述,本文提出的多组学异质网络整合方法通过创新性的特征学习与聚类策略,实现了跨组学数据的可解释融合。方法在精度、鲁棒性与生物可解释性上均优于现有技术,为复杂生物系统的多尺度机制解析提供了可靠的计算框架。

参考文献

[1]

江海平, 高纯纯, 刘文豪, . 数据驱动的生命科学研究进展[J]. 中国科学院院刊, 2024, 39(5): 862-871.

[2]

Jiang Hai-ping, Gao Chun-chun, Liu Wen-hao, et al. Progress in life science research driven by data[J]. Bulletin of the Chinese Academy of Sciences, 2024, 39(5): 862-871.

[3]

华夏. 全细胞催化氧化生物质醇/醛的过程强化及调控机制[D]. 南京: 南京林业大学化学工程学院, 2024.

[4]

Hua Xia. Process intensification and regulation mechanism of whole-cell catalytic oxidation of biomass alcohols/aldehydes[D]. Nanjing: College of Chemical Engineering, Nanjing Forestry University, 2024.

[5]

师瑶, 段贸腾, 刘丙强, . 图Transformer模型在多组学数据整合分析中的应用[J]. 数学建模及其应用, 2025, 14(2): 1-8.

[6]

Shi Yao, Duan Mao-teng, Liu Bing-qiang, et al. Application of graph transformer models in multi-omics data integration analysis[J]. Mathematical Modeling and Its Applications, 2025, 14(2): 1-8.

[7]

胡雅丽, 程晨阳, 郭颖婕. 融合图注意力与自编码器的单细胞分类方法[J/OL]. [2025-11-22].

[8]

Hu Ya-li, Cheng Chen-yang, Guo Ying-jie. A single-cell classification method fusing graph attention and autoencoder[J/OL]. [2025-11-22].

[9]

耿杰, 侯传东, 陈浩然, . 血友病A miRNA-mRNA调控网络构建及靶向治疗药物预测[J]. 郑州大学学报: 医学版, 2025, 60(6): 754-759.

[10]

Geng Jie, Hou Chuan-dong, Chen Hao-ran, et al. Construction of miRNA-mRNA regulatory network and prediction of targeted therapeutic drugs for hemophilia A[J]. Journal of Zhengzhou University (Medical Science Edition), 2025, 60(6): 754-759.

[11]

林欢, 曹玫华. 基于加权基因共表达网络联合蛋白质互作分析挖掘肝细胞癌的关键基因[J]. 医学理论与实践, 2025, 38(22): 3794-3800.

[12]

Lin Huan, Cao Mei-hua. Identifying key genes in hepatocellular carcinoma by weighted gene co-expression network analysis combined with protein-protein interaction analysis[J]. Journal of Medical Theory and Practice, 2025, 38(22): 3794-3800.

[13]

周巍, 刘志成. iCluster偏移成像子系统集成技术[C]∥中国地球物理2010——中国地球物理学会第二十六届年会、中国地震学会第十三次学术大会论文集, 宁波, 中国, 2010: 408.

[14]

Zhou Wei, Liu Zhi-cheng. Integration technology of iCluster migration imaging subsystem[C]∥Proceedings of the 26th Annual Meeting of the Chinese Geophysical Society & the 13th Academic Annual Meeting of the Chinese Seismological Society, Ningbo, China, 2010: 408.

[15]

张丽丽. 基于图神经网络的癌症生存分析模型研究[D]. 西安: 西安建筑科技大学理学院, 2025.

[16]

Zhang Li-li. Research on cancer survival analysis model based on graph neural network[D]. Xi'an: School of Science, Xi 'an University of Architecture and Technology, 2025.

[17]

腊志垚, 钱育蓉, 冷洪勇, . 基于随机游走的图嵌入研究综述[J]. 计算机工程与应用, 2022(13): 1-13.

[18]

Zhi-yao La, Qian Yu-rong, Leng Hong-yong, et al. Overview of research on graph embedding based on random walk[J]. Computer Engineering and Applications, 2022(13): 1-13.

[19]

朱瑜亮. 基于ST DBSCAN的航迹聚类实现[J]. 电子技术应用, 2022, 48(5): 125-128.

[20]

Zhu Yu-liang. Implementation of track clustering based on ST DBSCAN[J]. Application of Electronic Technique, 2022, 48(5): 125-128.

[21]

罗绍辉, 罗奕俊. 融合KMeans++与DBSCAN算法的工程车辆轨迹聚类研究[J]. 城市勘测, 2023(2): 27-30.

[22]

Luo Shao-hui, Luo Yi-jun. Research on engineering vehicle trajectory clustering based on KMeans++ and DBSCAN algorithm[J]. Urban Geotechnical Investigation & Surveying, 2023(2): 27-30.

[23]

盛屹涛, 郑晓璇. 基于DBSCAN聚类的基站选址与扇区角度规划研究[J]. 南通职业大学学报, 2022, 36(4): 64-68.

[24]

Sheng Yi-tao, Zheng Xiao-xuan. Research on base station site selection and sector angle planning based on DBSCAN clustering[J]. Journal of Nantong Vocational University, 2022, 36(4): 64-68.

[25]

万晓梅. 紫花苜蓿对模拟钙生境的生理生态响应特征及其适应机制研究[D]. 贵州: 贵州师范大学地理与环境科学学院, 2025.

[26]

Wan Xiao-mei. Physiological and ecological response characteristics and adaptation mechanisms of alfalfa to simulated calcium habitats[D]. Guizhou: College of Geography and Environmental Sciences, Guizhou Normal University, 2025.

[27]

王业建, 梁晓玲, 阿布来提·阿布拉, . 深度测序鉴定玉米雄穗花器官分化期响应干旱胁迫的miRNA和其靶基因[J]. 新疆农业科学, 2020, 57(8): 1373-1384.

[28]

Wang Ye-jian, Liang Xiao-ling, Abula Abulaiti, et al. Identification of drought-responsive miRNAs and their target genes during tassel floral organ differentiation in maize by deep sequencing[J]. Xinjiang Agricultural Sciences, 2020, 57(8): 1373-1384.

[29]

吴恩慧, 乔亮. 微生物宏蛋白质组——从样品处理、数据采集到数据分析[J]. 色谱, 2024, 42(7): 658-668.

[30]

Wu En-hui, Qiao Liang. Microbial metaproteomics: from sample preparation and data acquisition to data analysis[J]. Chinese Journal of Chromatography, 2024, 42(7): 658-668.

[31]

盛建华. 水稻抗稻瘟菌关键生物分子识别算法研究[D]. 长春: 吉林大学计算机科学与技术学院, 2024.

[32]

Sheng Jian-hua. Research on key biomolecular recognition algorithms for rice resistance to Magnaporthe oryzae[D]. Changchun: College of Computer Science and Technology, Jilin University, 2024.

[33]

李省. 基于异质网络的lncRNA-疾病关联预测[D]. 西安: 西安电子科技大学计算机学院, 2019.

[34]

Li Xing. Prediction of lncRNA-disease associations based on heterogeneous networks[D]. Xi'an: School of Computer Science, Xidian University, 2019.

[35]

张天悦. 基于多组学的稻瘟菌水稻互作关键因子网络构建算法研究[D]. 长春: 吉林大学计算机科学与技术学院, 2023.

[36]

Zhang Tian-yue. Research on key factor network construction algorithm for Magnaporthe oryzae-rice interaction based on multi-omics[D]. Changchun: College of Computer Science and Technology, Jilin University, 2023.

[37]

韩崔燕, 郝越, 李德勇, . 面向多元时空对象聚类分析的道路工程统筹[J]. 地理空间信息, 2024, 22(11): 49-52.

[38]

Han Cui-yan, Hao Yue, Li De-yong, et al. Road engineering coordination for multivariate spatio-temporal object clustering analysis[J]. Geospatial Information, 2024, 22(11): 49-52.

[39]

Zhang H, Zhao E, Li L, et al. GERWR: identifying the key pathogenicity-associated sRNAs of Magnaporthe oryzae infection in rice based on graph embedding and random walk with restart[J]. IEEE/ACM Transactions on Computational Biology and Bioinformatics, 2024, 21(2): 227-239.

[40]

Crandall S G, Filgueiras C, Gold K M, et al. A multi-omics approach to solving problems in plant disease ecology[J]. PLoS One, 2020, 15(8): e0237975.

[41]

Cembrowska-Lech D, Krzeminska A, Miller T, et al. An integrated multi-omics and artificial intelligence framework for advanced plant phenotyping in horticulture[J]. Biology, 2023, 12(10): 12101298.

[42]

Nijs M, De Moor B, Waelkens E. Non-negative matrix factorization for the analysis of mass spectrometry imaging data (with applications to other omics modalities)[R]. Lirias Report LIRIAS4159628, Leuven: KU Leuven, 2024.

[43]

纪开松, 马宏, 王庚润, . 基于双向长短期记忆网络的用户轨迹停留点提取[J]. 信息工程大学学报, 2021, 22(6): 641-646.

[44]

Ji Kai-song, Ma Hong, Wang Geng-run, et al. Stay point extraction from user trajectory based on bi-directional long short-term memory network[J]. Journal of Information Engineering University, 2021, 22(6): 641-646.

基金资助

国家自然科学基金面上项目(62072210)

AI Summary AI Mindmap
PDF (1940KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/