融合边分类器的图对比学习算法

陈东明 ,  胡瑞国 ,  杜天琦 ,  王冬琦

东北大学学报(自然科学版) ›› 2026, Vol. 47 ›› Issue (4) : 33 -41.

PDF (1388KB)
东北大学学报(自然科学版) ›› 2026, Vol. 47 ›› Issue (4) : 33 -41. DOI: 10.12068/j.issn.1005-3026.2026.20250066
信息与控制

融合边分类器的图对比学习算法

作者信息 +

Graph Contrastive Learning Algorithm with Edge Classifier

Author information +
文章历史 +
PDF (1420K)

摘要

无监督图表示学习因无需人工标注,成为当前研究的热点方向.图对比学习通过正负样本对构建,实现结构与语义一致性的多视角建模,成为主流方法之一.针对现有异质图对比学习依赖人工元路径设计、难以灵活适应多元结构与语义的局限,本文通过边分类器动态预测边的同质或异质属性,并据此构建同质视图与异质视图,并结合双视图交叉对比学习实现结构与语义的统一建模,提升表示的判别性与鲁棒性.在5个同质图和4个异质图数据集上的实验表明,带有边分类器的图对比学习(graph contrastive learning with edge classifier,ECGCL)在同质图上性能与主流基线方法持平;在异质图上,节点分类准确率较同质方法最高提升26.3%,较异质基线方法最高提升4.8%,验证了其有效性与泛化能力.

Abstract

Unsupervised graph representation learning has become a research hotspot because it does not require manual annotation. Graph contrastive learning has become one of the mainstream methods by constructing positive and negative sample pairs to achieve multi-view modeling of structural and semantic consistency. However, existing heterogeneous graph contrastive learning methods rely on manual meta-path design and struggle to flexibly adapt to diverse structural and semantic limitations. The homogeneous or heterogeneous properties of edges were dynamically predicted through an edge classifier, based on which a homogeneous view and a heterogeneous view were constructed. By integrating cross-view contrastive learning between these dual views, unified modeling of structural and semantic information was achieved, thereby enhancing the discriminativeness and robustness of the learned representations. Experiments on five homogeneous and four heterogeneous graph datasets show that ECGCL(graph contrastive learning with edge classifier) achieves performance comparable to mainstream baselines on homogeneous graphs, and on heterogeneous graphs, it improves node classification accuracy by up to 26.3% over homogeneous methods and up to 4.8% over heterogeneous baselines, demonstrating its effectiveness and generalization ability.

Graphical abstract

关键词

图神经网络 / 对比学习 / 图表示学习 / 无监督学习

Key words

graph neural network / contrastive learning / graph representation learning / unsupervised learning

引用本文

引用格式 ▾
陈东明,胡瑞国,杜天琦,王冬琦. 融合边分类器的图对比学习算法[J]. 东北大学学报(自然科学版), 2026, 47(4): 33-41 DOI:10.12068/j.issn.1005-3026.2026.20250066

登录浏览全文

4963

注册一个新账户 忘记密码

无监督图表示学习逐渐成为当前研究的重点方向,其目标是在无需依赖标签的情况下,仍能学习到具有判别力的图结构表示.近年来兴起的图对比学习方法结合图神经网络的表达能力与自监督学习中对比机制的优势,成为无监督图表示学习领域的重要突破,在社交网络1-3、生物分子网络4-5、知识图谱6-8和推荐系统9-11中得到了广泛应用.图对比学习的核心思想是通过构造不同视图的图表示,最大化同一节点在不同视图间表示的一致性,同时最小化其与其他样本的表示相似度.
现有图对比学习方法在无监督场景下取得了令人瞩目的性能,尤其在图数据上的节点分类任务中展现出优越的表达能力与鲁棒性,但多数图对比学习方法基于同质性假设设计,这种假设认为图数据中相互连接的节点之间彼此共享相似的信息12.然而,这种方法难以直接推广至结构复杂、语义多样的异质图场景.在异质图中,节点与边通常同时具有结构异质性和语义异质性,例如,在在线交易网络中,商家更有可能与客户建立联系,而不是与其他商家建立联系;在分子网络中,蛋白质结构更可能由不同类型的氨基酸连接在一起13.这对图对比学习中的数据增强策略、正负样本构造方法以及对比目标函数均提出了更高的要求.
为了解决现有图对比学习算法中难以利用图数据中的异质性信息,导致语义偏差与鲁棒性下降的问题,本文提出了一种带有边分类器的图对比学习方法(ECGCL).该方法通过引入边分类器模块,赋予边在语义空间中的明确分类标签,引导模型识别“高语义关联”的边,进而构建更可靠的正负样本对.在采样阶段,ECGCL融合同质边与异质边的区分机制,增强对正负节点对的判别能力,并设计基于边类型敏感的三元组对比损失函数,提升模型对复杂结构中微弱同质关系的捕捉能力.此外,ECGCL还引入边界节点语义引导机制,挖掘处于类别过渡区域节点的语义关系,从而提升模型在异质图中的判别精度.为进一步评估ECGCL方法的有效性,本文在Cora、Texas等多个图数据集上进行了广泛实验,验证了所提方法在各类图场景中的建模优势与扩展能力.

1 相关工作

近年来,已有研究关注图中同质性与异质性信息的建模问题.UD-GNN14重点研究了图神经网络(graph neural network,GNN)对同质性节点具有明显偏好的问题,并提倡模型在保持高准确率的同时,尽可能降低其预测偏好,这种模型偏好凸显出当前GNN方法在异质性图结构下的适应性不足.Geom-GCN15提出在图上引入几何空间距离表示,通过构造多个图几何结构对节点间的相似性进行建模,并基于这些空间结构在GNN中选择合适的邻居进行信息传播.与传统GCN仅使用一阶邻居不同,Geom-GCN可以动态选择结构上更相似的非局部节点作为信息传递对象,有效解决了同质性假设失效时模型性能严重下降的问题.H2GCN13针对传统GNN过度依赖一阶邻居导致表达能力下降的问题,提出一种硬连接机制,通过引入高阶同类节点的表示信息,同时剔除结构相近但语义不一致的异类邻居,更好地保留图中低频与高频信号,从而实现更具鲁棒性的节点表示学习.这种方法代表了从局部感知向结构选择性非局部建模的演进趋势,强调在异质图结构中挖掘更具判别力的远程依赖关系,突破了传统图神经网络的表达瓶颈.近年来的异质图表示学习方法,如GOAL16,也在一定程度上利用了上述建模思想,将其应用于图增强视图构建与正负样本选择策略中,进一步提升了模型对结构异质性与语义异质性的适应能力.

2 带边分类器的图对比学习算法

2.1 问题定义

本文算法是为了解决节点级无监督图表示学习问题.主要目标是学习一个表示映射函数::Rn×n×Rn×dfRn×dr,函数X,A=H,其中X表示特征矩阵,A表示邻接矩阵,H的每一行代表每个节点的低维嵌入表示,即drdf.这些学习到的节点表示可以用于下游任务,例如节点分类.

同质性是许多真实网络普遍存在的现象,也就是说相互连接的节点通常属于同一类或者具有相似的特征.如图1a所示的引文网络示例,其中节点代表论文,边代表论文之间存在引用关系,一篇论文倾向于引用同一研究领域的论文,只有少量论文存在跨领域引用关系.

异质图的图结构由不同类型的节点和边构成,则该图被称为异质图,即允许图数据中具有不同属性的节点和不同类型的边.图1b所示的交易网络示例包含两种不同类型的节点:商家和顾客.图中存在两种关系类型:商家与顾客之间的关系,商家与商家之间的关系.多数相连节点具有不同属性,存在大量异质性信息,即商家倾向于与顾客相连,只有少数商家与商家直接相连.

2.2 算法框架

ECGCL模型主要由两个模块构成,如图2所示.首先,边分类器模块用于将图数据集中连接节点的边区分成带有同质性信息的同质边和带有异质性信息的异质边.其次,对比学习模块利用边分类器区分的两种类型的边将原始图数据划分成同质视图和异质视图,在两个视图上分别使用精心设计的低通滤波器和高通滤波器作为编码器进行编码,并利用两个视图中的节点以对比学习方式学习信息丰富的低维节点表示.

此外,两个模块以相互促进的方式交替进行训练,其中设计使用基于三元组损失思想的相似性损失来训练边分类器,在对比学习模块应用基于InfoNCE思想的对比损失来学习信息丰富的低维节点表示.

2.3 基于邻居采样的随机游走策略

现有无监督图表示学习中,结构编码用于增强图神经网络模型对结构感知的能力,其核心目标是为图中的每个节点生成一个能够反映其在整个图结构中所处位置的向量表示,从而弥补图神经网络仅通过局部邻域聚合所造成的结构表达能力不足的问题.现有研究获取结构编码的方式通常依赖于全局的随机游走扩散矩阵或节点对之间的相似性直接计算.然而,这种全局性方法在处理具有复杂结构的异质图时可能导致较高的计算成本和信息提取不充分的问题.在本文算法中提出一种基于邻居采样的随机游走策略(neighborhood sampling based random walk strategy,NSRW),通过结合局部邻居采样与随机游走扩散编码的策略来优化结构编码 si 的生成过程,如式(1)所示:

si=1qTjj,Tjj2,,Tjjl.

式中:对于任意节点vi,NSRW首先从其一阶邻居节点集合Nvi中随机采样q个节点作为样本,如果节点一阶邻居个数小于q,则使用有放回采样以保证采样节点数量的稳定性;其次对每个样本vjNvi,从该样本出发执行长度为l的随机游走,生成结构编码sj=Tii,Tii2,,TiilsjRl;然后以式(2)对邻居节点结构编码sj进行聚合,生成最终的结构编码.

si=1qj=1qsj.

2.4 边分类器

为了充分利用图数据中的信息,以区分图中的同质性边和异质性边,ECGCL模型构建了一个边分类器,用于学习估计每条边的同质性概率.给定两个相邻节点,它们的同构性概率主要与节点特征和结构特征有关.

为了保留原始图数据中的信息,首先将节点初始特征与计算得到的结构编码进行拼接,用于表示一个节点的语义特征与拓扑特征的联合特征,并以此作为边分类器的输入.在边分类器中,采用一个2层的多层感知机(MLP)来预测边的同质性概率.具体地,首先将节点特征xi与其结构编码si进行拼接,得到节点的中间嵌入表示,如式(3)所示:

hi=MLP1xisi,hj=MLP1xjsj.

式中:MLP1为第1层MLP;hihj是两个相邻节点vivj的中间表示;代表向量拼接.

然后对每一条边ei,j,将两个相邻节点的中间表示进行拼接,即ui,j=hihj,将拼接表示输入到第2层MLP,得到边的同质性概率:

θi,j=MLP2ui,j.

式中θi,j表示边ei,j的同质性概率.

得到θi,j后,认为θ服从0-1分布,根据θi,j可以判断边ei,j是同质性边或异质性边,如果是同质性边,则赋予其权重δi,j=1,否则δi,j=0.但这种方式导致该权重是离散的,无法有效参与训练优化过程.

为了解决这个问题,在边分类器中引入Gumbel-Max重参数化技巧,将离散的权重δi,j松弛为可导的连续权重δ^i,j

δ^i,j=Sigmoidθi,j+logξ-log1-ξτg.

式中:ξ是一个来自均匀分布的随机变量;τg是温度超参数,用于控制采样的平滑度,τg越接近0,则δ^i,j越接近边界值0或者1.将δ^i,j视为边ei,j属于同质性边的概率,并且该权重能够参与训练优化过程.

2.5 三元组损失

在ECGCL模型的边分类器模块中,基于三元组损失思想设计损失函数,以增强同质性边与异质性边的区分度.三元组损失是通过优化基准节点、正样本和负样本所构成的三元组,使得基准节点与正样本的距离在特征空间内尽可能靠近,而与负样本的距离尽可能拉远.为了区分同质性边和异质性边,在边分类器模块中使用随机采样的节点对之间的相似性作为基准,目标是使得同质性边相连的两个节点的相似性更靠近基准,而异质性边相连的两个节点间的相似性比基准节点对差异更明显.通过迭代训练优化,找到节点对之间相似与不相似的界限,以更有效地区分同质性边和异质性边.

具体而言,对于每一条边ei,j,其同质性和异质性三元组边界损失定义如式(6)所示:

Lei,j hm=maxsimvm,vn-simei,j+η,0,Lei,j ht=maxsimei,j-simvm,vn+μ,0.

式中:maxx表示只考虑x为正值的情况;simei,j=coshi,hj表示节点vivj在嵌入空间中的余弦相似性度量;simvm,vn=coshm,hn表示随机采样节点vmvn在嵌入空间中的余弦相似性度量;ημ分别是同质性和异质性三元组边界损失的边界超参数,用于控制节点对之间的相似程度.

对所有相连节点对的同质性和异质性三元组损失进行平均,可以得到图数据中的同质性和异质性平均损失,如式(7),(8)所示:

Lhm=1Δ^hmei,jEδ^i,jLei,jhm,
Lht=1Δ^htei,jE1-δ^i,jLei,jht.

式中:δ^i,j1-δ^i,j分别是同质性和异质性边权重;Δ^hmΔ^ht分别是对所有同质性边权重和异质性边权重进行求和而得到的归一化项.

最后,通过对两种损失相加,可以得到边分类器模块最小化的整体三元组边界损失:

LTM=Lhm+Lht.

2.6 对比学习模块

对比学习模块首先利用边分类器模块区分出的边权重将原始图𝒢=X,A划分成2个视图,即以δ^i,j为边权重的同质性视图𝒢hm=X,Ahm和以1-δ^i,j为边权重的异质性视图𝒢ht=X,Aht,其中对每一条边ei,jAi,jhm=δ^i,jAi,jAi,jht=1-δ^i,jAi,j.接着,用不同编码器对两种视图中的节点进行编码,得到用于对比学习的初始节点嵌入表示.然后,使用基于规则的数据增强技术增加训练数据的多样性,并将两种视图的节点嵌入表示分别使用两个投影头映射到一个统一的潜在空间.最后,使用基于InfoNCE思想设计的双视图交叉对比机制优化节点嵌入表示.

2.6.1 编码器

有研究从图信号处理的角度出发,将图上节点中的数据视为信号,利用信号处理技术来理解节点的特征.在标准信号处理问题中,高频信息通常表示节点之间在特征空间中的差异较大,而低频信息则意味着节点之间特征变换平缓.为了从两种不同视图中学习到丰富的信息表示,针对同质性视图和异质性视图分别设计图滤波神经网络(graph filter neural network,GFNN)与高通图滤波神经网络(high-pass graph filter neural network,HP-GFNN)作为编码器.

在同质性视图上节点之间是相似的,此时使用低通图滤波器沿着同质性图结构平滑节点特征.具体而言,本文提出的算法使用GFNN作为低通图滤波器,其定义如式(10)所示:

Hhm=σ(Dropout((A˜hm)kXW)).

首先将A˜ hm作用于节点特征矩阵,即X1hm=(A˜hm)kX,其中A˜ hm=D-1A hm+I代表同质性视图中加入自环后的归一化邻接矩阵,A˜ hm可以视为低通图滤波器,k代表图滤波的阶数.然后将滤波后的特征X1hm使用一层MLP进行编码,其中σ为非线性激活函数PReLUW为可训练权重矩阵.Dropout是按一定比例随机丢弃神经元,用于防止神经网络过拟合并增强模型泛化能力.

与同质视图不同,异质视图包含连接不同类型节点的边.在这种视图中,使用低通滤波对特征进行平滑聚合会混淆不同类型节点的信息,造成关键信息丢失.为了更好地利用异质性边,本文算法在异质视图中使用高通图滤波神经网络,以尽可能保留节点特征中的高频图信号.从图信号处理的角度考虑,图拉普拉斯算子已被证明可以有效捕获数据中的高频信息.所以,ECGCL模型基于GFNN设计用于对异质性视图进行高通滤波的HP-GFNN,如式(11)所示:

H ht=σ(Dropout((I-A˜ht)kXW)).

式中:I为单位矩阵;I-A˜ht表示对异质性视图进行一阶高通滤波操作.通过构造节点自身与邻居节点之间的差异化表达,HP-GFNN不再追求全局平滑性,而是强调局部结构的不一致性,这样可以更好地捕捉结构边界和类别差异等异质性信息,提升对异质视图结构的建模能力.

通过拼接针对两种视图构造的节点表示可以得到最终的节点表示,如式(12)所示:

H=HhmHhtRn×dr.

2.6.2 投影头函数

如果直接将两个视图的表示向量应用于对比学习目标函数中进行相似性计算,容易出现表示空间冲突和判别能力不足等问题,因此在ECGCL模型的对比学习模块引入投影头,使得节点表示在统一的嵌入空间中更适合进行正负样本相似性判别,实现不同视图的节点表示在嵌入空间的解耦与信息重构,从而提升对比学习的效果与鲁棒性,通过两个可学习的多层感知机分别将两个视图中的节点向量映射到具有相同维度的一个潜在空间中,分别得到视图中节点在潜在空间中的表示向量zhmzht.

z hm=fprojhmh hm=MLP hmH hm,
z ht=fprojhth ht=MLP htH ht.

式中fproj为投影头函数.

2.7 对比损失

在无监督对比学习框架中,InfoNCE(information noise contrastive estimation)损失函数是一种广泛使用的目标函数,其核心思想是通过构造正负样本对,最大化正样本对在表示空间中的相似性,并最小化负样本对的相似性.其数学形式如式(15)所示:

LInfoNCE=-logexpsimzi,zj/τck=1Kexpsimzi,zk/τc.

式中:zizj为正样本对的嵌入表示;zkk=1K表示负样本节点表示集合;sim,表示余弦相似度;τc是对比损失温度超参数.InfoNCE损失通过拉近正样本对之间的距离,推远负样本对之间的距离,迭代优化节点嵌入表示.该方法已被应用于多项无监督图表示学习算法研究,并证明其能够有效捕获结构一致性和语义相似性,从而提升无监督图表示学习的能力.

然而,InfoNCE的有效性高度依赖于正负样本划分的准确性.在图数据中,由于噪声信息、异质性信息的存在,传统InfoNCE会受到特殊信息的干扰而生成误导性的表示,尤其是在异质性信息占据主导地位的异质图中更为严重.此外,单一视图下的对比缺乏多样性,限制了对图中多频结构信息的感知能力.

针对上述问题,ECGCL模型的对比学习在InfoNCE损失的基础上,提出一种双视图交叉对比损失.其数学定义如式(16)所示:

LCon=-1nviV12NvivjNvilogexpsimzihm,zjht/τcvk{V-vi}expsimzihm,zkht/τc+logexpsimziht,zjhm/τcvk{V-vi}expsimziht,zkhm/τc.

式中:zihmziht分别为节点vi在同质性视图和异质性视图下的投影嵌入表示;Nvi=kNNvi,k是节点vi在特征空间中的前k个最近邻节点.

ECGCL模型对比学习中的正样本对并非基于图结构中的邻接边生成,而是通过节点的特征空间相似性来构造.具体来说,对每个节点vi,在其特征表示空间中使用k近邻方法,选出前k个最相似节点vjkNNvi,将其作为vi的正样本.对于每个正样本对vi,vj,利用两个视图构造两个交叉对比方向,即zihm,zihtziht,zihm.这种交叉对比的好处在于能够从两种结构视图之间的协同关系中提取稳定的节点表示一致性,同时避免由于某一视图中结构失真而导致的节点表示误差.此外,使用基于节点特征相似性的正样本选择机制而不依赖图结构,防止图结构中可能存在的错误边分类对对比学习产生影响,使得模型在异质性图数据集中更具鲁棒性.

在ECGCL模型对比损失中,使用一种全局负样本采样策略.对于每个正样本对vi,vj,以zihm为基准节点,使用图中除vi以外的其他所有节点在异质视图中的投影表示zkht作为负样本集合;同理,对另一个视图则以ziht为基准节点,图中除vi以外的其他所有节点在同质视图中的投影表示zkhm作为负样本集合.

ECGCL模型对比损失的设计本质上是一种双视图交叉对比策略,不仅保留了InfoNCE损失函数的基础机制,同时利用不同结构视图之间的互补性提升了节点表示的信息多样性与鲁棒性.更重要的是,损失函数的通过从特征空间中选取正样本,弱化结构信息中的噪声依赖,并利用两个视图之间的交叉对比,增强了模型对图中多频信号的建模能力,有效提升了无监督图表示学习在异质性图数据中的适应能力与表达能力.

表1给出了ECGCL算法训练过程的伪代码.其中,结构编码和节点的k近邻集合在初始化阶段进行计算并保存.

ECGCL算法由两部分构成.第一部分是边分类器模块,主要功能是利用节点特征与位置编码生成连接节点的边的同质性权重.第二部分是对比学习模块,首先利用第一部分得到的边同质性权重,将原始图数据划分成同质性视图和异质性视图;其次,在两个视图上分别使用GFNN与High-GFNN进行低频信息编码和高频信息编码;最后,将两个视图编码后的节点嵌入表示分别投影到统一的潜在空间中进行交叉对比学习,通过不断迭代训练优化得到最终节点表示,用于节点分类等下游任务.

3 实 验

对本文所提ECGCL算法进行实验分析,在9个真实数据集上与8种图表示学习算法进行了对比分析,还进行了消融实验和参数分析,从多方面验证所提算法的有效性.

3.1 数据集

在9个真实数据集上与近年来的相关算法进行对比实验来对ECGCL算法的有效性进行验证,实验数据集的统计信息如表2所示.

Cora,Citeseer和PubMed17是3个引文网络数据集.Co-Author CS和Co-Author Physics17是从2016年KDD杯挑战赛的Microsoft Academic Graph中提取的合著网络.Texas和Wisconsin15是大学计算机科学系的网页网络.Chameleon和Squirrel18是维基百科网络.

数据集的训练集、验证集和测试集划分情况如下:1) 对于Cora,Citeseer和PubMed数据集,遵循公共标准划分;2) Co.CS和Co.Physics数据集,按10%,10%和80%比例进行划分;3) 对于异质图数据集,采用以往研究中使用的48%,32%和20%比例进行划分.

实验中使用平均准确率(accuracy,ACC)作为评价指标来评估ECGCL算法在节点分类任务上的性能.ACC是图表示学习领域常用的评价指标之一,在节点分类任务中应用广泛.它表示模型预测正确的节点类别数量占总节点预测数量的比例,以衡量模型整体分类性能的优劣.

3.2 基线算法与实验设置

为了全面评估本文所提出的ECGCL算法,将ECGCL算法与10种图表示学习方法进行比较.根据工作的特点,这些基线方法可以分为4类:1) 常规的无监督学习方法, 如DeepWalk19和Node2Vec;2) 半监督图表示学习方法,如GCN和GAT;3) 基于对比学习的图表示学习算法,如DGI,GRACE,GCA和BGRL;4) 基于异质性信息设计的图表示学习算法,如GEOM-GCN和H2GCN15.

ECGCL在各个数据集上的设置如下:epochs取值为{300,400,600,800,1 000,1 500};GCL-epochs设置为2或3,结构编码维度设置为32,三元组损失中的边界参数ημ均设置为0.5,k近邻个数取值为{0,10,20,25,30},特征掩盖比例取值为0.5,边丢弃比例取值为0.3.统一使用Adam优化器,学习率设置为0.001,权重衰减设置为0.000 5,Gumbel-Max温度超参数τg设置为1,对比损失温度超参数τc设置为0.2,最终节点嵌入表示维度设置为128.

3.3 实验结果与分析

3.3.1 节点分类

对于所有模型,本研究在同质性和异质性数据集上针对节点分类任务进行了充分的实验,以验证所提出模型的有效性.表3表4分别记录了在具有不同固定随机种子的10次运行中同质性和异质性数据集上节点分类实验的平均准确率和标准差,其中最优值用黑体表示,次优值用下划线表示.

根据表3的数据,可以明显观察到本文提出的ECGCL算法在5个同质性数据集上的平均准确率相较于8种基于同质性数据集设计的基线算法均取得了最优结果.

根据表4的数据,可以观察到本文提出的ECGCL算法在4个异质性数据集上的平均准确率相较于8种基于同质图设计的基线算法均取得了最优结果;并且,相较于两种针对异质图设计的图表示学习算法,在Chameleon,Squirrel和Texas数据集上取得最优结果,在Wisconsin数据集上取得次优结果.

ECGCL算法用结构编码充分保留图数据的原始结构信息,避免直接使用图卷积网络对结构信息的平滑.此外,精心设计的边分类器和双视图交叉对比学习能够深入挖掘图数据中的同质性和异质性信息,这使得算法能够捕捉到丰富且明确的信息.因此,算法能够在各类数据集上取得显著优势,充分证明了其在节点分类任务中的有效性和实用性.

3.3.2 消融实验

为了验证ECGCL算法中各关键模块的有效性,通过逐一去除或替换模块,分析其对算法整体性能的影响,进而确认每个部分的必要性和贡献程度,进行消融实验.具体设计了ECGCL算法的4种变体算法并与ECGCL在同质性数据集Cora和异质性数据集Texas上进行节点分类实验,比较各种变体算法在节点分类准确率上的性能.4种变体算法为:1) 只使用一种编码器获取节点表示(ECGCL-w/o-HP-GFNN);2) 不使用边分类器模块(ECGCL-w/o-EC);3) 在边分类器中不使用设计的位置编码,而是使用图卷积网络平滑聚合获取结构信息(ECGCL-w/o-NSRW);4) 将设计的双视图交叉对比损失替换为传统InfoNCE损失(ECGCL-InfoNCE).

ECGCL及其变体在两种数据集上的实验结果如图3所示.从实验结果可以看出,完整的ECGCL算法在Cora和Texas数据集上准确率都优于其他变体.这表明ECGCL设计的各个模块和损失函数共同协作,能够在同质图和异质图上学习到具有判别性的节点表示.使用传统InfoNCE损失替代设计的双视图交叉对比损失导致性能下降,这说明双视图交叉对比损失能更有效地协同同质边和异质边之间的表示学习,而传统InfoNCE难以充分利用图结构中的异质性信息.去除边分类器模块在Cora数据集上略有下降,但在Texas数据集上下降更为明显.这表明边分类器对ECGCL算法处理异质图十分重要.只使用单一的低通滤波编码器在两种数据集上都呈现出最差或者次差的结果.这说明分别使用低通和高通图滤波作为编码器对信息进行提取,能够充分捕捉到同质和异质结构中不同频率的图信号.此外,去除NSRW位置编码,ECGCL算法在两个数据集上的准确率显著下降,说明NSRW有助于捕捉节点在图结构中的相对位置关系,提升了边分类器的判别能力.

综合来看,ECGCL算法设计的各个组件对维护算法整体性能都起到关键作用.尤其在异质图中,边分类器和高通图滤波编码器的贡献更显著,这也表明异质图中的复杂结构对算法设计有更高的要求.

4 结 论

1) 本文提出ECGCL算法解决现有异质图对比学习方法对人工设计元路径依赖的局限,设计一种基于边分类器的对比学习算法,有效提升了算法对图中多元结构和语义的适应能力.通过引入边分类器模块,算法能够在不依赖先验知识的前提下动态区分同质边与异质边,从而构建出更具辨识度的同质视图和异质视图.

2) 通过差异化的图滤波编码器与双视图交叉对比策略,使得算法能够在不同视图下提取互补信息,从而提升节点表示的判别性与鲁棒性.此外,边分类器与对比学习模块以交替协同的方式进行迭代优化,其中前者通过三元组损失感知边类型差异,后者通过双视图交叉对比在两个视图之间进行语义对齐,实现了结构解耦与语义对比的有机结合,为图表示学习提供了一种灵活的解决范式.

3) 在多个真实数据集上的实验结果显示,与现有图表示学习算法相比,本文提出的ECGCL算法展现了更高的节点分类性能.这些结果充分证明了ECGCL算法在节点分类任务上具备出色的预测性能.

参考文献

[1]

Alemany JVal E DGarcía-Fornes A. A review of privacy decision-making mechanisms in online social networks[J]. ACM Computing Surveys202255(2): 1-32.

[2]

Sharma KLee Y CNambi Set al. A survey of graph neural networks for social recommender systems[J]. ACM Computing Surveys202456(10): 1-34.

[3]

赵琳琳,吴安彪,袁野,. 位置社交网络上的图表示学习[J]. 计算机学报202245(4): 838-857.

[4]

Zhao Lin-linWu An-biaoYuan Yeet al. Graph representation learning on location-based social networks [J]. Chinese Journal of Computers202245(4): 838-857.

[5]

Fang YZhang QZhang Net al. Knowledge graph-enhanced molecular contrastive learning with functional prompt[J]. Nature Machine Intelligence20235(5): 542-553.

[6]

Zhang SHu ZSubramonian Aet al. Motif-driven contrastive learning of graph representations [EB/OL]. (2020-12-23) [2025-03-24].

[7]

Chen J YGeng Y XChen Zet al. Zero-shot and few-shot learning with knowledge graphs: a comprehensive survey[J]. Proceedings of the IEEE2023111(6): 653-685.

[8]

Yang J WXu H WMirzoyan Set al. Poisoning medical knowledge using large language models [J]. Nature Machine Intelligence20246:1156-1168.

[9]

张宇姣,徐健,吴迪.基于图表示学习的知识图谱时序推理模型[J]. 济南大学学报(自然科学版)202539(2): 272-277.

[10]

Zhang Yu-jiaoXu JianWu di. A knowledge graph temporal reasoning model based on graph representation learning [J]. Journal of University of Jinan (Science and Technology202539(2): 272-277.

[11]

Ju WQin Y FQiao Z Yet al. Kernel-based substructure exploration for next POI recommendation[C]// 2022 IEEE International Conference on Data Mining (ICDM). Orlando, 2022: 221-230.

[12]

Qin Y FJu WWu H Jet al. Learning graph ODE for continuous-time sequential recommendation[J]. IEEE Transactions on Knowledge and Data Engineering202436(7): 3224-3236.

[13]

Wu S WSun FZhang W Tet al. Graph neural networks in recommender systems: a survey[J]. ACM Computing Surveys202255: 1-37.

[14]

Hamilton W L. Graph representation learning[M]. San Rafael: Morgan & Claypool Publishers, 2020.

[15]

Zhu JYan Y JZhao L Xet al. Beyond homophily in graph neural networks: current limitations and effective designs[J]. Advances in Neural Information Processing Systems202033: 7793-7804.

[16]

Liu YAo XFeng F Let al. UD-GNN: uncertainty-aware debiased training on semi-homophilous graphs[C]// Proceedings of the 28th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. Washington, DC, 2022: 1131-1140.

[17]

Pei HWei BChang K C Cet al. Geom-GCN: geometric graph convolutional networks [EB/OL]. (2020-02-13) [2025-03-24].

[18]

Sen PNamata GBilgic Met al. Collective classification in network data[J]. AI Magazine200829(3): 93-106.

[19]

Shchur OMumme MBojchevski Aet al. Pitfalls of graph neural network evaluation [EB/OL]. (2018-11-14) [2025-03-24].

[20]

Kipf T NWelling M. Semi-supervised classification with graph convolutional networks [EB/OL]. (2016-09-09) [2025-03-24].

[21]

Perozzi BAl-Rfou RSkiena S. DeepWalk: online learning of social representations[C]// Proceedings of the 20th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. New York: ACM, 2014: 701-710.

基金资助

辽宁省重点研发计划项目(2024JH2/102400072)

辽宁省应用基础研究计划项目(2023JH2/101300185)

AI Summary AI Mindmap
PDF (1388KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/