基于邻域信息与嵌套注意力的知识图谱补全

戴宇凡 ,  熊玉洁

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 539 -548.

PDF (1234KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 539 -548. DOI: 10.14188/j.1671-8836.2024.0152
面向知识图谱和大模型的工业软件

基于邻域信息与嵌套注意力的知识图谱补全

作者信息 +

Knowledge Graph Completion Based on Neighborhood Information and Nested Attention

Author information +
文章历史 +
PDF (1263K)

摘要

随着工业系统的复杂性和智能化需求的增加,知识图谱在工业领域的应用越来越广泛。知识图谱的补全对于优化业务流程、提升决策质量和实现系统自动化具有重要意义。然而,现有的大多数补全方法在分析工业实体之间关系时,仅考虑节点本身的相似性,未能充分利用节点邻域的丰富信息,限制了对节点关系的关联推断。为解决以上问题,提出一种基于邻域信息与嵌套注意力的知识图谱补全方法。首先,获取三元组的邻域信息,进行对应的词嵌入,组合得到邻域信息表示和三元组表示;然后将获取的特征向量进行嵌套注意力编码,使结构特征得到稳定保持;最后通过内积解码器,实现对图谱缺失关系的补全。在三个数据集上进行了实验,结果显示,模型预测准确性得到提升,同时保持了较低的参数量,为知识图谱补全任务提供了一种兼顾模型规模和预测准确性的方法。

Abstract

With the increase in the complexity of industrial systems and the demand for intelligence, knowledge graphs are being increasingly applied in industrial fields. Knowledge graph completion is essential for optimizing processes, enhancing decision quality, and enabling automation. However, most current methods focus only on node similarity and overlook the rich information in node neighborhoods, thereby limiting the relationship inference. To address this issue, we propose a knowledge graph completion method based on neighborhood information and nested attention. Our proposed model calculates the neighborhood information for all triples, embeds it to form neighborhood and triple representations, and encodes them using a nested attention mechanism to maintain the stability of the structural features. Finally, an inner product decoder completes the missing relationships. The experiments were conducted using three datasets, and the results showed that the prediction accuracy of the model improved while maintaining a low number of parameters. This provides a method for knowledge graph completion tasks that balances model scale and prediction accuracy.

Graphical abstract

关键词

知识图谱 / 知识图谱补全 / 知识推理 / Transformer / 注意力机制

Key words

knowledge graph / knowledge graph completion / knowledge reasoning / Transformer / attention mechanism

引用本文

引用格式 ▾
戴宇凡,熊玉洁. 基于邻域信息与嵌套注意力的知识图谱补全[J]. 武汉大学学报(理学版), 2025, 71(4): 539-548 DOI:10.14188/j.1671-8836.2024.0152

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

知识图谱通过结构化的方式将信息关联起来,构建了一个以实体为节点,关系为边的多关系有向图,从而形成一个多维度、可查询、可推理的知识网络。图谱中的三元组以(h, r, t)的形式表达现实世界中的各种信息,其中h表示头部实体,t表示尾部实体,r则表示两个实体之间的关系。随着大数据和人工智能技术的发展,其应用场景日益丰富,应用价值日益凸显[1]。在信息检索领域,知识图谱可以用于增强语义理解和信息检索能力;在推荐系统中,它可以为模型提供全面的背景知识和上下文信息,有助于揭示用户与物品之间的潜在联系,提供更具个性化和相关性更高的推荐[2]。与此同时,实际应用也对知识图谱自身的准确性和完整性提出了更高的要求,知识图谱补全技术应运而生,其目标是预测知识图谱中存在但尚未标注的实体间关系。

当前知识图谱补全方法主要依赖于知识图谱嵌入模型[3-4],这些嵌入模型通过将知识图谱中的元素映射到高维向量空间,成功捕捉实体之间的语义关系,并在一定程度上揭示了图谱的内在结构。然而,随着知识图谱规模的不断扩展,这些方法逐渐显露出可扩展性方面的问题[5]。当面对庞大的知识图谱时,知识图谱嵌入模型需要处理成千上万的实体和关系,嵌入维度往往随着图谱规模的扩大而增加,规模的扩展不仅增加了计算复杂度,而且使得训练和推理的时间显著增加,超出了计算资源的承受能力。特别是对于包含数百万节点和关系的大型知识图谱,这种方法的局限性更加明显。此外,知识图谱补全模型在面对稀疏数据时,无法充分捕捉稀有关系和实体的特征,影响了模型的表现[6]

为了提高模型的表达能力,许多研究开始探索在嵌入过程中加入邻域信息。一些方法如CoKE[7]、KG-BERT[8]和HittER[9]聚合来自实体邻域的信息共同学习知识图谱中实体和关系的表示。它们通过自注意力机制有效捕捉输入序列中的交互信息和依赖,而不仅仅是学习静态表示。然而,这类模型使用多个编码器块,增加了非嵌入的自由参数,并显著提升了训练时间。这种扩展导致的模型参数规模大幅增加,意味着需要更多的计算资源和更长的训练时间,增加了实现难度和应用成本。这些问题导致许多嵌入模型在处理大规模数据时效率低下,限制了其在实际场景中的广泛应用。例如,在实时系统中,知识图谱更新频繁,需要模型进行快速且高效的处理。然而,过于庞大的模型难以满足这样的需求。计算复杂度的提高在很大程度上源于Transformer[10]编码器结构的计算复杂度高。每个编码器块中的自注意力机制需要计算输入序列中所有元素间的相似度,其计算复杂度为O(n²)。因此,如何在保证精确性的前提下控制其参数量,成为知识图谱研究中的一个重要课题。

针对以上问题,本文提出了一种基于邻域信息与嵌套注意力的知识图谱补全方法。本文方法的贡献如下:1) 嵌套注意力机制,同时接收三元组及其邻域信息的输入,学习实体间的关系。该机制有效降低了计算复杂度,并通过采用较低维度的词嵌入优化了参数量,防止模型过拟合,提高了模型泛化能力。2) 局部点积注意力,通过对局部重要位置的权重提升,使模型能够更准确地捕捉知识图谱中局部语义和结构的变化。实验结果表明,本文模型在保持较低参数量的同时,能够提升预测准确性,展示了在知识图谱补全任务中的有效性。

1  相关工作

1.1 基于嵌入的方法

1.1.1 基于平移距离的方法

基于平移距离的方法是知识图谱嵌入模型的典型代表,通过最小化嵌入空间中的距离损失优化模型参数,从而提高预测的准确性,具有易解释的特点。基于平移距离的方法通常根据距离变换建模头实体和尾实体之间的关系。TransE[11]最早基于平移的思想,假设头实体特征和关系特征之和接近尾实体特征。然而,这种单一的平移方式在处理复杂关系时会导致所有近似尾实体嵌入收敛到相同的向量。为了解决这一问题,后续的模型如TransH[12]通过将实体生成的法向量投射到不同的超平面上处理复杂关系。TransR[13]则基于实体具有多方面的特征,将实体映射到不同的关系语义空间。RotatE[14]是一种用于知识图谱补全任务的嵌入模型,其核心思想是将实体和关系嵌入到复数空间中,并通过复数空间中的旋转操作建模关系。

1.1.2 基于张量分解的方法

张量分解模型也被称为语义匹配模型,其中RESCAL[15]通过关系矩阵建模实体的潜在语义交互作用,为三元组设计了一个双线性评分函数并将其编码成矩阵。然而,随着知识图谱的扩展,RESCAL的计算复杂度显著增加。为简化模型,DistMult[16]将关系矩阵替换为对角矩阵,设计了一个实体之间的双线性乘积。ComplEx[17]将实体和关系嵌入到复向量空间,通过低秩分解建模实体的关系投影操作,并通过取其共轭对关系建模。TuckER[18]采用更先进的低秩分解方法Tucker分解,并且将DistMult和ComplEx视为TuckER的特例。NTN[19]利用神经张量网络建模关系,对实体特征进行平均编码。为了减少模型规模,B-CP[20]提出了二值化的CANDECOMP/PARAFAC分解,使得模型能够快速计算具有更大嵌入维度的语义匹配评分。

1.2 基于神经网络的方法

1.2.1 基于卷积神经网络的方法

在知识图谱补全任务中,卷积神经网络也被广泛应用于增强实体和关系之间的交互。ConvE[21]作为第一个采用卷积神经网络进行知识图谱补全任务的模型,通过二维卷积表示实体和关系。InteractE[22]通过特征排列、特征重塑,增强了实体之间的完全交互,提升了预测的效果。CompGCN[23]在图卷积的过程中,同时建模实体和关系,通过组合操作将实体和关系信息融合,并在消息传递过程中对实体节点进行更新。HypER[24]实现了跨层权重共享,并根据输入动态合成权重,从而实现自适应的实体关系特征交互。ConvR[25]直接利用关系嵌入作为卷积核,对实体进行卷积操作,以显著提高交互数量。FESSI[26]中使用交互注意力机制,将多头注意力重新融合成多个混合注意力,增强注意力头之间的交互性,以提取目标实体更丰富的语义信息。龙伟等[27]提出了一种基于关系嵌入的模型,使用可学习的关系嵌入表征图中的异质类型信息。

1.2.2 基于Transformer的方法

Transformer能够在输入元素之间建立全局依赖关系,一些模型使用Transformer作为知识图谱补全的编码器。如SDFormer[28]和MSHE[29]引入了Transformer,以进一步增强实体和关系的交互。Fastformer[30]不再直接计算词与词之间注意力,而是使用加法注意力机制对全局上下文建模,然后基于词与全局上下文表示的交互进一步转换每个词的表示。Luna[31]使用一种高效的嵌套注意力机制,将复杂度降低为线性。Soft[32]使用高斯核函数替代点积相似度,无需进一步归一化,使得完整的自注意矩阵可以通过低秩矩阵分解来逼近。

2  本文方法

图1为本文方法流程。首先,从三元组出发提取实体的k跳邻域信息,分别构建三元组序列与邻域信息序列,根据词语类型对序列中的实体、关系及描述文本进行嵌入,得到三元组表示与邻域信息表示。接着,将两种表示输入嵌套注意力编码器,进行语义特征的融合提取。最终,将融合后的语义表示与实体嵌入矩阵进行匹配,通过内积解码器预测目标实体,从而实现知识图谱中缺失关系的补全。其中,本文提出的嵌套注意力机制,能够使模型同时接收三元组表示和邻域信息表示,并进行关系建模和特征提取。此外,局部点积注意力机制通过赋予关键位置更高的权重,能够更精准地感知知识图谱里局部语义及结构的细微变化。

2.1 邻域信息嵌入

在知识图谱补全任务中,加入邻域信息是提高模型理解和预测能力的重要方法。单一的三元组输入通常仅能提供有限的直接关系,而无法充分反映实体间的复杂联结。因此,整合邻域信息能够有效丰富模型的背景知识,使其在处理复杂关系时更加准确和灵活。图2为节点的邻域信息示意图,其中蓝色节点和美锦能源节点之间的关系,以及蓝色节点本身,构成了美锦能源节点的邻域信息。通过这些邻域信息,模型能够推断出美锦能源与新兴能源之间的关系。

2.1.1 邻域信息的获取

邻域信息通过对输入三元组进行预处理获得,包括邻域实体、邻域关系及邻域实体与邻域关系的描述。获取过程如下:给定一个三元组(h, r, t),首先从知识图谱中搜索所有与该三元组的头实体h或尾实体t相关联的其他三元组。邻域三元组的选择采用k跳算法,通过广度优先搜索,找出与目标实体路径长度不超过k跳的所有相关实体与关系。在获取的近邻中保留前n个实体-关系对,优先选择与实体距离更近的邻居,确保捕捉到与当前三元组具有更紧密语义或结构关系的邻域信息。找到这些相关联的三元组后,去除其中与原三元组相同的头实体h或尾实体t,形成新的实体-关系对,并基于这些实体-关系对,获取其描述文本[33]

2.1.2 邻域信息表示的生成

三元组的输入形式为(h, r, t),在预测特定节点时,原三元组中的待预测节点会被替换为[Target]标记。例如,如果预测目标是尾实体,则三元组序列形式为[h, r, [Target]]。邻域信息输入时会在开头添加[CLS]标记,并将邻域实体、邻域关系及其描述按特定顺序拼接在一起。具体步骤:在邻域信息的起始位置添加[CLS]标记,并按邻域实体、邻域实体描述、邻域关系、邻域关系描述的顺序拼接成一个序列。得到三元组序列与邻域信息序列后,将其中实体、关系及描述按类型输入到相应的嵌入层,通过嵌入层,将所有输入元素映射到高维向量空间中。

经实体嵌入、关系嵌入和描述嵌入,三元组实体的邻域信息被添加进来,为模型提供了上下文和结构化信息,使模型不仅能够利用单个三元组中的直接关系,而且可以捕捉到更广泛的间接联系,增强预测的准确性和鲁棒性。在面对数据稀疏性问题时,邻域信息能够给模型提供足够的背景知识,提升对未知三元组的预测能力,有助于处理大规模知识图谱中的复杂结构和关系,为知识图谱补全提供了支持。

2.2 嵌套注意力编码

传统Transformer中自注意力机制的复杂度较高,对于一个长度为n的输入序列,自注意力的计算复杂度是O(n2)。为了解决这一问题,在接收邻域信息的同时降低自注意力计算的复杂度,本文方法采用了嵌套注意力机制,将三元组及其邻域信息进行融合,其结构如图3所示。

本文引入两层局部点积注意力,形成嵌套注意力机制,将三元组表示和邻域表示分别处理后再进行融合,减少了单次计算所需的元素交互数量。局部点积注意力通过计算查询矩阵 Q 和键矩阵 K 的点积,得到查询向量和键向量的相似度,确定每个输入位置的重要程度。局部性偏置项通过非线性变换和加权计算,能够动态地识别和强调输入序列中对当前任务最为关键的位置,局部性偏置项公式如下:

b=(n · s(W1tanh(W2Q)))2

其中, Q 为输入序列的查询矩阵,W1W2Rd×d为权重矩阵,用于实现对输入特征的不同变换。n为邻域信息序列长度,用于控制局部性的范围。s表示sigmoid激活函数,对特征进行压缩,使结果在0和1之间,其表达式如下:

s(x)=11+exp(-x)

tanh为激活函数,其公式如下:

tanh(x)=1-exp(-2x)1+exp(-2x)

第一层局部点积注意力的作用是让三元组中的实体及关系查询到与其相关的邻域信息,从而确保模型能够获取到更全面的上下文信息。这一步骤能够有效地将邻域信息引入三元组中,丰富模型的输入数据。第二层局部点积注意力在结合了第一层得到的增强信息后,进行更深层次的关系建模和特征提取。这样的方法不仅降低了每层注意力的计算负担,同时也保留了足够的上下文信息,使得模型能够更有效地捕捉复杂的实体关系。具体操作为,通过将三元组表示TRm×d进行线性变换得到QtRm×d,三元组表示T的长度为m。邻域信息表示CRn×d的长度为n,将邻域信息表示C进行线性变换,得到Qc,Kc,VcRn×d。其中,Qc为查询向量,查询与自己相关的信息;Kc为键向量,表示序列中每个元素的特征索引,用于与查询进行匹配;Vc为值向量,表示每个元素携带的实际信息内容,确定了哪些查询向量与键向量相关后,就从对应的值向量中提取信息。第一层局部点积注意力的计算公式为:

AttnT=softmax(Qt·KcT+bdkc)·Vc

其中,dkcKc向量的维度,输出为长度与三元组表示相同的AttnTRm×dQtKcVc进行注意力计算得到Attn T,再经线性变换生成新的查询向量Qt',经过残差连接、归一化,并通过前馈网络层,构成第一层局部点积注意力的输出。该输出将作为下一轮嵌套注意力编码器三元组表示的输入,与邻域信息进行进一步交互融合。

第二层局部点积注意力层接收 QcKAVA,其计算公式为:

AttnC=softmax(Qc·KAT+bdka)VA

其中, KAVA 由Attn T 线性变换所得,dkaKA 向量的维度,输出为AttnCRn×d,长度与邻域信息表示相同。Attn C 通过线性变换得到Qc',经过残差链接与归一化后,作为第二层嵌套注意力的输出,该输出将作为下一轮嵌套注意力编码器邻域信息表示的输入。在第一层局部点积注意力层之后,应用一个前馈网络层,由两个线性变换层与非线性激活函数组成,可以表示为以下函数:

FFN(X)=W2σ(W1X)

其中, W1W2是两个线性变换层的参数矩阵。如图3所示,在前馈网络层前后各添加了一个残差连接,加强了信息流动,从而提高准确率。

残差连接与归一化(LayerNorm)操作中归一化的计算公式为:

LayerNorm(x)=γ·x-μσ2+ϵ+β

其中,γβ是可学习的参数向量,维度均为m×d,用于对归一化结果进行缩放和平移,使网络能够灵活调整数据的均值和方差。μ表示输入x在特征维度上的均值,σ表示输入x在特征维度上的标准差,ϵ是一个小常数,用于避免出现分子为零的情况。层归一化的目标是对每个样本的特征维度进行归一化,使每个维度上的均值为0,方差为1。这有助于减少不同样本之间的差异,提供更稳定的训练过程。

在完成模型计算并获取三元组表示和邻域信息表示后,内积解码器用于生成预测。将目标节点的特征与邻域信息的整体特征进行融合,综合考虑目标节点的上下文信息。将融合后的表达与所有实体嵌入矩阵进行相乘,计算每个实体与目标节点的相似度得分,得分公式如下:

Scores=s(([Target]+[CLS])·Eent)

其中, Eent表示实体嵌入矩阵。

通过内积解码器,模型能够输出每个实体作为目标节点的预测概率,从而实现对知识图谱中缺失部分的补全预测。通过这种分层处理和融合机制,实现了对长序列的高效处理,避免了直接处理长序列带来的高计算成本。该设计在保持模型性能和预测准确性的同时,降低了计算复杂度,提高了处理大规模知识图谱的可扩展性和准确率。

2.3 时间复杂度分析

嵌套注意力机制通过分层处理,首先利用三元组表示对邻域信息进行注意力提取,捕捉其相关上下文语义,然后在第二层上聚合这些信息。这种分层结构避免了直接对长序列进行全局计算,降低了复杂度。假设三元组表示长度为m,邻域信息表示长度为n,且m<n。在第一层注意力中,让三元组嵌入作为查询,从较长的邻域信息嵌入中获取相关信息。这部分的计算复杂度为O(n×m),输出长度为m的序列。由于m相对较小,O(n×m)小于直接对n+m个元素做全局自注意力所需的O((n+m)2)。在第二层注意力中,融合后的信息进行进一步处理,此时邻域信息嵌入作为查询,长度为n,对第一层的输出进行注意力计算,复杂度同样为O(n×m)。两层嵌套注意力的总复杂度为O(2×n×m),即在数量级上为O(n×m),由于三元组表示长度m为常数,复杂度可以看作O(n)

3  实验与分析

3.1 数据集

本文方法在FB15k-237、WN18RR和FR2KG三个基准数据集进行测试,如表1所示。其中,FB15k-237是一大规模数据集,是Freebase[34]的子集,其中关系包括人物、组织、地点、电影、书籍、音乐等多个领域。WN18RR[35]是一个词汇数据集,是WordNet[36]的子集,主要涉及英语单词及其语义关系。WN18RR中的实体为单词或词汇项,而关系则表示这些单词之间的语义连接。例如,同义关系、反义关系、从属关系、下属关系和派生关系等。FR2KG是中文金融知识图谱数据集,涵盖金融研报领域的大量实体和关系,数据规模大、关系类型多样,同时具有较强的行业背景和专业性。

3.2 评价指标

文本采用平均倒数排名(Mean Reciprocal Rank,MRR)和前N命中率(Hits@N)衡量知识图谱补全模型的性能,实验中N取值为1,3,10。在知识图谱补全任务中,MRR是一个常用的评价指标,用于衡量模型对测试集中目标实体预测的准确性。对于每一个测试样例,模型会为所有可能的实体生成一个排序列表,目标实体的排名位置被记录下来。MRR的计算方法是取每个测试样例的倒数排名的平均值,较高的MRR值表示模型在预测实体时更为准确,目标实体通常出现在排序列表的前面。MRR的公式为:

MRR=1|S|i=1|S|1ranki

其中S为三元组集合,|S|为三元组集合个数,rank i 表示第i个测试样例中目标实体的排名。对于每个查询,首先计算倒数排名,然后计算所有查询的倒数排名的平均值。

Hits@N用于评估模型在前N个候选实体中的预测准确性,表示目标实体在模型生成的排序列表的前N个位置中的比例。例如,Hits@1表示目标实体出现在排序列表第一位的频率。计算方法是将目标实体在前N个位置内的次数除以测试样例的总数。较高的Hits@N值表明模型具有较强的预测能力。Hits@N指标计算三元组的真实实体在候选预测实体中的排名,如果其排名小于或等于N则记录为1,否则记录为0,Hits@N公式为:

Hits@N=1|S|i=1|S|f(ranki)
f(x)=1,xN0,x>N

3.3 实验设置

本文所有实验均在Windows10、AMD Ryzen 5 3600X 6 Core Processor CPU@3.79 GHz 和NVIDIA GeForce RTX4070GPU上进行,并基于PyTorch框架,在Python集成开发环境PyCharm中进行代码实现和实验验证。在模型训练过程中,各个部分的参数设置如表2所示。

本文采用Adam(Adaptive Moment Estimation)优化器来更新模型参数。将Adam优化器的初始学习率设置为0.001,这个学习率在实验中表现最佳,能够在训练速度和模型收敛性之间取得较好平衡。根据输入模型的实体-关系对,对其进行特征编码以获取相应的嵌入,然后与所有候选尾实体进行计算,为每个候选尾实体得出一个0到1之间的分数,实体的分数排名被视为模型的预测结果。训练使用损失函数为二元交叉熵损失函数(Binary Cross Entropy Loss,BCELoss),其公式为:

L=-[yilog (pi)+(1-yi)log (1-pi)]

其中,yi 是第i个样本的真实标签,pi 是模型预测的第i个样本为正类的概率。

3.4 消融实验

为了深入理解模型的各个组件对性能的影响,在FB15k-237数据集上进行了两组消融实验。第一组实验旨在验证邻域信息以及使用嵌套注意力结构对提高预测准确性的作用。实验结果如表3所示,结合邻域信息并采用嵌套注意力结构的模型在所有指标上表现最佳,显著提升了模型的预测效果。

表3显示,在相同的Transformer结构下,加入邻域信息后MRR分别提高了0.005、0.032,表明邻域信息能显著提升预测能力;嵌套注意力结构在无邻域信息时相比自注意力结构MRR仅提升0.002,说明在无邻域信息的条件下,模型性能改进有限。相比传统的自注意力结构,嵌套注意力结构能够逐层捕获多级语义依赖关系,使模型在处理知识图谱中复杂的实体关系时更加灵活,尤其在有邻域信息的情况下,嵌套注意力结构相较于自注意力结构,MRR提高了0.029,Hits@1提升了0.020,表明其更能有效地利用邻域信息,增强实体预测能力。

第二组实验旨在验证嵌套注意力编码器的层数对模型预测效果的影响,其结果见表4。实验分析表明,采用4层嵌套注意力编码器结构的模型在所有指标上均取得最佳性能。增加嵌套注意力编码器个数可以逐层构建模型对知识图谱复杂关系的理解力,4层编码器提供了足够的深度,使模型能够从低级到高级逐步抽取复杂的关系特征。当个数超过4层时,尽管理论上可以进一步提升模型的表达能力,但却显著增加模型参数量和训练复杂度,导致模型易出现过度拟合现象,使得模型在测试数据上表现不佳,限制了模型对新数据的泛化能力。

3.5 参数对模型的影响

为了测试模型针对稀疏数据集的预测能力,在FB15k-237数据集上通过调控训练集稀疏性观察模型预测性能的变化。从训练集中随机去除不同比例的三元组,以构造不同稀疏性级别的数据集,同时保持验证集和测试集不变,实验结果如表5所示。

随着删除比例的增加,训练集的三元组数量减少,模型的预测性能下降。减少模型学习的样本数量,导致模型难以捕捉到足够丰富的实体和关系特征。从实验结果可以看出,模型在一定程度的稀疏性下仍能保持一定的性能,但随着稀疏性增加,性能下降明显。这表明模型对稀疏数据有一定的适应能力,但在极端稀疏情况下需要进一步优化。

为验证k跳算法在邻域信息提取中的作用,在数据集FB15k-237对k取不同值进行了实验。实验中保持其他参数不变,仅调整k的取值,从而观察不同邻域范围对模型预测能力的影响,结果如表6

k值较小时,模型的邻域信息较少,只能获取到与目标实体直接相关的少量上下文信息,模型难以捕捉到复杂的语义关系和结构信息,导致预测性能较低。随着k值的增加,模型能够获取到更丰富的邻域信息,包括与目标实体间接相关的实体和关系。这些额外的上下文信息有助于模型更好地理解实体之间的复杂关系,从而提升预测性能。在k=40时,在邻域信息的丰富性和噪声控制之间达到了最佳平衡,模型性能最佳。邻域信息足够丰富,能够支持复杂的语义推理,同时噪声水平较低,不会干扰模型的预测。当k值继续增加时,虽然邻域信息更多,但噪声也随之增加,导致性能下降。因为过多的邻域信息可能导致模型对不相关或冗余信息的关注,从而降低预测性能。

3.6 与其他模型的对比

表7为本文模型与其他基线方法在FB15k-237与WN18RR数据集上的实验结果。本文模型在大部分指标上均表现出色,在FB15k-237中,MRR达到了0.364,高于所对比的模型。本文模型Hit@1为0.265,虽略低于TuckER,但与大多数其他模型相当。在Hit@3和Hit@10指标上,本文模型分别达到了0.401和0.553,超过了所有比较模型。在WN18RR数据集上,本模型在MMR、Hit@1和Hit@3指标上分别达到0.493、0.455和0.509,优于所有已有的模型,同时在Hit@10指标上也保持了较强的竞争力。

各模型参数量如图4所示。由图4可知,本文模型的参数量不是最优,虽相比一些模型如ComplEx稍大,但却低于一些模型如TransE和ConvE,并且在多个指标上表现更佳,体现了较高的参数效率。例如,与参数量为21×106的DistMult相比,本文模型在各项指标上均有显著提升,而参数量不到其一半。这表明本文模型在保持较低参数量的同时,能够实现优异的性能,展示了在知识图谱补全任务中的有效性。

为验证本文方法在中文知识图谱补全任务中的有效性,基于FR2KG数据集进行中文实体预测实验,实验结果如表8所示。本实验将FR2KG数据集划分为训练集、验证集和测试集(表1)。

表8结果表明,在FR2KG中文知识图谱实体预测任务中,相比于TransE和ComplEx模型,本文模型在MRR、Hit@1、Hit@3和Hit@10等各项指标上均实现了明显提升。这是因为本文模型对邻域信息的引入,使得模型在预测时不仅依赖于单一的三元组信息,还能融合实体周围丰富的上下文关联,有效弥补了中文金融领域知识图谱中关系复杂的问题。Hit@3和Hit@10指标的提升表明,在允许一定排名范围内的实体预测任务中,本文模型具有更强的召回能力,能够在中文知识图谱中捕捉到实体之间潜在的、高阶的语义联系,提升了整体推理的鲁棒性和准确性。

4  结 语

本文提出了一种基于邻域信息与嵌套注意力的知识图谱补全方法,通过实验验证了其在预测方面的准确性。通过将双层嵌套的注意力机制和局部点积注意力相结合,该方法能够有效捕捉工业实体间的复杂关系和上下文信息。这种设计使模型不仅增强了对局部信息的敏感性,还提升了整体的准确性和可扩展性,在一定程度上解决了当前知识图谱嵌入模型在大规模数据处理中的计算复杂度高和扩展性差的问题。实验结果表明,本文提出的模型在大规模知识图谱中具有应用潜力。

在未来的工作中,我们将从以下几个方面展开研究:1) 逐步增加模型参数以实现性能提升,并与现有的大模型进行更系统的对比分析;2) 探索如何将文本、图像、视频等多模态数据整合到知识图谱补全任务中,以提高预测的准确性,进一步提升知识图谱补全模型在工业系统中的性能和适用性;3) 探索使用预训练BERT词向量作为嵌入的方法,从而支持生成原图谱中不存在的新实体和关系。

参考文献

[1]

JI S XPAN S RCAMBRIA Eet al. A survey on knowledge graphs: Representation, acquisition, and applications[J]. IEEE Transactions on Neural Networks and Learning Systems202233(2): 494-514. DOI: 10.1109/TNNLS.2021.3070843 .

[2]

陈清泓, 林广艳, 柳啸峰, . 基于分离式表征的知识图谱推荐算法[J]. 武汉大学学报(理学版)202167(6): 517-524. DOI: 10.14188/j.1671-8836.2021.1002 .

[3]

CHEN Q HLIN G YLIU X Fet al. Knowledge graph recommendation algorithm based on disentangled representation[J]. Journal of Wuhan University (Natural Science Edition)202167(6): 517-524. DOI: 10.14188/j.1671-8836.2021.1002(Ch ).

[4]

陈小英, 熊盛武, 王盛, . 基于上下文时序关联的时序知识图谱嵌入方法[J]. 武汉大学学报(理学版)202369(2): 249-257. DOI: 10.14188/j.1671-8836.2022.0304 .

[5]

CHEN X YXIONG S WWANG Set al. Embedding of temporal knowledge graph based on contextual temporal association [J]. Journal of Wuhan University (Natural Science Edition)202369(2): 249-257. DOI:10.14188/j.1671-8836.2022.0304(Ch ).

[6]

熊盛武, 陈振东, 段鹏飞, . 基于可信向量的知识图谱上下文感知表示学习[J]. 武汉大学学报(理学版)201965(5): 488-494. DOI: 10.14188/j.1671-8836.2019.05.010 .

[7]

XIONG S WCHEN Z DDUAN P Fet al. Context-aware representation learning of knowledge graphs with credibility vectors[J]. Journal of Wuhan University (Natural Science Edition)201965(5): 488-494. DOI: 10.14188/j.1671-8836.2019.05.010 (Ch ).

[8]

秦川, 祝恒书, 庄福振, . 基于知识图谱的推荐系统研究综述[J]. 中国科学: 信息科学202050(7): 937-956. DOI: 10.1360/ssi-2019-0274 .

[9]

QIN CZHU H SZHUANG F Zet al. A survey on knowledge graph-based recommender systems[J]. Scientia Sinica (Informationis)202050(7): 937-956 (Ch). DOI: 10.1360/ssi-2019-0274 .

[10]

延照耀, 丁苍峰, 马乐荣, . 面向图神经网络的知识图谱嵌入研究进展[J]. 计算机科学与探索202317(8): 1793-1813. DOI: 10.3778/j.issn.1673-9418.2212063 .

[11]

YAN Z YDING C FMA L Ret al. Advances in knowledge graph embedding based on graph neural networks[J]. Journal of Frontiers of Computer Science & Technology202317(8): 1793-1813 (Ch). DOI: 10.3778/j.issn.1673-9418.2212063 .

[12]

WANG QHUANG P PWANG H Fet al. CoKE: Contextualized knowledge graph embedding[EB/OL]. 2019: 1911.02168.

[13]

YAO LMAO C SLUO Y. KG-BERT: BERT for knowledge graph completion[EB/OL]. 2019: 1909.03193.

[14]

CHEN S XLIU X DGAO J Fet al. HittER: Hierarchical transformers for knowledge graph embeddings[EB/OL]. 2020: 2008.12813. DOI: 10.18653/v1/2021.emnlp-main.812 .

[15]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[EB/OL].[2024-02-15]. DOI: 10.1007/978-3-031-84300-6_13 .

[16]

BORDES AUSUNIER NGARCIA-DURAN Aet al. Translating embeddings for modeling multi-relational data[EB/OL].[2024-02-15].

[17]

WANG ZZHANG J WFENG J Let al. Knowledge graph embedding by translating on hyperplanes[EB/OL].[2024-02-15]. DOI: 10.1609/aaai.v28i1.8870 .

[18]

LIN Y KLIU Z YSUN M Set al. Learning entity and relation embeddings for knowledge graph completion[EB/OL].[2024-02-15]. DOI: 10.1609/aaai.v29i1.9491 .

[19]

SUN Z QDENG Z HNIE J Yet al. Rotate: Knowledge graph embedding by relational rotation in complex space[EB/OL]. [2014-02-26]. DOI: 10.1109/iccc52777.2021.9580273 .

[20]

NICKEL MTRESP VKRIEGEL H P. A three-way model for collective learning on multi-relational data[EB/OL]. [2024-02-15]. DOI: 10.1145/2187836.2187874 .

[21]

YANG B SYIH W THE X Det al. Embedding entities and relations for learning and inference in knowledge bases[EB/OL].[2024-02-15].

[22]

TROUILLON TWELBL JRIEDEL Set al. Complex embeddings for simple link prediction[EB/OL]. 2016: 1606.06357.

[23]

BALAŽEVIĆ IALLEN CHOSPEDALES T M. TuckER: Tensor factorization for knowledge graph completion[EB/OL]. 2019: 1901.09590. DOI: 10.18653/v1/d19-1522 .

[24]

SOCHER RCHEN D QMANNING C Det al. Reasoning with neural tensor networks for knowledge base completion[EB/OL]. [2024-02-15]. DOI: 10.1109/ICICIP.2013.6568119 .

[25]

HAYASHI KKISHIMOTO KSHIMBO M. Binarized embeddings for fast, space-efficient knowledge graph completion[J]. IEEE Transactions on Knowledge and Data Engineering202335(1): 141-153.

[26]

DETTMERS TMINERVINI PSTENETORP Pet al. Convolutional 2d knowledge graph embeddings[EB/OL].[2024-02-15]. DOI: 10.1609/aaai.v32i1.11573 .

[27]

VASHISHTH SSANYAL SNITIN Vet al. InteractE: Improving convolution-based knowledge graph embeddings by increasing feature interactions[EB/OL]. [2024-02-15].

[28]

VASHISHTH SSANYAL SNITIN Vet al. Composition-based multi-relational graph convolutional networks[EB/OL]. 2019: 1911.03082. DOI: 10.1609/aaai.v34i03.5694 .

[29]

BALAŽEVIĆ IALLEN CHOSPEDALES T M. Hypernetwork knowledge graph embeddings[M]//Artificial Neural Networks and Machine Learning — ICANN 2019: Workshop and Special Sessions. Cham: Springer International Publishing, 2019: 553-565. DOI: 10.1007/978-3-030-30493-5_52 .

[30]

JIANG X TWANG QWANG B. Adaptive convolution for multi-relational learning[EB/OL]. [2024-02-15]. DOI: 10.18653/v1/n19-1103 .

[31]

王利琴, 张特, 许智宏, . 融合实体语义及结构信息的知识图谱推理[J]. 计算机应用202444(11): 3371-3378.

[32]

WANG L QZHANG TXU Z Het al. Fusing entity semantic and structural information for knowledge graph reasoning[J]. Journal of Computer Applications202444(11): 3371-3378 (Ch).

[33]

龙伟, 张明蓝, 韩敏. 基于关系嵌入的异质图神经网络链接预测模型[J]. 计算机测量与控制202533(3): 30-36. DOI:10.16526/j.cnki.11-4762/tp.2025.03.004 .

[34]

LONG WZHANG M LHAN M. Heterogeneous graph neural network link prediction model based on relational embedding[J]. Computer Measurement & Control202533(3): 30-36. DOI:10.16526/j.cnki.11-4762/tp.2025.03.004(Ch ).

[35]

LI DXIA TWANG Jet al. SDFormer: A shallow-to-deep feature interaction for knowledge graph embedding[J]. Knowledge⁃Based Systems2024284: 111253. DOI: 10.1016/j.knosys.2023.111253 .

[36]

JIANG DWANG R GXUE L Xet al. Multisource hierarchical neural network for knowledge graph embedding[J]. Expert Systems with Applications2024237: 121446. DOI: 10.1016/j.eswa.2023.121446 .

[37]

WU C HWU F ZQI Tet al. Fastformer: Additive attention can be all you need[EB/OL]. 2021: 2108.09084.

[38]

MA X ZKONG XWANG S Net al. Luna: Linear unified nested attention[EB/OL]. [2024-11-08].

[39]

LU J CYAO J HZHANG J Get al. Soft: Softmax-free transformer with linear complexity[EB/OL]. [2024-11-08].

[40]

XIE R BLIU Z YJIA J. Representation learning of knowledge graphs with entity descriptions[EB/OL]. [2024-11-08].

[41]

BOLLACKER KEVANS CPARITOSH Pet al. Freebase: A collaboratively created graph database for structuring human knowledge[C]//Proceedings of the 2008 ACM SIGMOD International Conference on Management of Data. New York: ACM, 2008: 1247-1250. DOI: 10.1145/1376616.1376746 .

[42]

BORDES AGLOROT XWESTON Jet al. A semantic matching energy function for learning with multi-relational data[J]. Machine Learning201494(2): 233-259. DOI: 10.1007/s10994-013-5363-6 .

[43]

MILLER G A. WordNet: A lexical database for English[J]. Communications of the ACM199538(11): 39-41. DOI: 10.1145/219717.219748 .

基金资助

国家自然科学基金青年科学基金项目(62006150)

AI Summary AI Mindmap
PDF (1234KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/