基于依存句法与多头注意力的生物医学事件抽取

刘辉雄 ,  刘茂福 ,  唐东昕

武汉大学学报(理学版) ›› 2021, Vol. 67 ›› Issue (6) : 578 -588.

PDF (1431KB)
武汉大学学报(理学版) ›› 2021, Vol. 67 ›› Issue (6) : 578 -588. DOI: 10.14188/j.1671-8836.2021.0160
推荐系统专辑

基于依存句法与多头注意力的生物医学事件抽取

作者信息 +

Biomedical Event Extraction Based on Dependency Syntax and Multi-Head Attention

Author information +
文章历史 +
PDF (1465K)

摘要

采用流水线方式抽取生物医学事件存在错误传播问题,且子任务之间的联系被忽略了。为了解决这些问题,采用端到端方法,对触发词识别、要素检测和事件评估三个独立的子任务同时建模,以联合的方式进行训练,再引入依存句法信息捕获同一句子中多个事件的关联性,将依存句法树转化为图,然后用基于多头注意力机制的图神经网络来建模图信息。实验结果表明,该方法在三大生物数据集上的事件抽取任务上效果较好。

Abstract

The pipelined approach to biomedical event extraction has the problem of error propagation, and the associations among these subtasks is ignored. In order to solve these problems, this paper adopts an end-to-end approach to model three independent sub-tasks, namely trigger recognition, argument detection and event evaluation, simultaneously, and conducts training in a joint way. We introduce the dependency information of the sentence to capture the relevance of multiple events in the same sentence. Therefore, the proposed method converts the dependency parse tree into a graph and uses the graph neural network based on multiple heads mechanism to model the graph information. Experimental results show that this method is effective in event extraction tasks on the three major biological data sets.

Graphical abstract

关键词

生物医学事件抽取 / 端到端 / 依存句法 / 多头注意力 / 图神经网络

Key words

biomedical event extraction / end-to-end / dependency syntax / multi-head attention / graph neural network

引用本文

引用格式 ▾
刘辉雄,刘茂福,唐东昕. 基于依存句法与多头注意力的生物医学事件抽取[J]. 武汉大学学报(理学版), 2021, 67(6): 578-588 DOI:10.14188/j.1671-8836.2021.0160

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着生物医学文献的数量迅速增长,如何从海量的非结构化的生物医学文献中抽取人们所需要的有价值信息,成为了研究人员密切关注的问题,越来越多的学者参与到了生物医学信息抽取的研究中。生物医学信息抽取包括命名实体识别、关系抽取以及事件抽取。生物医学事件抽取是指从生物医学文献中识别出特定类型的事件触发词和与之相关的要素,然后以结构化的形式展现出来。

近年来,为了推动生物医学事件抽取技术的快速发展,生物文本挖掘领域的国际比赛相继举办,比如BioNLP-ST(BioNLP Shared Task)1~4已连续举办了十几届,在其推动下,基于规则的方法5~7、基于传统浅层机器学习的方法8~11以及基于深度学习的方法12~17被提出来用于生物医学事件抽取。

由于端到端的联合方式可以避免流水线方式存在的错误传播问题,因此被广泛运用于信息抽取领域,比如Miwa等18提出了一种端到端的关系抽取模型,同时考虑句子的词序信息和依存句法树的子结构信息。张玉坤等19提出一种联合神经网络模型,把实体识别和关系抽取联合起来,在中文医疗关系抽取任务上取得不错的效果。依存句法信息表达了句子中的短语结构以及短语之间的层次句法关系,为信息抽取任务提供关键信息,如Sha等20将句子的依存树集成到依赖桥循环神经网络中,Orr等21提出了有向无环图GRU模型,将句法结构引入序列结构。而随着图卷积神经网络GCN(graph convolutional network)22的兴起,类似依赖树的图信息更容易被建模,比如Nguyen等23、Liu等24、Yan等25和Cui等26提出将依存句法树转化为图,利用图神经网络建模图信息,在ACE数据集上取得不错的效果。这种用图神经网络对图信息建模的方法迅速成为研究人员的重点,因此把依存句法整合到图神经网络模型上的方法被广泛运用到关系抽取、事件检测和目标检测等领域。

尽管现有的方法在生物医学事件抽取中取得很好的效果,但是它们通常存在以下几点问题:

1)采用流水线方式进行事件抽取,把事件抽取任务划分为触发词识别、要素检测和事件评估三个独立的子任务,这种方式简化了问题,却忽略了子任务之间的联系,容易造成错误传播;2)采用的神经网络模型都只考虑句子的序列表示,没有考虑句子的句法表示,对于句法特征没有直接使用,并且对于复杂事件的抽取效果很不理想。

针对上述问题,本文提出基于依存句法与多头注意力的生物医学事件抽取模型,对三个子任务同时进行建模,采用端到端的联合方式来避免流水线方式中存在的错误传播问题,引入句法的依存句法信息,把句法信息转化为图信息,基于多头注意力机制的关系边增强的图卷积神经网络来对图信息进行建模,对图中有依存关系的节点之间的信息进行聚合,利用多头注意力机制发掘触发词和要素之间的信息,加强同一句子中多个事件之间的内在关联,从而提升生物医学事件的抽取效果。

1  本文模型

本文提出基于依存句法与多头注意力的生物医学事件抽取模型,把依存句法信息整合到图神经网络上,利用多头注意力机制来加强事件之间的联系,以端到端的方式进行生物医学事件抽取。该模型的框架如图1所示,包含七层,分别是:嵌入层、Bi-LSTM层、关系边增强的图卷积层EEGCN(edge-enhanced graph convolutional networks)、多头注意力层、触发词识别、要素识别和事件评估。其中嵌入层和Bi-LSTM层将句子编码为特征向量的序列,EEGCN捕获句子的句法结构信息和关系标签信息,多头注意力层利用多头注意力的机制去聚合事件之间的联系,触发词识别、要素检测和事件评估以联合的方式进行训练。

1.1 嵌入层

嵌入层将每个单词转换成实值的嵌入向量,向量中包含了语义信息和实体信息等。本文嵌入层的构建包含字符级词表示、词嵌入和实体词向量。给定含有n个单词的句子x={xword1,xword2,,xwordn},那么单词的特征vi表示如下

vi=[wi;ei;chi]

其中wi表示语义词嵌入,ei表示实体类型词向量,chi表示字符级词嵌入,把这三个向量进行级联输入到Bi-LSTM层。

1.1.1 字符级词表示

字符级词表示考虑了单词在形态学方面的信息和知识,能充分地表达单词的前缀和后缀信息。经大量的研究27证明,在嵌入层中加入字符级词表示可以提升信息抽取的结果。本文采用基于CNN(convolutional neural networks)的方式得到基于字符级词表示,首先将字符表中的所有字符向量随机初始化,然后通过CNN进行卷积,之后经过最大池化得到基于字符级词表示。

1.1.2 词嵌入

本文从PubMed中收集大量未标注语料,在此基础上加入一些与生物医学任务相关的数据集,然后使用FastText进行单词的词向量学习,构建单词的语义空间,得到预训练的词嵌入。

1.1.3 实体词向量

实体词向量包含了单词的实体类型信息,根据以往研究28表明,在命名实体识别、关系分类和事件抽取等任务中加入实体词向量将有助于提升任务效果。因此本文在特征构建上也引入了实体类型的词向量,并且设置这些实体类型词向量会随着模型的训练得到调整。

1.2 Bi-LSTM层

由于循环神经网络RNN(recurrent neural networks)在训练的时候会存在梯度消失或者梯度爆炸的问题,因此循环神经网络RNN不能很好地处理长距离依赖的问题,而长短时记忆模型LSTM的提出,可以有效解决此类问题,LSTM通过训练过程可以学习到记忆哪些信息和遗忘哪些信息。但是LSTM存在无法编码从后到前信息的问题,因此Bi-LSTM在LSTM基础上进行了更改,通过结合前向的LSTM与后向的LSTM来解决LSTM只能处理单向信息的问题。

经过嵌入层把句子中每个单词转化成对应的实值特征后,使用Bi-LSTM捕获单词的上下文信息,其计算公式如下

ht=LSTM(vt)
ht=LSTM(vt)
ht=[ht;ht]

其中vt表示t时刻的输入特征,htdh表示t时刻的前向LSTM的输出,htdh表示t时刻的后向LSTM的输出,ht2dhhtht拼接得到,dh是LSTM隐藏层维度。

1.3 关系边增强的图卷积层

依存句法表达了句子中的短语结构以及短语之间的层次句法关系。

例1 Eighteen patients with SRNV refusing radiotherapy served as a control group and were matched with 18 irradiated patients

该句子一共含有三个生物医学事件,一个为Planned process类型的事件E1,触发词为“irradiated”,Theme类型要素为“patients”;一个为Planned process类型的事件E2,触发词为“radiotherapy”,Theme类型要素为“patients”;一个为Negative regulation类型的事件E3,触发词为“refusing”,Theme类型要素为E2事件,E3是一个复杂事件。

图2就是例1的依存句法解析。从图2中可以看出,触发词T1“irradiated”和实体P2“patients”通过句法结构相关联,组成事件E1;触发词T2“radiotherapy”和实体P1“patients”通过句法结构相关联,组成简单事件E2;触发词T3“refusing”和触发词T2“radiotherapy”通过句法结构相关联,组成嵌套事件E3,此外它们的依存关系类型名词修饰语 nmod和形容词修饰语amod又蕴含着重要的信息,比如触发词与要素的交互信息,这表明依存句法结构和依存关系类型可以为事件抽取提供重要信息。

Cui等26提出关系边增强的图卷积神经网络,融入句子的依存句法信息,在ACE2005数据集的事件检测ED任务上取得很好的效果,因此本文借鉴此方法,在生物医学事件抽取中引入依存句法信息,并在EEGCN的基础上融合多头注意力机制来加强触发词和要素、事件和事件之间的联系,从而有效提升生物医学事件抽取的效果。

本文使用stanza对每个句子进行句法依存分析得到句法依存树,用无向图G=(N,ε)来表示依存树,其中N=N1,N2,,Nn表示节点集合,ε=ε1,ε2,,εn表示节点之间的边集合,在节点集合N中,句子中的每个单词被视为图上的一个节点,在边集合ε中,(Ni,Nj)表示节点Ni和节点Nj之间存在依存边,并且该边的类型标签表示为K(Ni,Nj)。为了建模图信息和引入依存关系类型信息,根据依存句法树初始化一个关系感知的邻接张量En×n×pEi,j,:p表示节点Ni和节点Nj的依存关系的p维向量,引入一个查询表将每种类型的句法关系标签转换成一个实值嵌入向量,如果节点Ni和节点Nj之间存在依赖边且它们的依存关系标签为r,那么Ei,j,:的初始化就可以从查询表中获得相应的p维向量,否则初始化为p维的零向量。

为了信息能沿着边逆向传播,对Ei,j,:Ej,i,:进行初始化时,分配给相同的值,并添加一个root关系的自环。关系边增强的图卷积层包含关系感知的聚合模块EANUM(edge-aware node update module)和节点感知的关系更新模块NAEUM(node-aware edge update module),该结构如图3所示。

EANUM根据节点之间的依存关系信息来更新节点的表示,NAEUM使用关系感知的聚合模块学习到的节点表示来更新邻接张量的依存关系表示,从而得到节点感知的关系表示,然后该模块的输出又作为下一层关系感知的聚合模块的输入。给定堆叠n层关系边增强的图卷积,那么第l层的关系边增强的图卷积中节点和边的计算如下

(Hl,El)=EEGCN(Hl-1,El-1)

其中,Hl-1n×d是第l-1层的输出的节点表示,d是单词的输入维度,El-1n×n×p是第l-1层的输出的边表示。

1.3.1 关系感知的聚合模块

关系感知的聚合模块旨在通过句子的依存句法信息将来自节点邻居的信息聚合在一起,从而更新每个节点的表示,为每个节点学习到其句法的上下文表示,其计算如下

Hl=EANUM(El-1,Hl-1)=σ(Pool(H1l,H2l,,Hpl))
Hil=E:,:,il-1Hl-1W

其中,E:,:,il-1n×n表示El-1的第i个通道,H0表示Bi-LSTM的输出,E0是由依存句法树初始化的,Wd×d是可学习的滤波器,d是节点的维度值,n是句子中单词的数量,Pool是池化操作,这里采用的平均池化方式,σ是激活函数relu。

1.3.2 节点感知的关系更新模块

节点感知的关系更新模块会根据节点的上下文表示动态地更新节点之间的依存关系表示,将上下文的语义信息和句法关系信息结合在一起,从而在不同的上下文中可以动态地表示节点之间的依存关系,其计算如下

Ei,j,:l=NAEUM(Ei,j,:l-1,hil,hjl)=Wu[Ei,j,:l-1;hil;hjl]

其中,hilhjl分别表示第l层节点vi的表示和节点vj的表示,Wu(2×d+p)×p是一个可学习的转移矩阵。

1.4 多头注意力层

多头注意力机制是注意力机制的一种变体,它使得模型关注到句子中更重要的部分,从而捕获到句子内部的重要信息。本文在图卷积层后引入多头注意力机制,通过多头注意力机制来加强触发词和触发词、触发词和要素之间的交互信息,从而维护同一个句子之中不同事件的关联性,提升生物医学复杂事件的抽取效果。

首先将查询矩阵、键矩阵和值矩阵映射到不同的子空间中,然后分别进行缩放点积注意力计算,计算公式如下

Attention(Q,K,V)=softmaxQKTdwV

其中,Q是查询矩阵,K是键矩阵,V是值矩阵,dw表示键的维数,多头注意力机制重复进行多次注意力计算,然后将结果拼接起来,计算公式如下

Multihead(Q,K,V)=WM[head1;;headh]
headi=Attention(WiQQ,WiKK,WiVV)

其中,权重矩阵WMd×dWiQd/h×dWiKd/h×dWiVd/h×d,[;]表示拼接,最后再经过一次线性变换得到自注意力层的输出M={m1,m2,,mn}mi是对应于第i个单词的输出向量。

1.5 触发词识别

生物医学事件抽取中触发的识别可以看成是序列标注问题,也可以看成是多类别的分类问题,本文把触发词识别看成是后者。由于生物触发词存在由多个单词组成的现象,因此使用BIO标签对句子的触发词进行标注,B-type表示某触发词的开始位置,I-type表示某类型触发词的中间或者后面位置,O表示该单词不是触发词。把多头注意力层的输出输入到一个全连接网络,然后通过softmax函数计算触发词类型的概率分布,公式如下

yti=softmax(WtMi+bt)

其中,Mid是多头注意力层第i个单词的输出表示。WtT×dbtTT代表触发词的类型数,d代表节点维度的大小。

1.6 要素检测

在完成触发词识别之后,需要进行事件要素的检测,识别出触发词与实体或者触发词和触发词之间的关系。在生物医学事件抽取中,当要素的参与者是实体类型时称之为简单事件,当要素的参与者是触发词类型时称之为复杂事件。

由于触发词候选或者要素候选可能由几个单词组成,因此本文通过平均池化的方式在序列长度这一维度上聚合这些子序列的上下文表示,从而获得候选触发词表示和候选要素表示,然后把触发词表示、句子表示和要素表示进行级联,之后经过高斯误差线性激活函数处理输入到全连接网络,通过softmax来预测要素的类型,其计算如下

ri=GELU(Wr[Ti;Sj;C]+br)
Ti=[Mi;ui]
Sj=[Mj;uj]
ya=softmax(Wari+ba)

其中,Ti为第i个候选触发词表示,Sj为第j个候选实体或者候选触发词表示,Wrbr分别是可学习的权重和偏差,C是整个句子的表示,采用的是平均池化的方式,GELU是高斯误差线性单激活函数,[;]表示拼接,uidtujdt为触发词类型表示,dt为触发词类型表示的维度,WaA×(3dt+2d)baA是全连接层的权重和偏差,A表示要素的类型数,ya表示第i个触发词与第j个候选实体或者第j个候选触发词之间的要素类别概率。

1.7 事件评估

经过触发词识别层和要素检测层识别出所有的触发词和要素后,事件评估层就是枚举必须满足特定结构定义的事件触发词和要素的所有有效组合,为每个事件触发词构造候选事件。这些候选事件既可以是有要素参与的事件,也可以是无要素参与的事件,然后把每个候选事件分类为事件或者非事件,计算公式如下

ei=Tt;jeaGELU(We[rj;Oj;Taj+be])+jeaGELU(Wk[rj;Oj;Taj]+bk)
ei'=GELU(Wlei'+bl)
ys=softmax(Wcei'+Wc)

其中,Tt为第t个候选触发词的表示,rj是第j个要素对的表示,Oj表示第j个要素对的要素类型标签表示,ea表示句子中所有要素的集合,Webe是事件评估层中要素可学习的权重和偏差,Wkbk也表示要素可学习的权重和偏差,不过这些要素虽然共享同一触发词,但是它们不在同一事件结构中,这种方法可以从所有可能的要素集合中选择合适的要素。Wlbl是权重和偏差,将ei经过高斯误差线性激活函数处理得到ei',然后将ei'输入到softmax进行二分类,判断候选事件为事件还是非事件。

1.8 损失函数

由于生物事件抽取数据集存在稀疏性问题,本文在触发词识别层、要素检测层和事件评估层采用带权重的交叉熵函数来计算每层损失,然后把每一层得到的损失乘以相应的权重,之后相加作为整个模型的损失,其计算公式如下

Loss=Losst+αLossa+βLosse

其中Losst代表触发词识别层的损失,Lossa代表要素检测层的损失,Losse代表事件评估层的损失,α代表要素层损失的权重,β代表事件评估层的权重,本文使用AdaDelta优化器来更新模型的参数,为防止过拟合,本文在计算每层损失的时候都使用L2正则化,同时在每层加入Dropout。

2  实 验

2.1 数据集及评估标准

本文的实验语料为PC29、GE201130和MLEE31三个生物事件抽取公共数据集。其中,PC是描述生物分子发展途径的,定义了4种实体类型和19种事件子类型;GE2011为描述蛋白质与生物分子的内在关系的,由蛋白质实体和9种事件子类型构成;MLEE数据集作为一个全新的多层次的生物医学事件抽取语料,不仅涵盖了分子级别的事件, 还涵盖了细胞、组织和器官等的生物实体事件,定义了16种实体类型与19种事件类型,要素的标注类型除了Theme和Cause,还额外加入了5种类型的要素,例如Site、From和Instrucment等。将每个数据集分别划分为训练集、测试集和验证集,且每篇语料文献都含有命名实体和事件两个标注文件,其中命名实体文件对语料文献中出现的所有实体进行了标注,记录了实体类型和实体在文献中的起始位置,而事件文件是对语料文献中出现的触发词和要素类型进行的标注,记录的事件触发词类型和事件,其统计信息如表1所示。

本文采用精确率(precision,P)、召回率(Recall,R)和F1值作为评价标准,P反映了模型预测为正例的样本中识别正确的比例,R反映了所有正例样本中被正确识别的比例,F1是对两者的折中考虑,更好地体现模型的好坏。

2.2 实验结果分析

2.2.1 生物事件抽取结果

表2列出了本文提出的模型在PC、GE2011和MLEE三个生物数据集的测试数据集上的事件抽取结果,并和7种文献模型的结果进行了对比。这7种文献采用的方法如下:文献[32]使用了基于SVM的方法;文献[11]的方法是基于隐藏主题的半监督学习的;文献[33]采用流水线方式进行生物事件抽取,每个子任务采用CNN进行特征编码;文献[34]的方法是基于并行多池化的卷积神经网络的,并结合了依存关系的词向量、实体特征和词性特征;文献[15]使用预训练语言词向量解决触发词歧义问题,引入自注意力和实体注意力机制提升要素抽取效果;文献[35]的方法是基于混合策略的神经网络模型的;文献[17]运用多标签感知编码策略和多任务学习对任务进行建模。

表2中的召回率来看,本文的召回率在MLEE数据集上明显低于文献[11]和文献[15],这可能是因为:1) 文献[1115]扩充了训练语料集,在原始的MLEE语料集上加入了新标注的语料集,这些扩充的语料集使得模型能学到额外的特征,能预测更多正确的触发词;2) 在MLEE中,有些单词或短语分别在训练集和测试集可以作为不同类型事件的触发词,本文模型得不到充分的训练; 3) 本文使用外部工具stanza对句子进行依存分析,依存句法的错误分析会传播到后面的事件抽取,降低了召回率。从精确率看,本文模型的精确率高于所有模型,这是因为本文使用的图神经网络可以直接利用句子的句法信息,同时本文引入的多头注意力使得模型更加关注触发词和要素之间的信息,维护了同一句子之中多个事件之间的联系。本文提出的模型的整体事件抽取F1优于其他模型。这是因为其他模型采用流水线方式,忽略了子任务之间的相关性,造成了错误传播,而本文采用端到端方式,利用子任务之前的联系提升了事件抽取的结果,从而验证了本文采用端到端的方法的有效性。

表3给出了在MLEE测试数据集上本文模型与文献[15]的简单事件与复杂事件抽取效果的对比。在简单事件抽取上本文模型召回率R低于文献[15],可能是文献[15]扩充了语料集,模型得到充分的训练,学习到更多的额外特征。本文在简单事件的抽取性能上达到较好的结果,在复杂事件抽取结果上得到了提升,优于文献[15],但是,复杂事件抽取性能依然不是很高,这一方面可能是因为生物数据集稀疏的问题,模型得不到充分的训练,另一方面本文进行的是句子级别的事件抽取,而对于复杂事件抽取来说,仅仅从单个句子中获取上下文特征是不够的。

表4给出了在MLEE测试数据集上本文模型与文献[15]的详细事件抽取结果的比较。从表4可知,本文在“Cell proliferation”“Development”“Blood vessel develop”“Growth”和“Remodeling”等数量较多的简单事件类型上大部分取得不错的效果,说明本文模型能有效抽取简单事件;在“Synthesis”“Transcription”“Catabolism”和“Dephosphorylation”等数量较少的简单事件类型上取得较差的结果,说明数据的稀少会很大程度影响模型的训练;在“Regulation”“Positive regulation”“Negative regulation”和“Planned process”四类复杂事件类型上的抽取结果优于文献[15]。这是因为一方面基于多头注意力机制的图卷积对依存句法图建模,聚合有依存关系的节点之间的信息,多头注意力的引入使得模型更加关注触发词和要素的交互信息,维护了同一句子中多个事件的联系,另一方面端到端的方式加强了子任务之间的联系,从而有效地抽取复杂事件。

2.2.2 消融实验分析

为了进一步验证本文方法各部分的有效性,本文在MLEE数据集上做了消融实验,实验结果如表5所示,其中“-charCNN”“-Bi-LSTM”“-EEGCN”和“-MHattention”分别表示不加入字符级的词表示、不加入Bi-LSTM层、不引入依存句法信息和图神经网络、不引入多头注意力,Pipeline表示不进行端到端学习,将触发词识别、要素检测和事件评估分离为独立的模块,“Pipeline-MHEEGCN”表示在单通道的方式下去除图神经网络和多头注意力。

表5可以看出,在不加入字符级的词表示情况下,和本文整体模型相比整体的事件抽取F1值下降0.24%,这是因为字符级的词表示考虑了单词在形态学方面的信息和知识,包含了单词的前后缀信息,证明了字符级的词表示的引入能提升事件抽取效果。在去掉Bi-LSTM层后,和本文整体模型相比事件抽取的精确率和召回率都会下降,F1值下降0.41%,这是因为K层图神经网络只能捕获到K阶邻居信息,当K过小时,模型就不能捕获到在句法依存图上相隔较远的节点之间的依存信息,当K过大时,模型会对上下文信息进行冗余的建模,就不能捕获到距离较短的节点之间的依存信息,而Bi-LSTM的加入实现了模型在使用较少层的图神经网络的情况下,可以自适应地整合节点之间较长的依存信息。在不加入依存信息和图神经网络模块后,F1值下降1.42%,这是因为依存句法信息表达了句子中的短语结构以及短语之间的层次句法关系,可以为事件抽取提供关键的信息,而图神经网络能有效对图信息进行建模,因此依存信息和图神经网络的引入能显著提升事件抽取效果。去掉多头注意力机制后,F1值下降0.48%,这是因为多头注意力机制可以让模型关注句子中更重要的部分,加强触发词和要素之间的交互信息,有效维护同一句子中不同事件的关联性,因此多头注意力的引入能提升生物事件抽取效果。采用Pipeline方式精确率下降2.46%,召回率上升0.74%,F1值下降0.59%,证明采用端到端的方式可以避免流水线的级联影响,加强子任务之间的交互性。在单通道方式下去除基于多头注意力的图神经网络后,精确率下降4.77%,召回率下降3.53%,F1值下降4.07%,验证了依存信息和端到端的方式能显著提升事件抽取结果。

2.2.3 ACE2005事件抽取结果

ACE2005数据集主要来自新闻语料,包含广播新闻、新闻专线等6个来源,定义了8种事件类型和33种子类型,事件论元在事件充当的角色有35类,ACE2005和生物医学数据集有点不同,ACE数据集中不存在复杂事件,但存在同一个句子中含有多个事件,且论元可以充当多个事件的论元,ACE事件抽取任务只包含触发词识别和论元识别两个任务。为了验证本文模型在其他领域数据集上的效果,本文把模型迁移到ACE2005数据集进行实验,并与不同文献模型进行比较与分析,实验结果如表6所示。

表6中文献[36]使用动态多池化卷积神经网络捕获句子中更丰富的语义特征;文献[20]将句子的依存树集成到依赖桥循环神经网络中;文献[23]引入依存句法信息和基于实体提及的池化方法;文献[24]提出JMEE模型,引入依存句法结构,用GCN建模图信息,利用自注意力聚合事件之间的联系;文献[25]引入依存句法结构,用多阶图注意力卷积神经网络建模图信息;文献[26]提出EEGCN模型,不仅利用句法结构还对依存关系标签进行建模。

表6可知,本文模型在触发词识别和论元识别上要优于文献[362024],这是因为文献[362024]仅仅利用了依存句法结构信息,没有对节点之间的依存关系类型标签进行建模,而本文引入依存句法结构信息和依存关系信息,并融合多头注意力机制来加强触发词和论元、事件和事件之间的联系。在触发词识别上本文模型也优于文献[232526],这是因为本文采用端到端的方式避免了错误传播,利用任务之间的相关性提升了子任务的效果,同时使用多头注意力机制捕获触发词和论元、事件和事件之间的信息,此外在嵌入层本文模型还引入了字符级的词表示,利用了单词在形态学方面的信息和知识,从而显著提升事件抽取效果,验证了本文模型的有效性。

3  结 语

本文采用端到端的方式进行生物医学事件抽取,避免了以流水线方式进行生物医学事件抽取中存在错误传播的问题,同时引入依存句法结构和依存关系信息,通过图神经网络来建模图信息,将句子从序列的模式转化成了句法依存图的模式,使用多头注意力机制来关注句子中重要的部分,维护同一句子中多个事件之间的关联信息。在生物数据集和ACE2005数据集上的抽取结果与其他文献方法的结果进行了对比,结果表明本文提出的模型效果较好。

尽管本文提出的方法在生物医学事件抽取任务上取得不错的效果,但需在以下方面做进一步研究:一是生物医学事件抽取的数据集存在不均衡和稀疏的问题,模型很难得到充分的训练,未来可以尝试通过半监督学习的方法或者强化学习的方法来解决语料集不足的问题;二是复杂事件在生物医学数据集占据相当一部分,因此如何提高复杂事件的抽取效果仍是未来研究的重点。

参考文献

[1]

KIM J DOHTA TPYYSALO Set al. Overview of BioNLP’09 shared task on event extraction[C]//Proceedings of the Workshop on BioNLP Shared Task - BioNLP’09. Stroudsburg: Association for Computational Linguistics, 2009: 1-9. DOI:10.3115/1572340.1572342 .

[2]

KIM J DPYYSALO SOHTA Tet al. Overview of bionlp shared task 2011[C]//Proceedings of the BioNLP Shared Task 2011 Workshop. Stroudsburg :Association for Computational Linguistics,2011: 1-6. DOI: 10.1111/j.1467-8640.2011.00398.x .

[3]

NÉDELLEC CBOSSY RKIM J Det al. Overview of bionlp shared task 2013[C]//Proceedings of the BioNLP Shared Task 2013 Workshop. Stroudsburg :Association for Computational Linguistics,2013: 1-7.

[4]

CHAIX EDUBREUCQ BFATIHI Aet al. Overview of the regulatory network of plant seed development (SeeDev) task at the BioNLP shared task 2016[C]//Proceedings of the 4th BioNLP Shared Task Workshop. Stroudsburg: Association for Computational Linguistics, 2016: 1-11. DOI:10.18653/v1/w16-3001 .

[5]

KILICOGLU HBERGLER S. Syntactic dependency based heuristics for biological event extraction [C]//Proceedings of the Workshop on BioNLP Shared Task-BioNLP’09. Stroudsburg: Association for Computational Linguistics, 2009: 119-127. DOI:10.3115/1572340.1572361 .

[6]

XUAN Q PMINH Q LBAO Q. A Hybrid approach for biomedical event extraction[C]//Proceedings of the BioNLP Shared Task 2013 Workshop. Stroudsburg:Association for Computational Linguistics,2013:121-124.

[7]

QUOC BDAVID CERIK Met al. A fast rule-based approach for biomedical event extraction[C]// Proceedings of the BioNLP Shared Task 2013 Workshop. Stroudsburg :Association for Computational Linguistics, 2013: 104-108.

[8]

BJÖRNE JHEIMONEN JGINTER Fet al. Extracting complex biological events with rich graph-based feature sets[C]//Proceedings of the Workshop on BioNLP Shared Task - BioNLP’09. Stroudsburg: Association for Computational Linguistics, 2009: 10-18. DOI:10.3115/1572340.1572343 .

[9]

KAI HSOFIE V LTAPIO Set al. EVEX in ST’13: Application of a large-scale text mining resource to event extraction and network construction[C]// Proceedings of the BioNLP Shared Task 2013 Workshop. Stroudsburg:Association for Computational Linguistics,2013:26-34.

[10]

ZHOU D YZHONG D Y. A semi-supervised learning framework for biomedical event extraction based on hidden topics[J]. Artificial Intelligence in Medicine201564(1): 51-58. DOI:10.1016/j.artmed.2015.03.004 .

[11]

LI L SLIU S SQIN M Yet al. Extracting biomedical event with dual decomposition integrating word embeddings [J]. IEEE/ACM Transactions on Computational Biology and Bioinformatics201613(4): 669-677. DOI:10.1109/TCBB.2015.2476876 .

[12]

LI L SLIU Y. Exploiting argument information to improve biomedical event trigger identification via recurrent neural networks and supervised attention mechanisms[C]//2017 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). New York: IEEE Press, 2017: 565-568. DOI:10.1109/BIBM.2017.8217711 .

[13]

LI L SHUANG M ZLIU Yet al. Contextual label sensitive gated network for biomedical event trigger extraction[J]. Journal of Biomedical Informatics201995: 103221. DOI:10.1016/j.jbi.2019.103221 .

[14]

FEI HREN Y FJI D H. A tree-based neural network model for biomedical event trigger detection[J]. Information Sciences2020512(3): 175-185. DOI:10.1016/j.ins.2019.09.075 .

[15]

魏优, 刘茂福, 胡慧君. 基于深层语境词表示与自注意力的生物医学事件抽取[J]. 计算机工程与科学202042(9): 1670-1679. DOI:10.3969/j.issn.1007-130X.2020.09.018 .

[16]

WEI YLIU M FHU H J. Biomedical event extraction based on deep contextual word representation and self-attention[J]. Computer Engineering and Science202042(9): 1670-1679. DOI:10.3969/j.issn.1007-130X.2020.09.018(Ch ).

[17]

ELAHEH S BANTONIO J Yet al. Global locality in biomedical relation and event extraction [C]// Proceedings of the 19th SIGBioMed Workshop on Biomedical Language Processing. Stroudsburg :Association for Computational Linguistics,2020:195-204.DOI:10.18653/v1/2020.bionl .

[18]

RAMPONI AGOOT R VAN DERLOMBARDO Ret al. Biomedical event extraction as sequence labeling[C]//Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP). Stroudsburg: Association for Computational Linguistics, 2020: 5357-5367. DOI:10.18653/v1/2020.emnlp-main.431 .

[19]

MIWA MBANSAL M. End-to-end Relation Extraction Using LSTMs on Sequences and Tree Structures[DB/OL].[2021-02-02].https://arxiv.org/pdf/1601.00770.pdf. DOI:10.18653/v1/p16-1105 .

[20]

张玉坤, 刘茂福, 胡慧君. 基于联合神经网络模型的中文医疗实体分类与关系抽取[J]. 计算机工程与科学201941(6): 1110-1118. DOI:10.3969/j.issn.1007-130X.2019.06.021 .

[21]

ZHANG Y KLIU M FHU H J. Chinese medical entity classification and relationship extraction based on joint neural network model [J]. Computer Engineering and Science201941(6): 1110-1118. DOI:10.3969/j.issn.1007-130X.2019.06.021(Ch ).

[22]

SHA LQIAN FCHANG B Bet al. Jointly Extracting Event Triggers and Arguments by Dependency Bridge RNN and Tensor Based Argument Interaction [DB/OL].[2021-01-02].http://shalei120.github.io/docs/sha2018Joint.pdf.

[23]

ORR J W, TADEPALLI PFERN X L. Event Detection with Neural Networks [DB/OL].[2021-02-02].https://arxiv.org/pdf/1808.08504.pdf.

[24]

KIPF T NWELLING M. Semi-Supervised Classification with Graph Convolutional Networks [DB/OL].[2021-02-02].

[25]

NGUYEN T HGRISHMAN R. Graph Convolutional Networks with Argument Aware Pooling for Event Detection [DB/OL].[2021-08-05].https://

[26]

LIU XLUO Z CHUANG H Y. Jointly multiple events extraction via attention-based graph information aggregation [C]//Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2018: 1247-1256. DOI:10.18653/v1/d18-1156 .

[27]

YAN H RJIN X LMENG X Bet al. Event detection with multi-order graph convolution and aggregated attention [C]//Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing(EMNLP-IJCNLP). Stroudsburg: Association for Computational Linguistics, 2019: 5765-5769. DOI:10.18653/v1/d19-1582 .

[28]

CUI S YYU B WLIU T Wet al. Edge-Enhanced Graph Convolution Networks for Event Detection with Syntactic Relation [DB/OL].[2021-08-05].https://arxiv.org/pdf/ 2002.10757v2.pdf.

[29]

YU J TBOHNET BPOESIO M. Named entity recognition as dependency parsing [C]//Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2020: 6470-6476. DOI:10.18653/v1/2020.acl-main.577 .

[30]

WANG A RWANG JLIN H Fet al. A multiple distributed representation method based on neural network for biomedical event extraction [J]. BMC Medical Informatics and Decision Making201717(3): 59-66. DOI:10.1186/s12911-017-0563-9 .

[31]

PYYSALO SOHTA TRAK Ret al. Overview of the cancer genetics and pathway curation tasks of BioNLP shared task 2013 [J]. BMC Bioinformatics201516(): S2. DOI:10.1186/1471-2105-16-s10-s2 .

[32]

KIM JWANG YTAKAGI Tet al. Overview of Genia Event Task in BioNLP shared Task 2011 [DB/OL].[2021-08-05]. https://dl.acm.org/doi/pdf/ 10.5555/2107691.2107693.

[33]

PYYSALO SOHTA TMIWA Met al. Event extraction across multiple levels of biological organization [J]. Bioinformatics201228(18): i575-i581. DOI:10.1093/bioinformatics/bts407 .

[34]

MIWA MANANIADOU S. Adaptable, high recall, event extraction system with minimal configuration [J]. BMC Bioinformatics201516(10): 1-11. DOI:10.1186/1471-2105-16-S10-S7 .

[35]

BJÖRNE JSALAKOSKI T. Biomedical event extraction using convolutional neural networks and dependency parsing [C]//Proceedings of the BioNLP 2018 Workshop. Stroudsburg: Association for Computational Linguistics, 2018: 98-108. DOI:10.18653/v1/w18-2311 .

[36]

LI L SLIU YQIN M Y. Extracting biomedical events with parallel multi-pooling convolutional neural networks[J]. IEEE/ACM Transactions on Computational Biology and Bioinformatics202017(2): 599-607. DOI:10.1109/TCBB.2018.2868078 .

[37]

ZHU LZHENG H R. Biomedical event extraction with a novel combination strategy based on hybrid deep neural networks [J]. BMC Bioinformatics202021(1): 1-12. DOI:10.1186/s12859-020-3376-2 .

[38]

CHEN Y BXU L HLIU Ket al. Event extraction via dynamic multi-pooling convolutional neural networks [C]//Proceedings of the 53rd Annual Meeting of the Association for Computational Linguistics and the 7th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2015: 167-176. DOI:10.3115/v1/p15-1017 .

基金资助

国家重点研发计划项目(2019YFC1712504)

贵州省科技计划项目(黔科合后补助[2020]3003)

AI Summary AI Mindmap
PDF (1431KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/