融合实体上下文特征的深度文本语义匹配模型

徐文峰 ,  杨艳 ,  张春凤

武汉大学学报(理学版) ›› 2020, Vol. 66 ›› Issue (5) : 483 -494.

PDF (1941KB)
武汉大学学报(理学版) ›› 2020, Vol. 66 ›› Issue (5) : 483 -494. DOI: 10.14188/j.1671-8836.2020.0041
计算机科学

融合实体上下文特征的深度文本语义匹配模型

作者信息 +

Incorporating Entity Context Features for Deep Text Semantic Matching

Author information +
文章历史 +
PDF (1986K)

摘要

为提高文本匹配过程中对实体上下文和语义关联信息的学习能力,提出一种融合实体上下文特征的深度文本语义匹配模型。该模型通过学习深度多视图语义交互信息和实体上下文特征匹配矩阵来计算文本的综合匹配得分,采用双向长短时记忆网络和共注意力机制获取文本的局部语义特征并进行多视图向量交互匹配,同时,针对文本中提取到的实体计算上下文特征,通过实体匹配矩阵和卷积神经网络进行实体上下文语义匹配。在SNLI、MultiNLI和Quora Question Pairs数据集上分别与已有基准模型对比,实验结果表明,相比经典深度文本匹配模型,本文提出的融合实体上下文特征的文本匹配模型可以有效提升文本匹配的准确度。

Abstract

To promote the learning of entity context and semantic relevance information in text matching, a deep text semantic matching model incorporating entity context features is proposed. This model calculates the comprehensive matching score of text by learning deep multi-view semantic interaction information and entity context feature matching matrix. Bidirectional long short-term memory network (Bi-LSTM) and co-attention mechanism are used to obtain the local semantic features of the text and perform interactive multi-view vector matching. Meanwhile, context features are calculated for the extracted entities in the text, and entity context semantic matching is carried out through entity matching matrix and convolutional neural network. On SNLI, MultiNLI and Quora Question Pairs datasets, the experimental results show that the proposed model can effectively improve the accuracy of text matching compared with the classical deep text matching model.

Graphical abstract

关键词

文本语义匹配 / 多语义文档表示 / 卷积神经网络 / 双向长短时记忆网络 / 注意力机制

Key words

text semantic matching / multi-semantic text representation / CNN (convolutional neural network) / Bi-LSTM (bidirectional long short-term memory) / attention mechanism

引用本文

引用格式 ▾
徐文峰,杨艳,张春凤. 融合实体上下文特征的深度文本语义匹配模型[J]. 武汉大学学报(理学版), 2020, 66(5): 483-494 DOI:10.14188/j.1671-8836.2020.0041

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

文本语义匹配(text semantic matching)1是自然语言处理领域的一项基础技术,旨在分析和判别两个文本之间的语义关联,并广泛应用于自然语言推理(natural language inference)2、语义鉴别(paraphrase identification)3、信息检索(information retrieval)4和问答对话(question answering)5等任务。自然语言推理又称文本蕴含识别(textual entailment recognition),用文本语义匹配技术可以判断一个假设语句是否可以由给定前提语句推导而来;在语义鉴别任务中,用文本语义匹配技术可判别两个语句是否表达相同的语义信息;在问答对话中,文本语义匹配可被用于查找与问题相关的内容和选择问题对应的答案。传统的文本匹配方法包括基于符号匹配的方法(如基于关键词、基于模板和基于正则表达式的文本匹配算法等)以及基于统计机器学习的方法(如基于贝叶斯网络、基于条件随机场的文本匹配算法等),这两种方法难以准确捕获文本所表达的深层语义信息。由于人类语言的多元性和复杂性,人们更期望计算机能够进行精准的自然语言理解和文本内容语义层面的智能匹配6

近年来,随着深度学习研究的深入,深度神经网络模型不仅在图像处理、语音识别领域展现出了较好的性能,也在自然语言处理领域展现出了很大的优势。由于传统的基于机器学习的文本匹配模型需要人为定义和抽取文本特征,参数较少、泛化能力较差,所以目前对文本匹配的研究逐渐向深度文本语义匹配转移,深度神经网络模型(如循环神经网络、卷积神经网络、递归神经网络、长短时记忆网络等)被越来越多地采用。深度神经网络模型的自动特征提取能力和近几年文本表示预训练模型(如Word2Vec7、GloVe8、ELMO9、BERT10、XLNet11等)的不断提出,可以较好地解决词语匹配的多元性问题,也能较好地符合短语匹配的结构性和文本匹配的层次性问题1

在国内外学者的共同努力下,针对基于深度神经网络的文本语义匹配研究,也有了很多研究成果,不仅构建了一批高质量的标注数据集(如Quora Question Pairs12,SNLI13、MultiNLI14、WikiQA15和Twitter-URL16等),而且还提出了很多有效的研究方法和模型。已有的深度文本语义匹配模型大体可以分为以下3类模式117:1) 基于单语义文档表达的匹配模式,以DSSM18、CDSSM19、LSTM-RNN(long short-term memory-recurrent neural network)20等模型为代表,简单地使用全连接网络、卷积神经网络或循环神经网络之类的网络结构以完全独立的方式来编码两个句子为固定长度的稠密文档向量,然后计算稠密文档向量之间的相似度,将其作为文本句子的匹配程度;2) 基于多语义文档表达的匹配模式,以MV-LSTM21、uRAE22、MultiGranCNN23模型为代表,针对单一粒度向量表示一段文本不够精细,分别从词、短语、句子等多粒度和多视图来解读句子语义信息,考虑到句子的局部结构,允许使用诸如句子间注意力信息等交互特征,最后计算不同粒度向量之间的相似度,将其作为文本之间的匹配度;3) 直接建模匹配模式,如DeepMatch24、ARC-II25、MatchPyramid26、Match-SRNN27模型,直接计算待匹配的句子间不同单词的交互和处理句子中的语义联系,再用深度神经网络挖掘交互后的模式特征,综合计算文本之间的匹配度。

相比基于单语义文档表达的匹配模式和直接建模匹配模式,基于多语义文档表达的匹配模型通过从不同粒度的表达可以学习到更全面更丰富的信息,便于取得更好的效果1,然而基于多语义文档表达的匹配模型在处理和整合局部知识关联和全局语义信息上存在缺陷。其次,我们发现待匹配的两个文本通常会共享一些重要的实体信息,而这些实体所在的上下文信息对理解整个句子的语义至关重要,也常常被现有模型忽略。

为了解决上述问题,本文提出一种融合实体上下文特征的深度文本语义匹配模型,该模型可以在文本匹配过程中自动学习上下文语境的局部结构特征和实体上下文语义特征,它隶属于基于多语义文档表示的文本匹配模式。首先,采用预训练词向量、词语上下文卷积特征和精确匹配标识(exact match flag)拼接来表示输入文本向量。然后,参考DRCN模型28用双向长短时记忆网络(Bi-LSTM)和共注意力机制(co-attention)获取文本的局部和全局语义特征并进行多视图向量交互匹配,通过全连接神经网络来提取交互匹配特征和计算多视图语义匹配得分。与此同时,使用自然语言处理工具提取文本语句中的命名实体,并通过卷积神经网络来编码实体的上下文语义表示,利用余弦距离或双线性操作或张量计算构建实体匹配矩阵,使用二维卷积操作和多层感知器(MLP,multi-layer perceptron)计算实体语义匹配得分。最后,通过以上多视图语义交互匹配得分和实体语义匹配得分计算文本语义匹配综合加权评分。模型的所有参数可以通过训练数据集自动学习,并采用BP(back propagation)和SGD(stochastic gradient descent)优化算法进行模型训练。

我们在SNLI13、MultiNLI14和Quora Question Pairs12数据集上分别与DIIN29、MV-LSTM21及DRCN28等基准模型对比,实验结果表明相比经典深度文本匹配模型,本文提出的融合实体上下文特征的文本匹配模型在自然语言推理任务和语义鉴别任务上可以有效提升文本匹配的准确度,其中基于张量计算相似度的方式所获得的性能提升最大。

1  问题和通用框架介绍

1.1 问题定义及建模

文本语义匹配问题1可以定义为:给定已标注的训练数据集合Τtrain={(Xk,Yk),Rk}k=1N,其中XkXYkY分别是语料X和语料Y的第k段待匹配的文本,Rk表示XkYk的匹配程度。文本语义匹配的主要任务是通过训练数据训练文本匹配模型,让模型学习如何自动进行文本语义匹配

score(Xk,Yk)=F(Φ(Xk),Φ(Yk))

其中,Xk=(x1k,x2k,,xmk)Yk=(y1k,y2k,,ynk)xikyik分别是文本XkYk中第i和第j个词汇,Φ()表示将文本进行词向量表征的函数,F()表示计算两段文本语义匹配分值的匹配模型。

1.2 深度文本语义匹配通用框架

现有深度文本语义匹配模型可以归纳为图1所示的通用框架30,每一层的功能如下:

• 输入向量化表示层(input embedding layer):把文本中的单词或短语表示为词向量、短语向量、子词向量(subword embedding)作为输入,如通常使用的预训练词向量GloVe8、Word2Vec7等。同时还可以采用预处理工具把命名实体、词性、词法和句法信息加入特征向量。

• 上下文编码层(context encoding layer):采用CNN(卷积神经网络)、Bi-RNN(双向循环神经网络)、递归神经网络等经典网络结构编码文本上下文信息和学习更深层特征,或者使用注意力机制(attention mechanism)建模长时依赖和局部特征。

• 交互层(interaction layer):通过使用上下文编码层的输出,计算两短文本特征向量或词汇序列之间的相似性构建交互矩阵或张量。向量相似性计算方法通常包括余弦相似性(cosine similarity)、向量点积(dot product)、欧氏距离(Euclidean distance)等。不同的模型对不同的交互作用赋予不同的权重,主要是模拟两个句子之间的单词对齐。对齐信息对于句子对建模非常有用,因为两个句子之间的语义关系很大程度上依赖于对齐的块之间的关系30

• 特征提取层(feature extraction layer):采用诸如AlexNet31、VGG32、Inception33、DenseNet34、ResNet35等卷积特征提取器或者添加多层全连接网络(MLP),从交互矩阵或张量中抽取更深层的语义对齐和语义交互特征。

• 输出分类层(output classification layer):整合特征提取层输出的深层语义交互特征向量,最后使用softmax函数预测每个关系类别的概率或者使用线性变换计算匹配得分。

2  本文提出的模型

2.1 模型总体框架描述

本文所提出的深度文本语义匹配模型如图2所示,主要包括两个模块:深度多视图语义匹配模块(左)、基于实体上下文特征的语义匹配模块(右)。两个模块同时将语句X:“France is the champion of the 2018 FIFA World Cup”和语句Y:“France won the FIFA World Cup in 2018”作为输入,分别计算文本语义匹配得分ss',然后加权求和得到模型最终的综合匹配得分score(X,Y)=s+λs'

2.2 深度多视图语义匹配模块

该模块由以下几部分构成:1) 文本向量化表示,2) 词汇上下文编码,3) 向量交互匹配,4) 交互特征提取和预测。定义两个输入语句为X={x1,x2,,xm}Y={y1,y2,,yn},其中xiyj分别是文本XY中第i和第j个词汇,mn是语句XY的长度。

2.2.1 文本向量化表示

针对输入语句XY,通过拼接预训练词向量(包括可训练词向量和固定词向量)、词语上下文卷积特征向量(包括词汇前文编码向量和词汇后文编码向量)和精确匹配标识来构建文本向量化表示。

首先,每个词通过GloVe预训练词嵌入矩阵映射为d维词向量,词向量在训练过程中可以同步更新或固定不变,可训练词向量便于获取到训练数据的特性,但是容易造成过拟合。固定词向量(在训练过程中保持不变)在特定任务数据上又缺乏灵活性。所以在我们的模型中同时采用可训练词向量exitr和固定词向量exifix以达到互补的效果。

其次,通过卷积神经网络计算上下文向量,把词汇前文(从语句开头到当前词汇)和后文(从当前词汇到语句结尾)分别输入一维卷积神经网络(卷积核的宽度为3)并采用最大池化操作,得到词汇前文编码向量cxibefore和词汇后文编码向量cxiafter。这里预训练词汇向量采用固定的GloVe词向量,卷积网络参数通过训练学习进行调整。

使用精确匹配标识fxi标记词汇是否出现在另一个语句中。最后通过拼接可训练词向量、固定词向量、词汇前文编码向量、词汇后文编码向量、精确匹配标识这5个特征向量来表示单词xi的特征向量,表达式如下

xiw=[exitr;exifix;cxibefore;cxiafter;fxi]

其中:

exitr=Etr(xi),exifix=Efix(xi)
cxibefore=Conv(x1xi-1),cxiafter=Conv(xi+1xm)

EtrEfix分别是可训练和不可训练词向量矩阵,Conv表示一维卷积操作。对于语句中的每一个词都执行上述步骤来抽取词汇特征向量。

2.2.2 词汇上下文编码

采用双向长短时记忆网络(Bi-LSTM)编码输入文本序列特征,t位置的隐含状态输出为

ht=[LSTM(xt,ht-1)T, LSTM(xt,ht-1)T]T

其中LSTM(xt,ht-1)LSTM(xt,ht-1)分别表示Bi-LSTM模型在t位置的正向输出和反向输出,()T表示转置。

为了保留原始文本特征,便于梯度传播,参考DenseNet34和ResNet35添加残差连接到Bi-LSTM的输出,并拼接htxt以保留隐含特征进行向量交互匹配。那么,t位置的编码输出pxt表示为

pxt=[ht;xt]

参考DRCN28采用基于两个语句相关部分的共注意力机制(co-attention)计算每个词汇的上下文向量,该注意力信息可以表示两个语句之间的软对齐规则(soft alignment)。即相对于文本Y,文本X的第i个词汇xi的注意力信息可以通过如下方式计算

axi=j=1nαi,jhyj

其中:

αi,j=exp (ei,j)k=1nexp (ei,k)
ei,j=cos (hxi,hyj)

n为语句Y的长度,ei,jxi位置和yj位置隐含输出的余弦相似度,αi,j表示xi相对yj的注意力评分,axixi相对Y的注意力向量表示。

拼接基于注意力的上下文向量axi和触发后的hxi作为下一层的输入

pxt=[ht;xt;at]

针对输入语句Y,可以用针对输入语句X同样的步骤进行文本向量化表示、词汇上下文编码(包括计算相对X的共注意力信息)得到pyt,这样就得到了两段文本XY在每个位置t的编码输出向量,可以对不同位置的交互信息进行建模。

2.2.3 向量交互匹配

基于文本不同位置xiyj的向量表示pxipyj,多种相似性度量函数可以用来建模其交互信息,如余弦距离(cosine)、向量点积(dot product)等。借鉴MV-LSTM模型21中的方法,我们分别采用Cosine(余弦距离)、Bilinear(双线性变换)和Tensor Layer(张量变换)3种相似性度量函数来计算两个语句不同位置的交互信息。针对给定的两个向量uv,这3种相似性度量函数的评分分别表示为

Cosine:sC(u,v)=uTvuv
Bilinear:sB(u,v)=uTMv+b
Tensor Layer:sT(u,v)=f(uTM1:cv+Wuvuv+b)

(7)

其中,M是不同维度交互的权重矩阵,Mi,i[1,,c]是张量参数的一个时间切片,Wuvb是线性部分参数,f(z)=max (0,z)。Cosine和Bilinear函数输出交互矩阵,而Tensor Layer函数输出交互张量。Cosine相似度计算是一种常用做法,而Bilinear能够考虑不同维度之间的关联信息,因此相比Cosine方法能够捕获更复杂的交互信息。Tensor Layer在建模两个向量之间相互关系表现出了较大的优越性36,且能够退化为Bilinear和向量点积相似度度量方法。

2.2.4 交互特征提取和预测

现在我们要分别整合这3种语义交互信息以计算得到两个语句最终的匹配得分,通过一个K-Max池化层,保留交互矩阵或张量中前K个大元素。对于交互矩阵,K-Max池化后得到K个数值,以降序排列,组成一个新的向量q。对于交互张量,每个张量切片在K-Max池化后返回K个数值形成一个向量,所有张量切片返回向量拼接在一起构成向量q。最后,把向量q输入多层感知机(MLP),通过全连接神经网络获取更深层次交互向量表示r,然后用一个线性变换输出匹配得分值s,其表达式如下

r=f(Wrq+br),s=Wsr+bs

其中,WrWs分别是权重矩阵,brbs为偏置向量,f()是非线性激活函数。

2.3 基于实体上下文特征的语义匹配模块

该模块包括4部分:1) 命名实体识别,2) 实体上下文编码,3) 实体交互匹配,4) 匹配特征提取和预测。

2.3.1 命名实体识别

在进行实体上下文特征提取之前,要先找到文本里面所包含的命名实体。实体是语句中的一个文本片段,通常由一个或者多个连续的单词构成。如图2中的语句Y“France won the FIFA World Cup in 2018”包含“France”和“the FIFA World Cup”两个实体。直接使用已有自然语言处理基础工具来识别命名实体,如NLTK、StanfordNLP。针对语句XY分别抽取得到实体集合{entxi}i=1k{entyi}i=1l

2.3.2 实体上下文编码

由于实体所体现的语义信息与实体所处的上下文语境关联较大,在找出文本语句中包含的所有候选命名实体之后,要提取实体上下文语义特征。本文采用两个不同参数的一维卷积神经网络ConventityConvcontext分别对命名实体片段和命名实体所处上下文进行特征抽取。由于实体长度通常比上下文语境短,实体的卷积过滤器的宽度自然要比上下文语境的小。针对命名实体之前的文本片段和命名实体之后的文本片段分别进行特征提取。然后,对实体和上下文特征向量分别采用K-Max池化,公式如下

ventxi=KMax{Conventity(entxi)}
vctxxi-=KMax{Convcontext(ctxxi-)}
vctxxi+=KMax{Convcontext(ctxxi+)}

再将上述3向量表征拼接

vxi=[ventxi;vctxxi-;vctxxi+]

其中,entxictxxi-ctxxi+分别表示语句X中第i个命名实体、实体之前的文本片段、实体之后的文本片段。KMax{}K-Max池化操作,ventxivctxxi-vctxxi+分别表示通过卷积神经网络和K-Max池化获得的实体、实体前文、实体后文的向量表征。

2.3.3 实体交互匹配

针对语句X中的k个实体上下文特征向量{vxi}i=1k和语句Y中的l个实体上下文特征向量{vyi}i=1l,采用与2.2.3节相同的3种向量相似性计算方法:Cosine、Bilinear和Tensor Layer,计算语句X和语句Y中的实体匹配矩阵或张量。

2.3.4 匹配特征提取和预测

针对上一步计算得到的Cosine实体匹配矩阵、Bilinear实体匹配矩阵或Tensor Layer实体匹配张量,分别采用二维卷积操作和K-Max池化操作,得到向量q'

最后,把向量q'输入多层感知机(MLP),通过全连接神经网络获取更高级别向量表示r',然后用一个线性变换输出匹配得分值s',其表达式如下

r'=f(Wr'q'+br'),  s'=Ws'r'+bs'

2.4 模型训练

对语句XY进行深度文本语义匹配,最终得分为

score(X,Y)=s+λs'

其中,s是深度多视图语义模块的匹配得分,s'是基于实体上下文特征的语义匹配模块得分,λ为平衡因子,用于调节两个模块的得分比重。

模型训练任务可以看作一个排序(ranking)问题,即最小化模型输出与真实匹配程度的差异

minimize {score(Xk,Yk)-Rk}

对于给定正样本(Xk,Yk)和负样本(Xk,Y-k),正样本的排名和匹配得分比负样本高,模型的损失函数可以定义为hinge损失函数

(Xk,Yk,Y-k)=max (0, 1-score(Xk,Yk)+score(Xk,Y-k))

本文采用AdaGrad37算法迭代优化模型,并使用反向传播(BP)算法和随机梯度下降(SGD)算法联合训练词向量、Bi-LSTM、CNN、MLP等参数。以Tensor Layer为例进行交互评分,整个模型的训练过程如算法1所示,Cosine和Bilinear相似度度量函数依此类推。

假设待匹配的两个语句XY的长度分别为mn,词向量的维度为d,Bi-LSTM隐含层节点数为h,MLP(多层感知机)的隐含层节点数为pK-Max池化层取k个最大值,c为Tensor Layer张量切片数量(slices of tensor),假设从XY中分别抽取到了lxly个实体,那么算法各部分的时间复杂度和空间复杂度如表1所示。由表1可见,本文提出模型的复杂度最大的是Bi-LSTM和向量交互匹配部分,3种相似性交互计算方法中,Tensor Layer的复杂度最高(与张量维度c成正比),Cosine的复杂度最低。

3  实 验

为了验证本文提出的融合实体上下文特征的深度文本语义匹配模型的有效性,分别在SNLI13和MultiNLI14数据集上测试自然语言推理(natural language inference)任务,在Quora Question Pairs12数据集上测试语义鉴别(paraphrase identification)任务。

3.1 数据集

SNLI13是一个基于图像自动描述的包含约57万个众包的前提-假设对集合,根据给定的前提(premise)书写相应的假设(hypothesis),该数据集支持自然语言推理任务,数据语义关系标签包括蕴含(entailment,前提语句蕴含假设语句)、中立(neutral,前提和假设没有相关性)和矛盾(contradict,前提和假设相互对立)3个类别。

MultiNLI14数据集又称Multi-Genre NLI,由SNLI语料扩展到10种不同种类的英文口头和书面语数据,包含约43.3万个语句对,集合的规模和模式与SNLI类似,也包括蕴含、中立和矛盾3个标签。另外,开发和测试数据集分为matched sets和mismatched sets,其中matched sets表示开发集和测试集与训练集来源于同一个数据源,而mismatched sets则表示开发集和测试集中的样本在训练模型时并没有出现过,因此可以判断模型是否过拟合、是否具有良好的泛化性能。

Quora Question Pairs12包含超过40万个基于真实Quora网站问题的问题对。每个问题对含有一个二进制数据标签positive或negative,分别表示两个问题的语义一致或不一致。

以上3个数据集的统计信息、样本示例和标签类别如表2所示。

3.2 对比模型

我们分别与以下基准模型进行实验对比:

MV-LSTM21:采用Bi-LSTM(双向长短时记忆网络)分别从前往后和从后向前两个方向同时扫描,在同一个位置得到两个向量表达,表示从句子开始位置和结束位置到当前位置的一个内容整合。然后把同一位置的两个表达拼接在一起作为当前位置为中心的整个句子的表达。不同中心词产生不同视图的表达形成一个集合表示整个句子。然后两个句子不同视图的句子表达两两计算相似度,得到一个相似度矩阵,通过动态最大池化加上全连接网络得到最后的相似度得分。

ESIM38:提出一种基于Bi-LSTM和tree-LSTM的混合神经推理模型,该模型分别采用Bi-LSTM序列模型编码词汇及上下文的局部推理信息和交互信息,采用tree-LSTM语法树模型编码短语及从句的局部语法信息和交互信息。在局部推理建模和推理组合中显示采用递归架构,融合句子的语法信息,可以有效提高模型的推理能力。

BiMPM39:提出一种双边多角度匹配模型,该模型使用Bi-LSTM编码两个语句,然后从正反两个方向匹配编码后的语句。利用另一个Bi-LSTM层将匹配结果聚合为固定长度匹配向量。

CAFÉ40:提出一种新的网络结构,对齐的文本对通过比较、压缩后传播到上层进行增强表示学习。然后,使用分解层来有效地压缩对齐向量为标量特征,以此增强基础文本表示能力。

LM-Transformer41:通过在大量无标签数据上训练生成式预训练语言模型,然后针对特殊任务做判别式微调可以取得良好的效果。在微调过程中根据任务对输入做转变可以在极少改变模型结构的情况下获得有效的迁移能力。

DIIN29:提出一种新的交互推理网络体系架构,通过分层结构方法从交互空间分层提取语义信息获得对文本对的高级理解。

DRCN28:提出一种密集连接的共注意力循环神经网络,网络的每层拼接注意力特征信息和之前循环层的隐含特征,保留原始和共注意力特征信息直至最靠上的循环层。为了解决密集连接操作带来的特征向量规模爆炸问题,在密集连接之后采用自动编码器来降维。

3.3 参数设置

初始化词向量为预训练的100维GloVe词向量,未登录词(OOV,out of vocabulary)词向量随机初始化,其他可训练变量通过均匀分布随机初始化,Bi-LSTM隐含层维度设为300。全连接网络MLP的隐含层维度设为100,(8)式的非线性激活函数f()选择tanh函数,dropout概率为0.2,词嵌入层dropout概率为0.5,Tensor Layer中张量M1:cc设为3。深度多视图语义匹配模块的词汇上下文词向量进行一维卷积的卷积核宽度为3。基于实体上下文特征的语义匹配模块中对实体上下文词向量进行一维卷积ConventityConvcontext的卷积核宽度分别为2和3,对实体匹配矩阵进行二维卷积的卷积核宽度为2×2。

设SGD batchsize为128,AdaGrad41优化算法的初始学习率为0.1,迭代训练次数epoch=1 000。所有权重矩阵通过L2正则化,正则化因子设为0.001。语句序列的长度分别为SNLI取35,MultiNLI取55,Quora Question Pairs取25。(10)式中平衡因子λ取值0.35。基于实体上下文特征的文本语义匹配模块中采用StanfordNLP工具进行命名实体抽取。

3.4 评估指标

由于我们将文本语义匹配任务转化为排序问题,输出按照文本匹配得分或者基准模型的正确分类类别概率降序排列。模型目标是使得正样本的排名比负样本的排名高,因此,参考MV-LSTM21使用排名第一的平均次数,即精准度P@1和平均倒数排名MRR(mean reciprocal rank)作为评估指标

P@1=1Ni=1Nδ(r(SY+i)=1)
MRR=1Ni=1N1r(SY+i)

其中,N是测试排序列表的长度,SY+i指第i个排序列表中的正样本语句,r()表示排序列表中语句的排名,δ是一个指示函数,即δ(true)=1δ(false)=0

另外,为了进一步与基准模型的性能进行对比,我们实施了分类任务实验,并采用分类准确率accuracy作为评价指标。

3.5 结果对比分析

表3显示了本文所提出的模型在SNLI、MultiNLI和Quora Question Pairs数据集上与基准模型的结果,Our(Cosine)、Our(Bilinear)、Our(Tensor)分别代表计算语义向量交互时所采用的Cosine、Bilinear和Tensor Layer 3种不同的相似度计算方法。从表3可以看到,我们模型的3种变体的性能在P@1和MRR指标上均优于MV-LSTM、ESIM、BiMPM、CAFÉ、LM-Transform和DIIN模型。基于Tensor Layer相似度计算交互的模型在3种变体中效果最好,其次是Bilinear,它们在P@1和MRR两个指标上明显优于其他基准模型。由于Bilinear方法能够捕获两个文本不同位置特征向量之间的交错交互,因此Bilinear方法比Cosine方法能够学到更有意义的交互信息。Tensor Layer是一种更强劲的相似性度量方法,不仅能够学习到两个文本之间线性交互信息,还能够学习到不同位置的交错交互信息。上述结果说明本文提出的融合实体上下文特征的深度文本语义匹配模型在SNLI、MultiNLI和Quora Question Pairs这3个数据集上具有明显的效果。

为了验证实体上下文特征信息和语义上下文卷积特征对文本语义匹配的作用,在SNLI数据集上对本文提出的模型进行了消融测试,结果如表4所示。其中,“-EntContext”表示不采用基于实体上下文特征的语义匹配模块,即只保留图2中的左侧深度多视图语义匹配模型;“-WordContext”表示在深度多视图语义匹配模块的文本向量表示部分,不采用词汇前文和词汇后文的卷积特征cxibeforecxiafter表4显示,与Our(Tensor)相比,去除基于实体上下文特征的语义匹配模块之后,模型的整体性能有明显的下滑,在P@1和MRR指标上分别下降了0.021和0.029。由此说明基于实体上下文特征的语义匹配模块对于文本语义匹配任务的重要性,这是因为该模块可以帮助模型学习和发现两个文本之间的实体语义关联信息。另外,去除了词汇前文和词汇后文的卷积特征之后的模型性能也存在下滑,在P@1和MRR指标上分别下降了0.011和0.015。

为了研究深度多视图语义匹配模块和基于实体上下文特征的语义匹配模块之间的权重,分别取权重系数λ为0.10,0.35,0.50,1.00,5.00进行实验,结果如表5。从表5可以看出,λ=0.35时,P@1和MRR指标最好,而λ大于0.35后,模型性能逐渐变差。

为了进一步验证本文所提出的模型对于分类任务的性能,我们在SNLI和MultiNLI测试数据集上进行了分类测试,结果如表6所示。其中,Matched表示所用测试集为MultiNLI matched测试集,测试样本与训练样本数据源相同;Mismatched表示mismatched测试集,测试样本在训练过程中没有出现过。从表6中的结果可以看出,本文提出的模型对于分类任务同样有效,特别是Our(Tensor)在MultiNLI上优于所有模型,在SNLI测试数据集上的性能接近LM-Transformer模型和DRCN模型,而本文提出的模型结构上没有DRCN模型那么复杂,且不同于LM-Transformer模型依赖于外部知识。

4  结 语

本文针对文本语义匹配问题,提出了一种融合实体上下文特征的深度文本语义匹配模型,该模型融合了深度多视图语义匹配方法和基于实体上下文特征的语义匹配方法。在SNLI、MultiNLI和Quora Question Pairs这3个数据集上进行文本匹配排序和分类任务的对比实验,结果证明本文提出模型能够有效提升文本语义匹配的性能。

参考文献

[1]

庞亮,兰艳艳,徐君,.深度文本匹配综述[J].计算机学报201740(4):985-1003. DOI: 10.11897/SP.J.1016.2017.00985 .

[2]

PANG LLAN Y YXU Jet al. A survey on deep text matching[J]. Chinese Journal of Computers201740(4):985-1003. DOI: 10.11897/SP.J.1016.2017.00985(Ch ).

[3]

PARIKH A PTACKSTROM O, DAS D, et al. A decomposable attention model for natural language inference[C]// Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: ACL, 2016:2249-2255.

[4]

YIN WSCHUTZE H. Convolutional neural network for paraphrase identification[C]// Proceedings of the 2015 Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Technologies. Stroudsburg,PA: NAACL, 2015:901-911.DOI: 10.3115/v1/n15-1091 .

[5]

LI HXU J. Semantic matching in search[J]. Foundations and Trends in Information Retrieval20147(5): 343-469. DOI: 10.1561/9781601988058 .

[6]

俞凯,陈露,陈博, .任务型人机对话系统中的认知技术—概念、进展及其未来[J].计算机学报201538(12):2333-2348. DOI: 10.11897/SP.J.1016.2015.02333 .

[7]

YU KCHEN LCHEN Bet al. Cognitive technologies in task-oriented dialogue systems: Concepts, advances and future[J]. Chinese Journal of Computers201538(12):2333-2348. DOI: 10.11897/SP.J.1016.2015.02333(Ch ).

[8]

LIU PQIU XCHEN Jet al. Deep fusion lstms for text semantic matching[C]// Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: ACL, 2016: 1034-1043.DOI: 10.18653/v1/p16-1098 .

[9]

MIKOLOV TSUTSKEVER ICHEN Ket al. Distributed representations of words and phrases and their compositionality[C]// Proceedings of the 26th International Conference on Neural Information Processing Systems. Cambridge: MIT Press, 2013: 3111-3119.DOI: 10.5555/2999792.2999959 .

[10]

PENNINGTON JSOCHER RMANNING C. GloVe: Global vectors for word representation [C]// Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: ACL, 2014:1532-1543.DOI: 10.3115/v1/D14-1162 .

[11]

PETERS M ENEUMANN MIYYER Met al. Deep contextualized word representations[C]// Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics. Stroudsburg: NAACL, 2018:2227-2237.

[12]

DEVLIN JCHANG M W, LEE K, et al. BERT: pre-training of deep bidirectional transformer for language understanding[C]// Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Stroudsburg: NAACL, 2019: 4171-4186.

[13]

YANG Z LDAI Z HYANG Y Met al. XLNet: generalized autoregressive pretraining for language understanding[C]// Proceedings of the 32th International Conference on Neural Information Processing Systems. Cambridge: MIT Press, 2019: 5754-5764.

[14]

AHMAD A. Quora question answering dataset[C]// International Conference on Text, Speech, and Dialogue. London: Springer, 2017:66-73.DOI: 10.1007/978-3-319-64206-2_8 .

[15]

BOWMAN S RANGELI GPOTTS Cet al. A large annotated corpus for learning natural language inference [C]// Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: ACL, 2015: 632-642.

[16]

WILLIAMS ANANGIA NBOWMAN S Ret al. A broad-coverage challenge corpus for sentence understanding through inference [C]// Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics. Stroudsburg: NAACL, 2018:1112-1122.

[17]

YANG Y, YIH W T, MEEK C. WikiQA: A challenge dataset for open-domain question answering[C]// Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: ACL, 2015: 2013-2018.

[18]

LAN W WQIU S YHE Het al. A continuously growing dataset of sentential paraphrases[C]// Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: ACL, 2017:1224-1234.

[19]

李宏广. 基于深度神经网络的文本匹配算法研究[D]. 合肥: 中国科学技术大学,2019.

[20]

LI H G. Text Matching Based on Deep Neural Network[D]. Hefei: China University of Science and Technology, 2019(Ch).

[21]

HUANG P SHE X DGAO J Fet al. Learning deep structured semantic models for web search using clickthrough data [C]// Proceedings of the 22nd ACM International Conference on Information and Knowledge Management. New York: ACM Press, 2013:2333-2338.DOI: 10.1145/2505515.2505665 .

[22]

SHEN Y LHE X DGAO J Fet al. A latent semantic model with convolutional-pooling structure for information retrieval[C]// Proceedings the 23rd ACM International Conference on Information and Knowledge Management. New York: ACM Press, 2014:101-110.

[23]

PALANGI HDENG LSHEN Yet al. Deep sentence embedding using long short-term memory networks: Analysis and application to information retrieval [J]. IEEE Transactions on AudioSpeech, and Language Processing. Piscataway:IEEE201624(4):694-707. DOI: 10.1109/TASLP.2016.2520371 .

[24]

WAN S XLan Y YGUO J Fet al. A deep architecture for semantic matching with multiple positional sentence representations [C]// Proceedings of the 30th AAAI Conference on Artificial Intelligence. Menlo Park: AAAI Press, 2016: 2835-2841.DOI: 10.1007/s10994-013-5363-6 .

[25]

SOCHER RHUANG E HPENNIN Jet al. Dynamic pooling and unfolding recursive autoencoders for paraphrase detection[C]// The 25th Annual Conference on Neural Information Processing Systems Neural Information Processing Systems. Cambridge: MIT Press, 2011: 801-809.

[26]

YIN W PSCHUTZE H. MultiGranCNN: An architecture for general matching of text chunks on multiple levels of granularity[C]// Proceedings of the 53rd Annual Meeting of the Association for Computational Linguistics and the 7th International Joint Conference on Natural Language Processing. Stroudsburg: ACL, 2015: 63-73.

[27]

LU ZLI H. A deep architecture for matching short texts[C]// Proceedings of the Advances in Neural Information Processing Systems. Stroudsburg: ACL, 2013: 1367-1375.

[28]

HU BLU ZLI Het al. Convolutional neural network architectures for matching natural language sentences[C]// Proceedings of the Advances in Neural Information Processing Systems. Stroudsburg: ACL, 2014: 2042-2050.

[29]

PANG LLAN Y YGUO J Fet al. Text matching as image recognition [C]// Proceedings of the 30th AAAI Conference on Artificial Intelligence. Menlo Park: AAAI Press, 2016: 2793-2799.DOI: 10.5555/3016100.3016292 .

[30]

WAN SLAN YGUO Jet al. Match-SRNN: Modeling the recursive matching structure with spatial RNN [C]// Proceedings of the 25th International Joint Conference on Artificial Intelligence. San Francisco: Morgan Kaufmann, 2016: 1022-1029.

[31]

KIM SKANG IKWAK Net al. Semantic sentence matching with densely-connected recurrent and co-attentive information[C]// Proceedings of the 33th AAAI Conference on Artificial Intelligence. Menlo Park: AAAI Press, 201933(1):2793-2799. DOI: 10.1609/aaai.v33i01.33016586 .

[32]

GONG Y CLUO HZHANG Jet al. Natural language inference over interaction space[C]// Proceedings of the 6th International Conference on Learning Representations (ICLR). New York: ICLR, 2018:1-15.

[33]

LAN W WXU W . Neural network models for paraphrase identification, semantic textual similarity, natural language inference, and question answering [C]// The 2018 International Conference on Computational Linguistics. New York: ACM Press,2018: 3890-3902 .

[34]

KRIZHEVSKY ASUTSKEVER IHINTON G E. Imagenet classification with deep convolutional neural networks [C]// Proceedings of the 26th Annual Conference on Neural Information Processing Systems. Stroudsburg: ACL, 2012: 1097-1105.

[35]

SIMONYAN KZISSERMAN A. Very deep convolutional networks for large-scale image recognition [C]// The 2014 IEEE Conference on Computer Vision and Pattern Recognition. Piscataway: IEEE,2014:1-14.

[36]

SZEGEDY CLIU WJIA Y Qet al. Going deeper with convolutions[C]// The 2015 IEEE Conference on Computer Vision and Pattern Recognition. Piscataway:IEEE Press, 2015: 1-9.

[37]

HUANG GLIU ZWEINBERGER K Qet al. Densely connected convolutional networks [C]// The 2017 IEEE Conference on Computer Vision and Pattern Recognition. Piscataway:IEEE Press, 2017:2261-2269. DOI:10.1109/CVPR.2017.243 .

[38]

HE KZHANG X YREN S Qet al. Deep residual learning for image recognition [C]// The 2016 IEEE Conference on Computer Vision and Pattern Recognition. Piscataway: IEEE Press,2016: 770-778.

[39]

QIU XHUANG X. Convolutional neural tensor network architecture for community-based question answering [C]// Proceedings of the 24th International Joint Conference on Artificial Intelligence (IJCAI). San Francisco: Margan Kaufmann, 2015: 1305-1311.

[40]

DUCHI JHAZAN ESINGER Y. Adaptive subgradient methods for online learning and stochastic optimization [J]. The Journal of Machine Learning Research201112: 2121-2159.

[41]

CHEN QZHU X DLING Z Het al. Enhanced LSTM for natural language inference [C]// Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: ACL. 2017: 1657-1668.DOI: 10.18653/v1/P17-1152 .

[42]

WANG Z GHAMZA WFLORIAN R. Bilateral multi-perspective matching for natural language sentences [C]// Proceedings of the 26th International Joint Conference on Artificial Intelligence. San Francisco: Morgan Kaufmann, 2017: 4144-4150.DOI: 10.24963/ijcai.2017/579 .

[43]

TAY Y, TUAN L AHUI S C . Compare, compress, and propagate: Enhancing neural architectures with alignment factorization for natural language inference[C]// Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: ACL, 2018: 1565-1575.DOI: 10.18653/v1/D18-1185 .

[44]

RADFORD ANARASIMHAN KSALIMANS Tet al. Improving Language Understanding by Generative Pre-Training[EB/OL].[2018-06-11].

基金资助

国家电网总部科技项目(536800180033)

AI Summary AI Mindmap
PDF (1941KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/