基于压缩与推理的长文本多项选择答题方法

夏旭 ,  刘茂福 ,  张耀峰 ,  胡慧君

武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (2) : 233 -242.

PDF (2094KB)
武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (2) : 233 -242. DOI: 10.14188/j.1671-8836.2022.0162

基于压缩与推理的长文本多项选择答题方法

作者信息 +

Long Text Multiple Choice Answer Method Based on Compression and Reasoning

Author information +
文章历史 +
PDF (2144K)

摘要

多项选择作为机器阅读理解中的一项重要任务,在自然语言处理(natural language processing,NLP)领域受到了广泛关注。由于数据中需要处理的文本长度不断增长,长文本多项选择成为了一项新的挑战。然而,现有的长文本处理方法容易丢失文本中的有效信息,导致结果不准确。针对上述问题,提出了一种基于压缩与推理的长文本多项选择答题方法(Long Text Multiple Choice Answer Method Based on Compression and Reasoning,LTMCA),通过训练评判模型识别相关句子,将相关句拼接成短文本输入到推理模型进行推理。为了提高评判模型的精度,在评判模型中增加了文章与选项之间的交互以补充文章对选项的注意力,有针对性地进行相关语句识别,更加准确地完成多项选择答题任务。在本文构建的CLTMCA中文长文本多项选择数据集上进行了实验验证,结果表明本文方法能够有效地解决BERT在处理长文本多项选择任务时的限制问题,相比于其他方法,在各项评价指标上均取得了较高的提升。

Abstract

As a significant task in Machine Reading Comprehension, multiple choice has received widespread attention in Natural Language Processing(NLP). Since the length of text that needs to be processed in data continues to be longer, long text multiple choice becomes a new challenge. However, existing long text processing methods tend to lose useful information in the text, leading to inaccurate results. To solve the above problems, this paper proposes the Long Text Multiple Choice Answer Method Based on Compression and Reasoning (LTMCA), which identifies relevant sentences by training the judgment model, and combines the relevant sentences to form a short text to be input into the inference model for inference. In order to improve the accuracy of the evaluation model, the interaction between the essay and the options is added to the evaluation model to supplement the essay's attention to the options, and the relevant statements are identified in a targeted way to complete the multiple-choice answer task more accurately.Experimental verification is carried out on the CLTMCA Chinese long text multiple choice dataset constructed in this paper, and the results show that the proposed method can effectively solve the problems of the BERT in handling the long text multiple choice task. Compared with other methods, this method has greatly improved in various evaluation indicators.

Graphical abstract

关键词

BERT(bidirectional encoder representation from transformer) / 中文长文本 / 多项选择 / 注意力

Key words

BERT(bidirectional encoder representation from transformer) / Chinese long text / multiple choice / attention

引用本文

引用格式 ▾
夏旭,刘茂福,张耀峰,胡慧君. 基于压缩与推理的长文本多项选择答题方法[J]. 武汉大学学报(理学版), 2023, 69(2): 233-242 DOI:10.14188/j.1671-8836.2022.0162

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

近年来,随着神经网络的发展,教会机器阅读理解成为了自然语言处理中的核心任务之一[1]。2018年,科技部设立了“基于大数据的类人智能关键技术与系统”项目,目标在于研制出能够理解文章意思并准确回答相应问题的智能机器人[2]。多项选择作为一种基本的阅读理解题型,在该课题的推动下,已成为机器阅读理解任务中的一个重要研究方向。

自2018年以来,BERT(bidirectional encoder representation from transformer)[3]及其改造版本在多项自然语言处理任务中显示出了惊人的改进。在谷歌官方发布的BERT-base(Chinese)中,中文以字为粒度进行切分,并没有考虑中文需要分词的特点。而应用全词Mask,非字粒度的中文BERT模型有更好的表现,因此研究人员将全词Mask方法应用在了中文中,在中文维基百科、新闻、问答等数据上进行训练,构造出了新的模型。和原版中文BERT模型相比,全词覆盖的中文BERT预训练模型BERT-wwm*[4]在多个中文任务中取得了更好的表现。作为BERT-wwm*的改进版本,MacBERT[5]引入了纠错型掩码语言模型(MLM as correction,Mac)预训练任务,缓解了“预训练-下游任务”不一致的问题,在多项任务中取得了优于前作的成绩。此外,为了更好地将预训练模型应用于中文任务,研究人员还训练出了中文版本的XLNet[6]、ELECTRA[7]

无论是BERT-base(Chinese)、BERT-wwm*还是MacBERT,支持的最长字符序列长度均为512,可以处理评论,标题等短文本,然而对于较长的文本,经常会出现超出字符限制的问题。目前基于BERT处理长文本的方法主要分为截断法、滑动窗口法、压缩法。对于篇章级文本,长度一般为几千个字符,如果直接使用截断法,必然会丢失大量信息。滑动窗口方法考虑到了全局的信息,对文本很长且截断敏感的任务有较好的效果。但存在性能较差、丢失上下文联系等缺点。文献[89]通过mean-pooling、max-pooling或附加MLP、LSTM来聚合每个窗口的结果,但是这些方法在文本长距离交互时效果仍不佳。此外,这些后期聚合方法主要是优化分类,对于其他任务,如跨度提取,BERT输出的文本长度为L,则还需要OL2空间进行自注意聚合。压缩法在三种方法中有着相对较好的效果,其宗旨是选取“精华”,去除“糟粕”,该方法的关键在于如何筛选出有效句子。

本文提出的LTMCA(Long Text Multiple Choice Answer method based on compression and reasoning)利用judger(评判器)与reasoner(推理器)两个预训练模型解决中文长文本多项选择答题任务。通过训练评判器识别相关句,将相关语句拼接后输入到推理器进行多项选择任务的推理。由于BERT的表示根植于字符,无法很好地表示句子的特征,本文更改了BERT的输入序列与嵌入,使句子识别成为可能。在识别过程中,增加了对选项信息的注意力以保证评判模型的准确率,在推理过程中又为评判模型提供更为准确的训练标签,形成上下游任务的联合训练。由于目前公开的中文多项选择数据集文本长度多在512之下,不能很好验证本文方法的有效性,本文提出了CLTMCA中文长文本多项选择数据集,并在此数据集上开展实验,进行对比分析,验证了本文方法的有效性。

1  相关工作

1.1 长文本阅读理解

在将Transformer[10]应用于长文本的研究中,许多方法只是压缩或重用之前步骤的结果,不能应用于BERT,例如Dai等[11]提出的Transformer-XL和Rae等[12]提出的Compressive Transformer。Kitaev等[13]使用了局部敏感哈希注意力(locality sensitive Hashing attention)实现对文本内容的注意,可以处理更长的文本且速度更快,但它对GPU并不友好,而且在BERT上的使用仍然需要验证。Qiu等[14]提出的BlockBERT去掉不重要的注意头,将BERT从512个token扩展到1 024个token。文献[15]设计实现的Longformer定制了CUDA内核,以支持特殊标记的窗口关注和全局关注。然而,这两个方法训练对显存的要求依旧很高,对其在中文上的有效性研究不足。Ding等[16]提出的CogLTX模型,通过训练一个判断模型来识别相关句,将其串接进行推理,并通过排练和衰减实现多步骤推理。作为一种通用算法,CogLTX训练需要的开销与文本长度无关,在各种下游任务上获得了优异的效果。Inoue等[17]通过生成式摘要的方式为下游任务生成一个简短、充分、以问题为中心的摘要文本以满足预训练模型的输入限制。Wu等[18]采用了一种S2G(select-to-guide)策略,专注于一种由粗到细的分阶段段落选择方法,该方法能够准确地提取相关段落,为后续的理解处理提供一个几乎无噪声的上下文,这两种方法在机器阅读理解多跳推理任务上取得了较好的效果,为长文本的阅读理解提供了思路,可行性还有待研究。

1.2 长文本压缩

在长文本压缩方法研究中,文献[1920]将抽取式摘要任务定义为序列标记问题:对文章的每句话都做一个二分类,被选中为摘要的一部分标注为1,未被选中标注为0,并使用Encoder-Decoder框架(编码器-解码器)解决该序列标记问题。这些模型对每个句子做出独立的二元决策,从而产生了高冗余。文献[21]解决上述问题的方法是引入自回归解码器,允许不同句子的评分操作相互影响。Trigram Blocking[22]作为最近更流行的方法,在选择句子形成摘要的阶段,会跳过与前面所选重叠的句子以降低冗余度。这种简单的删除重复的方法也带来了显著的性能改进。预训练模型在自然语言处理领域的大放异彩也为文本摘要提供了新的方案,BERTSUM[23]在文本摘要任务中使用并拓展了预训练模型BERT,在抽取式摘要上达到了较好的效果。为了使用BERT进行摘要抽取,需要它输出每个句子的表示。但是,由于BERT被训练为掩码语言模型,输出向量根植于符号而不是句子。同时,BERT虽然有分段嵌入来表示不同的句子,但它只有两个标签(句子A或句子B),无法提取多个句子形成摘要。因此,BERTSUM修改BERT的输入序列和嵌入,使提取摘要成为可能。Zhong等[24]借鉴BERTSUM提出了MATCHSUM,将抽取式摘要任务定义为语义文本匹配问题,即源文档和候选摘要(从原始文本中抽取)在语义空间中进行匹配,而不是遵循单独抽取句子和建模句子之间的关系。相较BERTSUM,该方法取得了更好的效果,但它依赖已经标注好的摘要,对于本文任务的场景,并没有已经标注好的摘要,其有效性还有待研究。

1.3 多项选择答题方法

多项选择作为阅读理解的常见任务之一,在预训练模型提出后,受到了更多研究者的关注。为了深入研究该任务,Lai等[25]提出了RACE数据集,该数据集拥有超过28 000篇文章和近100 000个问题,平均文章长度为322个字符。相比于RACE,Sun等[26]提出的DREAM数据集文体有所不同且规模要小得多,包含6 000多个对话和10 000多个问题,平均对话长度为86个字符。Sun等[26]基于特征提出的GBDT在DREAM数据集上都达到了较高的准确率。BERT[3]、XLNet[6]、RoBERTa[27]、ALBERT[28]等大型预训练模型的出现,使准确率达到了新的高度。Zhu[29]提出的ALBERTXxlarge+DUMA,将预训练模型作为编码器,并添加了文章与问答对之间的匹配机制,使得预训练模型发挥出了更好的效果。Wan[30]使用Albertxxlarge+DUMA作为模型架构,在此基础上进行多任务学习,达到了DREAM数据集目前的最高准确率。

2  本文方法

LTMCA继承了CogLTX[16]的基本假设“对于大多数NLP任务来说,文本中的部分相关句就存储了完成推理任务所需的足够和必要的信息”,即假设存在一个由长文本x+中的一些句子组成的短文本z+,满足:

reasonerx+reasonerz+

reasoner为下游任务推理器。

模型整体框架如图1,本文方法的核心在于上下游各有一个BERT模型,分别叫做评判器与推理器。一篇长文本x+先使用评判器识别出相关句,再将相关语句拼接成短文本z+,与问题以及选项一起输入到推理器进行多项选择任务的推理。两个模型在各自完成任务的同时还进行着联合训练,评判器为推理器提供推理文本,推理器完成推理任务,通过自身的干预机制(intervention)来给句子进行相关性标注,为评判器提供标签,以此来训练评判器。

2.1 模型

2.1.1 评判器

评判器被训练用来识别相关句子,长文本在输入到评判器前需要进行预处理,对文本进行分割。按照标点分割文章产生的句子粒度太细,无法保障拼接后文本的信息量。在LTMCA中,基本数据结构被定义为block(块),一篇长文本先根据标点符号进行切分,再将切分后的短句按照顺序进行拼接,在拼接过程中保证每个块中的短句拼接后长度小于等于62个token(字符),以保持拼接文本多样性的同时降低冗余度。每个块除了包含文本,还包含该块的打分以及相关性等基本信息。长文本x+切分为块集合blocks=[x0xn-1]后,块集合中的部分块将组成短文本块集合z=[xz0xzn-1],且满足z0<<zn-1,即z里面所有的块保持相对顺序。

在原始的CogLTX中,评判器对相关性的打分简单,设z+=[[CLS]z0[SEP]zn-1[SEP]],则

judgerz+=sigmoidMLPBERTz+
0,1lenz+,lenz+512

其中,MLP为多层感知机,judgerz+为短文本z+的打分,lenz+为短文本z+包含的字符数,该方法计算的是每一个字符的相关性打分,每一个块的相关性打分由该块中的所有字符打分计算平均得出,这样的打分遗漏了大量信息,将会不够准确。

为了满足本文的任务,需要修改BERT的输入序列和嵌入,使句子识别成为可能。如图2所示,本文在每个block的句首添加了“[CLS]”符号,在句尾添加了“[SEP]”符号。在BERT中,“[CLS]”符号被用来聚合一个句子或一对句子的特征。之后使用区间段嵌入区分文档中的多个句子。对于blockii为奇数将其嵌入EA段,为偶数将其嵌入EB段。例如,对于[sent1,sent2,sent3,sent4],将分配[EA,EB,EA,EB]。在文章经过BERT编码后的向量中,第i个“[CLS]”符号对应的向量将被作为该块的表示。

针对多项选择阅读理解题,我们在做题时常将选项带入到文章中进行阅读,凭借此经验,可以发现有用的信息不仅在原始文章中,还存在选项中,选项在挑选句子时可以帮助注意到相关句。在打分过程中,增加文章对选项的注意力,可以使相关句的识别更为准确。

为了方便选项与文章之间信息的交互,输入到评判器的块分为两部分,第一部分为选项的块,第二部分为文章的块。文章与选项的交互计算如下:

Hp=EncoderPHc=EncoderCGpc=SoftMaxHpW1HcTEpc=GpcHcHpc=ReLUEpcW2

一份样本输入到图2的模型后,四份文本将经过BERT(Encoder)得到每份文本的表示,每份文本的表示又分为两部分,文章部分的向量HpRP×l与选项部分的向量HcRC×lPC为文本长度(字符级),l为隐藏层的维度。文章需要注意到选项的信息,HpHc经过Matching(匹配层),达到注意力的效果。GpcRP×C为文章与选项之间的权重矩阵,EpcRP×l为感知到选项信息的文章表示,最后经过激活层将得到文章注意选项信息后的向量表示HpcRP×l,第i个块的首[CLS]字符在Hpc中对应的向量Ti将作为这个块的表示。其中W1Rl×lW2Rl×l为可学习的参数。

得到每个块的向量表示后,为了让取出的块表示获取文档级的特征,会再经过Transformer层:

T˜d=LNTd-1+MHAttTd-1,
Td=LNT˜d+FFNT˜d

其中T˜dRb×l为经过多头注意力后的块表示,TdRb×l为当前Transformer层输出的块表示,上标d表示Transformer堆叠层的深度,T0=PosEmb(T)Rb×lb为短文本所包含的块的个数,PosEmbT 添加position embedding(表示每个句子的位置),LN为layer normalization(归一化)操作,MHAtt为multi-head attention[10](多头注意力)操作,FFN为前馈神经网络,最后的输出层为Sigmoid分类层:

Y^i=σW3TiD+b

其中,TiD是第i个块在Transformer顶层输出的向量表示,Y^i0,1为第i个块的一份打分,W3Rl×l为可学习的参数。将同一个块的四份打分平均后得到这个块的最终打分。

2.1.2 推理器

推理器进行具体的多项选择任务推理。本文中,推理器直接使用BERT已经实现并开源的BertForMultipleChoice,其结构如图3。一篇长文本经过评判器后,所有的块将会得出相应的分数,目前已经被判定为相关的块和不相关但是打分高的块将会作为推理器的输入。与评判器不同是,为了满足推理器的输入,块集合分成了三部分,依次为问题的块、选项的块和文章的块。由于一个问题下有四个选项,一份样本将由四份文本组成。

在推理器中,模型输入由问题、选项与文章依次排列组成,组成的文本字符数需要小于等于512,输入到编码器中进行编码,此处的编码器为BERT,分类层为全连接层,经过Softmax后输出各个选项的概率分布。

2.2 干预机制

在LTMCA中,上下游任务模型的联合训练起着重要的作用。在一轮训练中,长文本x+切分为块集合blocks后,使用滑动窗口将blocks切分为多个子集,每个子集中的块将与选项文本共同拼接成评判器的输入短文本,整个切分与拼接过程保证拼接出的文本长度小于等于512个字符,评判器对当前短文本的块进行相关性打分,文章所有的块打分完成后,根据相关性分数排序,将已经标记为相关的块和相关性打分高的块共同拼接成推理器的输入短文本(保持块的相对顺序)输入到下游的推理器。推理器在进行推理任务后会模拟删除块,再对比删除块前后的推理损失来标记该块是否为相关块。

在评判器的训练中,块的相关性即为标签:

relvlabelz+=1,1,0,1,0,0,10,1countz+
judgerz+=0.6,0.5,0.4,0.8,0.2,0.5,0.90,1countz+
lossjudgerz+=CrossEntropyjudgerz+,relvlabelz+

其中,训练样本包含连续的块序列、相关块的和随机无关块的混合序列。CrossEntropy为交叉熵函数,relvlabel为块对应的相关性标签,countz+为短文本z+所包含块的数目,judgerz+为评判器对z+中块的打分,lossjudger为计算得出的评判器损失。

在推理器的训练中,每一份样本都包含一篇文章、一个问题、多个选项及一个答案,答案即为标签:

labelz+=10,1,2,3
reasonerz+={0.1,0.6,0.3,0.2}(0,1)4
lossreasonerz+=CrossEntropyreasonerz+,labelz+

其中,训练样本分为相关块与连续无关块的混合序列、相关块与随机无关块的混合序列。label为该题的正确选项,reasonerz+为推理器此次推理出的选项概率分布,lossreasoner为计算得出的推理器损失。

在本文方法中,推理器会对评判器的训练产生干预,当推理器完成多项选择答题任务后,会对短文本z+中的块进行相关性判断,相当于对评判器进行标签的标注。推理器会依次将短文本中块的attention_mask改为0,从而达到依次删除块的效果。

在短文本块集合z删除了块zi后,将此时的文本z-zi+再输入到推理器中,对比删除前与删除后的损失,如果损失差值大于某个阙值tup,则认为该块为相关块,当损失差值小于某个阙值tdown,则认为该块为不相关块。具体公式如下:

lossreasonerz-zi+-lossreasonerz+>tup,ziz,relevant
lossreasonerz-zi+-lossreasonerz+<tdown,ziz,irrelevant

3  实 验

3.1 数据集和评价指标

3.1.1 数据集

本CLTMCA数据集共包含10 500篇文档和22 015个问题,覆盖现代文与文言文两种文体,其中现代文9 062篇,包含18 631个问题,文言文1 438篇,包含3 384个问题,每条数据都包括一篇字符数大于512的文章、至少一个问题,每个问题下有多个候选选项,有且仅有一个正确选项,数据举例如表1。数据集的数据来源分为两部分,第一部分来自于“2021海华AI挑战赛·中文阅读理解·技术组”,第二部分使用爬虫技术采集自互联网。所有资料均可在互联网上免费查阅,供公众使用。

第一部分数据由“2021海华AI挑战赛·中文阅读理解·技术组”赛事组提供,其数据文体主要包括现代文、文言文以及古诗,该数据格式与上述CLTMCA数据集的数据格式一致,但CLTMCA数据集只选取其中文章篇幅大于512个字符的样例,文体为古诗的样例因此被过滤。

对于第二部分数据,首先使用爬虫技术采集互联网语文题库网站中的现代文、文言文阅读理解题。需要从采集的原始网页中抽取中“文章”“问题”“选项”“答案”字段,并清洗多余的HTML代码得到各个字段的纯文本,再筛选出文章篇幅大于512个字符的数据样例。

去除重复的问题与文章后,在文章级别上随机分割数据集,将数据集按照6∶2∶2划分训练集、验证集、测试集。对数据集分布进行统计,结果如表2。对数据集中全部样例(10 500篇文档和22 015个问题)的文章长度进行统计,发现数据集中的文章平均长度达到了1 243个字符,最长文本达到了4 133个字符,远超过了BERT可以处理的序列长度。

3.1.2 评价指标

本文实验的评价指标采用准确率(Accuracy,ACC)和宏F1(macro⁃F1)值。将多分类中每一类的F1值取平均,即得到宏F1值。

3.2 实验设置

本文所使用的BERT-base[3]、BERT-wwm[4]、BERT-wwm-ext[4]、MacBERT[5]、XLNet[6]、ELECTRA[7]模型均为预训练好的模型,上述模型与CogLTX[16]及本文提出的LTMCA均使用Adam训练优化器,损失函数均为交叉熵损失函数。在第一个epoch学习率开始预热,然后余弦退火衰减。各模型的实验参数设置如表3所示。所有模型均使用CLTMCA数据集的训练集、验证集、测试集的全量数据进行训练、验证、测试。

3.3 实验结果

在使用BERT-base、BERT-wwm、BERT-wwm-ext、MacBERT、XLNet、ELECTRA模型进行训练时,先用BM25算法对长文本进行相关语句识别,将问题、选项与相关句拼接成短文本输入到预训练模型,对模型进行微调。

本文方法与其他方法在CLTMCA测试集上的总体(包括现代文和文言文)实验结果如表4所示。本文方法具有很强的竞争优势,在ACC指标和Macro-F1指标上都表现很好,验证了本文方法在长文本多项选择答题任务上的有效性。从侧面反映出,相较使用BM25算法识别相关句,CogLTX与LTMCA使用模型有着更高的识别准确率,可以更好地为后续任务所利用。同时,更加强大的预训练模型可以辅助模型发挥更好的效果。

CLTMCA数据集包含了现代文与文言文两种文体,对总体实验结果按照文体进行拆分统计准确率,各方法在不同文体上的表现如表4所示。在现代文文体的阅读理解题中,LTMCA达到了最优的效果。在文言文的答题中,LTMCA并没有较突出的优势,分析可能存在以下原因。首先文言文数据样例较少,可能存在训练不充分的情况。再者由于LTMCA以MacBERT为基础模型,但从MacBERT的实验结果可以看出,与其他预训练模型相比,MacBERT预训练模型可能更适用于现代文而非文言文。

由于数据集包含的文章长度跨度较大,为了更好地验证LTMCA在不同长度的文本上均有一定的效果,本文统计了数据集中不同文章长度下的问题数量,结果如图4。从图4可以看出,以问题为单位来划分,问题对应的文章长度多集中在512个字符到2 048个字符之间,此外还存在少量超长文本。

对总体实验结果按照不同文章长度区间进行拆分统计准确率,结果如表5,按照每512个字符为一个区间,区间的界限为左开右闭,例如(512,1 024]代表大于512个字符小于等于1 024个字符的文章。从表5可以看出,对于大于1 024个字符的长文本,CogLTX与LTMCA有着比普通预训练模型更优异的结果。其中,LTMCA在1 024个字符到1 536个字符的文章上有着最高的答题准确率,在1 536个字符到2 048个字符的文章上也有优异的答题效果。考虑到大于2 048个字符的文章在总数据集中的占比很小,LTMCA可能存在训练不充分等原因,导致准确率并不高。此外,比较不同的预训练模型,可以发现预训练模型的不同,擅长的文本长度也不一致。

3.4 实例分析

表6的训练实例展示了各个模型在每个epoch训练结束后的块打分以及相关性标注。在模型开始训练之前,先使用BM25算法初始化,标记出部分相关句以及将各块的打分赋值为0。以第0、4、8、12、16块为例,可见0、4、16块被标记为不相关,8、12块被标记为相关。进入第一个epoch,评判器对输入的各块进行打分,由于此时评判器并没有充分训练,导致各块打分普遍较低,打分阶段完成后,将根据块的相关性以及打分,综合选择优胜的块输入到推理器,推理器再对正在使用的块进行二次相关性标注。第一轮训练结束,8、12块由于包含大量相关信息依旧标记为相关,第4块在推理任务中贡献了较大的作用,重新标记为相关,推理器更正了BM25初始化的错误。在第二个epoch中,评判器将根据新的标签进行训练,推理器进行着更准确的相关性标注工作,在第一个epoch中被标注为相关的第0块由于无法提供辅助推理的信息被标注为不相关。第16块由于评判器的识别准确率提高,打分降低,进行后续任务的概率较低,保持原相关性标注。后续训练保持着此流程。对比CogLTX与LTMCA的训练,可以发现在第二个epoch完成后,CogLTX将第12块标注为了不相关,但第12块包含着解题所必要的信息,LTMCA有着更高的识别准确率,可以减少类似问题的发生。

在训练的过程中,推理器通过干预机制更新块的相关性标签,使标签更加准确,从而影响评判器的训练,评判器在新标签的训练下,识别精度有所提升,为推理器提供优质文本,推理器可以更加准确地完成任务,上下游模型之间相辅相成。

4  结 语

本文提出了基于压缩与推理的长文本多项选择答题方法,将长文本多项选择任务分为上下游两部分任务进行。在上游文本压缩任务中修改了BERT的输入序列和嵌入,使句子识别成为可能。在模型中添加了文章与选项之间的交互机制以补充文章对选项的注意力,用以辅助识别相关句,为下游推理任务提供输入;在下游推理任务中又为上游文本压缩任务标注标签,形成联合训练,提升上下游模型的性能。由于长文本多项选择任务数据集较少,现有数据集无法验证本方法的有效性,本文提出了CLTMCA数据集。在此数据集上,本文方法相较其他方法,取得了较高的准确率,验证了此方法的可行性和有效性。

未来计划扩充数据集,丰富文体的种类,优化评判器的识别方法,在推理器部分尝试优秀的多项选择方法。

参考文献

[1]

谭红叶, 李宣影, 刘蓓. 基于外部知识和层级篇章表示的阅读理解方法[J]. 中文信息学报202034(4): 85-91. DOI: 10.3969/j.issn.1003-0077.2020.04.011 .

[2]

TAN H YLI X YLIU B. Reading comprehension based on external knowledge and hierarchical discourse representation[J]. Journal of Chinese Information Processing202034(4): 85-91 (Ch). DOI: 10.3969/j.issn.1003-0077.2020.04.011 .

[3]

张虎, 张颖, 杨陟卓, . 基于数据增强的高考阅读理解自动答题研究[J]. 中文信息学报202135(9): 132-140. DOI: 10.3969/j.issn.1003-0077.2021.09.013 .

[4]

ZHANG HZHANG YYANG Z Zet al. Data augmentation based automatic answering of reading comprehension in college entrance examination[J]. Journal of Chinese Information Processing202135(9): 132-140. DOI: 10.3969/j.issn.1003-0077.2021.09.013 (Ch ).

[5]

DEVLIN JCHANG M WLEE Ket al. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding[DB/OL].[2022-08-02].DOI: 10.18653/v1/n18-2 .

[6]

CUI Y MCHE W XLIU Tet al. Pre-training with whole word masking for Chinese BERT[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing202129: 3504-3514. DOI: 10.1109/TASLP.2021.3124365 .

[7]

CUI Y MCHE W XLIU Tet al. Revisiting pre-trained models for Chinese natural language processing[C]//Findings of the Association for Computational Linguistics: EMNLP 2020. Stroudsburg: Association for Computational Linguistics, 2020: 657-668. DOI: 10.18653/v1/2020.findings-emnlp.58 .

[8]

YANG Z LDAI Z HYANG Y Met al. XLNet: Generalized autoregressive pretraining for language understanding[EB/OL]. 2019arXiv: 1906.08237.

[9]

CLARK KLUONG M TLE Q Vet al. ELECTRA: Pre-training text encoders as discriminators rather than generators[EB/OL]. 2020arXiv: 2003.10555. DOI: 10.18653/v1/2020.emnlp-main.20 .

[10]

WANG WYAN MWU C. Multi-granularity hierarchical attention fusion networks for reading comprehension and question answering[C]//Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2018: 1705-1714. DOI: 10.18653/v1/p18-1158 .

[11]

PAPPAGARI RZELASKO PVILLALBA Jet al. Hierarchical transformers for long document classification[C]//2019 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU). New York: IEEE Press, 2020: 838-844. DOI: 10.1109/ASRU46091.2019.9003958 .

[12]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[EB/OL]. 2017arXiv: 1706.03762.

[13]

DAI Z HYANG Z LYANG Y Met al. Transformer-XL: Attentive language models beyond a fixed-length context[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2019: 2978-2988. DOI: 10.18653/v1/p19-1285 .

[14]

RAE J WPOTAPENKO AJAYAKUMAR S Met al. Compressive transformers for long-range sequence modelling[EB/OL]. 2019arXiv: 1911.05507.

[15]

KITAEV NKAISER ŁLEVSKAYA A. Reformer: The efficient transformer[EB/OL]. 2020arXiv: 2001.04451.

[16]

QIU J ZMA HLEVY Oet al. Blockwise self-attention for long document understanding[C]//Findings of the Association for Computational Linguistics: EMNLP 2020. Stroudsburg: Association for Computational Linguistics, 2020: 2555-2565. DOI: 10.18653/v1/2020.findings-emnlp.232 .

[17]

BELTAGY IPETERS M ECOHAN A. Longformer: The long-document transformer[EB/OL]. 2020arXiv: 2004.05150.

[18]

DING MZHOU CYANG H Xet al. CogLTX: Applying BERT to long texts[C]//Proceedings of the 34th International Conference on Neural Information Processing Systems. New York: ACM, 2020: 12792-12804. DOI: 10.5555/3495724.3496797 .

[19]

INOUE NTRIVEDI HSINHA Set al. Summarize-then-answer: Generating concise explanations for multi-hop reading comprehension[C]//Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2021: 6064-6080. DOI: 10.18653/v1/2021.emnlp-main.490 .

[20]

WU B HZHANG Z SZHAO H. Graph-free multi-hop reading comprehension: A select-to-guide strategy[EB/OL]. 2021arXiv: 2107.11823. DOI: 10.48550/arXiv.2107.11823 .

[21]

CHENG J PLAPATA M. Neural summarization by extracting sentences and words[C]//Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2016: 484-494. DOI: 10.18653/v1/p16-1046 .

[22]

NALLAPATI RZHAI F FZHOU B W. SummaRuNNer: A recurrent neural network based sequence model for extractive summarization of documents[C]//Proceedings of the 31st AAAI Conference on Artificial Intelligence. New York: ACM, 2017: 3075-3081. DOI: 10.1609/aaai.v31i1.10958 .

[23]

CHEN Y CBANSAL M. Fast abstractive summarization with reinforce-selected sentence rewriting[C]//Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2018: 675-686. DOI: 10.18653/v1/p18-1063 .

[24]

PAULUS RXIONG C MSOCHER R. A deep reinforced model for abstractive summarization[EB/OL]. 2017arXiv: 1705.04304.

[25]

LIU Y. Fine-tune BERT for extractive summarization[EB/OL]. 2019arXiv: 1903.10318. DOI: 10.1090/mbk/121/79 .

[26]

ZHONG MLIU P FCHEN Y Ret al. Extractive summarization as text matching[C]//Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2020: 6197-6208. DOI: 10.18653/v1/2020.acl-main.552 .

[27]

LAI G KXIE Q ZLIU H Xet al. RACE: large-scale ReAding comprehension dataset from examinations[C]//Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2017: 785-794. DOI: 10.18653/v1/d17-1082 .

[28]

SUN KYU DCHEN J Set al. DREAM: A challenge data set and models for dialogue-based reading comprehension[J]. Transactions of the Association for Computational Linguistics20197: 217-231. DOI: 10.1162/tacl_a_00264 .

[29]

LIU Y H, OTT M, GOYAL Net al. RoBERTa: A robustly optimized BERT pretraining approach[EB/OL]. 2019arXiv: 1907.11692.

[30]

LAN Z ZCHEN M DGOODMAN Set al. ALBERT: A lite BERT for self-supervised learning of language representations[EB/OL]. 2019arXiv: 1909.11942.

[31]

ZHU PZHAO HLI X. DUMA: Reading comprehension with transposition thinking[EB/OL]. 2020arXiv: 2001.09415.

[32]

WAN H. Multi-task learning with multi-head attention for multi-choice reading comprehension[EB/OL]. 2020arXiv: 2003.04992.

基金资助

贵州省科技计划项目(黔科合后补助[2020]3003)

湖北省教育厅科研重点项目(20192202)

AI Summary AI Mindmap
PDF (2094KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/