基于BERT的阅读理解式标书文本信息抽取方法

涂飞明 ,  刘茂福 ,  夏旭 ,  张耀峰

武汉大学学报(理学版) ›› 2022, Vol. 68 ›› Issue (3) : 311 -316.

PDF (747KB)
武汉大学学报(理学版) ›› 2022, Vol. 68 ›› Issue (3) : 311 -316. DOI: 10.14188/j.1671-8836.2021.0069
计算机科学

基于BERT的阅读理解式标书文本信息抽取方法

作者信息 +

BERT-Based Method for Bidding Text Information Extraction via Reading Comprehension

Author information +
文章历史 +
PDF (764K)

摘要

针对标书文本重要信息的抽取需求,提出一种基于BERT(bidirectional encoder representations from transformers)的阅读理解式标书文本信息抽取方法。该方法将信息抽取任务转换为阅读理解任务,根据标书文本内容,生成对应问题,再抽取标书文本片段作为问题答案。利用BERT预训练模型,得到强健的语言模型,获取更深层次的上下文关联。相比传统的命名实体识别方法,基于阅读理解的信息抽取方法能够很好地同时处理非嵌套实体和嵌套实体的抽取,也能充分利用问题所包含的先验语义信息,区分出具有相似属性的信息。从中国政府采购网下载标书文本数据进行了实验,本文方法总体EM(exact match)值达到92.41%,F1值达到95.03%。实验结果表明本文提出的方法对标书文本的信息抽取是有效的。

Abstract

Aiming at the demand for extracting important information in the bidding text, a bidding text information extraction method based on BERT (Bidirectional Encoder Representations from Transformers) via reading comprehension is proposed. This method converts the information extraction task into a reading comprehension task, generates questions based on the content of the bidding text, and then extracts the text fragments as the answers to the questions. We use the BERT pre-trained model to obtain a robust language model and a deeper contextual association. Compared with traditional named entity recognition methods, the information extraction method via reading comprehension can handle the extraction of flat entities and nested entities at the same time, and can also make full use of the prior semantic information contained in the problem to distinguish information with similar attributes. Experiments were carried out by downloading the text data of the bid documents from the Chinese Government Procurement Network. The overall EM(exact match) value of the method in this paper reached 92.41%, and the F1 value reached 95.03%. The experimental results show that the method proposed in this paper is effective for extracting information from bidding texts.

Graphical abstract

关键词

标书文本 / 阅读理解 / 信息抽取 / BERT(bidirectional encoder representations from transformers)

Key words

bidding text / reading comprehension / information extraction / BERT (bidirectional encoder representations from transformers)

引用本文

引用格式 ▾
涂飞明,刘茂福,夏旭,张耀峰. 基于BERT的阅读理解式标书文本信息抽取方法[J]. 武汉大学学报(理学版), 2022, 68(3): 311-316 DOI:10.14188/j.1671-8836.2021.0069

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

在互联网大数据时代,各大采购平台网站每天都会发布大量招投标和中标公告,这些公告内容涉及方方面面,蕴含着很大的商业价值。对于企业而言,及时获取这些招投标数据,并从中抽取所需信息,具有十分重要的意义。而网站上发布的标书文本多为非结构化文本,这给信息的抽取以及统计工作带来难度。

信息抽取(information extraction)是从非结构化或半结构化的文本中对用户指定类型的实体、关系以及事件进行自动标识和分类,输出为结构化的信息1。由于其广泛应用,近年来,信息抽取成为自然语言处理(natural language processing)领域研究的热门课题。信息抽取主要包括命名实体识别(named entity recognition)、关系抽取(relation extraction)和事件抽取(event extraction)三个子任务2,信息抽取的关键是命名实体的识别。早期常用的是基于规则的抽取方法3,但该方法存在泛化能力差的问题。

深度学习的发展对自然语言处理领域产生了巨大的影响4,在信息抽取中使用也相当普遍。在预训练模型发布之前,信息抽取主要模型以CNN和RNN5为主。Akbik等6通过动态存储每个词的所有上下文嵌入,并对这些嵌入进行池化操作以提取词的全局上下文嵌入,该方法显著提高了命名实体的识别效果。BERT(bidirectional encoder representations from transformers)模型的提出7,使得多项自然语言处理任务取得了更好的效果,预训练模型被越来越多的学者使用。Xue等8提出针对联合实体和关系提取任务的集中注意力模型,该模型通过动态范围注意力机制将BERT模型集成到联合学习中,提高了共享参数层的特征表示能力。Qiu等9使用预训练模型,并以问答的方式,实现临床医疗文本的结构化。

近年,有学者将信息抽取任务转化为问答(question answering)任务来处理,取得较好效果。机器阅读理解(machine reading comprehension)是一类基于文本的问答任务,Levy等10将关系映射为问题,把关系抽取任务转为简单的阅读理解任务。McCann等11将10个不同的自然语言处理任务转化为问答任务,并将10个不同的任务数据集转化为问答数据集。Li等12利用阅读理解模型进行多轮对话,从而实现对文本实体-关系信息的抽取。Qiu等13提出QA4IE框架,利用问答的灵活性,在句子间生成更加丰富的关系三元组。Li等14针对命名实体识别任务,提出了一个统一的阅读理解框架,能够同时识别出文本中的非嵌套实体和嵌套实体。

机器阅读理解任务定义为给定一篇文章以及基于文章的问题,让机器给出问题的答案。随着斯坦福大学发布SQuAD(Stanford Question Answering Dataset)阅读理解数据集15,阅读理解任务获得了大量的关注。Wang等16提出了在SQuAD数据集上的第一个端到端的阅读理解模型,该模型先对问题和原文分别进行编码,然后利用Match-LSTM将问题和原文融合,最后使用Pointer-Network从原文中选取答案片段。Seo等17在注意力机制的基础上进行改进,提出了BiDAF(bi-directional attention flow)模型,该模型利用双向注意力流,得到一个问题感知的上下文表征,获得更深层次的上下文语义信息。由于之前的SQuAD数据集全为有答案的情况,斯坦福大学又发布了SQuAD 2.0数据集18,SQuAD 2.0数据集存在原文中没有材料支持,无法作答的情况,其语料更加符合现实应用场景。受人类阅读习惯的启发,Zhang等19提出一种回顾式阅读器(retrospective reader),集成泛读和答案验证的模式,在SQuAD 2.0中取得佳绩。

本文提出一种基于BERT的阅读理解信息抽取方法,用于对标书文本中的预算金额、甲方名称、甲方联系方式、代理机构名称和代理机构联系方式5项信息进行抽取。抽取的信息多为单位名、人名以及数字(包括金额和电话号码)这样的实体,若将其视为命名实体识别任务,则有以下两个弊端:1) 在标书文本中,公司名多为嵌套命名实体,而传统命名实体识别模型大多是针对非嵌套命名实体识别任务的20,抽取效果欠佳;2) 部分要抽取的信息并不完全是实体,而是包含了其他符号的字符串,如金额“¥35,000.00元”、电话号码“0755-82****88转3454”(为保护隐私,电话号码部分数字已掩盖,下同)以及公司名“内蒙古电力(集团)有限责任公司”等。

本文将标书文本的信息抽取任务看作阅读理解任务,而非命名实体识别任务。对于给定的标书文档,对其提问,如“采购单位”,然后让模型预测出答案,得到的结果即要抽取的甲方名称,其他四项需要抽取的项目以类似的方式进行抽取。基于阅读理解的方法可以同时适用文本中非嵌套实体和嵌套实体的抽取,相比于传统的序列标注方法,基于阅读理解的方法更简单直观,可迁移性也强。另外,基于阅读理解的方法能够让问题编码一些先验语义知识,能够更容易区分具有相似标签的分类,如甲方名称和代理机构名称。

1  数据集构建

从中国政府采购网(http://www.ccgp.gov.cn/)获取标书网页文本1 450份,然后清洗数据,去除JavaScript、CSS代码以及注释文本等代码文本,去除HTML标签,替换部分符号,得到纯净、规范的中国政府采购网发布的标书正文。根据我们对中国政府采购网标书正文的了解,构建出规则库,使用规则对其进行抽取,再进行人工检验,更正规则抽取错误的例子,给出预算金额、甲方名称、甲方联系方式、代理机构名称以及代理机构联系方式5个字段的内容。

将以上5个字段内容转换成SQuAD数据格式,对标书文本提出5个问题,并给出答案文本以及答案开始位置,得到问题-答案对共7 250份。SQuAD格式的数据如例1。

例1

"context": "…项目概况 梧州市龙圩区、红岭片区市政园林设施…",

"qas": [

"question": "预算金额",

"id": "budget_amount_263",

"answers": [

"text": "84857100.00元",

"answer_start": 210

2  信息抽取方法

2.1 整体架构

对标书文本抽取上述5项信息,整体架构如图1所示。首先输入原始标书网页文本,对其进行预处理操作,得到标书纯文本,基于文本内容,匹配问题关键词列表,生成问题,把问题与文本拼接,然后使用BERT阅读理解模型进行预测,得到问题的答案。

2.2 问题生成

对于每个要抽取的字段,都会为其设置一个问题,然后让阅读理解模型根据问题给出预测答案。为生成阅读理解数据集,我们构建了规则库用于信息的初步抽取,统计到标书文本中常见的信息关键词,生成问题关键词列表,表1为部分问题关键词列表。我们为每个字段设置一个默认问题,然后在文本中查找这些问题关键词,匹配成功则生成对应问题;否则,使用默认的问题。本文生成的问题均为伪问题。比如,例2中标书文本包含“招标单位”关键词,抽取甲方名称时,就生成问题:“招标单位”。

例2

段落:…项目概况如下: 1.项目名称:沈阳市红十字会医院棋盘山分院污水处理站运维服务项目 2.项目编号:LNWX21046-C 3.招标单位:沈阳市红十字会医院…

问题:招标单位

答案:沈阳市红十字会医院

对于阅读理解模型而言,问题包含了重要的先验语义信息,能够帮助模型确定答案的位置。所以,合适的问题对于答案的正确预测有着重要作用。

2.3 基于BERT的阅读理解模型

在得到问题和文本后,使用BERT模型进行预测。阅读理解的任务是,给定问题(question)和包含答案的段落(paragraph),模型需要预测答案文本的起始位置和结束位置,从而给出答案文本,这实际上是一种抽取式问答。本文使用预训练好的BERT中文语言模型21,针对阅读理解任务进行微调。

图2所示,在阅读理解任务中,BERT将问题和段落组成一个序列,序列的第一个字符为一个特殊字符[CLS],并用一个特殊字符[SEP]将问题和段落区分开。E为输入序列,特殊字符[CLS]的最终隐藏向量表示为CRH,第i个输入词的最终隐藏向量表示为TiRH,其中H为隐藏层的维度。

微调过程中,引入向量VstartRHVendRHVstart表示答案起始位置判断向量,Vend表示答案结束位置判断向量。PiS表示第i个词是答案片段开始的概率,通过TiVstart点积,再接上段落中所有词的softmax计算得到

PiS=eVstartTijeVstartTj

类似地,PiE表示第i个词是答案片段结尾的概率,由下式计算得到

PiE=eVendTijeVendTj

从位置i到位置j的候选答案片段分数表示为VstartTi+VendTj,选取分数最高的片段作为预测结果,同时保证ij

3  实验部分

3.1 评价指标

本文使用两个评价指标:EM(exact match)和F1值,计算评价指标时忽略标点符号。

EM:对于每个问题-答案对,若模型预测结果与标准答案完全匹配,单个样例EM为1,否则为0,最后取全部测试集数据的均值。EM用于计算预测结果与正确答案是否完全匹配,反映了精准匹配度。

F1:首先得到预测结果与标准答案的最长公共子串(longest common substring,LCS),根据LCS的长度和标准答案的长度计算召回率(R),根据LCS的长度和预测结果的长度计算精确率(P),再由RP计算F1,如公式(3),然后同样取全部数据均值。F1用于计算预测结果与标准答案之间字符级别的匹配程度,反映了模糊匹配度。

F1=2PRP+R

3.2 实验结果

本文进行了基于BERT的命名实体识别抽取任务的实验,将数据集格式转换为适用于命名实体识别任务的格式,设置预算金额、甲方名称、甲方联系方式、代理机构名称以及代理机构联系方式5类命名实体,实验目标为从文本中抽取这5类命名实体,并同样使用EM和F1评价指标,用于对比阅读理解的抽取方法。为了比较不同阅读理解模型的抽取效果,本文进行了一系列阅读理解模型对比实验,选用Match-LSTM、BiDAF和Retro-Reader模型进行对比实验,实验结果如表2,其中“BERT”为本文模型。

因为金额的特征比较明显,多为数字加“元”或“万元”,适合Match-LSTM模型识别抽取,所以在“预算金额”上Match-LSTM表现较好。在其他字段BERT和Retro-Reader模型的抽取效果都比其他模型好。在“甲方联系方式”和“代理机构联系方式”两个字段上BERT抽取效果要优于Retro-Reader。Retro-Reader模型预测集成了粗读和精读两个阶段,粗读阶段判断问题是否可以回答;精读阶段寻找答案片段,验证问题是否可以回答,给出最终的判断。Retro-Reader适合处理包含无法回答问题的阅读理解任务,而本文的语料均包含抽取的信息,因此更适合BERT。另外,BERT的解码阶段直接采用线性网络层连接,设计上相比Retro-Reader更简单,训练时资源耗费更少。

3.3 实例分析

例3

context:…采购代理机构信息(如有) 名 称:辽源市宏基建设工程招标有限公司 地 址:辽源市隆基华典55号楼门市 联系方式:0437-31****3…

question:代理机构联系方式

answer:0437-31****3

NER-BERT:0437

Match-LSTM:-

BiDAF:-

BERT:0437-31****3

Retro-Reader:0437-31****3

如例3,对于代理机构联系方式的抽取,命名实体识别任务的抽取结果为“0437”,丢失了部分内容。阅读理解任务的Match-LSTM和BiDAF预测答案为“-”,而BERT以及Retro-Reader预测答案为“0437-31****3”,与标准答案一致。标准答案的位置相对文中“采购代理机构信息”位置较远,预训练模型更能学习到上下文语义信息,在阅读理解任务上更具有优势。

例4

context:项目名称:成安县经济开发区污水处理厂设施恶臭气体设备采购项目…采购人信息 名称:成安县环洁公司…

question:采购人

answer:成安县环洁公司

NER-BERT:成安县环洁公司

Match-LSTM:成安县经济开发区

BiDAF:成安县经济开发区

BERT:成安县环洁公司

Retro-Reader:成安县环洁公司

如例4,对于甲方名称的抽取,标准答案是“成安县环洁公司”,命名实体识别任务的抽取结果为“成安县环洁公司”,Match-LSTM和BiDAF错误地从标书文本的项目名称中选取“成安县经济开发区”片段作为答案,BERT和Retro-Reader则是从文本中选取位置与“采购人信息名称:”相近的“成安县环洁公司”作为答案,使用预训练模型,更能准确定位到答案位置。

4  结 语

本文提出了一种基于BERT的标书文本阅读理解式信息抽取方法,该方法将信息抽取任务转换成阅读理解任务,对于给定标书文本,生成问题对模型提问,然后模型从文本中抽取片段给出预测结果。使用BERT预训练模型能够增强语言表征能力,提升阅读理解抽取效果。实验结果显示:对于标书文本信息抽取,阅读理解抽取方法相比传统的命名实体识别抽取方法具有更好的效果。在今后的工作中,将完善数据集的构建,尝试用更多的方法实现文本信息抽取任务。

参考文献

[1]

李冬梅, 张扬, 李东远, . 实体关系抽取方法研究综述[J]. 计算机研究与发展202057(7): 1424-1448. DOI: 10.7544/issn1000-1239.2020.20190358 .

[2]

LI D MZHANG YLI D Yet al. Review of entity relation extraction methods [J]. Journal of Computer Research and Development202057(7): 1424-1448 (Ch). DOI: 10.7544/issn1000-1239.2020.20190358 .

[3]

GRISHMAN R. Twenty-five years of information extraction [J]. Natural Language Engineering201925(6): 677-692. DOI:10.1017/s1351324919000512 .

[4]

RAU L F. Extracting company names from text [C]// The Seventh IEEE Conference on Artificial Intelligence Application. New York: IEEE Press, 1991: 29-32. DOI:10.1109/CAIA.1991.120841 .

[5]

LAUZON F Q. An introduction to deep learning [C]//2012 11th International Conference on Information Science, Signal Processing and Their Applications (ISSPA). New York: IEEE Press, 2012: 1438-1439. DOI:10.1109/ISSPA.2012.6310529 .

[6]

YIN W PKANN KYU Met al. Comparative Study of CNN and RNN for Natural Language Processing [DB/OL].[2021-06-12].

[7]

AKBIK ABERGMANN TVOLLGRAF R. Pooled Contextualized Embeddings for Named Entity Recognition[DB/OL].[2021-06-12]. DOI:10.18653/v1/n19-1078 .

[8]

DEVLIN JCHANG M WLEE Ket al. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding[EB/OL]. [2021-06-12].DOI: 10.18653/v1/n19-1423 .

[9]

XUE KZHOU Y MMA Z Yet al. Fine-tuning BERT for joint entity and relation extraction in Chinese medical text [C]//2019 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). New York: IEEE Press, 2019: 892-897. DOI:10.1109/BIBM47256.2019.8983370 .

[10]

QIU J HZHOU Y MMA Z Yet al. Question answering based clinical text structuring using pre-trained language model[C]//2019 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). New York: IEEE Press, 2019: 1596-1600. DOI:10.1109/BIBM47256.2019.8983142 .

[11]

LEVY OSEO MCHOI Eet al. Zero-shot relation extraction via reading comprehension [C]//Proceedings of the 21st Conference on Computational Natural Language Learning (CoNLL 2017). Stroudsburg: Association for Computational Linguistics, 2017: 333-342. DOI:10.18653/v1/k17-1034 .

[12]

MCCANN BKESKAR N SXIONG C Met al. The Natural Language Decathlon: Multitask Learning as Question Answering[EB/OL]. [2021-08-06]. DOI: 10.48550/arXiv.1806.08730 .

[13]

LI X YYIN FSUN Z Jet al. Entity-relation extraction as multi-turn question answering [C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2019: 1340-1350. DOI:10.18653/v1/p19-1129 .

[14]

QIU LZHOU HQU Y Ret al. QA4IE: A Question Answering Based Framework for Information Extraction[DB/OL].[2021-06-12]. DOI: 10.1007/978-3-030-00671-6_12 .

[15]

LI X YFENG J RMENG Y Xet al. A unified MRC framework for named entity recognition[C]//Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2020: 5849-5859. DOI:10.18653/v1/2020.acl-main.519 .

[16]

RAJPURKAR PZHANG JLOPYREV Ket al. SQuAD: 100,000+ Questions for Machine Comprehension of Text [DB/OL].[2021-06-12]. DOI:10.18653/v1/d16-1264 .

[17]

WANG S HJIANG J. Machine Comprehension Using match-LSTM and Answer Pointer [DB/OL].[2021-06-12]. DOI: 10.18653/v1/2020.findings-emnlp.370 .

[18]

SEO MKEMBHAVI AFARHADI Aet al. Bidirectional Attention Flow for Machine Comprehension [EB/OL]. [2021-06-12]. DOI: 10.1109/cvpr.2017.571 .

[19]

RAJPURKAR PJIA RLIANG P. Know what you don’t know: Unanswerable questions for SQuAD [C]//Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers). Stroudsburg: Association for Computational Linguistics, 2018: 784-789. DOI:10.18653/v1/p18-2124 .

[20]

ZHANG Z SYANG J JZHAO H. Retrospective Reader for Machine Reading Comprehension [EB/OL]. [2021-06-12]. 26_Retrospective_Reader_for_Machine_Reading_Comprehension.

[21]

LIN B YXU FLUO Z Yet al. Multi-channel BiLSTM-CRF model for emerging named entity recognition in social media [C]//Proceedings of the 3rd Workshop on Noisy User-Generated Text. Stroudsburg: Association for Computational Linguistics, 2017: 160-165. DOI:10.18653/v1/w17-4421 .

[22]

CUI Y MCHE W XLIU Tet al. Pre-Training with Whole Word Masking for Chinese BERT [EB/OL]. [2021-06-12]. DOI: 10.1109/taslp.2021.3124365 .

基金资助

湖北省教育厅科研重点项目(20192202)

湖北经济学院科研培育项目(PYYB202007)

AI Summary AI Mindmap
PDF (747KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/