基于双步抽取的低资源中文工业领域术语抽取方法

邢季 ,  刘瑾 ,  张建伟

武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (3) : 329 -340.

PDF (3649KB)
武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (3) : 329 -340. DOI: 10.14188/j.1671-8836.2023.0233

基于双步抽取的低资源中文工业领域术语抽取方法

作者信息 +

A Dual-Step Extraction Method for Chinese Industrial Terminology in Low-Resource Environments

Author information +
文章历史 +
PDF (3735K)

摘要

工业领域数据集由各类操作文档、维修文档、设备图纸,以及不断增加的工单和工作记录等数据组成。现有的通用术语抽取方法在中文情景下效果受限,同时先验资源的匮乏也导致了传统的监督学习流程难以实现,因此业内常见模型在工业垂直领域术语抽取任务中的效果并不理想。为了解决上述问题,提出了一种基于预抽取和细化微调的双步抽取策略。在XLNet预训练模型的基础上,结合字符、字形和字音特征,增强了模型捕获语义信息的能力。采用LSTM编码器-解码器模型,生成含有错别字的负样本扩充数据集,旨在提升模型对噪音文本的鲁棒性。将本文方法应用于汽车工业领域,实验结果显示,本方法在该垂直领域的性能比现有传统方法提高了17%,充分证明了其有效性。

Abstract

The industrial dataset comprises various types of operation documents, maintenance manuals, and equipment drawings, as well as an increasing number of work orders and job records. Existing general-term extraction methods are limited in effectiveness in Chinese contexts, and the scarcity of prior resources also makes traditional supervised learning processes challenging to implement. Therefore, standard models in the industry do not perform ideally in the task of extracting vertical domain terminology in industrial fields. This study introduces a dual-step extraction strategy based on pre-extraction and fine-tuning refinement to address these issues. the approach enhances the model's ability to capture semantic information using the XLNet pre-trained model and incorporating character, glyph, and phonetic features. Moreover, the paper employs an LSTM encoder-decoder model to generate negative samples containing typographical errors to expand the dataset, aiming to improve the model's robustness to noisy text. Applying the method in this article to the field of the automotive industry,experimental results show that our method improves performance in the industrial vertical domain by 17% over the existing traditional methods, demonstrating its effectiveness.

Graphical abstract

关键词

深度学习 / 自然语言处理 / 术语抽取 / 低资源抽取 / XLNet

Key words

deep learning / NLP / terminology extraction / low-resource extraction / XLNet

引用本文

引用格式 ▾
邢季,刘瑾,张建伟. 基于双步抽取的低资源中文工业领域术语抽取方法[J]. 武汉大学学报(理学版), 2024, 70(3): 329-340 DOI:10.14188/j.1671-8836.2023.0233

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

近年来,中国汽车行业的产销量持续增长。这一稳定而显著的增长趋势,为汽车市场带来了前所未有的机遇和挑战。

随着智能化管理技术在汽车制造等领域的蓬勃发展,新兴的文本处理及知识图谱技术的地位日益凸显。这些技术的广泛应用带动了术语标准化以及分类的迫切需求。在资源有限的背景下,《GB/T 5624-2019 汽车维修术语》等术语本体库成为宝贵的先验资源,在此基础上构建新的术语库对于支持搜索索引和构建知识图谱具有关键作用。

术语是专业领域中为了准确表达专业概念和指称专业对象而创造的专业(科技及其他)语言中的词或词组,对于自然语言处理工作的下游任务产生着重要的影响。自动术语抽取(Automatic Term Extraction,ATE)是自然语言处理领域内的核心课题,旨在从专业领域特定文本中识别和提取专业术语。如工业领域中的专业术语有机械结构、零件名称和工艺流程等,这些术语对于理解和处理该领域的文本至关重要。本研究的目标是通过学习有限规模的专业性文本语料库,抽取涵盖机械结构、零件名称和工艺流程等汽车工业领域的专业术语。

中文自然语言处理领域中,专业术语的识别、抽取和术语库构建一直是重要的研究内容。相较于英文,中文的语法结构更为灵活,没有明显的词语分隔,这使得许多有效的英文术语抽取方法在中文环境下效果不佳。特别是在特定的垂直领域,由于缺乏足够的先验知识,术语抽取工作往往陷入“低资源”困境。这里的“低资源”主要表现在两个方面:一是数据资源上的不足,专业领域的参考数据有限,缺乏必要的标注信息,相关外部知识碎片化,且对于人工标注的需求大而现实中难以满足;二是硬件资源上的限制,即在从研发到应用的过程中,硬件计算资源往往不足,尤其是在研究不够广泛的非通用领域。因此,在这种“低资源”环境下,传统的监督式机器学习方法需要大量的人工专家标注和校验,耗费大量的人力和计算资源。

为解决上述问题,本研究将数据划分为高质量数据和低质量数据。高质量数据指的是由专业工程师制作并经过仔细校验的文档,如操作手册和电气图纸。这些数据具有准确性和专业性,语言表达逻辑清晰,专业术语使用频繁且一致,因此从这些文档中抽取信息相对容易。低质量数据通常来自非专业人员或未经严格校对的文档,如用户工单和维修记录。这类数据随生产过程不断累积,可能包括OCR识别的扫描件和手写文档。由于缺乏有效的校对和纠错过程,这些文档中可能存在错误和不准确之处,使得信息抽取变得更加困难。在此基础上提出了基于预抽取-微调模型的双步抽取策略;并构建了基于XLNet的模型框架,结合增强型全局注意力双向长短期记忆网络(GA-BiLSTM),加强语义表示和上下文信息的捕获;同时,使用条件随机场(CRF)层辅助序列标注,从而提高术语抽取的准确性。此外,本研究在数据层面通过融合字符、字形以及拼音嵌入来增强模型的语义理解能力,并引入了基于LSTM的干扰项生成模块来提升模型在低质量数据抽取中的鲁棒性。

1  相关工作

ATE系统通常采用以下流程:1) 提取候选术语列表;2) 利用监督或非监督技术确定正确的候选术语。早期的ATE系统大量依赖手工规则和特征工程,不仅成本高昂,而且泛化能力有限。

虽然ATE的研究可以追溯到20世纪90年代[1],但这一问题仍然尚未得到完全解决[2]。例如,ATR4S[2]是一个较新的自动术语抽取工具,包含了15个以上的统计特征。在7个公开数据集上的评测显示,没有一种算法能在所有数据集上获得最佳效果,表明不同语言和领域的ATE效果存在差异。

按照特征分类,传统的ATE方法可以分为多种类型[3],包括基于语言学、统计学和外部知识的方法。基于语言学的方法虽然准确率较高,但受限于特定的语言规则,泛化能力有限。相反,统计学方法在抽取过程中主要依赖术语的特性和其在目标语料库中的频率,因此其效果受到语料库规模和质量的影响。随着时间的推移,更多基于语义、图和主题信息的方法应运而生,这些方法更注重于利用语料库的结构信息。

近年来,受到深度神经网络在自然语言处理(Natural Language Processing,NLP)任务中的成功应用的启发,出现了众多基于深度学习的ATE方法[4]。这些方法大多遵循三个主要步骤:1) 预处理;2) 特征工程; 3) 术语提取分类。业内领先的预训练模型往往都是基于英语进行训练,对中文的泛化能力不佳,需要经过改进才能适应中文任务。一些较为成功的模型,如BERT[5],国内学者针对中文词语结构的特点,改进了BERT的掩码方式,重新构建了BERT-wwm[6],在中文的NLP任务上获得了一定的提升。为了更好地处理这些问题,研究人员提出了一系列针对中文处理的新方法,如ERNIE[7]和ZEN[8]等模型。

中文汽车工业领域的术语抽取研究目前仍然是一个空白,本文以该领域作为特定研究领域,将基于预抽取-微调模型的双步抽取策略应用于该领域,旨在填补这一空白并为相关领域提供参考。

2  本文方法

本文提出了一种适用于低资源环境的双步术语抽取流程,并基于XLNet-GABiLSTM-CRF构建了一个术语抽取模型框架,旨在实现一个具有高鲁棒性的弱监督深度学习解决方案,以确保在资源受限的汽车工业领域中,实现相对可靠的性能表现。

本方案将汽车工业领域中的数据分为高质量和低质量两类,采用双步抽取策略:首先应用无监督方法从高质量数据中抽取信息;然后结合领域先验数据,对模型进行微调,以提高其鲁棒性;最后利用优化后的模型处理低质量数据。

图1所示,整个方案分为三个部分:

1) 数据预处理:图1中的红色区域表示对语料库的预处理部分。首先进行中文分词,并清除噪音字符;然后对所有数据进行基于字符、字形和拼音的嵌入操作,输出嵌入文本供预抽取模型使用。此外,还需要将文档依据规则划分为高质量数据集和低质量数据集。

2) 准备原始数据:图1中的绿色区域代表数据准备部分。首先,进行基于高质量术语的预抽取;接着,通过预抽取结果和少量人工标注数据创建一些带有错别字的负样本模型;利用基于LSTM的模型生成对抗样本数据,合并得到包含负样本的混合数据集,用于辅助基于下文ATE模型的微调。

3) 构建ATE 模型:图1中的紫色部分代表 ATE 的模型结构,以及微调和预测的实现。通过使用1)、2)两步准备的高质量混合数据进行模型训练,再利用训练好的模型对低质量数据进行抽取,输出术语。

2.1 预处理

1) 文本处理

中文书写系统并不使用明确的分隔符(如空格)分隔书面文本中的单词。因此,中文分词(Chinese word segment,CWS)通常被视为中文文本处理的首要步骤。

由于汽车工业制造等领域中普遍存在长术语,这些术语往往由多个词链接嵌套而成[9],分词的效果对于后续的长术语识别起到关键作用。目前流行的分词方法包括Jieba[10],PKUseg[11],CWSB[12]等,它们各自采用不同的原理,因此在不同任务上的表现也有所差异。Jieba基于规则和词典匹配的方式进行分词。它的主要优点是通用领域的文本分词中表现良好。PKUseg采用监督学习方法,专门针对特定领域(如医学、网络、新闻、旅游)的文本进行训练。本文选择的CWSB基于深度学习技术进行分词,注重对上下文语义的捕捉和理解,在一些特定的垂直领域中,CWSB抽取可靠性更高。同时,CWSB可以通过调整窗口大小,灵活设置分词粒度,从而提升对长术语的抽取能力。

2) 字符嵌入

为了增强模型在文本识别中的准确性和鲁棒性,本研究在文字嵌入基础上,引入了字音和字形嵌入,目的是改进已有的字符编码嵌入在处理错别字和错音字时的不足。未引入字音和字形嵌入方法错别字的字符编码相似度通常较低。例如,在扫描文档中,由于纸张污渍,“水”字可能被错误地扫描为“永”字。通过引入字形和字音嵌入,具有相似特征的汉字在字形、字音维度上的投影相似,进而模型能够识别并处理这些汉字。这种方法显著提高了模型对错别字的处理能力,增强了其在文本理解中的容错性,尤其是在处理字形和字音相近的错别字时,模型能够捕获到其嵌入编码中的相似特征,避免了对错误字符的误解。图2展示了基于字音、字符和字形的汉字嵌入模式。

汉字的嵌入由两个步骤组成:第一步,基于汉字字符、拼音以及字形分别进行特征提取;第二步,将这三种特征进行融合。其中,基于字符的基础嵌入使用了现有的 Word2vec [13]方法来实现。

图2左侧部分展示了拼音嵌入模块。首先,将涉及的汉字转换为其对应的拼音和音调(用0~4表示),接着将拼音文本转为整数编码;然后,通过创建一个拼音嵌入层,将整数编码的拼音映射到固定维度的嵌入向量。

图2右侧部分则展示了字形嵌入模块。每个汉字都会被转换为一个40×40的图像,然后将其输入到一个预训练好的卷积神经网络(Convolution neural network,CNN) 模型中,进行特征抽取和压缩,最后通过最终的全连接层生成固定长度的向量,作为字形嵌入。

图2中间部分展示了组合嵌入模块。首先,字符嵌入、字形嵌入和拼音嵌入会被连结在一起。接着,使用一个带有可学习矩阵Wf的全连接层融合不同的嵌入。最后,在融合嵌入部分添加激活函数(如 ReLU),不仅增强了模型的表达能力,还有助于提高后续任务的效率和性能。

2.2 数据准备

1) 预抽取

高质量语料库的文本十分简洁,普遍由短句构成,易于抽取。实验表明,无监督的方案中YAKE![14]的效果较好,但对中文文本抽取效果欠佳。本文对YAKE![14]进行了改进,将其字符编码形式与本文统一,使之适合于中文文本。改进之后YAKE![14]的输出序列如下:

[XT,ConfT]

其中:X={x1,x2,x3,,xn},是输出的术语列表;Conf={conf1,conf2,conf3,,confn}是输出的置信度列表,confnConf中降序排列,并与xn一一对应。

对于输出的结果,通常会通过m<n限制每个文档抽取的术语数量上限,即只保留排名前m的术语,得到X=x1~m;或者通过confn>confmin,设定一个置信度的阈值confmin,将达标的术语保留,得到X=x1~m'

在基于序列标注的方案中,对于给定的句子,其汉字序列为C={c1,c2,c3,c4,,cn},其中n为句子中含有字符的数量。为c1~n分配相应的标记序列Y={y1,y2,y3,y4,,cn},标签B表示字符是术语的开始,标签I表示字符是术语的一部分,标签O表示字符并非术语。

在以上格式不匹配的情况下,将预抽取的结果进行调整。本文的方案是对于每个xX1~m,将抽取出的术语在所有语料序列中出现的部分都基于{B,I,O}模式进行标注,这个操作可以很方便地通过脚本自动化实现。

2) 基于LSTM的对抗样本生成

本节将介绍一种创新性的负样本生成模型,用于生成负样本。生成的负样本可在下游任务中与原始数据混合使用,用于语言模型的微调训练。此过程有助于提升模型在应对输入错误或OCR识别错误所导致的错别字和病句问题时的鲁棒性。

图3为在干扰项生成任务中使用的双层编码器-解码器模型架构。该架构使用了两个LSTM层,分别作为编码器与解码器,通过在隐藏层加入高斯噪声来达到制造干扰项的效果[15]

LSTM是一种循环神经网络(Recurrent Neural Network,RNN)的变体[16],由多个LSTM单元结构组成,具有长期记忆能力,结构如图4所示。它的优点在于能克服传统RNN在处理长序列时面临的梯度弥散问题。

在LSTM层对文字嵌入完成编码任务后,下一步引入高斯噪声来实行干扰。对于编码后的高维向量,生成一个相同维度的高斯噪声干扰微调量。高斯噪声由高斯分布建模,其概率密度函数如下:

f(x)=1σ2πe-(x-μ)22σ2

(2)式中,μ是均值,σ是标准差,x是观测值。(2)式描述了一个以均值为中心、标准差决定宽度的钟形曲线,图像中心最高,两侧逐渐降低。

n=μ+σz

(3)式中,n是高斯噪声生成的微调量,μ是均值,σ是标准差,z是从标准正态分布(均值为0,标准差为1)中采样的随机数。(3)式表示高斯噪声是由一个固定的均值和标准差确定的正态分布生成的,其中随机数z控制了噪声的大小。

由于编码后的高维向量每一维度的特征分布都不尽相同,为了防止噪声微调后的数据失去原本数据的语义信息,此处需要将噪声的微调量进行限制,本方案选择将其映射为当前微调目标值的-5%~5%

将添加了噪声的向量输入到LSTM解码器中,解码器尝试从这些扰动表示中生成概率分布序列,再将其导入SoftMax层进行归一化,最后使用贪婪解码策略进行解码输出文本。

多次实验表明,为了有效训练整个模型,需要同时最小化重构损失和KL散度。通过限制重构损失,可以确保生成的文本与原始文本在结构和语义上保持高度一致,从而避免生成的干扰项与原始文本偏差过大。同时,引入KL散度有利于促进向量潜在空间的结构合理性和有序性[17]

2.3 ATE模型

图5所示的是本研究中使用的基于XLNet[18]的编码器整体架构。XLNet是类似于BERT[5]的一种预训练语言模型,旨在改进BERT的一些缺陷。与BERT相比较,XLNet主要有以下两个特征:

① 将自回归(Autoregressive,AR)与自编码(Autoencoding,AE)相结合

BERT是一种基于自编码的预训练模型[5],使用掩码语言模型(Masked Language Model,MLM)进行训练。这种方法存在预训练和微调之间的不匹配,因为在预训练阶段,模型需要预测被掩码的词,而在微调阶段,模型处理的是未掩码的输入。与之相反,XLNet采用了一种自回归方法,同时保留了BERT的双向上下文建模能力。XLNet使用置换语言建模(PLM)对所有可能的因子分解顺序进行建模,从而解决了预训练和微调阶段的不匹配问题。

② 擅长捕捉长距离依赖关系

XLNet基于Transformer-XL[19]架构,使用分段循环机制(Segment Recurrent Mechanism,SRM)和相对位置编码(Relative Positional Encoding,RPE)处理长序列,能够捕捉更长距离的依赖关系,提高了在长文本任务上的性能。

图5所示,输入的文本C=(c1,c2,,cn)经过embedding层,对于字符Cn生成对应的e(cn),并为其添加可训练向量ω。经过两层屏蔽双层注意力层(Masked Two-Stream Attention),生成内容表示“双重隐藏状态”(content representation“standard hidden states”)hn以及查询表示法(query representation)gn

其中每个屏蔽双层注意力层都包含如图6所示的双流注意力(two-stream attention)层。在注意力机制中,查询(Q)代表目标信息的表示,键(K)用于与查询匹配以确定重要性,而值(V)则提供了实际要聚焦的内容信息。

hngn的定义如下:

内容流(content stream):同时使用ztczt

hzt(m)Attention(Q=hzt(m-1),KV=hZ<t(m-1);θ)

查询流(query stream):使用Zt,但是屏蔽czt

gzt(m)Attention(Q=gzt(m-1),KV=hZ<t(m-1);θ)

最后再将hn以及gn合并,送入下一模块。

2.4 GA-BiLSTM与CRF层

实际上,输入的文本可以直接通过BERT或XLNet进行处理,作为端到端的模型直接输出结果[20]。但是这种方式效率较差,而且对于领域的针对性不强。本文提出的更有效的方式如下:仅用XLNet的输出作为特征的深度表示来包含如语义、词性等句子级别的特征;再将XLNet模型的输出序列表示为X{x1,,xn},输入GA-BiLSTM模型进一步抽取其上下文相关信息以及相邻字词之间的信息;最后利用CRF计算标签序列(tag sequencey)的概率,同时得到loss score。具体模块如图7所示。

传统的单向LSTM模型不能同时处理上下文信息,本文使用LSTM的基本记忆单元构建Bi LSTM模型[21],分别使用前向和后向LSTM模块,连接到同一输出层。对每个句子分别计算正序(从左到右根据句子方向从左到右)和倒序(从右到左根据句子的倒序)得到两种不同的隐层表示,得到最终的隐层表示通过向量拼接。BiLSTM比LSTM能更好地捕获语义依赖,学习到更全面的上下文和语义共现信息,从而有效地利用文本序列的上下文信息。

句子的术语不仅与上下文信息有关,而且和其余词也有高度相关性。但是给定一个句子,并不是所有的上下文对句子的语义都有相同的贡献。为了解决这个问题,采用自注意力(self-attention)[22]机制提取更重要的词,通过给它们更高的权重增加它们的重要性。

此外,为了更有效地捕捉到内部结构信息,本文在BiLSTM上引入了全局自注意力(Global Self-Attention,GSA)[22]层。全局自注意力机制通过对序列中的所有位置计算查询、键和值之间的相似度,并将相似度作为权重应用于值,以获得全局加权表示可以捕捉序列中的全局依赖关系。全局自注意机制和BiLSTM模型的集成(GA-BiLSTM)可以显著增强重要词的作用。具体算法流程如下:

1) 假设hi表示BiLSTM模型隐藏层输出的特征向量,包含词wi的上下文信息。然后,hi通过全连接层转化为ui,其中ui的计算公式为:

ui=tanh(Whi+b)

其中: W 表示可训练的权重矩阵,b表示注意力机制的可训练偏差自动向量。

2) 计算ui与上下文向量ut的相关性,通过Softmax函数得到归一化权重aiai的计算公式为:

αi=exp(uiTut)i1,2,,nexp(uiTut)

其中,i{1,2,,n}表示句子中的一个字符,ut表示相应单词对句子的贡献,主要通过随机初始化和训练获得。

3) 每个单词获得的hi乘以相应的注意力权重αi,以获得整个序列的全局特征向量S

S=i=1naihi

句子级全局向量S和BiLSTM输出层获得的目标词向量ht组合成一个向量[S;ht]作为注意力层的输出。注意力层的输出zt如下:

zt=tanh(WC;ht)

在ATE的任务中,GA-BiLSTM模型的输出的向量仅包含了部分上下文信息,而处理相邻标签之间的依赖关系的能力则相对较弱。为此,引入条件随机场(CRF)[23],来获得全局最优的标记序列。其基本算法如下:

对于一个句子S={W1,W2,,Wn}送入网络中训练,定义矩阵P是GA-BiLSTM层的输出,其中P的大小为n×nn是单词个数,m是标签类别。定义Pij代表句子中第i个单词的第j个标签的概率。对于一个预测序列y={y1,y2,,yn},它的概率可以表示为:

K(X,y)=i=0nAyi,yi+1+i=1nPi,yi

式中,矩阵Α是转移矩阵;Aij表示由标签i转移到标签j的概率;y0yn是预测句子起始和结束的标记。Α是一个大小为M+2的方阵,在原始句S的条件下产生标记序列y的概率为:

P(y|S)=eK(X,y)y˜YXK(X,y˜)

式中,y^代表真实的标记值。在训练过程中标记序列的似然函数为:

logP(y|S)=K(X,y)-log(y˜YXeK(X,y˜))

式中,Yx表示所有可能的标记集合,包括不符合BIO(beginning-inside-outside)三元标注规则的标记序列。通过(19)式得到有效合理的输出序列。预测时,由(13)式输出整体概率最大的一组序列:

y*=argmaxy˜YXK(X,y˜)

3  实 验

模型在预训练过的中文语言模型的基础上进行微调。在XLNet的开源版本模型HFL/Chinese-XLNet-base[24]的基础上使用参杂了干扰项的工业数据集对本文的任务进行微调训练。本节将通过一些实验,从模型本身,以及模型与其他基准模型的对比验证本模型的优越性。

3.1 实验设置

1) 数据集

在ATE领域中存在着许多使用不同标准的数据集,对于本文文档级别的ATE任务而言,需要数据集由文段以及全局手动注释生成。经过筛选,本文最终采用ACTER[25]、TTC-project(Chinese)[26]以及本研究对于工业汽车生产领域语料进行标注的私有数据集。ACTER是涵盖了4个不同领域(腐败、盛装舞步、心力衰竭和风能)和3种语言(英语、法语和荷兰语)的数据集,TTC-project则涵盖了两个领域(风能和移动技术)以及多语言的数据集。

由于本文的工作主要针对中文领域用例进行研究,业内关于中文ATE的数据集相对较少,如大部分文章[27]都针对某一领域的具体任务,自行标注数据集且并未公开。所以此处选择对TTC-project筛出其中中文的部分,作为中文领域的公共基准数据集进行测试。

本文自建的数据集AMID (Automotive Manufacturing Industry Data)分为两个部分,高质量语料库,示例如图8;低质量语料库,示例如图9。高质量语料库的语言逻辑规整,术语密集且重复出现,抽取难度较小的高质量语料库。主要由工业汽车制造领域的用户手册、技术文档、技术图纸组成。

低质量语料库的语言逻辑等质量相对较差,且更为口语化,抽取难度较大。主要由用户工单、维修工单等随着生产过程慢慢增加的数据组成。

本研究通过对部分具有代表性的文档中的术语表达进行注释筛选制作验证、测试数据集,例如隔离阀(isolation valve)、交叉流动热交换器(cross-flow heat exchanger)和泄漏探测器(leak detector)。验证集与测试集以1∶1划分后,均包含826条数据。

2) 基准模型

为了验证本方案的效率,本节将C-value[9] 、CNN-BiLSTM-CRF[28]、BERT-BiLSTM-CRF[27]和HAMLET[29]这几种具有代表性的算法与本文方法进行了比较。

C-value[9]通过计算特征的凝聚度(cohesion)和分离度(separation)来评估候选术语的重要性。CNN-BiLSTM-CRF[28]可以最小化不同分词结果对词条抽取的影响。BERT-BiLSTM-CRF[27]通过端到端的模式,借鉴NER的方式来进行ATE任务,HAMLET[29]是一种混合自适应机器学习算法。

3) 评价指标

图10所示,ATE的数据集的标准集主观性相对较强,有多种建立方式,如人工标注建立、基于词典或基于行业标准。同时,传统的ATE方式会有多种输出类型,如输出整个结果、输出部分结果或者输出the-top-n个结果的方式。由于评估的方式具有多样性,不同方法的性能并不能直接对比,因此通常使用精度(P)、召回率(R)和F1值 (F1)三个评价指标进行评价。

P=TPTP+FP
R=TRTR+FN
F1=2PRP+R

图10展示了一个示例语句“泄漏探测器内置于底部盘内部。”的标注情况。图10上半部分使用蓝色标注的是Ground Truth,下半部分用绿色标注的是示例Prediction。

在术语抽取任务中,评估指标的选择对结果有显著影响。常用的评估指标分别是基于token的评估方式以及基于术语实体的评估方式。基于token的评估方式更为宽容。例如,在上述极端案例中,当采用基于严格术语实体匹配的评估方法时,计算得到的F1值为0。相比之下,基于token的方法得到的F1值高达0.89。这种差异体现在不同评分方法对细微误差的容忍度以及对复杂术语(如长术语、嵌套术语)的精确度的不同要求。在本研究所关注的工业应用领域中,鉴于数据准确性对于下游任务(例如图谱构建)的重要性,采用基于术语实体的评估方法。

4) 参数设置

表1展示了本实验中采用的超参数数值。

在本实验中,XLNet的基础预训练模型使用的是hfl/Chinese-XLNet-base[24]。用于模型微调的训练集、验证集、测试集的比例为8∶1∶1。

初次实验中,将epoch设置为40,观察对应的F1值变化。实验结果表明,当epoch达到20时,F1值达到最高值,且变化趋向于平缓,并在25之后不再有明显提升,发生了一定的过拟合。因此,本文最终将epoch设置为20。

图11(a)和(b)展示了在多次实验中,不同学习率(LR)下F1值与Epoch之间的关系,其中图11(b)提供了图11(a)末尾部分的详细放大视图。同样,图11(c)和(d)呈现了在不同学习率下,损失值(Loss)与step之间的关系,其中图11(d)为图11(c)末端部分的放大细节视图。

在基于BERT、XLNet等预训练模型基础上的任务中,学习率一般设置为5.0×10-4到5.0×10-6之间。当学习率过大时,网络不能收敛,在最优值附近徘徊;而学习率过小时,网络收敛非常缓慢,且有可能陷入局部最优解[30]。GABiLSTM-CRF层的学习率过低会导致模型难以提取特征,拟合速度过慢[31],此处将其设置为预训练模型学习率的10倍。本节在确定了合适的epoch范围之后,继续寻找合适的学习率。如图11所示,当学习率大约为5.0×10-5时,实验获得相对较好的结果。

3.2 性能对比

因自动术语抽取评价体系不够完善,各种文献中术语抽取方法的实验评估完全不同[3]。在语料库选择(例如领域,规模)、评价方法(例如人工评价方式,术语参考表评价方式)和候选术语选择范围(例如整个抽取结果,前N个最佳结果)等方面各成体系,并且部分论文在自己标注的封闭数据集上进行实验评估,导致很难将术语抽取方法的实验结果进行统一的、公正的对比。

表2展示了在多个中文数据集上对比的结果,以及一些开源的方法对工业领域进行抽取作为对比。其中AMID-H代表着以文档为主的高质量数据集,AMID-L代表以工单等数据为主的低质量数据集,AMID-ALL则是两者一起抽取。本文的模型在这个过程中,对AMID-ALL的任务使用自己的预抽取-微调的模型方式来进行抽取,其中标星号数据来源于公开数据[34]

表2所呈现的数据分析显示,在不同数据集中,多种抽取方法的效果存在显著差异。以公开数据集为例,其中以C-value为典型的传统统计学方法对于高质量的通用数据表现尤为出色。这一现象的原因在于,高质量通用数据集往往包含大量重复出现的术语,使得基于频次的统计方法能有效识别关键术语,显示出其简洁性与高效性。然而,在专业垂直领域,由于数据量有限,传统方法的局限性开始显现。在这种情况下,深度学习方法如本文所采用的模型,经过大量文本预训练,获得了对复杂语义的深入理解,从而在这些领域展现出更优异的性能。

针对中文数据,不论是公开还是私有数据集,本模型凭借多种嵌入技术和针对中文特化的预训练语言模型,实现了显著的性能提升。尤其值得一提的是,模型中先进的分词技术有效减少了术语错误截断的风险,而多元特征嵌入策略则极大增强了模型的鲁棒性。在本研究构建的私有数据集中,由于数据质量较低,常见的问题包括语言结构的松散和错别字的存在,这些因素使得各类模型在这些数据集上的表现(以F1值为标准)普遍低于高质量数据集。然而,深度学习模型如本文提出的方案及BERT-BiLSTM-CRF等,凭借其强大的语义理解和上下文分析能力,在低质量数据集中的性能下降幅度较小。这表明,深度学习模型能够在复杂和多变的数据环境中保持稳定的抽取效果,这一优势在处理非结构化和质量参差不齐的真实世界数据时尤为重要。

3.3 消融实验

为了解基于字符、字形、字音embedding导入的XLNet+GABiLSTM+CRF模型在术语抽取任务上的性能,进行消融实验,观察逐个移除模型的各个部分前后的性能变化,评估模型中每个组件的贡献。实验的数据见表3

字符、字形、字音embedding:移除任何一种embedding,模型性能都会下降。这表明,在中文术语抽取任务中,这三种embedding相互补充:字符编码提供了字符的基础和客观表示;而字形和字音则贡献了额外信息。在容错率要求较高的场景中,字形和字音有助于纠正对错别字的语义理解,从而显著增强模型的处理效能。

XLNet:当去除预训练的XLNet,转而仅依赖字符嵌入训练GA-BiLSTM模型时,明显观察到性能下降。这不仅表明了XLNet在捕获长距离上下文信息及深层语义理解方面的显著优势,也彰显了它在提升自然语言处理(NLP)任务中的关键作用。因此,这一实验结果验证了XLNet在提高NLP任务中的整体性能和准确度方面的重要性。

GA-BiLSTM:移除了GA-BiLSTM层后,模型在进一步捕捉局部上下文信息和建立序列表示方面的能力减弱。这证实了GA-BiLSTM机制在术语抽取任务中的重要作用。

CRF:移除CRF层后,模型在建立标签之间关系方面的能力减弱,导致标签之间的结果互相独立,甚至可能会出现如图12所示的错误标注情况。

4  结 语

本文提出了一种基于双步抽取的低资源中文工业领域术语抽取方法。该方法能够高效处理不同质量的数据,并结合预提取及微调的方式,充分发挥XLNet预训练语言模型的潜力。鉴于中文术语抽取的特殊性,本研究还将字形与拼音特征融入嵌入过程中,以更精准地捕捉语义信息。虽然不同语言和数据集的术语抽取表现存在差异,但本模型在中文工业领域数据集中表现出色。消融实验结果表明,将预训练语言模型与全局注意机制融入BiLSTM+CRF框架,能够显著提升模型性能。

本模型在优化方面仍有提升空间。整合额外特征和多个处理阶段虽增强了模型功能,但也导致了处理速度的降低。此外,模型在适应其他工业领域的能力上还需进一步强化。

参考文献

[1]

KAGEURA KUMINO B. Methods of automatic term recognition: A review[J]. Terminology. International Journal of Theoretical and Applied Issues in Specialized Communication19963(2): 259-289. DOI: https://doi.org/10.1075/term.3.2.03kag .

[2]

ASTRAKHANTSEV N. ATR4S: Toolkit with state-of-the-art automatic terms recognition methods in Scala[J]. Language Resources and Evaluation201852(3): 853-872. DOI: 10.1007/s10579-017-9409-4 .

[3]

张雪, 孙宏宇, 辛东兴, . 自动术语抽取研究综述[J]. 软件学报202031(7): 2062-2094. DOI: 10.13328/j.cnki.jos.006040 .

[4]

ZHANG XSUN H YXIN D Xet al. Survey on automatic term extraction research[J]. Journal of Software202031(7): 2062-2094. DOI: 10.13328/j.cnki.jos.006040 (Ch ).

[5]

TRAN H T HMARTINC MCAPORUSSO Jet al. The recent advances in automatic term extraction: A survey[EB/OL]. 2023arXiv: 2301.06767.

[6]

DEVLIN JCHANG M WLEE Ket al. BERT: Pre-training of deep bidirectional transformers for language understanding[EB/OL]. 2018arXiv: 1810.04805. DOI: 10.48550/arXiv.1810.04805 .

[7]

CUI Y MCHE W XLIU Tet al. Pre-training with whole word masking for Chinese BERT[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing202129: 3504-3514. DOI:10.1109/TASLP.2021.3124365 .

[8]

SUN YWANG S HLI Y Ket al. ERNIE: Enhanced representation through knowledge integration[EB/OL]. 2019arXiv:1904.09223. DOI:10.48550/arXiv.1904.09223 .

[9]

DIAO SBAI JSONG Yet al. ZEN: Pre-training Chinese text encoder enhanced by n-gram representations[EB/OL]. arXiv: 2019:1911.00720. DOI:10.48550/arXiv.1911.00720 .

[10]

FRANTZI KANANIADOU SMIMA H. Automatic recognition of multi-word terms: The C-value/NC-value method[J]. International Journal on Digital Libraries20003(2): 115-130. DOI: 10.1007/s007999900023 .

[11]

ZHANG X WWU PCAI J Met al. A contrastive study of Chinese text segmentation tools in marketing notification texts[J]. Journal of Physics: Conference Series20191302(2): 022010. DOI: 10.1088/1742-6596/1302/2/022010 .

[12]

LUO R XXU J JZHANG Yet al. PKUSEG: A toolkit for multi-domain Chinese word segmentation[EB/OL]. 2019arXiv: 1906.11455.

[13]

MA JGANCHEV KWEISS D. State-of-the-art Chinese word segmentation with Bi-LSTMs[EB/OL]. 2018arXiv: 1808.06511. DOI: 10.18653/v1/d18-1529 .

[14]

MIKOLOV TCHEN KCORRADO Get al. Efficient estimation of word representations in vector space[EB/OL]. 2013arXiv: 1301.3781.

[15]

CAMPOS RMANGARAVITE VPASQUALI Aet al. YAKE! Keyword extraction from single documents using multiple local features[J]. Information Sciences2020509: 257-289. DOI: 10.1016/j.ins.2019.09.013 .

[16]

RASMUS ABERGLUND MHONKALA Met al. Semi-supervised learning with ladder networks[DB/OL].[2023-05-16].

[17]

HOCHREITER SSCHMIDHUBER J. Long short-term memory[J]. Neural Computation19979(8): 1735-1780. DOI: 10.1162/neco.1997.9.8.1735 .

[18]

KINGMA D PWELLING M. Auto-encoding variational Bayes[EB/OL]. 2013arXiv: 1312.6114.

[19]

YANG Z LDAI Z HYANG Y Met al. XLNet: Generalized autoregressive pretraining for language understanding[EB/OL]. 2019arXiv: 1906.08237.

[20]

DAI Z HYANG Z LYANG Y Met al. Transformer-XL: Attentive language models beyond a fixed-length context[EB/OL]. 2019arXiv: 1901.02860. DOI: 10.18653/v1/p19-1285 .

[21]

HAZEM ABOUHANDI MBOUDIN Fet al. TermEval 2020: TALN-LS2N system for automatic term extraction[EB/OL].[2023-04-18].

[22]

SCHUSTER MPALIWAL K K. Bidirectional recurrent neural networks[J]. IEEE Transactions on Signal Processing199745(11): 2673-2681. DOI: 10.1109/78.650093 .

[23]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[EB/OL].[2023-05-15].

[24]

HUANG Z HXU WYU K. Bidirectional LSTM-CRF models for sequence tagging[EB/OL]. 2015arXiv: 1508.01991.

[25]

CUI Y MCHE W XLIU Tet al. Revisiting pre-trained models for Chinese natural language processing[C]//Findings of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2020: 657-668. DOI: 10.18653/v1/2020.findings-emnlp.58 .

[26]

RIGOUTS TERRYN AHOSTE VDROUIN Pet al. TermEval 2020: Shared task on automatic term extraction using the annotated corpora for term extraction research (acter) dataset[DB/OL]. [2023-04-30].

[27]

ROCHETEAU JDAILLE B. TTC TermSuite: A UIMA application for multilingual terminology extraction from comparable corpora[DB/OL].[2023-05-16]. DOI: 10.1007/11562214_62 .

[28]

吴俊, 程垚, 郝瀚, . 基于BERT嵌入BiLSTM-CRF模型的中文专业术语抽取研究[J]. 情报学报202039(4):409-418. DOI:10.3772/j.issn.1000-0135.2020.04.007 .

[29]

WU JCHENG YHAO Het al. Automatic extraction of Chinese terminology based on BERT embedding and BiLSTM-CRF model[J]. Journal of the China Society for Scientific and Technical Information202039(4):409-418. DOI:10.3772/j.issn.1000-0135.2020.04.007 (Ch ).

[30]

HAN X WXU L ZQIAO F. CNN-BiLSTM-CRF model for term extraction in Chinese corpus[C]//International Conference on Web Information Systems and Applications. Cham: Springer, 2018: 267-274. DOI:10.1007/978-3-030-02934-0_25 .

[31]

TERRYN A RHOSTE VLEFEVER E. HAMLET: Hybrid adaptable machine learning approach to extract terminology[J]. Terminology. International Journal of Theoretical and Applied Issues in Specialized Communication202127(2): 254-293. DOI:10.1075/term.20017.rig .

[32]

SUN CQIU X PXU Y Get al. How to fine-tune BERT for text classification[C]// Chinese Computational Linguistics. Cham: Springer, 2019: 194-206. DOI:10.1007/978-3-030-32381-3_16 .

[33]

SOUZA FNOGUEIRA RLOTUFO R. Portuguese named entity recognition using BERT-CRF[EB/OL]. 2019arXiv: 1909.10649.

基金资助

科技部科技创新 2030“新一代人工智能”重大项目(2020AAA0109300)

AI Summary AI Mindmap
PDF (3649KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/