基于多特征信息融合自注意机制的中文命名实体识别方法

张建伟 ,  刘瑾 ,  杨海马 ,  曾国辉 ,  邢季 ,  张锐

武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (3) : 281 -292.

PDF (2668KB)
武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (3) : 281 -292. DOI: 10.14188/j.1671-8836.2023.0234

基于多特征信息融合自注意机制的中文命名实体识别方法

作者信息 +

A Chinese-Named Entity Recognition Method Based on Multi-Feature Information Fusion and a Self-Attention Mechanism

Author information +
文章历史 +
PDF (2731K)

摘要

工业领域数据由于其非结构化、领域特定性和数据稀缺性等特点,传统的中文命名实体识别技术在工业领域的应用并不理想。本文以汽车产业数据为依托,提出一种将标签语义与字形拼音信息相融合的自注意网络算法,结合字符级和标签级特征进行多维特征提取。模型引入自注意机制获得文本长距离依赖关系,将分词特征整合到字符级,并结合标签语义特征的上下文进行预测,提高了字符词边界的识别性能。在一定程度上解决了词边界分割歧义及短语组合上下文依赖问题。本文方法在MSRA和Weibo数据集及自构建工业维修文档数据集上进行了实验,结果表明所提方法能够提高实体识别准确性,并在工业领域汽车零配件数据集上实现了工业场景化应用。

Abstract

Due to the inherent characteristics of industrial domain data, such as its unstructured format, domain-specific nature, and the scarcity of available data, the application of traditional Chinese-Named Entity Recognition (NER) techniques in industrial contexts often leads to suboptimal results. In response, this paper introduces a novel self-attention network algorithm, leveraging automotive industry data, that synergizes label semantics with glyph and phonetic elements. This model employs a self-attention mechanism to discern long-distance textual dependencies and integrates these with word segmentation at the character level. The model notably enhances character and word boundary recognition by fusing these elements with the context of label semantics. This approach effectively mitigates the common ambiguities in word boundary segmentation and the complexities associated with phrase contextual dependencies. Extensive testing on the MSRA and Weibo datasets, and a bespoke industrial maintenance document dataset demonstrates the method's efficacy. The results reveal a significant improvement in entity recognition accuracy, with specific enhancements in industrial scenario applications, particularly in the automotive parts sector datasets.

Graphical abstract

关键词

中文命名实体识别 / 自注意机制 / 多特征融合 / 标签语义

Key words

Chinese-named entity recognition / self-attention mechanism / multi-feature fusion / label semantics

引用本文

引用格式 ▾
张建伟,刘瑾,杨海马,曾国辉,邢季,张锐. 基于多特征信息融合自注意机制的中文命名实体识别方法[J]. 武汉大学学报(理学版), 2024, 70(3): 281-292 DOI:10.14188/j.1671-8836.2023.0234

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

工业知识自动化是工业领域中的重要一环。随着知识构建技术在各领域落地应用的不断发展,实体抽取作为核心步骤,对其精度和效率的要求日益增高。由于工业领域数据的非结构化性、领域特定性和数据稀缺性,使得直接从这些数据中抽取实体和关系成为一项挑战。特别在技术层面,信息抽取的准确性直接关系到知识质量和可靠性,因此需要通过高精度模型来减少错误和偏差的迭代传播。研究如何提升信息抽取模型的语义解析能力,已成为该领域的研究焦点。

命名实体识别(NER)任务旨在查找分类非结构化文本中的命名实体类型,例如人物(PER)、地点(LOC)或组织(ORG)等,在许多自然语言处理(NLP)下游任务已经广泛应用。例如关系提取[1]、实体链接[2]、问题生成[3]和指代消解[4]。对于英文文本任务,这些问题已经得到广泛研究[5~7]。在中文文本处理方面,由于中文特有的语言特性,如缺乏明确的词边界和更为复杂的语法结构,该任务面临着额外的挑战,这使得中文命名实体识别工作更具挑战性。

中文字符之间没有空格作为单词分隔符,主要通过语义信息来区分,给中文NER带来了许多困难[8]。此外,该任务还面临着复杂组合、实体嵌套和长度不齐等挑战[9]

在中文文本语言中,存在两个重要基本特征:基于字形的信息和基于拼音的信息。汉语是一种逻辑学(符号)语言,在中文字形中包含着字符语义信息。例如:“液(液体)”,“江(河流)”和“湖(湖泊)”都有“氵(水)”这个偏旁,在语义上都与水有关。并且字形通过多种中文字体表达含义,而每种字体对应字形也不尽相同。例如:中文汉字中有仿宋、楷体和隶书等字体,而对应同一汉字“江”,每种字体也不尽相同。汉字字形背后蕴含着丰富的语义,充分利用字形信息可以增强中文自然语言处理模型的表达能力。许多研究工作将神经网络应用于识别中文字形[1011]

拼音是用罗马字母表示的汉语发音系统,对建模语义以及语法信息至关重要。这些信息无法被上下文或者字形嵌入所捕捉。考虑到在汉语中普遍存在多音字现象(根据《当代汉语词典》统计,汉语7 000个常用汉字中,约有700个汉字具有多音字的特点),即同一个字符具有多个发音,每个发音都与特定的拼音表达相关联。在语义层面上,例如字符“乐”具有两种截然不同的发音:“乐”发音为“yuè[yε]”,表示“音乐”,而“lè[lγ]”表示“快乐”。在句法层面上,发音有助于识别字符词性,例如字符“还”有两个发音:“huán”和“hái”,前者表示动词“归还”,后者表示副词“也”。通过拼音信息进行表征,整合字形和拼音信息到NER模型中不仅有助于提高模型对实体的识别精度,而且也有助于捕捉语义和语法的细微差别。

为了增加中文语义的提取能力,已有相关研究关注到标签特征。标签名称具有从数据中归纳出来的语义信息,标注本体在一定程度上与实体的上下文相关联。例如,“Kobe Bean Bryant”标签标注与“PERSON”的表示更相似,而不与“LOCATION”或“DATE”更相似。Ma等[12]利用标签名称中的语义信息为模型提供丰富的额外先验知识,通过使用两个BERT编码器,在低资源环境中提高了小样本NER基准性能。标签名称中蕴含的语义信息可以与实体的上下文相关联,这样的先验知识对于模型的学习和推断是非常有价值的。在低资源或特定工业应用场景下,标签名称的语义信息可以用来增强模型对实体的识别和分类。

为了增强中文文本的语义表达能力,本研究采用了一种结合自注意机制的语义增强方法。该方法通过计算汉字的字形和拼音信息与标签语义嵌入信息的加权和,整合这两种表示形式的语义特征。字形嵌入基于汉字的不同字体,能够从字符表面形态以可视化的形式捕捉汉字的语义信息。拼音嵌入对相同字形的不同语义进行了建模,因此避免了同一字形词素交叉的限制。为了利用NER的标签语义,标签嵌入通过单独BERT编码器[13],编码标签名称(PERSON,LOCATION等)。本文将字形嵌入、拼音嵌入、字符嵌入和标签语义嵌入相结合,形成融合嵌入,通过注意机制输出最终NER识别标签,对中文字符独特的语义特性进行建模。

1  相关工作

1.1 学习字形信息

自深度神经网络出现以来,从表面中文形式学习字形信息已经受到广泛关注。受到词向量的启发,Li等[14]、Yin等[15]使用索引部首嵌入捕获字符语义,在中文NLP任务上提高了模型性能。另一种融合字形信息的方法是将字符视为图像形式,通过对图像进行建模可以学习到字形信息。Liu等[16]、Shao等[17]使用卷积神经网络(CNN)从字符图像中提取字形特征,但并没有在所有任务上实现一致的性能提升。Tao等[18]在词级类比和词级相似性任务上获得积极的结果,但没有在更多任务上进一步评估学习到的字形嵌入。Meng等[11]将字形嵌入应用于广泛的中文任务,提出一种特定CNN结构提取字符特征,并使用图像分类作为辅助目标规则化有限图像影响。Xuan等[19]将Meng等[11]的想法扩展到了NER任务中,使用一种新颖的卷积神经网络对字形信息进行编码,用于捕捉字形信息和邻近图形之间的交互信息;通过融合机制,融合每个字符的BERT表示和字形表示,提取字符分布表示和字形表示之间的交互信息。刘志豪等[20]通过ALBERT预训练语言模型获取地质文本的丰富语义特征,同时融合汉字拼音、字形以及词边界特征,共同构建嵌入层,从而增强对复杂实体的识别性能。由此受到启发,可以将不同字形信息进行融合,充分提取字形潜在语义特征,进一步增强信息提取能力。

1.2 学习标签语义信息

已有的研究工作表明,在文本分类任务中利用标签语义可以进行少样本学习[21]。Zhou等[22]通过从维基百科中自动链接读取信息,研究了带有标签语义的细粒度命名实体识别。Paolini等[23]将NER作为生成任务,预测增强语言中的命名实体。Cui等[24]将NER重新定义为一个填空任务,并使用序列到序列模型填充预定义模板中的命名实体。这两种方法都采用自回归解码器而导致推理时间过长。Hou等[25]在任务自适应投影网络(TapNet)中利用标签名称语义表示标签,核心思想是通过映射函数,将不同标签的单词投影于映射空间中。由于工业文本数据较为缺乏,利用标签语义信息,通过将标签表示与字符表示对齐,提高词边界范围准确性。

2  本文模型

2.1 概述

图1展示了本文模型的总体架构。在工业维修文档中,存在大量长文本数据,例如:“XYZ型号高效能热交换器”“DEF型多功能CNC加工中心”“电机气动阀门”等。这些工业实体由多个中文词语组成,用一般方法识别长距离关系准确性较低。本文模型关注了两种粒度信息,一种是基于字符、字形、拼音粒度,一种是基于标签语义粒度。对于每个中文字符,首先将其字符嵌入、字形嵌入以及拼音嵌入连接起来,通过全连接层映射到D维嵌入中,形成融合嵌入。在融合嵌入基础上加上位置嵌入,形成词向量嵌入表示——基于字符、字形、拼音粒度。对于标签信息,使用一个单独的基于BERT的编码器以利用标签语义信息。模型使用BiLSTM-CRF作为基本结构,并引入自注意机制(self-attention结构)获得字符序列与标签序列的长距离依赖关系。

2.2 字符信息表示

字符信息由绝对位置信息嵌入和融合信息嵌入共同表示。其中融合信息嵌入基于相应的字符嵌入、字形嵌入和拼音嵌入。字符嵌入的作用与BERT中使用的token-embedding类似,不同之处在于其粒度为字符级别。下面分别介绍字形嵌入、拼音嵌入和融合嵌入方法。

1) Glyph Embedding (字形嵌入): 汉语中语义高度相关的汉字通常也具有类似的结构,如“锡、钉、铣、钳、铲、销”都是与金属有关的汉字,同时都是左右结构,有相同的偏旁部首。中文字体中有仿宋、楷体和隶书等字体,因此同一汉字,有不同的字体。Meng等[11]通过结合古代和现代汉字脚本丰富汉字图像的象形信息。本文则将字符转换成图像,使用三种类型的中文字体:仿宋、楷体和隶书,每种字体都被实例化为一个24×24的图像。其中每个浮点像素范围为0到255,⊗表示向量拼接。然后使用卷积神经网络提取特征,转换后的字符图像被输入到一个卷积神经网络中。24×24×3的向量首先经过向量扁平化(vector flattening),再经过same padding操作(图像卷积时在图像周围各填充两层零值像素),展开成一维2 352向量,然后将一维向量输入到全连接层中,以获得输出字形向量。过程如图2所示。

2) Pinyin Embedding (拼音嵌入): 在汉语语言处理中,由于语句不以空格作为单词边界的标志,因此在命名实体识别的初步阶段,确立词汇的界限成为一个关键任务。这一点体现了分词与命名实体识别两者之间的紧密关联性。在工业领域的文本处理中,通过拼音分析可以发现,相同类别的命名实体通常在词尾有着相同的字,这一现象为识别工业文本中的命名实体提供了有效的依据。如表1所示,工业领域中常见的实体类型包括:“-机”“-器”“-线”“-台”“-泵”“-炉”“-轮”“-带”等。例如,“铣床机”“钻床机”等实体名称均以“机[jī]”结尾;“电磁器”“蓄电器”“加热器”等则以“器[qì]”结尾。基于此,本研究考虑将拼音特征融入工业领域文本处理中,以解决实体边界识别的模糊性问题。

每个中文字符的拼音嵌入用于解耦同一字形下的不同语义,如图3所示。通过使用开源pypinyin软件包(https://pypi.org/project/pypinyin/)为中文字符生成对应拼音序列。pypinyin软件包是一种将机器学习模型与基于字典规则相结合的系统,可以根据给定的上下文推断出汉字的拼音。汉语拼音是一种将汉字的读音用罗马字母(拉丁字母)拼写出来的符号音标字符序列,其中有4个音符表示声调。通过使用特殊符号来表示声调,这些标记添加到罗马字母序列的末尾。在拼音序列上应用宽度为2的CNN模型,通过最大池化(max-pooling层)得出最终的拼音嵌入。这使得输出维度不受输入拼音序列长度的影响。输入拼音序列的长度固定为8,当实际长度未达到8时,其余位置用特殊字符“-”填充。

3) Fusion Embedding (融合嵌入): 将获得的字符嵌入、字形嵌入和拼音嵌入组合成一个三维向量,融合层通过全连接层将三维向量转换为一维向量。生成的融合嵌入与位置嵌入相结合,形成词向量嵌入表示(word representation)。图4展示了融合层过程,其中,“⊗”表示向量拼接,“×”表示矩阵相乘。将字符嵌入、字形嵌入、拼音嵌入进行向量拼接。Fusion Layer表示融合层, WF 表示学习参数矩阵。通过Fusion Layer层获得融合嵌入。

2.3 标签编码表示

使用一个单独的基于BERT的编码器以利用标签语义信息。和传统NER模型[626]类似,使用BIO方案(每个标记都被预测为B-entity_type、I-entity_type或O,表示该标记位于entity_type的开头、内部或外部)预测每个标记的标签。对于每个标记,从字形信息序列表示中获取嵌入eD为源数据集,对于与D相关联的唯一标签集合LD,应用三个步骤获取标签表示:1) 进行标签名转换,手动将标签名称转换为自然语言形式,例如“PER”转换为“person”,“EQU”转换为“equipment”等;2) BIO方案应用,将每个标签名称转换为自然语言形式的BIO方案,例如将“person”转换为“begin person”或“inside person”;3) 使用BERT进行标签嵌入。对于转换后的每个BIO标签名称,使用BERT模型生成嵌入。BERT模型首先将输入序列的每个标签名称作为单独的序列进行编码,如下:

BERT_Embedding(“B-person”), BERT_Embedding(“I-person”),…,BERT_Embedding(“O”)

在BERT输出中,每个序列的第一个标记[CLS]被用来表示整个序列的聚合信息。取出的每个BIO标签序列的[CLS]标记的嵌入,用作该标签的嵌入表示:Label_representation i =BERT_Embedding(“[CLS] B-person … [SEP]”)。其中,[SEP]是BERT模型中用于分隔序列的特殊标记。

2.4 自注意力多特征融合表示

模型以Bi-LSTM为基本结构,将词嵌入表示和标签嵌入表示序列分别表示为[E1c,E2c,…,Enc]和[E1w,E2w,…,Emw],并分别输入到两个具有相同结构但参数不同的并行Bi-LSTM结构中。输出字形和标签信息的语义特征,分别表示为hchw。将两个隐藏层连接起来形成一个总隐状态(表示为htotal=[hc,hw]),其中前面部分是字形信息表示,后面部分是标签信息的语义特征。接着对总隐状态序列进行自注意机制操作。

自注意机制是一种编码序列数据方法,在处理一种类型信息时,同时考虑到其他相关信息的影响。hchw的结合旨在通过序列级联操作整合这两种不同粒度的信息。首先通过联合嵌入,hchw被映射到一个统一嵌入空间X={x1,x2,,xn},以便在同一框架下对两种类型的信息进行处理。其中每个xi是一个包含字形隐藏状态和标签隐藏状态的复合表示,即xi=[hci;hwi]。“;”表示连接操作。然后对序列中每个元素,进行自注意力打分。使用自注意力机制计算其与序列中所有其他元素的相互关系。其中Self-attention打分公式为:

Scorehci,hwj=WqhciTWkhwjdk

其中,WqWk分别是查询(query)和键(key)的可学习参数权重矩阵,dk是键向量的维度,归一化因子dk用于缩放点积,防止其过大导致softmax函数进入梯度较小区域。注意力得分通过softmax函数进行归一化处理,生成概率分布,表示各元素对当前元素的重要性。通过softmax函数获得每个元素对于序列中其他元素的注意力权重为:

αij=exp(Score(hci,hwj))k=1nexp(Score(hci,hwk))

通过不同元素权重,计算加权上下文表示为:

ci=j=1nαij(Wvhwj)

其中,Wv是值(value)的权重矩阵。将分布αij作为权重,对输入hchw进行加权求和。为了更细致捕获信息间复杂关系,使用多头自注意力机制。上述过程并行执行多次,每个头学习不同的表示子空间:

MultHead(X)=Concat(head1,head2,,headm)WO
whereheadi=Attention(WiQhc,WiKhw,WiVhw)

每个头的注意力权重WiQWiKWiV都是独立的参数矩阵,最后将所有头的输出连接起来,通过另一个可学习权重矩阵WO进行变换,得到最终输出表示。

注意力机制使用加权求和计算生成输出,有效解决了梯度消失的问题。而且自注意力机制能够并行计算,显著提高了效率。自注意机制的引入可以解决边界分割问题和短语组合问题。在分词过程中,可能存在词边界错误问题。如图1所引用实例,前三个字符可能被错误地分割成句中一个人的名字,这将导致错误地传播,对后续预测产生严重偏差影响。以前的通用模型不能很好地解决分词问题,在结合字符的嵌入信息时,会造成一定的内容损失。通过在序列级结合两种粒度隐藏状态,以尽可能保持原始信息特征。同时,自注意训练总序列的权重信息,并保留了上下文字符的语义信息,利用标签序列结构信息修正边界分割错误问题,并将“张三”正确地识别为人名,而第三个字符不在范围内。

在短语组合中,中文字符长短语通常由短短语序列按照顺序排列组成。例如,“电机气动阀门”由“电机/气动/阀门”组成。相对于英语而言,汉语短语通常不需要使用介词连接,导致长短语的边界区分难度加大。这也是中文NER的难点之一。基于词典的分词方法依词典短语将句子切分为短语,但字典中没有出现的长短语,目前还未有效方案切分。本研究提出通过互相辅助的两个不同粒度语义表示,改善上述问题。模型利用自注意力机制,通过顺序计算总序列中所有标记与每个字符之间关联,在不同级表示子空间上计算语义相似度。该方法通过捕捉标签序列的结构信息,并结合字符上下文信息计算相似度,识别长短语的组合边界。

2.5 标签预测

在注意力层之上引用一个标准条件随机场(CRF)层。CRF可以利用状态特征函数和状态转移函数最大化文本特征。此外,还可以考虑相邻词上下文信息和标注信息。其中,特征函数定义如下:

fjs,j,li,li-1=tjli-1,li,s,i,State transfer functionsjli,s,i, State feature function

其中,s表示要预测的句子,l表示句子的标签序列,li表示第i个标记的标签,i是当前位置。状态转移函数定义了语句s中,第i-1个位置标记标签li-1 转移到第i个位置标记标签li的概率。状态特征函数表示当前第i个位置被标记为标签li的概率。

然后对得分进行归一化,得到给定语句s条件下,标签序列为l的概率。其中l表示所有可能的标签序列。对于所有预测标签序列l,计算标签序列 s 的概率:

pl|s=expscorel|sl'expscorel'|s

自注意机制的输出是相互独立的。虽然在进行矩阵变换时考虑了上下文信息,但输出之间并不互相影响。最终输出是每个字符对应上下文表示。采用CRF层进行标签预测,通过考虑输出标签之间的转移特性,对最终标签进行约束,提高实体标签预测的准确性。

3  实 验

3.1 评价指标

本文采用精确率、召回率和F1值作为NER任务的评估指标。其中,真阳性(TP)是指正确预测为正类的样本数量,假阴性(FN)是指误判为负类的正类样本数量,而假阳性(FP)是指错误地将负类样本预测为正类的数量。

精确率(P)又称查准率,是预测正确的正类样本与预测为正类所有样本之比,计算如下:

P=TPTP+FP×100%

召回率(R)也称查全率,被用作关键评估指标之一,衡量的是所有正类样本中被模型准确识别的比例,具体计算方法如下:

R=TPTP+FN×100%

F1值(F1Score)作为评价指标,以平衡精确率和召回率的表现。F1值是基于精确率和召回率的调和平均计算得出,计算公式如下:

F1=2P×RP+R×100%

3.2 数据集

使用Microsoft Research Asia(MSRA)提供语料库以及从新浪微博(Weibo)提取的语料库对提出模型进行实验。MSRA语料库包含三种实体类型:Person(PER)、Location(LOC)、Organization(ORG)。Weibo数据集标注4种类型实体(除上述3种实体,还包括一种地缘政治实体类型Geo-Political,GPE)。对Weibo数据集中的命名实体提及(named mention entity)和普通名词实体提及(nominal mention entity)进行训练,数据组成见表2

数据集的预处理操作,使用BIO规则对实体类型进行标注,其中BIO表示实体开头(Begin)、内部(Inside)和外部(Outside)位置。

3.3 实验设置

实验采用字符级精确度(P)、召回率(R)、F1值(F1-score)为评估标准。使用Pytorch库构建模型,通过Adam优化器进行训练,通过反向传播对网络进行微调。为了避免过拟合和梯度消失问题,采用dropout方法。实验控制语句长度为80,对较短序列进行填充处理,对较长部分进行截断。超参数列表见表3

3.4 组件评估

设计消融实验验证模型中每个组件必要性及其对实验结果的影响。基线模型是一个BiLSTM-CRF架构,该模型已经被证实在多个NER任务中有效。在消融实验中,通过逐一移除关键组件:字形嵌入(-glyph.Emb)、拼音嵌入(-pinyin.Emb)、标签嵌入(-label.Emb)和自注意力机制(-self-attention)观察性能变化,结果见表4

字形嵌入(-glyph.Emb)提供了字符级别的视觉特征表示。实验中去除字形嵌入的模型表现在F1值上显著下降,尤其在微博数据集上,这表明字形信息对于模型捕捉中文字符语义和句法信息具有显著作用。

拼音嵌入(-pinyin.Emb)是中文处理的一个独特组件,提供汉字读音信息。可以帮助模型解决同音字或者多音字问题。从而提高语义理解。移除拼音嵌入后,模型在MSRA数据集上的性能有所下降,尽管下降幅度小于字形嵌入消融,但仍然表明拼音信息对于提高模型的整体表现有贡献。这一发现强调了拼音信息在处理中文语义时的补充作用,尤其是在区分多音字和消除歧义方面。

标签嵌入(-label.Emb)直接关系到实体分类。消融实验结果表示,去除标签嵌入导致了最大幅度的性能下降,特别是在微博数据集上的F1值,这强调了标签语义信息在中文NER中的重要性。这可能是因为标签嵌入捕获了丰富的上下文信息,对于识别不清晰或歧义性强的实体至关重要。

自注意力机制(-self-attention)能够捕获长距离依赖信息,加强了模型对上下文的理解。消融实验结果表明,去除自注意力机制后,性能有所下降,模型在MSRA上F1值降低2.10个百分点,在微博数据集上降低3.44个百分点。这表明自注意力机制通过捕获长距离依赖来增强模型的上下文理解能力,并克服循环神经网络的限制,从而提高性能。

由于公共领域与工业领域的数据分布不同,以及实体关系类型差异化,为了确保模型的鲁棒性以及实用性,进行工业领域性能验证。工业原始语料文本,一般为PDF工业文档数据,无法直接使用。首先要进行PDF文档预处理,包括PDF解析和数据清洗;然后进行文本标注,以及数据集的构建。标注数据共计12 000条样本。使用相同的消融实验设置来测试在工业数据集上的表现。验证组件在工业环境中的作用,结果见表5

通过对工业领域中维修手册数据集进行消融验证试验,可以看到,去除字形嵌入、拼音嵌入以及标签嵌入都会导致性能下降。字形嵌入消融导致模型性能显著下降,可能是工业文档中包含大量专业术语和特定的产品名称,这些实体的字形特征对于识别至关重要。标签嵌入消融结果显示对模型影响较大,表明在区分不同实体类别时显示出标签信息在工业文档中NER任务的重要性。工业手册中的实体可能具有复杂内在结构和语义关系,标签嵌入丢失使得模型在区分这些细微差别方面的能力降低。拼音嵌入消融对模型的影响相对较小,可能是因为工业领域的文本更倾向于使用专业术语和具体技术词汇,这些词汇的含义可能不太依赖于拼音信息。相比之下,字形和语义信息可能对于理解这些术语更为重要。自注意力机制通过捕获长距离依赖性和全局上下文信息,改善实体识别和分类,在处理长文本和复杂结构时仍然不可或缺。

3.5 与其他模型对比

将本文模型与已有模型在MSRA和Weibo数据集上进行对比,对比结果见表6表7

MSRA语料库中,本模型的P虽然低于文献[27],但在RF1值上展现出更好的表现。这表明,考虑到召回率和精确率的平衡,本模型在整体性能上具有明显优势,有效地提升了性能。

在Weibo语料库中,由于社交媒体数据中存在许多非标准数据,如拼写错误、非正式词语表达等,因此模型在Weibo语料库的F1值要低于MSRA数据库的。但本文模型在named mention entity、nominal mention entity和overall三种类型实体上的F1值仍比文献[34~39]模型高;nominal mention entity 的F1值比文献[40]低,是因为模型结构和参数配置存在差异,但named mention entity结果比其高很多,因此overall也比其高。结果表明,本文模型在整体上表现出较好的性能。

3.6 工业领域落地应用

汽车工业数据具有非结构化性、领域特定性和数据稀缺性。在工业领域中,有独特术语、缩写以及实体命名规则,而且训练标记数据相对较少。原始语料库来自工业生产维修手册以及说明文档。图5展示了部分工业原始语料文本。

工业维修手册中存在噪声数据,需要进行文本去重、去噪以及合并等操作。在领域专家指导下,将预处理后数据标注设备(equipment)、故障(exceptions)和操作(operation)三类标签。定义类别如表8所示。

本文构建了基于工业维修文档、人工记录手册等源数据的工业领域数据集,标注数据共计12 000条样本,应用本文模型进行实验。由表9可知,训练35个epoch后F1值可以达到60%以上,训练45个epoch后趋于稳定。当epoch=55时,F1值表现最佳,为62.74%。由于原始语料中有工作人员手动记录数据,存在记录误差,因此PRF1值都小于在MSRA和Weibo数据集的值。

在自构建工业领域数据集上,将本文模型与已有模型进行对比。对比结果见表10。本文模型在精确率、召回率和F1值上均高于已有模型。由于自构建工业领域数据集中包含大量长文本术语以及专业领域名词,使得已有模型对词边界的识别性能欠缺。而本文模型结合了字符级和标签级特征进行多维特征提取,深入捕捉语言细节。通过融合自注意力机制以处理长距离依赖,能够有效处理长篇文本中的复杂结构。结果表明所提方法在工业领域的实体识别任务中显著提升了准确率,并在汽车零配件的自构建工业领域数据集上成功实现了应用,展现了其在工业场景中的实用性。

表10 自构建工业数据集结果

Table 10 Results from the Self-Constructed

Industrial Dataset

%

4  结 语

本文提出了一种将标签语义融合字形与拼音信息的自注意网络模型。该模型利用汉字的字形和拼音信息,增强了从汉字表层字形中捕获上下文语义和中文多音字消歧的能力。利用自注意机制融合序列上下文中多特征语义和结构表示(基于字符、字形、拼音粒度以及基于标签语义粒度)可以显著提高识别字符词边界性能。实验结果表明该方法能较好地对词边界进行分割,提高了中文命名实体识别的准确率。

在未来工作中,我们将侧重于在大规模预训练模型上进行应用,并引入粒度更细信息表示以适用于其他垂直领域识别任务。与此同时,继续丰富工业语料库,以提高对工业领域实体识别的数据支持。

参考文献

[1]

XIONG C YLIU Z ZCALLAN Jet al. Towards better text understanding and retrieval through kernel entity salience modeling[DB/OL].[2023-09-10]. DOI: 10.1145/3209978.3209982 .

[2]

GUPTA NSINGH SROTH D. Entity linking via joint encoding of types, descriptions, and context[DB/OL].[2023-09-10]. DOI: 10.18653/v1/d17-1284 .

[3]

ZHOU Q YYANG NWEI F Ret al. Neural question generation from text: A preliminary study[M]// Natural Language Processing and Chinese Computing. Cham: Springer International Publishing, 2018: 662-671. DOI: 10.1007/978-3-319-73618-1_56 .

[4]

BARHOM SSHWARTZ VEIREW Aet al. Revisiting joint modeling of cross-document entity and event coreference resolution[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2019: 4179-4189. DOI: 10.18653/v1/p19-1409 .

[5]

XU M BJIANG HWATCHARAWITTAYAKUL S. A local detection approach for named entity recognition and mention detection[C]//Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2017: 1237-1247. DOI: 10.18653/v1/p17-1114 .

[6]

LAMPLE GBALLESTEROS MSUBRAMANIAN Set al. Neural architectures for named entity recognition[C]//Proceedings of the 2016 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Stroudsburg: Association for Computational Linguistics, 2016: 260–270. DOI: 10.18653/v1/n16-1030 .

[7]

SHEN Y YYUN HLIPTON Zet al. Deep active learning for named entity recognition[C]//Proceedings of the 2nd Workshop on Representation Learning for NLP. Stroudsburg: Association for Computational Linguistics, 2017: 252-256. DOI: 10.18653/v1/w17-2630 .

[8]

MA R TPENG M LZHANG Qet al. Simplify the usage of lexicon in Chinese NER[C]//Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2020: 5951-5960. DOI: 10.18653/v1/2020.acl-main.528 .

[9]

DONG C HZHANG J JZONG C Qet al. Character-based LSTM-CRF with radical-level features for Chinese named entity recognition[DB/OL].[2023-09-10]. DOI: 10.1007/978-3-319-50496-4_20 .

[10]

SU T RLEE H Y. Learning Chinese word representations from glyphs of characters[C]//Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2017: 264–273. DOI: 10.18653/v1/d17-1025 .

[11]

MENG Y XWU WWANG Fet al. Glyce:Glyph-vectors for Chinese character representations[DB/OL].[2023-09-10].

[12]

MA JBALLESTEROS MDOSS Set al. Label semantics for few shot named entity recognition[C]//Findings of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2022: 1956-1971. DOI: 10.18653/v1/2022.findings-acl.155 .

[13]

DEVLIN JCHANG M WLEE Ket al. Bert: Pre-training of deep bidirectional transformers for language understanding[DB/OL].[2023-09-10]. DOI: 10.18653/v1/n18-2 .

[14]

LI Y RLI W JSUN Fet al. Component-enhanced Chinese character embeddings[C]//Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2015: 829–834. DOI: 10.18653/v1/d15-1098 .

[15]

YIN R CWANG QLI Pet al. Multi-granularity Chinese word embedding[C]//Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2016: 981–986. DOI: 10.18653/v1/d16-1100 .

[16]

LIU FLU H, LO C, et al. Learning character-level compositionality with visual features[C]//Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2017: 2059–2068. DOI: 10.18653/v1/p17-1188 .

[17]

SHAO YHARDMEIER CTIEDEMANN Jet al. Character-based joint segmentation and POS tagging for Chinese using bidirectional RNN-CRF[DB/OL].[2023-09-10].

[18]

TAO H QTONG S WXU Tet al. Chinese embedding via stroke and glyph information: A dual-channel view[EB/OL]. 2019arXiv: 1906.04287.

[19]

XUAN Z YBAO RJIANG S Y. FGN: fusion glyph network for Chinese named entity recognition[M]//Knowledge Graph and Semantic Computing: Knowledge Graph and Cognitive Intelligence. Singapore: Springer 2021: 28-40. DOI: 10.1007/978-981-16-1964-9_3 .

[20]

刘志豪, 金相国, 邱芹军, . 顾及中文汉字多特征的矿产资源实体识别[J]. 地质科学202358(4): 1535-1553. DOI: 10.12017/dzkx.2023.084 .

[21]

LIU Z HJIN X GQIU Q Jet al. Mineral resource entity recognition considering multiple features of Chinese characters[J]. Chinese Journal of Geology (Scientia Geologica Sinica)202358(4): 1535-1553. DOI: 10.12017/dzkx.2023.084(Ch ).

[22]

LUO Q YLIU L QLIN Y Het al. Don’t miss the labels: Label-semantic augmented meta-learner for few-shot text classification[C]//Findings of the Association for Computational Linguistics: ACL-IJCNLP 2021. Stroudsburg: Association for Computational Linguistics, 2021: 2773-2782. DOI: 10.18653/v1/2021.findings-acl.245 .

[23]

ZHOU BKHASHABI DTSAI C Tet al. Zero-shot open entity typing as type-compatible grounding[C]//Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2018: 2065-2076. DOI: 10.18653/v1/d18-1231 .

[24]

PAOLINI GATHIWARATKUN BKRONE Jet al. Structured prediction as translation between augmented natural languages[EB/OL]. 2021arXiv: 2101.05779.

[25]

CUI L YWU YLIU Jet al. Template-based named entity recognition using BART[C]//Findings of the Association for Computational Linguistics: ACL-IJCNLP 2021. Stroudsburg: Association for Computational Linguistics, 2021: 1835-1845. DOI: 10.18653/v1/2021.findings-acl.161 .

[26]

HOU Y TCHE W XLAI Y Ket al. Few-shot slot tagging with collapsed dependency transfer and label-enhanced task-adaptive projection network[C]//Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2020: 1381-1393. DOI: 10.18653/v1/2020.acl-main.128 .

[27]

COLLOBERT RWESTON JBOTTOU Let al. Natural language processing (almost) from scratch[J]. Journal of Machine Learning Research201112: 2493-2537.

[28]

LI J YFEI HLIU Jet al. Unified named entity recognition as word-word relation classification[J]. Proceedings of the AAAI Conference on Artificial Intelligence202236(10): 10965-10973. DOI: 10.1609/aaai.v36i10.21344 .

[29]

CAO P FCHEN Y BLIU Ket al. Adversarial transfer learning for Chinese named entity recognition with self-attention mechanism[C]//Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2018: 182-192. DOI: 10.18653/v1/d18-1017 .

[30]

YANG FZHANG J HLIU G Set al. Five-stroke based CNN-BiRNN-CRF network for Chinese named entity recognition[C]//CCF International Conference on Natural Language Processing and Chinese Computing. Cham: Springer, 2018: 184-195.10.1007/978-3-319-99495-6_16. DOI: 10.1007/978-3-319-99495-6_16 .

[31]

ZHU Y YWANG G XKARLSSON B F. CAN-NER: Convolutional attention network for Chinese named entity recognition[DB/OL].[2023-09-10]. DOI: 10.18653/v1/N19-1342 .

[32]

DING R XXIE P JZHANG X Yet al. A neural multi-digraph model for Chinese NER with gazetteers[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2019: 1462-1467. DOI: 10.18653/v1/p19-1141 .

[33]

LIU WFU X YZHANG Yet al. Lexicon enhanced Chinese sequence labeling using BERT adapter[EB/OL]. 2021arXiv: 2105.07148. DOI: 10.18653/v1/2021.acl-long.454 .

[34]

SHEN Y LWANG X BTAN Z Qet al. Parallel instance query network for named entity recognition[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2022: 947⁃961. DOI: 10.18653/v1/2022.acl-long.67 .

[35]

PENG N YDREDZE M. Named entity recognition for Chinese social media with jointly trained embeddings[C]//Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2015: 548-554. DOI: 10.18653/v1/d15-1064 .

[36]

PENG N YDREDZE M. Improving named entity recognition for Chinese social media with word segmentation representation learning[C]//Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers). Stroudsburg: Association for Computational Linguistics, 2016: 149-155. DOI: 10.18653/v1/p16-2025 .

[37]

HE H FSUN X. F-score driven max margin neural network for named entity recognition in Chinese social media[C]//Proceedings of the 15th Conference of the European Chapter of the Association for Computational Linguistics: Volume 2, Short Papers. Stroudsburg: Association for Computational Linguistics, 2017: 713⁃718. DOI: 10.18653/v1/e17-2113 .

[38]

HE H FSUN X. A unified model for cross-domain and semi-supervised named entity recognition in Chinese social media[J]. Proceedings of the AAAI Conference on Artificial Intelligence201731(1): 3216–3222. DOI: 10.1609/aaai.v31i1.10977 .

[39]

ZHANG YYANG J. Chinese NER using lattice LSTM[C]//Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2018: 1554-1564. DOI: 10.18653/v1/p18-1144 .

[40]

GUI TZOU Y CZHANG Qet al. A lexicon-based graph neural network for Chinese NER[C]//Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP). Stroudsburg: Association for Computational Linguistics, 2019: 1040-1050. DOI: 10.18653/v1/d19-1096 .

[41]

SUI D BCHEN Y BLIU Ket al. Leverage lexical knowledge for Chinese named entity recognition via collaborative graph network[C]//Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP). Stroudsburg: Association for Computational Linguistics, 2019: 3830-3840. DOI: 10.18653/v1/d19-1396 .

[42]

LI X NYAN HQIU X Pet al. FLAT: Chinese NER using flat-lattice transformer[C]//Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2020: 6836-6842. DOI: 10.18653/v1/2020.acl-main.611 .

基金资助

科技部科技创新2030“新一代人工智能”重大项目(2020AAA0109300)

AI Summary AI Mindmap
PDF (2668KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/