基于BiLSTM+CRF融合的藏文文本共指消解研究

索南旺姆 ,  索南尖措 ,  扎西平措null ,  高兴 ,  万玛才旦null

高原科学研究 ›› 2026, Vol. 10 ›› Issue (1) : 129 -140.

PDF (1100KB)
高原科学研究 ›› 2026, Vol. 10 ›› Issue (1) : 129 -140. DOI: 10.16249/j.cnki.2096-4617.2026.01.012
高原交通与信息处理

基于BiLSTM+CRF融合的藏文文本共指消解研究

作者信息 +

Study on Tibetan Text Coreference Resolution Based on BiLSTM-CRF Integration

Author information +
文章历史 +
PDF (1125K)

摘要

共指消解作为自然语言处理中的基础任务,在机器翻译、问答系统及文本摘要等多个下游应用中发挥关键作用。然而,当前主流研究多集中于高资源语种,对于藏语等低资源语言的共指消解研究仍较为薄弱。为解决藏文自然语言处理领域相关数据集与应用研究不足问题,文章构建了涵盖新闻与文学体裁的藏文共指消解语料库TiCoref-2025,并在此基础上提出了一种融合多种建模策略的神经网络模型TiCoref。该模型以BERT-base-Tibetan为基础编码器,结合BiLSTM增强长距离依存建模能力,并引入条件随机场(CRF)以提升提及边界识别精度。此外,针对文学体裁文本的特点,专门引入“词藻知识库”模块以提供外部先验知识,从而提升模型对复杂共指关系的识别能力,并验证了该策略在特定体裁下的有效性。实验结果表明,所提方法在MUC、B3CEAFϕ4三个指标上的F1值分别达到了78.70%、71.08%和68.22%,验证了模型在低资源藏文文本上的适用性与鲁棒性。

Abstract

Coreference resolution, as a fundamental task in natural language processing, plays a crucial role in various downstream applications, including machine translation, question answering, and text summarization. However, current mainstream research is predominantly focused on high-resource languages, while studies on coreference resolution for low-resource languages such as Tibetan remain limited. To address the shortage of relevant datasets and applied research in the field of Tibetan natural language processing, we constructed a Tibetan coreference resolution corpus, TiCoref-2025, covering both news and literary genres. Building upon this corpus, we proposed a neural network model, TiCoref, that integrates multiple modeling strategies. This model utilises BERT-base-Tibetan as its base encoder, incorporates BiLSTM to enhance long-distance dependency modeling, and introduces a Conditional Random Field (CRF) to improve the accuracy of mention boundary recognition. Additionally, to address the characteristics of literary texts, a Word-Knowledge Module (WKM) is specifically introduced to provide external prior knowledge, thereby improving the model's ability to capture complex coreference relations, and the effectiveness of this strategy in genre-specific scenarios has been validated. Experimental results show that the proposed method achieved F1 scores of 78.70%, 71.08%, and 68.22% on the official MUC, B3, CEAFϕ4 metrics, respectively, validating the model's applicability and robustness on low-resource Tibetan texts.

Graphical abstract

关键词

共指消解 / 藏文文本 / BiLSTM / 条件随机场 / 知识增强

Key words

coreference resolution / Tibetan text / BiLSTM / Conditional Random Field (CRF) / knowledge enhancement

引用本文

引用格式 ▾
索南旺姆,索南尖措,扎西平措null,高兴,万玛才旦null. 基于BiLSTM+CRF融合的藏文文本共指消解研究[J]. 高原科学研究, 2026, 10(1): 129-140 DOI:10.16249/j.cnki.2096-4617.2026.01.012

登录浏览全文

4963

注册一个新账户 忘记密码

引 言

共指消解(Coreference Resolution,CR)任务作为自然语言处理(Natural Language Processing,NLP)中的关键任务,在机器翻译、文本摘要、问答系统等多个下游任务中发挥着重要作用[1-4],其目标是识别文本中指向同一个实体的不同指称表述。例如,在句子“近年来,人工智能技术得到了广泛应用,许多企业将它视为提升竞争力的关键。”一句中,“人工智能技术”和“它”均为同一实体的不同表述,而共指消解任务即在于明确这些实体提及之间的指代关系[5,6]

1978年,Hobbs[7]提出两种基于规则的方法来处理指代消解问题:一是通过句法分析树遍历结构寻找前指;二是结合语义知识与常识信息处理更复杂的指代关系。随后,Grosz等[8]在20世纪80 年代中期提出中心理论(Centering Theory)的初步框架,并于1995年对该理论体系进行了系统阐述。该理论旨在解释话语中的注意力结构与代词指代关系,认为在一段连贯的话语中,存在一些持续被关注的实体,这些实体在不同句子中通过代词等方式被反复提及,而中心理论正是用来描述这些实体如何在话语中被引入、维持与转换。1998年,Ge等[9]提出一种基于朴素贝叶斯(Naive Bayes,NB)算法的统计方法来确定代词指代关系。之后,Ng等[10]利用C4.5决策树归纳系统训练分类器,并结合额外添加的词汇、语义、语法等特征,对名词短语的共指关系进行了判别。

随着深度学习方法的发展,共指消解研究也逐步向神经网络方向演进[11]。2016年,Wiseman等[12]提出一种基于全局特征的共指消解方法,通过使用循环神经网络(Recurrent Neural Network,RNN)学习实体簇的全局表示。Park等[13]提出一种融合规则系统与神经网络的引导式共指模型,其中规则系统采用多通道筛选算法,神经网络则利用前馈神经网络(Feedforward Neural Network,FFNN)计算提及对得分,以提升模型精度。Joshi等[14]在2019年沿用Lee等[15]提出的c2f-coref高阶共指消解模型,将模型中的LSTM编码器替换为BERT(Bidirectional Encoder Representations from Transformers)。2021年,Kirstain等[16]提出了一种不依赖跨度(span)表示的建模方式,通过端点表示结合双线性函数计算提及对的共指得分。同年,Hsu等[17]引入对比学习(Contrastive Learning)思想来设计跨文档共指系统,通过采样式训练方法增强模型对实体语义的一致性表达能力。2022年,Wang等[18]将强化学习(Reinforcement Learning)引入共指消解任务,采用Actor-Critic架构联合训练提及识别与聚类模块,提升了系统鲁棒性与长距离依赖建模能力。之后,Yao等[19]提出了一种融合多种相似性度量的事件共指模型,通过引入事件特征与事件对的多维表示,在ACE-2005数据集上取得了优异性能,为跨句级别的语义建模提供了新思路。

近年来,中英文等语言的共指消解研究取得了显著进展,特别是深度学习的发展带动了该领域的快速发展。相比之下,藏文共指消解因受限于语料资源匮乏及语言结构的差异性,整体发展相对滞后,尽管如此,已有学者开展了初步探索。例如,贡保才让等[20]在2017年通过自动识别藏文人名和性别来指定人称代词,以此提出一种简单且有效的藏文指代消解方法。2018年,夏吾吉等[21]同样针对藏文人称代词消解这一任务展开研究,在贡保才让等人研究基础上提出了一种混合策略方法,通过规则构建和最大熵模型(Maximum Entropy Model,MaxEnt)相结合方法来实现指代消解,同时进一步拓展了代词研究的范围。

综上,鉴于目前主流共指消解模型大多面向高资源语言,藏文等低资源语言因语料资源匮乏,相关研究尚处于起步阶段。鉴于此,本文将基于BERT的共指消解模型迁移至藏文文本处理任务,围绕数据构建、建模适配与知识增强3个层面,开展面向藏文的系统性探索。具体工作如下:

(1)数据资源构建:构建面向藏文的共指消解数据集TiCoref-2025,其涵盖新闻与文学两种体裁。设计适合藏文特点的标注规范,并对原始文本进行人工标注,为模型训练与评测提供可靠的数据支撑。

(2)模型方法:采用端到端神经共指消解模型架构,结合藏文预训练语言模型构建跨度表示。为增强长距离依存关系的建模能力,引入双向长短时记忆网络(Bidirectional Long Short-Term Memory,BiLSTM)。同时集成条件随机场(Conditional Random Field, CRF)模块对提及边界进行序列标注优化,通过细化边界的判定,提升提及识别的整体准确率。

(3)知识增强机制:针对藏文文学类文本中存在“词形差异大、语义隐喻性强”的词藻式隐性共指现象,提出词藻知识库模块(Word-Knowledge Module, WKM),利用知识库先验知识,提升模型对隐性共指的识别能力。

1 藏文共指消解概述

1.1 共指消解

共指消解任务旨在识别文本中指代同一实体的不同指称表达,如代词或名词短语。该任务通常包括提及识别、共指关系判断与共指簇构建等子任务。图1展示了共指消解的具体实例。

本文对共指消解任务作如下形式化定义:

S={s1,s2,,sn}

式中,si表示某一个按音节或词级划分后的基本单元(token),通过预训练语言模型进行向量化表示。共指消解任务需要从序列S中识别所有由token构成的提及(mention),记为集合 M

M=m1,m2,,mk,    mi=[ai,bi]

式中,mi表示从位置 ai  bi 的闭区间,即每段指代某一实体的子序列 {sai,sai+1,,sbi}。模型为每个提及构建语义表示向量gmi作为后续共指聚类的基础,以便将这些提及划分为若干个共指簇(coreference cluster),一个共指簇指代同一实体的所有提及的集合,记为集合 C

C=c1,c2,,ct,    ciM,    i=1tci=M

1.2 低资源语言环境下的建模挑战

藏文具有丰富的指称表达[22],除了用名词来指代特定的人或事物的定名指称外,本文重点汇总了3类常见的指称形式:人称代词、指示代词以及人名(表1)。其中,人称代词不仅区分第一、第二和第三人称,还在单复数、性别以及格助词(如第三人称的施事格形式“ཁོས།”“མོས།”)等属性上表现出多样化。指示代词则用于近指或远指,且区分单复数形式。在人名方面,藏族人名的结构具有一定的模式性和性别可区分性,往往采用双音节、三音节或四音节的命名格式。在双音节人名中主要存在两类情况:一是原生的双音节人名,如“ལྷ་མོ།”(女性)、“མགོན་པོ།”(男性)等;其二是从四音节人名简化而来的双音节形式,通常包括两种简化方式:其一是直接取原名中的后两个音节,例如“ཚེ་རིང་སྒྲོལ་མ།——སྒྲོལ་མ།”(女性)、“ཡོན་ཏན་རྒྱ་མཚོ།——རྒྱ་མཚོ།”(男性)等;其二为组合原名中第一个和第三个音节,如“ཟླ་བ་སྒྲོལ་དཀར།——ཟླ་སྒྲོལ།”(女性)、“བསོད་ནམས་ཚེ་རིང་།——བསོད་ཚེ།”(男性)等。相较于双音节人名,三音节人名的性别属性通常根据其最后一个音节加以区分。例如,三音节人名中以“སྐྱིད།”“མཚོ།”等结尾的常见于女性名字,如“ཚེ་རིང་སྐྱིད།”“འབྲུག་མོ་མཚོ།”;以“རྒྱལ།”“ཐར།”等结尾的常见于男性,如“སྟག་ཐར་རྒྱལ།”“རིག་འཛིན་ཐར།”。四音节人名的性别属性通常根据最后两个音节加以区分,例如以“དབྱངས་ཅན།”“མཚོ་མོ།”结尾的多为女性,以“རྡོ་རྗེ།”“རྒྱ་མཚོ།”结尾的多为男性。如表1所示,这些语言现象为共指关系建模提供了潜在的先验知识与语义线索。

然而,仅聚焦于代词的消解仍不足以全面覆盖藏文语篇中的共指现象。特别是在文学、宗教与古籍文献等领域文本中,蕴含着丰富的“词藻学”(མངོན་བརྗོད།)文化。词藻学是藏族传统“小五明”(རིག་གནས་ཆུང་བ་ལྔ།)学科之一,专注于事物命名规则的研究,涵盖对同义称谓的规范以及对多义词义项的阐释。在上述语篇中,常见的同义表达通常具有“语义隐喻性强、词形差异显著”的特征,对共指链的建模构成了挑战。

表2所示,以“月亮”为例,可出现“乐源顶饰”(བདེ་འབྱུང་གཙུག་རྒྱན།)、“施凉者”(བསིལ་སྦྱིན་མཁན།)、“持兔”(རི་བོང་འཛིན།)、“凉光者”(འོད་དཀར་ཅན།)等不同的词藻。这些表述虽然形式不同,但在特定的文化语境下均可指代同一个实体,体现出高度的语义隐喻性与文化依存性。若无外部知识辅助,模型往往难以判定这些提及间的语义一致性关系。因此,本文引入外部知识增强的建模策略[23,24],通过构建“词藻知识库”模块(WKM)辅助模型预测。

本研究在实验阶段主要针对文学类文本启用WKM模块,以验证先验知识增强机制的有效性。随着语料库的进一步扩展,该方法可迁移至其他体裁,从而评估该策略在更广泛文本中的适用性。

2 数据集构建与预处理

目前,尚未建立系统化的藏文共指消解任务数据资源。一方面,共指链的篇章级标注要求高、耗时长,缺乏高质量的标注工具;另一方面,已有藏文语料较为分散,语体风格多样。这些因素共同导致当前难以构建规模化、系统化的藏文共指消解数据集,也限制了模型在该语言环境下的训练与评估能力。下面将介绍TiCoref-2025数据集的构建流程与预处理方法。

2.1 数据来源与预处理

本研究所用新闻原始语料主要采集自青海藏语广播电视台官网,共计收集文本数据1 100条,每条数据对应一篇完整的新闻报道,总字数约为44万字。新闻体裁文本在篇章结构上相对规范,通常包含较丰富且标准的共指提及。在文学类文本构建方面,本文基于真实藏文文学词汇资源,结合人工设计的藏文句式模板进行模板式数据扩充(template-based augmentation),旨在缓解词藻类共指实例分布零散、直接采集与标注成本较高的问题。具体而言,本文参考《词渊学词典——沧海滴水》[25]构建小型“词藻知识库”,该知识库用于收集常见别称形式与其标准实体之间的映射关系,共包含274个规范实体和927条共指配对。在此基础上,将词藻知识库中基于真实文学语境的“实体-词藻”映射关系填入预先设定的藏文句式模板,生成共指实例。最后对所有实例进行人工校对与筛选,确保语言规范、语义自然。最终共构建文学类数据实例约800条,总字数约4万字。

在数据预处理阶段,本文对藏文文本分别采用两种不同的切分策略:音节切分与词级切分,旨在探讨不同粒度下对模型性能的影响。

音节切分:藏文音节字之间由音节分隔符“་”分隔,一个音节字可以由单个音节字构件或多个构件加元音组成。音节切分即以音节分隔符“་”为依据切分原始文本。此外藏文中常用单垂符“།”来表示句子结束,一般情况下直接在句末音节字后面添加该符号即可。但其具体使用还需视前一个音节字的结构而定,例如:若前一个音节字是以后加字“ག”结尾(如“འདུག”),则不加“།”;若以后加字“ང”结尾(比如“ངང”),则需先添加音节分隔符“་”再添加单垂符“།”,形成“ངང་།”[26]

词级切分: 与音节切分仅依赖音节分隔符不同,词级切分策略以语义边界为划分依据,根据藏语言中的词汇结构、功能词搭配、助词后缀等规则识别词块。本文采用规则驱动的藏文分词工具TIP-LAS [27],将连续文本划分为具有独立语义功能的词语单元。举例来说,藏文文本片段“བོད་པ་ཞིག་གིས་”在音节切分策略下被划分为[བོད་][པ་][ཞིག་][གིས་],而在词级切分策略下,则为[བོད་པ་][ཞིག་][གིས་],其中“བོད་པ་”(藏族人)作为一个完整词汇单元表达实体概念。此外,考虑到TIP-LAS分词系统在处理未登录词(如专有名词、地名、人名等)时识别能力有限,本文在标注阶段同步构建了一个包含约2 000条未登录词的“未登录词词库”。该词库在实际标注过程中被用于辅助提及边界的判断,确保词级切分的语义合理性。

2.2 提及与共指链标注策略

为构建高质量的藏文共指消解数据集,本文借鉴OntoNotes5.0[28,29]的共指链标注规范,构建了TiCoref-2025数据集。标注时,首先明确“提及”是指文本中指向某一实体的具体表述,包括专有名词、代词、普通名词短语等。同一篇章中的多个提及若指代同一实体,则被划入同一个共指簇, 形成簇集合C=c1,c2,,ct,其中每个簇 ciM 由若干指代同一实体的提及 miM组成。标注过程中需遵循以下基本规范:

提及类型:包括代词(如“ཁོང་།”(他))、专有名词(如“ཅཱ་ཧྲ་ས་ཁུལ།”(加沙地带))、名词短语(如“མཉམ་འབྲེལ་རྒྱལ་ཚོགས་ཀྱི་དྲུང་ཡིག་ཆེན་མོ་ཀུའུ་ཐི་ལོས་སི།”(联合国秘书长古特雷斯))等,均视为合法的提及单位。

嵌套处理:为更全面覆盖篇章中的实体指代现象,本文在标注过程中保留嵌套提及结构,即当一个较长提及内部包含其他可单独指代的短提及时,同时对内层与外层提及进行标注。

提及筛选:对于文档中仅出现一次、未能与其他提及形成共指关系的提及,不予标注。

指代方向:不区分前指或回指情形,只要多个提及指向同一语义实体,均被纳入到同一共指簇中。

2.3 数据格式与转换流程

为满足主流共指消解模型的训练与评估需求,本文将藏文共指标注数据统一存储为结构化的JSON格式。其中包括文档唯一标识、基于音节或词级切分得到的token序列、说话人以及共指簇标注等重要信息。

在训练阶段,模型根据所输入的JSON格式数据,构建候选提及并进行共指聚类学习;在评估阶段,为计算MUC、B3CEAFϕ4三种性能指标,需将预测结果转换为CoNLL-2012标准格式(CoNLL-Coref column format),以便使用官方评估工具进行模型性能评估。

3 模型方法

针对藏文篇章结构特点及低资源环境下共指建模的实际需求,本文构建了一种面向藏文的端到端神经共指消解模型——TiCoref(Tibetan Coreference Resolution Framework)。模型整体结构是以藏文预训练语言模型BERT-base-Tibetan[30]为编码器,结合BiLSTM上下文增强机制、跨度表示构建与前馈神经网络(FFNN)进行提及与共指关系建模。在此基础上,引入条件随机场(CRF)模块,以建模BIO标签之间的结构依赖关系,提升提及识别精度。最终通过贪心策略完成共指聚类,整体模型结构如图2所示。该模型主要由输入表示与编码层和Coref模块组成。Coref模块是模型的核心部分,负责共指消解任务,包含跨度构建与表示模块、提及识别模块和共指对建模模块。

3.1 输入表示与编码层

在编码层,本文使用藏文预训练语言模型BERT-base-Tibetan对输入序列进行上下文嵌入计算。该模型基于一定规模的藏文语料进行训练,能够有效捕捉藏文实体之间的语义联系。给定输入token序列s1,s2,,sn,预训练模型输出对应的上下文表示:

H=BERTs1,s2,,sn=h1,h2,,hn,    hiRd

随后引入BiLSTM模块以增强序列的上下文建模能力,所生成的token表示为:

H'=BiLSTMH=h1',h2',,hn',  hi'Rd'

3.2 跨度构建与表示模块

在获得输入序列 S 的上下文表示后,模型基于该序列构建所有可能的候选提及片段,用于后续提及的提取与共指关系建模。本文将span跨度定义为序列中任意长度不超过Lmax的连续子序列si:j=si,si+1,,sj,其中0ij<nj-i+1Lmax。每个候选跨度的表示向量记作 gi:j,主要由以下几个组成部分拼接得到:

gi:j=h'i;h'j;ϕi:j;ai:j
at=eWah'tk=ijeWah'k,    ti,j
ai:j=t=ijath't

式中,hi'hj'分别表示当前span的起始与终止token的上下文嵌入,由编码器输出。ϕi:j 表示span的长度特征,用于显式建模span的结构信息。ai:j是该span内部的注意力聚合表示,用于表示“头词”(head word)的语义贡献度。Wa为模型可学习参数。

3.3 提及识别模块

本文采用候选提及识别机制,从所有可能的span中筛选出具有共指潜力的候选提及。为进一步提升提及边界识别的准确性,模型引入条件随机场(CRF)模块,规范和优化token的序列标注。CRF作为一种判别式序列标注模型,能够在预测当前标签的同时考虑前一个标签,建模标签之间的转移依赖关系。相比于独立预测每个标签的方式,CRF能够显著提升提及边界识别的一致性与准确性。

首先,通过线性层计算每个位置的BIO标签得分,公式如下:

si=Whi'+b

其次,引入条件随机场对标签序列建模,条件概率分布公式如下:

PY|X=ei=1nsi,yi+Tyi-1,yiZX

式中,si,yi为第i个位置预测为标签yi的发射得分,Tyi-1,yi表示标签转移矩阵中的转移得分,ZX 表示归一化因子。随后,结合3.2节中构建的跨度表示向量gi:j,通过前馈神经网络为每个候选span分配提及得分,公式如下:

smi:j=FFNNmentiongi:j

在训练阶段,模型对全部候选提及(正例与负例)进行监督学习;推理阶段则采用贪心筛选,仅保留得分排名前k的候选项作为最终提及。

3.4 共指对建模模块

本模块的目标是基于提及集合M中的候选项,构建最优的共指簇划分集合C,以最小化错误聚类。在识别出候选提及集合后,模型需进一步判断各提及之间是否构成共指关系。为此,本文构建了前向评分模块,并结合“词藻知识库模块”(WKM)为每一对候选提及 (i,j) 进行打分,其中j<i,表示ji的先行项(antecedent)。共指对打分函数如下:

si,j=  smi+c,                                                                 j=ε smi+smj+sai,j+λ δi,j,               j<i
δi,j= 1,    WKMi=WKMj0                                            

式中,sm(i)  sm(j) 分别表示提及 i  j 的提及得分,sa(i,j) 为提及对之间的相似性得分,是由跨度表示和相对位置等信息构成,用于衡量其构成共指的可能性,最终由前馈神经网络计算概率得分。空先行项 ε 表示当前提及为一个新簇的起始项,而 c 是一个可学习的标量偏置项,用于控制新建簇的倾向。当 j<i 时,模型根据提及得分与相似性得分计算提及对分数,并且当提及对在词藻知识库中对应同一实体时,叠加偏置 λ

为确保该模块仅在特定体裁中生效,模型根据文档唯一标识符自动判断是否启用WKM模块。具体而言,TiCoref-2025数据集中所有文学类文本均以“lit/”为前缀命名,模型在检测到该前缀时激活WKM模块,并对词藻知识库中映射为同一规范实体的提及对叠加偏置 λ

此外,为了训练模型准确识别共指关系,本文采用归一化的得分函数并通过贪心策略选取具有最高共指得分项,具体公式如下:

j^=arg maxj{ε,1,,i-1} si,j

3.5 损失函数

为优化模型性能,本文以对数似然损失为训练目标,鼓励模型倾向于真实先行项。对于每个提及 i,其真实先行项集合为 GOLD(i),损失函数定义如下:

L=-ilogjGOLDiPj|i

4 实验设置与结果分析

4.1 实验设置

本研究基于TiCoref-2025数据集开展实验,其中新闻类文本共1 100条数据,文学类文本共800条数据。数据集划分如表3所示。

实验在单卡GPU环境下基于PyTorch框架进行训练,采用Adam优化器。预训练模型学习率设置为1×10-5,下游任务部分设置2×10-4,Dropout设置为0.3。

为了全面评估模型在藏文共指消解任务上的性能,本研究采用标准的共指消解评价指标体系,包括MUC、B3CEAFϕ4三个指标[31],并以三者的F1平均值作为最终评估标准。

4.2 实验结果

为了评估TiCoref模型在藏文共指消解任务中的性能,本文基于TiCoref-2025数据集中的新闻语料进行实验。并将模型结果与不同预训练语言模型以及经典基线模型进行比较,如表4所示。

M1~M4对比了不同的藏文预训练模型在本文TiCoref模型上的性能表现。其中,Multilingual BERT[32](M1)在藏文任务上的效果最差,主要是由于其词表中仅包含少量藏文字符,语义建模能力有限; Roberta-base-Tibetan(M2)、藏文Albert[33](M3)与TiBERT[34](M4)等预训练模型则在针对藏文语料进行预训练的条件下显著提升了性能,验证了语言适配度对共指消解性能的重要影响。而本文采用的Bert-base-Tibetan预训练模型表现最佳,平均F1达到了72.67%。

M5~M8以Bert-base-Tibetan预训练模型为统一编码器,使用Coref核心模块对常见基线模型架构进行对比。结果显示,本文的TiCoref模型在多项指标上均优于其他模型,平均F1为72.67%。M5(GRU)与M6(LSTM)性能较弱,M7(GRU-CRF)中基于GRU引入CRF后由于在提及边界识别上有所改善,性能有所提升。M8(Transformer-CRF)在平均F1上达到70.22%,展现出Transformer在长距离依存建模方面的潜能。实验结果对比可视化如图3所示。

为深入分析模型结构中各组件对共指消解性能的贡献,本文基于Coref核心模块构建3种不同的模型架构进行消融实验,具体实验结果如表5所示。从平均指标可以看出,本实验采用的TiCoref模型综合性能最优,平均F1为72.67%,表明BiLSTM与CRF模块在共指结构建模中具有良好协同作用。

为验证引入词藻知识库这一先验知识的建模策略在共指消解任务中的有效性,本文对比分析启用与关闭WKM模块后的性能差异。该模块通过为具有规范别称的提及引入偏置,帮助模型更好地识别共指关系的多样表达,缓解传统纯数据驱动模型在隐式共指知识学习方面的不足。为单独评估该模块的增益作用,本研究在文学体裁样本上重新训练模型,并统一将训练轮数设为5轮,以模拟低资源下的快速适配场景。对比结果如表6所示。

表6可以看出,在引入WKM模块后,模型整体性能显著提升,表明该模块对实体聚合上具有一定的促进作用。该结果进一步表明,在低资源语言场景下,通过轻量知识注入提升模型建模能力是可行的。

最后,为了分析不同粒度的切分方式对模型性能的影响,本研究对新闻语料分别采用音节切分和词级切分两种策略,结果如表7所示。

其中音节切分策略在3项指标上略优于词级切分,平均F1提升约1.38个百分点。这表明细粒度的音节切分在当前任务中能够更充分地对齐预训练模型的子词编码方式,从而提升模型性能。

结 语

本文针对藏文这一低资源语言的共指消解任务,提出了一种兼具语言适配性与结构扩展性的建模方案。基于自建的藏文共指消解语料TiCoref-2025,所提出的TiCoref模型通过引入BiLSTM编码器与CRF边界优化机制,提升了提及识别与聚类性能;同时,针对藏文文学文本中的词藻表达特点,引入了“词藻知识库”模块(WKM),有效增强了对复杂指代现象的建模能力。实验结果表明,该模型在多个共指消解评估指标上均取得显著提升,验证了其在低资源藏文场景下的有效性与泛化性。

尽管本研究取得了初步成果,但仍存在以下不足:首先,当前模型对跨句长距离依赖的建模能力上仍有较大提升空间,在篇章级指代处理上表现不够稳定;其次,所构建的数据集在规模与体裁上仍然有限,目前主要集中于新闻与文学文本,尚未覆盖对话、政文、历史文献等类型,制约了模型的泛化能力。此外,基于大语言模型(LLM)的共指消解方法因其强大的语境理解能力展现出广阔的应用前景,但在藏文场景下仍面临数据稀缺的现实挑战。在建模策略方面,现有方法对多层交互注意力、结构感知编码器(如图神经网络)等机制的探索尚不充分,未来尚有较大的优化空间。

未来研究将从以下方面继续拓展:一是进一步优化模型结构,引入如多层注意力融合机制或外部语言知识,以更好地捕捉复杂共指关系;二是探索共指消解与命名实体识别、篇章结构分析等任务的联合建模机制,以提升整体理解能力;三是利用跨语言迁移学习,借助高资源语言的经验提升藏文场景下的模型泛化能力;四是结合大语言模型的预训练能力,进一步提升模型在低资源语言场景中的表现,特别是在处理复杂指代与跨句共指时的效果;同时,考虑到算力限制,未来研究可进一步探索更高效的模型架构与训练策略,以减少对计算资源的依赖。

参考文献

[1]

张诗安,熊德意.使用共指消解增强多轮任务型对话生成[J].中文信息学报,2022,36(9):149-158.

[2]

熊玲,徐增壮,王潇斌,.基于共指消解的实体搜索模型研究[J].中文信息学报,2018,32(5):89-96.

[3]

Liu Y M, Peng X Y, Cao J N, et al. Bridging context gaps: leveraging coreference resolution for long contextual understanding[C]. Proceedings of the International Conference on Learning Representations, 2025.

[4]

Wong B. A survey on the development and applications of coreference resolution[R]. University of California, Berkeley, 2023.

[5]

刘冬,张晓.基于图神经网络的法律文本共指消解模型[J].无线电通信技术,2024,50(3):587-596.

[6]

周宁,靳高雅,石雯茜.融合神经网络与全局推理的实体共指消解算法[J].数据分析与知识发现,2022,6(8):75-83.

[7]

Hobbs J R. Resolving pronoun references[J]. Lingua, 1978, 44:311-338.

[8]

Grosz B J, Weinstein S, Joshi A K. Centering: A framework for modeling the local coherence of discourse[J]. Computational Linguistics, 1995, 21(2):203-225.

[9]

Ge N, Hale J, Charniak E. A statistical approach to anaphora resolution[C]. Proc Sixth Workshop on Very Large Corpora, 1998:161-170.

[10]

Ng V, Cardie C. Improving machine learning approaches to coreference resolution[C]. Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002:104-111.

[11]

陈远哲,匡俊,刘婷婷,.共指消解技术综述[J].华东师范大学学报(自然科学版),2019(5):16-35.

[12]

Wiseman S, Rush A M, Shieber S M. Learning global features for coreference resolution[C]. Proceedings of the 2016 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies(NAACL-HLT). San Diego, California: ACL, 2016:994-1004.

[13]

Park C, Choi K H, Lee C, et al. Korean coreference resolution with guided mention pair model using deep learning[J]. ETRI Journal, 2016, 38(6):1207-1217.

[14]

Joshi M, Levy O, Weld D S, et al. BERT for coreference resolution: Baselines and analysis[C]. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing. Hong Kong, China: Association for Computational Linguistics, 2019:5803-5808.

[15]

Lee K, He L, Zettlemoyer L. Higher-order coreference resolution with coarse-to-fine inference[C]. Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. New Orleans, USA: Association for Computational Linguistics, 2018:687-692.

[16]

Kirstain Y, Ram O, Levy O. Coreference resolution without span representations[C]. Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing, 2021:14-19.

[17]

Hsu B, Horwood G. Contrastive representation learning for cross-document coreference resolution of events and entities[C]. Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, 2022:3644-3655.

[18]

Wang Y, Jin H. Neural coreference resolution based on reinforcement learning[J]. arXiv preprint, 2022:2212.09028.

[19]

Yao Y, Li Z, Zhao H. Learning event-aware measures for event coreference resolution[C]. Findings of the Association for Computational Linguistics, 2023:13542-13556.

[20]

贡保才让,色差甲,慈祯嘉措,.基于Naive Bayes的藏文人名性别自动识别[J].青海师范大学学报(自然科学版),2017,33(4):11-15.

[21]

夏吾吉,华却才让.基于混合策略的藏文人称代词指代消解研究[J].计算机工程与应用,2018,54(7):66-69.

[22]

才让三智,多拉.藏、英、汉三种语言的人称代词用法比较研究[J].西北民族大学学报(自然科学版),2011,32(1):25-29.

[23]

徐昇,李培峰,朱巧明.外部知识增强的事件共指消解方法[J].软件学报,2025.

[24]

Rahman A, Ng V. Coreference resolution with world knowledge[C]. Proceedings of the 49 th Annual Meeting of the Association for Computational Linguistics. Portland, Oregon, 2011:814-824.

[25]

泽仁郎吉.词渊学词典—沧海滴水[M].成都:四川民族出版社,2001.

[26]

次多.藏文文法[M].北京:民族出版社,2005.

[27]

李亚超,江静,加羊吉,.TIP-LAS:一个开源的藏文分词词性标注系统[J].中文信息学报,2015,29(6):203-207.

[28]

Hovy E, Marcus M, Palmer M, et al. OntoNotes: The 90% solution[C]. Proceedings of the Human Language Technology Conference of the ACL. New York, USA: Association for Computational Linguistics, 2006:57-60.

[29]

Lin R. A survey on the state of the art in coreference resolution[R]. University of California, Berkeley, 2023.

[30]

安波,龙从军.基于预训练语言模型的藏文文本分类[J].中文信息学报,2022,36(12):85-93.

[31]

Liu R, Mao R, Luu A T, et al. A brief survey on recent advances in coreference resolution[J]. Artificial Intelligence Review, 2023, 56:14439-14481.

[32]

Devlin J, Chang M W, Lee K, et al. BERT: Pre-training of deep bidirectional transformers for language understanding[C]. Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, 2019:4171-4186.

[33]

Lan Z, Chen M, Goodman S, et al. ALBERT: A lite BERT for self-supervised learning of language representations[C]. Proceedings of the International Conference on Learning Representations (ICLR), 2020.

[34]

Liu S, Deng J, Sun Y, et al. Tibert: Tibetan pre-trained language model[C]. 2022 IEEE International Conference on Systems, Man, and Cybernetics, 2022:2956-2961.

基金资助

西藏大学研究生高水平人才培养计划项目(2025-GSP-S146)

西藏自治区科技厅中央引导地方科技发展资金项目(XZ202102YD0018C)

AI Summary AI Mindmap
PDF (1100KB)

50

访问

0

被引

详细

导航
相关文章

AI思维导图

/