基于TiBERT标签修复交替网络的藏语语言理解方法

沈淑涛 ,  高红梅 ,  贾承燊

高原科学研究 ›› 2025, Vol. 9 ›› Issue (3) : 108 -119.

PDF (681KB)
高原科学研究 ›› 2025, Vol. 9 ›› Issue (3) : 108 -119. DOI: 10.16249/j.cnki.2096-4617.2025.03.012
高原交通与信息处理

基于TiBERT标签修复交替网络的藏语语言理解方法

作者信息 +

Study on the Tibetan Language Understanding Approach Based on TiBERT Label Repair Alterinating Network

Author information +
文章历史 +
PDF (697K)

摘要

预训练语言模型在下游自然语言理解任务中表现出色,能够从大规模无标注文本数据中自动学习通用语法和语义特征。然而,现有的大多数预训练语言模型和跨语言模型尚未覆盖藏语等少数民族语言,导致其在相关语言任务上的表现有限。近年来,以SimCSE为代表的对比学习方法通过构建正负样本对来实现无监督表征学习。然而,简单的样本构造策略可能会导致语义相近的正对数据被错误地划分为负对数据。针对上述问题,文章提出了一种基于BERT的标签修复交替学习网络。该网络通过交替训练两个相同的BERT模型对藏语句子进行编码,并基于编码结果动态优化正负样本划分策略,从而获得更具区分性的特征表示。在藏语文本相似度匹配数据集上的实验评估结果显示,所提方法在处理相似对与错负对时具有较强的清理能力。进一步地,在文本分类和文本相似度匹配两个下游理解任务上的实验验证了该方法的优越性。最后,消融实验也证实了各个模块的有效性,整体上体现了所提方法的综合优势。

Abstract

Pre-trained language models have demonstrated excellent performance in downstream natural language understanding tasks by learning general grammar and semantic features from large-scale unlabeled text data. However, most existing pre-trained language models and cross-lingual models have yet to cover minority languages such as Tibetan, resulting in limited performance in processing these languages. In recent years, contrastive learning methods, such as SimCSE, have optimized data encoding by constructing positive and negative sample pairs. However, the simple division of positive and negative pairs may erroneously classify semantically similar positive pairs as negative pairs. To address this issue, this paper proposes a BERT-based label repairing alternating learning network. This network alternately trains two identical BERT models to encode Tibetan sentences and optimizes the division of positive and negative samples based on the encoding results, thereby obtaining more discriminative feature representations. Experimental evaluations on the Tibetan text similarity matching dataset demonstrate the cleaning ability of Bert-Label-Repair Alternating Learning for similar and negative pairs. Furthermore, experiments on two downstream understanding tasks,i.e., text classification and text similarity matching, validate the method's superiority. Finally, Ablation studies also confirm the effectiveness of each module, collectively highlighting the comprehensive advantages of the proposed approach.

Graphical abstract

关键词

预训练模型 / 藏语文本分类 / 藏语相似度匹配 / 交替学习

Key words

pre-trained language model / Tibetan text classification / Tibetan text similarity matching / alternative learning

引用本文

引用格式 ▾
沈淑涛,高红梅,贾承燊. 基于TiBERT标签修复交替网络的藏语语言理解方法[J]. 高原科学研究, 2025, 9(3): 108-119 DOI:10.16249/j.cnki.2096-4617.2025.03.012

登录浏览全文

4963

注册一个新账户 忘记密码

引 言

自然语言理解是一项使计算机理解和解析人类语言的技术,主要包括命名实体识别、文本分类、文本相似度匹配等任务。传统卷积神经网络(Convolutional Neural Network,CNN)等方法只能设计具有有限泛化能力的特定任务模型,而预训练语言模型(Pre-trained Language Models,PLMs)则在一定程度上缓解了网络泛化能力弱的问题[1]。PLMs在大量无监督数据上进行训练,提取通用语义特征后,通过在下游任务数据上进行参数微调,使得在各种下游自然语言理解任务中取得更好的泛化能力和更高效的数据利用能力。

然而,现有PLMs的应用主要集中在英语、中文等使用广泛且数据资源丰富的语言上。对于藏语等资源相对有限的语言,尚缺乏性能优良的专用优化模型。为弥补这一不足,跨语言模型应运而生。如,Google推出的多语言预训练模型(Multilingual BERT,mBERT)[2],其能够有效增强PLMs的跨语言泛化能力;FAIR团队提出的跨语言模型XLM(Cross-lingual Language Model)[3],则通过联合训练不同语言,能够捕捉更多的跨语言信息,使低资源语言能够受益于从其他语言迁移而来的知识。然而,上述多语言模型并未包含藏语和国内其他少数民族语言。由哈尔滨工业大学讯飞联合实验室(HFL)开发的面向中国少数民族语言的多语言预训练模型(Chinese mINOrity pre-trained language model,CINO)[4],涵盖了藏语等少数民族语言和国内部分方言。已有研究表明,CINO在少数民族语言任务上表现优于通用多语言模型,但在某些特定下游任务中,其性能仍有待提升。

本文针对藏语数据资源有限以及处理过程中正负样本分布不均的问题[4],提出了一种基于BERT的标签修复交替学习网络。该方法通过交替使用两个结构相同的PLMs模型——BERT模型,对藏语句子进行编码,从而优化正负样本的划分,以获取更具区分性的特征表示。本研究在藏语文本分类与文本相似度匹配任务上进行了实验验证,实验结果显示了所提方法的有效性。

1 相关工作

1.1 预训练语言模型

预训练语言模型(PLMs)是指在大规模无标注文本语料上进行训练,从而学习到通用语言表示能力的模型,目前常用的预训练模型有BERT(Bidirectional Encoder Representations from Transformers)、SimCSE(Simple Contrastive Sentence Embedding)等[1,5]。在训练过程中,模型将预测句子中缺失的单词或生成序列中的下一个单词,从而学习语言中的模式和语义表示。PLMs在文本分类和文本相似度匹配等自然语言处理任务中表现出显著的优势[5]。通过预训练,模型捕获了单词之间的上下文信息和语义关系,使其在理解和生成自然语言文本时表现出更接近人类语言的能力,捕获的一般语义关系使模型能够在多种下游任务中表现良好。

多语言预训练模型CINO涵盖了藏文、蒙古文、维吾尔文、哈萨克文、朝鲜文、壮语和粤语等我国少数民族语言与部分方言[4],有效推动了我国少数民族语言自然语言处理研究,但是其对于情感分析和问答系统等特定下游任务中的性能仍有待改进。借鉴BERT在各类文本分类及命名实体识别等任务中的出色表现,研究者采用BERT预训练模型来优化与藏文相关的自然语言理解任务[6]。本研究从西藏人民网和青海省人民政府网收集了一定规模的藏文数据集,并基于此进行了TiBERT[7]的预训练。TiBERT的有效性在文本分类和问题生成等下游任务中得到了验证与分析,在文本分类任务中,该方法采用了双向软模板提示学习策略,在少样本实验设置下表现优异,同时TiBERT在问题生成任务中也能够达到较好的效果,优于传统的基于LSTM[8]或Transformer[9-11]的模型。

1.2 基于相似性对比自监督学习

基于相似性对比自监督学习(SimCSE)是建立在相似性和对比学习任务组合的基础之上[12]。SimCSE通过简单的对比学习框架,经过相似性学习与对比学习任务的有效结合,在句子嵌入学习上取得了突破性进展。该方法通过利用大规模无标注文本或相关文本对进行训练,摆脱了对人工标注数据的依赖。其核心思想是同时优化嵌入空间中相似文本之间的相似度最大化和不相似文本之间的相似度最小化。SimCSE利用预训练语言模型BERT,对输入文本进行编码和生成隐藏表示。在训练过程中,每对文本被编码,用模型计算相似性损失和对比损失。相似性损失旨在使嵌入空间中的相似文本对的语义更加接近,对比损失则尽可能分开不相似文本对。通过共同优化两个损失函数,SimCSE能够有效地以无监督的方式学习语义表示。这种方法确保模型捕获文本中微妙的语义差异,同时清晰地区分不同文本的上下文。通过这种方式,SimCSE在各种自然语言处理任务中展现出巨大潜力,优于传统监督学习技术。

1.3 对比学习

对比学习旨在通过对比不同样本之间的相似性和差异性来学习有意义的语义表示[13]。对比学习质量的评估依赖于两个关键指标:对齐度和均匀度。对齐度指的是表示相似样本的向量之间的一致性,表明样本间应具有相似的特征,即差异最小[14]。相反,均匀度评估了向量在高维球面上的均匀分布,表明向量应均匀分布在高维球面上[14]。对齐度和均匀度公式分别如下:

Lalignf;aE(x,y)~ppos[f(x)-f(y)2a] 
Luniform(f;t)logEx,y~pdatae-tf(x)-f(y)22

公式(1)中,E(x,y)~ppos[f(x)-f(y)2a]为正样本对(x,y)的分布求期望,f(x)和f(y)分别表示样本xy的向量表示,f(x)-f(y)2a表示它们之间的欧氏距离平方,用于衡量相似样本之间的对齐程度。公式(2)中,logEx,y~pdatae-tf(x)-f(y)22表示在所有样本对上取期望,e-tf(x)-f(y)22用于评估向量在高维球面上的分布情况(均匀度)。通过同时优化对齐度和均匀度,模型既能拉近正样本对之间的语义距离,又能避免特征空间的过度聚集,从而获得更具区分性的语义表示。均匀的特征分布有助于更全面地保存信息结构,同时追求对齐度和均匀度,也揭示出对比学习在效果评估中面临的内在平衡难题。

2 研究方法

本研究基于BERT标签修复交替网络,为缓解模型在自我训练中由确认偏见引发的模型错误累积,本文训练了两个结构相同的BERT网络进行学习,分别记为网络A(NA)和网络B(NB),两个网络通过交替迭代数据分区的方式进行更新。在每个训练周期内,网络A根据相似度计算将样本划分为简单负样本集(SN)和困难负样本集(HN),其中困难负样本是指在初步计算中与正样本相似度较高的负样本。为有效区分困难负样本,本研究设定阈值ε为0.8,超过此阈值的数据被分类为困难负样本,并被标记为相似数据,同时被记录在一个二进制表中。而更新后的数据分区随后被另一个网络使用,该过程交替并进行迭代。通过标签修复机制,这些高相似度负样本会被重新标注为正样本,从而可有效清理样本中的错误标注,保证模型在后续学习过程中更加精确。

在训练过程中,样本会被划分为多个小批次进行处理。在每个小批次中,网络首先会对所有其他数据进行相似度检查:若两条数据相似,则构建一个正样本对,否则构建一个负样本对。与此同时,通过数据增强技术,解决“长度偏差”问题和创建更多样化的数据对样本,改进了SimCSE正负样本构建方法。

本研究使用的藏文数据集总规模约为10 MB,包含约18万条句子,涵盖新闻、词典、政治文件、日常用语等多个领域。在对TiBERT模型进行重新预训练时,采用了该数据集中的全部文本,并进行了标准化清洗与分词处理。预训练采用MLM(Masked Language Modeling)任务进行,训练轮数为100轮,batch size为64,最大序列长度为128。TiBERT模型的词表大小为30 005条,词表构建参考了面向中文的预训练语言模型CINO的处理方法,并结合藏文音节特征对词缀特征进行了特别优化,以更好地适应藏文语料的特点。

2.1 增强后的基于相似性对比自监督学习

SimCSE采用自监督方式,利用对比损失来优化文本编码表示。然而,其原有的正样本生成机制和正负样本匹配机制较为简单,导致了正样本数据分布趋于固定。受BERT中位置嵌入的影响,句子的长度信息通常会被编码在句子向量中。在SimCSE中,每个正样本实际上具有相同的长度信息,而负样本往往具有不同的长度信息。因此,使用这些正例进行无监督训练的SimCSE容易出现“长度偏差”问题,即模型倾向于将长度相似或相同的句子视为语义相似。为缓解上述问题,本文采用了Enhanced SimCSE(ESimCSE)[15]方法。与传统人工数据增强方式不同,ESimCSE方法主要运用随机复制、随机删除和随机插入语篇标记来构建新的数据集,以增加正负样本数据量。这一改进使得ESimCSE能够在利用相同基础数据的同时,引入了更多样化的数据增强方式,从而缓解了SimCSE对齐性和均匀性不足问题,有效克服了样本规模有限的问题,增强了模型捕捉微妙语义差异的能力,提高了模型整体的泛化性能。尽管语篇标记(如随机复制、删除或插入)在一定程度上改变了文本的形式,但这类操作不会显著改变文本的核心语义结构。表1展示了在藏文文本中应用语篇标记后的增强效果,从中可以看出,尽管文本形式发生了变化,原始语义依然得以有效保留,表明ESimCSE在提升语言多样性和鲁棒性方面发挥了积极作用。

2.2 针对藏文文本相似度匹配的改进TiBERT技术

本文的训练过程主要分为两个阶段:第一阶段通过最小化对比损失函数进行模型预训练;第二阶段则冻结BERT网络的部分层,并利用相同数据集针对下游任务对模型进行微调。

由于藏文缺乏面向文本相似度匹配任务的标注数据集,且当前尚无大规模开源数据集可供使用。因此,本研究选取了目前广泛使用的STS-B(语义文本相似度基准)数据集,并对其部分内容进行了人工藏文翻译。为确保所构建的藏文数据的语言自然性与文化适配性,本研究着重翻译了数据集中的日常语言部分,并排除了与外国新闻相关的内容。据此,最终形成的藏文数据集在规模上相较于原始STS-B数据集有所缩减。

在构建数据集时,本文为每个句子对标注了从05的6个相似度等级。其中,等级4和5代表语义相似度较高的正样本,其余等级则因相似性不足,不予视为正样本。由于可用作对比损失的正样本不足一半,本文采用了掩码方法。将掩码比例p设置为0.1,随机采样并添加掩码到非正样本数据xi,生成初始xi+。再根据ESimCSE方法进一步处理已生成的掩蔽样本xi+。对于句子中的每个藏文字符,以5%的概率随机进行复制、以5%的概率随机进行删除,并以10%的概率在文本的任意位置添加一个没有实际语义的藏文字符,用于增强数据的多样性和训练模型的鲁棒性。本文收集10个以上的此类字符,它们可以随机地插入到文本中,模拟自然语言中的噪音和变化。这种处理方法增加了句子长度的多样性,并呈现出以原始句子长度为均值的随机分布。对比损失函数公式如下:

Lossmat=-logesim(hi,hi+)/τj=1Nesim(hi,hi+)/τ+m=1Mesim(hi,hi+)/τ

式中,sim(hi,hi+)=h1h2h1.h2hi,hi+xi,xi+的编码表示,τ代表softmax函数的温度系数。

在预训练阶段结束后,冻结TiBERT模型的参数,并且不再直接连接句子对,而是使用具有相同参数的两个独立TiBERT模型,分别对每对模型中的两个句子进行编码,之后对编码结果进行余弦相似度计算,最后使用线性层执行六类分类任务。

近年来,无监督对比学习在预训练句子表示学习中得到了广泛应用,然而该类方法面临的一个关键挑战在于如何有效构建与利用困难负样本[16],这对于提升模型的表示区分能力至关重要。鉴于此,本文提出了一种基于BERT的标签修复交替网络。该模型采用孪生网络框架,并结合正负样本对的动态划分与更新机制,能够动态识别并校正训练批次中的假负样本,从而优化整体训练过程。本文具体构建了两个二进制表Tα和Tb,分别用于记录两个网络在训练过程中被错误分类的负样本对。在每一个训练周期内,数据依次经过网络A和网络B的训练。首先,网络A进行训练以获取网络参数θA。该网络对所有负样本数据进行编码,并计算其余弦相似度。若某样本对的相似度sim(hi,hj)>ε,则将该对(i,j)记录至新的Tα表中,同时使网络B保持不变。训练完A模型后,利用所构建的Tα表指导网络B的训练。在同一批次中,所有数据对会与Tα进行比较,若某数据对出现在Tα表中,则将其视为正样本参与训练;否则,仍作为负样本对进行处理。类似地,基于网络B获得的参数θB对数据重新进行分类,其中 sim(hi,hj)>ε的样本对将被记录至Tb表中,供下一周期中训练网络A使用。上述过程不断交替迭代,直至模型收敛。需要指出的是,由于本文初始模型无法准确评估数据对的相似性,本研究在启动记录二进制表和更新数据分割之前对模型进行了10个周期的预热训练。

3 实验设置

3.1 数据集

藏文STS-B(语义文本相似性基准)数据集由句子对构成,每个句子对标注有05的相似性分数,用于衡量两个句子之间的语义相似度。分数越高表示语义相似性越大,分数越低则表示语义相似性越小。通过翻译原始英文STS-B数据集,并辅以人工翻译和部分手动校正构建本研究数据集,这在一定程度上缓解了藏文语义相似性研究领域数据资源匮乏问题。本文规定每条数据包含3个字段:句子1、句子2和相似度等级,且将数据划分为训练集、验证集和测试集,分别有1 948条、605条和684条数据样本。

另外,参考已有数据构建方法(PyTorch数据集构建方法、RAG向量知识库构建等)[1718],自建藏文数据集,其中包含10万个句子。该数据集覆盖11个类别:党章、法律法规、计算机词典、人民日报、日常用语、第十八次全国代表大会报告、数字词典、物理词典、现代汉藏词典、政策法规和治理与行政,其具体组成见表2。自建数据集按照7:1:2的比例也被划分为训练集、验证集和测试集,以便后续实验使用。

3.2 评估指标

对于句子相似度匹配任务,本文使用余弦相似度作为评估指标。该指标通过计算空间中两个向量之间夹角的余弦值来衡量它们的方向相似性,其计算公式如下:

Cosin_similαrity(A,B)=ABAB

为了全面评估模型在文本分类任务上的性能,本文采用领域中常用的准确率、精确度、召回率和F1值来评估模型的性能。

准确率:表示分类器正确分类的样本比例。公式如下:

Accuacy=TP+TNTP+TN+FP+FN

精确率:表示被预测为正例且实际属于正例类别的样本比例。公式如下:

Precision=TPTP+FP

召回率:表示被分类器正确预测为正例的真正正例样本所占比例。公式如下:

Recall=TPTP+FN

F1分数:精确率和召回率的调和平均值,为具有不同精确率和召回率的分类器提供了一个平衡的度量。公式如下:

F1=2*Precision*RecallPrecision+Recall

以上指标可共同评估分类器的性能,有助于确定其在文本分类任务中的准确性和可靠性。

3.3 基准模型

为验证所提出方法在改进前述任务性能方面的有效性,本文开展了一系列对比实验,将Transformer、DPCNN、TiBERT等模型和本文模型进行了比较。其中,Transformer模型[19]采用多层自注意力机制,能够有效捕捉更长距离的依赖关系,并通过位置编码来全面处理输入序列中的位置信息,从而实现高效文本表示。相比之下,DPCNN(Deep Pyramid Convolutional Neural Networks)[20]利用深金字塔结构,通过多次卷积和池化操作逐渐减少序列长度,同时逐步增加特征的抽象级别,这种架构使得DPCNN能够在不同层级上捕捉语义信息,从局部逐渐扩展到全局,从而有效编码文本的语义信息。TextRCNN [21]结合了循环神经网络(RNNs)和卷积神经网络(CNNs)的优势,有效捕捉文本中的上下文信息和局部特征。Whitening [22]则是一种对文本特征向量进行线性转换的方法,旨在使各维度具有相同方差且彼此独立,从而降低数据冗余、提升模型性能。Flow转换将各向异性的BERT向量映射到标准高斯分布空间,有效增强了无监督文本域表示的质量。TiBERT作为专门为藏文设计的BERT模型,其在原始架构基础上针对藏语语言特征与结构进行了优化,并在训练过程中充分考虑藏文特有的语言属性,从而在各类藏文自然语言处理任务中表现出更优的性能。

3.4 实验结果与分析

选择预训练的TiBERT模型作为编码模型。在训练具体任务之前,首先对TiBERT进行了预训练编码;随后,将实验任务的结果与上述基准模型进行了比较,各任务的实验结果如表3表4所示。藏文 STS-B数据集中,句子对的相似度评分范围为05。为了将05的评分线性映射到余弦相似度范围,对原始分值进行了线性变换。即,首先将05的分值标准化到01的范围,然后使用公式将标准化后的分值映射到-11的相似度区间。实验结果如表3所示,在句子相似度匹配任务中,本文提出的方法在性能显著优于其他模型,准确率从59.67提高到62.59,F1值从58.90提高到62.38。

标签修复机制通过动态优化正负样本的划分,尤其是在困难负样本的处理上,显著提升了模型在文本分类任务中的表现。修复后的标签能够帮助模型更好地学习句子之间的细微差异,从而有效提升了模型的性能。在文本分类任务中,模型的准确率从73.65%提升至76.23%,F1值从75.12%提升至78.52%,展现了显著的性能增益。与此同时,本文引入的孪生网络框架缓解了学习偏差问题和单一模型的局部收敛问题。通过交替训练,网络可以相互学习,即从两个不同的视角对数据进行建模,利用不同视角增强模型的鲁棒性。

此外,ESimCSE通过自监督学习有效利用未标记数据,确保在标签数据有限的情况下也能得到高效训练。通过结合预训练和数据增强策略,提高了数据利用率和数据集的可扩展性,确保了模型在真实样本量较小的情况下仍然具备良好的学习效果。值得注意的是,ESimCSE在不平衡数据上无需鉴别标签进行训练,从而得到更全面和鲁棒的文本表示。这一特性增强了模型的泛化能力,并增强了模型处理不平衡数据的能力。

在文本分类任务中,尽管在整体性能提升幅度有限,但在“党章”和“党的十八大”等数据量稀少的种类上,本文方法展现出显著的优势,具体如图1所示。这一结果表明,本文的方法能够有效缓解数据不平衡带来的性能瓶颈问题。

此外,本研究进一步对比分析了TiBERT-ESimCSE(本文方法)和其他不同的预训练方法在对齐性和均匀性方面的性能表现差异,具体结果如图2所示。从图2中可以看出,尽管TiBERT的对齐分数最低,但在一致性方面表现相对较好。这主要归因于由BERT编码生成的向量具有各向同性特性,意味着所有向量都被映射到一个“狭窄”的高维空间中。TiBERT-whitening和TiBERT-flow对向量空间进行转换以减轻各向同性,但缺乏维持高对齐性的专门损失函数。另一方面,SimCSE在对齐性和一致性之间取得了更好的平衡,这正是其数据增强策略产生了积极影响。基于BERT的交替学习训练模式,则在保持对齐性的同时进一步提升了相似性。

为了验证本文实验的有效性,在同一批次训练中分别选取了藏文STS-B中评分为4分、5分和0分的样本,生成了两个二值表,交叉Tα和Tb,并将结果与基本事实(GT)进行比较,以确保有多少错误负样本被正确修复。实验结果如图3所示,最终的负样本错误率降至0.1837,说明本文模型能够有效纠正多数错误数据,验证了基于BERT的标签修复交替学习方法的有效性。此外,为了探索最佳阈值设置,本文在0.50.9的范围内,以0.1为步长测试了一系列阈值。实验结果如图4所示,显示阈值为0.8时模型性能表现最佳。

在文本分类任务中,本文设计了两个关键的消融实验,以评估不同模块对模型性能的影响。首先,通过引入TiBERT-SimCSE和TiBERT-ESimCSE对TiBERT模型进行了改进,它们分别采用了SimCSE和ESimCSE方法,实验结果如表5所示。从中可以看出,上述改进对模型性能产生了显著的影响,验证了所引入方法在增强模型性能方面的有效性。其次,专门针对TiBERT-ESimCSE模型,本研究进行了消融实验来评估不同的数据增强方法,其结果如表6所示。本文将负样本校正机制与孪生网络架构相结合后进行观察,发现模型性能得到了进一步提升,这表明了本文使用的负样本校正机制和孪生网络训练架构的有效性,结果如表7所示。

整体实验结果显示,各种数据增强方法对模型性能产生了积极影响,进一步验证了TiBERT-ESimCSE模型的有效性。这一发现不仅验证了ESimCSE方法的有效性,还能清晰地显示了不同数据增强策略在增强模型性能方面的潜力。

结 语

本文针对藏语自然语言处理中的数据稀缺和数据不平衡问题,提出了一种基于TiBERT的改进预训练方法,并对ESimCSE方法进行了数据增强,以更有效地学习藏文数据集的高质量语义表示。为验证该方法的有效性,本文在收集和自建的数据集上进行了文本分类和文本相似度匹配任务实验。实验结果表明,与现有主流模型相比,本研究提出的方法在两种任务类型上的性能均有所提升。特别是在文本分类任务中,本方法显著提高了稀有类别数据的分类准确性,展示了其在处理数据不平衡问题方面的优势。此外,消融实验进一步验证了各个模块的独立有效性。总体而言,本文的方法不仅增强了现有预训练模型对藏文的理解能力,也有效缓解了数据不平衡对模型性能的影响。

参考文献

[1]

Devlin J, Chang M W, Lee K, et al.BERT: Pre-training of deep bidirectional transformers for language understanding[C]. Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, 2019: 4171-4186.

[2]

Pires T, Schlinger E, Garrette D. How multilingual is multilingual BERT?[C]. Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Florence, Italy: Association for Computational Linguistics, 2019:4996-5001.

[3]

Alexis C, Kartikay K, Naman G, et al. Cross-lingual language model pretraining[C]. Proceedings of the 33rd International Conference on Neural Information Processing Systems,2019:7059-7069.

[4]

Yang Z Q, Xu Z H, Cui Y M,et al. CINO: A Chinese minority pre-trained language model[C]. Proceedings of the 29th International Conference on Computational Linguistics,2022:3937-3949.

[5]

Li B H, Zhou H, He J X,et al. On the sentence embeddings from pre-trained language models[C]. Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP),2020:9119-9130.

[6]

Zhang J, Kazhuo D, Gadeng L,et al. Research and application of Tibetan pre-training language model based on BERT[C]. Proceedings of the 2022 2nd International Conference on Control and Intelligent Robotics,2022: 519-524.

[7]

Liu S, Deng J, Sun Y, et al.TiBERT: Tibetan pre-trained language model[C].2022 IEEE International Conference on Systems, Man, and Cybernetics(SMC).IEEE,2022:2956-2961.

[8]

索南多杰,官却多杰,拉玛杰,.基于深度学习的藏文文本自动分类研究[J].青海科技,2023,30(3):192-196.

[9]

Deng J, Chen L, Zhang Y,et al. TiKEM: Knowledge enhanced Tibetan pre-trained language mode[C]. Proceedings of the 22nd Chinese National Conference on Computational Linguistics,2023:135-144.

[10]

Secha J, Cizhen J, Cairang J,et al. Automatic generation of Tibetan poems based on pre-training and control code method[C]. Proceedings of the 21st Chinese National Conference on Computational Linguistics,2022:366-373.

[11]

Huang S, Yan X, OuYang X,et al. Abstractive summarization of Tibetan based on end-to-end pre-trained model [C]. Proceedings of the 22nd Chinese National Conference on Computational Linguistics,2023:113-123.

[12]

Gao T Y, Yao X C, Chen D Q.SimCSE: Simple contrastive learning of sentence embeddings[C]. Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing,2021:6894-6910.

[13]

Zhang D J, Li S W, Xiao W,et al. Pairwise supervised contrastive learning of sentence representations[C]. Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing,2021:5786-5798.

[14]

Wang T, Isola P. Understanding contrastive representation learning through alignment and uniformity on the hypersphere[C]. Proceedings of the International Conference on Machine Learning, 2020:9929-9939.

[15]

Wu X, Gao C C, Zang L J,et al. ESimCSE: Enhanced sample building method for contrastive learning of unsupervised sentence embedding[C].Proceedings of the 29th International Conference on Computational Linguistics,2021:3898-3907.

[16]

Oord A, Li Y, Vinyals O. Representation learning with contrastive predictive coding[J]. arXiv preprint arXiv:2018.

[17]

Sun Y, Liu S, Chen C,et al.Construction of high-quality tibetan dataset for machine reading comprehension [C]. Proceedings of the 20th Chinese National Conference on Computational Linguistics,2021:208-218.

[18]

孙媛,刘思思,陈超凡,.面向机器阅读理解的高质量藏语数据集构建[J].中文信息学报,2024,38(3):56-64.

[19]

Vaswani A, Shazeer N, Parmar N,et al. Attention is all you need[J]. Advances in Neural Information Processing Systems, 2017:5998-6008.

[20]

Johnson R, Zhang T. Deep pyramid convolutional neural networks for text categorization[C].Association for Computational Linguistics,2017:562-570.

[21]

Lai S, Xu L, Liu K,et al. Recurrent convolutional neural networks for text classification[C]. Proceedings of the Twenty-ninth AAAI Conference on Artificial Intelligence,2015:2267-2273.

[22]

Su J, Cao J, Liu W,et al. Whitening sentence representations for better semantics and faster retrieval[J]. arXiv preprint arXiv:2021.

基金资助

西藏自治区科技计划项目(XZ202202YD0015C)

AI Summary AI Mindmap
PDF (681KB)

30

访问

0

被引

详细

导航
相关文章

AI思维导图

/