一种基于迁移学习的藏英神经机器翻译方法

扎西平措 ,  张佳亮 ,  群诺 ,  尼玛扎西

高原科学研究 ›› 2025, Vol. 9 ›› Issue (2) : 105 -112.

PDF (1342KB)
高原科学研究 ›› 2025, Vol. 9 ›› Issue (2) : 105 -112. DOI: 10.16249/j.cnki.2096-4617.2025.02.011
高原交通与信息处理

一种基于迁移学习的藏英神经机器翻译方法

作者信息 +

A Tibetan-English Neural Machine Translation Method Based on Transfer Learning

Author information +
文章历史 +
PDF (1373K)

摘要

随着全球化背景下跨文化交流需求的日益增长,藏英翻译在促进我国藏族文化的传播、加强与外界的联系以及提升藏语言数字化应用等方面具有重要的现实意义。然而,藏英平行语料资源的严重匮乏,极大地制约了藏英神经机器翻译研究进展,导致系统在处理低频词汇和复杂句式时表现欠佳。针对这一问题,文章系统探讨了迁移学习技术在藏英神经机器翻译中的应用潜力。通过分析父模型的数据规模、目标语言特性以及参数冻结等因素对藏英翻译模型性能的影响基础上,借助其他语言的丰富语料和预训练模型,探索迁移学习策略在藏英神经机器翻译中的潜在优势。研究结果显示,引入迁移学习策略后藏英神经机器翻译性能得到了很大的提升,相比于传统策略BLEU值提高了1.88个点。该方法不仅能够有效缓解藏英语句对的不足,还能有效增强藏英神经机器翻译模型的翻译质量和泛化能力。

Abstract

With the increasing demand for cross-cultural communication in the context of globalization, Tibetan-English translation plays a crucial role in promoting the spread of Tibetan culture in China, strengthening ties with the outside world, and improving the digital application of Tibetan language. However, the serious shortage of Tibetan-English sentence parallel corpus resources has greatly limited the progress of research in Tibetan-English neural machine translation, resulting in poor performance of the system when dealing with low-frequency vocabulary and complex sentence patterns. In view of this problem, this paper systematically discusses the application potential of transfer learning technology in Tibetan-English neural machine translation. Based on the analysis of the influence of the data size of the parent model, the characteristics of the target language, and the parameter freezing on the performance of the Tibetan-English translation model, this study explores the potential advantages of employing a transfer learning strategy in Tibetan-English neural machine translation with the help of rich corpus and pre-training model of other languages. The results show that incorporating the transfer learning strategy significantly improves Tibetan-English neural machine translation compared to traditional methods, and the BLEU value is improved by 1.88 compared with the traditional strategy. This method can not only effectively make up for the deficiency of Tibetan-English sentence pairs, but also enhance the translation quality and generalization ability of Tibetan-English neural machine translation models.

Graphical abstract

关键词

藏英机器翻译 / 生成式对抗网络(GAN) / 迁移学习

Key words

Tibetan-English machine translation / Generative Adversarial Network(GAN) / transfer learning

引用本文

引用格式 ▾
扎西平措,张佳亮,群诺,尼玛扎西. 一种基于迁移学习的藏英神经机器翻译方法[J]. 高原科学研究, 2025, 9(2): 105-112 DOI:10.16249/j.cnki.2096-4617.2025.02.011

登录浏览全文

4963

注册一个新账户 忘记密码

引 言

机器翻译作为不同语言背景的人利用计算机实现跨语言沟通交流的一种手段,经历了从理论到实践的转变。随着神经机器翻译(Neural Machine Translation, NMT)方法的兴起,传统基于规则和统计学习的机器翻译系统逐渐显现出诸多的局限性。这些系统不仅存在领域适应性差、对低资源语言处理能力有限等技术瓶颈问题,还面临着模型更新滞后的困境。相比之下,NMT方法通过端到端的深度学习架构,可显著提升翻译结果的准确性和语言流畅度,推动了机器翻译技术的跨越式发展。藏文机器翻译技术同样经历了从基于规则的方法、统计学习方法到神经网络方法的技术演进过程[1]。2018年完么扎西等[2]在国内率先开展了基于短语的统计机器翻译在藏英翻译任务中的系统性研究,该工作为后续神经机器翻译技术在藏文自然语言处理中的应用奠定了重要基础。但是,当前针对藏英相关的机器翻译研究成果相对较少,尤其缺乏基于神经网络的藏英机器翻译技术研究。这一研究面临的核心挑战在于,神经机器翻译模型的性能高度依赖大规模高质量的双语训练数据[3],而目前可供训练的藏英双语句对数量极为有限,导致现有NMT方法在藏英翻译任务中面临显著的性能瓶颈。鉴于上述背景,本文对藏英神经机器翻译开展了初步探索,提出了一种基于迁移学习(Transfer Learning)的藏英神经机器翻译方法。迁移学习作为一种机器学习方法[4],将一个资源充足任务上学到的知识迁移到另一个资源稀缺的相关任务上,进而提升模型对资源稀缺领域的翻译性能[5]。因此,本文构建几个基于高资源语言的翻译父模型,在此基础上利用迁移学习技术,将父模型上学到的知识迁移至藏语和英语之间的翻译任务当中[6],用来减少模型对大量双语语料库的依赖[7],提高翻译系统的整体性能。

首先,本文介绍了低资源神经机器翻译的基本原理及面临的挑战;其次,系统地阐述了迁移学习的基本概念和原理;最后,分析了该方法在提升藏英翻译质量方面的具体作用,包括语言相似性、语料的规模和参数调整策略等,并通过实验证明了其有效性。本文的主要创新点如下:①开展基于对抗性神经网络的藏英机器翻译工作;②针对藏英语句对匮乏的问题,本文借鉴其他语言的丰富语料和预训练模型,展示迁移学习技术在藏英机器翻译任务中的优势,并进一步结合藏语言的语法特征探讨了语言相似性、父模型的语料数量和参数冻结策略等因素对藏英子模型性能的影响;③结合2022年计算语言大会(CCL 2022)提供的藏汉平行语料,通过跨语言数据转换和人工翻译的方法,初步构建了一定规模的藏英平行语料,为该方向的研究提供了数据资源支持。

1 相关技术背景

1.1 低资源神经机器翻译

神经机器翻译通常依赖大量的双语平行数据来训练高效且准确率较高的翻译模型。然而,对于许多缺乏双语句对的语言(如藏语到英语)来说,由于缺乏足够的平行语料作为训练数据集,神经机器翻译模型的翻译效果往往受限,无法达到理想的水平。为了解决这一问题,研究者提出了多种技术策略并进行了相关研究。如,利用跨语言预训练模型进行知识迁移、应用无监督学习或半监督学习、结合数据增强技术(如回译、生成式对抗网络等)策略和采用迁移学习[8]等方法,将其他富资源语言任务中的知识迁移至低资源语言翻译任务中,以进一步提升低资源语言的翻译效果。

1.2 藏文语法特征

藏文语法是对藏文书写规则和句法结构的系统总结与规范,是藏文使用和书写的重要依据。它通过藏文的句子结构、词汇应用、动词时态及虚实词搭配等方面进行约束,为藏文的书写规范提供了理论基础。任何藏文句子的书写方式要遵循藏文语法规则,以确保语义表达流畅且准确。

不同于汉语句子的主谓宾(SVO)结构,藏文句子属于主宾谓(SOV)结构。即,在藏文句子中,主语置于句首,宾语紧随其后,核心谓语动词则置于句末(图1)。以句子“བཀྲ་ཤིས་ཁྲོམ་ལ་སོང་།”(扎西去逛街)为例,“བཀྲ་ཤིས།”(扎西)作为主语排在句首、“ཁྲོམ་”(街)为宾语、“སོང་”(去)为核心谓语词,宾语和谓语通过业格助词“ལ་”进行连接,使该句子表达了具有完整意义的“扎西去逛街”的含义。“བཀྲ་ཤིས་ཁྲོམ་ལ་སོང་།”中的“ལ་”属于藏文语法八大格助词[9]中的业格助词(ལས་སུ་བྱ་བ།),表示施动者对某一对象所进行的动作或者表示进行动作的方位或目的。

藏文语法体系具有丰富且复杂的词性分类系统。如,藏文名词的单复数形式不作形态上的区分,复数概念主要通过上下文语境、修饰成分或数量词来体现。代词系统则呈现出复杂的语法特征,其形态变化和句法功能具有明显的多元性,如,人称代词“ང་”(我)、“ཁྱེད་”(你)、“ཁོ་”(他/她)明确指代对象,指示代词“འདི་”(这)、“དེ་”(那)精准指向特定人与事物,如“སློབ་དེབ་འདི།”(这本书)和“ཕ་གའི་མི་དེ།”(那个人),疑问代词“ཅི་”(什么)、“ཇི་”(如何)、“སུ་”(谁)、“གང་”(哪个)等,用于替代特定的名词或指示具体的人或物。动词则随着时态变化而产生形态上的不同,这也是藏文语法的重要特征之一。以动词“吃”为例,其词形随时态发生变化,如,“བཟའ་”(将来时)、“ཟ་”(进行时)、“བཟས་”(过去时)、“ཟོ་”(命令式),这些变化主要通过词干变化或者元音的插入来实现。此外,动词还具备被动语态等派生形式,以进一步拓展语义的表达空间。形容词与副词的语法规则与汉语相似,可分别修饰名词和动词,但需依据被修饰对象的属性、数量及格助词搭配调整词形。除了实词外,在藏文语法中的虚词也非常重要,格助词、接续词等虚词在构建句子结构、连接词语等方面起着关键作用。总体而言,深入理解和准确运用藏文语法规则,不仅是正确理解藏文句子、准确表达藏语含义的基础,同时也为藏文文本分析和处理、句法解析以及机器翻译等自然语言处理任务提供重要的理论支撑。

1.3 迁移学习

迁移学习是通过运用已有的知识来学习新的知识,其核心是发现已有知识与新知识之间的相似性,并通过这种相似性进行迁移达到迁移效果(见图2)。迁移学习的要素包括给定源域(Ds)和学习任务(Ts)、目标域(Dt)和学习任务(Tt),迁移学习的目的是将源域Ds和学习任务Ts中学到的知识来提升目标域中预测函数的学习效果,其中Ds不等于Dt、Ts不等于Tt[10]

基于迁移学习方法,本文首先利用大规模高资源平行语料训练一个父模型;接着,利用已训练的父模型初始化藏英神经机器翻译模型;之后,将初始化的模型在一个低资源的双语(如,藏语-英语)数据集上继续训练,获得子模型。这意味着低资源的NMT模型训练不会从随机权重开始训练,而是以父模型获取的权重作为基础[11],使用目标语言的平行语料对初始化后的模型继续训练,得到最终的藏英翻译模型。为了进一步提升模型在目标任务上的表现,本文在微调阶段冻结了模型的前几层参数,以保留其在高资源任务中学到的通用特征。这些特征有助于提高模型对通用语言结构的建模能力,从而提升低资源领域的迁移效果。具体流程见图3。

1.4 基于语言相似性的知识迁移

在本文中,语言的相似性是指不同语言之间存在的语法结构、词汇和句法等方面具有共同的特性。具有共同的语言特征的语言通常来自同一种语系,这种语言间的共性为迁移学习提供了自然契机。Nguyen等[12]指出相似语言在迁移学习中能够更好地传递语言知识,这是由于机器翻译模型通过迁移学习方式,将源语言中学到的语言知识更有效地迁移到目标语言当中,进而提升翻译性能。

基于上述研究我们设想,如果选择与藏语在语法结构上高度相似的高资源语言作为预训练的父模型,可能在藏英机器翻译中发挥积极作用,增强模型的表现。藏文的语法结构属于主宾谓(SOV)的语序,与一些高资源语言的语法结构相同。尽管来自不同的语系,这种语序上的共性为迁移学习利用语法共性提供了有利条件,从而提升藏英机器翻译的性能。实验结果也证明了这一假设的有效性。

1.5 生成式对抗网络(GAN)

生成式对抗网络(Generative Adversarial Network, GAN)是Ian Goodfellow等[13]提出的一种生成式模型,由生成器(Generator)和鉴别器(Discriminator)两个相互对抗的神经网络组成。其中,鉴别器的作用是判断输入样本属于真实数据或者属于伪造数据,目标是最大化判断真实样本为真的概率,同时最小化误将生成样本判为真的概率;而生成器的目标在于不断改进其生成样本的质量,使得鉴别器无法识别出这些样本为伪造数据。具体公式如下:

LD=-EX~Pdata(x)logD(x)-Ez-pz(z)log(1-D(G(z)))
LG=-Ez~pz(z)logD(G(z))

因此,GAN的训练过程是生成器和鉴别器之间相互协作又互相竞争的动态过程。其总体损失函数表示如下:

LGAN=LD+LG

通常情况下,生成器和鉴别器使用卷积神经网络(Convolutional Neural Networks, CNN ),这种网络架构在图像处理相关领域已被广泛应用。然而,对于处理序列数据诸如机器翻译等任务时,使用循环神经网络(Recurrent Neural Network, RNN )[14]作为生成器比采用卷积神经网络效果更好。这类基于RNN的异构生成对抗网络被称为RNN-GAN,已被成功应用于多种序列生成任务中。

1.6 对抗性神经网络的藏英神经机器翻译模型

神经机器翻译作为一种先进的机器翻译技术,采用编码-解码层架构。其中,编码器负责处理输入的句子序列,并将其转化为固定维度的词向量,解码器则利用编码器生成的词向量来生成目标语言的词序列。对抗性神经机器翻译模型的目标是通过生成器学习给定源句子的映射为目标语言的翻译[15]。鉴别器会采用CNN将生成器输出的结果与真实的人类翻译进行比较,以指导生成器不断改进翻译质量。

对抗性藏英神经机器翻译框架如图4所示。模型底部的“x”表示即将要翻译的源语言句子,模型左边的“y”表示人工翻译的目标语言句子,右边的“y'”表示模型生成的翻译句子。模型当中的NMT Model和Generator(生成器),将源句子“x”映射为翻译句子。其中,Discriminator(鉴别器)负责预测给定目标句子是否为真实翻译还是机器根据源句“x”生成的翻译结果。Generator(生成器)和Discriminator(鉴别器)相互对抗,生成翻译样本“y'”来训练Discriminator(鉴别器),并生成通过策略梯度D(x,y')训练G的奖励信号,指导生成器如何根据鉴别器的反馈来优化其参数。结合这种对抗性的方式,对抗性NMT模型能够有效提升藏英翻译的质量和翻译效率。

2 实验设置

2.1 数据集

本研究选择了印地语-英语(Hi-En)、法语-英语(Fr-En)、日语-英语(Ja-En)等3种高资源语言语句对,数据集均来自NLLB(No Limits Language Barriers)数据集[16]。该数据集基于Meta AI发布的metadata双语语料库,包含了148个以英语为中心的其他语言平行语语料及1 465个其他语言之间的双语语料。本文的低资源数据集来自CMXT 2022发放的200万条数据中筛选的6万条高质量藏汉平行句对,其中约60%来自新闻领域,40%来自日常对话领域。本研究通过跨语言数据转换的方法得到5万条高质量藏英平行语料,作为翻译模型的训练语料。

考虑到人工标注成本较高,且目前汉英机器翻译技术较为成熟。本研究通过本地搭建中英神经机器翻译模型的方式获取训练数据集,使用的模型为Facebook发布的M2M100_1.2 B,M2M100作为多语言编码器解码器模型,按照目标任务的不同,根据不同的参数分为多个模型版本,包括418 M、1.2 B以及12 B。本文使用1.2 B参数量的模型对上述数据集中的汉文数据进行英语的翻译,之后将英语结果与原始汉藏平行语料的藏语进行对齐合并,最终形成本文的训练语料。此外,本文结合机器翻译和人工翻译等方式,分别构建了规模为5 000条的验证集和5 000条的测试集。

在构建上述数据集的基础上,还对通过跨语言数据转换方法得到的数据进行了抽样检查。从中随机抽取上述数据集中5%的数据,由5位懂藏英的藏族同学进行人工审查,审查结果显示上述语料适合作为训练数据。数据具体划分和构成情况如表1所示。

2.2 分词模型及评估方式

在本实验中,除了藏文语料以外,还采用了一种综合分词策略。该策略基于Moses分词器,通过tokenizer.perl脚本实现基础分词,并针对具体语言调整参数以提高分词的准确度。此外,引入字节对编码(Byte Pair Encoding、BPE)技术,对所有语料进行子词的处理。BPE技术将词语切分为单个字符后,通过迭代合并频率最高的字符对来构建子词单元,直到达到预设的子词词典大小。BPE能够减少词汇表大小的同时有效缓解未登录词问题,是目前子词分词领域中的常用方法。由于本实验中选取的藏英训练集只包含5万条平行语料,实验中将英语的词汇表大小限制在3 200。对于藏文采用格桑加措等[17]开发的分词工具,该工具主要使用Bi-LSTM结合CRF的藏语分词方法。表2呈现了本文对藏语和英语两种语言的源数据进行分词后的结果。

在评估模型性能方面,选择BLEU(Bilingual Evaluation Understudy)[18]值作为评价指标。BLEU值是一种自动化的评价方法,通过比较模型翻译结果与参考译文(通常由人类翻译者提供)的相似程度,来衡量机器翻译的质量。BLEU分值与人类评判翻译句子质量的判断密切相关。一般情况下,BLEU分值越高,意味着翻译结果与“真实”(即人类翻译)翻译相似度越高,翻译质量越好。

2.3 模型参数

本研究以Pytorch为框架,选取的基线模型为基于LSTM的生成对抗网络(GAN)模型,所有的实验都在阿里云的NVIDIA A10 24GB服务器上进行。模型的生成器(Generator)和鉴别器(Discriminator)分别由循环神经网络(RNN)和卷积神经网络(CNN)构成。为了比较不同实验的结果,每对语言均训练了10个检查点。采用双向LSTM模型,具体参数如表3所示。

2.4 实验结果与分析

本研究选择的基线模型采用一种通过生成对抗网络(GAN)优化翻译质量的方法,该方法已在多个领域证明了其有效性。本实验的主要目标是缓解藏英机器翻译中数据匮乏的问题。为了验证迁移学习能够缓解这一问题,本文分别训练了基于GAN+LSTM的印地语-英语、法语-英语和日语-英语的3种神经机器翻译模型父模型,并将3种父模型的参数迁移至藏英神经机器翻译模型中进行微调,将其性能与未进行迁移的基线模型进行比较,实验结果如表4所示。

实验结果表明,在迁移学习的策略下,经过Hi-En、Fr-En和Ja-En等3种模型进行知识迁移的模型性能均优于基线模型,验证了迁移学习在藏英机器翻译任务中的有效性。此外,表4中的Model1、Model2和Model3在不同数据量条件下的结果也显示,Model2和Model3的效果优于Model1,表明在迁移学习中,父模型的数据量越大能够更好地捕捉到语言细微差别和上下文信息。实验结果还显示,除了父模型的数据量外,结合目标语言的语言特征来选择合适的父模型同样重要。例如,表4中的Model2和Model3在相同数据量的情况下,Model3的表现优于Model2,验证了语法特征相关的语言更有利于指数的迁移。藏文和日语相同(SOV)的语法结构,有助于提升藏语相关任务的翻译性能。从Ti-En在3种不同父模型上微调的损失曲线可知(图5),Model 3在整个训练过程中损失保持在最低值,说明模型Model 3的性能得到了最好的收敛。

综上所述,迁移学习中应综合考虑父模型的多种因素,例如数据量和目标语言的特征等,以便实现更好的迁移效果,进而在藏-英等低资源语言翻译任务中得到更好的性能。此外,在迁移学习过程中,选择性地冻结生成器(Generator)和鉴别器(Discriminator)的参数,也是一种普遍有效的策略。在父模型学出来的参数上训练子模型时,父模型的参数不再进行梯度更新[19]。冻结的参数部分通常包含了对目标语言和源语言均有益的重要信息,这些跨语言共享的信息在不同语言之间可能具有一定的语言通用性。通过冻结这些参数,可以确保迁移过程中保留对语言通用的关键特征,从而进一步提高模型对目标语言的理解和翻译质量。同时,这种方法有助于减少过度拟合的风险,因为嵌入层的参数已经在大量数据上预训练过,具备较好的泛化能力。相比简单初始化子模型,这种方法能够更深入地验证并利用不同语言之间共享的结构和语义共性。

为此,本研究采用了类似的方法,在迁移过程当中冻结生成器(Generator)目标词嵌入参数和鉴别器(Discriminator)词嵌入参数,确保不再更新。在藏英低资源数据集上鉴别器和生成器从头开始训练,并进行了测试。实验结果如表5所示。

结 语

本文系统研究了迁移学习在藏英机器翻译中的应用。实验结果表明,采用迁移学习策略的藏英神经机器翻译系统在翻译效果上明显优于未使用迁移学习策略的基线模型。此外,进一步探讨了父模型的数据规模、目标语言特性以及参数冻结等因素对藏英翻译模型性能的影响,旨在筛选最合适的父模型以提升翻译质量。最后,通过跨语言数据转换和人工翻译等手段,初步构建了藏英平行语料。未来将继续扩充藏英平行语料库,并结合藏语言的形态学、句法结构和语言拓扑等特征,探索更为精确和高效的父模型策略。同时,增加训练轮数,并引入更强大的基线模型,进一步验证迁移学习在藏英机器翻译中的有效性。

参考文献

[1]

严松思,珠杰,汪超,.藏文虚词知识融合的藏汉机器翻译方法研究[J].中央民族大学学报(自然科学版),2024,33(1):20-27.

[2]

完么扎西.基于短语的藏英统计机器翻译关键技术研究[D].拉萨:西藏大学,2018.

[3]

戴光荣,刘思圻.神经网络机器翻译:进展与挑战[J].外语教学,2023,44(1):82-89.

[4]

李洪政,冯冲,黄河燕.稀缺资源语言神经网络机器翻译研究综述[J].自动化学报,2021,47(6):1217-1231.

[5]

Ashraf M. Innovations and Challenges in Neural Machine Translation: A Review[J].

[6]

田静,贾智勇. 基于语言特征和迁移学习的机器翻译系统研究[J].自动化与仪器仪表,2022(8):213-216.

[7]

Ranathunga S, Lee E S A, Prifti Skenduli M, et al. Neural machine translation for low-resource languages: A survey[J]. ACM Computing Surveys, 2023,55(11):1-37.

[8]

Maimaiti M, Liu Y, Luan H, et al. Multi-round transfer learning for low-resource NMT using multiple high-resource languages[J]. ACM Transactions on Asian and Low-Resource Language Information Processing (TALLIP), 2019,18(4):1-26.

[9]

卓玛扎西. 基于组块分割的无监督藏文句法分析研究[D].西宁:青海师范大学,2022.

[10]

刘鑫鹏,栾悉道,谢毓湘,. 迁移学习研究和算法综述 [J].长沙大学学报,2018,32(5):28-31+36.

[11]

乌尼尔. 面向多任务知识迁移的低资源神经机器翻译研究[D].呼和浩特:内蒙古大学,2022.

[12]

Nguyen T Q, Chiang D. Transfer learning across low-resource, related languages for neural machine translation[J]. arXiv preprint arXiv, 2017:1708.09803.

[13]

Goodfellow I J, Pouget-Abadie J, Mirza M, et al. Generative adversarial nets[J]. Advances in neural information processing systems, 2014:27.

[14]

Krizhevsky A, Sutskever I, Hinton G E. ImageNet classification with deep convolutional neural networks[J]. Communications of the ACM, 2017,60(6):84-90.

[15]

陈炜,汪洋,钟敏.结合生成式对抗网络的神经机器翻译研究[J]. 计算机与数字工程,2020,48(5):1164-1167.

[16]

NLLB Team. Scaling neural machine translation to 200 languages[J]. Nature, 2024,630(8018):841.

[17]

格桑加措,阿卜杜热西提·热合曼,尼玛扎西,.Bi-LSTM和CRF结合的藏文分词方法研究[J].中央民族大学学报(自然科学版),2024,33(3):40-46.

[18]

基肖尔·帕皮内尼,萨利姆·鲁科斯,托德·沃德,. Bleu:一种自动评估机器翻译的方法[C]//计算语言学协会年会论文集,2002:311-318.

[19]

Zoph B, Yuret D, May J, et al. Transfer learning for low-resource neural machine translation[J]. arXiv preprint arXiv,2016:1604.02201.

基金资助

新一代人工智能国家科技重大专项(2022ZD0116100)

国家自然基金重点项目(62436006)

西藏自治区科技计划技术创新引导项目(XZ202501JX0004)

AI Summary AI Mindmap
PDF (1342KB)

46

访问

0

被引

详细

导航
相关文章

AI思维导图

/