基于子句的低资源神经机器翻译数据增强方法

邵明智, 李付学, 闫红

沈阳化工大学学报 ›› 2026, Vol. 40 ›› Issue (3) : 320 -327.

沈阳化工大学学报 ›› 2026, Vol. 40 ›› Issue (3) : 320 -327.

基于子句的低资源神经机器翻译数据增强方法

    邵明智, 李付学, 闫红
作者信息 +

Author information +
文章历史 +

摘要

针对低资源翻译任务,提出了基于子句的数据增强方法来缓解由于平行数据稀缺而限制神经机器翻译模型学习句子多样化翻译能力的问题.首先,利用成分句法树和提出的子句提取算法,从训练集的目标端句子中提取子句;其次,构建并使用目标端到源端的神经机器翻译模型反向翻译子句得到伪源端句子,进而得到伪平行语料库;最后,将伪平行数据加入到训练数据中重新训练神经机器翻译模型.在4个低资源翻译任务上进行实验,根据实验结果,以子句构造伪平行数据对训练数据进行增强的方法明显提升了低资源神经机器翻译模型的性能.

关键词

数据增强 / 神经机器翻译 / 低资源语言 / 子句 / 伪平行语料库

Key words

引用本文

引用格式 ▾
邵明智, 李付学, 闫红. 基于子句的低资源神经机器翻译数据增强方法[J]. 沈阳化工大学学报, 2026, 40(3): 320-327 DOI:

登录浏览全文

4963

注册一个新账户 忘记密码

参考文献

基金资助

辽宁省自然基金区域联合基金项目(2022-YKLH-18); 营口理工学院校级科研项目(ZDIL202305,YBL202316)

AI Summary AI Mindmap

2

访问

0

被引

详细

导航
相关文章

AI思维导图

/