PDF
摘要
针对现有循环神经网络(recurrent neural networks, RNN)在长序列学习任务中容易遇到梯度消失或爆炸,且对长文本处理能力存在局限的问题,本文提出一种基于多源信息融合的自动标注算法。该算法构建了多目标语义映射器(multi-objective semantic mapper, MOSM)模型,在传统RNN基础上融合了Transformer结构与自注意力机制(Self-Attention),以增强模型对长距离依赖文本的特征捕捉能力。同时,引入贝叶斯理论处理多源数据融合,并利用多目标优化算法调整模型参数,以实现各项标注指标的最佳平衡。为验证所提方法的有效性,研究采用Chinese-English Text和UN translation text双语数据集进行对比实验,从吞吐量、准确度、召回率、F1分数、系统资源消耗及可用性等多个维度,将MOSM模型与传统的BERT、GAN模型进行综合评估与测试。实验结果表明,本文提出的MOSM模型吞吐量达到1.32word/s,准确度高达93.5%,召回率为92.1%,F1分数为92.8%;系统仅消耗15%的CPU和300 MB内存,可用性维持在99.95%。各项性能指标均显著优于传统模型,该模型在提升翻译文本隐形词汇语义标注的准确性、效率及资源利用率方面展现出明显优势。
关键词
Key words
王彦易.
一种多源融合的英语翻译词汇语义自动标注算法[J].
自动化技术与应用, 2026, 45(7): 144-148 DOI:10.20033/j.1003-7241.(2026)07-0144-05
基金资助
上海市科技创新行动计划国内科技合作项目(22015802400)