面向端到端语音翻译的分阶段训练与策略优化方法

朱烨 ,  李军辉 ,  周国栋

南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (04) : 577 -591.

PDF (784KB)
南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (04) : 577 -591. DOI: 10.13232/j.cnki.jnju.2026.04.006

面向端到端语音翻译的分阶段训练与策略优化方法

作者信息 +

A staged training and policy optimization method for end⁃to⁃end speech translation

Author information +
文章历史 +
PDF (802K)

摘要

近年来,语音大模型凭借强大的跨模态表征与跨语言理解生成能力,为端到端语音翻译(End⁃to⁃End Speech Translation,E2E ST)的研究提供了新范式,现有E2E ST方法也逐渐开始利用大模型的跨模态优势,以缓解传统训练中的对齐与优化难题.然而,直接从语音生成译文仍十分困难,模型需在单一目标下同时完成声学建模、语义理解与跨语言生成,在平行语料有限时,往往容易导致训练不稳定和译文质量下降.为此,提出一种面向端到端语音翻译的分阶段训练与策略优化方法.该方法在统一自回归生成框架下,将关键词、ASR转录和目标译文组织为结构化输出序列,并通过三个阶段逐步提升模型的语音理解与翻译生成能力.首先,通过关键词预测与语音转写联合建模,构建由关键词语义骨架和完整源端转写组成的双粒度源端表示,以建立稳定的声学⁃语义对应关系;其次,引入完整翻译目标,并结合人工标注与阶段预测结果来构建混合辅助标签,以提升模型对推理阶段中间表示噪声的适应能力;最后,采用基于群体相对策略优化(Group Relative Policy Optimization,GRPO)的强化学习方法,仅针对最终译文子序列进行奖励建模,进一步优化译文生成策略.在Qwen2⁃Audio,Qwen2.5⁃Omni和Qwen3⁃Omni模型上对MuST⁃C三个语言对进行的实验表明,该方法在BLEU和COMET上均取得显著提升,验证了分阶段训练、混合辅助标签与译文级策略优化能够有效提升端到端语音翻译的稳定性和跨语言生成质量.

Abstract

In recent years,large speech models have demonstrated strong capabilities in cross⁃modal representation and cross⁃lingual generation,offering a new paradigm for end⁃to⁃end speech translation (E2E ST). Existing E2E ST methods have gradually leveraged these advantages to alleviate alignment and optimization challenges inherent in traditional training. However,directly generating translations from speech remains difficult,as the model is required to simultaneously perform acoustic modeling,semantic understanding,and cross⁃lingual generation within a single objective. This challenge becomes more severe when parallel data are limited,often leading to unstable training and degraded translation quality. To address these issues,this paper proposes a staged training and policy optimization method for end⁃to⁃end speech translation. Under a unified autoregressive generation framework,the proposed method organizes keywords,ASR transcriptions,and target translations into a structured output sequence and progressively enhances the model's speech understanding and translation generation capabilities through three stages. First,keyword prediction and speech transcription are jointly modeled to construct a dual⁃granularity source representation comprising a keyword⁃level semantic skeleton and a complete source transcription,thereby establishing stable acoustic–semantic correspondences. Second,the full translation objective is introduced,and mixed auxiliary labels are constructed by combining human annotations with predictions from the previous stage,improving the model’s adaptability to intermediate⁃representation noise during inference. Finally,reinforcement learning based on Group Relative Policy Optimization (GRPO) is adopted,with reward modeling applied exclusively to the final translation subsequence,to further refine the translation generation strategy. Experiments on three MuST⁃C language pairs using Qwen2⁃Audio,Qwen2.5⁃Omni,and Qwen3⁃Omni demonstrate that the proposed method achieves significant improvements in both BLEU and COMET scores,confirming that the integration of staged training,mixed auxiliary labels,and translation⁃level policy optimization effectively enhances both the stability and cross⁃lingual generation quality of end⁃to⁃end speech translation.

Graphical abstract

关键词

端到端语音翻译 / 分阶段训练 / 策略优化 / 强化学习

Key words

end⁃to⁃end speech translation / staged training / policy optimization / reinforcement learning

引用本文

引用格式 ▾
朱烨,李军辉,周国栋. 面向端到端语音翻译的分阶段训练与策略优化方法[J]. 南京大学学报(自然科学), 2026, 62(04): 577-591 DOI:10.13232/j.cnki.jnju.2026.04.006

登录浏览全文

4963

注册一个新账户 忘记密码

随着全球化与信息化的推进,跨语言的语音交流的需求持续增长,语音到文本的翻译技术在国际商务、教育交流、会议同传以及人机交互等场景中发挥着越来越重要的作用1-3.传统语音翻译系统多采用级联式架构,即先通过自动语音识别(Automatic Speech Recognition,ASR)模块将源语音转写为文本,再由机器翻译(Machine Translation,MT)模块生成目标语言译文4-5.该框架可以分别利用ASR和MT的成熟技术,但由于声学建模与翻译生成相互割裂,误差易在模块间累积,导致语义信息丢失、上下文不一致及系统延迟增加等问题.
端到端语音翻译(End⁃to⁃End Speech Translation,E2E ST)采用单一模型直接将源语言语音映射为目标语言文本,在统一目标函数下同时建模声学特征、语义内容与跨语言生成,有望缓解级联架构中的误差传播,具有结构简洁、推理链路短、实时性较好的优势,因此已成为当前语音翻译研究的重要方向6-10.然而,E2E ST的训练与优化仍面临诸多挑战:一是语音信号高维连续、时序跨度长,模型需在单一训练过程中同时完成声学建模、语义理解和目标语言生成,导致优化目标高度耦合、收敛过程不稳定;二是语音与文本之间存在显著模态差异,高质量平行语音⁃文本数据相对匮乏,模型在特征对齐、表示转换及低资源条件下的泛化能力均受到限制,使端到端系统的翻译准确性、流畅度和稳定性仍有较大提升空间11-12.
现有研究从课程学习、噪声鲁棒训练、强化学习策略优化等方向解决E2E ST的训练难题,但多为独立设计与简单移植,没有针对语音大模型的自回归生成特性进行有机融合,也没有结合任务特点进行轻量化、精准化的策略调整.因此,本文提出一种面向端到端语音翻译的分阶段训练与策略优化方法,将原本单阶段的训练过程拆分为三个难度递进的阶段,使模型能沿着更平滑的学习路径逐步掌握语音⁃文本映射.其中,阶段一与阶段二采用“由易到难”的课程学习训练策略,通过先学习较为简单的语音⁃语义对应,再逐步过渡到完整的语音翻译任务,以缓解端到端训练中声学、语义与翻译目标耦合带来的优化困难.在阶段一中,模型仅需完成ASR与关键词预测两个中间辅助任务,通过弱化跨语言生成压力,促使模型先建立稳定的声学⁃语义表征.阶段二在此基础上引入完整翻译目标,使模型在同时预测ASR、关键词和翻译的多任务设置下进行训练,并采用由人工标注与第一阶段预测结果构成的联合标注中间语料,使模型能够在包含自动预测误差的条件下进行联合建模,提升对非完美中间输入的适应能力.在第三阶段,进一步结合基于群体相对策略优化(Group Relative Policy Optimization,GRPO)13的强化学习,针对译文子序列进行策略层面的精细化调整,但对关键词与ASR部分不施加显式奖励约束,在有监督信号的基础上进一步提升译文的整体质量与稳定性.
综上,本文的主要创新点如下.
(1)提出一种面向语音大模型的结构化分阶段训练框架,将关键词、ASR转录与目标译文统一组织为自回归输出序列,通过关键词语义骨架与完整源端转写的联合建模,增强模型在跨语言生成前的声学⁃语义对齐能力.
(2)提出一种混合辅助标签策略,在翻译阶段联合使用人工标注与阶段预测结果,使模型在监督训练中提前接触推理阶段可能出现的中间表示噪声,缓解训练与推理之间的分布偏移.
(3)提出一种面向结构化输出的译文级GRPO策略优化方法,仅对最终译文子序列计算奖励,使强化学习目标直接对齐端到端语音翻译的最终评价指标,避免辅助任务与翻译任务之间的优化目标冲突.

1 相关工作

1.1 级联式语音翻译

语音翻译作为跨语言交流的重要技术手段,长期以来以级联式架构为主要实现方式.该架构首先由ASR模型将源语言语音转写为文本,再由MT模型将转写结果生成目标语言译文.这一流程充分借助了ASR与MT领域成熟的模型体系与丰富的数据资源,因此,在工业界建立了稳固的应用基础.

尽管如此,级联式语音翻译也存在明显的缺陷.ASR的识别误差会直接传递到MT,导致语义缺损、实体错译甚至整体句意偏移.同时,由于ASR与MT通常各自独立优化,难以形成统一的语义表示与全局建模.为了缓解这些问题,Sa⁃leem et al14引入词格使翻译模型能够访问ASR的多条潜在识别路径,避免仅依赖单一最佳转写导致的信息损失.Zhang et al15提出基于后验概率过滤的词格翻译策略,以提升候选文本质量并降低噪声传播.Lam et al16采用自训练与后编辑结合的方法,通过强大的语言建模能力对ASR文本进行语义补全与纠错,降低输入噪声对翻译阶段的影响.

此外,也有研究者关注ASR与MT之间的协同优化.Bahar et al17将ASR和MT融合为一个端到端可训练的联合模型,通过参数共享与梯度反向传递来改善两者的语义一致性.Anastasopoulos and Chiang18利用正则化约束加强多任务间的中间表示共享,使ASR输出与翻译输入在高层语义上更加对齐.

1.2 端到端语音翻译

随着深度学习与多模态建模技术的发展,端到端语音翻译逐渐成为语音翻译领域的重要研究方向.相较于传统的级联式架构,端到端方法不再显式生成中间的转写文本,而是通过单一模型直接建立语音信号到目标语言文本之间的映射关系.

然而,端到端语音翻译的训练难度远高于ASR或MT这样的单模态任务,这主要源于任务本身的双重复杂性.其一,语音与文本之间存在显著的模态差异,语音是高维连续信号,而文本是离散符号序列;其二,语音翻译需要同时跨越语言差异,使模型必须在统一框架内完成声学建模、语义抽象和跨语言生成三类高度异质的任务.此外,与ASR或MT领域庞大的训练资源相比,语音翻译可用的平行语音⁃翻译数据规模极为有限,导致模型在口音变化、说话风格多样性和跨领域迁移方面容易出现性能下降.

针对上述挑战,研究者提出了多个方向的技术路线,其中一类工作聚焦于扩大训练数据规模.Jia et al19通过将文本翻译数据转化为合成语音来构造额外的平行数据.Bahar et al20结合TTS和MT模型生成伪样本,以丰富语音⁃译文配对.Pino et al21利用自训练机制,以模型自身生成的伪标签持续扩充训练集.Di Gangi et al22提出结合知识蒸馏的框架,使端到端模型能够吸收级联系统的知识,提高在低资源环境下的稳定性.

另一类研究着重于改进训练策略,以提升模型的收敛效率和语义对齐能力.Bérard et al23探索了利用大规模ASR或文本翻译模型作为初始化,使E2E ST能够从更成熟的语义或声学表示开始训练.Wang et al24发现课程学习策略能够有效缓解端到端模型在训练初期的不稳定性.通过逐步提升任务难度,使模型从简单目标过渡到复杂目标,该方法显著改善了整体训练过程的收敛质量.

此外,也有研究者着重处理模态差异问题.Han et al25提出共享语义内存模块,使语音与文本表示可以投射到统一的语义空间.Ye et al26采用跨模态对比学习,通过语音⁃文本正负样本对的约束来增强模态对齐能力.Fang et al27通过引入混合序列,使模型能够在同一输入流中同时接收语音片段和文本标记,缓解跨模态转换时的信息断层问题.

在端到端语音翻译不断发展的同时,近年来大语言模型在跨语言理解与生成上的优势也逐渐被引入语音翻译任务.Huang et al28提出LLM⁃ST (Large Language Model⁃Speech Translation),将预训练语言模型与连续语音编码器结合,并通过多任务指令微调使模型能够同时处理转录、时间戳预测与跨语言翻译等任务,构建统一的语音⁃文本生成框架.Zhang et al29提出LST,通过使用适配层将语音编码器与LLaMA系列模型连接,使端到端语音翻译能够借助更强的语言建模能力改善长语音条件下的译文质量.Ouyang et al30提出FASST,面向实时翻译场景,通过块式因果编码和一致性掩码实现增量式语音建模,以降低大模型在流式翻译中的推理延迟.Fathullah et al31提出AudioChatLlama,通过指令微调构建可进行语音问答、语音翻译与开放式生成的多模态语言模型,展示了大模型在统一语音理解任务中的可扩展性.Du et al32提出将语音翻译重构为“转写⁃翻译”联合生成任务,并结合课程式训练策略,使大模型在低资源条件下亦能逐步获得稳健的跨语言生成能力.

1.3 基于课程学习的语音翻译

课程学习(Curriculum Learning,CL)的核心思想是通过由易到难、由浅入深的训练方式,使模型逐步掌握复杂任务,获得更稳定的收敛性与更强的泛化能力.在语音翻译这一跨模态场景中,课程学习为改善训练稳定性、降低优化难度并应对数据稀缺提供了一条可行途径.

Kano et al33最早将课程学习引入语音翻译任务,通过构造难度逐步增加的训练阶段,使模型能够先学习声学⁃文本对齐的基础能力,再逐渐承担更复杂的跨语言生成任务.Wang et al24进一步提出课程式预训练框架,将ASR、帧级语义建模以及跨语言词汇对齐等子任务按照学习难度组织成多级课程,引导模型在翻译训练前逐步获取声学、语义和跨语言表征能力.Du et al32提出三阶段ASR→SMT→SRT的课程学习策略,使多模态大语言模型能够借助由易到难的任务序列完成语音理解、语义编码和跨语言生成的渐进式迁移.但现有课程学习方法主要关注表征学习的递进性,较少将其与噪声鲁棒训练和强化学习策略优化进行联合建模.

2 分阶段训练与策略优化方法

2.1 任务定义与总体框架

本文的端到端语音翻译任务旨在将源语言语音信号直接映射为目标语言文本序列.为了提供清晰的对比起点,首先在Qwen2⁃Audio34,Qwen2.5⁃Omni35和 Qwen3⁃Omni36三个语音大模型上分别构建直接端到端基线模型,即在不引入关键词、ASR转录等中间辅助任务,也不采用阶段式训练或策略优化的条件下,通过单阶段监督微调直接学习从源语音到目标译文的映射关系.在此基础上,进一步提出一种分阶段训练与策略优化框架,以缓解端到端建模中声学建模、语义理解与跨语言生成目标高度耦合带来的优化不稳定问题.具体做法是在统一的自回归生成框架下,基于语音大模型将“关键词⁃ASR⁃译文”线性化为一个结构化输出序列,由模型逐子词生成.其中,译文为最终目标,关键词与ASR转录作为辅助信号帮助模型在早期阶段建立稳健的源端表征.在此基础上,构建了一个端到端语音翻译的分阶段训练与策略优化框架(图1),使模型能沿由浅入深的路径逐步掌握语音⁃文本映射.其中,阶段一与阶段二在监督目标上形成由“中间表示预测”到“完整翻译生成”的递进关系,构成了一种从易到难的课程式学习安排,阶段三在前两阶段训练好的模型基础上进一步进行策略优化.三个阶段共享相同的模型结构与输入格式,但在监督内容与优化方式上逐步增加难度,模型参数在阶段之间依次继承,具体如下.

阶段一,语音识别.仅预测关键词与ASR转录,使模型在不涉及跨语言生成的条件下优先学习语音与语义之间的稳定对应关系.

阶段二,语音翻译.在阶段一已获得的源端表征基础上引入完整翻译任务,并在辅助任务中使用人工标注与阶段一预测结果构成的混合标签,使模型在更贴近推理噪声的条件下进行跨语言生成.

阶段三,策略优化.在与阶段二相同的输出结构下,引入基于GRPO的强化学习,以序列级指标为奖励对生成策略进行细粒度优化.

2.2 阶段一:语音识别阶段

阶段一的目标是在不涉及跨语言生成的条件下,让模型优先掌握稳定的声学⁃语义对应关系,为后续翻译建模提供可靠的源端表征.在这一阶段中,模型仅需完成两个源端辅助任务,即关键词预测与ASR转录预测.

给定输入语音xi,阶段一的目标序列由关键词序列ki与ASR转录序列ai线性化构成:

ti=ki;ai

其中,·;·表示序列在词元层面的顺序拼接操作.模型通过自回归方式逐子词预测目标序列的条件概率:

ptixi=j=1tipti,jxi,ti,<j

其中,ti,j表示第i条样本的目标序列里第j个子词,ti,<j表示第i条样本的目标序列里前j个子词.

训练采用标准交叉熵损失:

1=-ij=1tilg pti,jxi,ti,<j

由于训练目标仅包含源端语义信息,模型无需承担跨语言生成压力,能够在简化的优化空间中快速建立稳健的声学⁃语义对齐能力.该阶段所得模型作为阶段二的初始化,为后续跨语言建模提供高质量的中间语义表示.

2.3 阶段二:语音翻译阶段

阶段二在阶段一的基础上加入完整的翻译任务,使模型在统一框架下同时预测关键词、ASR转录及目标语言译文,实现语音理解与跨语言生成的联合建模.

为了减轻训练与推理之间的分布差异,本阶段在辅助任务(关键词与转录)中采用“人工标注+阶段一预测”的联合标注中间语料.具体地,对关键词与转录分别定义联合标签分布:

k˜ikigold,pkipred,1-pa˜iaigold,paipred,1-p

其中,p表示从人工标注序列中采样的概率.实验中固定p=0.5,即期望上一半样本使用人工标注序列,另一半使用阶段一预测序列.关于不同混合比例对模型性能的影响,将在4.2中通过对比实验进一步分析.

最终,阶段二的目标序列如下:

y˜i=k˜i;a˜i;zigold

其中,zigold为人工标注的目标语言译文.

对应的训练损失为:

2=-ij=1y˜ilg py˜i,jxi,y˜i<j

其中y˜i,j表示第i条样本的目标序列里第j个子词,y˜i<j表示第i条样本的目标序列里前j个子词.

混合标签使模型在训练过程中提前暴露于更贴近推理噪声的中间表示,从而增强在不完美语义输入条件下的鲁棒性,使跨语言生成过程更加稳定可信.

2.4 阶段三:策略优化阶段

尽管阶段二已具备较强的跨语言生成能力,但基于交叉熵的监督学习无法直接优化BLEU等序列级指标.为了进一步提升整体译文质量,阶段三引入Group Relative Policy Optimization (GRPO)13,以序列级奖励为导向对模型生成策略进行优化.

本阶段中,模型的输出序列仍保持与阶段二相同的结构,即同时包含关键词、ASR转录与目标语言译文三部分.但在计算奖励时,仅关注最终译文子序列,对关键词与ASR部分不施加显式奖励约束.因为端到端语音翻译的最终优化目标是目标语言译文质量,关键词和ASR转录主要是作为前两个阶段的辅助监督信号,用于帮助模型建立声学⁃语义对应关系.若在策略优化阶段对关键词、ASR和译文都设置奖励,就需要额外平衡不同任务的奖励尺度,可能使模型过度关注辅助输出的形式匹配,从而干扰最终译文质量的优化.因此,本文仅基于译文子序列计算BLEU奖励,使GRPO优化更加直接地服务于语音翻译目标.

2.4.1 多样候选生成与译文抽取

对于每个输入语音x,从当前策略πθ中通过采样得到一组G个候选输出序列:

o=o1,o2,,oG

其中,每个oi均为线性化的完整输出序列,从中抽取其对应的译文子序列,记为:

zi=Transoi

其中,Trans·表示从完整输出中截取目标语言翻译部分的操作.

2.4.2 仅基于译文的序列级奖励

奖励函数仅作用于译文子序列,采用BLEU37分数衡量生成译文与参考译文之间的一致性:

ri=BLEUzi,zigold

其中,zigold为人工标注的目标语言参考译文.

随后,在每个候选组内对奖励进行标准化,得到GRPO的组内相对优势:

Ai=ri-meanrstdr+δ

其中,meanrstdr分别为同一组内ri的均值与标准差,δ为数值稳定项.

2.4.3 策略比率与GRPO目标

设阶段二训练得到的模型作为旧策略πθold,同时保存其副本作为参考策略πref.对每个候选序列oi,定义策略比率为:

pi=πθoixiπθoldoixi

GRPO的优化目标为在组内提升高优势样本的概率并通过KL正则化约束策略偏移,其形式化如式(12)所示:

maxθ 𝔼1Gi=1GminρiAi,clipρi,1-ε,1+εAi-βDKLπθπref

实际训练时,等价地最小化损失函数:

3=-1Gi=1GminρiAi,clipρi,1-ε,1+εAi+βDKLπθπref

其中,clip·为截断项,用于防止策略更新过大,ε为截断超参数,β控制当前策略偏离参考策略的幅度.

通过这种“仅基于译文子序列的序列级奖励+组内相对优势+KL约束”的优化方式,阶段三在保留前两阶段所学声学与语义表征的基础上,进一步对译文生成策略进行细粒度调整,同时大幅降低了策略优化的计算开销.

3 实验设计与数据集

3.1 数据集

在多语种语音翻译数据集MuST⁃C38上开展实验,选取了三个具有代表性的翻译方向:英语→德语(En→De)、英语→西班牙语(En→Es)和英语→法语(En→Fr).为了保证数据质量与训练的稳定性,对原始语料进行了预处理.过滤时长超过30 s或短于0.3 s的语音片段,并对保留样本的音频进行采样率统一和归一化处理.文本部分进行基本清洗与规范化,包括去除异常符号和统一大小写等.在ASR与参考译文外还为每个训练样本构建一组用于课程学习的关键词集合,具体做法是基于对应的语音转写文本,使用DeepSeek⁃v339模型自动抽取名词、动词、形容词和副词等实词作为关键词,以突出句子中的关键信息,有利于模型在早期阶段学习语义骨架.

在第三阶段的GRPO训练中,从训练集中构建一个难度适中的子集.具体地,首先利用第二阶段已训练好的模型在训练集上生成译文,并计算其与参考译文之间的句子级BLEU分数.随后,选取BLEU大于18的样本,并按照BLEU的值从低到高的顺序筛选出8000条数据作为GRPO训练集.这样的样本选择策略能够集中保留既非“极差”也非“几乎完美”的中等难度样本,相比于仅使用高质量或低质量译文,更有利于强化学习阶段稳定地学习到有效的优化信号,提升策略更新的效率与效果.

3.2 模型与实验设置

在Qwen2⁃Audio⁃7B⁃Instruct34,Qwen2.5⁃Omni⁃7B35和Qwen3⁃Omni⁃30B⁃A3B36三个语音大模型上展开实验,其中,Qwen3⁃Omni采用混合专家(Mixture⁃of⁃Experts,MoE)结构,模型总参数规模为30 B,A3B表示其每次前向推理时激活的参数量约为3 B.对每个底座模型,首先在不引入分阶段训练策略的条件下对其进行端到端监督微调,使模型直接学习从源语音到目标译文的映射,并以此作为该底座模型对应的基线,在此基础上再依次开展阶段一至阶段三的训练.包括基线模型和后续各阶段训练在内,全部训练均采用LoRA (Low⁃Rank Adaptation)进行参数高效微调,秩为8,缩放参数为16,dropout为0.1,以所有可适配线性层作为注入目标.训练批量为2,梯度累计步数为16,训练轮数为3.优化器采用AdamW,初始学习率为5e-5,配合0.1 warmup比例的余弦退火学习率调度策略,以缓解训练初期的不稳定.训练过程中均开启fp16混合精度,以加速计算.

受参数规模差异的影响,对7 B级别与30 B级别模型采用不同的硬件配置.两个7 B模型(Qwen2⁃Audio⁃7B⁃Instruct与Qwen2.5⁃Omni⁃7B)在两块NVIDIA Tesla V100⁃SXM2 32 GB GPU上完成训练.由于Qwen3⁃Omni⁃30B⁃A3B的总参数规模显著增大,在八块NVIDIA L40 GPU上完成训练,每块L40基于NVIDIA Ada Lovelace架构,配备48 GB GDDR6显存,可以满足30 B级别MoE模型在LoRA微调下的显存与算力需求.

本研究探索通过分阶段训练与策略优化来改善语音大模型在端到端语音翻译任务中的训练稳定性与跨语言生成质量,而不是追求绝对性能的最优.考虑到现有端到端语音翻译方法在模型架构、参数规模及训练数据条件上与本文存在本质的差异,直接的数值对比难以公平地反映各方法的实际贡献,因此,在三个底座模型上均以其直接监督微调的结果作为各自的基线.在控制底座模型与训练数据不变的前提下,重点考察分阶段训练策略各阶段的方法贡献.

3.3 评测指标

在翻译质量的评估过程中,采用两种具有代表性的自动评价指标:BLEU37和COMET40(本研究使用wmt22⁃comet⁃da版本).BLEU通过比较候选译文与参考译文的词汇重叠来衡量表层匹配程度;COMET基于神经网络模型,从语义维度评价译文的充分性和流畅性.所以,BLEU更注重形式一致性,COMET更关注语义质量.二者结合可互补优势,既反映词汇层面的准确度,也揭示译文的语义表现与可读性.

4 实验结果与分析

4.1 主要实验结果

表1给出了本文方法在 MuST⁃C三个翻译方向上的主要实验结果,表中每个单元格以“BLEU/COMET”的形式报告结果,黑体字表示在三个基座模型各自的训练设置中取得的相对基线最优结果,突出同一基座模型内部不同训练阶段之间的性能差异.

表的上半部分列出了ConST26,CRESS41,FuseST⁃FT42,M³ST43,LST⁃7B29,LST⁃13B29和MoLoRA44等已有的端到端语音翻译方法,提供当前相关工作的性能参照.需要说明的是,已有方法多数只报告BLEU指标,没有给出COMET结果,因此表中的相应位置以“-”表示.同时,部分原文结果仅保留小数点后一位,本文为保持表格格式统一,将其补足为两位小数,例如,将28.3记为28.30.该处理仅涉及显示精度,不改变原始实验结果.

表1的下半部分展示了在Qwen2⁃Audio⁃7B,Qwen2.5⁃Omni⁃7B和Qwen3⁃Omni⁃30B⁃A3B三个语音大模型上的实验结果.对每个基座模型,均设置直接端到端监督微调作为基线,并在相同训练数据和相同模型结构的基础上,依次加入阶段一、阶段二和阶段三训练.因此,表1的下半部分主要反映不同模型体系下的性能位置.而验证本文方法有效性的关键,在于同一基座模型内部不同训练阶段之间的对比.

从同一基座模型内部的结果来看,分阶段训练在三个语言方向上均带来了稳定收益.阶段一只执行关键词预测与ASR转录预测,不直接生成最终译文,因此不在主表中单独报告,而是作为阶段二的初始化过程.经过“Stage1&2”训练后,三个基座模型在BLEU和COMET上均优于各自的端到端基线.表明在直接语音到译文的训练目标之外,引入关键词和ASR转录等源端辅助监督,能够为模型提供更明确的语义中间结构,缓解声学建模、语义理解与跨语言生成在同一目标下高度耦合带来的优化困难.尤其对于端到端语音翻译,模型并不仅需要学习词面映射,还需要先从连续语音信号中恢复稳定的语义内容.分阶段训练先建立源端表示,再过渡到目标语言生成,使训练过程更加可控.

在阶段二的基础上继续引入GRPO策略优化后,模型性能进一步提升.与“Stage1&2”相比,“Stage1&2&3”在三个基座模型和三个语言方向上均保持了更高的BLEU或COMET表现,说明基于译文子序列的序列级奖励进一步校正了监督学习阶段得到的模型.交叉熵训练关注局部词元级拟合,BLEU奖励直接作用于完整译文序列,有助于模型在生成阶段形成更符合翻译评价目标的输出偏好.由于阶段三是在已经较强的监督模型基础上进行策略层面的细化调整,其增益幅度相对温和,但这种持续、稳定的提升说明策略优化与前两阶段训练之间具有较好的互补性.

进一步比较不同基座模型可以发现,模型规模和基础能力仍然对最终BLEU表现具有重要影响.Qwen3⁃Omni⁃30B⁃A3B在三个方向上的BLEU整体最高,说明更强的语音理解和语言生成能力可以为端到端语音翻译提供更高的性能上限.不过,BLEU与COMET并不总是呈现完全一致的跨模型排序.例如,Qwen2⁃Audio⁃7B经过三阶段训练后,平均BLEU仍明显低于Qwen2.5⁃Omni⁃7B,但其平均COMET超过了Qwen2.5⁃Omni⁃7B的端到端基线和“Stage1&2”结果.说明较低的词面重合度并不必然对应较差的语义质量,本文方法对译文语义充分性和可读性的改善在COMET指标上体现得更加明显.因此,在分析不同模型表现时,不能仅依据BLEU进行单一排序,而应结合BLEU与COMET分别考察词汇匹配和语义质量.

从语言方向上看,En→De,En→Es和En→Fr三个方向均呈现相似的变化趋势,端到端基线经过分阶段监督训练后得到提升,随后通过GRPO策略优化继续改善.不同语言方向之间不存在某一方向单独失效的情况,表明该训练框架不是只对特定的目标语言有效,而是在不同目标语言条件下均能稳定发挥作用.实验结果证明,提出的“源端辅助建模⁃完整翻译训练⁃译文级策略优化”流程能为端到端语音翻译提供更平滑的优化路径,使模型逐步完成从语音感知、语义组织到跨语言生成的能力迁移,并在词汇准确性、语义充分性和译文流畅性方面取得稳定改进.

4.2 分析实验

为了系统评估本文提出的分阶段训练框架的有效性,并进一步分析其性能来源与计算成本,在英语➝德语(En→De)方向上进行了多组分析实验,从方法机制与工程开销两个层面展开分析.对于方法机制,以Qwen2⁃Audio⁃7B模型为基础模型,分别考察关键词引导机制、课程学习策略、混合中间表示数据以及第三阶段奖励函数设计对语音翻译性能的影响.对于工程开销,比较不同模型在各训练阶段的训练时间、硬件配置与性能收益.通过对比不同实验设置下的模型表现,结合BLEU,COMET以及阶段性训练耗时等指标,分析各设计选择对最终翻译质量与训练效率的影响.

4.2.1 关键词引导机制的作用

在分阶段框架中,关键词引导机制通过为模型提供额外的语义提示,帮助其更准确地捕捉句子主题与关键实体信息.由于第一阶段与第二阶段是联合执行的,因此,设置了两条并行的训练流程以进行公平比较,一条在两个阶段均引入ASR结果与关键词信息,另一条仅使用ASR结果.除关键词外,其余超参数和训练设置保持一致.

表2展示了引入关键词对模型的语音翻译性能的影响.由表可见,引入关键词后,模型的BLEU和COMET指标均出现了稳定的提升,虽然数值增幅相对温和,但在不同随机种子与训练轮次下均能复现这一趋势,说明关键词在译文生成过程中确实为模型提供了有用的语义线索.具体地,模型在带有关键词引导的设置下,对专有名词和领域术语的译法更一致,对句子主题的把握也更加明确,译文在语义延续和语气控制方面更平滑.在语义结构较复杂或源语与目标语在语序上差异较大的句子中,关键词能显著减轻信息遗漏与错误聚焦的问题,使模型更容易集中在句子的关键信息上,改善整体翻译质量.

4.2.2 课程学习的作用

为了评估课程式学习策略的贡献,比较了包含与不包含第一阶段训练的两组模型,即是否使用课程学习的方式训练.在包含第一阶段的设置中,模型首先在中间表示ASR结果与关键词上进行训练,然后在第二阶段过渡到完整的翻译任务.在不包含第一阶段的设置中,模型直接在翻译任务上进行训练.

表3展示了课程式学习对模型性能的贡献.由表可见,引入第一阶段后,模型的BLEU与COMET指标均有不同程度的提升,说明逐步引入任务难度有助于模型构建更合理的表示空间与优化路径.在先学习中间表示的过程中,模型优先建立了语音到词序列的映射以及对关键词的语义解读,获得了较为稳固的词汇与短语层知识基础.在此基础上再进行端到端翻译训练时,模型不必同时处理所有难点,训练过程更加稳定,梯度震荡减弱,收敛速度也更为可控.

4.2.3 混合辅助任务标签的影响

在第二阶段训练中进一步考察自动生成辅助任务标签与人工标注辅助任务标签的混合比例对模型性能的影响.具体地,自动生成标签是由第一阶段模型生成的ASR和关键词,人工标注标签是由人工标注或人工构造得到的语音转写与关键词.为了分析不同噪声暴露程度对第二阶段翻译学习的影响,设置自动生成标签比例分别为0,25%,50%,75%和100%,其中,0表示仅使用人工标注辅助任务标签,100%表示完全使用第一阶段模型自动生成的辅助任务标签.除了混合比例外,其余训练配置保持一致,以尽可能排除其他因素对实验结果的影响.

表4展示了第二阶段中不同辅助任务标签混合比例对语音翻译性能的影响,表中黑体字表示性能更优.由表可见,仅使用人工标注辅助任务标签时,模型取得了最高的BLEU分数,说明人工标注的ASR和关键词能够提供更稳定、准确的中间监督信号,有利于生成与参考译文词面更接近的译文.随着自动生成标签比例的增加,BLEU指标整体出现轻微波动并略有下降,表明第一阶段模型预测中可能存在的识别误差和关键词偏差,会在一定程度上影响译文与参考译文之间的n⁃gram词面匹配.

与BLEU指标不同,COMET指标在引入自动生成标签后整体有所提升,并在50%自动生成标签与50%人工标注标签的配置下取得最高的数值.说明适度引入由第一阶段模型生成的中间表示,可以使第二阶段模型在训练过程中接触到更接近推理阶段的中间表示分布,增强其在非完美关键词和ASR条件下保持语义完整性的能力.当自动生成标签比例进一步提高到75%或100%时,COMET没有继续提升,说明过高比例的自动生成标签可能引入更多中间表示噪声,削弱了人工标注信号带来的稳定监督作用.

因此,50%人工标注标签与50%自动生成标签的配置虽然没有取得最高的BLEU,但在COMET上表现最好,并在词面匹配和语义鲁棒性之间取得了较好的折中.由于本文更关注端到端语音翻译在真实推理场景下的稳定性与语义生成质量,本文将50%自动生成标签与50%人工标注标签作为第二阶段的默认混合策略.

为了更直观地说明混合标签策略对BLEU和COMET的不同影响,表5给出了一个具体实例.表中黑体字表示与源语核心语义或参考译文关键内容相对应的表达,用于突出不同译文在词面匹配和语义保留方面的差异.由表可见,仅使用人工标注辅助标签时,模型译文在“in den Tiefen”“kongolesischen Urwalds”“schwer zu beobachten”等表达上与参考译文更接近,更容易获得较高的BLEU分数.相比之下,在采用“50%人工标注+50%自动生成辅助标签”后,模型译文虽然在“tief im”和“schwer zu erforschen”等表达上与参考译文存在一定词面差异,可能降低了n⁃gram的重合度,但仍然准确保留了“生活在刚果雨林深处”和“难以研究”的核心语义,而且,“erforschen”与源语中的“to study”形成了更直接的语义对应.因此,该译文可能在BLEU略低的情况下获得更高的COMET.该样例说明,混合标签策略可能牺牲了少量的词面匹配,但有助于模型保持源语核心语义.

4.2.4 奖励函数设计的影响

在第三阶段的强化学习过程中,围绕奖励函数的设计比较三种不同配置:一是仅以BLEU作为奖励信号;二是仅以COMET作为奖励信号;三是按照固定权重将BLEU与COMET进行线性组合构成联合奖励.联合奖励中BLEU∶COMET的权重为3∶1,因为本实验设置两者数值尺度的比例大致为1∶3(BLEU约为27,COMET约为82),如果直接相加,容易被数值更大的COMET主导,因此采用与数值尺度相反的3∶1权重,使两种指标在总奖励中的贡献大致均衡.三种配置均在第二阶段训练得到的同一基线模型上继续进行GRPO优化,以便将性能差异尽可能归因于奖励信号本身的不同,而非模型初始状态或训练数据的变化.

表6给出了三种配置在测试集上的BLEU与COMET指标,表中黑体字表示性能更优.由表可见,三种奖励配置在整体水平上都取得了较好的翻译质量,差异主要体现在指标偏好上.以BLEU指标作为唯一奖励时,BLEU的得分最高,COMET的得分也保持在较高水平.以COMET指标作为唯一奖励时,COMET的得分略高于BLEU的得分,但BLEU的得分有一定幅度的下降.在3∶1的线性组合奖励下,BLEU的得分位于前两种情形之间,而COMET的得分略高于单独使用BLEU奖励的情形.整体上,三种配置不存在极为悬殊的优劣,更像是在“词面匹配”与“语义充分性”之间表现出不同的偏好.

在这种情况下,可以将三种奖励视为在本实验条件下均可行的选项:仅使用BLEU的配置获得了相对稳健且与主流自动评测标准一致的结果;仅使用COMET的配置,实验结果略偏向语义充分性,但会牺牲一定的BLEU.联合奖励在两种指标之间提供了一定折中,但其相对优势没有在统计结果上体现出足够稳定的趋势.

考虑到评测体系对BLEU的依赖以及三种方案之间缺乏显著的实质性差异,本研究采用“只使用BLEU”作为第三阶段强化学习的默认奖励形式,而其他奖励配置则可以根据具体应用场景,对形式一致性或语义质量的侧重点进行灵活选取.

4.2.5 计算开销分析

表7展示了En→De方向上不同训练阶段的计算开销与性能增量对比.从整体结果来看,本文提出的分阶段训练策略在性能提升与训练成本之间取得了较好的平衡.在训练流程上,阶段一主要面向ASR转录与关键词预测任务,旨在帮助模型建立基础的声学⁃语义对齐能力.虽然该阶段不直接生成目标语言译文,因此没有单独报告翻译性能增量,但其为后续端到端翻译训练提供了较稳定的中间表示基础.进入阶段二后,模型进一步学习了从语音输入到目标语言译文的映射关系.

实验结果显示,在相同的模型与硬件配置下,阶段二的训练时间与阶段一基本处于同一量级,同时带来了较明显的BLEU和COMET指标的提升,说明通过先学习中间表示再过渡到翻译任务的递进式训练方式,能够在相对可控的计算开销下改善语音翻译性能.

在不同模型规模的对比中,各模型的训练时间受到硬件配置、模型规模以及模型架构等因素的共同影响.虽然Qwen3⁃Omni⁃30B⁃A3B的参数规模更大,但在8×L40 48 GB的硬件配置下,其阶段一与阶段二的墙钟时间均低于采用2×V100 32 GB的7 B模型,说明更高的并行计算资源可以显著缩短实际训练耗时.不过,由于不同模型使用的GPU数量和硬件类型不同,墙钟时间不能完全等价于总计算成本,因此,该结果更适合说明不同配置下的工程训练耗时,而不宜直接作为模型计算效率的严格比较.阶段三中,GRPO训练需要进行多轮采样与策略更新,因此,比阶段一和阶段二具有更高的计算复杂度.这一点在Qwen3⁃Omni⁃30B⁃A3B上表现得更明显,其阶段三耗时占比相对上升.与此同时,阶段三在三个模型上均带来了进一步的BLEU和COMET指标的提升,说明强化学习阶段虽然引入了额外计算开销,但能继续改善模型的翻译质量.

总体上,本文的分阶段训练框架在增加有限额外训练成本的同时,实现了逐阶段的性能提升,体现出较好的工程可行性与性能收益.

5 结论

本文提出一种面向端到端语音翻译的分阶段训练与策略优化方法.不同于简单叠加课程学习、噪声鲁棒训练和强化学习,本文围绕语音大模型的自回归生成特性进行统一设计,将关键词、ASR转录和目标译文组织为结构化输出序列,并将训练过程划分为语音识别、语音翻译和策略优化三个阶段.通过这种由浅入深的训练方式,模型能够先建立较稳定的声学⁃语义对应关系,再逐步过渡到完整的跨语言生成任务,缓解端到端语音翻译中声学建模、语义理解与译文生成目标高度耦合所带来的优化困难.

实验结果表明,本文方法在多个语音大模型和多个语言方向上均取得了稳定的性能提升.分阶段监督训练能够增强模型对源端语义信息的建模能力,混合辅助标签使模型在训练阶段提前接触推理过程中可能出现的中间表示噪声,提升生成鲁棒性.在此基础上,基于GRPO的译文级策略优化进一步改善了模型的生成偏好,使最终译文在词汇匹配、语义充分性和语言流畅性方面获得了更好的表现.这些结果验证了分阶段训练与策略优化相结合对于提升端到端语音翻译质量和训练稳定性的有效性.

后续研究可从以下方面进一步展开.首先,在策略优化阶段仅基于最终译文子序列构建奖励函数,可探索将关键词准确性、ASR转写质量与译文质量纳入统一的多目标奖励框架,以更细致地平衡中间语义表示和最终翻译质量之间的关系.其次,采用固定比例的人工标注与自动生成辅助标签,可进一步设计动态混合策略,例如,在训练初期提高人工标注标签比例以保证监督信号的稳定性,在训练后期逐步增加自动生成标签比例,以增强模型对推理阶段噪声的适应能力.此外,该训练范式还可扩展到更多低资源语言对、不同规模和架构的语音大模型以及流式语音翻译等实时应用场景,进一步验证其普适性与实用价值.

参考文献

[1]

Zhang BHaddow BSennrich R. Revisiting end⁃to⁃end speech⁃to⁃text translation from scratch∥Proceedings of the International Conference on Machine Learning. New York,NY,USA:PMLR,2022:26193-26205.

[2]

Chen Z HHuang HAndrusenko Aet al. SALM:Speech⁃augmented language model with in⁃context learning for speech recognition and translation∥2024 IEEE International Conference on Acoustics,Speech and Signal Processing. Seou,Korea (South):IEEE,2024:13521-13525.

[3]

宗伟,赵悦,李尹,. 端到端语音到语音翻译的优化方法综述. 计算机应用202545(5):1363-1371.

[4]

Hu D YLi J H. Contrastive learning for robust neural machine translation with ASR errors∥Natural Language Processing and Chinese Computing. Cham,Switzerland:Springer,2022:81-91.

[5]

Bentivogli LCettolo MGaido Met al. Cascade versus direct speech translation:Do the differences still make a difference?∥Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics,the 11th International Joint Conference on Natural Language Processing. Volume 1. Long Papers. Stroudsburg,PA,USA:Association for Computational Linguistics,2021:2873-2887.

[6]

Vila L CEscolano CFonollosa J A Ret al. End⁃to⁃end speech translation with the transformer∥VI Iberian Conference on Speech Technologies. Madrid,Spain:IEEE,2018:60-63.

[7]

Dou H XTian X YLyu X Let al. Speech translation refinement using large language models. https://arxiv.org/abs/2501.15090,2025-01-25.

[8]

Han Y CXu CXiao Tet al. Modality adaption or regularization? A case study on end⁃to⁃end speech translation∥Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics. Volume 2. PapersShort. Stroudsburg,PE,USA:Association for Computational Linguistics,2023:1340-1348.

[9]

Gao P ZZhang R QHe Z Jet al. An empirical study of consistency regularization for end⁃to⁃end speech⁃to⁃text translation∥Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Technologies. Volume 1. LongPapers. Stroudsburg,PE,USA:Association for Computa⁃tional Linguistics,2024:242-256.

[10]

X LTang WLi Y Aet al. DoCIA:An online document⁃level context incorporation agent for speech translation. https://arxiv.org/abs/2504. 05122,2025-04-07.

[11]

Lam T KSchamoni SRiezler S. Sample,translate,recombine:Leveraging audio alignments for data augmentation in end⁃to⁃end speech translation∥Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics. Volume 2. PapersShort. Stroudsburg,PE,USA:Association for Computational Linguistics,2022:245-254.

[12]

Lei Y KXue Z SZhao X Het al. CKDST:Comprehensively and effectively distill knowledge from machine translation to end⁃to⁃end speech translation∥Findings of the Association for Compu⁃tational Linguistic. Stroudsburg,PE,USA:Association for Computational Linguistics,2023:3123-3137.

[13]

Shao Z HWang P YZhu Q Het al. Deepseekmath:Pushing the limits of mathematical reasoning in open language models. https://arxiv.org/abs/2402.03300,2024-04-27.

[14]

Saleem SJou S CVogel Set al. Using word lattice information for a tighter coupling in speech translation systems∥Proceedings of the International Conference on Speech and Language Processing. Jeju,Korea (South):International Speech Communi⁃cation Association,2004: 41-44.

[15]

Zhang R QKikui GYamamoto Het al. A decoding algorithm for word lattice translation in speech translation∥Proceedings of the 2nd International Workshop on Spoken Language Translation. Jeju,Korea (South):International Speech Communication Association,2005:23-29.

[16]

Lam T KSchamoni SRiezler S. Cascaded models with cyclic feedback for direct speech translation∥2021 IEEE International Conference on Acoustics,Speech and Signal Processing. Toronto,Canada:IEEE,2021:7508-7512.

[17]

Bahar PBieschke TSchlüter Ret al. Tight integrated end⁃to⁃end training for cascaded speech translation∥2021 IEEE Spoken Language Technology Workshop. Shenzhen,China:IEEE,2021:950-957.

[18]

Anastasopoulos AChiang D. Tied multitask learning for neural speech translation∥Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Technologies. Volume 1. LongPapers. Stroudsburg,PE,USA:Association for Computational Linguistics,2018:82-91.

[19]

Jia YJohnson MMacherey Wet al. Leveraging weakly supervised data to improve end⁃to⁃end speech⁃to⁃text translation∥2019 IEEE International Conference on Acoustics,Speech and Signal Processing. Brighton,UK:IEEE,2019:7180-7184.

[20]

Bahar PZeyer ASchlueter Ret al. On using SpecAugment for end⁃to⁃end speech translation∥The 16th International Workshop on Spoken Language Translation. Hong Kong,China:International Speech Communication Association,2019:134-139.

[21]

Pino JXu Q TMa X Tet al. Self⁃training for end⁃to⁃end speech translation∥The 21st Annual Conference of the International Speech Communi⁃cation Association. Virtual Conference,2020:1476-1480.

[22]

Di Gangi M ANegri MNguyen V Net al. Data augmentation for end⁃to⁃end speech translation∥Proceedings of the 15th International Workshop on Spoken Language Translation. Brussels,Belgium: International Speech Communication Association. 2018:134-141.

[23]

Bérard ABesacier LKocabiyikoglu A Cet al. End⁃to⁃end automatic speech translation of audiobooks∥2018 IEEE International Conference on Acoustics,Speech and Signal Processing. Piscataway,NJ,USA:IEEE Press,2018:6224-6228.

[24]

Wang C YWu YLiu S Jet al. Curriculum pre⁃training for end⁃to⁃end speech translation∥Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Stroudsburg,PE,USA:Association for Compu⁃tational Linguistics,2020:3728-3738.

[25]

Han CWang M XJi Het al.Learning shared semantic space for speech⁃to⁃text translation//Findings of the Association for Computational Linguistics:ACL⁃IJCNLP 2021.Stroudsburg,PE,USA:Association for Computational Linguistics,2021:2214-2225.

[26]

Ye RWang M XLi L. Cross⁃modal contrastive learning for speech translation∥Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Technologies. Stroudsburg,PE,USA:Association for Computational Linguistics,2022:5099-5113.

[27]

Fang Q KYe RLi Let al. STEMM:Self⁃learning with speech⁃text manifold mixup for speech translation∥Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics. Volume 1. LongPapers. Stroudsburg,PE,USA:Association for Computational Linguistics,2022:7050-7062.

[28]

Huang Z CYe RKo Tet al. Speech translation with large language models:An industrial practice. https://arxiv.org/abs/2312.13585,2023-12-21.

[29]

Zhang HSi N WChen Y Qet al. Tuning large language model for end⁃to⁃end speech translation. https://arxiv.org/abs/2310.02050,2023-10-03.

[30]

Ouyang S QXu XDandekar Cet al. Fasst:Fast LLM⁃based simultaneous speech translation. https://arxiv.org/abs/2408.09430,2024-08-18.

[31]

Fathullah YWu C YLakomkin Eet al. Audiochatllama:Towards general⁃purpose speech abilities for LLMs∥Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Technologies. Volume 1. LongPapers. Stroudsburg,PE,USA:Association for Computa⁃tional Linguistics,2024:5522-5532.

[32]

Du Y XPan Y CMa Z Yet al. Making LLMs better many⁃to⁃many speech⁃to⁃text translators with curriculum learning∥Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics. Volume 1. LongPapers. Stroudsburg,PE,USA:Association for Computational Linguistics,2025:12466-12478.

[33]

Kano TSakti SNakamura S. Structured⁃based curriculum learning for end⁃to⁃end English⁃Japanese speech translation∥The 18th Annual Conference of the International Speech Communication Association.Stockholm,Sweden:International Speech Communi⁃cation Association,2017:2630-2634.

[34]

Chu Y FXu JYang Qet al. Qwen2⁃audio technical report. https://arxiv.org/abs/2407.10759,2024-07-15.

[35]

Xu JGuo Z FHe J Zet al. Qwen2.5⁃omni technical report. https://arxiv.org/abs/2503.20215,2025-03-26.

[36]

Xu JGuo Z FHu H Ret al. Qwen3⁃omni technical report. https://arxiv.org/abs/2509.17765,2025-09-22.

[37]

Papineni KRoukos SWard Tet al. BLEU:A method for automatic evaluation of machine translation∥Proceedings of the 40th Annual Meeting on Association for Computational Linguistics.Stroudsburg,PE,USA:Association for Compu⁃tational Linguistics,2002:311-318.

[38]

Di Gangi M ACattoni RBentivogli Let al. Must⁃C:A multilingual speech translation corpus∥Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Tech⁃nologies,Volume 1. Long and Short Papers. Stroudsburg,PE,USA:Association for Compu⁃tational Linguistics,2019:2012-2017.

[39]

DeepSeek⁃AI, Liu A XFeng Bet al. Deepseek⁃v3 technical report. https://arxiv.org/abs/2412.19437,2024-02-18.

[40]

Rei RStewart CFarinha A Cet al. COMET:A neural framework for MT evaluation∥Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing.Stroudsburg,PE,USA:Association for Computational Linguistics,2020:2685-2702.

[41]

Fang Q KFeng Y. Understanding and bridging the modality gap for speech translation∥Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics. Volume 1. LongPapers. Stroudsburg,PE,USA:Association for Compu⁃tational Linguistics,2023:15864-15881.

[42]

Yin W BLiu Z CZhao C Qet al. Improving speech translation by fusing speech and text∥Findings of the Association for Computational Linguistics. Stroudsburg,PE,USA:Association for Computational Linguistics,2023:6262-6273.

[43]

Cheng X XDong Q QYue F Pet al. M3ST:Mix at three levels for speech translation∥2023 IEEE International Conference on Acoustics,Speech and Signal Processing. Rhodes Island,RI,USA:IEEE,2023:1-5.

[44]

Zhang HChen Y QSi N Wet al. MoLoRA:Boosting LLM⁃based end⁃to⁃end speech translation with mixture of low⁃rank experts∥The 40th AAAI Conference on Artificial Intelligence,the 38th Conference on Innovative Applications of Artificial Intelligence,the 16th Symposium on Educational Advances in Artificial Intelligence. Menlo Park,CA,USA:AAAI Press,2026:34683-34691.

基金资助

国家自然科学基金(62376178)

AI Summary AI Mindmap
PDF (784KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/