《计算机技术与发展杂志》发表论文赏析
作者:步寅硕;;仁增多杰;;格桑加措;;拉毛吉;;尼玛扎西;
单位:1. 西藏大学 信息科学技术学院,西藏 拉萨 850000;2. 西藏自治区藏文信息技术人工智能重点实验室,西藏 拉萨 850000;3. 藏文信息技术教育部工程研究中心,西藏 拉萨 850000
摘要:语音翻译在跨语言交流中具有重要意义,它能够消除语言障碍,实现不同语言间的即时沟通。 传统的级联式 S2ST系统存在错误复合和延迟较高的问题。 相比之下,端到端模型通过简化处理流程,有效减少延迟并提升翻译准确性。 目前,端到端语音翻译的研究主要集中在高资源语言对,而在低资源语言对,尤其是藏汉语音翻译领域缺少相关研究成果。针对该问题,该文提出一种端到端藏汉语音翻译方法。 该方法首先引入基于声学特征扰动增强方法的语音数据增强技术,解决藏汉语音翻译数据资源匮乏的问题。 其次,引入双边扰动技术对 Hubert 模型进行微调,通过风格归一化和信息增强阶段减少声学多模态对翻译的影响。 再次,引入 S2UT(Speech-to-units)模型实现源语言语音到目标语言离散单元的转换,以解决 Mel-spectrogram 映射中存在的语言内容与声学特征混淆的问题。 最后,在模型中加入目标语言的语音识别辅助任务,通过联合解码提高语音翻译性能。 实验结果显示在藏语-汉语语音翻译任务中,BLEU 分数相比基线模型提升了 12. 61,验证了该模型在低资源多模态语言对下的有效性。
关键词:端到端;语音翻译;低资源;藏语;Hubert