《信号处理杂志》发表论文赏析

基于Whisper的藏语方言语音识别研究

来源:信号处理杂志 2025年第12期北京时间:

作者:马立克, 李冠宇

摘要:尽管Whisper语音大模型基于68万小时多语种语料进行训练,但其原生架构并未涵盖藏语语音识别任务。直接采用模型自带的微调方法进行藏语语音识别任务的训练,仍面临以下问题: (1)共享表征空间被英语等高资源语言主导,导致模型对藏语特性的学习不足;(2)模型自带的字节码编码将藏文音节无差别拆分,造成字符结构断裂与语义信息丢失;(3)藏语语料训练数据稀缺,模型难以充分习得藏语语言规律;(4)藏语各方言使用同一套文字体系,在多方言混合训练时难以区分音节在不同方言中的发音差异,产生严重的跨方言混淆,导致识别错误率上升。为此,本文提出一种在Whisper多语种预训练框架下改进的藏语方言语音识别方法,旨在促使模型学习方言间的共性与差异,以提升模型在不同方言场景下的识别鲁棒性与精度。首先,本文构建藏语字节对编码(Byte Pair Encoding, BPE)模型,并通过引入不同建模单元(如字母、BPE与音素)来扩展Whisper词表,系统比较不同编码策略对模型最终识别效果的影响;其次,在模型原有语音识别任务的基础上引入方言判别辅助机制,增强模型对藏语方言的区分能力;最后,结合对识别结果的分析,引入外部语言模型使用重打分以及浅融合的方式来提升模型的解码结果,进一步提升音频和文本一致性。实验结果表明,相较于模型直接全参微调,采用本方法并基于BPE-100建模单元对模型进行微调,同时引入语言模型优化解码结果,字符错误率(Character Error Rate, CER)可由45.80%降至9.56%。同时模型对藏语长序列文本的处理能力提升,最大可处理序列长度为原来的3倍。

关键词:语音识别, 藏语, Whisper, 建模单元, 低资源

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!