《计算机应用杂志》发表论文赏析
作者:黄文娜, 彭亚雄, 贺松
单位:贵州大学 大数据与信息工程学院, 贵阳 550025
摘要:为了改善发声力度对说话人识别系统性能的影响,在训练语音存在少量耳语、高喊语音数据的前提下,提出了使用最大后验概率(MAP)和约束最大似然线性回归(CMLLR)相结合的方法来更新说话人模型、投影转换说话人特征。其中,MAP自适应方法用于对正常语音训练的说话人模型进行更新,而CMLLR特征空间投影方法则用来投影转换耳语、高喊测试语音的特征,从而改善训练语音与测试语音的失配问题。实验结果显示,采用MAP+CMLLR方法时,说话人识别系统等错误率(EER)明显降低,与基线系统、最大后验概率(MAP)自适应方法、最大似然线性回归(MLLR)模型投影方法和约束最大似然线性回归(CMLLR)特征空间投影方法相比,MAP+CMLLR方法的平均等错率分别降低了75.3%、3.5%、72%和70.9%。实验结果表明,所提出方法削弱了发声力度对说话人区分性的影响,使说话人识别系统对于发声力度变化更加鲁棒。
关键词:说话人识别,发声力度,最大后验概率,最大似然线性回归,约束最大似然线性回归
基金资助:贵州省社会攻关计划项目(黔科合SY字[2013]3105号);贵州省工程技术研究中心建设项目(黔科合G字[2014]4002号)。