《南京信息工程大学学报·自然科学版杂志》发表论文赏析

基于深度学习的开放场景下声纹识别系统的设计与实现

来源:南京信息工程大学学报·自然科学版杂志2021年第5期北京时间:

作者:郭新,罗程方,邓爱文

单位:郭新,广东交通职业技术学院 机电工程学院, 广州, 510520,罗程方,华南理工大学 自动化科学与工程学院, 广州, 510641,邓爱文,华南理工大学 自动化科学与工程学院, 广州, 510641

摘要:针对现实应用场景中短时语音和混叠有噪声情况下声纹识别准确性低的问题,本文设计了一种改进的基于深度学习的声纹识别算法,提高了声纹识别模型在短时语音和带噪环境下的鲁棒性,并将该模型部署到了嵌入式设备中.本文主要对声纹识别算法的编码层和损失函数进行改进.对于编码层,本文使用了基于差分编码的NeXtVLAD技术,同时对帧级特征中的静态声纹特征和动态声纹特征进行建模.对于损失函数,本文将基于小样本学习框架的余弦-原型损失函数cosine-Prototypical 与附加间隔分类损失函数AM-Softmax 进行融合来训练声纹识别模型,使得模型在特征空间中的同类特征尽可能集聚,异类特征尽可能分离.此外,本文还将声纹识别算法部署在Raspberry Pi平台上,实现了能快速推理的声纹识别系统.实验结果表明:这种改进的声纹识别系统在多种开放场景下,能够实时、准确地完成声纹识别任务,可以达到实际应用的要求.

关键词:深度学习;开放场景;短时语音;声纹识别;差分化编码;NeXtVLAD;树莓派

基金资助:广东省青年创新人才项目(2018GkQNCX005)

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!