《南京信息工程大学学报·自然科学版杂志》发表论文赏析

开放场景下短时语音说话人识别系统的优化设计

来源:南京信息工程大学学报·自然科学版杂志2023年第5期北京时间:

作者:郭新,邓爱文,罗程方,邓飞其

单位:郭新,广东交通职业技术学院 机电工程学院, 广州, 510650,邓爱文,华南理工大学 自动化科学与工程学院, 广州, 510641,罗程方,华南理工大学 自动化科学与工程学院, 广州, 510641,邓飞其,华南理工大学 自动化科学与工程学院, 广州, 510641,aufqdeng@scut.edu.cnis_first_author:0,is_contact_author:,sequence:4,first_name:,middle_name:,last_name:,resume:,institute_superscript:

摘要:为适应开放场景下说话人识别短时语音的应用需要,本文对说话人识别模型进行优化,提升了模型的准确率和鲁棒性.为了实现对重要频率特征的筛选,提出基于重加权的特征增强层及网络,起到增强特征表达的作用.将人脸识别领域的误分类样本损失函数首次引入到说话人识别领域,提高对困难样本的挖掘能力.提出基于误分类样本挖掘的分类损失与基于小样本学习框架的余弦角度原型损失的组合损失函数,解决了分类损失函数与说话人识别实际评测需求不匹配和度量函数对采样策略依赖性强的问题.实验结果显示,与基准模型相比,性能指标等误率(EER)降低12.45%,最小检测代价函数(minDCF)降低14.09%,取得现有说话人识别领域的优异效果.

关键词:说话人识别;重加权;特征增强层;分类损失函数;度量损失函数

基金资助:广东省普通高校特色创新类项目(2022KTSCX258,2021KTSCX224);广州市基础研究计划(202002030476);广东交通职业技术学院项目(GDCP-ZX-2021-004-N1)

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!