《信号处理杂志》发表论文赏析
作者:张汐宇, 陈仙红
摘要:说话人验证是深度学习领域的一项关键任务,旨在根据说话人的声音来验证其身份。加性边际损失(Additive Margin loss, AM loss)和加性角裕度边际损失(Additive Angular Margin loss, AAM loss)是说话人验证中常用的损失函数。这两种方法通过引入边际项,显著提高了同类样本的聚集度。然而,这些方法只考虑了类内距离而忽略了不同类别之间的关系,限制了区分不同说话人的能力。为解决这一缺陷,本文提出一种新的损失函数,称为双加性角裕度边际损失(Double Additive Angular Margin loss, DAAM loss)。DAAM损失为类内角度和类间角度引入边际常数,有效地考虑了类内内聚和类间分离。同时压缩类内距离和扩大类间距离,DAAM损失增强了对说话人嵌入的区分能力,从而提高了性能。为了验证DAAM损失的有效性,我们采用不同损失监督的说话人验证模型Xvector和Extended-Xvector(Evector)来提取说话人嵌入信息,在广泛使用的Voxceleb1和Voxceleb2数据集上进行了大量的实验。此外,我们分析了不同损失函数监督模型得到的说话人嵌入的平均类内和类间距离。实验结果表明,DAAM损失在相等错误率(equal error rate, EER)、最小检测代价函数(minimum Detection Cost Function, minDCF)以及类间距离和类内距离比值方面优于AM损失和AAM损失。DAAM损失有效地最大化了不同说话人之间的距离,同时令同一说话人的样本保持紧凑,从而增强了说话人嵌入的区分能力。总之,本文提出了双加性角裕度边际损失(DAAM loss)。DAAM损失考虑了类内和类间关系,增强了类可分性,提高了验证性能,使说话人验证模型能够学习到更有鉴别性和鲁棒性的说话人表示。在Voxceleb1和Voxceleb2数据集上使用Xvector和Evector模型进行了广泛的实验,验证了DAAM损失的有效性,展示了其在推进说话人验证领域最先进技术方面的潜力。提出的DAAM损失有助于开发更准确和鲁棒的说话人验证系统,为该领域的未来研究铺平了道路。
关键词:说话人验证, 深度学习, 度量学习