《计算机工程与应用杂志》发表论文赏析

刻意伪装场景下的说话人确认

来源:计算机工程与应用杂志2025年第21期北京时间:

作者:覃晓逸, 励泽, 刘东, 李明

单位:1.武汉大学 计算机学院,武汉 430072;2.昆山杜克大学 苏州市多模态智能系统重点实验室,江苏 苏州 215316

摘要:刻意伪装的说话人确认任务的难点在于说话人刻意隐藏自己的身份而改变音色成为其他人。将这一任务视为一人饰演多角的场景,并为此提出了CN-Moives训练集和TheSound-test测试集。CN-Moives数据通过对中文电影中的演员及配音演员进行人物匹配、人脸检测、人脸识别、唇动识别和语音活动片段检测,获取了一人多部戏的多个角色的语音片段。该数据集包含了演员原声和对应的配音演员,利用演员和配音演员为塑造角色而有意改变自己音色的特性,实现了刻意伪装中一人多角数据的采集。同时,利用TheSound节目中配音演员刻意隐藏自身身份不被识破的节目特性,提出刻意伪装场景的测试集TheSound-test。通过联合以上领域挖掘的数据,采用孪生网络建模,在VoxMoives测试集和TheSound-test集上均取得了说话人验证性能的显著提升。

关键词:说话人确认,刻意伪装,孪生网络

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!