《计算机应用与软件杂志》发表论文赏析
作者:李祯其, 胡尧, 高翔, 温志庆
摘要:针对噪声环境下,基于单模态音频信息的连续语音识别算法抗噪能力较差问题,提出一种基于信息融合的抗噪视听语音识别模型。该网络模型利用注意力机制自主学习音频流和视频流间的对应关系,并通过对从音视频流中所提取的特征进行融合来补充单一模态所缺失的信息,以达到信息间的互补,提高信息利用率,增强鲁棒性。算法效果在 LRS2 数据集上进行验证,结果表明在不同信噪比的加噪环境下,该算法的识别词错误率较其他多个基准模型能取得更优的效果。
关键词:信息融合, 视听语音识别, 噪声环境, 注意力机制, 连续语音, 鲁棒性