《电子与信息学报杂志》发表论文赏析
作者:杨颖, 杨艳秋, 余本功
单位:1.合肥工业大学管理学院 合肥 2300092.合肥工业大学过程优化与智能决策教育部重点实验室 合肥 2300093.智能决策与信息系统技术教育部工程研究中心 合肥 230009
摘要:在人机交互的闲聊型对话中,准确理解用户多模态意图有助于机器为用户提供智能高效的聊天服务。当前的用户多模态意图识别方法面临着跨模态信息交互性与模型不确定性的挑战。该文提出一种基于Transformer的可信多模态意图识别方法。考虑用户意图表达时的文本、视频和音频等数据的异质性,通过模块特定编码模块,生成单模态特征视图;为了捕捉跨模态间的互补性和长距离依赖性,通过跨模态交互模块,生成跨模态特征视图;为了降低模型的不确定性,设计一个多视图可信融合模块,考虑每个视图的可信度进行主观意见的动态融合,基于主观意见的Dirichlet分布,设计一种组合优化策略进行模型训练。最后在多模态意图识别数据集MIntRec上进行实验。实验结果表明,与基线模型相比,该文方法在准确率和召回率上分别提升了1.73%和1.1%。该方法不仅能够提升多模态意图识别的效果,而且能够对每个视图预测结果的可信度进行度量,提高模型的可解释性。
关键词:意图识别, 多模态融合, 多视图学习
基金资助:国家自然科学基金(72071061)