《计算机工程与应用杂志》发表论文赏析

一种多任务学习的跨模态视频情感分析方法

来源:计算机工程与应用杂志2023年第12期北京时间:

作者:缪裕青, 董晗, 张万桢, 周明, 蔡国永, 杜华巍

单位:1.桂林电子科技大学 计算机与信息安全学院,广西 桂林 541004;2.桂林电子科技大学 广西图像图形与智能处理重点实验室,广西 桂林 541004;3.桂林航天工业学院 工程综合训练中心,广西 桂林 541004;4.仲恺农业工程学院 信息科学与技术学院,广州 510225;5.桂林海威科技股份有限公司,广西 桂林 541004;6.桂林电子科技大学 广西可信软件重点实验室,广西 桂林 541004

摘要:针对现有跨模态视频情感分析模型中模态融合不充分、空间复杂度较高以及较少考虑说话人本身属性对情感影响等问题,提出了一种结合多头注意力与多任务学习的跨模态视频情感分析模型。对视频进行预处理,得到视频、音频、文本三个模态的特征表示。将得到的特征表示分别输入到GRU网络以提取时序特征。利用所提出的最大池化多头注意力机制,实现文本与视频、文本与音频的两两融合。将融合后的特征输入到情感分类与性别分类多任务网络得到说话人的情感极性与性别属性。实验结果表明,所提模型能够较好地利用模态间的差异信息与说话人性别属性,在有效提升情感识别准确率的同时降低了模型的空间复杂度。

关键词:视频情感分析,模态融合,多头注意力,多任务学习,模型复杂度

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!