《计算机工程与应用杂志》发表论文赏析
作者:关佳琪, 黄丽霞, 张雪英
单位:太原理工大学 电子信息工程学院,太原 030024;
摘要:对于多模态语音情感识别中存在的时序动态建模、多模态融合问题,提出一种基于改进异构图卷积网络(improved heterogeneous graph convolutional network,IHGCN)的多模态语音情感识别方法。通过对语音、文本及视频模态的特征提取,构建历史边、当前边、未来边与跨模态边共同组成异构图结构,以增强对情感动态演化感知能力;结合自适应边权重学习机制,实现不同边类型在情感识别中的贡献权重;采用二阶GraphSAGE聚合策略,增强长距离情感依赖性能,实现多模态情感信息的高效融合。实验结果表明,改进的异构图网络通过细粒度的时序边建模、动态权重调整和二阶聚合,在IEMOCAP和MELD数据集上的准确率(ACC)分别达到73.01%和68.01%,F1分数为72.95%和66.71%,较主流基线模型(如IMDNet、DER-GCN)在IEMOCAP上提升1.23~3.31个百分点(Acc)和1.22~3.55个百分点(F1),在MELD上提升0.46~1.21个百分点(Acc)和0.61~0.62个百分点(F1)。
关键词:多模态语音情感识别(MSER),异构图卷积网络,时序动态建模,自适应边权重学习
基金资助:国家自然科学基金(62271342,62201377);山西省基础研究计划项目(202203021211174)。