《计算机工程与应用杂志》发表论文赏析
作者:郭世松, 杨启萌, 闫远播, 何晓宇
单位:1.新疆大学 软件学院,乌鲁木齐 830099;2.新疆大学 计算机科学与技术学院,乌鲁木齐 830017
摘要:多模态隐喻检测依赖非文本模态的信息补充文本模态,而当前检测模型往往过于关注文本模态,忽略了视觉模态在捕捉隐喻语义中的关键作用,并且缺乏有效的模态交互融合策略。为解决上述问题,提出了一种基于交替主导模态内在相关性的多模态深度神经网络模型(alternating dominant modalities intrinsic correlation,ADMIC)。该模型在文本模态和图像模态间交替指定主导模态,通过调整主导模态的方式,充分挖掘两种模态的内在关联与互补特性,实现隐喻信息的双向交互融合。与固定主导模态的融合方法相比,交替主导模态策略能够更灵活地适应隐喻语义在不同模态间的分布,提高了隐喻检测的性能和泛化能力。设计了多级融合策略,进一步提升了模态融合的效果。在Met-meme数据集上的实验结果表明,ADMIC在英文、中文及双语数据集上的F1-score分别提升了1.32、3.15和2.29个百分点,显著优于传统方法。实验结果验证了该模型在捕捉隐喻语义方面的优势,同时在多模态讽刺数据集上的良好表现也证明了其泛化能力。
关键词:多模态,隐喻检测,特征融合,注意力机制,Met-meme