《计算机工程与应用杂志》发表论文赏析

融合外部知识增强多模态命名实体识别

来源:计算机工程与应用杂志2025年第23期北京时间:

作者:马裕鹏, 张明, 李志强, 高梓灵

单位:1.武汉工程大学 智能机器人湖北省重点实验室,武汉 430205;2.武汉工程大学 机电工程学院,武汉 430205

摘要:多模态命名实体识别(multi-modal named entity recognition,MNER)旨在利用文本和图像等多种模态信息识别文本中预定义类型的实体。尽管现有方法取得了一定的进展,但仍然面临一些挑战:(1)难以建立统一的表示来弥合不同模态之间的鸿沟。(2)难以实现不同模态之间的高效语义交互。因此,提出了一种融合外部知识增强多模态命名实体识别模型。在模态表示阶段,该模型引入CLIP(contrastive language-image pre-training)模型,利用模型中蕴含的文本和图像先验跨模态知识信息,增强文本和图像的语义表示,弥补模态鸿沟。在模态融合阶段,设计了跨模态交叉注意力机制和跨模态门控机制实现模态信息融合,有效排除图像中的噪声信息,进一步增强语义交互;采用条件随机场(CRF)实现命名实体的识别。所提出的方法在公开数据集Twitter2015和Twitter2017上的F1值分别达到了75.35%和86.18%,证明了该方法的有效性。

关键词:多模态命名实体识别(MNER),CLIP模型,跨模态交叉注意力机制,跨模态门控机制,条件随机场(CRF)

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!