《计算机工程与应用杂志》发表论文赏析
作者:赵博文, 马廷淮
单位:南京信息工程大学 软件学院,南京 210044
摘要:研究聚焦于多模态输入数据的核心语义分析,旨在生成融合多模态信息的文本摘要,并挑选出与文本摘要最为契合的图片作为图片摘要。当前多模态摘要领域面临两大挑战:一是文本与图片间语义相关性的量化难题,阻碍了跨模态共有关键语义的挖掘;二是源模态数据冗余度高,导致摘要内容难以精准聚焦关键信息。为应对这些挑战,创新性地提出了一种基于图片目标锚点引导的多模态图文摘要模型(multi-modal summarization model with image anchor guidance,MSM-AG)。该模型构建图片锚点选择机制,确定图片中的关键目标锚点,并据此将文本与图片模态样本划分为积极与消极两类;利用对比学习方法深化这两类样本的区分度,精选出与文本摘要高度匹配的图片摘要。在HCSCL多模态新闻数据集上的广泛实验证明,MSM-AG模型在多项文本摘要评估指标上均展现出优于现有多模态摘要模型的性能,有效解决了多模态摘要中的关键问题。
关键词:多模态摘要,图片目标锚点,对比学习,语义挖掘