《计算机技术与发展杂志》发表论文赏析

基于双信息流Transformer的图像描述生成

来源:计算机技术与发展杂志2025年第01期北京时间:

作者:范小瑞;张晓滨

摘要:针对图像描述生成中由于视觉信息不足,模型会忽略背景信息,并且难以准确捕捉目标之间的相对位置关系,导致生成的句子未能准确、完整地描述图像中的场景问题,提出了一个针对图像描述领域的双信息流 Transformer 模型(DIFTN)。 首先,该网络将图像的全景分割特征作为另一个视觉信息源,以增强视觉特征对背景信息的贡献;其次,在网格流 Transformer 编码器中添加卷积位置学习(CPL)模块,利用卷积和自注意力的优势,补偿信息丢失。 最后,在解码器中增加一个自适应交叉注意力融合模块,用于计算上述两种类型的视觉特征和描述句子之间的关系。 为了验证该方法的有效性,将模型与目前广泛使用的 Up-Down 模型、M2 Transformer 模型、RSTNet 模型、VAT 模型、PGT 模型和 Tri-RAT 模型在MSCOCO 数据集上进行对比实验,结果表明,DIFTN 模型的 BLEU-1、METEOR、CIDEr 和 SPICE 评价指标分数更高,分别达到了 81. 5、29. 5、134. 1、23. 3。

关键词:图像描述;双信息流Transformer;全景分割;卷积位置学习;交叉注意力融合

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!