《计算机应用与软件杂志》发表论文赏析
作者:孟繁聪, 徐伟, 李海波, 吴闻, 郑骏杰, 陈兴
摘要:针对当前已有模型缺乏对图像局部细节的关注以及趋向于通用型描述问题,提出一种采用融合编码器和视觉关键词搜索技术的图像中文描述方法。构建融合编码器,在一个卷积神经网络(CNN)中同时提取图像的局部和全局特征,丰富长短时记忆网络(LSTM)解码的语义信息;针对图像描述一般性表达,采用基于 CNN 的图像检索方法查找潜在视觉词汇,用于词向量解码;引入强化学习机制,在 CIDEr 评估指标上做句子层面上的优化,用以提高图像描述的词汇多样性。实验结果验证了所提方法的有效性。
关键词:图像中文描述, 编解码结构, 注意力机制, 图像检索, 强化学习