《计算机技术与发展杂志》发表论文赏析
作者:李珍;毋涛
单位:1. 西安工程大学 计算机科学学院,陕西 西安 710048;2. 西安工程大学 计算机科学学院 纺织服装智能信息服务研究所,陕西 西安 710048
摘要:针对文本生成图像任务中多阶段生成器之间语义纠缠以及生成图像与文本描述不一致、图像细节模糊等问题,提出了利用 BERT 文本嵌入的视觉文本融合生成对抗网络(BVT-GAN)模型。 首先,利用 BERT 模型在 NLP 任务中的优秀文本编码与强泛化能力深度匹配文本语义。 然后,增加门机制注意力模块,衡量每个单词特征对于图像区域的贡献程度来分配权重。 最后,使用视觉文本融合模块(VFTBlock),将多粒度文本信息通过并行仿射变换与视觉特征进行融合,生成纹理更加丰富、目标物体边缘更加清晰的图像。 实验结果表明,相比于基准模型 AttnGAN,在 CUB 和 COCO 数据集上该模型的 IS 性能提升了 10. 3% 和 19. 4% ,FID 指标分别降低了 8. 17 和 3. 77。 同以往方法相比,该模型在视觉保真度和与输入文本描述的对齐方面具有显著的优势。
关键词:文本生成图;生成对抗网络;BERT嵌入;视觉文本融合;门控注意力