《计算机技术与发展杂志》发表论文赏析
作者:肖华兴;马丽丽;陈金广
摘要:文本引导的图像检索是将查询图像与文本条件集成为多模态查询。 现有的方法通过构建更先进的细粒度度量学习来提升性能,但这可能会使模型在文本条件不够精确的情况下对目标图像过拟合,并使得检索结果特征单调。 针对该问题,提出了基于特征增强和多粒度匹配的文本引导的服装图像检索方法。 首先,根据目标特征的分布,产生服从正态分布的噪声,使其产生小幅度的类内抖动;然后,根据目标特征的波动对增强特征施加约束,波动越大,则对增强特征的惩罚越大,由此得到粗粒度匹配损失;最后,优化学习策略,使用随着训练迭代不断衰减的动态权重将粗粒度与细粒度损失进行统一。 通过该方法降低模型对潜在目标图像的排斥,提高特征识别的多样化。 在两个公开服装数据集 FashionIQ 和Shoes 上的大量实验表明,该方法能够提高召回率,并且检索结果更丰富。
关键词:文本引导;图像检索;特征增强;多粒度匹配;多模态融合