《计算机工程与应用杂志》发表论文赏析
作者:康宇, 郝晓丽
单位:太原理工大学 计算机科学与技术学院,太原 030000
摘要:细粒度视觉分类方法的核心是定位图像中的判别区域。现有研究通过利用与改进视觉Transformer方法增强了判别区域特征的远距离依赖关系,但是大多数方法仅局限于增强显著判别区域的注意力,忽略了次显著的判别区域中可以联合提取的特征信息,导致具有相似局部特征的不同类别区分难度大,分类准确率较低。因此,提出了一种联合判别区域的提取特征方法,在自注意力模块的前端划分特征图的候选判别区域,引导模型提取不同显著程度的判别区域特征;通过双线性融合自注意力模块对多个不同显著程度的判别区域进行联合特征的提取,获取更加全面的判别区域特征信息。实验结果表明,引入联合判别区域方法的视觉Transformer网络在CUB-200-2011数据集上的准确率达92.7%,较标准视觉Transformer方法提升了2.4个百分点,并且在其余的基准数据集上均超越了当前最优的细粒度视觉分类方法。
关键词:细粒度视觉分类,判别区域,视觉Transformer,自注意力机制