《计算机工程与应用杂志》发表论文赏析

细粒度图像分类上Vision Transformer的发展综述

来源:计算机工程与应用杂志2024年第10期北京时间:

作者:孙露露, 刘建平, 王健, 邢嘉璐, 张越, 王晨阳

单位:1.北方民族大学 计算机科学与工程学院,银川 750021;2.北方民族大学 图像图形智能处理国家民委重点实验室,银川 750021;3.中国农业科学院 农业信息研究所,北京 100081

摘要:细粒度图像分类(fine-grained image classification,FGIC)一直是计算机视觉领域中的重要问题。与传统图像分类任务相比,FGIC的挑战在于类间对象极其相似,使任务难度进一步增加。随着深度学习的发展,Vision Transformer(ViT)模型在视觉领域掀起热潮,并被引入到FGIC任务中。介绍了FGIC任务所面临的挑战,分析了ViT模型及其特性。主要根据模型结构全面综述了基于ViT的FGIC算法,包括特征提取、特征关系构建、特征注意和特征增强四方面内容,对每种算法进行了总结,并分析了它们的优缺点。通过对不同ViT模型在相同公用数据集上进行模型性能比较,以验证它们在FGIC任务上的有效性。最后指出了目前研究的不足,并提出未来研究方向,以进一步探索ViT在FGIC中的潜力。

关键词:细粒度图像分类,Vision Transformer,特征提取,特征关系构建,特征注意,特征增强

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!