《计算机工程与应用杂志》发表论文赏析
作者:王玲, 崔志瑜, 黄靖, 王鹏, 白燕娥
单位:长春理工大学 计算机科学技术学院,长春 130022
摘要:在数据获取受限、环境复杂且光照变化大的工业场景中,ViT模型的分类准确率仍有待提高。针对该问题,基于CMT模型提出一种工业图像分类算法。改进Patch Embedding模块,通过添加仿射变换和连续卷积块,提升模型对小数据集的泛化能力;改进CMT Block,提出并行局部特征提取模块,增强模型对局部特征的提取能力,将多头自注意力替换为token交互注意力,提升模型的全局特征表达能力,将深度卷积和通道注意力集成到前馈神经网络中,使模型能够有效地捕获相邻特征;提出特征融合模块,将局部和全局特征融合到一起,丰富特征表示,增强模型在小数据集上的分类性能。在自制灌装桶数据集、公开Car Parts和Tiny ImageNet数据集上的实验表明,改进CMT模型的Top-1 Accuracy较CMT模型提升4.7、6.9和5.2个百分点,Macro F1较CMT模型提升0.057、0.071和0.048,实现了分类精度的提高。
关键词:ViT模型,工业图像分类,CMT模型,注意力,特征融合