《电子与信息学报杂志》发表论文赏析
作者:文泓力, 胡庆浩, 黄立威, 王培松, 程健
单位:1.中国科学院自动化研究所 北京 1001902.中国科学院大学 北京 1000493.北京市遥感信息研究所 北京 100192
摘要:针对传统少样本遥感图像分类方法在特征提取能力、模型泛化性及计算资源消耗等方面存在的不足,该文提出一种基于参数高效微调预训练视觉变换器(ViT)与多模态交叉度量的少样本遥感图像分类方法(EFS-ViT-MM)。该方法首先构建一个低秩高效视觉特征提取器(ELR-ViT),采用前沿预训练Transformers作为骨干网络,并引入低秩参数高效微调策略,以利用其强大的视觉特征提取能力,在大幅降低训练参数量的同时有效抑制了过拟合且提升了其泛化性。其次,为了引入更丰富的语义信息以指导分类,该方法利用多模态大语言模型为支持集样本生成描述性文本,并通过先进的文本嵌入模型将其转换为语义向量,进而通过特征级线性调制(FiLM)将语义向量融入视觉特征中,实现对视觉表征的动态调整。最后,该文设计了一种新颖的交叉注意力度量模块,以替代传统的人工设计距离函数。该模块能够自适应地学习查询图像与多模态增强后的支持集样本之间的相关性,实现更精准的相似度匹配。在NWPU-RESISC45, WHU-RS19, UC-Merced和AID等多个公开遥感数据集上的实验结果表明,相较于基线模型,所提方法在5 way-1shot和5 way-5shot任务上的分类准确率分别提升了4.7%和7.0%,同时可训练参数量显著减少。研究表明,该方法有效融合了预训练大模型的强大能力与参数高效微调技术,并通过多模态信息与交叉注意力机制显著提升了少样本分类性能,为解决遥感领域数据稀缺场景下的图像分类问题提供了一个高效、泛化的新范式。
关键词:少样本学习, 遥感图像分类, 参数高效微调, 多模态学习, 交叉度量
基金资助:国家自然科学基金(62572471, 62341130)