《计算机技术与发展杂志》发表论文赏析
作者:俞焕友;范?静*;黄?凡
单位:1. 上海第二工业大学 计算机与信息工程学院,上海 201209;2. 上海第二工业大学 数理与统计学院,上海 201209;3. 华为技术有限公司 云核心网研究部,江苏 南京 210012
摘要:针对 Vision Mamba(Vim)模型的局限性,该文提出了一种改进的模型———Convolutional Vision Mamba(CvM)。此模型通过摒弃Vim中的图形切割和位置编码机制,转而采用卷积操作进行替代,以实现对全局视觉信息的更高效处理。同时,此模型对Vim模型中的位置嵌入模块进行了优化,以解决其固有的高计算量和内存消耗问题。进而,该文将CvM模型应用于医学图像分类领域,选用了血细胞图像、脑肿瘤图像、胸部CT扫描、病理性近视眼底图像以及肺炎X射线影像等数据集进行实验。实验结果表明,与Vim模型及其他5个神经网络模型相比,CvM模型在准确率上表现更为出色,在内存占用和参数数量方面也展现出明显的优势。消融实验表明,深度可分离卷积比标准卷积使用的参数和显存占用更少,而且在血细胞图像、脑肿瘤图像等医学图像分类上,准确率还有了显著提升。这些结果充分说明了CvM模型的优势和可行性。
关键词:深度学习;Vision Mamba;卷积神经网络;深度可分离卷积;医学图像分类