《计算机工程与应用杂志》发表论文赏析
作者:黄科迪, 黄鹤鸣, 李伟, 樊永红
单位:1.青海师范大学 计算机学院,西宁 810008 ;2.藏语智能信息处理及应用国家重点实验,西宁 810008
摘要:语义分割是计算机视觉中分析和理解场景的关键任务,但现有的分割模型需要较高的计算成本和内存需求,不适合高分辨率场景的轻量级语义分割。针对该问题,提出了一种新的面向高分辨率场景的轻量级语义分割模型DCaT。采用深度可分离卷积提取图像的局部语义;使用基于坐标感知和动态稀疏混合注意力的轻量级Transformer获取图像的全局语义;通过模块融合,在低级语义上注入高级语义;通过分割头输出像素预测标签。实验结果表明:与基线模型相比,DCaT在高分辨率数据集Cityscapes上的平均交并比提高了1.5个百分点,模型复杂度降低了26%,推理速度提升了12%。实现了高分辨率场景下模型复杂度与性能之间的更好平衡,证明了DCaT的有效性和实用性。
关键词:语义分割,轻量化,高分辨率,Transformer,稀疏注意力