《计算机工程与应用杂志》发表论文赏析
作者:潘惟兰, 张荣芬, 刘宇红, 张吉友, 孙龙
单位:贵州大学 大数据与信息工程学院,贵阳 550025
摘要:透明物体具有高透明度、光泽度和特殊质地等视觉特性,这些特性使得物体与背景之间的边界往往模糊不清,导致传统的图像分割算法难以准确识别和分割,因此提出结合CNN-Transformer的跨模态透明物体语义分割算法CTNet。该算法采用CNN和Transformer混合网络的编码-解码结构跨模态对透明物体类别和位置进行预测,CNN用于提取图像特征,Transformer用于多模态融合(multimodal fusion transformer,MFT);设计边界特征增强注意力模块(enhanced boundary attention module,EBAM),提升图像边缘分割能力;提出多尺度融合解码结构,减少模糊特征。CTNet在RGB-T-Glass数据集上的平均绝对误差(mean absolute error,MAE)为3.3%,交并比(intersection over union,IOU)在包含透明物体和不含透明物体的测试集上分别为90.18%和95.00%;在GDD数据集上,MAE为6.9%,IOU为87.6%。实验结果表明,CTNet利用可见光和热红外图像成功实现了对透明物体的准确分割,满足目标任务中对透明物体分割时的精确性和鲁棒性要求。
关键词:CNN-Transformer,多模态,透明物体,语义分割,特征融合