《计算机测量与控制杂志》发表论文赏析
作者:李琼,邢景松,廖海斌,翁灿
单位:武汉工程大学电气信息学院
摘要:针对定位信息传播路径过长,不能充分挖掘不同尺度特征的语义信息,导致难以利用底层定位信息来预测文本边界框的问题,提出了一种基于注意力机制和多尺度特征的场景文本检测方法;改进特征提取模块,构建内嵌十字交叉注意力机制的特征提取器提取多尺度特征,获取上下文感知信息;引入特征融合模块路径聚合网络(PANet)对不同尺度的特征映射进行融合,并提供多尺度的上下文语义信息,使分割网络生成更精细的边界分割结果,并在预测阶段重建损失函数;为了验证该方法的有效性,在公开数据集ICDAR2015,CTW1500和Total-Text三个公开数据集上进行实验,其综合指标F值分别达到了87.4%,82.3%,83.4%,基于注意力机制和多尺度特征的场景文本检测CM-STD的性能优于经典的EAST方法,且可与当前的LOMO方法相媲美。
关键词:场景文本检测;注意力机制;多尺度特征融合;损失函数;任意形状文本
基金资助:江西省主要学科学术和技术带头人培养计划--领军人才项目