《计算机工程与应用杂志》发表论文赏析
作者:徐诗康, 刘俊峰, 曾君, 廖丁丁
单位:1.华南理工大学 自动化科学与工程学院,广州 510641;2.华南理工大学 电力学院,广州 510641
摘要:针对目前端到端场景文本识别方法通常将文本检测和文本识别两个子任务整合到一个统一的框架中,而没有充分考虑文本检测和识别之间的交互和协同的问题,提出了一种基于跨模态和循环分解自注意力的端到端场景文本识别方法。基于缩放点积注意力机制,设计了一种跨模态模块,旨在增强视觉信息和语义信息的融合,从而增强文本检测和识别之间的交互。采用了带有循环卷积的循环分解自注意力替代解码器中的自注意力,以更好地捕捉文本实例的轮廓特征,从而提高文本检测的性能。在Total-Text、CTW1500和ICDAR 2015数据集上的大量实验表明,该方法相较于当前主流方法在文本检测的准确率、召回率、F值和端到端文本识别的准确率上均有较为明显的提升,并且消融实验也证明了所提方法的有效性。
关键词:场景文本识别,跨模态,循环卷积,分解自注意力,特征融合