《计算机技术与发展杂志》发表论文赏析
作者:梁晓中;王涛
摘要:针对现有的手写汉字骨架提取算法存在的汉字骨架提取不完全、笔画交叉处畸变、笔画断裂等问题,提出一种多层次特征融合与多维度上下文信息增强的手写汉字骨架提取算法,记为 PixCLIP。 该算法将多模态预训练模型 CLIP(Contrastive Language-Image Pre-training)的视觉 Transformer 分支与 Pix2Pix 条件生成对抗网络进行多层次特征融合,增强模型整体的全局上下文信息提取能力。 对 CLIP 使用视觉提示微调技术(VPT),仅需微调极少数额外参数即可增强其在骨架提取任务的表现。 提出多维度特征聚合(MDFA)模块,充分促进 CLIP 的全局特征与 Pix2Pix 局部特征之间多维度特征的自适应融合。 引入多头注意力机制与卷积块注意力模块(CBAM),在通道和空间维度上抑制冗余信息。 基于在线手写汉字数据集,构建手写汉字图像数据集用于实验。 实验表明,与现有最优的骨架提取算法相比,该算法在测试数据集与真实手写汉字图像中均能更好地提取出流畅、完整的汉字骨架;在测试数据集上,此模型 F1 值与联合交并比(IoU)分别达到了 85. 62% 和 75. 45% 。
关键词:骨架提取;条件生成对抗网络;多模态;CLIP模型;视觉提示微调