《计算机技术与发展杂志》发表论文赏析
作者:章安;马明栋
摘要:针对 Tesseract 文字识别框架对输入图像的像素要求,以及图像采集过程中可能出现的歪斜、黑边等情况,基于文字识别流程,对预处理阶段的二值化、缩放、边框处理与倾斜矫正进行研究与 C++代码的实现。 对文字识别 OCR(optical character recognition,光学字符识别)的流程进行了概述,重点研究图像缩放与二值化过程,利用双线性插值算法逐像素、逐行分别对横纵坐标进行线性插值,完成图像缩放;利用最大类间方差法、聚类的思想,遍历灰度值,获取最佳二值化阈值,实现图像的二值化。 参考 OpenCV 库函数,提出图像边框与偏移的处理思路。 在 VS2015 环境下基于 Tesseract 框架,对整个流程进行实现,介绍了 Tesseract 框架的接口与功能、输入与输出参数。 图像的预处理对文字识别必不可少,有利于Tesseract 之后的识别工作。
关键词:OCR;文字识别;预处理;Tesseract 框架;C++