基于Python的图片文本识别系统的研究

2019-10-21 10:06:01韩琳
科学与财富 2019年20期
关键词:特征

韩琳

近年来随着计算机技术的不断发展,Optical Character Recognition(光学字符识别,简称“OCR”)应用的领域更加的广泛,而图片文字识别就是其中重要的一个。目前图片文字识别的准确率并没有达到100%,这也成为了图片文字识别发展领域的一大瓶颈,因此要去探索一个好的图片文字识别算法是非常有意义的。

图片文字识别系统的基本流程为:获得图片、去噪处理、二值化处理、矫正图片、行查找、文字定位、细化处理、文字特征扫描、查询显示文字。OpenCv提供了图片处理的基本函数,例如数据矩阵的遍历,图片的存储等,去噪处理中的平滑处理、二值化处理等。矫正图片就是将图片按照文字的行摆正,该步骤是比较的关键一步,后面的行定位等都是依赖于图片矫正。文字的行定位和文字定位即确定文字的区域,方便文字特征扫描,细化处理是将文字细化为一个像素,而不破坏连通性。细化处理是方便特征扫描而做的处理使数据库中存储文字特征码和UTF-8编码对应起来。涉及到的相关技术主要如下。

1. OpenCv

OpenCv是一个基于BSD许可发行的可以跨平台的计算机视觉库。它可以运行在Windows和Linux等操作系统之上,它是由一系列的C函数和少许的C++类构成,同时还提供了Python、Matlab等语言的接口,实现了计算机视觉和图像处理等方面的很多通用算法。

包含的五个基本模块,功能非常的强大。可以在设计中使用的是图形处理模块,结构图如下所示:

2. UTF-8编码

UTF-8是一种针对Unicode的可变长度字符编码,又称万国码,由Ken Thompson于1992年创建。……

登录APP查看全文

猜你喜欢
特征
离散型随机变量的分布列与数字特征
具有两个P’维非线性不可约特征标的非可解群
月震特征及与地震的对比
如何表达“特征”
不忠诚的四个特征
当代陕西(2019年10期)2019-06-03 10:12:04
詈语的文化蕴含与现代特征
新闻传播(2018年11期)2018-08-29 08:15:24
基于特征筛选的模型选择
线性代数的应用特征
河南科技(2014年23期)2014-02-27 14:19:15