欧杰



摘要:制度及规范性文件是内部审计人员开展现场审计工作以及审计发现问题定性时的重要依据,经常需要反复检索查阅,但由于政府机关的电子制度文件主要以纸质扫描图片或电子公文系统生成的pdf文件等形式保存,无法进行全文检索。为此,笔者运用Tesseract-OCR开源OCR引擎,将图片和pdf文件中的文字内容识别并提取出来,为实现制度内容的全文检索奠定了基础。
关键词: OCR技术;python;制度文件
中图分类号:TP311 文献标识码:A
文章编号:1009-3044(2021)09-0201-02
开放科学(资源服务)标识码(OSID):
1 背景
制度及规范性文件是内部审计人员开展现场审计工作以及审计发现问题定性时的重要依据,常需要反复检索查阅,但由于大量相关文件均为纸质扫描图片或由电子公文系统生成的pdf文件,难以全文检索快速定位,为提高审计发现的效率和精准度带来极大不便。
为解决上述问题,笔者基于python和开源的OCR引擎Tesseract-OCR实现了将图片、PDF格式的制度文件批量转换为可编辑的doc文件的工具。
2文件可编辑转换研究
制度文件可编辑转换是在广西人民银行内审监督制度库项目背景下的一项研究,由于广西人民银行系统内历史及现行制度的电子保存格式主要以tif、jpg、png、pdf等难以读取文字内容的文件格式为主,不利于对制度内容的全文检索,给审计人员快速查阅制度带来障碍。因此需要将相关制度内容进行全文录入,但如果仅依靠人力录入,则耗时费力。
Tesseract-OCR是由惠普公司开发的一个开源OCR引擎(Optical Character Recognition,光学字符识别),可识别多种格式的图像文件并将其转换成文本[1]。……