python开发中怎么使用pytesseract实现文字识别

发布时间：2021-11-29 14:17:42 作者：iii
来源：亿速云阅读：268

本篇内容介绍了“python开发中怎么使用pytesseract实现文字识别”的有关知识，在实际案例的操作过程中，不少人都会遇到这样的困境，接下来就让小编带领大家学习一下如何处理这些情况吧！希望大家仔细阅读，能够学有所成！

pytesseract是一款开源的图片文字识别库，能识别中文、英文等不少类型的语言，使用之前需要安装tesseract-ocr引擎，此引擎在windows、linux、macos上都能进行安装，(OCR,Optical Character Recognition，光学字符识别)，安装完成后，对应安装pytesseract库，就能做简单的文字识别了，自带的文字类库，识别有时不准确，但是可以自己训练识别库。

“Tesseract的OCR引擎最先由HP实验室于1985年开始研发，至1995年时已经成为OCR业内最准确的三款识别引擎之一。然而，HP不久便决定放弃OCR业务，Tesseract也从此尘封。

数年以后，HP意识到，与其将Tesseract束之高阁，不如贡献给开源软件业，让其重焕新生－－2005年，Tesseract由美国内华达州信息技术研究所获得，并求诸于Google对Tesseract进行改进、消除Bug、优化工作。”

下边列举一下，如何在Centos7系统的环境下，搭建一个python的tesseract-ocr环境，并使用python进行简单的图片识别。

安装Tesseract-ocr，在github上有安装的网址，https://github.com/tesseract-ocr/tesseract/wiki，在Centos7上，使用最简单的yum进行安装，这种方式，需要保持互联网的连接，但是也不用编译源代码进行安装了。

//更新配置，添加tesseract的地址
yum-config-manager --add-repo https://download.opensuse.org/repositories/home:/Alexander_Pozdnyakov/CentOS_7/
sudo rpm --import https://build.opensuse.org/projects/home:Alexander_Pozdnyakov/public_key
//更新yum
yum update
//安装tesseract
yum install tesseract 
//安装简体中文语言包
yum install tesseract-langpack-chi_sim

安装完引擎后，安装python的开发包，使用pip进行安装，安装命令是：

pip install pytesseract

简单的图片识别代码：

import pytesseract
from PIL import Image
#打开图片
image = Image.open('图片路径')
#将图片中的文字转换字符串
code = pytesseract.image_to_string(image, lang='chi_sim')
#输出字符串
print(code)

“python开发中怎么使用pytesseract实现文字识别”的内容就介绍到这里了，感谢大家的阅读。如果想了解更多行业相关的知识可以关注亿速云网站，小编将为大家输出更多高质量的实用文章！

python开发中怎么使用pytesseract实现文字识别

相关阅读