码迷,mamicode.com
首页 > 其他好文 > 详细

关于用tesseract和tesserocr识别图片的一个问题

时间:2019-04-07 22:19:25      阅读:378      评论:0      收藏:0      [点我收藏+]

标签:print   直接   top   出现   src   应该   ext   找不到   需要   

对于像我这样初学python网络爬虫的freshman来说,软件的准备和环境的配置能让我们崩溃。其中用刚安装好的tesseract和tesserocr库测试识别验证码就是其中一例。

这里我要测试的验证码是image.png,保存在C:\Users\LENOVO\Desktop。

1.对于tesseract,我按照书上来输入一下命令,然后产生错误。

技术图片

觉得不可思议,我完全按照书上来的!

过了一天回头看才发现是那个‘-1’出了问题,原本应该是‘-l’,即language的简称。

改了之后以为能成功了,结果一阵无语,又出现了新错误。

技术图片

后来捣鼓半天才意识到:虽然我已经把Tesseract-OCR目录添加到path环境变量,能在系统任意位置打开tesseract.exe,但打开图片需要正确的路径,于是我做了修改。成功了。

技术图片

这是结果:

技术图片

 

2.对于tesserocr库,当我直接按照书上敲入命令时:

>>> import tesserocr
>>> from PIL import Image
>>> image = Image.open(‘image.png‘)

>>> print(tesserocr.image_to_text(image))

到第三行就会出错

技术图片

说是找不到文件。同样,跟上面一样,我们需要找到准确地址。下面有两种解决办法:

a.第三行命令填上完整读取地址

技术图片

然后运行成功。

b.我已经把python安装地址添到path环境变量,可以直接在运行打开,但此时是在安装地址打开,直接读取验证码肯定会失败,所以我改在验证码位置打开python3:

技术图片

然后成功!

所以,像这种东西,不仅需要细心,还要动脑。

关于用tesseract和tesserocr识别图片的一个问题

标签:print   直接   top   出现   src   应该   ext   找不到   需要   

原文地址:https://www.cnblogs.com/wuhewuhe/p/10667120.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!