Python+Pillow+Pytesseract实现验证码识别

2024-04-02 19:04:59 303人浏览安东尼

Python 官方文档：入门教程 => 点击学习

摘要

目录一、环境配置二、验证码识别实例1实例2实例3昨天十行代码实现文字识别，感觉怎样，是不是很爽今天咋们继续利用pillow和pytesseract来实现验证码的识别一、环境配置

一、环境配置

需要 pillow 和 pytesseract 这两个库，pip install 安装就好了。

pip install pillow -i Http://pypi.douban.com/simple --trusted-host pypi.douban.com
pip install pytesseract -i http://pypi.douban.com/simple --trusted-host pypi.douban.com

安装好Tesseract-OCR.exe

pytesseract 库的配置：搜索找到pytesseract.py，打开该.py文件，找到 tesseract_cmd，改变它的值为刚才安装 tesseract.exe 的路径。

二、验证码识别

识别验证码，需要先对图像进行预处理，去除会影响识别准确度的线条或噪点，提高识别准确度。

实例1

import cv2 as cv
import pytesseract
from PIL import Image

def recognize_text(image):
    # 边缘保留滤波  去噪
    dst = cv.pyrMeanShiftFiltering(image, sp=10, sr=150)
    # 灰度图像
    gray = cv.cvtColor(dst, cv.COLOR_BGR2GRAY)
    # 二值化
    ret, binary = cv.threshold(gray, 0, 255, cv.THRESH_BINARY_INV | cv.THRESH_OTSU)
    # 形态学操作   腐蚀  膨胀
    erode = cv.erode(binary, None, iterations=2)
    dilate = cv.dilate(erode, None, iterations=1)
    cv.imshow('dilate', dilate)
    # 逻辑运算  让背景为白色  字体为黑  便于识别
    cv.bitwise_not(dilate, dilate)
    cv.imshow('binary-image', dilate)
    # 识别
    test_message = Image.fromarray(dilate)
    text = pytesseract.image_to_string(test_message)
    print(f'识别结果：{text}')


src = cv.imread(r'./test/044.png')
cv.imshow('input image', src)
recognize_text(src)
cv.waiTKEy(0)
cv.destroyAllwindows()

运行效果如下：

识别结果：3n3D
Process finished with exit code 0

实例2

import cv2 as cv
import pytesseract
from PIL import Image

def recognize_text(image):
    # 边缘保留滤波  去噪
    blur =cv.pyrMeanShiftFiltering(image, sp=8, sr=60)
    cv.imshow('dst', blur)
    # 灰度图像
    gray = cv.cvtColor(blur, cv.COLOR_BGR2GRAY)
    # 二值化
    ret, binary = cv.threshold(gray, 0, 255, cv.THRESH_BINARY_INV | cv.THRESH_OTSU)
    print(f'二值化自适应阈值：{ret}')
    cv.imshow('binary', binary)
    # 形态学操作  获取结构元素  开操作
    kernel = cv.getStructuringElement(cv.MORPH_RECT, (3, 2))
    bin1 = cv.morphologyEx(binary, cv.MORPH_OPEN, kernel)
    cv.imshow('bin1', bin1)
    kernel = cv.getStructuringElement(cv.MORPH_OPEN, (2, 3))
    bin2 = cv.morphologyEx(bin1, cv.MORPH_OPEN, kernel)
    cv.imshow('bin2', bin2)
    # 逻辑运算  让背景为白色  字体为黑  便于识别
    cv.bitwise_not(bin2, bin2)
    cv.imshow('binary-image', bin2)
    # 识别
    test_message = Image.fromarray(bin2)
    text = pytesseract.image_to_string(test_message)
    print(f'识别结果：{text}')


src = cv.imread(r'./test/045.png')
cv.imshow('input image', src)
recognize_text(src)
cv.waitKey(0)
cv.destroyAllWindows()

运行效果如下：

二值化自适应阈值：181.0
识别结果：8A62N1
Process finished with exit code 0

实例3

import cv2 as cv
import pytesseract
from PIL import Image

def recognize_text(image):
    # 边缘保留滤波  去噪
    blur = cv.pyrMeanShiftFiltering(image, sp=8, sr=60)
    cv.imshow('dst', blur)
    # 灰度图像
    gray = cv.cvtColor(blur, cv.COLOR_BGR2GRAY)
    # 二值化  设置阈值  自适应阈值的话 黄色的4会提取不出来
    ret, binary = cv.threshold(gray, 185, 255, cv.THRESH_BINARY_INV)
    print(f'二值化设置的阈值：{ret}')
    cv.imshow('binary', binary)
    # 逻辑运算  让背景为白色  字体为黑  便于识别
    cv.bitwise_not(binary, binary)
    cv.imshow('bg_image', binary)
    # 识别
    test_message = Image.fromarray(binary)
    text = pytesseract.image_to_string(test_message)
    print(f'识别结果：{text}')


src = cv.imread(r'./test/045.jpg')
cv.imshow('input image', src)
recognize_text(src)
cv.waitKey(0)
cv.destroyAllWindows()

运行效果如下：

二值化设置的阈值：185.0
识别结果：7364
Process finished with exit code 0

到此这篇关于python+Pillow+Pytesseract实现验证码识别的文章就介绍到这了,更多相关Python验证码识别内容请搜索编程网以前的文章或继续浏览下面的相关文章希望大家以后多多支持编程网！

您可能感兴趣的文档:

--结束END--

本文标题: Python+Pillow+Pytesseract实现验证码识别

本文链接: https://lsjlt.com/news/125947.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

猜你喜欢

Python+Pillow+Pytesseract实现验证码识别

目录一、环境配置二、验证码识别实例1实例2实例3昨天十行代码实现文字识别，感觉怎样，是不是很爽今天咋们继续利用pillow和pytesseract来实现验证码的识别一、环境配置 ...

99+

2024-04-02
Python+Pillow+Pytesseract怎么实现验证码识别

这篇“Python+Pillow+Pytesseract怎么实现验证码识别”文章的知识点大部分人都不太理解，所以小编给大家总结了以下内容，内容详细，步骤清晰，具有一定的借鉴价值，希望大家阅读完这篇文章能有所收获，下面我们一起来看看这篇“Py...

99+

2023-06-30
Python+Selenium+Pytesseract实现图片验证码识别

目录一、selenium截取验证码二、安装识别环境pytesseract+Tesseract-OCR验证识别环境是否正常三、处理验证码图片图片处理识别一、selenium截取验证码 ...

99+

2024-04-02
Python+Selenium+Pytesseract怎么实现图片验证码识别

这篇文章给大家介绍Python+Selenium+Pytesseract怎么实现图片验证码识别，内容非常详细，感兴趣的小伙伴们可以参考借鉴，希望对大家能有所帮助。一、selenium截取验证码import jsonfrom&nbs...

99+

2023-06-26
pytesseract+mechanize识别验证码自动登陆

pytesseract+mechanize识别验证码自动登陆需要的模块安装Pillow,Python平台的图像处理标准库pip install pillow安装pytesseract，文字识别库pip inst...

99+

2023-01-30

验证码 pytesseract mechanize
Selenium&Pytesseract模拟登录+验证码识别

验证码是爬虫需要解决的问题,因为很多网站的数据是需要登录成功后才可以获取的.验证码识别，即图片识别，很多人都有误区，觉得这是爬虫方面的知识，其实是不对的.验证码识别涉及到的知识：人工智能，模式识别，机器视觉，图像处理.主要流程：1 图像采集...

99+

2023-01-30

验证码 Selenium Pytesseract
python下调用pytesseract识别某网站验证码的实现方法

一、pytesseract介绍 1、pytesseract说明 pytesseract最新版本0.1.6，网址：https://pypi.python.org/pypi/pytesseract Python...

99+

2022-06-04

验证码方法网站
python怎么通过pillow识别动态验证码

这篇文章主要讲解了“python怎么通过pillow识别动态验证码”，文中的讲解内容简单清晰，易于学习与理解，下面请大家跟着小编的思路慢慢深入，一起来研究和学习“python怎么通过pillow识别动态验证码”吧！生活中，我们在登录微博，邮...

99+

2023-06-21
python通过pillow识别动态验证码的示例代码

目录环境配置安装 pillow（PIL）库识别过程生活中，我们在登录微博，邮箱的时候，常常会碰到验证码。在工作时，如果想要爬取一些数据，也会碰到验证码的阻碍。本次试验将带领大家认识...

99+

2024-04-02
如何使用Python实现极验验证码识别验证码

这篇“如何使用Python实现极验验证码识别验证码”文章的知识点大部分人都不太理解，所以小编给大家总结了以下内容，内容详细，步骤清晰，具有一定的借鉴价值，希望大家阅读完这篇文章能有所收获，下面我们一起来看看这篇“如何使用Python实现极验...

99+

2023-07-05
Python通用验证码识别OCR库之ddddocr验证码识别

目录前言传统验证码滑动验证码文字点选验证码总结前言相信做自动化测试的同学一定不可忽视的问题就是验证码，他几乎是一个网站登录的标配，当然，我一般是不建议在这上面浪费时间去做识别的。 ...

99+

2024-04-02
python实现腾讯滑块验证码识别

腾讯滑块验证码识别,识别凹槽的x轴位置，mock滑块的加速度。该项目公开API，提供识别和加速度模拟部分，第二部分模拟滑动进行识别返回数据请求项目地址：https://github.com/zhaojunlike/...

99+

2022-06-02

python 验证码识别 python 滑块验证码识别 python 腾讯验证码
Python怎么实现图形验证码识别

这篇文章主要介绍了Python怎么实现图形验证码识别的相关知识，内容详细易懂，操作简单快捷，具有一定借鉴价值，相信大家阅读完这篇Python怎么实现图形验证码识别文章都会有所收获，下面我们一起来看看吧。环境使用python 3.9pycha...

99+

2023-07-05
Python验证码识别处理实例

一、准备工作与代码实例 (1)安装PIL：下载后是一个exe，直接双击安装，它会自动安装到C:Python27Libsite-packages中去， (2)pytesser：下载解压后直接放C:Python...

99+

2022-06-04

验证码实例 Python
Python网站验证码识别

0x00 识别涉及技术验证码识别涉及很多方面的内容。入手难度大,但是入手后,可拓展性又非常广泛,可玩性极强,成就感也很足。验证码图像处理验证码图像识别技术主要是操作图片内的像素点,通过对图片...

99+

2022-06-04

验证码网站 Python
详解Python验证码识别

以前写过一个刷校内网的人气的工具，Java的(以后再也不行Java程序了)，里面用到了验证码识别，那段代码不是我自己写的:-) 校内的验证是完全单色没有任何干挠的验证码，识别起来比较容易，不过从那段代码中可...

99+

2022-06-04

验证码详解 Python
python 验证码识别库pytesse

笔者环境 centos7 python3 pytesseract只是tesseract-ocr的一种实现接口。所以要先安装tesseract-ocr（大名鼎鼎的开源的OCR识别引擎）。依赖安装 yum install-y auto...

99+

2023-01-30

验证码 python pytesse
python简单验证码识别

在学习python通过接口自动登录网站时，用户名密码、cookies、headers都好解决但是在碰到验证码这个时就有点棘手了；于是通过网上看贴，看官网完成了对简单验证码的识别，如果是复杂的请看大神的贴这里解决不了；以上两张为网站的上...

99+

2023-01-31

验证码简单 python
python简单验证码识别的实现过程

目录1. 环境准备1.1 安装pillow 和 pytesseract1.2 安装Tesseract-OCR.exe1.3 更改pytesseract.py的ocr路径2. 测试识别...

99+

2024-04-02
Python教学|Python验证码识别

大致介绍在python爬虫爬取某些网站的验证码的时候可能会遇到验证码识别的问题，现在的验证码大多分为四类：计算验证码滑块验证码识图验证码语音验证码这篇博客主要写的就是识图验证码，识别的是简...

99+

2023-09-01

python opencv 开发语言