编程 Python

python selenium UI自动化解决验证码的4种方法

Posted in Python onJanuary 05, 2018

本文介绍了python selenium UI自动化解决验证码的4种方法，分享给大家，具体如下：

测试环境

windows7+
firefox50+
geckodriver # firefox浏览器驱动
python3
selenium3

selenium UI自动化解决验证码的4种方法：去掉验证码、设置万能码、验证码识别技术-tesseract、添加cookie登录，本次主要讲解验证码识别技术-tesseract和添加cookie登录。

1. 去掉验证码

去掉验证码，直接通过用户名和密码登陆网站。

2. 设置万能码

设置万能码，就是不管什么情况，输入万能码，都可以成功登录网站。

3. 验证码识别技术-tesseract

准备条件

tesseract，下载地址：https://github.com/parrot-office/tesseract/releases/tag/3.5.1
Python3.x，下载地址：https://www.python.org/downloads/
pillow（Python3图像处理库）

安装好Python，通过pip install pillow安装pillow库。然后将tesseract中的tesseract.exe和testdata文件夹放到测试脚本所在目录下，testdata中默认有eng.traineddata和osd.traineddata，如果要识别汉语，请自行下载对应包。

以下是两个主要文件，TesseractPy3.py是通过python代码去调用tesseract以达到识别验证码的效果。code.py是通过selenium获取验证码图片，进而使用TesseractPy3中的函数得到验证码，实现网站的自动化登陆。

TesseractPy3.py

#coding=utf-8

import os
import subprocess
import traceback
import logging

from PIL import Image # 来源于Pillow库

TESSERACT = 'tesseract' # 调用的本地命令名称
TEMP_IMAGE_NAME = "temp.bmp" # 转换后的临时文件
TEMP_RESULT_NAME = "temp" # 保存识别文字临时文件
CLEANUP_TEMP_FLAG = True # 清理临时文件的标识
INCOMPATIBLE = True # 兼容性标识

def image_to_scratch(image, TEMP_IMAGE_NAME):
  # 将图片处理为兼容格式
  image.save(TEMP_IMAGE_NAME, dpi=(200,200))

def retrieve_text(TEMP_RESULT_NAME):
  # 读取识别内容
  inf = open(TEMP_RESULT_NAME + '.txt','r')
  text = inf.read()
  inf.close()
  return text

def perform_cleanup(TEMP_IMAGE_NAME, TEMP_RESULT_NAME):
  # 清理临时文件
  for name in (TEMP_IMAGE_NAME, TEMP_RESULT_NAME + '.txt', "tesseract.log"):
    try:
      os.remove(name)
    except OSError:
      pass

def call_tesseract(image, result, lang):
  # 调用tesseract.exe，将识读结果写入output_filename中
  args = [TESSERACT, image, result, '-l', lang]
  proc = subprocess.Popen(args)
  retcode = proc.communicate()

def image_to_string(image, lang, cleanup = CLEANUP_TEMP_FLAG, incompatible = INCOMPATIBLE):
  # 假如图片是不兼容的格式并且incompatible = True，先转换图片为兼容格式（本程序将图片转换为.bmp格式），然后获取识读结果;如果cleanup=True,操作之后删除临时文件。
  logging.basicConfig(filename='tesseract.log')
  try:
    try:
      call_tesseract(image, TEMP_RESULT_NAME, lang)
      text = retrieve_text(TEMP_RESULT_NAME)
    except Exception:
      if incompatible:
        image = Image.open(image)
        image_to_scratch(image, TEMP_IMAGE_NAME)
        call_tesseract(TEMP_IMAGE_NAME, TEMP_RESULT_NAME, lang)
        text = retrieve_text(TEMP_RESULT_NAME)
      else:
        raise
    return text
  except: 
    s=traceback.format_exc()
    logging.error(s)
  finally:
    if cleanup:
      perform_cleanup(TEMP_IMAGE_NAME, TEMP_RESULT_NAME)

code.py

#coding=utf-8

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.common.keys import Keys
from selenium.webdriver.support.ui import Select
from selenium.common.exceptions import NoSuchElementException
from selenium.common.exceptions import NoAlertPresentException
from PIL import Image
import unittest, time, re
from TesseractPy3 import *

class lgoin(unittest.TestCase):
  def setUp(self):
    self.driver = webdriver.Ie()
    self.driver.implicitly_wait(30)
    self.base_url = 'http://127.0.0.1:8080/test' # 要测试的链接
    self.title = '某管理平台' # 测试网站的Title
    self.verificationErrors = []
    self.accept_next_alert = True

  def test_lgoin(self):
    driver = self.driver
    driver.get(self.base_url)
    driver.maximize_window()
    driver.save_screenshot('All.png') # 截取当前网页，该网页有我们需要的验证码
    imgelement = driver.find_element_by_class_name('kaptchaImage')
    location = imgelement.location # 获取验证码x,y轴坐标
    size = imgelement.size # 获取验证码的长宽
    rangle = (int(location['x']),int(location['y']),int(location['x']+size['width']),int(location['y']+size['height'])) # 写成我们需要截取的位置坐标
    i = Image.open("All.png") # 打开截图
    result = i.crop(rangle) # 使用Image的crop函数，从截图中再次截取我们需要的区域
    result.save('result.jpg')
    text = image_to_string('result.jpg', 'eng').strip()

    assert self.title in driver.title

    driver.find_element_by_id(u'userCode').clear()
    driver.find_element_by_id(u'userCode').send_keys('XXXXXX') # 用户名
    driver.find_element_by_id(u'password').clear()
    driver.find_element_by_id(u'password').send_keys('XXXXXX') # 密码
    #driver.find_element_by_name('verifyCode').clear()
    driver.find_element_by_name('verifyCode').send_keys(text)
    driver.find_element_by_name('submit').submit()


  def is_element_present(self, how, what):
    try: self.driver.find_element(by=how, value=what)
    except NoSuchElementException as e: return False
    return True

  def is_alert_present(self):
    try: self.driver.switch_to_alert()
    except NoAlertPresentException as e: return False
    return True

  def close_alert_and_get_its_text(self):
    try:
      alert = self.driver.switch_to_alert()
      alert_text = alert.text
      if self.accept_next_alert:
         alert.accept()
      else:
        alert.dismiss()
      return alert_text
    finally: self.accept_next_alert = True

  def tearDown(self):
    #self.driver.quit()
    self.assertEqual([], self.verificationErrors)

if __name__ == "__main__":
  unittest.main()

最后，执行命令python code.py，就可以成功自动登录网站。

注意：

由于受验证码图片质量以及清晰度的影响，并不是每一次都能成功登陆。

4. 添加cookie登录

首先获取网站登陆后的cookie，然后通过添加cookie的方式，实现网站登陆的目的。我们用cook来表示xxxxxx的登录后的cookie。

# coding=utf-8

from selenium import webdriver
import time 

driver = webdriver.Firefox()
driver.get("http://www.xxxxxx.com/") # 要登陆的网站

driver.add_cookie(cook) # 这里添加cookie，有时cookie可能会有多条，需要添加多次
time.sleep(3) 

# 刷新下页面就可以看到登陆成功了
driver.refresh()

注意：

登录时有勾选下次自动登录的请勾选，浏览器提示是否保存用户密码时请选择确定，这样获取的cookie成功登陆的机率比较高

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持三水点靠木。

python selenium UI自动化解决验证码的4种方法

- Author -

地空神一

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

python使用点操作符访问字典(dict)数据的方法

Mar 16 Python

Python遍历指定文件及文件夹的方法

May 09 Python

Python实现Linux中的du命令

Jun 12 Python

Python实现类似比特币的加密货币区块链的创建与交易实例

Mar 20 Python

pycharm: 恢复(reset) 误删文件的方法

Oct 22 Python

python pytest进阶之xunit fixture详解

Jun 27 Python

python输出电脑上所有的串口名的方法

Jul 02 Python

Python 用turtle实现用正方形画圆的例子

Nov 21 Python

Python Numpy 控制台完全输出ndarray的实现

Feb 19 Python

python爬虫爬取图片的简单代码

Jan 18 Python

Python insert() / append() 用法 Leetcode实战演示

Mar 31 Python

PYTHON 使用 Pandas 删除某列指定值所在的行

Apr 28 Python

轻松实现TensorFlow微信跳一跳的AI

Jan 05 #Python

OpenCV-Python实现轮廓检测实例分析

Jan 05 #Python

django2 快速安装指南分享

Jan 05 #Python

Python实现改变与矩形橡胶的线条的颜色代码示例

Jan 05 #Python

用python制作游戏外挂

Jan 04 #Python

Python学习之Anaconda的使用与配置方法

Jan 04 #Python

Windows下Anaconda的安装和简单使用方法

Jan 04 #Python

You might like

php下实现一个阿拉伯数字转中文数字的函数

2008/07/10 PHP

WordPress中创建用户角色的相关PHP函数使用详解

2015/12/25 PHP

使用PHP+MySql+Ajax+jQuery实现省市区三级联动功能示例

2017/09/15 PHP

PHP下用Swoole实现Actor并发模型的方法

2019/06/12 PHP

JScript的条件编译

2007/05/29 Javascript

JavaScript 学习笔记（十五）

2010/01/28 Javascript

Google的跟踪代码动态加载js代码方法应用

2012/11/12 Javascript

js 程序执行与顺序实现详解

2013/05/13 Javascript

jQuery学习之prop和attr的区别示例介绍

2013/11/15 Javascript

jquery form表单序列化为对象的示例代码

2014/03/05 Javascript

iframe窗口高度自适应的又一个巧妙实现思路

2014/04/04 Javascript

js匿名函数的调用示例(形式多种多样)

2014/08/20 Javascript

基于Css3和JQuery实现打字机效果

2015/08/11 Javascript

jQuery animate easing使用方法图文详解

2016/06/17 Javascript

解决OneThink中无法异步提交kindeditor文本框中修改后的内容方法

2017/05/05 Javascript

详解Angular2 关于*ngFor 嵌套循环

2017/05/22 Javascript

解决ionic和angular上拉加载的问题

2017/08/03 Javascript

vue bus全局事件中心简单Demo详解

2018/02/26 Javascript

bootstrap-table formatter 使用vue组件的方法

2019/05/09 Javascript

vue 中命名视图的用法实例详解

2019/08/14 Javascript

Python实现的堆排序算法原理与用法实例分析

2017/11/22 Python

Python列表推导式与生成器表达式用法示例

2018/02/08 Python

pytorch forward两个参数实例

2020/01/17 Python

踩坑:pytorch中eval模式下结果远差于train模式介绍

2020/06/23 Python

使用Python中tkinter库简单gui界面制作及打包成exe的操作方法（二）

2020/10/12 Python

Python使用Opencv实现边缘检测以及轮廓检测的实现

2020/12/31 Python

POP文化和音乐灵感的时尚：Hot Topic

2019/06/19 全球购物

Java的基础面试题附答案

2016/01/10 面试题

化工工艺专业求职信

2013/09/22 职场文书

工业设计专业推荐信

2013/10/29 职场文书

服装创业计划书范文

2014/02/05 职场文书

《特殊的葬礼》教学反思

2014/04/27 职场文书

职工食堂管理制度

2015/08/06 职场文书

pytorch finetuning 自己的图片进行训练操作

2021/06/05 Python

MongoDB数据库部署环境准备及使用介绍

2022/03/21 MongoDB

Python函数对象与闭包函数

2022/04/13 Python