编程 Python

Python爬虫爬验证码实现功能详解

Posted in Python onApril 14, 2016

主要实现功能：

- 登陆网页

- 动态等待网页加载

- 验证码下载

很早就有一个想法，就是自动按照脚本执行一个功能，节省大量的人力——个人比较懒。花了几天写了写，本着想完成验证码的识别，从根本上解决问题，只是难度太高，识别的准确率又太低，计划再次告一段落。
希望这次经历可以与大家进行分享和交流。

Python打开浏览器

相比与自带的urllib2模块，操作比较麻烦，针对于一部分网页还需要对cookie进行保存，很不方便。于是，我这里使用的是Python2.7下的selenium模块进行网页上的操作。

测试网页：http://graduate.buct.edu.cn

打开网页：（需下载chromedriver）

为了支持中文字符输出，我们需要调用sys模块，把默认编码改为 UTF-8

<code class="hljs python">from selenium.webdriver.support.ui import Select, WebDriverWait
from selenium import webdriver
from selenium import common
from PIL import Image
import pytesser
import sys
reload(sys)
sys.setdefaultencoding('utf8')
broswer = webdriver.Chrome()
broswer.maximize_window()
username = 'test'
password = 'test'
url = 'http://graduate.buct.edu.cn'
broswer.get(url)</code>

等待网页加载完毕

使用的是selenium中的WebDriverWait，上面的代码中已经加载

<code class="hljs livecodeserver">url = 'http://graduate.buct.edu.cn'
broswer.get(url)
wait = WebDriverWait(webdriver,5) #设置超时时间5s
# 在这里输入表单填写并加载的代码
elm = wait.until(lambda webdriver: broswer.find_element_by_xpath(xpathMenuCheck))</code>

元素定位、字符输入

接下来我们需要进行登录操作：这里我使用的是Chrome，右键选择需要进行填写内容的部分，选择检查，会自动转跳到 F12下的开发者模式（全程需要这个功能来找到相关的资源）。

Python爬虫爬验证码实现功能详解

vczKprbLJnJkcXVvO9Gh1PHT0LnYtcSyv7fWPGJyIC8+DQo8aW1nIGFsdD0="这里写图片描述" src="https://3water.com/uploadfile/Collfiles/20160414/20160414092144893.png" title="\" />

这里我们看到有一个value = “1”，考虑到下拉框的属性，我们只要想办法把这个value赋值给UserRole就好了。
这里使用的是通过selenium的Select模块来进行选择，定位控件使用 find_element_by_**，能一一对应，很方便。

<code class="hljs sql">select = Select(broswer.find_element_by_id('UserRole'))
select.select_by_value('2')
name = broswer.find_element_by_id('username')
name.send_keys(username)
pswd = broswer.find_element_by_id('password')
pswd.send_keys(password)
btnlg = broswer.find_element_by_id('btnLogin')
btnlg.click()</code>

这是用脚本自动填充完的效果，之后就会转跳到下一页。

Python爬虫爬验证码实现功能详解

这里，我需要的是功能是自动对学术报告进行报名

Python爬虫爬验证码实现功能详解

对需要已有的报告右键即可发现和这个活动有关的消息，因现在没有报告，所以只显示了标题，但对于后面的有效报告识别有相似的地方。

Python爬虫爬验证码实现功能详解

对于元素的定位，我优先选择了 xpath，根据测试，可以唯一定位一个元素的位置，很好用。

<code class="hljs perl">//*[@id="dgData00"]/tbody/tr/td[2] （前面是xpath）</code>

Python爬虫爬验证码实现功能详解

爬取信息

接下来我们要进行的步骤是爬取现有的有效报告：

<code class="hljs axapta"># 寻找有效报告
flag = 1
count = 2
count_valid = 0
while flag:
  try:
    category = broswer.find_element_by_xpath('//*[@id="dgData00"]/tbody/tr[' + str(count) + ']/td[1]').text
    count += 1
  except common.exceptions.NoSuchElementException:
    break
# 获取报告信息
flag = 1
for currentLecture in range(2, count):
  # 类别
  category = broswer.find_element_by_xpath('//*[@id="dgData00"]/tbody/tr[' + str(currentLecture) + ']/td[1]').text
  # 名称
  name = broswer.find_element_by_xpath('//*[@id="dgData00"]/tbody/tr[' + str(currentLecture) + ']/td[2]').text
  # 单位
  unitsPublish = broswer.find_element_by_xpath('//*[@id="dgData00"]/tbody/tr[' + str(currentLecture) + ']/td[3]').text
  # 开始时间
  startTime = broswer.find_element_by_xpath('//*[@id="dgData00"]/tbody/tr[' + str(currentLecture) + ']/td[4]').text
  # 截止时间
  endTime = broswer.find_element_by_xpath('//*[@id="dgData00"]/tbody/tr[' + str(currentLecture) + ']/td[5]').text</code>

爬取验证码

对网页中的验证码进行元素审查后，我们发现了其中的一个一个链接，是 IdentifyingCode.apsx，后面我们就对这个页面进行加载，并批量获取验证码。

Python爬虫爬验证码实现功能详解

爬取的思路是用selenium截取当前页面（仅显示部分），并保存到本地——需要翻页并截取特定位置的请研究：

broswer.set_window_position(**)相关函数；然后人工进行验证码的定位，通过PIL模块进行截取并保存。

最后调用谷歌在Python下的pytesser进行字符识别，但这个网站的验证码有很多的干扰，外加字符旋转，仅仅能识别其中的一部分字符。

<code class="hljs livecodeserver"># 获取验证码并验证（仅仅一幅）
authCodeURL = broswer.find_element_by_xpath('//*[@id="Table2"]/tbody/tr[2]/td/p/img').get_attribute('src') # 获取验证码地址
broswer.get(authCodeURL)
broswer.save_screenshot('text.png')
rangle = (0, 0, 64, 28)
i = Image.open('text.png')
frame4 = i.crop(rangle)
frame4.save('authcode.png')
qq = Image.open('authcode.png')
text = pytesser.image_to_string(qq).strip()</code>
<code class="hljs axapta"># 批量获取验证码
authCodeURL = broswer.find_element_by_xpath('//*[@id="Table2"]/tbody/tr[2]/td/p/img').get_attribute('src') # 获取验证码地址
# 获取学习样本
for count in range(10):
  broswer.get(authCodeURL)
  broswer.save_screenshot('text.png')
  rangle = (1, 1, 62, 27)
  i = Image.open('text.png')
  frame4 = i.crop(rangle)
  frame4.save('authcode' + str(count) + '.png')
  print 'count:' + str(count)
  broswer.refresh()
broswer.quit()</code>

爬取下来的验证码

Python爬虫爬验证码实现功能详解

一部分验证码原图： Python爬虫爬验证码实现功能详解

从上面的验证码看出，字符是带旋转的，而且因为旋转造成的重叠对于后续的识别也有很大的影响。我曾尝试过使用神经网络进行训练，但因没有进行特征向量的提取，准确率低得离谱。

关于Python爬虫爬验证码实现功能详解就给大家介绍到这里，希望对大家有所帮助！

Python爬虫爬验证码实现功能详解

- Author -

Buf_Discoverer

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

Python代码解决RenderView窗口not found问题

Aug 28 Python

TensorFlow损失函数专题详解

Apr 26 Python

Python使用Pickle库实现读写序列操作示例

Jun 15 Python

pycharm编写spark程序，导入pyspark包的3中实现方法

Aug 02 Python

python3-flask-3将信息写入日志的实操方法

Nov 12 Python

Python中filter与lambda的结合使用详解

Dec 24 Python

Python Print实现在输出中插入变量的例子

Dec 25 Python

Python内建序列通用操作6种实现方法

Mar 26 Python

Django中从mysql数据库中获取数据传到echarts方式

Apr 07 Python

Python 列表反转显示的四种方法

Nov 16 Python

详解Pycharm第三方库的安装及使用方法

Dec 29 Python

Python办公自动化之Excel（中）

May 24 Python

Python实现简单登录验证

Apr 13 #Python

Python数组定义方法

Apr 13 #Python

Python基于select实现的socket服务器

Apr 13 #Python

Python简单实现子网掩码转换的方法

Apr 13 #Python

Python多进程分块读取超大文件的方法

Apr 13 #Python

Python字符串拼接、截取及替换方法总结分析

Apr 13 #Python

Python字符串格式化输出方法分析

Apr 13 #Python

You might like

DC的38部超级英雄动画电影

2020/03/03 欧美动漫

PHP常用编译参数中文说明

2014/09/27 PHP

PHP的文件操作与算法实现的面试题示例

2015/08/10 PHP

thinkPHP+LayUI 流加载实现功能

2019/09/27 PHP

小米公司JavaScript面试题

2014/12/29 Javascript

angularJS结合canvas画图例子

2015/02/09 Javascript

Vue系列：通过vue-router如何传递参数示例

2017/01/16 Javascript

JavaScript文件的同步和异步加载的实现代码

2017/08/19 Javascript

vue :src 文件路径错误问题的解决方法

2018/05/15 Javascript

Vue框架下引入ActiveX控件的问题解决

2019/03/25 Javascript

这样回答继承可能面试官更满意

2019/12/10 Javascript

Vue通过配置WebSocket并实现群聊功能

2019/12/31 Javascript

python将xml xsl文件生成html文件存储示例讲解

2013/12/03 Python

python协程用法实例分析

2015/06/04 Python

Python 字符串操作(string替换、删除、截取、复制、连接、比较、查找、包含、大小写转换、分割等)

2018/03/19 Python

python实现从文件中读取数据并绘制成 x y 轴图形的方法

2018/10/14 Python

详解python的四种内置数据结构

2019/03/19 Python

tornado+celery的简单使用详解

2019/12/21 Python

python实现tail实时查看服务器日志示例

2019/12/24 Python

Python实现AI自动抠图实例解析

2020/03/05 Python

简单的命令查看安装的python版本号

2020/08/28 Python

Python基于execjs运行js过程解析

2020/11/27 Python

python中字符串的编码与解码详析

2020/12/03 Python

突袭HTML5之Javascript API扩展1—Web Worker异步执行及相关概述

2013/01/31 HTML / CSS

Supersmart英国：欧洲市场首批食品补充剂供应商之一

2018/05/05 全球购物

曼城官方网上商店：Manchester City

2019/09/10 全球购物

大二自我鉴定范文

2013/10/05 职场文书

自荐信写法介绍

2014/01/25 职场文书

求职毕业生自荐书

2014/02/08 职场文书

小溪流的歌教学反思

2014/02/13 职场文书

幼儿园区域活动总结

2014/05/08 职场文书

房地产资料员岗位职责

2014/07/02 职场文书

医生学习党的群众路线教育实践活动心得体会

2014/11/03 职场文书

淘宝客服专员岗位职责

2015/04/07 职场文书

大学生学生会工作总结2015

2015/05/26 职场文书

redis 解决库存并发问题实现数量控制

2022/04/08 Redis