python爬虫开发之selenium模块详细使用方法与实例全解


Posted in Python onMarch 09, 2020

python爬虫模块selenium简介

selenium主要是用来做自动化测试,支持多种浏览器,爬虫中主要用来解决JavaScript渲染问题。

模拟浏览器进行网页加载,当requests,urllib无法正常获取网页内容的时候

一、声明浏览器对象

注意点一,Python文件名或者包名不要命名为selenium,会导致无法导入

from selenium import webdriver
#webdriver可以认为是浏览器的驱动器,要驱动浏览器必须用到webdriver,支持多种浏览器,这里以Chrome为例
browser = webdriver.Chrome()

二、访问页面并获取网页html

from selenium import webdriver
browser = webdriver.Chrome()
browser.get('https://www.taobao.com')
print(browser.page_source)#browser.page_source是获取网页的全部html
browser.close()

三、查找元素

单个元素

from selenium import webdriver
browser = webdriver.Chrome()
browser.get('https://3water.com')
input_first = browser.find_element_by_id('q')
input_second = browser.find_element_by_css_selector('#q')
input_third = browser.find_element_by_xpath('//*[@id="q"]')
print(input_first,input_second,input_third)
browser.close()

常用的查找方法

find_element_by_name

find_element_by_xpath

find_element_by_link_text

find_element_by_partial_link_text

find_element_by_tag_name

find_element_by_class_name

find_element_by_css_selector

也可以使用通用的方法

from selenium import webdriver
from selenium.webdriver.common.by import By
browser = webdriver.Chrome()
browser.get('https://3water.com')
input_first = browser.find_element(BY.ID,'q')#第一个参数传入名称,第二个传入具体的参数
print(input_first)
browser.close()

多个元素,elements多个s

input_first = browser.find_elements_by_id(‘q')

四、元素交互操作-搜索框传入关键词进行自动搜索

from selenium import webdriver
import time
browser = webdriver.Chrome()
browser.get('https://3water.com')
input = browser.find_element_by_id('q')#找到搜索框
input.send_keys('iPhone')#传送入关键词
time.sleep(5)
input.clear()#清空搜索框
input.send_keys('男士内裤')
button = browser.find_element_by_class_name('btn-search')#找到搜索按钮
button.click()

更多操作

http://selenium-python.readthedocs.io/api.html#module-selenium.webdriver.remote.webelement#可以有属性、截图等等

五、交互动作,驱动浏览器进行动作,模拟拖拽动作,将动作附加到动作链中串行执行

from selenium import webdriver
from selenium.webdriver import ActionChains#引入动作链
browser = webdriver.Chrome()
url = '//3water.com/try/try.php?filename=jqueryui-api-droppable'
browser.get(url)
browser.switch_to.frame('iframeResult')#切换到iframeResult框架
source = browser.find_element_by_css_selector('#draggable')#找到被拖拽对象
target = browser.find_element_by_css_selector('#droppable')#找到目标
actions = ActionChains(browser)#声明actions对象
actions.drag_and_drop(source, target)
actions.perform()#执行动作

更多操作

http://selenium-python.readthedocs.io/api.html#module-selenium.webdriver.common.action_chains

六、执行JavaScript

有些动作可能没有提供api,比如进度条下拉,这时,我们可以通过代码执行JavaScript

from selenium import webdriver
browser = webdriver.Chrome()
browser.get('https://3water.com/explore')
browser.execute_script('window.scrollTo(0, document.body.scrollHeight)')
browser.execute_script('alert("To Bottom")')

七、获取元素信息

获取属性

from selenium import webdriver
from selenium.webdriver import ActionChains
browser = webdriver.Chrome()
url = 'https://3water.com/explore'
browser.get(url)
logo = browser.find_element_by_id('zh-top-link-logo')#获取网站logo
print(logo)
print(logo.get_attribute('class'))
browser.close()

获取文本值

from selenium import webdriver
browser = webdriver.Chrome()
url = 'https://3water.com/explore'
browser.get(url)
input = browser.find_element_by_class_name('zu-top-add-question')
print(input.text)#input.text文本值
browser.close()

获取Id,位置,标签名,大小

from selenium import webdriver
browser = webdriver.Chrome()
url = 'https://3water.com/explore'
browser.get(url)
input = browser.find_element_by_class_name('zu-top-add-question')
print(input.id)#获取id
print(input.location)#获取位置
print(input.tag_name)#获取标签名
print(input.size)#获取大小
browser.close()

八、Frame操作

frame相当于独立的网页,如果在父类网frame查找子类的,则必须切换到子类的frame,子类如果查找父类也需要先切换

from selenium import webdriver
from selenium.common.exceptions import NoSuchElementException
browser = webdriver.Chrome()
url = '//3water.com/try/try.php?filename=jqueryui-api-droppable'
browser.get(url)
browser.switch_to.frame('iframeResult')
source = browser.find_element_by_css_selector('#draggable')
print(source)
try:
  logo = browser.find_element_by_class_name('logo')
except NoSuchElementException:
  print('NO LOGO')
browser.switch_to.parent_frame()
logo = browser.find_element_by_class_name('logo')
print(logo)
print(logo.text)

九、等待

隐式等待

当使用了隐式等待执行测试的时候,如果 WebDriver没有在 DOM中找到元素,将继续等待,超出设定时间后则抛出找不到元素的异常,

换句话说,当查找元素或元素并没有立即出现的时候,隐式等待将等待一段时间再查找 DOM,默认的时间是

from selenium import webdriver
browser = webdriver.Chrome()
browser.implicitly_wait(10)#等待十秒加载不出来就会抛出异常,10秒内加载出来正常返回
browser.get('https://3water.com/explore')
input = browser.find_element_by_class_name('zu-top-add-question')
print(input)

显式等待

指定一个等待条件,和一个最长等待时间,程序会判断在等待时间内条件是否满足,如果满足则返回,如果不满足会继续等待,超过时间就会抛出异常

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
browser = webdriver.Chrome()
browser.get('https://3water.com/')
wait = WebDriverWait(browser, 10)
input = wait.until(EC.presence_of_element_located((By.ID, 'q')))
button = wait.until(EC.element_to_be_clickable((By.CSS_SELECTOR, '.btn-search')))
print(input, button)

title_is 标题是某内容

title_contains 标题包含某内容

presence_of_element_located 元素加载出,传入定位元组,如(By.ID, ‘p')

visibility_of_element_located 元素可见,传入定位元组

visibility_of 可见,传入元素对象

presence_of_all_elements_located 所有元素加载出

text_to_be_present_in_element 某个元素文本包含某文字

text_to_be_present_in_element_value 某个元素值包含某文字

frame_to_be_available_and_switch_to_it frame加载并切换

invisibility_of_element_located 元素不可见

element_to_be_clickable 元素可点击

staleness_of 判断一个元素是否仍在DOM,可判断页面是否已经刷新

element_to_be_selected 元素可选择,传元素对象

element_located_to_be_selected 元素可选择,传入定位元组

element_selection_state_to_be 传入元素对象以及状态,相等返回True,否则返回False

element_located_selection_state_to_be 传入定位元组以及状态,相等返回True,否则返回False

alert_is_present 是否出现Alert

详细内容

http://selenium-python.readthedocs.io/api.html#module-selenium.webdriver.support.expected_conditions

十一、前进后退-实现浏览器的前进后退以浏览不同的网页

import time
from selenium import webdriver
browser = webdriver.Chrome()
browser.get('https://3water.com/')
browser.get('https://3water.com/')
browser.get('https://3water.com/')
browser.back()
time.sleep(1)
browser.forward()
browser.close()

十二、Cookies

from selenium import webdriver
browser = webdriver.Chrome()
browser.get('https://3water.com/explore')
print(browser.get_cookies())
browser.add_cookie({'name': 'name', 'domain': '3water.com', 'value': 'germey'})
print(browser.get_cookies())
browser.delete_all_cookies()
print(browser.get_cookies())

选项卡管理 增加浏览器窗口

import time
from selenium import webdriver
browser = webdriver.Chrome()
browser.get('https://3water.com')
browser.execute_script('window.open()')
print(browser.window_handles)
browser.switch_to_window(browser.window_handles[1])
browser.get('https://3water.com')
time.sleep(1)
browser.switch_to_window(browser.window_handles[0])
browser.get('//3water.com')

十三、异常处理

from selenium import webdriver
browser = webdriver.Chrome()
browser.get('https://3water.com')
browser.find_element_by_id('hello')
from selenium import webdriver
from selenium.common.exceptions import TimeoutException, NoSuchElementException
browser = webdriver.Chrome()
try:
  browser.get('https://3water.com')
except TimeoutException:
  print('Time Out')
try:
  browser.find_element_by_id('hello')
except NoSuchElementException:
  print('No Element')
finally:
  browser.close()

本文主要讲解了python爬虫模块selenium详细使用方法与实例全解,更多关于python爬虫模块的使用知识请查看下面的相关链接

Python 相关文章推荐
python类装饰器用法实例
Jun 04 Python
取numpy数组的某几行某几列方法
Apr 03 Python
python 正确保留多位小数的实例
Jul 16 Python
Python分割指定页数的pdf文件方法
Oct 26 Python
python将txt等文件中的数据读为numpy数组的方法
Dec 22 Python
Python实现高斯函数的三维显示方法
Dec 29 Python
Python实现的读取文件内容并写入其他文件操作示例
Apr 09 Python
Python PIL读取的图像发生自动旋转的实现方法
Jul 05 Python
Python实现新型冠状病毒传播模型及预测代码实例
Feb 05 Python
Python操作Excel把数据分给sheet
May 20 Python
Python Excel vlookup函数实现过程解析
Jun 22 Python
Python进阶学习之带你探寻Python类的鼻祖-元类
May 08 Python
python为QT程序添加图标的方法详解
Mar 09 #Python
python爬虫开发之PyQuery模块详细使用方法与实例全解
Mar 09 #Python
详解pandas中iloc, loc和ix的区别和联系
Mar 09 #Python
pandas中ix的使用详细讲解
Mar 09 #Python
Python unittest 自动识别并执行测试用例方式
Mar 09 #Python
python爬虫开发之urllib模块详细使用方法与实例全解
Mar 09 #Python
在Python IDLE 下调用anaconda中的库教程
Mar 09 #Python
You might like
在PHP中操作Excel实例代码
2010/04/29 PHP
PHP5中使用PDO连接数据库的方法
2010/08/01 PHP
PHP抽象类 介绍
2012/06/13 PHP
比较strtr, str_replace和preg_replace三个函数的效率
2013/06/26 PHP
浅析php数据类型转换
2014/01/09 PHP
10个php函数实用却不常见
2015/10/13 PHP
PHP实现求连续子数组最大和问题2种解决方法
2017/12/26 PHP
经典的解除许多网站无法复制文字的绝招
2006/12/31 Javascript
JavaScript 解析读取XML文档 实例代码
2009/07/07 Javascript
javascript定时保存表单数据的代码
2011/03/17 Javascript
Jquery显示和隐藏元素或设为只读(含Ligerui的控件禁用,实例说明介绍)
2013/07/09 Javascript
浅谈Jquery为元素绑定事件
2015/04/27 Javascript
JQuery实现简单的图片滑动切换特效
2015/11/22 Javascript
总结十个Angular.js由浅入深的面试问题
2016/08/26 Javascript
详解angular element()方法使用
2017/04/08 Javascript
jQuery事件_动力节点Java学院整理
2017/07/05 jQuery
Js利用console计算代码运行时间的方法示例
2017/09/24 Javascript
基于vue2.0动态组件及render详解
2018/03/17 Javascript
vscode下vue项目中eslint的使用方法
2019/01/13 Javascript
今天 平安夜 Python 送你一顶圣诞帽 @微信官方
2017/12/25 Python
PyCharm代码整体缩进,反向缩进的方法
2018/06/25 Python
pygame游戏之旅 添加游戏介绍
2018/11/20 Python
Django框架使用内置方法实现登录功能详解
2019/06/12 Python
Python进程池Pool应用实例分析
2019/11/27 Python
python 实现将Numpy数组保存为图像
2020/01/09 Python
Python调用shell命令常用方法(4种)
2020/05/11 Python
keras 解决加载lstm+crf模型出错的问题
2020/06/10 Python
Python sublime安装及配置过程详解
2020/06/29 Python
python实现马丁策略回测3000只股票的实例代码
2021/01/22 Python
墨西哥网上超市:Superama
2018/07/10 全球购物
英国川宁茶官方网站:Twinings茶
2019/05/21 全球购物
SAZAC的动物连体衣和动物睡衣:Kigurumi Shop
2020/03/14 全球购物
小学庆六一活动方案
2014/02/28 职场文书
酒店圣诞节活动总结
2015/05/06 职场文书
幼儿园2016圣诞节活动总结
2016/03/31 职场文书
Python图片验证码降噪和8邻域降噪
2021/08/30 Python