Selenium 模拟浏览器动态加载页面的实现方法


Posted in Python onMay 16, 2018

相信爬取大公司的数据时,常常会遇到页面信息动态加载的问题,

如果仅仅使用content = urllib2.urlopen(URL).read(),估计信息是获取不全的,这时候就需要模拟浏览器加载页面的过程,

selenium提供了方便的方法,我也是菜鸟,试了很多种方式,下面提供觉得最靠谱的(已经证明对于爬取新浪微博的topic、twitter under topic完全没问题)。

至于下面的browser变量是什么,看前面的几篇文章。

首先是请求对应的URL:

right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App) 
print right_URL 
try: 
browser.get(right_URL) 
print "loading more, sleep 3 seconds ... 0" 
time.sleep(3) # NO need for this sleep, but we add ... 
browser = selenuim_loading_more(browser, method_index=0) 
except: 
print "one exception happen ==> get_tweeter_under_topic 2 ..." 
pass

然后模拟浏览器,加载更多(推荐使用method_index=0,已经证明比其他好用很多):

def selenuim_loading_more(browser, method_index=0): 
  if method_index==0: 
    browser.implicitly_wait(3) # 为了快速滑动,先设置超时时间为1秒 
    # while True: 
    for i in range(1, 4): # at most 3 times 
      print "loading more, window.scrollTo bettom for the", i,"time ..." 
      browser.execute_script("window.scrollTo(0,document.body.scrollHeight);") 
      try: 
        # 定位页面底部的换页tab 
        browser.find_element_by_css_selector("div[class='W_pages']") 
        break # 如果没抛出异常就说明找到了底部标志,跳出循环 
      except NoSuchElementException: 
        pass # 抛出异常说明没找到底部标志,继续向下滑动 
    browser.implicitly_wait(4) # 将超时时间改回10秒 
  elif method_index==1: 
    browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more 
    print "loading more, sleep 4 seconds ... 1" 
    time.sleep(4) 
    browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more 
    print "loading more, sleep 3 seconds ... 2" 
    time.sleep(2) 
  elif method_index==2: 
    load_more_1 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more         
    ActionChains(browser).click(load_more_1).perform() 
    print "loading more, sleep 4 seconds ... 1" 
    time.sleep(4) 
    load_more_2 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more         
    ActionChains(browser).click(load_more_2).perform() 
    print "loading more, sleep 3 seconds ... 2" 
    time.sleep(2) 
  elif method_index==3: 
    print "loading more, sleep 4 seconds ... 1" 
    element = WebDriverWait(browser, 4).until( 
      EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']")) 
    ) 
    element.click() 
    print "loading more, sleep 2 seconds ... 2" 
    WebDriverWait(browser, 2).until( 
      EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']")) 
    ).click() 
  return browser

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持三水点靠木。

Python 相关文章推荐
Python实现微信公众平台自定义菜单实例
Mar 20 Python
Python绑定方法与非绑定方法详解
Aug 18 Python
python利用rsa库做公钥解密的方法教程
Dec 10 Python
浅谈Python采集网页时正则表达式匹配换行符的问题
Dec 20 Python
Appium+Python自动化测试之运行App程序示例
Jan 23 Python
django的聚合函数和aggregate、annotate方法使用详解
Jul 23 Python
Kears+Opencv实现简单人脸识别
Aug 28 Python
Python reshape的用法及多个二维数组合并为三维数组的实例
Feb 07 Python
Python递归调用实现数字累加的代码
Feb 25 Python
python+requests接口自动化框架的实现
Aug 31 Python
Python实现自动整理文件的脚本
Dec 17 Python
Python绘制词云图之可视化神器pyecharts的方法
Feb 23 Python
Python selenium实现微博自动登录的示例代码
May 16 #Python
Python实现统计给定字符串中重复模式最高子串功能示例
May 16 #Python
Python(Django)项目与Apache的管理交互的方法
May 16 #Python
Python检测网络延迟的代码
May 15 #Python
在windows下Python打印彩色字体的方法
May 15 #Python
一条命令解决mac版本python IDLE不能输入中文问题
May 15 #Python
Python切片索引用法示例
May 15 #Python
You might like
php横向重复区域显示二法
2008/09/25 PHP
PHP 一个页面执行时间类代码
2010/03/05 PHP
PHP中文URL编解码(urlencode()rawurlencode()
2010/07/03 PHP
PHP图片验证码制作实现分享(全)
2012/05/10 PHP
谈谈关于php的优点与缺点
2013/04/11 PHP
PHP中preg_match函数正则匹配的字符串长度问题
2015/05/27 PHP
JavaScript 组件之旅(二)编码实现和算法
2009/10/28 Javascript
PhotoShop给图片自动添加边框及EXIF信息的JS脚本
2015/02/15 Javascript
js数组去重的5种算法实现
2015/11/04 Javascript
ichart.js绘制虚线、平均分虚线效果的实现代码
2016/05/05 Javascript
Vue实现PopupWindow组件详解
2018/04/28 Javascript
JS实现显示当前日期的实例代码
2018/07/03 Javascript
vue中使用极验验证码的方法(附demo)
2019/12/04 Javascript
[59:59]EG vs IG 2018国际邀请赛小组赛BO2 第二场 8.16
2018/08/17 DOTA
Python实现二分查找算法实例
2015/05/26 Python
使用Python的Bottle框架写一个简单的服务接口的示例
2015/08/25 Python
python学习之编写查询ip程序
2016/02/27 Python
Python进阶-函数默认参数(详解)
2017/05/18 Python
对python以16进制打印字节数组的方法详解
2019/01/24 Python
Python 串口读写的实现方法
2019/06/12 Python
Python实现 PS 图像调整中的亮度调整
2019/06/28 Python
python几种常用功能实现代码实例
2019/12/25 Python
分享一个页面平滑滚动小技巧(推荐)
2019/10/23 HTML / CSS
俄罗斯和世界各地的酒店预订:Hotels.com俄罗斯
2016/08/19 全球购物
一个C/C++编程面试题
2013/11/10 面试题
会计专业自我鉴定范文
2013/10/06 职场文书
电气工程师岗位职责
2014/01/01 职场文书
产品促销活动策划书
2014/01/15 职场文书
查摆剖析材料范文
2014/09/30 职场文书
乡镇党的群众路线教育实践活动剖析材料
2014/10/09 职场文书
设立有限责任公司出资协议书
2014/11/01 职场文书
社会治安综合治理责任书
2015/01/29 职场文书
酒店优秀员工推荐信
2015/03/24 职场文书
公安机关起诉意见书
2015/05/20 职场文书
酒吧七夕情人节宣传语
2015/11/24 职场文书
告诉你一个秘密:富人致富的五大优点
2019/07/11 职场文书