Python selenium爬取微博数据代码实例


Posted in Python onMay 22, 2020

爬取某人的微博数据,把某人所有时间段的微博数据都爬下来。

具体思路:

创建driver-----get网页----找到并提取信息-----保存csv----翻页----get网页(开始循环)----...----没有“下一页”就结束,

用了while True,没用自我调用函数

嘟大海的微博:https://weibo.com/u/1623915527

办公室小野的微博:https://weibo.com/bgsxy

代码如下

from selenium import webdriver
from selenium.webdriver.common.keys import Keys
import csv
import os
import time
 
#只有这2个参数设置,想爬谁的微博数据就在这里改地址和目标csv名称就行
weibo_url = 'https://weibo.com/bgsxy?profile_ftype=1&is_all=1#_0'
csv_name = 'bgsxy_allweibo.csv'
 
def start_chrome():
  print('开始创建浏览器')
  driver = webdriver.Chrome(executable_path='C:/Users/lori/Desktop/python52project/chromedriver_win32/chromedriver.exe')
  driver.start_client()
  return driver
 
def get_web(url):   #获取网页,并下拉到最底部
  print('开始打开指定网页')
  driver.get(url)
  time.sleep(7)
  scoll_down()
  time.sleep(5)
 
def scoll_down():  # 滚轮下拉到最底部
  html_page = driver.find_element_by_tag_name('html')
  for i in range(7):
    print(i)
    html_page.send_keys(Keys.END)
    time.sleep(1)
 
def get_data():
  print('开始查找并提取数据')
  card_sel = 'div.WB_cardwrap.WB_feed_type'
  time_sel = 'a.S_txt2[node-type="feed_list_item_date"]'
  source_sel = 'a.S_txt2[suda-uatrack="key=profile_feed&value=pubfrom_guest"]'
  content_sel = 'div.WB_text.W_f14'
  interact_sel = 'span.line.S_line1>span>em:nth-child(2)'
 
  cards = driver.find_elements_by_css_selector(card_sel)
  info_list = []
 
  for card in cards:
    time = card.find_elements_by_css_selector(time_sel)[0].text #虽然有可能在一个card中有2个time元素,我们取第一个就对
    if card.find_elements_by_css_selector(source_sel):
      source = card.find_elements_by_css_selector(source_sel)[0].text
    else:
      source = ''
    content = card.find_elements_by_css_selector(content_sel)[0].text
    link = card.find_elements_by_css_selector(time_sel)[0].get_attribute('href')
    trans = card.find_elements_by_css_selector(interact_sel)[1].text
    comment = card.find_elements_by_css_selector(interact_sel)[2].text
    like = card.find_elements_by_css_selector(interact_sel)[3].text
    info_list.append([time,source,content,link,trans,comment,like])
 
  return info_list
 
def save_csv(info_list,csv_name):
  csv_path = './' + csv_name
  print('开始写入csv文件')
  if os.path.exists(csv_path):
    with open(csv_path,'a',newline='',encoding='utf-8-sig') as f: #newline=''避免空行;encoding='utf-8-sig'比utf8牛,保存中文没问题
      writer = csv.writer(f)
      writer.writerows(info_list)
  else:
    with open(csv_path,'w+',newline='',encoding='utf-8-sig') as f:
      writer = csv.writer(f)
      writer.writerow(['发布时间','来源','内容','链接','转发数','评论数','点赞数'])
      writer.writerows(info_list)
  time.sleep(5)
 
def next_page_url():
  next_page_sel = 'a.page.next'
  next_page_ele = driver.find_elements_by_css_selector(next_page_sel)
  if next_page_ele:
    return next_page_ele[0].get_attribute('href')
  else:
    return None
 
 
driver = start_chrome()
input('请在chrome中登录weibo.com')   # 暂停程序,手动登录weibo.com
 
while True:
  get_web(weibo_url)
  info_list = get_data()
  save_csv(info_list,csv_name)
  if next_page_url():
    weibo_url = next_page_url()
  else:
    print('爬取结束')
    break

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持三水点靠木。

Python 相关文章推荐
Python datetime时间格式化去掉前导0
Jul 31 Python
python中lambda与def用法对比实例分析
Apr 30 Python
windows系统下Python环境的搭建(Aptana Studio)
Mar 06 Python
python3+selenium实现126邮箱登陆并发送邮件功能
Jan 23 Python
python三大神器之fabric使用教程
Jun 10 Python
Python利用pandas处理Excel数据的应用详解
Jun 18 Python
解决Djang2.0.1中的reverse导入失败的问题
Aug 16 Python
python3应用windows api对后台程序窗口及桌面截图并保存的方法
Aug 27 Python
Python使用Pandas库常见操作详解
Jan 16 Python
Python 字符串处理特殊空格\xc2\xa0\t\n Non-breaking space
Feb 23 Python
Python + opencv对拍照得到的图片进行背景去除的实现方法
Nov 18 Python
pycharm 如何取消连按两下shift出现的全局搜索
Jan 15 Python
python实现文法左递归的消除方法
May 22 #Python
使用Django搭建网站实现商品分页功能
May 22 #Python
Tensorflow卷积实现原理+手写python代码实现卷积教程
May 22 #Python
Python实现发票自动校核微信机器人的方法
May 22 #Python
基于django micro搭建网站实现加水印功能
May 22 #Python
基于Tensorflow一维卷积用法详解
May 22 #Python
Python参数传递机制传值和传引用原理详解
May 22 #Python
You might like
层叠菜单的动态生成
2006/10/09 PHP
在PHP中使用灵巧的体系结构
2006/10/09 PHP
一个可以找出源代码中所有中文的工具
2006/10/25 PHP
获取URL文件名后缀
2013/10/24 PHP
yii框架使用分页的方法分析
2019/07/25 PHP
IE中jscript/javascript的条件编译
2006/09/07 Javascript
jQuery实现平滑滚动到指定锚点的方法
2015/03/20 Javascript
使用C++为node.js写扩展模块
2015/04/22 Javascript
浅谈javascript中基本包装类型
2015/06/03 Javascript
jQuery使用$.ajax提交表单完整实例
2015/12/11 Javascript
使用微信内置浏览器点击下拉框出现页面乱跳转现象(iphone),该怎么办
2016/01/04 Javascript
javascript数组定义的几种方法
2017/10/06 Javascript
Vue.js+Layer表格数据绑定与实现更新的实例
2018/03/07 Javascript
微信小程序实现团购或秒杀批量倒计时
2020/11/01 Javascript
解决vue的变量在settimeout内部效果失效的问题
2018/08/30 Javascript
详解vue数组遍历方法forEach和map的原理解析和实际应用
2018/11/15 Javascript
vue基础之事件简写、事件对象、冒泡、默认行为、键盘事件实例分析
2019/03/11 Javascript
vue.js实现备忘录demo
2019/06/26 Javascript
H5实现手机拍照和选择上传功能
2019/12/18 Javascript
[01:02:20]Mineski vs TNC 2019国际邀请赛小组赛 BO2 第二场 8.15
2019/08/16 DOTA
Python 流程控制实例代码
2009/09/25 Python
在Python中使用列表生成式的教程
2015/04/27 Python
Python实现批量检测HTTP服务的状态
2016/10/27 Python
使用python验证代理ip是否可用的实现方法
2018/07/25 Python
Python如何获取文件指定行的内容
2020/05/27 Python
新手常见Python错误及异常解决处理方案
2020/06/18 Python
canvas绘制太极图的实现示例
2020/04/29 HTML / CSS
韩国女装NO.1网店:STYLENANDA
2016/09/16 全球购物
PUMA官方商城:世界领先的运动品牌之一
2016/11/16 全球购物
英国剑桥包中文官网:The Cambridge Satchel Company中国
2018/11/06 全球购物
澳大利亚女装精品店:Alannah Hill
2020/07/29 全球购物
设计毕业生简历中的自我评价
2013/10/01 职场文书
面包店的创业计划书范文
2014/01/16 职场文书
教师个人成长总结
2015/02/11 职场文书
敬老院活动感想
2015/08/07 职场文书
Python可变集合和不可变集合的构造方法大全
2021/12/06 Python