编程 Python

python爬取亚马逊书籍信息代码分享

Posted in Python onDecember 09, 2017

我有个需求就是抓取一些简单的书籍信息存储到mysql数据库，例如，封面图片，书名，类型，作者，简历，出版社，语种。

我比较之后，决定在亚马逊来实现我的需求。

我分析网站后发现，亚马逊有个高级搜索的功能，我就通过该搜索结果来获取书籍的详情URL。

由于亚马逊的高级搜索是用get方法的，所以通过分析，搜索结果的URL，可得到node参数是代表书籍类型的。field-binding_browse-bin是代表书籍装饰。

所以我固定了书籍装饰为平装，而书籍的类型，只能每次运行的时候，爬取一种类型的书籍难过

之后就是根据书籍详情页面利用正则表达式来匹配需要的信息了。

以下源代码，命名不是很规范。。。

import requests
import sys
import re
import pymysql

class product:
  type="历史"
  name=""
  author=""
  desciption=""
  pic1=""
  languages=""
  press=""

def getProUrl():
  urlList = []
  headers = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36"}
  session = requests.Session()
  furl="https://www.amazon.cn/gp/search/ref=sr_adv_b/?search-alias=stripbooks&field-binding_browse-bin=2038564051&sort=relevancerank&page="
  for i in range(1,7):
    html=""
    print(furl+str(i)) 
    html = session.post(furl+str(i)+'&node=658418051',headers = headers)
    html.encoding = 'utf-8'
    s=html.text.encode('gb2312','ignore').decode('gb2312')
    url=r'</li><li id=".*?" data-asin="(.+?)" class="s-result-item celwidget">'
    reg=re.compile(url,re.M)
    items = reg.findall(html.text)
    for i in range(0,len(items)):
      urlList.append(items[i])
  urlList=set(urlList)
  return urlList

def getProData(url):
  pro = product()
  headers = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36"}
  session = requests.Session()
  zurl="https://www.amazon.cn/dp/"
  html = session.get(zurl+url,headers = headers)
  html.encoding = 'utf-8'
  s=html.text.encode('gb2312','ignore').decode('gb2312')
  pro.pic1=getProPic(html)
  pro.name=getProName(html)
  pro.author=getProAuthor(html)
  pro.desciption=getProDescrip(html)
  pro.press=getProPress(html)
  pro.languages=getProLanguages(html)
  return pro

def getProPic(html):
  pic=r'id="imgBlkFront" data-a-dynamic-image="{"(.+?)".*?}"'
  reg=re.compile(pic,re.M)
  items = reg.findall(html.text)
  if len(items)==0:
    return ""
  else:
    return items[0]

def getProName(html):
  name=r'<div class="ma-title"><p class="wraptext goto-top">(.+?)<span'
  reg=re.compile(name,re.M)
  items = reg.findall(html.text)
  if len(items)==0:
    return ""
  else:
    return items[0]

def getProAuthor(html):
  author=r'<span class="author.{0,20}" data-width="".{0,30}>.*?<a class="a-link-normal" href=".*?books" rel="external nofollow" >(.+?)</a>.*?<span class="a-color-secondary">(.+?)</span>'
  reg=re.compile(author,re.S)
  items = reg.findall(html.text)
  au=""
  for i in range(0,len(items)):
    au=au+items[i][0]+items[i][1]
  return au

def getProDescrip(html):
  Descrip=r'<noscript>.{0,30}<div>(.+?)</div>.{0,30}<em></em>.{0,30}</noscript>.{0,30}<div id="outer_postBodyPS"'
  reg=re.compile(Descrip,re.S)
  items = reg.findall(html.text)
  if len(items)==0:
    return ""
  else:
    position = items[0].find('海报：')
    descrip=items[0]
    if position != -1:
      descrip=items[0][0:position]
    return descrip.strip()

def getProPress(html):
  press=r'<li><b>出版社:</b>(.+?)</li>'
  reg=re.compile(press,re.M)
  items = reg.findall(html.text)
  if len(items)==0:
    return ""
  else:
    return items[0].strip()


def getProLanguages(html):
  languages=r'<li><b>语种：</b>(.+?)</li>'
  reg=re.compile(languages,re.M)
  items = reg.findall(html.text)
  if len(items)==0:
    return ""
  else:
    return items[0].strip()

def getConnection():
  config = {
     'host':'121.**.**.**',
     'port':3306,
     'user':'root',
     'password':'******',
     'db':'home_work',
     'charset':'utf8',
     'cursorclass':pymysql.cursors.DictCursor,
     }
  connection = pymysql.connect(**config)
  return connection

urlList = getProUrl()
i = 0
for d in urlList:
  i = i + 1
  print (i)
  connection = getConnection()
  pro = getProData(d)
  try:
    with connection.cursor() as cursor:
      sql='INSERT INTO books (type,name,author,desciption,pic1,languages,press) VALUES (%s,%s,%s,%s,%s,%s,%s)'
      cursor.execute(sql,(pro.type,pro.name,pro.author,pro.desciption,pro.pic1,pro.languages,pro.press))
    connection.commit()
  finally:
    connection.close();

总结

以上就是本文关于python爬取亚马逊书籍信息代码分享的全部内容，希望对大家有所帮助。感兴趣的朋友可以继续参阅本站：

如有不足之处，欢迎留言指出。感谢朋友们对本站的支持！

python爬取亚马逊书籍信息代码分享

- Author -

天下醉闲

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

Python中删除文件的程序代码

Mar 13 Python

Python中lambda的用法及其与def的区别解析

Jul 28 Python

Python中的各种装饰器详解

Apr 11 Python

win10环境下python3.5安装步骤图文教程

Feb 03 Python

Python中正则表达式详解

May 17 Python

使用django-crontab实现定时任务的示例

Feb 26 Python

djang常用查询SQL语句的使用代码

Feb 15 Python

Django框架登录加上验证码校验实现验证功能示例

May 23 Python

python中web框架的自定义创建

Sep 08 Python

简单了解如何封装自己的Python包

Jul 08 Python

python将下载到本地m3u8视频合成MP4的代码详解

Nov 24 Python

Python与C++中梯度方向直方图的实现

Mar 17 Python

matplotlib在python上绘制3D散点图实例详解

Dec 09 #Python

K-近邻算法的python实现代码分享

Dec 09 #Python

Python数据可视化编程通过Matplotlib创建散点图代码示例

Dec 09 #Python

python学习之matplotlib绘制散点图实例

Dec 09 #Python

Python学习pygal绘制线图代码分享

Dec 09 #Python

Python编程pygal绘图实例之XY线

Dec 09 #Python

同时安装Python2 & Python3 cmd下版本自由选择的方法

Dec 09 #Python

You might like

4.与数据库的连接

2006/10/09 PHP

php 随机排序广告的实现代码

2011/05/09 PHP

php 网上商城促销设计实例代码

2012/02/17 PHP

基于PHP CURL获取邮箱地址的详解

2013/06/03 PHP

php中使用getimagesize获取图片、flash等文件的尺寸信息实例

2014/04/29 PHP

php结合安卓客户端实现查询交互实例

2015/05/05 PHP

PHP输出多个元素的排列或组合的方法

2017/03/14 PHP

php使用fputcsv实现大数据的导出操作详解

2020/02/27 PHP

做网页的一些技巧（续）

2007/02/01 Javascript

基于jquery & json的省市区联动代码

2012/06/26 Javascript

动态的改变IFrame的高度实现IFrame自动伸展适应高度

2012/12/28 Javascript

Area 区域实现post提交数据的js写法

2014/04/22 Javascript

分享一个原生的JavaScript拖动方法

2016/09/25 Javascript

JS识别浏览器类型(电脑浏览器和手机浏览器)

2016/11/18 Javascript

Node调用Java的示例代码

2017/09/20 Javascript

JS小球抛物线轨迹运动的两种实现方法详解

2017/12/20 Javascript

vue.js中$set与数组更新方法

2018/03/08 Javascript

一次微信小程序内地图的使用实战记录

2019/09/09 Javascript

微信小程序如何实现点击图片放大功能

2020/01/21 Javascript

vue的webcamjs集成方式

2020/11/16 Javascript

vue element el-transfer增加拖拽功能

2021/01/15 Vue.js

[36:43]NB vs Optic 2018国际邀请赛小组赛BO1 B组加赛 8.19

2018/08/21 DOTA

Django实现跨域的2种方法

2019/07/31 Python

Django应用程序入口WSGIHandler源码解析

2019/08/05 Python

python_array[0][0]与array[0,0]的区别详解

2020/02/18 Python

Python selenium模块实现定位过程解析

2020/07/09 Python

Html5实现如何在两个div元素之间拖放图像

2013/03/29 HTML / CSS

欧洲最大的球衣网上商店：Kitbag

2017/11/11 全球购物

英国鲜花递送：Blossoming Gifts

2020/07/10 全球购物

在数据文件自动增长时，自动增长是否会阻塞对文件的更新

2014/05/01 面试题

EJB的基本架构

2016/09/22 面试题

中专毕业生个人职业生涯规划

2014/02/19 职场文书

大班幼儿评语大全

2014/04/30 职场文书

文言文辞职信

2015/02/28 职场文书

2015年社区环境卫生工作总结

2015/04/21 职场文书

人民的好儿女观后感

2015/06/18 职场文书