python 爬取古诗文存入mysql数据库的方法


Posted in Python onJanuary 08, 2020

使用正则提取数据,请求库requests,看代码,在存入数据库时,报错ERROR 1054 (42S22): Unknown column ‘title' in ‘field list'。原来是我写sql 有问题,sql = “insert into poem(title,author,content,create_time) values({},{},{},{})”.format(title, author,content,crate_time)
应该写成sql = “insert into poem(title,author,content,create_time) values('{}','{}','{}','{}')”.format(title, author,content,crate_time)

把插入的值放入引号中。

import datetime
import re
import pymysql
import requests
url = "https://www.gushiwen.org/"
headers = {
 'User-Agent': "Mozilla/5.0 (Macintosh; U; Intel Mac OS X 10_6_8; en-us) AppleWebKit/534.50 (KHTML, like Gecko) Version/5.1 Safari/534.50"}
class Spiderpoem(object):
 conn = pymysql.Connect(host="localhost", port=3306, user="root", password='mysql', database='poem_data',
       charset="utf8")
 cs1 = conn.cursor()
 def get_requests(self, url, headers=None):
  """发送请求"""
  resp = requests.get(url, headers=headers)
  if resp.status_code == 200:
   # print(resp.request.headers)
   return resp.text
  return None
 def get_parse(self, response):
  """解析网页"""
  re_data = {
   "title": r'<div\sclass="sons">.*?<b>(.*?)</b>.*?</div>',
   "author": r'<p>.*?class="source">.*?<a.*?>(.*?)</a>.*?<a.*?>(.*?)</a>.*?</p>',
   "content": r'<div\sclass="contson".*?>(.*?)</div>'
  }
  titles = self.reg_con(re_data["title"], response)
  authors = self.reg_con(re_data["author"], response)
  poems_list = self.reg_con(re_data["content"], response)
  contents = list()
  for item in poems_list:
   ite = re.sub(r'<.*?>|\s', "", item)
   contents.append(ite.strip())
  for value in zip(titles, authors, contents):
   title, author, content = value
   author = "".join([author[0], '.', author[1]])
   poem = {
    "title": title,
    "author": author,
    "content": content
   }
   yield poem
 def reg_con(self, params, response):
  """正则匹配"""
  if not response:
   return "请求错误"
  param = re.compile(params, re.DOTALL) # re.DOTALL 匹配换行等价于re.S
  result = re.findall(param, response)
  return result
 @classmethod
 def save_data(cls, poem):
  title = poem.get("title")
  author = poem.get("author")
  content = poem.get("content")
  crate_time = datetime.datetime.now().strftime("%Y-%m-%d %H:%M:%S")
  sql = "insert into poem(title,author,content,create_time) values('{}','{}','{}','{}')".format(title, author,
                          content,
                          crate_time)
  count = cls.cs1.execute(sql)
  print(count)
  cls.conn.commit()
 def main(self):
  resp = self.get_requests(url, headers)
  for it in self.get_parse(resp):
   self.save_data(it)
  self.cs1.close()
  self.conn.close()
if __name__ == '__main__':
 Spiderpoem().main()

总结

以上所述是小编给大家介绍的python 爬取古诗文存入mysql数据库的方法,希望对大家有所帮助,如果大家有任何疑问请给我留言,小编会及时回复大家的。在此也非常感谢大家对三水点靠木网站的支持!
如果你觉得本文对你有帮助,欢迎转载,烦请注明出处,谢谢!

Python 相关文章推荐
跟老齐学Python之关于类的初步认识
Oct 11 Python
Python 序列的方法总结
Oct 18 Python
浅析Python3爬虫登录模拟
Feb 07 Python
解决Spyder中图片显示太小的问题
Apr 27 Python
python调用xlsxwriter创建xlsx的方法
May 03 Python
python tools实现视频的每一帧提取并保存
Mar 20 Python
python中单下划线(_)和双下划线(__)的特殊用法
Aug 29 Python
详解使用django-mama-cas快速搭建CAS服务的实现
Oct 30 Python
Python关于__name__属性的含义和作用详解
Feb 19 Python
python实现ftp文件传输系统(案例分析)
Mar 20 Python
Python函数默认参数常见问题及解决方案
Mar 26 Python
python实现简易版学生成绩管理系统
Jun 22 Python
基于python3抓取pinpoint应用信息入库
Jan 08 #Python
Python PyInstaller安装和使用教程详解
Jan 08 #Python
关于Pytorch的MLP模块实现方式
Jan 07 #Python
PyTorch 普通卷积和空洞卷积实例
Jan 07 #Python
Pytorch中膨胀卷积的用法详解
Jan 07 #Python
Python urlopen()和urlretrieve()用法解析
Jan 07 #Python
简单了解Django ORM常用字段类型及参数配置
Jan 07 #Python
You might like
PHP5.0正式发布 不完全兼容PHP4 新增多项功能
2006/10/09 PHP
PHP实现简单的新闻发布系统实例
2015/07/28 PHP
利用PHP扩展Xhprof分析项目性能实践教程
2018/09/05 PHP
php多进程中的阻塞与非阻塞操作实例分析
2020/03/04 PHP
javascript Firefox与IE 替换节点的方法
2010/02/24 Javascript
JavaScript function 的 length 属性使用介绍
2014/09/15 Javascript
jQuery中triggerHandler()方法用法实例
2015/01/19 Javascript
jQuery随机密码生成的方法
2015/03/09 Javascript
JavaScript操作cookie类实例
2015/03/31 Javascript
json实现添加、遍历与删除属性的方法
2016/06/17 Javascript
jQuery实现日期联动效果实例
2016/07/26 Javascript
DOM中事件处理概览与原理的全面解析
2016/08/16 Javascript
Bootstrap table的使用方法
2016/11/02 Javascript
微信小程序之前台循环数据绑定
2017/08/18 Javascript
JS+Canvas绘制动态时钟效果
2017/11/10 Javascript
深入理解node.js http模块
2018/01/24 Javascript
VUE 全局变量的几种实现方式
2018/08/22 Javascript
JavaScript对象的特性与实践应用深入详解
2018/12/30 Javascript
详解vue几种主动刷新的方法总结
2019/02/19 Javascript
简单学习5种处理Vue.js异常的方法
2019/06/17 Javascript
[42:39]老党炸弹人试玩视频
2014/09/03 DOTA
[54:10]Spirit vs NB Supermajor小组赛 A组败者组决赛 BO3 第一场 6.2
2018/06/03 DOTA
分享15个最受欢迎的Python开源框架
2014/07/13 Python
一道python走迷宫算法题
2018/01/22 Python
python判断一个数是否能被另一个整数整除的实例
2018/12/12 Python
python 2.7 检测一个网页是否能正常访问的方法
2018/12/26 Python
python3图片文件批量重命名处理
2019/10/31 Python
python 解决Fatal error in launcher:错误问题
2020/05/21 Python
python实现图像外边界跟踪操作
2020/07/13 Python
flask开启多线程的具体方法
2020/08/02 Python
scrapy-redis分布式爬虫的搭建过程(理论篇)
2020/09/29 Python
Overload和Override的区别。Overloaded的方法是否可以改变返回值的类型
2013/10/30 面试题
中学实习教师自我鉴定
2013/12/12 职场文书
自我鉴定总结
2014/03/24 职场文书
银行客户经理培训心得体会
2016/01/09 职场文书
MySQL令人咋舌的隐式转换
2021/04/05 MySQL