Python爬虫实例爬取网站搞笑段子


Posted in Python onNovember 08, 2017

众所周知,python是写爬虫的利器,今天作者用python写一个小爬虫爬下一个段子网站的众多段子。

目标段子网站为“http://ishuo.cn/”,我们先分析其下段子的所在子页的url特点,可以轻易发现发现为“http://ishuo.cn/subject/”+数字,

经过测试发现,该网站的反扒机制薄弱,可以轻易地爬遍其所有站点。

现在利用python的re及urllib库将其所有段子扒下

import sys
import re
import urllib
#返回html格式
def gethtml(url):
  page=urllib.urlopen(url)
  html=page.read()
  return html
def getmessage(html):
  p=re.compile(r'<div class="content">(.*)</div><script type="text/javascript">')
  #对段子内容进行正则匹配
  message=re.findall(p,html)#返回正则匹配的结果
  return message
fp=open('data.txt','w+')
#实际范围比1~7000要大,因为时间原因这里暂定为1~7000
for i in range(1,7000):
  i=str(i)
  web=gethtml('http://ishuo.cn/subject/'+i)
  #该网站段子的链接特点
  message=getmessage(web)
  message2=''.join(message)#将结果转换为字符串类型
  #message2=message2.decode('utf8','strict')
  message2=str(message2)
  print message2
  fp.writelines(message2+'\n')
  #将爬下的众多段子写入文件中
fp.close()

 data.txt收录了其中爬下段子的结果:

收录的部分结果如下:

【韩寒】明明下流的人,凑一起就叫上流社会? 
日子过不下去的时候,我就得向钱看!只有当日子过滋润了,我才能够向前看!
某公司一群基层员工年底聚会,没有加薪没有升职连年终奖金都被取消了,打算借酒浇愁一回。有人带了瓶酒来,大家一看那酒的名字,眼泪就都扑簌簌地往下掉开了,还有人顿时抱头痛哭了一场。那酒的名字叫老白干。
【段子】群里听到的段子,太乐了:路上听到一大叔情绪激动地打电话:对!国足进3个球了!没错!是男足!没错没错!是和韩国比赛!什么?对方?对对对!对方也是男足!
 
一女士向闺蜜诉说,他结婚原因:他向我求婚,我说跟我结婚,没门!我还没发昏到那程度!后来,他就用石头把我碰昏了!我就傻了,死心塌地跟他结婚了!闺蜜说:你不告他,反而跟他结婚,真是发昏了!他用什么石头碰的你呀?女士说:他用钻石!
【冷笑话】一男子提着一个皮包,挤上了公共汽车,车上人拥挤,一小偷用刀片割其皮包,窃其财物。一勇敢女子见状偷偷的提醒身边的男士,但由于紧张,说道:“先生,有人要割你的包皮”……
【段子】外交部工作:周一表示不满;周二抗议;周三强烈谴责;周四严正交涉;周五深表遗憾。周六、周日休息。
经考证孔子是经济学家,有其语为证: 三十而立--三十两银子只能站着听课; 四十不惑--四十两就能一直问到没疑问为止; 五十知天命--五十两就能知道明天考试命题; 六十耳顺--六十两老师会说你喜欢听的话,七十而从心所欲-七十两你来不来、学习的怎么样都随便了。
班车上,坐在身边的一位美女同事睡着了,竟然打起呼噜,觉得这样很丢脸,就用手轻推她,只见她喃喃的说:不要了老公,明天吧。
【太尖锐】蒙古国是个纯内陆国,却有个海军部。中国老大哥很好奇地问:”你们连海都没有,搞什么海军部!?”蒙古人回答道:”你们不也有文化部么?!”
一女程序员征婚:SELECT * FROM 男人 WHERE 未婚=true and 有房=true and 有车=true and 条件 in (‘大方',\'绅士',\'会做家务\',\'帅气\',\'最好还能带孩子') 一资深的程序员回复:(0 row(s) affected)
【小笑话】孔子,孟子,老子三人同时在猪圈睡了一夜之后,发现母猪怀孕了,经DNA检验证明,肯定不是孔子干的,也不是孟子干的,请问,那是谁干的?
【冷笑话】一妓深夜应召,路遇巡警,巡警大喝:谁?干什么的?女回应:妓者!巡警肃然起敬,柔和问道:那个报社的?女答:“和男晚抱”!大笑而去!
无聊的最高境界是什么?摆渡结果如下: 1、对着镜子,数自己的头发; 2、拿着剃刀等胡子长出来; 3、跟正吸你血的蚊子聊天; 4、看着天花板上的污渍,把它想成山水画; 5、给N年以前的报纸校对错别字; 6、喝一大杯水,然后坐到马桶上去等着。
【经典语录】当我要找我崇拜的人的时候,我就照镜子。 —— 李敖
看过冬奥会冰壶比赛后,一大妈逢人便说:“你看这外国奥运会的志愿者就是不一般啊,擦地每一个都擦得那么认真……”
【胡歌】我眼中的世界从未如此纯净 我的左手边是一面雪白的墙 我的右手边是一面和左手边一样的墙 我的前边有一扇门 从那里出去可以看到更多白花花的墙 虽然已是午夜时分 窗外却分外敞亮 我后边的万家灯火足以照亮此时白白的墙 我是不是疯了?
【冷笑话】:单位有个同事,蒙古人,属于常魂游天外的大神级人物。一年休假回家,假期过了好几天还不回来,领导给打电话,丫在电话里说:领导,我还在呼伦贝尔草原上骑马找我家呢,我家是游牧民族,现在不知道搬到哪里了。#搞笑#
【地名简述】一次历史考试,有一道题是让同学们任选十个国家或地区,并加以简述。 一个学生是这样答的:从前有个柬埔寨,里面有个阿拉伯。一天,他带着墨西哥去爬山,爬到新加坡时,突然来了只头上长着好望角的巴拿马,吓出一身阿富汗,拔腿跑进名古屋急忙关也门,结果碰掉了一颗葡萄牙。
【幽默说婆媳】为什么天底下最难搞的关系是婆媳关系?1.媳妇的别称是“新娘”,一个新的娘突然来到家里,旧的娘心里能好受吗?2.婆婆用了五年的时间教会儿子穿衣服,媳妇用不到五秒钟就能让儿子把衣服脱光,这是一种怎样的心理落差?
在一个泼水节上,大家都开心疯狂的相互泼水,突然有一个人破口大骂:“他妈的,谁在泼我”。旁边的人说他,你干嘛骂人啊,人泼你是对你的祝福啊!这个人气急败坏的说:你知道什么?哪个王八蛋是用开水在泼我!
1、一定要把多余的房子卖掉,#地震#来了才知道,原来不动产也是会动的,而且动起来吓死人。 2、余震就象打麻将,如果半天没什么动静,就绝对是在整大的! 3、看余震的心情就象初恋少女看情人,既怕他不来又怕他乱来!
【冷笑话】1.一居室,求合租,面议。2.小事招魂,大事挖坟。3.我觉得我还可以抢救一下!4.提供鞭尸服务,一次100!5.基因重组中,请稍候二十年6.单挑冥王哈迪斯中,征求组队!7.当你看清这行字的时候:朋友,你踩到我了。8.老子终于不用怕鬼了!9.给爷笑一个,要不爷给你笑一个?
局长发短信给女秘书:想死你了,在国际酒店1203号房,快来!却不小心按了群发键。片刻,回复分至。女秘书:德性,干嘛猴急!女科长:领导,今天不方便,改天吧!男副局长:不知道你也是同志啊?女部下:马上到!对门王姐:今天老公在家,明天行吗?女副局长:你才想起我呀?老婆:回来啊!还浪费那钱!
爱情和婚姻就像老黑熊掰玉米棒子,不要指望你能掰到最大和最好的,要挑自己最喜欢最满意的掰一个,掰到了就不要在去在掰了。要不然就会掰来掰去掰了个最小的最不喜欢的回来。
【小偷也幽默】相对两户人家,一户防盗门,一户普通木门。一天,防盗门这家失窃,发现#小偷#在普通木门门口留下了纸条:你相信我,我也相信你。
[强人语录]:世界上最远的距离.不是生与死.而是我在电信你在网通
世界上最远的距离,不是树与树的距离,而是同根生长的树枝,却无法在风中相依。(~ o ~)~zZ
世界上最远的距离是啥?是两个人到了边境,你过去了,我护照忘带了。。
温总理语录:“一个人不管有多聪明,多能干,背景条件有多好,如果不懂得如何去做人、做事,那么他最终的结局肯定是失败。做人做事是一门艺术,更是一门学问。很多人之所以一辈子都碌碌无为,那是因为他活了一辈子都没有弄明白该怎样去做人做事。”
【极品冷笑话】:刘若英向周杰伦求婚,居然遭拒!!!周董深情地说:“奶茶,我更喜欢优乐美!”
你知道哪两种水果居然有手机?--“萝卜青菜,各有索爱。”
糗事百科:“我站起身来给一孕妇让座,她疑惑地看了看我,忽然明白过来,哭笑不得道:同学,我这是胖!”
有些事,我们总是弄不懂;有些人,我们总是猜不透;有些道,我们总是悟不尽;有些理,我们总是想不通;有些坎,我们总是跨不过;有些伤,我们总是治不好;有些天,我们总是睡不着;有些地,我们总是去不了;有些情,我们总是说不出;有些爱,我们总是得不到。------人生十大困惑
六岁的小孩第一次观赏电视里的芭蕾舞,看到台上演员们踮著脚尖急转时,他禁不住问他的父亲:「他们为什麽不选些高个的女孩来跳呢?」
爱情就像白米饭,浪漫过程就像菜。人饿时,会想着吃饭。但吃完后,更多人喜欢去评论菜好不好吃,而忽略白米饭。
用别人的智慧充实自己,不用别人的智慧贬低自己;用别人的成功激励自己,不用别人的成功折磨自己;用别人的错误提醒自己,不用别人的错误娱乐自己。
【老婆和情人的差别】老婆会告诉男人青菜多少钱一斤,情人会告诉男人夜空有多少颗星星。
【我可以等】狱吏问一个即将被处死的罪犯早餐想吃什么?罪犯说:我想吃桃子。狱吏:你知道,现在是冬天,哪有桃子!罪犯说:没关系,我可以等。

爬下的段子为编写如聊天机器人、公众号、段子发布点提供了丰富素材。

总结

以上就是本文关于Python爬虫实例爬取网站搞笑段子的全部内容,希望对大家有所帮助,感兴趣的朋友可以继续参阅本站:Python入门之三角函数全解【收藏】、python好玩的项目—色情图片识别代码分享、Python实现一个简单的验证码程序等,有什么问题可以随时留言,小编会及时回复大家的。

感谢朋友们对本站的支持!

Python 相关文章推荐
tornado捕获和处理404错误的方法
Feb 26 Python
Python写的创建文件夹自定义函数mkdir()
Aug 25 Python
Ubuntu 14.04+Django 1.7.1+Nginx+uwsgi部署教程
Nov 18 Python
列举Python中吸引人的一些特性
Apr 09 Python
Python实现识别手写数字大纲
Jan 29 Python
使用TensorFlow实现二分类的方法示例
Feb 05 Python
python爬虫基础教程:requests库(二)代码实例
Apr 09 Python
python3.6生成器yield用法实例分析
Aug 23 Python
python自动结束mysql慢查询会话的实例代码
Oct 27 Python
解决python对齐错误的方法
Jul 16 Python
Jupyter Notebook 远程访问配置详解
Jan 11 Python
用gpu训练好的神经网络,用tensorflow-cpu跑出错的原因及解决方案
Mar 03 Python
python执行使用shell命令方法分享
Nov 08 #Python
python通过socket实现多个连接并实现ssh功能详解
Nov 08 #Python
Python基础练习之用户登录实现代码分享
Nov 08 #Python
python实现简单中文词频统计示例
Nov 08 #Python
python中如何正确使用正则表达式的详细模式(Verbose mode expression)
Nov 08 #Python
python如何使用正则表达式的前向、后向搜索及前向搜索否定模式详解
Nov 08 #Python
Python入门之三角函数全解【收藏】
Nov 08 #Python
You might like
php split汉字
2009/06/05 PHP
PHP判断是否有Get参数的方法
2014/05/05 PHP
PHP的CURL方法curl_setopt()函数案例介绍(抓取网页,POST数据)
2016/12/14 PHP
CI框架(CodeIgniter)公共模型类定义与用法示例
2017/08/10 PHP
显示、隐藏密码
2006/07/01 Javascript
jQuery timers计时器简单应用说明
2010/10/28 Javascript
用客户端js实现带省略号的分页
2013/04/27 Javascript
JavaScript操作Oracle数据库示例
2015/03/06 Javascript
Jquery和angularjs获取check框选中的值的方法汇总
2016/01/17 Javascript
Node.js的文件权限及读写flag详解
2016/10/11 Javascript
jQuery实现简单的滑动导航代码(移动端)
2017/05/22 jQuery
基于 D3.js 绘制动态进度条的实例详解
2018/02/26 Javascript
微信小程序在地图选择地址并返回经纬度简单示例
2018/12/03 Javascript
说说Vue.js中的functional函数化组件的使用
2019/02/12 Javascript
vue组件中iview的modal组件爬坑问题之modal的显示与否应该是使用v-show
2019/04/12 Javascript
少女风vue组件库的制作全过程
2019/05/15 Javascript
laydate只显示时分 不显示秒的功能实现方法
2019/09/28 Javascript
解决Can't find variable: SockJS vue项目的问题
2020/09/22 Javascript
[26:52]LGD vs EG 2018国际邀请赛小组赛BO2 第一场 8.17
2018/08/18 DOTA
python关键字and和or用法实例
2015/05/28 Python
Python 实现引用其他.py文件中的类和类的方法
2018/04/29 Python
python 重定向获取真实url的方法
2018/05/11 Python
在python中安装basemap的教程
2018/09/20 Python
python实现将文件夹下面的不是以py文件结尾的文件都过滤掉的方法
2018/10/21 Python
python+os根据文件名自动生成文本
2019/03/21 Python
python3.7 利用函数os pandas利用excel对文件名进行归类
2019/09/29 Python
Python面向对象多态实现原理及代码实例
2020/09/16 Python
Python xmltodict模块安装及代码实例
2020/10/05 Python
浅析python连接数据库的重要事项
2021/02/22 Python
中国综合性网上购物商城:当当(网上卖书起家)
2016/11/16 全球购物
植物选择:Botanic Choice
2017/02/15 全球购物
英国乡村时尚和宠物用品专家:Pet & Country
2018/07/02 全球购物
毕业生个人求职信范文分享
2014/01/05 职场文书
致跳高运动员广播稿
2014/01/13 职场文书
内勤岗位职责
2015/02/10 职场文书
2019秋季运动会口号
2019/06/25 职场文书