Python爬虫基础之XPath语法与lxml库的用法详解


Posted in Python onSeptember 13, 2018

前言

本来打算写的标题是XPath语法,但是想了一下Python中的解析库lxml,使用的是Xpath语法,同样也是效率比较高的解析方法,所以就写成了XPath语法和lxml库的用法

XPath 即为 XML 路径语言,它是一种用来确定 XML(标准通用标记语言的子集)文档中某部分位置的语言。

XPath 基于 XML 的树状结构,提供在数据结构树中找寻节点的能力。 XPath 同样也支持HTML。

XPath 是一门小型的查询语言。

python 中 lxml库 使用的是 Xpath 语法,是效率比较高的解析方法。

下面话不多说了,来一起看看详细的介绍吧

安装

为什么要用这个库呢,因为要写爬虫啊,利用lxml库来解析 HTML 代码,同时lxml也继承了libxml2的特性自动修正HTML代码,利用pip安装即可

pip install lxml

XPath语法

XPath是一门在XML文档中查找信息的语言,可以用于在XML文档中通过元素和属性进行导航

举个栗子 ?

我们可以使用XPath提取网站地图中的所有链接,也就是说可以使用XPath去找我们HTML中的一些具体的东西

节点关系

在XPath中,有七种类型的节点:元素、属性、文本、命名空间、处理指令、注释以及文档节点(或称为根节点)

再举个栗子 ?

<urlset>
<url>
<loc>https://qq52o.me</loc>
<lastmod>2018-04-28T19:00:42+00:00</lastmod>
<changefreq>daily</changefreq>
<priority>1.0</priority>
</url>
</urlset>

第一个:父(Parent)

每个元素以及属性都有一个父

url元素是 loc、lastmod、changefreq以及 priority元素的父

第二个:子(Children)

元素节点可有零个、一个或多个子

loc、lastmod、changefreq以及 priority元素都是url元素的子

第三个:同胞(Sibling)

拥有相同的父的节点

loc、lastmod、changefreq以及 priority元素都是url元素的同胞

第四个:先辈(Ancestor)

某节点的父、父的父,等等

loc元素的先辈是 url元素和 urlset元素

第五个:后代(Descendant)

某个节点的子,子的子,等等

urlset的后代是url、loc、lastmod、changefreq以及 priority元素

如果你分不清楚,就按照子元素从上到下的去找元素节点

选取节点

XPath使用路径表达式在 XML 文档中选取节点,节点是通过沿着路径或者 step 来选取的,也就是上面所说的按照子元素从上到下去找元素节点

这些是最有用的路径表达式 ?

表达式 描述
nodename 选取此节点的所有子节点
/ 从根节点选取
// 从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置
. 选取当前节点
.. 选取当前节点的父节点
@ 选取属性

实例

路径表达式 结果
urlset 选取urlset元素的所有子节点
/urlset 选取根元素 urlset
urlset/url 选取属于urlset的子元素的所有url元素
//url 选取所有url子元素,而不管它们在文档中的位置
urlset//url 选择属于urlset元素的后代的所有url元素,而不管它们位于urlset之下的什么位置
//@href 选取名为href的所有属性

其他XPath语法请参考w3school

XPath实例测试

提取本站网站地图中id属性为content的的子元素h3的内容以及子元素a的href属性,F12去看代码找这个属性

Python爬虫基础之XPath语法与lxml库的用法详解

div的id属性,下面的子元素h3的内容,直接利用 text 方法来获取元素的内容,然后输出

Python爬虫基础之XPath语法与lxml库的用法详解

这里的子元素层级关系必须按顺序写好,不然会报错的

IndexError: list index out of range

这就说明你的XPath规则没写好,list是一个空的,没有一个元素

XPath 是一个非常好用的解析方法,同时也是作为爬虫学习的基础

总结

以上就是这篇文章的全部内容了,希望本文的内容对大家的学习或者工作具有一定的参考学习价值,如果有疑问大家可以留言交流,谢谢大家对三水点靠木的支持。

Python 相关文章推荐
python将xml xsl文件生成html文件存储示例讲解
Dec 03 Python
通过C++学习Python
Jan 20 Python
Python中的zipfile模块使用详解
Jun 25 Python
Python2.7基于淘宝接口获取IP地址所在地理位置的方法【测试可用】
Jun 07 Python
利用python实现xml与数据库读取转换的方法
Jun 17 Python
Python实现完整的事务操作示例
Jun 20 Python
用matplotlib画等高线图详解
Dec 14 Python
python 剪切移动文件的实现代码
Aug 02 Python
python  Django中的apps.py的目的是什么
Oct 15 Python
Python实现动态给类和对象添加属性和方法操作示例
Feb 29 Python
Python无损压缩图片的示例代码
Aug 06 Python
python使用re模块爬取豆瓣Top250电影
Oct 20 Python
Python爬虫常用小技巧之设置代理IP
Sep 13 #Python
python集合比较(交集,并集,差集)方法详解
Sep 13 #Python
python中dict字典的查询键值对 遍历 排序 创建 访问 更新 删除基础操作方法
Sep 13 #Python
Python字典创建 遍历 添加等实用基础操作技巧
Sep 13 #Python
python单例模式获取IP代理的方法详解
Sep 13 #Python
如何利用python制作时间戳转换工具详解
Sep 12 #Python
Python get获取页面cookie代码实例
Sep 12 #Python
You might like
在MongoDB中模拟Auto Increment的php代码
2011/03/06 PHP
PHP警告Cannot use a scalar value as an array的解决方法
2012/01/11 PHP
php 中的4种标记风格介绍
2012/05/10 PHP
php 判断数组是几维数组
2013/03/20 PHP
php实现可用于mysql,mssql,pg数据库操作类
2014/12/13 PHP
Ubuntu下安装PHP的mongodb扩展操作命令
2015/07/04 PHP
PHP使用fopen与file_get_contents读取文件实例分享
2016/03/04 PHP
禁止js文件缓存的代码
2010/04/09 Javascript
顶部缓冲下拉菜单导航特效的JS代码
2013/08/27 Javascript
最佳的JavaScript错误处理实践
2016/07/16 Javascript
Bootstrap轮播图的使用和理解4
2016/12/14 Javascript
JS设计模式之命令模式概念与用法分析
2018/02/06 Javascript
Python使用CMD模块更优雅的运行脚本
2015/05/11 Python
Selenium 模拟浏览器动态加载页面的实现方法
2018/05/16 Python
python smtplib发送带附件邮件小程序
2018/05/22 Python
Python定义二叉树及4种遍历方法实例详解
2018/07/05 Python
python3 小数位的四舍五入(用两种方法解决round 遇5不进)
2019/04/11 Python
解决Pycharm 导入其他文件夹源码的2种方法
2020/02/12 Python
Python接口自动化测试的实现
2020/08/28 Python
css3实现文字扫光渐变动画效果的示例
2017/11/07 HTML / CSS
澳大利亚吉他在线:Artist Guitars
2017/03/30 全球购物
Jimmy Choo美国官网:周仰杰鞋子品牌
2018/06/08 全球购物
香港交友网站:be2香港
2018/07/22 全球购物
Ramy Brook官网:美国现代女装品牌
2019/06/18 全球购物
夜大毕业自我鉴定
2013/10/11 职场文书
公司总经理工作职责管理办法
2014/02/28 职场文书
教师节活动主持词
2014/04/02 职场文书
3分钟演讲稿
2014/04/30 职场文书
个人租房协议书样本
2014/10/01 职场文书
党校学习党性分析材料
2014/12/19 职场文书
写给媳妇的检讨书
2015/05/06 职场文书
债务纠纷起诉书
2015/05/20 职场文书
美容院员工规章制度
2015/08/05 职场文书
婚宴祝酒词大全
2015/08/10 职场文书
不会写演讲稿,快来看看这篇文章!
2019/08/06 职场文书
微信小程序APP页面的之间的相互传递参数以及自定义组件
2022/04/19 Javascript