编程 Python

Python爬虫基础之XPath语法与lxml库的用法详解

Posted in Python onSeptember 13, 2018

前言

本来打算写的标题是XPath语法，但是想了一下Python中的解析库lxml，使用的是Xpath语法，同样也是效率比较高的解析方法，所以就写成了XPath语法和lxml库的用法

XPath 即为 XML 路径语言，它是一种用来确定 XML（标准通用标记语言的子集）文档中某部分位置的语言。

XPath 基于 XML 的树状结构，提供在数据结构树中找寻节点的能力。 XPath 同样也支持HTML。

XPath 是一门小型的查询语言。

python 中 lxml库使用的是 Xpath 语法，是效率比较高的解析方法。

下面话不多说了，来一起看看详细的介绍吧

安装

为什么要用这个库呢，因为要写爬虫啊，利用lxml库来解析 HTML 代码，同时lxml也继承了libxml2的特性自动修正HTML代码，利用pip安装即可

pip install lxml

XPath语法

XPath是一门在XML文档中查找信息的语言，可以用于在XML文档中通过元素和属性进行导航

举个栗子 ?

我们可以使用XPath提取网站地图中的所有链接，也就是说可以使用XPath去找我们HTML中的一些具体的东西

节点关系

在XPath中，有七种类型的节点：元素、属性、文本、命名空间、处理指令、注释以及文档节点（或称为根节点）

再举个栗子 ?

<urlset>
<url>
<loc>https://qq52o.me</loc>
<lastmod>2018-04-28T19:00:42+00:00</lastmod>
<changefreq>daily</changefreq>
<priority>1.0</priority>
</url>
</urlset>

第一个：父（Parent）

每个元素以及属性都有一个父

url元素是 loc、lastmod、changefreq以及 priority元素的父

第二个：子（Children）

元素节点可有零个、一个或多个子

loc、lastmod、changefreq以及 priority元素都是url元素的子

第三个：同胞（Sibling）

拥有相同的父的节点

loc、lastmod、changefreq以及 priority元素都是url元素的同胞

第四个：先辈（Ancestor）

某节点的父、父的父，等等

loc元素的先辈是 url元素和 urlset元素

第五个：后代（Descendant）

某个节点的子，子的子，等等

urlset的后代是url、loc、lastmod、changefreq以及 priority元素

如果你分不清楚，就按照子元素从上到下的去找元素节点

选取节点

XPath使用路径表达式在 XML 文档中选取节点，节点是通过沿着路径或者 step 来选取的，也就是上面所说的按照子元素从上到下去找元素节点

这些是最有用的路径表达式 ?

表达式	描述
nodename	选取此节点的所有子节点
/	从根节点选取
//	从匹配选择的当前节点选择文档中的节点，而不考虑它们的位置
.	选取当前节点
..	选取当前节点的父节点
@	选取属性

实例

路径表达式	结果
urlset	选取urlset元素的所有子节点
/urlset	选取根元素 urlset
urlset/url	选取属于urlset的子元素的所有url元素
//url	选取所有url子元素，而不管它们在文档中的位置
urlset//url	选择属于urlset元素的后代的所有url元素，而不管它们位于urlset之下的什么位置
//@href	选取名为href的所有属性

其他XPath语法请参考w3school

XPath实例测试

提取本站网站地图中id属性为content的的子元素h3的内容以及子元素a的href属性，F12去看代码找这个属性

Python爬虫基础之XPath语法与lxml库的用法详解

div的id属性，下面的子元素h3的内容，直接利用 text 方法来获取元素的内容，然后输出

Python爬虫基础之XPath语法与lxml库的用法详解

这里的子元素层级关系必须按顺序写好，不然会报错的

IndexError: list index out of range

这就说明你的XPath规则没写好，list是一个空的，没有一个元素

XPath 是一个非常好用的解析方法，同时也是作为爬虫学习的基础

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作具有一定的参考学习价值，如果有疑问大家可以留言交流，谢谢大家对三水点靠木的支持。

Python爬虫基础之XPath语法与lxml库的用法详解

- Author -

qq52o

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

Python中datetime常用时间处理方法

Jun 15 Python

详解Python的Flask框架中的signals信号机制

Jun 13 Python

Python第三方库xlrd/xlwt的安装与读写Excel表格

Jan 21 Python

Python操作使用MySQL数据库的实例代码

May 25 Python

使用pandas模块读取csv文件和excel表格,并用matplotlib画图的方法

Jun 22 Python

python 实现求解字符串集的最长公共前缀方法

Jul 20 Python

在python2.7中用numpy.reshape 对图像进行切割的方法

Dec 05 Python

Appium Python自动化测试之环境搭建的步骤

Jan 23 Python

python实现批量注册网站用户的示例

Feb 22 Python

Pytorch 实现自定义参数层的例子

Aug 17 Python

Python 文件操作之读取文件(read)，文件指针与写入文件(write)，文件打开方式示例

Sep 29 Python

Python使用scapy模块发包收包

May 07 Python

Python爬虫常用小技巧之设置代理IP

Sep 13 #Python

python集合比较(交集,并集,差集)方法详解

Sep 13 #Python

python中dict字典的查询键值对遍历排序创建访问更新删除基础操作方法

Sep 13 #Python

Python字典创建遍历添加等实用基础操作技巧

Sep 13 #Python

python单例模式获取IP代理的方法详解

Sep 13 #Python

如何利用python制作时间戳转换工具详解

Sep 12 #Python

Python get获取页面cookie代码实例

Sep 12 #Python

You might like

咖啡豆分级制度咖啡豆等级分类咖啡豆是按口感分类的吗？

2021/03/05 新手入门

PHP面向对象之旅:深入理解static变量与方法

2014/01/06 PHP

PHP数字和字符串ID互转函数（类似优酷ID）

2014/06/30 PHP

如何用PHP做到页面注册审核

2017/03/02 PHP

Redis构建分布式锁

2017/03/28 PHP

jQuery Ajax 全解析

2009/02/08 Javascript

js 跨域和ajax 跨域问题小结

2009/07/01 Javascript

js 实现复制到粘贴板的功能代码

2010/05/13 Javascript

给artDialog 5.02 增加ajax get功能详细介绍

2012/11/13 Javascript

Javascript 中 null、NaN和undefined的区别总结

2013/04/10 Javascript

使用Math.floor与Math.random取随机整数的方法详解

2013/05/07 Javascript

巧用replace将文字表情替换为图片

2014/04/17 Javascript

JavaScript中用字面量创建对象介绍

2014/12/31 Javascript

jquery自定义表格样式

2015/11/23 Javascript

three.js绘制地球、飞机与轨迹的效果示例

2017/02/28 Javascript

详解Vue-Router源码分析路由实现原理

2019/05/15 Javascript

vue结合el-upload实现腾讯云视频上传功能

2020/07/01 Javascript

JavaScript实现像雪花一样的Hexaflake分形

2020/07/07 Javascript

python字典序问题实例

2014/09/26 Python

利用pyinstaller或virtualenv将python程序打包详解

2017/03/22 Python

一行代码让 Python 的运行速度提高100倍

2018/10/08 Python

django-rest-framework 自定义swagger过程详解

2019/07/18 Python

Python unittest装饰器实现原理及代码

2020/09/08 Python

巴西网上药房：onofre

2016/11/21 全球购物

柯基袜：Corgi Socks

2017/01/26 全球购物

聪明的粉丝购买门票的地方：TickPick

2018/03/09 全球购物

英国最大的运动营养公司之一：LA Muscle

2018/07/02 全球购物

ｅ路東瀛(JAPANiCAN)香港：日本旅游、日本酒店和温泉旅馆预订

2018/11/21 全球购物

运动鞋、街头服装、手表和手袋的实时市场：StockX

2020/11/25 全球购物

下列程序在32位linux或unix中的结果是什么

2015/01/26 面试题

建筑工程技术应届生自荐信

2013/09/27 职场文书

建筑工程专业学生的自我评价

2013/12/25 职场文书

安全宣传标语口号

2014/06/06 职场文书

2015年高一班主任工作总结

2015/05/13 职场文书

德生2P3收音机开箱评测

2022/04/30 无线电

Python 序列化反序列化和异常处理的问题小结

2022/12/24 Python