编程 Python

python操作xml文件详细介绍

Posted in Python onJune 09, 2014

关于python读取xml文章很多，但大多文章都是贴一个xml文件，然后再贴个处理文件的代码。这样并不利于初学者的学习，希望这篇文章可以更通俗易懂的教如何使用python 来读取xml 文件。

一、什么是xml？

xml即可扩展标记语言，它可以用来标记数据、定义数据类型，是一种允许用户对自己的标记语言进行定义的源语言。

abc.xml

<?xml version="1.0" encoding="utf-8"?>

<catalog>

    <maxid>4</maxid>

    <login username="pytest" passwd='123456'>

        <caption>Python</caption>

        <item id="4">

            <caption>测试</caption>

        </item>

    </login>

    <item id="2">

        <caption>Zope</caption>

    </item>

</catalog>

Ok ,从结构上，它很像我们常见的HTML超文本标记语言。但他们被设计的目的是不同的，超文本标记语言被设计用来显示数据，其焦点是数据的外观。它被设计用来传输和存储数据，其焦点是数据的内容。

那么它有如下特征：

首先，它是有标签对组成，<aa></aa>

标签可以有属性：<aa id='123'></aa>

标签对可以嵌入数据：<aa>abc</aa>

标签可以嵌入子标签（具有层级关系）：

二、获得标签属性

那么，下面来介绍如何用python来读取这种类型的文件。

#coding=utf-8

import  xml.dom.minidom
#打开xml文档

dom = xml.dom.minidom.parse('abc.xml')
#得到文档元素对象

root = dom.documentElement

print root.nodeName

print root.nodeValue

print root.nodeType

print root.ELEMENT_NODE

mxl.dom.minidom 模块被用来处理xml文件，所以要先引入。

xml.dom.minidom.parse() 用于打开一个xml文件，并将这个文件对象dom变量。

documentElement 用于得到dom对象的文档元素，并把获得的对象给root

每一个结点都有它的nodeName，nodeValue，nodeType属性。

nodeName为结点名字。

nodeValue是结点的值，只对文本结点有效。

nodeType是结点的类型。catalog是ELEMENT_NODE类型

现在有以下几种：

'ATTRIBUTE_NODE'
'CDATA_SECTION_NODE'
'COMMENT_NODE'
'DOCUMENT_FRAGMENT_NODE'
'DOCUMENT_NODE'
'DOCUMENT_TYPE_NODE'
'ELEMENT_NODE'
'ENTITY_NODE'
'ENTITY_REFERENCE_NODE'
'NOTATION_NODE'
'PROCESSING_INSTRUCTION_NODE'
'TEXT_NODE'

三、获得子标签

现在要获得catalog的子标签以的标签name

<?xml version="1.0" encoding="utf-8"?>

<catalog>

       <maxid>4</maxid>

       <login username="pytest" passwd='123456'>

            <caption>Python</caption>

             <item id="4">

                    <caption>测试</caption>

            </item>

    </login>

    <item id="2">

            <caption>Zope</caption>

    </item>

</catalog>

对于知道元素名字的子元素，可以使用getElementsByTagName方法获取：

#coding=utf-8

import  xml.dom.minidom
#打开xml文档

dom = xml.dom.minidom.parse('abc.xml')
#得到文档元素对象

root = dom.documentElement
bb = root.getElementsByTagName('maxid')

b= bb[0]

print b.nodeName
bb = root.getElementsByTagName('login')

b= bb[0]

print b.nodeName

如何区分相同标签名字的标签：

<?xml version="1.0" encoding="utf-8"?>

<catalog>

       <maxid>4</maxid>

       <login username="pytest" passwd='123456'>

            <caption>Python</caption>

             <item id="4">

                    <caption>测试</caption>

            </item>

    </login>

    <item id="2">

            <caption>Zope</caption>

    </item>

</catalog>

<caption>和<item>标签不止一个如何区分？

#coding=utf-8

import  xml.dom.minidom
#打开xml文档

dom = xml.dom.minidom.parse('abc.xml')
#得到文档元素对象

root = dom.documentElement
bb = root.getElementsByTagName('caption')

b= bb[2]

print b.nodeName
bb = root.getElementsByTagName('item')

b= bb[1]

print b.nodeName

root.getElementsByTagName('caption') 获得的是标签为caption 一组标签，b[0]表示一组标签中的第一个；b[2] ，表示这一组标签中的第三个。

四、获得标签属性值

<?xml version="1.0" encoding="utf-8"?>

<catalog>

       <maxid>4</maxid>

       <login username="pytest" passwd='123456'>

            <caption>Python</caption>

             <item id="4">

                    <caption>测试</caption>

            </item>

    </login>

    <item id="2">

            <caption>Zope</caption>

    </item>

</catalog>

<login>和<item>标签是有属性的，如何获得他们的属性？

#coding=utf-8

import  xml.dom.minidom
#打开xml文档

dom = xml.dom.minidom.parse('abc.xml')
#得到文档元素对象

root = dom.documentElement
itemlist = root.getElementsByTagName('login')

item = itemlist[0]

un=item.getAttribute("username")

print un

pd=item.getAttribute("passwd")

print pd
ii = root.getElementsByTagName('item')

i1 = ii[0]

i=i1.getAttribute("id")

print i
i2 = ii[1]

i=i2.getAttribute("id")

print i

getAttribute方法可以获得元素的属性所对应的值。

五、获得标签对之间的数据

<?xml version="1.0" encoding="utf-8"?>

<catalog>

       <maxid>4</maxid>

       <login username="pytest" passwd='123456'>

            <caption>Python</caption>

             <item id="4">

                    <caption>测试</caption>

            </item>

    </login>

    <item id="2">

            <caption>Zope</caption>

    </item>

</catalog>

<caption>标签对之间是有数据的，如何获得这些数据？

获得标签对之间的数据有多种方法，

方法一：

#coding=utf-8

import  xml.dom.minidom
#打开xml文档

dom = xml.dom.minidom.parse('abc.xml')
#得到文档元素对象

root = dom.documentElement
cc=dom.getElementsByTagName('caption')

c1=cc[0]

print c1.firstChild.data
c2=cc[1]

print c2.firstChild.data
c3=cc[2]

print c3.firstChild.data

firstChild 属性返回被选节点的第一个子节点，.data表示获取该节点人数据。

方法二：

#coding=utf-8

from xml.etree import ElementTree as ET

per=ET.parse('abc.xml')

p=per.findall('./login/item')
for oneper in p:

    for child in oneper.getchildren():

        print child.tag,':',child.text


p=per.findall('./item')
for oneper in p:

    for child in oneper.getchildren():

        print child.tag,':',child.text

方法二有点复杂，所引用模块也与前面的不一样，findall用于指定在哪一级标签下开始遍历。

getchildren方法按照文档顺序返回所有子标签。并输出标签名（child.tag）和标签的数据（child.text）

其实，方法二的作用不在于此，它核心功能是可以遍历某一级标签下的所有子标签。

python操作xml文件详细介绍

- Author -

junjie

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

在Python中调用ggplot的三种方法

Apr 08 Python

Python进阶篇之字典操作总结

Nov 16 Python

python实现神经网络感知器算法

Dec 20 Python

实例详解Matlab 与 Python 的区别

Apr 26 Python

Python中print和return的作用及区别解析

May 05 Python

对Python强大的可变参数传递机制详解

Jun 13 Python

用Python从0开始实现一个中文拼音输入法的思路详解

Jul 20 Python

Django MEDIA的配置及用法详解

Jul 25 Python

python自动化unittest yaml使用过程解析

Feb 03 Python

基于nexus3配置Python仓库过程详解

Jun 15 Python

MoviePy常用剪辑类及Python视频剪辑自动化

Dec 18 Python

Python Pygame实现俄罗斯方块

Feb 19 Python

实例讲解python函数式编程

Jun 09 #Python

理解python多线程（python多线程简明教程）

Jun 09 #Python

Python高级应用实例对比：高效计算大文件中的最长行的长度

Jun 08 #Python

Python实例分享：快速查找出被挂马的文件

Jun 08 #Python

python小技巧之批量抓取美女图片

Jun 06 #Python

Python学习笔记（二）基础语法

Jun 06 #Python

pycharm 使用心得（九）解决No Python interpreter selected的问题

Jun 06 #Python

You might like

如何开发一个虚拟域名系统

2006/10/09 PHP

PHP 第三节变量介绍

2012/04/28 PHP

PHP实现的汉字拼音转换和公历农历转换类及使用示例

2014/07/01 PHP

PHP使用GETDATE获取当前日期时间作为一个关联数组的方法

2015/03/19 PHP

PHP与SQL语句常用大全

2016/12/10 PHP

PHP+MySQL实现模糊查询员工信息功能示例

2018/06/01 PHP

关于PHP5.6+版本“No input file specified”问题的解决

2019/12/11 PHP

从零开始学习jQuery (二) 万能的选择器

2010/10/01 Javascript

Extjs407 getValue()和getRawValue()区别介绍

2013/05/21 Javascript

Js 导出table内容到Excel的简单实例

2013/11/19 Javascript

JavaScript支持的最大递归调用次数分析

2014/06/24 Javascript

js锁屏解屏通过对$.ajax进行封装实现

2014/07/31 Javascript

使用jquery.qrcode生成彩色二维码实例

2014/08/08 Javascript

JavaScript实现拖拽元素对齐到网格（每次移动固定距离）

2016/11/30 Javascript

JavaScript原型继承_动力节点Java学院整理

2017/06/30 Javascript

JavaScript多线程运行库Nexus.js详解

2017/12/22 Javascript

前端MVVM框架解析之双向绑定

2018/01/24 Javascript

全站最详细的Vuex教程

2018/04/13 Javascript

vue.js绑定事件监听器示例【基于v-on事件绑定】

2018/07/07 Javascript

React注册倒计时功能的实现

2018/09/06 Javascript

你可能从未使用过的11+个JavaScript特性(小结)

2020/01/08 Javascript

基于javascript实现日历功能原理及代码实例

2020/05/07 Javascript

Swiper实现导航栏滚动效果

2020/10/16 Javascript

JS算法教程之字符串去重与字符串反转

2020/12/15 Javascript

[56:42]VP vs RNG 2019国际邀请赛小组赛 BO2 第二场 8.15

2019/08/17 DOTA

python爬虫中get和post方法介绍以及cookie作用

2018/02/08 Python

破解安装Pycharm的方法

2018/10/19 Python

pycharm远程开发项目的实现步骤

2019/01/20 Python

如何在Django项目中引入静态文件

2019/07/26 Python

Python3操作MongoDB增册改查等方法详解

2020/02/10 Python

linux系统下pip升级报错的解决方法

2021/01/31 Python

python和opencv构建运动检测器的实现

2021/03/03 Python

优秀员工自荐信范文

2013/10/05 职场文书

党员教师群众路线对照检查材料思想汇报

2014/09/29 职场文书

党员专题组织生活会发言材料

2014/10/17 职场文书

跟班学习心得体会（共6篇）

2016/01/23 职场文书