找回密码
 用户注册

QQ登录

只需一步,快速开始

查看: 3890|回复: 0

python对XML的解析

[复制链接]
发表于 2012-2-17 13:45:04 | 显示全部楼层 |阅读模式
python有三种方法解析XML,SAX,DOM,以及ElementTree
###1.SAX (simple API for XML )
       pyhton 标准库包含SAX解析器,SAX是一种典型的极为快速的工具,在解析XML时,不会占用大量内存。
但是这是基于回调机制的,因此在某些数据中,它会调用某些方法进行传递。这意味着必须为数据指定句柄,
以维持自己的状态,这是非常困难的。


###2.DOM(Document Object Model)
       与SAX比较,DOM典型的缺点是比较慢,消耗更多的内存,因为DOM会将整个XML数读入内存中,并为树
中的第一个节点建立一个对象。使用DOM的好处是你不需要对状态进行追踪,因为每一个节点都知道谁是它的
父节点,谁是子节点。但是DOM用起来有些麻烦。


###3.ElementTree(元素树)
     ElementTree就像一个轻量级的DOM,具有方便友好的API。代码可用性好,速度快,消耗内存少,这里主要
介绍ElementTree。


下面是一个转载的例子:
test.xml如下:<?xml version="1.0" encoding="utf-8"?>
  1. <root>
  2. <person age="18">
  3.     <name>hzj</name>
  4.     <sex>man</sex>
  5. </person>
  6. <person age="19" des="hello">
  7.     <name>kiki</name>
  8.     <sex>female</sex>
  9. </person>
  10. </root>
复制代码

1.加载xml文件
    加载XML文件共有2种方法,一是加载指定字符串,二是加载指定文件
2.获取element的方法
  a) 通过getiterator
  b) 过 getchildren
  c) find方法
  d) findall方法#-*- coding:utf-8 -*-
  1. from xml.etree import ElementTree
  2. def print_node(node):
  3.     '''打印结点基本信息'''
  4.     print "=============================================="
  5.     print "node.attrib:%s" % node.attrib
  6.     if node.attrib.has_key("age") > 0 :
  7.         print "node.attrib['age']:%s" % node.attrib['age']
  8.     print "node.tag:%s" % node.tag
  9.     print "node.text:%s" % node.text
  10. def read_xml(text):
  11.     '''读xml文件'''
  12.     # 加载XML文件(2种方法,一是加载指定字符串,二是加载指定文件)   
  13.     # root = ElementTree.parse(r"D:/test.xml")
  14.     root = ElementTree.fromstring(text)
  15.    
  16.     # 获取element的方法
  17.     # 1 通过getiterator
  18.     lst_node = root.getiterator("person")
  19.     for node in lst_node:
  20.         print_node(node)
  21.         
  22.     # 2通过 getchildren
  23.     lst_node_child = lst_node[0].getchildren()[0]
  24.     print_node(lst_node_child)
  25.         
  26.     # 3 .find方法
  27.     node_find = root.find('person')
  28.     print_node(node_find)
  29.    
  30.     #4. findall方法
  31.     node_findall = root.findall("person/name")[1]
  32.     print_node(node_findall)
  33.    
  34. if __name__ == '__main__':
  35.      read_xml(open("test.xml").read())
复制代码


想想为什么?不明白,请看下面
  1. #encoding=utf-8
  2. from xml.etree import ElementTree as ET
  3. #要找出所有人的年龄
  4. per=ET.parse('test.xml')
  5. p=per.findall('/person')
  6. for x in p:
  7.     print x.attrib
  8. print
  9. for oneper in p:  #找出person节点
  10.     for child in oneper.getchildren(): #找出person节点的子节点
  11.         print child.tag,':',child.text
  12.     print 'age:',oneper.get('age')
  13.     print '############'
复制代码
结果如下:{'age': '18'}
  1. {'age': '19', 'des': 'hello'}
  2. name : hzj
  3. sex : man
  4. age: 18
  5. ############
  6. name : kiki
  7. sex : female
  8. age: 19
  9. ############
复制代码


作者:yueguanghaidao 发表于2012-2-16 20:09:49 原文链接

您需要登录后才可以回帖 登录 | 用户注册

本版积分规则

Archiver|手机版|小黑屋|ACE Developer ( 京ICP备06055248号 )

GMT+8, 2024-12-23 03:20 , Processed in 0.017479 second(s), 6 queries , Redis On.

Powered by Discuz! X3.5

© 2001-2023 Discuz! Team.

快速回复 返回顶部 返回列表