python ----- xml 命名空间与xpath详解

一、简介

本文章以如下xml 样例进行讲解命名空间和xpath

python 复制代码
xml_text="""<?xml version="1.0"?>
            <actors xmlns:fictional="http://characters.example.com"
                    xmlns="http://people.example.com">
                <actor>
                    <name>John Cleese</name>
                    <fictional:character>Lancelot</fictional:character>
                    <fictional:character>Archie Leach</fictional:character>
                </actor>
                <actor>
                    <name>Eric Idle</name>
                    <fictional:character>Sir Robin</fictional:character>
                    <fictional:character>Gunther</fictional:character>
                    <fictional:character>Commander Clement</fictional:character>
                </actor>
            </actors>"""

二、xml命名空间和find命令

xml中可以没有默认命名空间,但是如果要有,只能有一个默认命名空间;当一个xml使用了命名空间语法,则find/findall方法必须使用带有命名空间的调用方式否则无法查询数据。实例如下:

python 复制代码
root = ET.fromstring(xml_text)
for actor in root.findall('actor'):   # 结果为空
    name = actor.find('{http://people.example.com}name')
    print(name.text)
    for char in actor.findall('{http://characters.example.com}character'):
        print(' |-->', char.text)
python 复制代码
find(match, namespaces=None)
findall(match, namespaces=None)

其中的namespaces是一个dict类型或者一个空字符串,使用方式如下:

python 复制代码
ns1={'role1':'url1'}
find('role1:tag1',ns1)  #查询命名空间在url1的tag1

实例如下:

python 复制代码
ns = {'real_person': 'http://people.example.com',
      'role': 'http://characters.example.com'}

for actor in root.findall('real_person:actor', ns):
    name = actor.find('real_person:name', ns)
    print(name.text)
    for char in actor.findall('role:character', ns):
        print(' |-->', char.text)

或者

python 复制代码
find('{url1}tag1')  #查询命名空间在url1的tag1

实例如下:

python 复制代码
root = fromstring(xml_text)
for actor in root.findall('{http://people.example.com}actor'):
    name = actor.find('{http://people.example.com}name')
    print(name.text)
    for char in actor.findall('{http://characters.example.com}character'):
        print(' |-->', char.text)

三、xpath详解

语法 示例 说明
tag find("tag1") 查询标签为tag1的第一层子元素;spam/tag1 查询标签为spam的第一层子元素下的tag1标签
// find(".//a") 其中.是必须的,否则会报错;该语句会返回当前元素下的所有级别上的a标签,(不包含当前元素)
* find("*") 查询当前级别下的所有子元素,*/egg 查询当前层级下grandchild elements为egg的元素
position 位置是指当前层级下第一层子元素的位置,0代表第一个,1代表第二个,依此类推,-1代表倒数第二个

注意: 谓词(方括号内的表达式)前面必须有标记名称、星号或其他谓词。position 谓词前面必须有一个标记名称。

2、实践

find(*)

python 复制代码
xml_text1="<a name1='a1'><a name2='a2'><a name3='a3'></a></a><a name2_1='a2_1'><a name3_1='a3_1'></a></a></a>"
root1 = ET.fromstring(xml_text1)
for a in root1.findall('*'):
    print(a.attrib)
    
PS C:\Users\love1\Documents\technology\python\project\test1> python .\test-xml.py
{'name2': 'a2'}
{'name2_1': 'a2_1'}

child elements 第一层子元素

grandchild elements 第二层子元素

subelements 所有子元素

on all levels beneath the current element 在当前元素下的所有级别上

引用

python xml xpath

相关推荐
WWJA王文举10 分钟前
FreeRTOS事件组和任务通知详解:为什么任务通知比队列更轻量?
开发语言·php
Rnan-prince17 分钟前
堆与TopK · 从零到通透 —— 9 节全系列复盘
python·算法
wuyk5551 小时前
12.归并排序:分治思想的稳定排序算法
开发语言·数据结构·算法·排序算法
吴声子夜歌1 小时前
ApacheCommons——commons-text(模板替换与文本算法)
java·开发语言·算法·apache
2601_962294611 小时前
Python接口自动化测试实战:使用requests库
python·接口自动化测试·异常处理·requests库·api测试
砚底藏山河2 小时前
【量化纯GET实战 #23】多股票相关性:用收益率看板块联动
java·数据库·python·金融·数据分析
阿童木写作2 小时前
跨境电商翻译工具推荐:批量图片翻译+视频字幕实时翻译
人工智能·python·音视频
晶捷软件2 小时前
晶捷智能:集团型制造企业ERP如何实现多工厂统一管控
大数据·人工智能·python·制造
oyguyteggytrrwwwrt2 小时前
闵可夫斯基差演示
python
智购科技无人售货机工厂店2 小时前
2026自动售货机大屏交互设计原则:从信息层级到视觉动线的工程实践~YH
运维·python·单片机·嵌入式硬件·自动化·交互