爬虫-xpath篇

1.xpath的基础语法

表达式 描述
nodename 选中该元素
/ 从根节点选取、或者是元素和元素间的过渡
// 从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置
. 选取当前节点
... 选取当前节点的父节点
@ 选取属性
text() 选取文本

举例:

路径表达式 结果
html 选择html元素
/html 选取根元素 html。注释:假如路径起始于正斜杠( / ),则此路径始终代表到某元素的绝对路径!
/html/body/ul/li 选取属于 ul的子元素的所有 li元素
//li 选取所有 li元素,而不管它们在文档中的位置
/html//li 选择属于 html元素的后代的所有 li元素,而不管它们位于 html之下的什么位置
//li//a/@href 选择所有的li下面的a标签中的href属性的值
//li//a/text() 选择所有的li下面的a标签的文本

2. 寻找特定节点:

路径表达式 结果
//span[@class="s2"] 选择class属性值为s2的所有span标签
//ul/li[1] 选取属于 ul子标签的第一个 li标签
//ul/li[last()] 选取属于 ul子标签的最后一个 li标签
//ul/li[last()-1] 选取属于 ul子标签的倒数第二个 li标签
//ul/li[position()>1] 选择ul下面的li标签,从第二个开始选择
//li/span/a[text()='无墟极道'] 选择所有li下的span标签,仅仅选择文本为 无墟极道 的a标签

敲黑板: 在xpath中,第一个元素的位置是1,最后一个元素的位置是last(),倒数第二个是last()-1


以上仅供参考,实用才是王道
重点在这here!!!
一.在大多数标准网站中对于文本 的提取

一般只需:相对标签+class属性值

eg.提取喜马拉雅的发现页面的书名
//span[@class='v-m T_G']

  1. 通过开发者工具定位一个书名的位置
    2.黄色标记部分即为所提取的内容
    二.对于链接 的提取一般只需:相对标签+class属性值+标签中内容所在的属性值

eg.提取喜马拉雅的发现页面的书籍封面链接
//img[@class='img _hW']/@src

  1. 通过开发者工具定位一个图片链接的位置
    (如果图片没刚好定位到链接位置也会定位在临近的地方)
    2. 上方xpath右框内的内容即为所提取的封面图片链接
    (可能会不以协议名开头,浏览器访问会自动加上,如果非浏览器需要自己加上)
相关推荐
cdbqss11 小时前
VB2026 菜单生成基类 BqGetMenuStrip
数据库·经验分享·学习·oracle·vb
智者知已应修善业2 小时前
【51单片机8位数码管动态显示日期小数点风格】2023-11-13
c++·经验分享·笔记·算法·51单片机
智者知已应修善业2 小时前
【51单片机有三个LED 分别第一个灯闪三下 再到第二个灯又闪三下 再到第三个灯又闪三下 就这样循环程序】2023-11-16
c++·经验分享·笔记·算法·51单片机
暴躁小师兄数据学院2 小时前
【AI大数据工程师特训笔记】第04讲:PostgreSQL 数据库内置函数详解
大数据·数据库·笔记·ai·语言模型
熊猫不是猫QAQ3 小时前
NAS上的文字版《星露谷物语》,大型种田经营游戏
经验分享
z落落5 小时前
C# 数组 最终完整版全套笔记(一维+多维+交错+引用类型+对象数组)
java·笔记·c#
searchforAI5 小时前
B站视频转笔记用哪个工具?2026年四款AI笔记工具对比实测
人工智能·经验分享·笔记·gpt·学习·视频总结·ai笔记
RainCity6 小时前
Java Swing 自定义组件库分享(九)
java·笔记·后端
05候补工程师6 小时前
【408考研·数据结构专题】二叉树、树与森林、线索树及哈夫曼树核心考点与秒杀技巧深度总结
数据结构·经验分享·笔记·考研·算法
louiseailife6 小时前
从规则引擎到大模型驱动:财务自动化的技术演进路径
经验分享