python爬虫-网页数据提取

python 复制代码
import requests
#headers = 网页右键->Network->最下面的User-Agent复制。
headers = {"user-agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/116.0.0.0 Safari/537.36"}
#你想要的网址
url = "https://www.xinpianchang.com/discover/article?from=navigator"
response = requests.get(url, headers=headers)
print(response)# 打印200 说明访问成功
#下面是正式的数据提取,构建xpath的对象
from lxml import etree
tree = etree.HTML(response.text)#页面的元素树
##示例1 标题
elements = tree.xpath('//h2[@class="truncate block"]')#在Elements寻找你想要的元素,可以在页面移动#光标
for element in elements:
    print(element.text)
##也可以在elements中右键copy xpath,这里需要分析一下,将复制的xpath删除一部分
print(tree.xpath('//*[@id="__next"]/section/main/div/div/div/div/div/a/div/ul/li[1]/span[2]')[0].text)
print(tree.xpath('//*[@id="__next"]/section/main/div/div/div/div/div/a/div/ul/li[2]/span[2]')[0].text)
print(tree.xpath('/html/body/div/section/main/div/div/div/div/div/div/a/h2')[1].text)
  


相关推荐
牛奔16 小时前
Go 如何打印调试深层或嵌套的结构体
开发语言·后端·golang
geovindu16 小时前
go: Iterative Algorithms
开发语言·后端·算法·golang·迭代算法
学逆向的16 小时前
汇编——JCC指令
开发语言·汇编·网络安全
mayaairi17 小时前
JS循环语句深度解析:嵌套for、while与do...while
开发语言·前端·javascript
郭老二18 小时前
【Python】基本语法:装饰器语法糖@
python
kite012118 小时前
Go语言Map深度解析与最佳实践
开发语言·后端·golang
_Jimmy_19 小时前
Agent常用检索器的详细介绍
python·langchain
小柯南敲键盘19 小时前
图片翻译API接入与自动化实现指南
运维·python·自动化
l1564694819 小时前
突围!图文混合知识库难以解析,Kimi-K3 原生视觉架构深耕知识工作,DMXAPI 统一接口,缩短项目开发周期
java·大数据·开发语言
旅僧19 小时前
Q-learning(自用)
python·机器学习