爬虫项目(1)

1.节点

想要获取网页中的数据,首先要获取网页 HTML 代码,再把数据从中提取出来。

我们要向网页的服务器发送请求,服务器返回的响应就是网页 HTML 代码

节点

(1)文档节点:就是文档的内容;

(2)标签节点:就是html里面对应的标签;

(3)属性节点:就是html里面标签的属性,比如长度,外边距,内边距等等;

2.解析模块

对于一个网页的节点来说,它可以定义id、class或其他属性,而且节点之间还有层级关系。

我们可以借助网页节点的结构和属性,提取想要的信息。在这里,我们来学习一个强大的解析工具

------BeautifulSoup

3.解析器

网络爬虫的最终目的就是过滤选取网络信息,最重要的部分可以说是解析器。解析器的优劣决定了爬虫的速度和效率。

Beautiful Soup 官方推荐我们使用的是 lxml 解析器,原因是它具有更高的效率,所以我们也将采用lxml解析器。

5.导入类

安装完成后,我们需要使用 bs4 模块中的 BeautifulSoup 类。

这就要使用 from...import 从 bs4 中导入 BeautifulSoup 。

6.函数传参

BeautifulSoup() 函数可以把不标准的 HTML 代码重新进行了自动更正,从而方便我们对其中的节点、标签、属性等进行操作。

复制代码
soup = BeautifulSoup(html, "lxml")
print(soup)

这段代码调用函数BeautifulSoup,

这个函数有2个参数,第一个是需要进行解析的html代码,第二个是解析器的类型;

使用 BeautifulSoup() 函数,创建一个 BeautifulSoup 对象,传入 HTML 文本和解析器 lxml。

7.找到对应节点处的内容

文本所在的位置,包含在<em>XXX</em>这样的节点中,它们都有相同的标签。

使用 BeautifulSoup 中的 find_all() 函数,获取所有符合指定条件的节点。

复制代码
ps = soup.find_all(name = "h1")
print(ps)

find_all() 函数可以查询 soup 中所有符合条件的元素,组成一个列表赋值给ps。

8.代码的完整实现

复制代码
import requests

from bs4 import BeautifulSoup

url = "https://xxxxxxxxxxxxxxxxx/"

response = requests.get(url)

html = response.text

soup = BeautifulSoup(html,"lxml")

content_all = soup.find_all(name="em")

print(content_all)
相关推荐
绘梨衣5479 小时前
AI技术栈全景指南_Prompt_RAG_爬虫_MCP
人工智能·爬虫·prompt
stolentime15 小时前
OpenClaw 2.0 新手快速上手与实战指南
爬虫·python·ai·网络爬虫
玫瑰互动GEO16 小时前
工程视角看GEO优化与SEO优化:爬虫排序 vs 大模型引用
人工智能·爬虫·搜索引擎
for_ever_love__18 小时前
python爬虫: 数据解析
开发语言·爬虫·python·xpath
傻啦嘿哟18 小时前
某米应用商店爬虫:爬取APP榜单数据,分析应用市场格局
爬虫
德迅云安全-上官2 天前
业务接口对抗爬虫与批量薅羊毛实战手册:拨开接口层攻击迷雾,搭建业务接口全链路安全防护体系
爬虫·安全
心中有你02142 天前
Python爬虫实战:京东商品数据爬取+可视化分析
开发语言·爬虫·python
tang777892 天前
爬虫代理池搭建全流程:从IP筛选、去重到自动切换(附完整落地代码)
爬虫·网络协议·tcp/ip·代理ip池·爬虫代理池
进击的雷神3 天前
网站 SEO 功能怎么测:从手工检查到自动化脚本的实战思路
运维·爬虫·自动化·官网seo·收录
深蓝电商API3 天前
TLS 指纹为什么越来越重要?
爬虫·tls 指纹