Python爬虫:BeautifulSoup

安装

打开cmd,键入pip install bs4,下载慢的用清华源

BeautifulSoup

一,概念

bs4数据解析的一种工具,其实和正则表达式差不多的用处,但是bs返回的是网页源代码,我们通过bs4返回的对象可以直接操作标签的标签的各种属性达到加快筛选元素的目的,并且不同于正则表达式,bs4处理过程非常简单(如果你有前端基础的话)。

二,使用

python 复制代码
from bs4 import BeautifulSoup

html = """<ul>
    <li><a href="zhubajie.com">猪八戒</a></li>
    <li id="abc"><a href="zhouxingchi.com">周星驰</a></li>
    <li><a href="zhangwuji.com">张无忌</a></li>
    <li><a href="wuzetian.com">武则天</a></li>
  </ul>"""

#1.初始化BeautifulSoup对象

page = BeautifulSoup(html,features="html.parser")
print(page)

假设我们有一个html文件,通过bs4解析,我们会得到一个bs4对象,html.parser是指用html的格式解析。

输出结果:

1.find方法

python 复制代码
from bs4 import BeautifulSoup
html = """<ul>
    <li><a href="zhubajie.com">猪八戒</a></li>
    <li id="abc"><a href="zhouxingchi.com">周星驰</a></li>
    <li><a href="zhangwuji.com">张无忌</a></li>
    <li><a href="wuzetian.com">武则天</a></li>
  </ul>"""

page = BeautifulSoup(html,features="html.parser")
page.find()#查找某个元素,输入标签名,还可以将属性放入attr字典中
res = page.find("li",attrs={'id':'abc'})#find只找一个,找到就完
print(res)#<li id="abc"><a href="zhouxingchi.com">周星驰</a></li>
a = res.find("a")#可以连续找
print(a)#<a href="zhouxingchi.com">周星驰</a>
print(a.text)#周星驰#获取文本
print(a.get("href"))#zhouxingchi.com#get获取属性

概括一下,find就是用来找标签用的,不用加<>,如果标签具有某些属性,比如说id,class什么的,你就可以用attr(字典) 来直接选中,当然find方法是支持连续的,意思就是找到一个父标签,你可以对父标签再用一次find找到它的子标签,以此类推,非常方便。提一嘴,find只能找一个,找多个要findall方法了

2.findall方法

python 复制代码
from bs4 import BeautifulSoup
html = """<ul>
    <li><a href="zhubajie.com">猪八戒</a></li>
    <li id="abc"><a href="zhouxingchi.com">周星驰</a></li>
    <li><a href="zhangwuji.com">张无忌</a></li>
    <li><a href="wuzetian.com">武则天</a></li>
  </ul>"""

page = BeautifulSoup(html,features="html.parser")
res_ = page.find_all("li")
print(res_)#[<li><a href="zhubajie.com">猪八戒</a></li>, <li id="abc"><a href="zhouxingchi.com">周星驰</a></li>,
           # <li><a href="zhangwuji.com">张无忌</a></li>, <li><a href="wuzetian.com">武则天</a></li>]

res_ = page.find_all("a")
print(res_)#[<a href="zhubajie.com">猪八戒</a>,
           # <a href="zhouxingchi.com">周星驰</a>, <a href="zhangwuji.com">张无忌</a>, <a href="wuzetian.com">武则天</a>]

findall返回的是一个包含所有目标标签的列表,我们可以直接遍历取出来

以上,就是bs4最常用的两个方法了,基本上能用上bs4的情况下这两个方法是够用的。

三,案例

爬取优美图库(可以选其他的网站,步骤是相似的)

python 复制代码
from bs4 import BeautifulSoup
import requests
import os
url = "http://www.umeituku.com/bizhitupian/xiaoqingxinbizhi/"

response = requests.get(url)
content = response.content.decode('utf-8')

label = BeautifulSoup(content,features='html.parser')
div = label.find("div",attrs={'class':'TypeList'})
imgs = div.find_all("img")
srcs = []
for img in imgs:
    src = img.get("src")
    srcs.append(src)
print(srcs)
#下载
os.mkdir('images')
n = 1
for src in srcs:
    img_response = requests.get(src)
    path = './images/'+str(n)+'.jpg'
    with open(path, mode='wb') as f:
        f.write(img_response.content)
    n+=1
相关推荐
小艳加油几秒前
Python机器学习与深度学习;Transformer模型/注意力机制/目标检测/语义分割/图神经网络/强化学习/生成式模型/自监督学习/物理信息神经网络等
python·深度学习·机器学习·transformer
学行库小秘2 小时前
ANN神经网络回归预测模型
人工智能·python·深度学习·神经网络·算法·机器学习·回归
Yn3122 小时前
在 Python 中使用 json 模块的完整指南
开发语言·python·json
秋难降2 小时前
线段树的深度解析(最长递增子序列类解题步骤)
数据结构·python·算法
猿榜2 小时前
Python基础-控制结构
python
专注API从业者2 小时前
基于 Flink 的淘宝实时数据管道设计:商品详情流式处理与异构存储
大数据·前端·数据库·数据挖掘·flink
Ratten2 小时前
【Python 实战】---- 实现一个可选择、配置操作的批量文件上传工具(三)上传类的实现
python
阿里云大数据AI技术3 小时前
【跨国数仓迁移最佳实践6】MaxCompute SQL语法及函数功能增强,10万条SQL转写顺利迁移
python·sql
杜子不疼.3 小时前
《Python学习之文件操作:从入门到精通》
数据库·python·学习
微小的xx4 小时前
java + html 图片点击文字验证码
java·python·html