打卡学习Python爬虫第四天|bs4爬取优美图库的小清新图片

bs4解析比较简单,通过HTML的标签和属性去提取值,find(标签,属性="值")

但是需要了解HTML的语法知识,然后再使用bs4去提取,逻辑和编写难度就会比较简单和清晰。

bs4如何使用?如有如下HTML代码:

html 复制代码
<!DOCTYPE html>
<html lang="en">
<head>
<meta charset="UTF-8">
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<title>Simple HTML Table</title>
</head>
<body>

<table border="1">
  <tr>
    <td>Row 1, Cell 1</td>
    <td>Row 1, Cell 2</td>
  </tr>
  <tr>
    <td>Row 2, Cell 1</td>
    <td>Row 2, Cell 2</td>
  </tr>
  <tr>
    <td>Row 3, Cell 1</td>
    <td>Row 3, Cell 2</td>
  </tr>
</table>

</body>
</html>

bs4利用标签和属性去提取值,在什么代码中table是表格标签,tr是行,td是列。也就是这个HTML表格包含三个行(tr)和六个单元格(td)。

目标:爬取优美图库的小清新图片

思路:通过小清新图片的源代码获取子页面的链接,再将子页面的链接作为一个url,通过循环访问子页面来获取每一个子页面中的图片。

一、安装bs4(PyCharm终端输入)

bash 复制代码
pip install BeautifulSoup4

# 用清华源
pip install beautifulsoup4 -i https://pypi.tuna.tsinghua.edu.cn/simple

二、 找到网页url

三、查看页面源代码

四、获取全部子链接

python 复制代码
import requests
from bs4 import BeautifulSoup

url = 'https://www.umeituku.com/weimeitupian/xiaoqingxintupian/'
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.89 Safari/537.36'
}
resp = requests.get(url, headers=headers)
resp.encoding = 'utf-8'
# print(response.text)
page = BeautifulSoup(resp.text, 'html.parser')
div = page.find("div",class_="TypeList")

alist = div.find_all("a")
for i in alist:
    href = i.get("href")  # 通过get直接拿到属性值,即子页面链接
    print(href)

五、将子页面链接作为新的url访问

六、根据子页面源代码特征提取想要的内容

成功获取图片下载地址:

七、下载并保存图片

完整代码:

python 复制代码
import requests
from bs4 import BeautifulSoup

url = 'https://www.umeituku.com/weimeitupian/xiaoqingxintupian/'
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.89 Safari/537.36'
}
resp = requests.get(url, headers=headers)
resp.encoding = 'utf-8'
# print(response.text)
page = BeautifulSoup(resp.text, 'html.parser')
div = page.find("div",class_="TypeList")

alist = div.find_all("a")
for i in alist:
    href = i.get("href")  # 通过get直接拿到属性值,即子页面链接

    z_resp = requests.get(href)  # href就是子页面的url
    z_resp.encoding = 'utf-8'
    z_page = BeautifulSoup(z_resp.text, 'html.parser')

    # p = z_page.find("p",align="center")
    # img = p.find("img")
    # src = img.get("src")
    src = z_page.find("p",align="center").find("img").get("src")
    # 下载图片
    img_resp = requests.get(src)
    img_resp.content  # 图片二进制数据

    with open("./img/"+src.split("/")[-1], "wb") as f:
        f.write(img_resp.content)
        print("下载成功")
    f.close()
    z_resp.close()
resp.close()
相关推荐
战略性的菠萝1 分钟前
学习笔记-Numpy知识
python·numpy
m4Rk_7 分钟前
【论文阅读】Agent 记忆机制(48):Fine-Mem——用细粒度奖励解决长期记忆管理中的奖励稀疏与信用分配
论文阅读·人工智能·学习·开源·github
总有刁民想爱朕ha7 分钟前
零基础Python开发「图片批量转MP4视频」工具,本地离线、免费无水印
开发语言·python·音视频
是隼人9 分钟前
buuctf-pwn axb_2019_fmt32题解(学习过程持续更新)
c语言·学习·安全·pwn入门·ctf入门
txg66620 分钟前
Less Is More:如何用半监督学习提升漏洞检测能力
人工智能·深度学习·学习·安全·开源软件
捧 花23 分钟前
FastAPI 基础语法:从一个完整接口理解 Web API 的设计
前端·python·fastapi·middleware
FAREWELL0007528 分钟前
02-资源包形态-AB与Addressables
学习
Ming_studying30 分钟前
Python批量压缩图片:支持JPG_PNG_WebP、尺寸限制与CSV报告
开发语言·图像处理·python·pillow·图片压缩
大熊背30 分钟前
ISP图像处理中大数乘法溢出处理(一)
人工智能·python·算法·溢出处理
何以解忧,唯有..35 分钟前
Python协程详解:从生成器到async/await的完整指南
开发语言·python