使用Nokogiri库的Python程序

华科℡云2023-11-06 10:36

```python

import requests

from bs4 import BeautifulSoup

import os

设置

proxies = {"http": "", "https": ""}

设置headers

headers = {

'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.77 Safari/537.36'

}

设置请求的URL

url = "https://www.yuanfudao.com/"

发送请求

response = requests.get(url, headers=headers,proxies=proxies)

使用BeautifulSoup解析返回的HTML

soup = BeautifulSoup(response.text, 'html.parser')

找到所有img标签

images = soup.find_all('img')

遍历所有img标签

for image in images:

获取图片的src属性

src = image.get('src')

如果图片的src属性以'/'开头，说明是域名外的图片，需要加上'http://www.yuanfudao.com/'前缀

if src.startswith('/'):

src = 'http://www.yuanfudao.com/' + src

获取图片的文件名

filename = src.split('/') $-1$

创建保存图片的文件夹，如果不存在则创建

if not os.path.exists('images'):

os.makedirs('images')

将图片保存到指定的文件夹中

with open('images/' + filename, 'wb') as f:

f.write(requests.get(src, headers=headers,proxies=proxies).content)

```

以上代码的工作原理是，首先发送一个GET请求到指定的URL，并使用BeautifulSoup解析返回的HTML。

然后，它找到所有img标签，并遍历这些标签。对于每个img标签，它获取图片的src属性，并检查这个属性是否以'/'开头。

如果以'/'开头，说明这是域名外的图片。

然后，它获取图片的文件名，并创建一个保存图片的文件夹（如果不存在的话）。

最后，它将图片保存到指定的文件夹中。

上一篇：剑指JUC原理-12.手写简易版线程池思路

下一篇：【python 深拷贝与浅拷贝】

热门推荐

012026年7月AI圈大地震：GPT-5.6被政府限制、Claude入驻Slack、Anthropic自研芯片 02GitHub 镜像站点 03如何新建文件夹？电脑新建文件夹的4种方法 04AI科技热点日报 | 2026年07月01日 05幻兽帕鲁 - 服务器管理员权限与 GM 命令完全指南 06国内可直接用、免费额度/永久免费的大模型API清单（含 SiliconFlow、火山、阿里、智谱、百度、Kimi、DeepSeek、DMXAPI 等）072026 国产 AI 大模型横评：DeepSeek、通义千问、Kimi、文心一言、星火、豆包谁更能打？08AI 编程 IDE 全景解析 2026：Agent 全面接管开发链路 092026 年 AI 大模型 & AI 编程工具实战全总结 10微信历史版本含下载地址（ Windows PC | 安卓 | MAC ）及设置微信不更新