python利用urllib和xpath爬取并保存图片

概要

在网络时代,图片是信息传递的重要形式之一,而Python作为一种多用途的编程语言,可以用来编写爬虫从网页上获取图片,并保存到本地。本文将介绍如何使用Python爬虫实现这一功能,并探讨一些进阶技巧。

实现

(1)请求对象定制

python 复制代码
# 请求对象定制
def create_request(page):

    if 1 == page:
        url = 'https://sc.chinaz.com/tupian/huacaotupian.html'
    else:
        url = 'https://sc.chinaz.com/tupian/huacaotupian_' + str(page) + '.html'

    # 防止UA(User-Agent)检查
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko)'
    }

    request = urllib.request.Request(url=url, headers=headers)
    return request

(2)获取网页源码

python 复制代码
# 获取网络源码
def get_content(request):
    response = urllib.request.urlopen(request)
    content = response.read().decode('utf-8')
    return content

(3)解析并下载图片

python 复制代码
# 下载
def down_load(content):
    tree = etree.HTML(content)
    name_list = tree.xpath('//div[@class="container"]//div/div/img/@alt')
    img_list = tree.xpath('//div[@class="container"]//div/div/img/@data-original')
    # for i in range(len(name_list)):
    #     print('name', i)
    # for i in range(len(img_list)):
    #     print('src', i)
    for i in range(len(name_list)):
        urllib.request.urlretrieve(url= 'https:' + img_list[i], filename='./out_Data/img/' + name_list[i] + '.png')

解析网页源码这里用到了xpath,xpath是lxml下的一个包,使用时,需要导入:

python 复制代码
from lxml import etree

完整代码

完整代码如下:

python 复制代码
import urllib.request
from lxml import etree

# 分析页码之间的关系
# get请求
# https://sc.chinaz.com/tupian/huacaotupian.html  1
# https://sc.chinaz.com/tupian/huacaotupian_2.html 2
# https://sc.chinaz.com/tupian/huacaotupian_3.html  3
# https://sc.chinaz.com/tupian/huacaotupian_4.html  4

# 请求对象定制
def create_request(page):

    if 1 == page:
        url = 'https://sc.chinaz.com/tupian/huacaotupian.html'
    else:
        url = 'https://sc.chinaz.com/tupian/huacaotupian_' + str(page) + '.html'

    # 防止UA(User-Agent)检查
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko)'
    }

    request = urllib.request.Request(url=url, headers=headers)
    return request

# 获取网络源码
def get_content(request):
    response = urllib.request.urlopen(request)
    content = response.read().decode('utf-8')
    return content

# 下载
def down_load(content):
    tree = etree.HTML(content)
    name_list = tree.xpath('//div[@class="container"]//div/div/img/@alt')
    img_list = tree.xpath('//div[@class="container"]//div/div/img/@data-original')
    # for i in range(len(name_list)):
    #     print('name', i)
    # for i in range(len(img_list)):
    #     print('src', i)
    for i in range(len(name_list)):
        urllib.request.urlretrieve(url= 'https:' + img_list[i], filename='./out_Data/img/' + name_list[i] + '.png')



if __name__ == '__main__':
    start_page = int(input('请输入起始页码: '))
    end_page = int(input('请输入截止页码: '))
    for page in range(start_page, end_page + 1):
        print('下载至第' + page + '页')
        # 请求对象定制
        request = create_request(page)
        # 获取网页源码
        content = get_content(request)
        # 下载数据
        down_load(content)
相关推荐
reasonsummer12 小时前
【办公类-146-07】20260906《总园大班6个班级四大教育》(优化版:标题excle+复制AI文字+Python占位符录入)
人工智能·python·c#
2601_9622845012 小时前
利用Python语言实现实验室自动化
python·自动化·数据采集·labview·科学计算
隐擎fox12 小时前
网络传输中的 DNS 泄漏成因剖析与 Python 自动化检测排查实战
python·网络协议·自动化·dns·ip/tcp
2601_9622962812 小时前
python初学者怎么选IDE
ide·python·开发环境·初学者·工具选择
青少儿编程课堂14 小时前
威佐夫博弈(双堆取子游戏)解析
c++·python·算法·bfs·信息学竞赛
hhzz14 小时前
【OpenCV 入门到精通 03】图像入门:读取、显示、保存完全指南
人工智能·python·opencv·计算机视觉
金融小师妹15 小时前
AI趋势识别:黄仁勋宣布“AGI时代”到来,Astra能力跃迁背后的AI安全边界
大数据·python·深度学习·重构·逻辑回归
2501_9418752818 小时前
从配置中心到动态管理的互联网工程语法演进与多语言实践分享
开发语言·python
hfywmsj18 小时前
广州餐饮铺位招租决策模型:多因子选址系统设计
开发语言·人工智能·python·广州餐饮铺位招租
泡海椒21 小时前
内置SPI函数库详解:JQuick-Java Builtin工具类实战用法
java·开发语言·python