python使用scrapy-pyppeteer中间件使用代理IP

要提高scrapy-pyppeteer的效率,可以考虑以下几个方面:

  • 减少不必要的页面操作,如滚动、点击等,只执行对数据抓取有用的操作。
  • 使用pyppeteer_page_coroutines 参数传入一个可排序的迭代器(如列表、元组或字典),指定在返回响应之前需要在页面上执行的协程。这样可以避免多次调用page.evaluate方法。
  • 设置合理的并发数和下载延迟,避免过多的请求导致浏览器崩溃或被目标网站封禁。
  • 使用缓存或增量爬取,避免重复爬取相同的页面。
python 复制代码
# settings.py
# -*- coding: utf-8 -*-

Sydney = 'scrapy_pyppeteer'

SPIDER_MODULES = ['scrapy_pyppeteer.spiders']
NEWSPIDER_MODULE = 'scrapy_pyppeteer.spiders'

# 设置下载中间件
DOWNLOADER_MIDDLEWARES = {
    'scrapy_pyppeteer.middlewares.PyppeteerMiddleware': 543,
    'scrapy_pyppeteer.middlewares.RandomUserAgentMiddleware': 544,
}

# 设置请求头
DEFAULT_REQUEST_HEADERS = {
    'Accept': '*/*',
    'Accept-Language': 'en',
}

# 设置日志级别
LOG_LEVEL = "DEBUG"

# 设置pyppeteer启动选项
PYPPETEER_LAUNCH_OPTIONS = {
    # 是否显示浏览器界面,默认False
    "headless": False,
    # 是否忽略HTTPS错误,默认False
    "ignoreHTTPSErrors": True,
    # 添加代理服务器的地址,格式为host:port或protocol://host:port
    "args": ["--proxy-server=www.16yun.cn:31111"]
}

# 设置并发数,默认16
CONCURRENT_REQUESTS = 8

# 设置下载延迟,默认0秒
DOWNLOAD_DELAY = 1

# 启用缓存,默认False
HTTPCACHE_ENABLED = True
python 复制代码
# middlewares.py
# -*- coding: utf-8 -*-
import asyncio

import pyppeteer

from scrapy import signals, Request, Spider, http


class PyppeteerMiddleware:
    # 定义一个类属性browser,表示浏览器对象
    browser: pyppeteer.browser.Browser

    @classmethod
    def from_crawler(cls, crawler):
        # 创建中间件实例,并传入crawler对象作为参数
相关推荐
2601_966949653 分钟前
从轮询到策略消费:量化系统如何高效处理五档盘口数据
开发语言·python·数据分析·pandas·量化交易·股票数据·quantdash
萧鼎9 分钟前
2026实战:用 accelerate 库加速 PyTorch 训练,核心语法与避坑指南
python·开源·教程·python库·accelerate
我命由我1234531 分钟前
人脸识别 - 去重时间窗口
java·开发语言·python·学习·java-ee·学习方法·python3.11
王志来137944730081 小时前
安防监控工控工业服务器配套
运维·服务器·python
投票竞赛1 小时前
作品投票版权注意事项,线上评选上传图片视频须知
python·音视频
2601_962293531 小时前
人工智能 & 神经网络完整入门路线(零基础可走,分阶段)
人工智能·python·深度学习·神经网络·机器学习
傻啦嘿哟1 小时前
某房产平台爬虫:爬取二手房源数据,分析各城市房价走势
爬虫
深蓝电商API1 小时前
Celery 调度实践
爬虫·celery
“AI国潮设计-小江”2 小时前
【Python/SDXL实战】潮汕国潮IP视觉落地:普宁英歌舞猫IP & 创意甜品设计(附ComfyUI工作流与商业授权说明)
开发语言·人工智能·python·prompt·aigc
529宝宝起名网2 小时前
用 Python 分析汉字字源与起名用字的关联规律:从六书结构到文化寓意的起名偏好洞察
开发语言·python