python爬虫进阶篇:scrapy爬虫框架的依赖库搭建和项目创建

一、前言

上篇我们记录了Scrapy的各个组件功能,这篇我们来动手scrapy爬虫框架的依赖库搭建和项目创建,开始进入进阶实战。

二、环境搭建

  • 安装依赖库
python 复制代码
pip install lxml==4.9.2
pip install parsel==1.6.0
pip install Twisted==21.2.0
pip install pyOpenSSL==19.1.0
pip install cryptography==2.8
pip install Scrapy==1.6.0

以上依赖库是必须要安装的,否则启动Scrapy会报依赖包不存在的错;Scrapy的依赖包对版本要求比较严格,不同版本的依赖包经常会冲突,上面这些依赖包是测试过没有问题的。

三、创建Scrapy项目

  • 创建一个爬虫项目文件夹scrapy_demo01
  • 命令行进入此文件夹,执行命令:
python 复制代码
scrapy startproject scrapy_demo
  • 将第一层scrapy_demo文件夹设置为根目录(pycharm中右键此文件夹,Mark directory as Sources Root)
  • 创建个spider_main.py文件,用于执行启动爬虫的命令
python 复制代码
from scrapy import cmdline

if __name__ == '__main__':

    cmdline.execute("scrapy crawl demo_spider".split())
  • 最后的项目结构如下

四、测试结果

python 复制代码
# -*- coding: utf-8 -*-
import scrapy

class DemoSpider(scrapy.Spider):
    name = "demo_spider"

    def start_requests(self):
        urls = [
            'http://quotes.toscrape.com/page/1/',
            'http://quotes.toscrape.com/page/2/',
        ]
        for url in urls:
            yield scrapy.Request(url=url, callback=self.parse)

    def parse(self, response):
        page = response.url.split("/")[-2]
        filename = f'quotes-{page}.html'
        with open(filename, 'wb') as f:
            f.write(response.body)
        self.log(f'Saved file {filename}')

相关推荐
测试秃头怪3 小时前
Postman中变量的使用
自动化测试·软件测试·python·测试工具·测试用例·接口测试·postman
ynchyong3 小时前
词云(Word Cloud) 使用方法
python·统计·词云
Alkaid20773 小时前
我把文件和脚本放一起了,Python 就是看不见?新手必看的绝对路径 vs 相对路径终极避坑指南
python·ai编程
SamChan903 小时前
Python+OpenCV检测PDF翻译后排版偏移:像素级格式一致性验证
python·opencv·ai·pdf·wpf
会博通·代码搬运工3 小时前
双层PDF技术实现与档案数字化系统的API集成实践
数据库·人工智能·分布式·python·计算机视觉·api集成
健康平安的活着3 小时前
java中批量查询+stream返回map提高查询效率
java·windows·python
无线通信科研笔记3 小时前
IEEE TWC 2026 论文精读与完整复现|H-PASS:机械—电子双重可重构波束成形
论文阅读·人工智能·笔记·python·论文笔记
青 春 记 忆4 小时前
零基础入门python35:Django用户登录与权限边界
python·django·后端开发
淼澄研学4 小时前
LangChain构建Prompt模板解决Python长尾报错实操
python·langchain·prompt
枫叶v.4 小时前
DeepSeek Harness(DSH)插件开发保姆级教程:从 0 到 1 快速写出第一个插件
python