scrapy框架开发中pipelines模块将数据写入记事本中

理论知识:

用于处理spider中获取的items,可以对获取的数据进行进一步处理(将获取的items保存至文件或者数据库等)如果要使用pipelines模块中定义的各pipelines类,必须在settings模块中指定,格式如下:pipeline的权重值越小优先级越高

代码部分:

  1. 创建一个新的项目 test1 命令:scrapy startproject test1
  1. 重写items.py文件,定义title属性
python 复制代码
import scrapy


class Test1Item(scrapy.Item):
    # define the fields for your item here like:
    # name = scrapy.Field()
    title=scrapy.Field()
  1. 修改setting文件,指定要使用的pipeline对应的类。将下面这行代码解注释
python 复制代码
ITEM_PIPELINES = {
   "test1.pipelines.Mytest": 300,
}
  1. 在spider目录下创建爬虫文件myspider.py 命令:scrapy genspider -t basic myspider baidu.com
python 复制代码
import scrapy
from test1.items import Test1Item

class MyspiderSpider(scrapy.Spider):
    name = "myspider"
    allowed_domains = ["sina.com.cn"]
    start_urls = ["http://sina.com.cn/"]

    def parse(self, response):
        item = Test1Item()
        item['title'] = response.xpath("/html/head/title").extract_first()
        print(item['title'])
        yield item
  1. 重写pipeline.py文件
python 复制代码
import codecs

class Mytest(object):
    def __init__(self):
        self.file = codecs.open("C:/Users/Administrator/lxj/test.txt","wb",encoding="utf-8")

    def process_item(self, item, spider):
        ll=str(item)+'\n'
        self.file.write(ll)
        return item
    def close_spider(self,spider):
        self.file.close()
  1. 执行行爬虫文件 命令:scrapy crawl myspider --nolog
相关推荐
圆脸脸lxj4 小时前
scrapy框架开发中pipelines模块将数据写入mysql数据库中
scrapy
深蓝电商API2 天前
Scrapy 架构源码解析
爬虫·scrapy
IPdodo_5 天前
2026年爬虫代理 IP 选择指南:从可用率、延迟到成本验收
网络协议·tcp/ip·scrapy·http·https·beautifulsoup·httpx
q5673152312 天前
Curl 报 CONNECT tunnel failed, response 6xx:排查思路全解
数据库·网络协议·scrapy·http·中间件·http代理
Data_Journal14 天前
Playwright vs Selenium:哪个是最佳无头浏览器
开发语言·python·scrapy·microsoft·编辑器
Data_Journal14 天前
如何使用 Python 抓取 Google Flights:分步指南
大数据·开发语言·数据库·python·scrapy
Data_Journal15 天前
用于网页抓取的 Node-unblocker
大数据·开发语言·数据库·python·scrapy
Data_Journal18 天前
使用 Scrapy 和 Splash 抓取无限滚动内容
scrapy
Minner-Scrapy18 天前
Scrapy 2.17 源码解析:Scheduler 调度器与磁盘/内存双队列
java·爬虫·python·scrapy·网络爬虫·twisted