Scrapy + Playwright 完整示例(JS 动态渲染网页)

作用:Scrapy 本身不执行 JS,Playwright 启动真实浏览器渲染页面,获取 ajax 动态加载出来的数据。

  1. 安装依赖

pip install scrapy scrapy-playwright

安装浏览器内核

playwright install chromium

  1. 修改 settings.py 关键配置
  1. 编写爬虫 spiders/dynamic_spider.py
  1. 运行爬虫

scrapy crawl dynamic_spider -o out.json

常用 meta 参数拓展

重要注意点

Playwright 会启动 Chromium 浏览器,内存占用高,并发不要设置很大。

headless=False 可以看到浏览器真实访问页面,适合调试。

如果页面滚动加载,需要自定义 playwright 页面回调,模拟下拉滚动。

相关推荐
Mr. zhihao44 分钟前
深度解析:为什么Java序列化需要搭配ByteArrayOutputStream?IO装饰器模式的精妙设计
java·开发语言·装饰器模式
—Qeyser1 小时前
html 可视化海报模板编辑器
css·html·js
vx-程序开发1 小时前
springboot旅游推介平台---附源码24175
java·spring boot·python·spring cloud·eclipse·django·idea
心运软件1 小时前
基于深度学习的宝石图像分类系统
人工智能·python·深度学习·机器学习·分类·数据挖掘
格林威1 小时前
多相机并行采图最佳实践:Task.WhenAll + 异常处理 + 资源释放
开发语言·人工智能·数码相机·计算机视觉·c#·视觉检测·机器视觉
djjjx.1 小时前
【 C++ 】多态
开发语言·c++·多态
逝水无殇1 小时前
HTML 文本格式化详解:掌握 <strong>、<em>、<mark>、<del> 等常用标签
前端·javascript·html
一木 之林1 小时前
AI实战 : Numpy图像处理与深度学习框架
python
c_lb72881 小时前
零基础选策略工具,先分清三件事
人工智能·python