Scrapy + Playwright 完整示例(JS 动态渲染网页)

作用:Scrapy 本身不执行 JS,Playwright 启动真实浏览器渲染页面,获取 ajax 动态加载出来的数据。

  1. 安装依赖

pip install scrapy scrapy-playwright

安装浏览器内核

playwright install chromium

  1. 修改 settings.py 关键配置
  1. 编写爬虫 spiders/dynamic_spider.py
  1. 运行爬虫

scrapy crawl dynamic_spider -o out.json

常用 meta 参数拓展

重要注意点

Playwright 会启动 Chromium 浏览器,内存占用高,并发不要设置很大。

headless=False 可以看到浏览器真实访问页面,适合调试。

如果页面滚动加载,需要自定义 playwright 页面回调,模拟下拉滚动。

相关推荐
默_笙3 天前
🍙 给每个请求过安检:FastAPI 是怎么把校验写进类型注解的
python
小羊没烦恼!3 天前
初探性能优化——2个月到4小时的性能提升
java·开发语言·windows·算法·c#
qq_426003963 天前
启动playwright录制codegen生成自动化测试脚本
python·自动化
譕痕3 天前
JSONObject与JSONArray封装数据格式区别
java·json
A黄俊辉A3 天前
uniapp webview中实现 app和内嵌的H5双向通信
vue.js·json
虎头金猫3 天前
4K 视频总卡在公网带宽?用 N1 + OpenList 把网盘播放链路重新理顺
运维·服务器·网络·python·容器·beautifulsoup·pandas
三十而立洋3 天前
Cookie 详解:从产生到安全,一次讲透
前端·javascript
长沙三为智能科技3 天前
家政小程序开发从0到上线:五阶段交付流程与验收清单
python
伞伞悦读3 天前
【第38期】Python 模块与包详解:import、from、模块搜索路径、包结构和 __init__
开发语言·python
卡布鲁3 天前
把一个 Vite + Vue3 应用塞进 qiankun (React + Umi3) 主站:十个坑的复盘
前端·javascript·react.js