Scrapy + Playwright 完整示例(JS 动态渲染网页)

作用:Scrapy 本身不执行 JS,Playwright 启动真实浏览器渲染页面,获取 ajax 动态加载出来的数据。

  1. 安装依赖

pip install scrapy scrapy-playwright

安装浏览器内核

playwright install chromium

  1. 修改 settings.py 关键配置
  1. 编写爬虫 spiders/dynamic_spider.py
  1. 运行爬虫

scrapy crawl dynamic_spider -o out.json

常用 meta 参数拓展

重要注意点

Playwright 会启动 Chromium 浏览器,内存占用高,并发不要设置很大。

headless=False 可以看到浏览器真实访问页面,适合调试。

如果页面滚动加载,需要自定义 playwright 页面回调,模拟下拉滚动。

相关推荐
LorryJovens20 小时前
【LAAP科研】CEN因果等价网络理论---从双缝干涉到因果等价
开发语言·php
2301_8000742120 小时前
map,list简单方法
windows·python·list
Brilliantwxx21 小时前
【Linux】 进程(10) 进程控制深度解析:创建、终止与等待
linux·运维·服务器·c语言·开发语言·网络
DeepVisionary21 小时前
30B 参数打平 1 万亿参数:Meta 开源 Muse Glimmer,跑分 35 对 36
python·自动化
吴声子夜歌21 小时前
Guava——基本工具(二)
windows·python·guava
卢锡荣1 天前
国产PD3.1全集成Type-C管控芯片LDR6020P
c语言·开发语言
Freak嵌入式1 天前
Pico UART 数据收发实战:硬件配置、MicroPython 编程
java·开发语言·单片机·嵌入式硬件·生活
Casual1 天前
【网络基础进阶】:看懂子网划分与 VLAN
开发语言·网络·php
独立开发之道1 天前
【three.js教程】Three.js 运行时更新:矩阵、几何体、材质怎么改才不卡
javascript·矩阵·材质
用户8356290780511 天前
使用 Python 管理 PDF 属性和元数据
后端·python