基于JavaScript、puppeteer的爬虫

前期准备:

npm puppeteer

import puppeteer from 'puppeteer';

puppeteer文档

第一步:启动浏览器,跳转到需要爬取的页面

javascript 复制代码
const browser = await puppeteer.launch({ headless: false });
    const page = await browser.newPage();

    await page.goto(url, { waitUntil: 'networkidle2' });

第二步:打开需要爬取的网页,按"F12"查看前端的dom,查看我们想获取的文本信息的父级类名,例如:

第三步,通常列表页面都有下拉刷新,我们需要写一个脚本让页面下拉刷新

我要爬取的页面下拉到一定的地步后会有一个"加载更多"按钮,需要点击,直到页面无法滚动,且没有加载更多按钮的时候停止,脚本参考如下:

javascript 复制代码
 // 定义滚动函数
  const scrollPage = async () => {
    const distance = 100000; // 每次滚动的距离
    const delay = 2000; // 每次滚动后的延迟
    let previousHeight = await page.evaluate('document.body.scrollHeight');

    while (true) {
        await page.evaluate(`window.scrollBy(0, ${distance})`);
        await new Promise(resolve => setTimeout(resolve, delay));

        const newHeight = await page.evaluate('document.body.scrollHeight');
        if (newHeight === previousHeight) {
            const loadMoreButton = await page.$('.类名1.类名2');//锁定"加载更多按钮"
                if (loadMoreButton) {
                    await loadMoreButton.click();
                    console.log('点击加载更多结果按钮');
                    await new Promise(resolve => setTimeout(resolve, delay)); // 等待加载更多内容
                } else {
                    console.log('已滚动到底部,没有更多内容加载');
                    break;
                }
        }
        
        previousHeight = newHeight;
    }
};

await scrollPage();

第四步,封装成对象并打印

第三步的脚本让我们把页面加载到拥有全部数据的状态,现在需要将第二步收集的类名里的文本封装成数组

javascript 复制代码
await page.waitForSelector('.卡片父级类名', { timeout: 60000 });//卡片最外层
const info= await page.evaluate(() => {
    const cardElements = document.querySelectorAll('.卡片父级类名');//获取所有卡片
    const arr= [];
    cardElements.forEach(hotel => {
        const nameElement = hotel.querySelector('[需要的元素1的属性]');
        const priceElement = hotel.querySelector('[需要的元素2的属性]');
        const name = nameElement ? nameElement.innerText.trim() : null;
        const price = priceElement ? priceElement.innerText.trim() : null;
        if (name || price) {
            arr.push({ name, price });
        }
    });
    return arr;
});

console.log(JSON.stringify(info, null, 2))

// 完事关闭浏览器
await browser.close();

运行

相关推荐
wuyoula13 分钟前
全新多平台电商代付商城源码
开发语言·c++·ui·小程序·php源码
玖疯子14 分钟前
IT疑难杂症诊疗室:系统性故障排查指南
开发语言·php
码云数智-大飞15 分钟前
OpCache 原理深挖:从字节码缓存到预加载(Preloading)的实战配置
java·开发语言
Komorebi_999919 分钟前
前端开发|18 个高频易错知识点汇总(HTML+CSS+JS+Vue)面试 & 开发通用
javascript·css·html
cany100039 分钟前
C++ -- 泛型编程
java·开发语言·c++
格林威42 分钟前
面阵相机 vs 线阵相机:堡盟与海康相机选型差异全解析 附C++ 实战演示
开发语言·c++·人工智能·数码相机·计算机视觉·视觉检测·工业相机
时空系1 小时前
第7篇功能——打造你的工具箱 python中文编程
开发语言·python·ai编程
shughui1 小时前
2026最新JDK版本选择及下载安装详细图文教程【windows、mac附安装包】
java·linux·开发语言·windows·jdk·mac
Wenzar_1 小时前
# D3.js实战进阶:从基础图表到交互式数据仪表盘的全流程构建在现代前端开发中,**数据可视化已成为提升用户体验的核心能力之一
java·javascript·python·信息可视化·ux
菜鸟小码1 小时前
MapReduce 编程模型详解:Mapper、Reducer、Driver 三大核心组件
大数据·javascript·mapreduce