【Python】使用pyppeteer进行网页截图并发送机器人

使用pyppeteer进行网页截图并发送机器人

介绍

Pyppeteer是对Puppeteer的一个Python封装,常用在爬虫方面,最近使用它做网页巡检报告的截图,记录一下

正文

脚本截图

使用pyppeteer其实和我们自己开浏览器的逻辑差不多,同时要结合async一起使用,首先要通过lauch函数启动一个浏览器,启动浏览器的时候可以设置启动参数,其中包括使用的代理服务器:

python 复制代码
browser = await launch(args=["--no-sandbox", "--proxy-server=http://10.1.1.1:8443"])

启动浏览器后我们要开一个新的标签页来访问网页,goto就是用来访问对应的网页的:

python 复制代码
page = await browser.newPage()
await page.goto(url)

现在我们就开始访问对应的网页了,根据经验我们都知道有的网页刚开启的时候不是完全渲染完的,所以可以添加一个asyncio.sleep(10)来等待十秒钟:

python 复制代码
await asyncio.sleep(10)

如果需要运行一些js脚本语句,可以通过evaluate执行:

python 复制代码
dimensions = await page.evaluate('''() => {
    return {
        width: document.documentElement.scrollWidth,
        height: document.documentElement.scrollHeight,
    }
}''')

然后可以使用字典访问对应的数据:

python 复制代码
dimensions['height']

接下来就是截图的操作了,甚至可以同时截成pdf,完整代码如下:

python 复制代码
async def main():
    browser = await launch(args=["--no-sandbox", "--proxy-server=http://10.1.1.1:8443"])
    # 新建选项卡
    page = await browser.newPage()
    await page.goto(url)

    await asyncio.sleep(10)
    dimensions = await page.evaluate('''() => {
       return {
           width: document.documentElement.scrollWidth,
           height: document.documentElement.scrollHeight,
       }
    }''')
    await page.setViewport({'width': 1920, 'height': dimensions['height']})
    await page.screenshot({'path': "test.png", "clip": {"x": 300, "y": 10, "width": 1320, "height": dimensions['height']}})

    await page.pdf({'path': file,  'width': 1920, 'height': dimensions['height']})
    await browser.close()

发送到机器人

截图和pdf都生成了,现在都可以发送给企业微信机器人了

发送图片

python 复制代码
def post_img_to_robot(page):
    with open(page, 'rb') as file:
        data = file.read()
        encodestr = base64.b64encode(data)
        image_data = str(encodestr, 'utf-8')
    with open(page, 'rb') as file:
        md = hashlib.md5()
        md.update(file.read())
        image_md5 = md.hexdigest()
    data = {
        "msgtype": "image",
        "image": {
            "base64": image_data,
            "md5": image_md5
        }
    }
    headers = {'content-type': 'application/json;charset=utf-8'}
    body = json.dumps(data)
    requests.post(qy_ex, data=body, headers=headers)

发送PDF

发送PDF按照教程需要先调用upload_media接口,然后在发送图片的时候把media_id作为参数传入

python 复制代码
def post_file_to_robot(file):
    parsed_url = urlparse(qy_ex)
    param = parse_qs(parsed_url.query)
    webHookKey = param["key"][0]
    upload_url = f'https://qyapi.weixin.qq.com/cgi-bin/webhook/upload_media?key={webHookKey}&type=file'
    headers = {
        "Accept": "application/json, text/plain, */*", "Accept-Encoding": "gzip, deflate",
        "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.100 Safari/537.36"
    }
    data = {'file': open(file, 'rb')}
    req = requests.post(url=upload_url, files=data, headers=headers).json()
    media_id = req["media_id"]

    data = {
        "msgtype": "file",
        "file": {"media_id": media_id}
    }

    requests.post(url=qy_ex, json=data)

发送效果如下:

相关推荐
Bruce_Liuxiaowei1 分钟前
基于Flask的MBA考生成绩查询系统设计与实现
后端·python·flask
啊阿狸不会拉杆2 分钟前
第二十章:Python-Matplotlib库实现函数可视化
开发语言·python·matplotlib
欧宸雅6 分钟前
HTML语言的空值合并
开发语言·后端·golang
nlog3n21 分钟前
Java外观模式详解
java·开发语言·外观模式
方瑾瑜30 分钟前
Visual Basic语言的物联网
开发语言·后端·golang
緣起緣落40 分钟前
Linux(CentOS 7) 部署 redis 集群
linux·运维·服务器·redis·centos·集成学习
浪里小妖龙1 小时前
网络爬虫的基础知识
python
晓13131 小时前
第七章 Python基础进阶-异常、模块与包(其五)
人工智能·python
赖皮猫1 小时前
PIKIE-RAG 本地部署实践
后端·python·flask
无名之逆1 小时前
[特殊字符] Hyperlane 框架:高性能、灵活、易用的 Rust 微服务解决方案
运维·服务器·开发语言·数据库·后端·微服务·rust