010-sha1+base64:爬虫练习网站

网站地址:爬虫练习网站

找加密参数及位置

找到接口:

加密参数:

直接搜索关键字:

打上断点,其他都不像,然后翻页触发断点:

进函数内部看看:

这里有一个sha1加密和base64编码,我们看看sha1是否是标准加密:

sha1是加密的,然后base64也看看:

都是标准的,看一下参数即可:

外面参数是offset:

下面开始扣代码

扣代码复现逻辑

先扣i函数:

将n全部改为第三方库:

然后将外部调用的代码扣下来:

封装成函数:

整体代码如下:

python 复制代码
CryptoJS = require("crypto-js");

function i() {
    for (var t = Math.round((new Date).getTime() / 1e3).toString(), e = arguments.length, r = new Array(e), i = 0; i < e; i++)
        r[i] = arguments[i];
    r.push(t);
    var o = CryptoJS.SHA1(r.join(",")).toString(CryptoJS.enc.Hex)
        , c = CryptoJS.enc.Base64.stringify(CryptoJS.enc.Utf8.parse([o, t].join(",")));
    return c
}

function encrypt_data(page) {
    var a = (page - 1) * 10
        , e = Object(i)("/api/movie", a);
    return {
        token: e,
        offset: a
    }
}


// console.log(encrypt_data(19));

返回a是因为后端会根据offset校验token

py调用

plain 复制代码
import execjs
import os
import requests

class JSExecutor:
    def __init__(self, file_path):
        if not os.path.exists(file_path):
            print('NotFoundFile')
        with open(file_path, 'r', encoding='utf-8') as f:
            self.js_code = f.read()

        self.js_code = execjs.compile(self.js_code)

    def run(self, func_name, *args):
        return self.js_code.call(func_name, *args)


def get_data(token, offset):
    headers = {
        'Accept': 'application/json, text/plain, */*',
        'Accept-Language': 'zh-CN,zh;q=0.9,en;q=0.8,en-GB;q=0.7,en-US;q=0.6',
        'Cache-Control': 'no-cache',
        'Connection': 'keep-alive',
        'Pragma': 'no-cache',
        'Referer': 'https://spa2.scrape.center/page/2',
        'Sec-Fetch-Dest': 'empty',
        'Sec-Fetch-Mode': 'cors',
        'Sec-Fetch-Site': 'same-origin',
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/143.0.0.0 Safari/537.36 Edg/143.0.0.0',
        'sec-ch-ua': '"Microsoft Edge";v="143", "Chromium";v="143", "Not A(Brand";v="24"',
        'sec-ch-ua-mobile': '?0',
        'sec-ch-ua-platform': '"Windows"',
    }

    params = {
        'limit': '10',
        'offset': str(offset),
        'token': token,
    }

    return requests.get('https://spa2.scrape.center/api/movie/', params=params, headers=headers).json()

if __name__ == '__main__':
    js_executor = JSExecutor('10.js')
    for page in range(1, 11):
        params_js = js_executor.run('encrypt_data', page)
        print(f'正在爬取第{page}页...')
        print(get_data(params_js['token'], params_js['offset']))

result:

小结

文章内容简单,小白可以试试手,如有问题及时提出,加油加油

相关推荐
小刘在重生~几秒前
Java常用类|String类详解 + BigDecimal精准计算(含面试题)
java·开发语言·python
万象观察录33 分钟前
API面临越权、爬虫、撞库等风险,有什么解决方案?
爬虫
大汉堡玩测试40 分钟前
langfuse测试实战(一): 配置一个简单的项目快速落地
python·测试工具
一位正在转型AI全栈的前端工程师1 小时前
AI 全栈学习之旅 -Week 8:从单 Agent 到多 Agent 协作:LangGraph 实战与记忆持久化
前端·python
长江后浪博客1 小时前
Python + YOLOv8 疲劳驾驶 AI 视觉检测入门:从模型训练到 ONNX 实时摄像头检测完整实战
人工智能·python·yolo·疲劳驾驶检测·onnx·yolov8
hhzz1 小时前
【OpenCV 入门到精通 01】认识 OpenCV 与计算机视觉:从零建立全局认知
人工智能·python·opencv·计算机视觉·开源
CDN3602 小时前
爬虫把价格库扒光、SQL注入打穿数据库?360CDN WAF规则引擎深度定制,把防护精度拉到逐字段级
数据库·爬虫·sql
一马平川的大草原2 小时前
如何实现SVG转Mermaid图
python·svg·格式转换·mermaid
PFFstronger2 小时前
基于 Dify 知识库 + Ollama 大模型,自动生成测试用例并导出 XMind 的完整方案
人工智能·python·测试用例·xmind
SomeBottle2 小时前
【小记】图片托管从又拍云迁移到腾讯云 EO + COS(兼容图片处理参数)
python·计算机网络·学习笔记·对象存储·cdn·折腾