Python爬虫基础第一章,JSON

一个爬虫主要的三个核心协议:http、https,wss

WSS协议用作视频的弹幕,实时更新的数据

网页中找到对应的接口,有动态接口和静态接口

动态数据是后端进行动态加载的

静态数据是纯静态资源,比如CSS、JS、HTML

先F12那里在浏览器设置代码折叠

在爬虫中,网页的F12的"元素"界面称之为DOM,如果没有DOM,那JS就不能生效

DOM文档对象模型,JS通过DOM来获取对象

F12源代码界面叫静态资源,这个界面里面的HTML文件和元素中的不太一样

只要在这里面找不到的数据,都是动态数据(除了加密的)

F12的网络界面是一个监听器,它并不是抓包的。抓包的定义是能修改、篡改

XHR:结构化动态数据

文档:静态的html数据

WS:上面说到的全称WSS

Wasm是一个加密机制

在F12的XHR中,刷新界面产生了两个接口,区分方法就看数据大小。数据大的里边有东西,可能是加密数据

右击内存大的接口,点复制-复制为cURL(base)

curlconverter.com

这个网站可以一键生成Python爬虫脚本

在Python PyCharm下边的终端里下载东西,有的时候你在CMD里下载PCHM识别不了是因为它们都是单独的,pycharm在你新建一个项目后会给你设置一个虚拟环境

在PyCharm右击代码打开终端,在这上面下载requests

pip install requests

headers:模拟浏览器的请求头

在最后面的代码加一个.json()

之后打印这个

response = requests.get().json()

print(response)

这样你就会得到和他一样的请求

在后面拼接是把它从服务器返回的数据类型进行转变

为什么加.json(),只要在浏览器中返回的数据是有大括号{},那他就是json型数据

这个指令是把它从HTTP响应的格式转换为Python的字典和列表

在浏览器的一处JS代码,把明文换成密文

相关推荐
MeixianAgent2 小时前
Python 回测数据入口怎么验?历史 K 线入库前先做 5 个检查
后端·python
咕白m6255 小时前
用 Python 实现一键批量查找与替换 Excel 数据
后端·python
SelectDB1 天前
Apache Doris Python UDF:让 SQL 直接调用 Python 生态,支撑 Agent 时代复杂业务逻辑
大数据·数据库·python
荣码1 天前
GraphRAG:普通RAG只能回答"点"的问题,我踩了4个坑才搞懂
java·python
金銀銅鐵2 天前
[Python] 基于欧几里得算法,实现分数约分计算器
python·数学
Lyn_Li2 天前
Kaggle Top 5 | 198只股票、200条数据的金融预测——BattleFin高分方案从零复现
python·kaggle·比赛复盘·金融预测
小九九的爸爸2 天前
前端想要入门Agent开发,要具备哪些Python基础?
python·agent·ai编程
阿耶同学2 天前
手把手教你用 LangGraph 搭建三层嵌套 Agent 架构
python·程序员
花酒锄作田3 天前
Pydantic校验配置文件
python
hboot3 天前
AI工程师第四课 - 深度学习入门
pytorch·python·神经网络