Python爬虫基础第一章,JSON

一个爬虫主要的三个核心协议:http、https,wss

WSS协议用作视频的弹幕,实时更新的数据

网页中找到对应的接口,有动态接口和静态接口

动态数据是后端进行动态加载的

静态数据是纯静态资源,比如CSS、JS、HTML

先F12那里在浏览器设置代码折叠

在爬虫中,网页的F12的"元素"界面称之为DOM,如果没有DOM,那JS就不能生效

DOM文档对象模型,JS通过DOM来获取对象

F12源代码界面叫静态资源,这个界面里面的HTML文件和元素中的不太一样

只要在这里面找不到的数据,都是动态数据(除了加密的)

F12的网络界面是一个监听器,它并不是抓包的。抓包的定义是能修改、篡改

XHR:结构化动态数据

文档:静态的html数据

WS:上面说到的全称WSS

Wasm是一个加密机制

在F12的XHR中,刷新界面产生了两个接口,区分方法就看数据大小。数据大的里边有东西,可能是加密数据

右击内存大的接口,点复制-复制为cURL(base)

curlconverter.com

这个网站可以一键生成Python爬虫脚本

在Python PyCharm下边的终端里下载东西,有的时候你在CMD里下载PCHM识别不了是因为它们都是单独的,pycharm在你新建一个项目后会给你设置一个虚拟环境

在PyCharm右击代码打开终端,在这上面下载requests

pip install requests

headers:模拟浏览器的请求头

在最后面的代码加一个.json()

之后打印这个

response = requests.get().json()

print(response)

这样你就会得到和他一样的请求

在后面拼接是把它从服务器返回的数据类型进行转变

为什么加.json(),只要在浏览器中返回的数据是有大括号{},那他就是json型数据

这个指令是把它从HTTP响应的格式转换为Python的字典和列表

在浏览器的一处JS代码,把明文换成密文

相关推荐
计算机源码社1 小时前
【大数据项目实战】基于大数据的影视内容生态综合质量分析与可视化-基于数据挖掘的影视内容类型共现与口碑聚类分析系统
大数据·人工智能·python·数据挖掘·数据分析·毕业设计·课程设计
C^h2 小时前
pytorch 适合初学者 0基础学习
人工智能·pytorch·python
小柯南敲键盘2 小时前
跨马翻译:AI批量图片翻译工具,跨境电商视频字幕翻译与智能抠图一体搞定
人工智能·python·音视频
2601_962297252 小时前
Python里behave和pytest-bdd哪个更适合中大型项目?为什么?
python·bdd·行为驱动开发·behave·pytest-bdd
YCOSA20254 小时前
系统工具使用检测.exe (仅供娱乐)
python·microsoft
2601_962295334 小时前
如何python实现网页的自动化
python·selenium·beautifulsoup·requests·网页自动化
ofoxcoding4 小时前
GPT Image 2.5 API 实战:Python 调用实现图片生成与编辑
人工智能·python·gpt·ai
张小姐的猫5 小时前
【AI大模型接入SDK】 —— Gemini接入封装
android·数据结构·数据库·c++·人工智能·python
Elastic 中国社区官方博客5 小时前
Elasticsearch Python DSL 客户端开发
大数据·数据库·python·elasticsearch·搜索引擎·全文检索
计算机编程-吉哥6 小时前
脑肿瘤MRI智能识别系统:基于深度学习的像素级脑肿瘤语义分割平台【计算机毕业设计选题推荐】
人工智能·python·深度学习·算法·毕业设计·课程设计·大数据毕业设计选题推荐