爬虫学习笔记

定制request

传递URL

有params = param_data , 这个就是传入一些,用户密码之类的

定制请求头

无法访问时候,就是页面禁止爬取,此时要定制Headers
获取方法 :

进入网页-->点鸡network 选项卡-->刷新-->找到Doc-->点鸡name 下方的网址-->

然后复制User-Agent (Hoysst)

先写base_url 然后加入headers 参数是headers = headers ,一样是写成字典的形式

网络超时

为request的 timeout参数设置等待描述,如果服务器在指定时间之内没有应答就返回异常

解析网页

BeautifulSoup 简介

bs用来解析网页,支持CSS 选择器,Python 标准库中的HTML 解析器

复制代码
from bs4 import BeautifulSoup
soup = BeautifulSoup("<html>A Html Text</html>","html.parasr")
两个参数:第一个是文本,第二个是解释器
soup.prettify() 格式化输出

BeautifulSoup 四大对象

BeautifulSoup 将HTML 文档转换成一个复杂的树形结构,每个节点都是一个Pyhton 对象

它们分别是:tag, NavigableString, BeautifulSoup, Comment

Tag:

有两个属性: name 和attrs

复制代码
soup = BeautifulSoup('<b class="boldest">Extremely bold</b>')
tag = soup.b
type(tag)
# <class 'bs4.element.Tag'>

tag.name
# 'b'

tag['class']
# 'boldest'

tag.attrs
# {'class': 'boldest'}

type(tag.attrs)
# <class 'dict'>

bs 用NavigableString 来包装夹在tag 中间的的字符串。

但是字符串中间不能包含其他的tag

复制代码
soup = BeatutifulSoup('<b class="boldest">Extremely bold</b>')
s = soup.b.string
print(s)        # Extremely bold
print(type(s))  # <class 'bs4.element.NavigableString'>
这个 s 就是一个 NavigableString 对象

BeautifulSoup

BeautifulSoup 对象表示的是一个文档的全部内容。大部分时候,可以把它当作 Tag 对象。但是 BeautifulSoup 对象并不是真正的 HTM L或 XML 的 tag,它没有attribute属性,name 属性是一个值为"document"的特殊属性。

Comment

一般表示 文档的注释部分

复制代码
soup = BeautifulSoup("<b><!--This is a comment--></b>")
comment = soup.b.string
print(comment)          # This is a comment
print(type(comment))    # <class 'bs4.element.Comment'>

遍历文档树

搜索文档树

CSS 选择器

相关推荐
91刘仁德11 小时前
HTTP协议详解:从URL到HTTP服务器的完整实战
服务器·网络·笔记·网络协议·http
sunshine22 girl12 小时前
Java学习六 Java常见API-2--String-3-字符串的截取替换和其他方法
java·开发语言·学习
sunshine22 girl12 小时前
Java学习六 Java常见API-1-Radom随机数
java·开发语言·学习
Answer1st13 小时前
【嵌入式学习】嵌入式原理知识-DMA(九)
学习
柳鲲鹏13 小时前
老电脑X99安装WIN11 26H2总结、问题解决办法汇总
笔记
传奇开心果编程13 小时前
【ArkUI进阶练中学】第11课:安全与合规进阶
学习·ui·华为·harmonyos
Mr_Macallon15 小时前
C++回顾(基础)(01)
c语言·开发语言·c++·学习
sunoo-22916 小时前
【ARM嵌入式学习笔记第十天】i.MX6ULL eLCDIF控制器驱动RGB LCD全解析(硬件原理+寄存器配置+裸机代码)
arm开发·笔记·学习
wuyk55517 小时前
Python 网络爬虫入门到实战 第 04 章:请求头、UA 伪装、超时、异常处理、基础反爬绕过
开发语言·爬虫·python
kaiyou202617 小时前
用户研究岗秋招,统计分析能力怎么学习和证明?
数据库·python·学习