【Python】Requests 库使用示例

本文使用Python+requests库对微博页面进行数据抓取和简单的数据清洗

使用Requests库进行网络爬虫

requests是一个PythonHTTP客户端库,用于发送HTTP请求。它简单易用,同时提供了足够的功能来处理各种网络请求。

1. 安装requests库

Python中安装requests库,可以使用pip,使用国内镜像源,下载速度更快:

bash 复制代码
pip install requests -i https://pypi.tuna.tsinghua.edu.cn/simple

常用的镜像源可以参考以下文章:Python常用镜像库源

2. 基本用法

2.1 发送GET请求

python 复制代码
import requests
# 发送GET请求
response = requests.get('https://www.weibo.com/')
# 检查响应状态码
if response.status_code == 200:
    print('成功获取页面内容')
else:
    print('请求失败,状态码:', response.status_code)

2.2 解析响应内容

python 复制代码
# 获取响应的文本内容
page_content = response.text
# 打印前500个字符
print(page_content[:500])

3. 数据清洗

通常,抓取到的HTML页面需要经过数据清洗,以提取有用的信息。可以使用BeautifulSoup库进行HTML的解析和清洗。

3.1 安装BeautifulSoup库

bash 复制代码
pip install beautifulsoup4

3.2 使用BeautifulSoup清洗数据

python 复制代码
from bs4 import BeautifulSoup
# 使用BeautifulSoup解析HTML
soup = BeautifulSoup(page_content, 'html.parser')
# 假设我们要提取微博用户的昵称
user_nicknames = soup.find_all('nick-name')
# 清洗并打印用户昵称
for nickname in user_nicknames:
    print(nickname.get_text().strip())

4. 完整示例

以下是一个简单的示例,展示了如何抓取微博页面并清洗数据。

python 复制代码
import requests
from bs4 import BeautifulSoup
# 微博页面URL(需登录微博,点击任一内容页面)
url = 'https://www.weibo.com/'
# 发送GET请求
response = requests.get(url)
# 检查响应状态码
if response.status_code == 200:
    # 解析HTML内容
    soup = BeautifulSoup(response.text, 'html.parser')
    
    # 假设我们要提取所有微博用户的昵称
    user_nicknames = soup.find_all('nick-name')
    
    # 清洗并打印用户昵称
    for nickname in user_nicknames:
        print(nickname.get_text().strip())
else:
    print('请求失败,状态码:', response.status_code)

请注意,实际的微博页面结构可能与此示例不同,在摘取信息的时候需要根据实际情况调整选择器和清洗逻辑。此外,微博可能会采取反爬虫措施,因此在实际应用中可能需要其他技术来绕过这些措施。

这个示例展示了如何使用requests库来获取微博页面的HTML内容,并使用BeautifulSoup库来解析和清洗数据。在实际应用中,您需要根据微博页面的具体结构来调整选择器。

相关推荐
多米Domi0114 小时前
0x3f 第49天 面向实习的八股背诵第六天 过了一遍JVM的知识点,看了相关视频讲解JVM内存,垃圾清理,买了plus,稍微看了点确定一下方向
jvm·数据结构·python·算法·leetcode
饺子大魔王的男人4 小时前
Remote JVM Debug+cpolar 让 Java 远程调试超丝滑
java·开发语言·jvm
人工智能训练10 小时前
【极速部署】Ubuntu24.04+CUDA13.0 玩转 VLLM 0.15.0:预编译 Wheel 包 GPU 版安装全攻略
运维·前端·人工智能·python·ai编程·cuda·vllm
yaoming16810 小时前
python性能优化方案研究
python·性能优化
兩尛10 小时前
c++知识点2
开发语言·c++
fengfuyao98510 小时前
海浪PM谱及波形的Matlab仿真实现
开发语言·matlab
xiaoye-duck11 小时前
C++ string 底层原理深度解析 + 模拟实现(下)——面试 / 开发都适用
开发语言·c++·stl
码云数智-大飞11 小时前
使用 Python 高效提取 PDF 中的表格数据并导出为 TXT 或 Excel
python
Hx_Ma1611 小时前
SpringMVC框架提供的转发和重定向
java·开发语言·servlet
biuyyyxxx12 小时前
Python自动化办公学习笔记(一) 工具安装&教程
笔记·python·学习·自动化