初学者如何用 Python 写第一个爬虫?

编写第一个 Python 爬虫并不难,以下是一个简单的步骤指南,帮助从零开始。

1. 安装必要的库

首先,你需要安装 requests 和 BeautifulSoup 这两个库。requests 用于发送 HTTP 请求,BeautifulSoup 用于解析 HTML 内容。

bash 复制代码
pip install requests beautifulsoup4

2. 导入库

在你的 Python 脚本中导入所需的库。

python 复制代码
import requests
from bs4 import BeautifulSoup

3. 发送 HTTP 请求

使用 requests.get() 方法发送一个 HTTP GET 请求来获取网页内容。

python 复制代码
url = 'https://example.com'
response = requests.get(url)

4. 检查请求是否成功

你可以通过检查 response.status_code 来确保请求成功(状态码 200 表示成功)。

python 复制代码
if response.status_code == 200:
    print('请求成功')
else:
    print('请求失败', response.status_code)

5. 解析 HTML 内容

使用 BeautifulSoup 解析 HTML 内容,并提取你感兴趣的数据。

python 复制代码
soup = BeautifulSoup(response.text, 'html.parser')

6. 提取数据

假设你想提取网页的标题,可以使用以下代码:

python 复制代码
title = soup.title.string
print('网页标题:', title)

如果你想提取所有的链接,可以这样做:

python 复制代码
for link in soup.find_all('a'):
    print(link.get('href'))

7. 完整示例代码

以下是一个完整的示例代码,它会抓取一个网页的标题和所有链接:

python 复制代码
import requests
from bs4 import BeautifulSoup

# 目标URL
url = 'https://example.com'

# 发送HTTP请求
response = requests.get(url)

# 检查请求是否成功
if response.status_code == 200:
    print('请求成功')
    
    # 解析HTML内容
    soup = BeautifulSoup(response.text, 'html.parser')
    
    # 提取网页标题
    title = soup.title.string
    print('网页标题:', title)
    
    # 提取所有链接
    print('网页链接:')
    for link in soup.find_all('a'):
        print(link.get('href'))
else:
    print('请求失败', response.status_code)

8. 运行代码

将上述代码保存为一个 .py 文件(例如 first_spider.py),然后在终端或命令行中运行:

bash 复制代码
python first_spider.py

9. 进一步学习

  • 学习如何处理更复杂的 HTML 结构。
  • 学习如何使用正则表达式提取数据。
  • 学习如何处理分页、表单提交等更复杂的爬虫任务。
  • 学习如何使用 Scrapy 框架来构建更强大的爬虫。

注意事项

  • 遵守目标网站的 robots.txt 文件中的规则。
  • 不要过度请求,以免给服务器带来负担。
  • 确保你有权抓取和使用目标网站的数据。

通过以上步骤,能够编写并运行你的第一个 Python 爬虫。

相关推荐
零基础1233 分钟前
Agent 的 Memory 怎么做科研:以中医诊断场景为例
人工智能·经验分享·python·语言模型
databook44 分钟前
面向数据工程师的正则表达式:从日志清洗到字段提取
python·正则表达式·数据分析
zhangzeyuaaa1 小时前
深入理解 Ruby 运算符:本质、分类、坑点与重载实战
开发语言·前端·ruby
一木 之林1 小时前
DeepSeek Agent 开发(一)
开发语言·前端·javascript
朔北之忘 Clancy1 小时前
青少年软编等考七级题解目录
开发语言·c++·青少年编程·gesp·csp·信奥赛·noi
ss2731 小时前
AI全栈实战 | 3.2-01 Python 基础:四大数据容器怎么选,推导式为什么是 Pythonic 的灵魂
开发语言·人工智能·python
Mr_Macallon1 小时前
C++回顾(基础)(01)
c语言·开发语言·c++·学习
计算机毕业编程指导师1 小时前
【大数据毕设选题推荐】基于Spark的WTA职业网球赛事演变与竞技格局分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习 深度学习
大数据·python·计算机·spark·毕业设计·课程设计·wta网球
未来之窗软件服务2 小时前
Go 利器 GoReSym:剥离符号恢复 Go 二进制元数据—东方仙盟
开发语言·golang·仙盟创梦ide·东方仙盟
言乐62 小时前
Python区分广度优先深度优先宽度优先的区别
python·算法·深度优先·广度优先·宽度优先