Python简单网络爬虫教程

⚠️重要提醒:爬虫请遵守网站 robots.txt 协议,不要高频爬取,禁止爬取隐私、付费、受版权保护内容,部分网站严禁爬虫,违规会有法律风险。

环境准备

需要安装两个第三方库

bash

pip install requests beautifulsoup4

  • requests :用于发送http请求,获取网页源码

  • BeautifulSoup :解析html网页,提取数据

完整示例:静态网页爬虫

python

import requests

from bs4 import BeautifulSoup

def simple_crawler(url):

请求头,模拟浏览器访问,防止被反爬拦截

headers = {

"User‑Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36"

}

try:

发送GET请求

resp = requests.get(url, headers=headers, timeout=10)

resp.raise_for_status() # 如果状态码不是200,抛出异常

resp.encoding = resp.apparent_encoding # 自动识别编码

解析网页

soup = BeautifulSoup(resp.text, "html.parser")

示例1:获取网页标题

title = soup.find("title").get_text()

print("网页标题:", title)

示例2:提取页面所有a标签(超链接)

all_links = soup.find_all("a")

print("\n页面内链接:")

for link in all_links:10: #只打印前10条

text = link.get_text(strip=True)

href = link.get("href")

if href:

print(f"文本:{text} 链接:{href}")

except requests.exceptions.RequestException as e:

print("请求出错:", e)

if name == "main":

target_url = "https://example.com" #测试网页,可替换为合法目标站点

simple_crawler(target_url)

核心知识点

  1. User‑Agent 请求头

网站会识别客户端,不加UA会被识别为爬虫直接拒绝访问,所以必须带上浏览器UA。

  1. 常见状态码
  • 200 :访问成功

  • 403 :服务器拒绝访问,反爬拦截

  • 404 :页面不存在

  • 521 :网站WAF防火墙拦截爬虫,需要处理指纹、cookie

  1. 解析数据常用方法

python

soup.find("标签名") # 查找第一个匹配标签

soup.find_all("标签名") # 查找全部匹配标签

tag.get_text() # 获取标签内文字

tag.get("属性名") # 获取标签属性,比如href、src

进阶场景

  1. 网页是JS动态渲染(requests拿不到数据)

requests只能拿原始HTML,JS加载出来的数据需要:

  • 方案1:调用网站公开API接口(优先)

  • 方案2:使用 Selenium / Playwright 模拟真实浏览器

  1. 保存爬取结果

python

将结果写入txt

with open("result.txt","w",encoding="utf‑8") as f:

f.write(resp.text)

爬虫避坑

  1. 设置 timeout 超时时间,防止程序卡死

  2. 请求之间加延时 time.sleep(1‑3) ,不要疯狂请求服务器

  3. 不要爬登录后才能看到的内容,未授权抓取属于侵权

  4. 遇到验证码、cloudflare防护,简单requests无法解决。

相关推荐
Patrick在香港3 小时前
Claude Prompt 香港场景:公文里「今日」落在 6 个日历日上,「翌日」锚错了 5 天
python·自然语言处理·正则表达式·claude·数据清洗
YsyaaabB4 小时前
Python 数值分析
python
阿洛学长4 小时前
计算机二级 Python 基本操作题(15 分)真题笔记(0101 ~ 1903 全套)
python·pycharm
weixin199701080165 小时前
[特殊字符]️《二手ERP对接电商平台的总体方案:统一数据模型 + 事件驱动 + 灰度上线6原则》(附Python源码)
大数据·python
滚雪球~5 小时前
量化交易 防止Windows电脑自动更新并重启
python·量化
L@ncor6 小时前
第二章可能出现的问题
人工智能·python
y = xⁿ6 小时前
大模型基础概念
python
ctlover7 小时前
排序与查找算法详解
开发语言·python
用户8356290780517 小时前
如何使用 Python 给 Word 文档添加水印
后端·python