Python简单网络爬虫教程

⚠️重要提醒:爬虫请遵守网站 robots.txt 协议,不要高频爬取,禁止爬取隐私、付费、受版权保护内容,部分网站严禁爬虫,违规会有法律风险。

环境准备

需要安装两个第三方库

bash

pip install requests beautifulsoup4

  • requests :用于发送http请求,获取网页源码

  • BeautifulSoup :解析html网页,提取数据

完整示例:静态网页爬虫

python

import requests

from bs4 import BeautifulSoup

def simple_crawler(url):

请求头,模拟浏览器访问,防止被反爬拦截

headers = {

"User‑Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36"

}

try:

发送GET请求

resp = requests.get(url, headers=headers, timeout=10)

resp.raise_for_status() # 如果状态码不是200,抛出异常

resp.encoding = resp.apparent_encoding # 自动识别编码

解析网页

soup = BeautifulSoup(resp.text, "html.parser")

示例1:获取网页标题

title = soup.find("title").get_text()

print("网页标题:", title)

示例2:提取页面所有a标签(超链接)

all_links = soup.find_all("a")

print("\n页面内链接:")

for link in all_links:10: #只打印前10条

text = link.get_text(strip=True)

href = link.get("href")

if href:

print(f"文本:{text} 链接:{href}")

except requests.exceptions.RequestException as e:

print("请求出错:", e)

if name == "main":

target_url = "https://example.com" #测试网页,可替换为合法目标站点

simple_crawler(target_url)

核心知识点

  1. User‑Agent 请求头

网站会识别客户端,不加UA会被识别为爬虫直接拒绝访问,所以必须带上浏览器UA。

  1. 常见状态码
  • 200 :访问成功

  • 403 :服务器拒绝访问,反爬拦截

  • 404 :页面不存在

  • 521 :网站WAF防火墙拦截爬虫,需要处理指纹、cookie

  1. 解析数据常用方法

python

soup.find("标签名") # 查找第一个匹配标签

soup.find_all("标签名") # 查找全部匹配标签

tag.get_text() # 获取标签内文字

tag.get("属性名") # 获取标签属性,比如href、src

进阶场景

  1. 网页是JS动态渲染(requests拿不到数据)

requests只能拿原始HTML,JS加载出来的数据需要:

  • 方案1:调用网站公开API接口(优先)

  • 方案2:使用 Selenium / Playwright 模拟真实浏览器

  1. 保存爬取结果

python

将结果写入txt

with open("result.txt","w",encoding="utf‑8") as f:

f.write(resp.text)

爬虫避坑

  1. 设置 timeout 超时时间,防止程序卡死

  2. 请求之间加延时 time.sleep(1‑3) ,不要疯狂请求服务器

  3. 不要爬登录后才能看到的内容,未授权抓取属于侵权

  4. 遇到验证码、cloudflare防护,简单requests无法解决。

相关推荐
怕浪猫11 小时前
RAG 面试 6 连问,从原理到优化全部覆盖
python·算法·面试
高洁0111 小时前
具身智能中的世界模型训练
人工智能·python·深度学习·机器学习·transformer
无线通信科研笔记11 小时前
IEEE TVT 2026 论文精读与完整复现|相位误差如何重塑近场 RIS 的幅相响应
论文阅读·人工智能·python·算法·论文笔记
朝朝辞暮i11 小时前
VLA 系统学习第 1 课:VLA 到底在干什么?
人工智能·python·计算机视觉·vla
2601_9628857212 小时前
如何用 Python 自动识别股票的支撑位与压力位?
开发语言·python
北冥有鱼被烹12 小时前
VCSEL全景解析:与光模块NPO CPO的关系、市场量化分析与产业链影响
python
caoerzhong12 小时前
中小企业上 WMS 该先上哪几块:JeeWMS 开源 Java 仓库管理系统的分批上线清单
java·python·开源
正在走向自律13 小时前
AI数据分析与可视化:从基础到应用实践
服务器·人工智能·python·机器学习·数据分析·pandas
databook13 小时前
从手动检查到自动监控:一个数据质量工作流的实现
后端·python·数据分析
北冥有鱼被烹16 小时前
砷化镓与磷化铟:光模块的地基——从化学键到AI缺货潮的底层逻辑
人工智能·python