python爬虫学习(1)——初识爬虫

520那天我向心仪的女孩要微信:"女神,能给我你的微信号吗?"

女神:****"爬!!!!"

从那天开始,我就决定要学好爬虫,爬到女神微信号!!!


目录

1、网络爬虫概述

2、网络爬虫的类型:

3、网络爬虫的工作原理:

4、网络爬虫的设计考虑:

5、搭建开发环境


1、网络爬虫概述

网络爬虫(Web Crawler),也称为网页蜘蛛(spider)或机器人(bot),是一种自动浏览互联网的程序。它的主要任务是从一个或多个起始网页开始,递归地访问网页,收集信息,并将其存储在本地数据库中,以供搜索引擎索引或进行其他类型的分析。

2、网络爬虫的类型:

  1. 通用爬虫:爬取互联网上广泛的网页,用于构建大型搜索引擎的索引。
  2. 聚焦爬虫:专注于特定主题或领域的网页,用于构建特定领域的搜索引擎或数据库。
  3. 增量爬虫:定期爬取网页,只更新那些自上次爬取以来发生变化的网页。

3、网络爬虫的工作原理:

  1. 选择起始点:爬虫从预定义的URL列表或种子URL开始。
  2. 发送请求:爬虫向目标网页发送HTTP请求。
  3. 接收响应:服务器响应请求,返回网页内容。
  4. 解析内容:爬虫解析网页内容,提取有用的信息,如文本、图片、链接等。
  5. 存储数据:将提取的信息存储到数据库中。
  6. 发现新链接:分析网页中的链接,将新的URL添加到待爬取的队列中。
  7. 重复过程:对新发现的链接重复上述过程。

4、网络爬虫的设计考虑:

  1. 爬取策略:如何决定访问哪些网页,常见的策略有广度优先、深度优先等。
  2. 重复内容的处理:避免爬取重复内容,节省资源。
  3. 用户体验:尊重网站的robots.txt文件,遵守爬取规则,减少对服务器的压力。
  4. 数据质量:确保收集的数据准确、完整。
  5. 法律和道德问题:遵守相关法律法规,尊重版权和隐私。

5、搭建开发环境

我使用用conda来管理python环境;使用VScode/pycharm取决于你;

我的往期博客;

window下下载Anaconda及python并创建虚拟环境
在window下下载Anaconda时新建的虚拟环境在C盘解决方案

相关推荐
湫ccc3 分钟前
《Python基础》之pip换国内镜像源
开发语言·python·pip
熙曦Sakura3 分钟前
完全竞争市场
笔记
hakesashou4 分钟前
Python中常用的函数介绍
java·网络·python
菜鸟的人工智能之路14 分钟前
极坐标气泡图:医学数据分析的可视化新视角
python·数据分析·健康医疗
菜鸟学Python15 分钟前
Python 数据分析核心库大全!
开发语言·python·数据挖掘·数据分析
小白不太白95016 分钟前
设计模式之 责任链模式
python·设计模式·责任链模式
喜欢猪猪22 分钟前
Django:从入门到精通
后端·python·django
糖豆豆今天也要努力鸭28 分钟前
torch.__version__的torch版本和conda list的torch版本不一致
linux·pytorch·python·深度学习·conda·torch
何大春44 分钟前
【弱监督语义分割】Self-supervised Image-specific Prototype Exploration for WSSS 论文阅读
论文阅读·人工智能·python·深度学习·论文笔记·原型模式
在下不上天1 小时前
Flume日志采集系统的部署,实现flume负载均衡,flume故障恢复
大数据·开发语言·python