python爬虫学习(1)——初识爬虫

520那天我向心仪的女孩要微信:"女神,能给我你的微信号吗?"

女神:****"爬!!!!"

从那天开始,我就决定要学好爬虫,爬到女神微信号!!!


目录

1、网络爬虫概述

2、网络爬虫的类型:

3、网络爬虫的工作原理:

4、网络爬虫的设计考虑:

5、搭建开发环境


1、网络爬虫概述

网络爬虫(Web Crawler),也称为网页蜘蛛(spider)或机器人(bot),是一种自动浏览互联网的程序。它的主要任务是从一个或多个起始网页开始,递归地访问网页,收集信息,并将其存储在本地数据库中,以供搜索引擎索引或进行其他类型的分析。

2、网络爬虫的类型:

  1. 通用爬虫:爬取互联网上广泛的网页,用于构建大型搜索引擎的索引。
  2. 聚焦爬虫:专注于特定主题或领域的网页,用于构建特定领域的搜索引擎或数据库。
  3. 增量爬虫:定期爬取网页,只更新那些自上次爬取以来发生变化的网页。

3、网络爬虫的工作原理:

  1. 选择起始点:爬虫从预定义的URL列表或种子URL开始。
  2. 发送请求:爬虫向目标网页发送HTTP请求。
  3. 接收响应:服务器响应请求,返回网页内容。
  4. 解析内容:爬虫解析网页内容,提取有用的信息,如文本、图片、链接等。
  5. 存储数据:将提取的信息存储到数据库中。
  6. 发现新链接:分析网页中的链接,将新的URL添加到待爬取的队列中。
  7. 重复过程:对新发现的链接重复上述过程。

4、网络爬虫的设计考虑:

  1. 爬取策略:如何决定访问哪些网页,常见的策略有广度优先、深度优先等。
  2. 重复内容的处理:避免爬取重复内容,节省资源。
  3. 用户体验:尊重网站的robots.txt文件,遵守爬取规则,减少对服务器的压力。
  4. 数据质量:确保收集的数据准确、完整。
  5. 法律和道德问题:遵守相关法律法规,尊重版权和隐私。

5、搭建开发环境

我使用用conda来管理python环境;使用VScode/pycharm取决于你;

我的往期博客;

window下下载Anaconda及python并创建虚拟环境
在window下下载Anaconda时新建的虚拟环境在C盘解决方案

相关推荐
摇滚侠几秒前
Spring Boot3零基础教程,StreamAPI 的基本用法,笔记99
java·spring boot·笔记
程序猿202311 分钟前
Python每日一练---第三天:删除有序数组中的重复项
开发语言·python
一只游鱼17 分钟前
抖音上的用python实现激励弹窗
开发语言·python
Serendipity_Carl19 分钟前
爬虫数据清洗可视化链家房源
python·pandas·matplotlib
行走在电子领域的工匠23 分钟前
2.2 常用控件
开发语言·python
岑梓铭31 分钟前
《考研408数据结构》第六章(5.5树的应用)复习笔记
数据结构·笔记·考研·408·ds
天才测试猿31 分钟前
Selenium三大等待详解
自动化测试·软件测试·python·selenium·测试工具·职场和发展·测试用例
梨轻巧1 小时前
pyside6安装:下载python、配置环境变量、vscode安装和测试pyside6、可能遇到的错误、pycharm 安装pyside6
python
wu_jing_sheng01 小时前
电商销售数据分析实战:从数据挖掘到业务增长
python
前路不黑暗@1 小时前
Java:继承与多态
java·开发语言·windows·经验分享·笔记·学习·学习方法