python爬虫学习(1)——初识爬虫

520那天我向心仪的女孩要微信:"女神,能给我你的微信号吗?"

女神:****"爬!!!!"

从那天开始,我就决定要学好爬虫,爬到女神微信号!!!


目录

1、网络爬虫概述

2、网络爬虫的类型:

3、网络爬虫的工作原理:

4、网络爬虫的设计考虑:

5、搭建开发环境


1、网络爬虫概述

网络爬虫(Web Crawler),也称为网页蜘蛛(spider)或机器人(bot),是一种自动浏览互联网的程序。它的主要任务是从一个或多个起始网页开始,递归地访问网页,收集信息,并将其存储在本地数据库中,以供搜索引擎索引或进行其他类型的分析。

2、网络爬虫的类型:

  1. 通用爬虫:爬取互联网上广泛的网页,用于构建大型搜索引擎的索引。
  2. 聚焦爬虫:专注于特定主题或领域的网页,用于构建特定领域的搜索引擎或数据库。
  3. 增量爬虫:定期爬取网页,只更新那些自上次爬取以来发生变化的网页。

3、网络爬虫的工作原理:

  1. 选择起始点:爬虫从预定义的URL列表或种子URL开始。
  2. 发送请求:爬虫向目标网页发送HTTP请求。
  3. 接收响应:服务器响应请求,返回网页内容。
  4. 解析内容:爬虫解析网页内容,提取有用的信息,如文本、图片、链接等。
  5. 存储数据:将提取的信息存储到数据库中。
  6. 发现新链接:分析网页中的链接,将新的URL添加到待爬取的队列中。
  7. 重复过程:对新发现的链接重复上述过程。

4、网络爬虫的设计考虑:

  1. 爬取策略:如何决定访问哪些网页,常见的策略有广度优先、深度优先等。
  2. 重复内容的处理:避免爬取重复内容,节省资源。
  3. 用户体验:尊重网站的robots.txt文件,遵守爬取规则,减少对服务器的压力。
  4. 数据质量:确保收集的数据准确、完整。
  5. 法律和道德问题:遵守相关法律法规,尊重版权和隐私。

5、搭建开发环境

我使用用conda来管理python环境;使用VScode/pycharm取决于你;

我的往期博客;

window下下载Anaconda及python并创建虚拟环境
在window下下载Anaconda时新建的虚拟环境在C盘解决方案

相关推荐
摇滚侠2 分钟前
《SpringBoot 3:入门与应用实战》第 6 章 Spring Boot 最佳实践 阅读笔记 12
android·spring boot·笔记
名字还没想好☜10 分钟前
Python asyncio.Queue 实战:用生产者-消费者给爬虫/任务流限速又解耦
开发语言·爬虫·python·并发·asyncio
金立基包装胶水12 分钟前
格拉辛纸热封后容易开胶怎么办?
大数据·笔记·其他
IT小白杨13 分钟前
多账号运营为什么需要独立浏览器环境:原理、机制与自测方法
服务器·chrome·经验分享·安全架构·指纹浏览器
我命由我1234530 分钟前
人脸识别 - 判断人脸是否在画面中央
java·人工智能·python·java-ee·人脸识别·android jetpack·android runtime
Black_Rock_br32 分钟前
本地AI工具更新,#DSH Desktop桌面端# 正式发布迭代
人工智能·python·开源·运维开发·开源软件
gfdr532 分钟前
把吃灰的电视盒子,改成一台不花月租的监控
python·嵌入式硬件·电视盒子
OPEN-F44 分钟前
Python进阶教程:Git版本控制与团队协作
git·python·elasticsearch
小五兄弟1 小时前
YouTube AI 肖像新机制:单集受限,不影响频道变现
经验分享·音视频·媒体
金立基包装胶水1 小时前
牛皮纸袋用什么热封胶最好?
大数据·笔记·其他