网络爬虫的定义

网络爬虫,即Web Spider,是一个很形象的名字。

把互联网比喻成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。

网络蜘蛛是通过网页的链接地址来寻找网页的。

从网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它链接地址,

然后通过这些链接地址寻找下一个网页,这样一直循环下去,直到把这个网站所有的网页都抓取完为止。

如果把整个互联网当成一个网站,那么网络蜘蛛就可以用这个原理把互联网上所有的网页都抓取下来。

这样看来,网络爬虫就是一个爬行程序,一个抓取网页的程序。

网络爬虫的基本操作是抓取网页。

那么如何才能随心所欲地获得自己想要的页面?

我们先从URL开始。

相关推荐
音视频牛哥10 分钟前
从感知到执行:人形机器人低延迟视频传输与多模态同步方案解析
网络·人工智能·深度学习·大牛直播sdk·机器人视觉·人形机器人·智能机器人
AIBigModel6 小时前
智能情趣设备、爆 bug:可被远程操控。。。
网络·安全·bug
暗流者8 小时前
终端安全与网络威胁防护笔记
网络·安全
xiikzi9 小时前
UDP和TCP协议
网络·tcp/ip·udp
Bruce_Liuxiaowei9 小时前
计划任务:被忽视的网络与系统安全边界
网络·安全·系统安全
optimistic_chen9 小时前
【Java EE初阶 --- 网络原理】JVM
java·jvm·笔记·网络协议·java-ee
wang090710 小时前
网络协议之TCP和UDP
网络协议·tcp/ip·udp
NEUMaple10 小时前
python爬虫(三)----Selenium
爬虫·python·selenium
网络研究院11 小时前
将黑客拒之物联网网络之外的竞赛
网络·物联网·5g·安全·趋势
小白爱电脑12 小时前
Wireshark专家模式定位网络故障:14种TCP异常深度解剖
网络·tcp/ip·wireshark