爬虫技术初步自学

目的

本篇文章实际上自学爬虫技术的学习一份学习笔记,希望可以对后学的小白起到帮助,也希望得到大佬的指点,若有错漏希望大佬指出。

初步认知

爬虫实际上是一个计算机程序。开发爬虫程序的常用语言是Python。(Python我已经在五六年前就感觉很火热了,感觉这个语言应该非常好用,后续要提上学习计划了。)

它的行为看起来就像是蜘蛛在网上面爬行一样,顺着互联网这个"网",一条线一条线地"爬行"。所以爬虫在英文中又叫作"Spider",正是蜘蛛这个单词。(Spider man就是蜘蛛侠了,说不定爬虫技术到高深处做好事的话咱也是一名行走在夜之城的侠客也未可知啊)

主要是用于爬取网站的数据,并且效率极高,比起人工收集数据的效率高出很多倍。

爬虫技术的应用

数据收集

由于网页模板大多都是一样的,所以针对一个页面写出了一个爬虫程序就可以通过这个程序获取大量相同的网页数据。

刷流量和秒杀活动

刷流量是爬虫天然自带的功能。当爬虫访问了一个网站时,如果这个爬虫隐藏得很好,网站不能识别这一次访问来自于爬虫,那么就会把它当成正常访问。于是,爬虫就"不小心"地刷了网站的访问量。除了刷流量外,爬虫也可以参与各种秒杀活动,包括但不限于在各种电商网站上抢商品等等。(我想着现在这种防止爬虫的技术基本上大厂的网站已经做过很好的防护程序了,就算要用也只能去小地方看看了

参考文章:

链接: 何为爬虫技术(感谢大佬的技术分享)

相关推荐
Data_Journal16 小时前
Scrapy vs. Crawlee —— 哪个更好?!
运维·人工智能·爬虫·媒体·社媒营销
深蓝电商API17 小时前
async/await与多进程结合的混合爬虫架构
爬虫·架构
Fleshy数模17 小时前
我的第一只Python爬虫:从Requests库到爬取整站新书
开发语言·爬虫·python
喵手17 小时前
Python爬虫实战:采集“界面新闻-科技频道”的文章列表,提取标题、发布时间、摘要(导语)及原文链接(附 CSV 导出)!
爬虫·python·爬虫实战·python爬虫工程化实战·零基础python爬虫教学·采集新闻头条页数据·新闻数据采集
m0_7482299918 小时前
Laravel 1.x:古老框架的现代挑战
爬虫
喵手19 小时前
Python爬虫实战:深挖GitHub开源库的“进化史”,Releases 抓取(附 CSV 导出)!
爬虫·python·爬虫实战·python爬虫工程化实战·零基础python爬虫教学·采集github数据·release抓取
喵手20 小时前
Python爬虫实战:采集小宇宙播客平台的节目数据,提取期数、标题、时长、发布时间、shownotes等字段信息,最终存入SQLite数据库!
爬虫·python·爬虫实战·零基础python爬虫教学·采集小宇宙博客平台数据·小宇宙节目数据·存储sqlite
上海云盾-小余1 天前
什么是恶意爬虫,有什么应对措施
爬虫
喵手1 天前
Python爬虫零基础入门【第九章:实战项目教学·第12节】动态列表:滚动加载采集 300 条(带终止条件)!
爬虫·python·爬虫实战·python爬虫工程化实战·零基础python爬虫教学·动态列表·滚动加载采集条数
Selenium-Wang1 天前
Python多线程与代理IP轻松提升爬虫性能
爬虫·python·tcp/ip