爬虫

深蓝电商API7 小时前
爬虫
Font Fingerprint 原理详解在浏览器指纹技术体系中,字体指纹(Font Fingerprint)是最隐蔽且区分度极高的追踪维度之一。不同于 Cookie、LocalStorage 等显式存储机制,字体指纹利用操作系统与浏览器渲染层的天然差异生成设备标识,即便用户清除缓存、切换 IP,指纹特征依然稳定。本文将从底层原理、实现技术、检测手段到防御策略,系统拆解字体指纹的技术全貌。
绘梨衣5478 小时前
爬虫·架构
水质月报爬虫解析架构选型:动态表头映射为主 + 字段覆盖率监控为辅(工程复盘)本文聚焦全国地表水月度水质监测报表长期自动化采集场景,结合2016-2025十年全量真实表头数据,完整拆解业务现状、迭代痛点、技术边界与架构瓶颈,深度对比两套主流表格解析方案:传统年月白名单固定路由方案、动态语义映射+监控安全层方案。
Python大数据分析@8 小时前
爬虫
如何应对网站反爬虫策略?如何高效地爬大量数据?现在大型网站的反爬策略越来越高明了,不仅是对IP访问频率、User-Agent请求头进行异常识别,还会分析IP地址、浏览器指纹、JS动态加载、API逆向、行为模式等方式各种设卡,动不动跳出五花八门的验证码,非常难搞。
'pi%'10 小时前
人工智能·爬虫·microsoft·langchain·ocr·能源
多 Agent 协同方案实践:基于 LangGraph 搭建能源领域智能调度工作流版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
kisloy1 天前
网络·爬虫·scrapy
【爬虫入门第13讲】Scrapy 框架深度解析(四)核心配置与自定义扩展Scrapy 作为 Python 生态中最强大的爬虫框架之一,其灵活性与可扩展性很大程度上源于 settings.py 中的配置体系。无论是控制爬虫行为、优化性能,还是注入自定义逻辑,理解这些配置都是进阶的必经之路。本文将深入剖析六个核心配置项,并手把手教你编写自定义扩展(Extension),让你真正掌控 Scrapy 的运行机制。
'pi%'1 天前
爬虫·pdf·ocr
LangGraph 多智能体实战:搭建电力政策跟踪 Agent,实现网页爬虫、OCR 与 PDF 文档自动化解析随着国内电力市场化改革持续推进,各省电力交易中心持续发布交易规则、政策文件、市场通知。电力从业者需要持续跟踪海量PDF公告、网页政策文本,人工整理、对比政策差异、提取核心条款成本极高。传统单一大模型应用无法完成网页采集→文档解析→文本抽取→知识入库→智能分析完整流水线。
TlSfoward1 天前
服务器·爬虫·网络协议·https
TLSFoward 能帮你看到什么 TLSFOWARD抓包工具在网页调试和爬虫排查中,很多人一看到验证就去检查 Cookie 是否存在。但实际问题往往不止“有没有带上”,还包括 Cookie 的生命周期、作用域、过期时间、刷新时机和传递路径。一个 Cookie 在登录后可用,不代表在跳转后、资源请求里、跨域访问中或者长期运行任务中仍然有效。本文从会话生命周期角度解释为什么 Cookie 和验证问题经常绑定出现,帮助读者在自有系统、测试环境和授权排查中判断问题到底出在身份状态、路径切换,还是协议差异。文章结合 TLSFoward 官网公开展示的 HTTP 流量和 TL
2501_916007471 天前
爬虫·python·ios·小程序·https·uni-app·iphone
Python实现HTTPS爬虫的完整指南:使用requests、BeautifulSoup、Selenium和Scrapy在Python中进行HTTPS爬虫,可以使用多个库来实现,其中包括 requests库、BeautifulSoup库、Scrapy框架 等。以下是关于如何使用Python进行HTTPS爬虫的一些核心观点: 使用requests库发送HTTPS请求、解析HTML内容使用BeautifulSoup、处理动态网页使用Selenium、使用Scrapy进行复杂爬虫任务。其中,使用requests库发送HTTPS请求是最基础和常用的方法之一。接下来,将详细描述如何使用requests库进行HTTPS请求。
杨先生哦1 天前
前端·人工智能·笔记·爬虫·安全
【2026热端攻防系列 11/12】前端AI风控攻防实战:验证码缺陷、人机验证绕过、智能爬虫对抗与企业智能风控加固方案标签:#Web安全 #前端安全 #热端攻防 #AI风控 #人机验证 #验证码安全 #反爬虫 #智能对抗 #2026安全热点
久久学姐1 天前
爬虫·python·http·框架·数据存储
Python开发爬虫的常用技术架构爬虫, 是一种自动化程序, 它能用于浏览互联网上的网页, 还能依据一定规则自动抓取网页内容, 其主要功能是从一个起始网址, 或者多个起始网址开始, 借助解析网页内容找到新链接, 接着继续访问这些新链接, 以此遍历整个网站, 或者互联网的一部分, 它在搜索引擎、数据挖掘、信息检索等领域有着广泛应用。
tang777891 天前
分布式·爬虫·python·tcp/ip·分布式爬虫·爬虫代理·代理ip
分布式爬虫优化指南:如何用代理IP把采集效率提升300%做过分布式数据采集的朋友应该都有同感:爬虫跑不满、提速提不动,真不是机器算力和带宽不够,绝大多数情况都是被IP封禁、访问限流、高频拦截这三大风控卡死了。常规分布式集群看着节点多、配置高,实际能用上的算力往往不到30%,大部分时间都在重试、超时、休眠空耗资源。想要真正跑满集群性能、把采集效率直接拉满,代理IP绝对是性价比最高的优化方案,熟练用对方法,轻松实现300%以上的效率提升。这篇指南就用通俗好懂的方式,从原理、IP选型、实操技巧、避坑要点到落地流程,手把手讲透分布式爬虫的代理IP优化思路。
tang777894 天前
爬虫·python·网络协议·tcp/ip·动态代理ip·免费代理ip
爬虫频繁429封禁?代理IP轮换+请求指纹优化全流程解决方案爬虫开发过程中,429 Too Many Requests 高频限流封禁是最常见的核心问题。其本质是目标服务器基于IP访问频率、客户端指纹、请求行为特征触发的自动化风控拦截。单纯延长请求间隔仅能临时缓解问题,无法解决高频爬取、批量采集场景下的永久性IP封禁与指纹拉黑问题。
二十雨辰3 天前
爬虫
[爬虫]-request基本使用get请求post请求代理cookie定制: 获取验证码然后调用登录接口, 登录接口登录成功会返回页面数据, 拿到页面数据
狗都不学爬虫_3 天前
爬虫·python·网络爬虫
AI逆向 - 99aq中心滑块验证+登录(wasm纯算)提示:仅供学习,不得用做商业交易,如有侵权请及时联系课程早鸟最后2天!!!感兴趣主页+推荐中转(稳定+实惠):aHR0cHM6Ly93d3cub3JhbmdlY2MuY2MvcmVnaXN0ZXI/YWZmPTZFUDdTR1haRzJTRA==
hyf3266334 天前
运维·服务器·爬虫·百度·seo
泛程序:从零开始搭建稳定程序项目框架在当今数字化的时代,泛程序的概念愈发受到关注。泛程序,即具有广泛适用性和灵活性的程序体系,从零开始搭建稳定的程序项目框架,是众多开发者和创业者面临的重要任务。
进击的雷神4 天前
爬虫·spiderflow
攻克俄语编码适配与无ID字段去重:基于纯URL拼接的国际化爬虫设计在实际爬虫开发中,我们经常会遇到两种特殊场景:一是目标网站使用非英语语言(如俄语),虽然对爬虫本身影响不大,但需要注意编码问题;二是网站没有独立的新闻ID字段,必须完全依赖URL进行去重。这两种情况的结合,对爬虫的URL处理能力和去重策略提出了特殊要求。
JackSparrow4145 天前
前端·javascript·后端·爬虫·python·安全
前端安全之JS混淆+请求加密+请求签名以提升爬虫难度之前的Python(一)实现一个爬取微信小程序数据并定时秒杀的爬虫+工程化初步实践 爬取了目标网站的接口,这个目标网站在请求接口方面没做什么防护,只要会抓包的爬虫小子都能根据请求格式构造合法的请求数据,这种没难度的接口基本上把所有压力都给到了后端。恰好近2年自己偶尔也思考如何提高爬虫小子分析后端接口的难度,再加上偶尔看到一些大型网站如阿里云等,F12看到的请求体有时候是一堆加了密的乱码,所以趁此机会自己简单实现一下以清楚的知道基本流程
kisloy5 天前
开发语言·爬虫·python
【爬虫入门第5讲】Python爬虫文本解析详解在数据驱动的时代,网络爬虫是获取公开数据的重要工具。而爬虫的核心环节之一,便是数据提取——从杂乱的HTML/XML文档中精准抓取所需信息。Python生态提供了多种强大的解析库,本文将深入讲解lxml、BeautifulSoup4和re(正则表达式) 三大工具,并对比XPath、CSS选择器和正则匹配的适用场景,助你成为数据提取高手。
上海云盾-小余5 天前
网络·爬虫·安全·小程序·ddos
CC 高频请求 + DDoS 流量攻击实战防御:全链路 WAF 流量清洗部署完整流程本文详细阐述了针对 CC(Challenge Collapsar)高频请求攻击与 DDoS(分布式拒绝服务)流量攻击的实战防御方案,重点介绍了基于全链路 Web 应用防火墙(WAF)进行流量清洗的完整部署流程。内容涵盖攻击原理剖析、防御架构设计、主流 WAF 产品选型对比、从域名解析到后端服务的全链路配置步骤、精细化策略调优以及实战攻防演练验证,旨在为运维、安全及开发人员提供一套可落地、可复制的企业级防护体系构建指南。
喜欢吃豆5 天前
运维·爬虫·自动化
Playwright 深度解析:从浏览器自动化到动态爬虫、自动化测试与 AI Agent在传统爬虫中,我们通常使用 requests、httpx 或 curl 向服务器发送 HTTP 请求,然后解析返回的 HTML。