技术栈
爬虫
'pi%'
11 小时前
爬虫
·
pdf
·
ocr
LangGraph 多智能体实战:搭建电力政策跟踪 Agent,实现网页爬虫、OCR 与 PDF 文档自动化解析
随着国内电力市场化改革持续推进,各省电力交易中心持续发布交易规则、政策文件、市场通知。电力从业者需要持续跟踪海量PDF公告、网页政策文本,人工整理、对比政策差异、提取核心条款成本极高。传统单一大模型应用无法完成网页采集→文档解析→文本抽取→知识入库→智能分析完整流水线。
TlSfoward
10 小时前
服务器
·
爬虫
·
网络协议
·
https
TLSFoward 能帮你看到什么 TLSFOWARD抓包工具
在网页调试和爬虫排查中,很多人一看到验证就去检查 Cookie 是否存在。但实际问题往往不止“有没有带上”,还包括 Cookie 的生命周期、作用域、过期时间、刷新时机和传递路径。一个 Cookie 在登录后可用,不代表在跳转后、资源请求里、跨域访问中或者长期运行任务中仍然有效。本文从会话生命周期角度解释为什么 Cookie 和验证问题经常绑定出现,帮助读者在自有系统、测试环境和授权排查中判断问题到底出在身份状态、路径切换,还是协议差异。文章结合 TLSFoward 官网公开展示的 HTTP 流量和 TL
2501_91600747
11 小时前
爬虫
·
python
·
ios
·
小程序
·
https
·
uni-app
·
iphone
Python实现HTTPS爬虫的完整指南:使用requests、BeautifulSoup、Selenium和Scrapy
在Python中进行HTTPS爬虫,可以使用多个库来实现,其中包括 requests库、BeautifulSoup库、Scrapy框架 等。以下是关于如何使用Python进行HTTPS爬虫的一些核心观点: 使用requests库发送HTTPS请求、解析HTML内容使用BeautifulSoup、处理动态网页使用Selenium、使用Scrapy进行复杂爬虫任务。其中,使用requests库发送HTTPS请求是最基础和常用的方法之一。接下来,将详细描述如何使用requests库进行HTTPS请求。
杨先生哦
12 小时前
前端
·
人工智能
·
笔记
·
爬虫
·
安全
【2026热端攻防系列 11/12】前端AI风控攻防实战:验证码缺陷、人机验证绕过、智能爬虫对抗与企业智能风控加固方案
标签:#Web安全 #前端安全 #热端攻防 #AI风控 #人机验证 #验证码安全 #反爬虫 #智能对抗 #2026安全热点
久久学姐
12 小时前
爬虫
·
python
·
http
·
框架
·
数据存储
Python开发爬虫的常用技术架构
爬虫, 是一种自动化程序, 它能用于浏览互联网上的网页, 还能依据一定规则自动抓取网页内容, 其主要功能是从一个起始网址, 或者多个起始网址开始, 借助解析网页内容找到新链接, 接着继续访问这些新链接, 以此遍历整个网站, 或者互联网的一部分, 它在搜索引擎、数据挖掘、信息检索等领域有着广泛应用。
tang77789
12 小时前
分布式
·
爬虫
·
python
·
tcp/ip
·
分布式爬虫
·
爬虫代理
·
代理ip
分布式爬虫优化指南:如何用代理IP把采集效率提升300%
做过分布式数据采集的朋友应该都有同感:爬虫跑不满、提速提不动,真不是机器算力和带宽不够,绝大多数情况都是被IP封禁、访问限流、高频拦截这三大风控卡死了。常规分布式集群看着节点多、配置高,实际能用上的算力往往不到30%,大部分时间都在重试、超时、休眠空耗资源。想要真正跑满集群性能、把采集效率直接拉满,代理IP绝对是性价比最高的优化方案,熟练用对方法,轻松实现300%以上的效率提升。这篇指南就用通俗好懂的方式,从原理、IP选型、实操技巧、避坑要点到落地流程,手把手讲透分布式爬虫的代理IP优化思路。
tang77789
3 天前
爬虫
·
python
·
网络协议
·
tcp/ip
·
动态代理ip
·
免费代理ip
爬虫频繁429封禁?代理IP轮换+请求指纹优化全流程解决方案
爬虫开发过程中,429 Too Many Requests 高频限流封禁是最常见的核心问题。其本质是目标服务器基于IP访问频率、客户端指纹、请求行为特征触发的自动化风控拦截。单纯延长请求间隔仅能临时缓解问题,无法解决高频爬取、批量采集场景下的永久性IP封禁与指纹拉黑问题。
二十雨辰
2 天前
爬虫
[爬虫]-request
基本使用get请求post请求代理cookie定制: 获取验证码然后调用登录接口, 登录接口登录成功会返回页面数据, 拿到页面数据
狗都不学爬虫_
2 天前
爬虫
·
python
·
网络爬虫
AI逆向 - 99aq中心滑块验证+登录(wasm纯算)
提示:仅供学习,不得用做商业交易,如有侵权请及时联系课程早鸟最后2天!!!感兴趣主页+推荐中转(稳定+实惠):aHR0cHM6Ly93d3cub3JhbmdlY2MuY2MvcmVnaXN0ZXI/YWZmPTZFUDdTR1haRzJTRA==
hyf326633
3 天前
运维
·
服务器
·
爬虫
·
百度
·
seo
泛程序:从零开始搭建稳定程序项目框架
在当今数字化的时代,泛程序的概念愈发受到关注。泛程序,即具有广泛适用性和灵活性的程序体系,从零开始搭建稳定的程序项目框架,是众多开发者和创业者面临的重要任务。
进击的雷神
3 天前
爬虫
·
spiderflow
攻克俄语编码适配与无ID字段去重:基于纯URL拼接的国际化爬虫设计
在实际爬虫开发中,我们经常会遇到两种特殊场景:一是目标网站使用非英语语言(如俄语),虽然对爬虫本身影响不大,但需要注意编码问题;二是网站没有独立的新闻ID字段,必须完全依赖URL进行去重。这两种情况的结合,对爬虫的URL处理能力和去重策略提出了特殊要求。
JackSparrow414
4 天前
前端
·
javascript
·
后端
·
爬虫
·
python
·
安全
前端安全之JS混淆+请求加密+请求签名以提升爬虫难度
之前的Python(一)实现一个爬取微信小程序数据并定时秒杀的爬虫+工程化初步实践 爬取了目标网站的接口,这个目标网站在请求接口方面没做什么防护,只要会抓包的爬虫小子都能根据请求格式构造合法的请求数据,这种没难度的接口基本上把所有压力都给到了后端。恰好近2年自己偶尔也思考如何提高爬虫小子分析后端接口的难度,再加上偶尔看到一些大型网站如阿里云等,F12看到的请求体有时候是一堆加了密的乱码,所以趁此机会自己简单实现一下以清楚的知道基本流程
kisloy
4 天前
开发语言
·
爬虫
·
python
【爬虫入门第5讲】Python爬虫文本解析详解
在数据驱动的时代,网络爬虫是获取公开数据的重要工具。而爬虫的核心环节之一,便是数据提取——从杂乱的HTML/XML文档中精准抓取所需信息。Python生态提供了多种强大的解析库,本文将深入讲解lxml、BeautifulSoup4和re(正则表达式) 三大工具,并对比XPath、CSS选择器和正则匹配的适用场景,助你成为数据提取高手。
上海云盾-小余
4 天前
网络
·
爬虫
·
安全
·
小程序
·
ddos
CC 高频请求 + DDoS 流量攻击实战防御:全链路 WAF 流量清洗部署完整流程
本文详细阐述了针对 CC(Challenge Collapsar)高频请求攻击与 DDoS(分布式拒绝服务)流量攻击的实战防御方案,重点介绍了基于全链路 Web 应用防火墙(WAF)进行流量清洗的完整部署流程。内容涵盖攻击原理剖析、防御架构设计、主流 WAF 产品选型对比、从域名解析到后端服务的全链路配置步骤、精细化策略调优以及实战攻防演练验证,旨在为运维、安全及开发人员提供一套可落地、可复制的企业级防护体系构建指南。
喜欢吃豆
4 天前
运维
·
爬虫
·
自动化
Playwright 深度解析:从浏览器自动化到动态爬虫、自动化测试与 AI Agent
在传统爬虫中,我们通常使用 requests、httpx 或 curl 向服务器发送 HTTP 请求,然后解析返回的 HTML。
kisloy
4 天前
爬虫
·
scrapy
·
中间件
【爬虫入门第10讲】Scrapy 框架深度解析(一):五大组件与中间件
Scrapy 是 Python 生态中最成熟、最强大的异步爬虫框架之一,由 Zyte(原 Scrapinghub)开发维护。它基于 Twisted 事件循环引擎,天然支持异步并发,能够高效处理大规模网页抓取任务。本文将从架构设计、核心组件、中间件机制、分布式扩展、性能调优等维度,带你全面掌握 Scrapy 的精髓。
IPdodo_
4 天前
爬虫
·
python
·
网络代理
·
代理ip
·
ipdodo
Python 接入代理IP:爬虫网络优化实战
在爬虫、数据采集和多店铺运营中,代理 IP 是绕过目标站频率限制和地理封锁的常用手段。但直接给 requests.get() 加一个 proxies 参数只是第一步,真正影响稳定性和效率的是代理轮换、Session 复用、超时重试、并发控制和请求指纹。
kisloy
4 天前
爬虫
·
python
·
自动化
【爬虫入门第9讲】Python爬虫浏览器自动化
在2026年的今天,Web应用愈发复杂,动态渲染、反爬机制层出不穷。对于爬虫工程师而言,浏览器自动化库早已不是“可选项”,而是“必备武器”。本文将带你深入剖析两大主流库——Selenium(老牌霸主)与Playwright(微软新锐),从安装、核心用法到性能对比,助你选对工具,高效爬取。
独行侠影a
4 天前
爬虫
·
python
·
selenium
Selenium 爬虫反爬实战:Python 模拟浏览器点击动态页面采集
在 Python 爬虫开发中,我们经常会遇到动态渲染页面、AJAX 异步加载、按钮点击触发数据加载等场景。传统的 requests+BeautifulSoup 静态爬虫只能获取页面源码,无法执行 JavaScript,自然拿不到动态生成的数据。而 Selenium 作为主流的自动化测试工具,能完美模拟浏览器行为,成为破解动态页面、应对基础反爬机制的利器。
kisloy
5 天前
开发语言
·
爬虫
·
python
【爬虫入门第8讲】Python爬虫反爬入门
服务器首先会检查HTTP请求头中的User-Agent字段,识别请求是否来自浏览器。默认的python-requests/2.x很容易被识别并拒绝。