技术栈
爬虫
深蓝电商API
1 天前
爬虫
·
ecc
ECC 加密简介
ECC(Elliptic Curve Cryptography,椭圆曲线密码学)是现代公钥密码体系的核心分支之一,它基于椭圆曲线数学理论实现加密、签名与密钥交换功能。与传统的 RSA、DSA 等算法相比,ECC 能够以更短的密钥长度提供同等强度的安全保障,在资源受限的移动设备、物联网、区块链等领域得到了广泛应用,已成为当代密码学的主流技术方向。
Buke..
5 小时前
java
·
javascript
·
爬虫
·
python
·
算法
【APP 逆向】哔哩哔哩 sign 参数逆向(下):OLLVM 混淆还原 sign 算法
本文章中所有内容仅供学习交流使用,不用于其他任何目的,不提供完整代码,抓包内容、敏感网址、数据接口等均已做脱敏处理,严禁用于商业用途和非法用途,否则由此产生的一切后果均与作者无关! 本文章未经许可禁止转载,禁止任何修改后二次传播,擅自使用本文讲解的技术而导致的任何意外,作者均不负责,若有侵权,请联系作者立即删除!
Buke..
6 小时前
java
·
开发语言
·
爬虫
·
python
·
安卓
【APP 逆向】哔哩哔哩 sign 参数逆向(上):Frida 反调试绕过与 unidbg 调用
本文章中所有内容仅供学习交流使用,不用于其他任何目的,不提供完整代码,抓包内容、敏感网址、数据接口等均已做脱敏处理,严禁用于商业用途和非法用途,否则由此产生的一切后果均与作者无关! 本文章未经许可禁止转载,禁止任何修改后二次传播,擅自使用本文讲解的技术而导致的任何意外,作者均不负责,若有侵权,请联系作者立即删除!
归去来 兮
11 小时前
开发语言
·
爬虫
·
python
Python爬虫爬取数据案例
爬虫协议,是每一个爬虫开发者都应该遵守的协议,但是他是一个君子协定,并不是强制协定,但为了维护网络环境,大家都应该遵守下,把环境搞臭了,还是程序员受害。 那爬虫协议怎么看呢,我们可以瞅瞅B站的爬虫协议,获取方式如下:
大鹏说大话
1 天前
开发语言
·
爬虫
·
python
从爬虫到决策引擎:大数据下自媒体如何用Python挖掘用户痛点
在自媒体竞争进入“存量博弈”的时代,爆款不再靠运气,而靠对用户痛点的精准拿捏。内容创作者面临一个核心矛盾:信息过载与洞察稀缺并存——评论区、热榜、社群里藏着海量需求信号,却难以被人工高效识别。Python 作为数据科学与自动化的通用语言,正成为连接“原始数据”与“内容决策”的关键桥梁。本文将系统拆解:自媒体如何从零搭建一套轻量级“数据驱动决策系统”,用爬虫采集信号,用算法提炼痛点,最终反哺内容生产。
Minner-Scrapy
1 天前
java
·
爬虫
·
python
·
scrapy
·
网络爬虫
·
twisted
Scrapy 2.17 源码解析:Scheduler 调度器与磁盘/内存双队列
本文基于 Scrapy 2.17.0 的真实源码逐行分析。 其中 SCHEDULER_START_MEMORY_QUEUE / SCHEDULER_START_DISK_QUEUE(起始请求独立队列)是 2.13+ 才有的机制,旧版本没有,网上资料基本没覆盖。
不叫猫先生
1 天前
爬虫
·
agent
2026 Web Scraping 实战:页面改 class 就归零?用 Bright Data 搭稳定的 Agent 爬虫
之前有个需求要爬取某BOSS直聘的岗位信息, 我在Cursor 里让 Agent 去执行,它兴冲冲写出一堆 CSS 选择器,跑通了。过了一段时间,官方页面改了一个 class,整段 pipeline 直接归零,无力回天。
陈皮波比茶
1 天前
开发语言
·
网络
·
爬虫
·
python
·
机器人
Python项目实战-网络机器人(爬虫)
爬虫:也称为网络爬虫(网络机器人),是一种按照一定的预设规则,自动浏览并抓取网络数据的程序或脚本场景搜索引擎(百度、Google)
tang77789
1 天前
爬虫
·
tcp/ip
·
scrapy
·
架构
·
爬虫代理
·
动态ip
Scrapy框架动态IP自动轮换集成配置教程
做爬虫开发的小伙伴基本都踩过封IP的坑:高频请求站点后IP被限流、封禁,爬虫直接瘫痪。手动换IP效率极低,而Scrapy原生支持代理中间件,搭配动态IP轮换就能完美解决这个问题。
傻啦嘿哟
2 天前
java
·
c++
·
爬虫
英雄联盟皮肤爬虫:爬取全皮肤价格与特效,做比价工具
在《英雄联盟》这款运营超过十五年的游戏中,皮肤早已超越了“外观装饰”的范畴,成为游戏文化的重要组成部分。截至2026年,游戏内已拥有超过160位英雄、超过1500款皮肤——从售价低廉的“勇士”系列,到高达数千元的“神话”限定,每一款皮肤的推出都牵动着亿万玩家的心。
Spider赵毅
2 天前
爬虫
·
python
·
beautifulsoup
Python爬虫踩坑实录:BeautifulSoup使用中的高频问题排查
多数场景下,CSS选择器或find_all直接定位到目标节点就够了。但有一类页面,目标数据的位置取决于上下文关系——比如"标题后面紧跟的那段价格文本",或者"某个特定标签的父级容器的兄弟节点里的字段"。这种定位依赖节点间关系,选择器写不出,就得手动在DOM树里走。
Patrick在香港
2 天前
redis
·
爬虫
·
python
Python asyncio + aiohttp 并发抓取实战:把同步爬虫改造成 3 倍吞吐量的并发管道
上个月我发了篇同步版 HKOpenDataClient(香港政府公开 API 的通用爬虫框架),文末说"如果你要批量抓多个 endpoint,请等下一篇文章"——今天就来填这个坑。
TlSfoward
2 天前
爬虫
·
网络协议
·
http
TLS指纹库的数据质量与误判治理 TLSFOWARD TLS指纹库
TLS指纹库的数据质量与误判治理:工程实践中的五个关键问题建立TLS指纹库并不困难,困难的是让数据长期保持准确。浏览器频繁升级、不同系统实现存在差异,GREASE和网络中间设备也可能改变握手特征。如果缺少数据治理,指纹库很快就会积累重复、过期或标签错误的样本。
天启HTTP
2 天前
爬虫
·
网络协议
·
tcp/ip
住宅IP和机房IP有什么区别?爬虫场景实测对比
在数据采集项目中,很多开发者都会把注意力集中在爬虫框架、请求头设置、并发控制等技术细节上,却忽略了一个影响采集成功率的重要因素——IP类型。
阿图灵
2 天前
爬虫
·
playwright
·
反爬
·
z3
·
猫眼票房
猫眼票房监控系统实战:z3 约束求解破解字体混淆反爬
项目地址(Gitee):https://gitee.com/Touari/boxoffice-monitor.git 项目定位:破解猫眼专业版字体混淆反爬,实时抓取解码票房,提供监控/报表/API 全链路服务 技术栈:Python 3.11 · Playwright 1.62 · z3-solver 5.1 · FastAPI 0.133 · SQLite 所有数据均为实测(2026-08-20)
小白学大数据
3 天前
人工智能
·
pytorch
·
爬虫
·
python
CuPy vs Numba vs PyTorch:GPU 加速方案怎么选
引言:数据进得来,才算得动大规模数据采集常被目标站点限流、封 IP、验证码拦截。企业级代理 IP 服务如 亿牛云可让采集在分布式节点间平滑切换出口,保障数据稳定入库。数据进来后,瓶颈转向算力——下面用代码直接对比 CuPy、Numba、PyTorch 三种上 GPU 的方式。
亿牛云爬虫专家
3 天前
爬虫
·
python
·
隧道代理
·
舆情采集
·
媒体权重
·
频率控制
·
ip自动轮换
爬虫调度系统设计:用 Celery 实现按媒体权重动态调整的抓取频率控制
做舆情采集的朋友大多遇到过这个两难:固定频率去抓全网媒体,要么低频漏掉突发热点,要么高频把代理流量烧光还被站点限流。我之前一套系统就是这么垮的——所有媒体一刀切每 5 分钟抓一次,结果低权重的边缘站点占了七成请求量,真正该盯紧的头部媒体反而因为代理配额被挤占,关键时刻没抓到关键稿件。
2601_96687140
3 天前
爬虫
·
python
·
数据挖掘
Python 爬虫 + 数据挖掘实战:数据抓取与深度挖掘分析全流程
在数据驱动决策的时代,Python爬虫与数据挖掘的结合,正从单纯的“数据采集”升维为“构建智能决策系统的感知触角”。一个完整的全流程项目,绝非止步于将网页内容存入数据库,而是构建一个从感知外部世界到输出业务洞察的闭环系统。///“虾仔”>>>:jzit点top
pass_by_Z
3 天前
开发语言
·
爬虫
·
python
Python异步爬虫实战:从零到一构建高性能并发爬虫
随着互联网数据量的爆炸式增长,单线程的爬虫已经难以满足我们对数据采集效率的需求。传统的同步爬虫虽然代码简单,但每次请求都需要等待服务器响应,造成了大量的时间浪费在IO等待上。而异步爬虫能够充分利用等待时间,同时发起多个请求,极大地提升爬取效率。