爬虫

Buke..11 小时前
前端·人工智能·爬虫·python·小程序·notepad++
【小程序逆向】某游快爆 AI 逆向 sign参数:AI 辅助分析与 MCP 工具链实战本文章中所有内容仅供学习交流使用,不用于其他任何目的,不提供完整代码,抓包内容、敏感网址、数据接口等均已做脱敏处理,严禁用于商业用途和非法用途,否则由此产生的一切后果均与作者无关!
码农飞哥14 小时前
人工智能·爬虫·langchain·ai编程·亮数据
RAG 翻车实测 + LangGraph Agent 实时抓取修复RAG翻车实测+LangGraph Agent 实时抓取修复体验地址,注册即送美金传统 RAG 分五步:获取、分块、向量化存储、检索、生成。对制度、手册、历史档案,这套链路完全合理,因为这些知识几乎不变。但遇到"最新版本"“今天的公告”"当前价格"这类带时效的问法就会出问题:知识库在 T0 入库时写的是旧值,官方在 T1 更新,用户在 T2 提问,检索到的仍是 T0 的证据。模型能力没有下降,是它手里的证据停在了过去。
小白的成长路程15 小时前
人工智能·爬虫
移动版藏内容,AI爬虫直接跳过很多人以为网站做了响应式设计就万事大吉,但GEO时代移动适配的标准已经变了。AI爬虫默认用手机UA抓取,超过60%的AI搜索查询发生在移动端。如果你的核心内容在移动版被CSS折叠隐藏、表格横向滚动、Schema靠JS动态注入,AI看到的可能只是一个"精简版空壳"。在阳光每一天的知识库中,你的皮卡丘分析过一个典型案例:某内容平台桌面端AI引用率正常,移动端却几乎为零,排查后发现平台为了"清爽感"把数据表格和FAQ全部塞进了折叠面板,AI爬虫不会点击,这些高价值内容对AI根本不可见。更隐蔽的是,触屏体验差导致
IT毕设实战小研17 小时前
java·大数据·后端·爬虫·python·算法·课程设计
基于大数据的二手车数据分析与预测🔥作者:it毕设实战小研🔥 💖简介:java、微信小程序、安卓;定制开发,远程调试 代码讲解,文档指导,ppt制作💖 精彩专栏推荐订阅:在下方专栏👇🏻👇🏻👇🏻👇🏻 Java精彩实战毕设项目案例 小程序精彩项目案例 Python大数据项目案例
深蓝电商API1 天前
爬虫·aes 加密
AES 加密逆向思路在逆向工程与协议分析领域,AES(Advanced Encryption Standard)是目前最常见的对称加密算法,广泛应用于客户端通信加密、本地数据保护、License 校验、固件加密等场景。与自定义异或、简单置换不同,AES 具有严格的数学结构和固定的算法特征,这也为逆向识别与还原提供了明确的抓手。本文从实战角度系统梳理 AES 加密的逆向分析思路,覆盖静态识别、动态抓包、密钥提取、变体对抗等完整链路。
深蓝电商API4 天前
爬虫·ecc
ECC 加密简介ECC(Elliptic Curve Cryptography,椭圆曲线密码学)是现代公钥密码体系的核心分支之一,它基于椭圆曲线数学理论实现加密、签名与密钥交换功能。与传统的 RSA、DSA 等算法相比,ECC 能够以更短的密钥长度提供同等强度的安全保障,在资源受限的移动设备、物联网、区块链等领域得到了广泛应用,已成为当代密码学的主流技术方向。
Buke..2 天前
java·javascript·爬虫·python·算法
【APP 逆向】哔哩哔哩 sign 参数逆向(下):OLLVM 混淆还原 sign 算法本文章中所有内容仅供学习交流使用,不用于其他任何目的,不提供完整代码,抓包内容、敏感网址、数据接口等均已做脱敏处理,严禁用于商业用途和非法用途,否则由此产生的一切后果均与作者无关! 本文章未经许可禁止转载,禁止任何修改后二次传播,擅自使用本文讲解的技术而导致的任何意外,作者均不负责,若有侵权,请联系作者立即删除!
Buke..2 天前
java·开发语言·爬虫·python·安卓
【APP 逆向】哔哩哔哩 sign 参数逆向(上):Frida 反调试绕过与 unidbg 调用本文章中所有内容仅供学习交流使用,不用于其他任何目的,不提供完整代码,抓包内容、敏感网址、数据接口等均已做脱敏处理,严禁用于商业用途和非法用途,否则由此产生的一切后果均与作者无关! 本文章未经许可禁止转载,禁止任何修改后二次传播,擅自使用本文讲解的技术而导致的任何意外,作者均不负责,若有侵权,请联系作者立即删除!
归去来 兮3 天前
开发语言·爬虫·python
Python爬虫爬取数据案例爬虫协议,是每一个爬虫开发者都应该遵守的协议,但是他是一个君子协定,并不是强制协定,但为了维护网络环境,大家都应该遵守下,把环境搞臭了,还是程序员受害。 那爬虫协议怎么看呢,我们可以瞅瞅B站的爬虫协议,获取方式如下:
大鹏说大话3 天前
开发语言·爬虫·python
从爬虫到决策引擎:大数据下自媒体如何用Python挖掘用户痛点在自媒体竞争进入“存量博弈”的时代,爆款不再靠运气,而靠对用户痛点的精准拿捏。内容创作者面临一个核心矛盾:信息过载与洞察稀缺并存——评论区、热榜、社群里藏着海量需求信号,却难以被人工高效识别。Python 作为数据科学与自动化的通用语言,正成为连接“原始数据”与“内容决策”的关键桥梁。本文将系统拆解:自媒体如何从零搭建一套轻量级“数据驱动决策系统”,用爬虫采集信号,用算法提炼痛点,最终反哺内容生产。
Minner-Scrapy3 天前
java·爬虫·python·scrapy·网络爬虫·twisted
Scrapy 2.17 源码解析:Scheduler 调度器与磁盘/内存双队列本文基于 Scrapy 2.17.0 的真实源码逐行分析。 其中 SCHEDULER_START_MEMORY_QUEUE / SCHEDULER_START_DISK_QUEUE(起始请求独立队列)是 2.13+ 才有的机制,旧版本没有,网上资料基本没覆盖。
不叫猫先生4 天前
爬虫·agent
2026 Web Scraping 实战:页面改 class 就归零?用 Bright Data 搭稳定的 Agent 爬虫之前有个需求要爬取某BOSS直聘的岗位信息, 我在Cursor 里让 Agent 去执行,它兴冲冲写出一堆 CSS 选择器,跑通了。过了一段时间,官方页面改了一个 class,整段 pipeline 直接归零,无力回天。
陈皮波比茶3 天前
开发语言·网络·爬虫·python·机器人
Python项目实战-网络机器人(爬虫)爬虫:也称为网络爬虫(网络机器人),是一种按照一定的预设规则,自动浏览并抓取网络数据的程序或脚本场景搜索引擎(百度、Google)
tang777894 天前
爬虫·tcp/ip·scrapy·架构·爬虫代理·动态ip
Scrapy框架动态IP自动轮换集成配置教程做爬虫开发的小伙伴基本都踩过封IP的坑:高频请求站点后IP被限流、封禁,爬虫直接瘫痪。手动换IP效率极低,而Scrapy原生支持代理中间件,搭配动态IP轮换就能完美解决这个问题。
傻啦嘿哟4 天前
java·c++·爬虫
英雄联盟皮肤爬虫:爬取全皮肤价格与特效,做比价工具在《英雄联盟》这款运营超过十五年的游戏中,皮肤早已超越了“外观装饰”的范畴,成为游戏文化的重要组成部分。截至2026年,游戏内已拥有超过160位英雄、超过1500款皮肤——从售价低廉的“勇士”系列,到高达数千元的“神话”限定,每一款皮肤的推出都牵动着亿万玩家的心。
Spider赵毅4 天前
爬虫·python·beautifulsoup
Python爬虫踩坑实录:BeautifulSoup使用中的高频问题排查多数场景下,CSS选择器或find_all直接定位到目标节点就够了。但有一类页面,目标数据的位置取决于上下文关系——比如"标题后面紧跟的那段价格文本",或者"某个特定标签的父级容器的兄弟节点里的字段"。这种定位依赖节点间关系,选择器写不出,就得手动在DOM树里走。
Patrick在香港5 天前
redis·爬虫·python
Python asyncio + aiohttp 并发抓取实战:把同步爬虫改造成 3 倍吞吐量的并发管道上个月我发了篇同步版 HKOpenDataClient(香港政府公开 API 的通用爬虫框架),文末说"如果你要批量抓多个 endpoint,请等下一篇文章"——今天就来填这个坑。
TlSfoward4 天前
爬虫·网络协议·http
TLS指纹库的数据质量与误判治理 TLSFOWARD TLS指纹库TLS指纹库的数据质量与误判治理:工程实践中的五个关键问题建立TLS指纹库并不困难,困难的是让数据长期保持准确。浏览器频繁升级、不同系统实现存在差异,GREASE和网络中间设备也可能改变握手特征。如果缺少数据治理,指纹库很快就会积累重复、过期或标签错误的样本。
天启HTTP4 天前
爬虫·网络协议·tcp/ip
住宅IP和机房IP有什么区别?爬虫场景实测对比在数据采集项目中,很多开发者都会把注意力集中在爬虫框架、请求头设置、并发控制等技术细节上,却忽略了一个影响采集成功率的重要因素——IP类型。
阿图灵5 天前
爬虫·playwright·反爬·z3·猫眼票房
猫眼票房监控系统实战:z3 约束求解破解字体混淆反爬项目地址(Gitee):https://gitee.com/Touari/boxoffice-monitor.git 项目定位:破解猫眼专业版字体混淆反爬,实时抓取解码票房,提供监控/报表/API 全链路服务 技术栈:Python 3.11 · Playwright 1.62 · z3-solver 5.1 · FastAPI 0.133 · SQLite 所有数据均为实测(2026-08-20)