技术栈
爬虫
小静AI工程实验室
6 小时前
爬虫
·
python
·
json
Python 爬虫解析 JSON-LD:多块 script、@graph 与坏数据的 9 个边界
很多商品页、文章页把结构化数据放在 <script type="application/ld+json"> 中。它看起来像一个 JSON 对象,实际爬虫最容易在三个地方出错:只取第一块 script、把 @graph 当普通字段、遇到一块坏 JSON 就让整页失败。
要吃这碗饭
6 小时前
网络
·
爬虫
·
网络协议
YouTube 数据抓取出现 429/403 错误?2026 反爬机制拆解与爬虫选型指南
抓取 YouTube 视频、频道或评论数据时,403、429、CAPTCHA 和内容为空等问题并不少见,其原因往往涉及 IP、请求频率、客户端特征和页面渲染。2026 年,YouTube 自动化访问校验更加复杂,选对抓取方式并优化网络环境,比反复修改代码更重要。本文将从工具选型、反爬机制和报错排查展开分析。
袁袁袁袁满
7 小时前
爬虫
·
python
·
自动化
·
爬虫实战
·
多线程爬虫
AI Agent 如何“看懂“互联网?
新手用户注册就送30刀试用金:点击免费体验亮数据官号:爬虫技巧/代理IP/粉丝福利
Helix250
8 小时前
爬虫
·
python
·
beautifulsoup
·
excel
·
python教程
·
requests
·
网页数据
Python爬虫零基础实战:3步抓取网页数据并导出Excel
在掌握了Python基础语法后,很多初学者会陷入“学完就忘”的困境。而网络爬虫作为Python最经典的应用场景之一,不仅能让你快速看到代码的实际效果,还能串联起文件操作、字符串处理、第三方库调用等多个核心知识点。本文将带你从零开始,用3个步骤完成一个完整的网页数据抓取项目,并将结果导出为Excel文件,真正实现学以致用。
深蓝电商API
1 天前
爬虫
·
frida
Frida入门到实战:hook so层与Java层的姿势总结
Frida 是一款跨平台的动态二进制插桩工具,凭借 JavaScript 脚本化、轻量灵活、全平台覆盖的特性,成为移动端逆向分析、安全测试领域的标配工具。无论是 Java 层的业务逻辑 Hook,还是 so 原生层的算法分析,Frida 都能提供统一的操作范式。本文将从基础环境搭建出发,系统总结 Java 层与 so 层的常用 Hook 姿势,结合实战案例梳理完整的分析链路,帮助读者快速掌握 Frida 的核心用法。
小静AI工程实验室
1 天前
爬虫
·
python
·
缓存
robots.txt 不是门禁:RFC 9309 规则、缓存与 Python 爬虫的 10 个边界
爬虫启动前,经常有人问“robots.txt 能不能爬”。更准确的说法是:它是站点公开给自动客户端的访问约定,不是登录鉴权,也不是防火墙。RFC 9309 将 Robots Exclusion Protocol 定义为服务方控制爬虫访问 URI 的规则,并明确这些规则不是访问授权。
远航计算机
1 天前
人工智能
·
爬虫
·
aigc
AI 爬虫分三种,你 robots.txt 里挡的是哪一种?
有位站长上周翻了服务器日志,越看越不对劲:GPTBot、ClaudeBot、PerplexityBot 轮着来,一天好几百次请求。可他让同事去 AI 里搜了十个行业问题,公司名一次都没出现。
深蓝电商API
2 天前
爬虫
·
验证码
大厂验证码对抗升级:从“破解”到“养环境”的思路转变
在很多人的认知里,验证码对抗的核心是 “解题”—— 用 OCR 识别字符、用 AI 模型点选图文、用脚本模拟滑块轨迹,只要答案正确就能通关。但随着国内大厂与海外主流风控体系的全面升级,这条路径正在快速失效。
Getgit
2 天前
爬虫
·
亮数据
·
broowser api
亮数据 | Browser API 实战:Booking.com 动态页面抓取对比
视频讲解:JS网站太难爬?Browser API处理动态网站全流程实战在做旅游、电商、社交平台这类网页采集时,很多页面已经不是简单的静态 HTML。页面内容需要 JS 渲染,还可能包含验证码、弹窗、搜索表单、日期选择器等交互流程。
深蓝电商API
3 天前
爬虫
·
recaptcha
·
hcaptcha
·
turnstile
reCAPTCHA/hCaptcha/Turnstile三大国际验证码对比研究
验证码(CAPTCHA)作为互联网人机身份鉴别基础防线,自 1997 年诞生以来经历了从字符扭曲、图像识别到行为分析的三代技术迭代。随着全球隐私监管趋严与用户体验要求提升,传统视觉验证码的局限性日益凸显,市场逐步形成 Google reCAPTCHA、Intuition Machines hCaptcha 与 Cloudflare Turnstile 三足鼎立的格局。
深蓝电商API
3 天前
爬虫
·
验证码
从零训练自己的验证码识别模型:数据生成到部署
验证码(CAPTCHA)是互联网最常见的人机验证手段之一,从早期的字符扭曲验证码到后来的点选、滑动、行为验证,技术形态不断演进。其中字符型验证码因实现简单、部署成本低,至今仍被大量网站使用。对于需要自动化业务流程的场景,训练一个专属的验证码识别模型,比调用第三方接口更灵活、成本更低。
wuyk555
4 天前
开发语言
·
爬虫
·
python
Python 网络爬虫入门到实战 第 04 章:请求头、UA 伪装、超时、异常处理、基础反爬绕过
📌 专栏:Python 网络爬虫入门到实战(零基础连载全套) 🎯 本章定位:爬虫入门防踩坑核心章节。很多新手写好 requests 代码,直接访问网站就 403 被拦截,根源就是缺少请求头伪装、没有超时与异常捕获。本章聚焦基础反爬手段,学会模拟真实浏览器行为,写出健壮、稳定的爬虫请求代码,为后面网页解析实战打下基础。 ✅ 学习目标
weixin_44040169
4 天前
爬虫
·
python
·
数据分析
·
pandas
质朴的爬虫+数据处理
此次质朴学习源自“以赛促学”Xpath 在浏览器中安装扩展xpath helper插件,可以辅助解析xpath地址
沙漠之主
5 天前
爬虫
·
python
Python 教学设计资料:从入门到实战的完整课程方案
链接:https://pan.xunlei.com/s/VP1K52xAGt8JP3j9kYt8EarDA1 提取码:mw4p
深蓝电商API
5 天前
爬虫
·
yolo
·
目标检测
·
目标跟踪
用YOLO训练验证码目标检测模型的全流程
在爬虫逆向、自动化测试等场景中,验证码识别是高频需求。传统 OCR 方案面对带干扰线、噪点、字符粘连、旋转变形的复杂验证码时,识别率往往大幅下降;而基于 YOLO 的目标检测方案,通过 “先定位单个字符、再分类识别” 的思路,能够精准分离粘连字符、抵抗背景干扰,在复杂验证码场景下具备更强的鲁棒性和可优化空间。
wuyk555
6 天前
爬虫
·
python
·
http
Python网络爬虫入门到实战 第02章:HTTP/HTTPS协议超通俗精讲(GET/POST、请求头、响应码、爬虫核心基础)
📌 专栏:Python网络爬虫入门到实战(零基础连载全套)🎯 本章定位:爬虫核心底层原理课。90%爬虫报错、反爬拦截、访问失败,根源都是不懂网络协议。本章零基础吃透HTTP/HTTPS核心规则,不讲废话、只学爬虫能用的知识点,为后续requests实战、反爬绕过、接口抓包筑牢基础。
szial
7 天前
爬虫
·
python
·
csrf
网络爬虫与 CDP 实战(二):浏览器能访问,Python 却被拒绝?拆开登录态与 CSRF
配套实验网站: 实验 05:Session 账户 · 实验 06:CSRF 购物车 · 实验 07:Token 账户
梅雅达编程笔记
7 天前
开发语言
·
爬虫
·
python
·
pandas
·
数据采集
·
csv
04-Python CSV数据保存与翻页抓取
前几篇我们学会了发请求、提取数据。但你发现没有——数据抓到了,可都在 Python 变量里。程序一结束,就什么都没了。
梅雅达编程笔记
7 天前
爬虫
·
python
·
beautifulsoup
·
pandas
·
数据采集
03_网页表格数据抓取
网页里的信息很多,但表格是最特殊的一种——它天生就是结构化数据,一行一行、一列一列排好了,抓下来直接就能用,存成 CSV 打开就是整齐的表格。
傻啦嘿哟
7 天前
网络
·
爬虫
·
tcp/ip
爬虫代理IP池从0到1:构建高可用代理池,彻底解决IP被封问题
“代码写好了,请求发出去了,IP也被封了。”这是每一位爬虫开发者都经历过的痛。无论是电商价格监控、社交媒体数据采集,还是新闻舆情追踪,IP封禁始终是悬在头顶的达摩克利斯之剑。单个IP的请求频率一旦超过目标网站的阈值,轻则返回403,重则临时封禁数小时甚至永久拉黑。