爬虫

小静AI工程实验室6 小时前
爬虫·python·json
Python 爬虫解析 JSON-LD:多块 script、@graph 与坏数据的 9 个边界很多商品页、文章页把结构化数据放在 <script type="application/ld+json"> 中。它看起来像一个 JSON 对象,实际爬虫最容易在三个地方出错:只取第一块 script、把 @graph 当普通字段、遇到一块坏 JSON 就让整页失败。
要吃这碗饭6 小时前
网络·爬虫·网络协议
YouTube 数据抓取出现 429/403 错误?2026 反爬机制拆解与爬虫选型指南抓取 YouTube 视频、频道或评论数据时,403、429、CAPTCHA 和内容为空等问题并不少见,其原因往往涉及 IP、请求频率、客户端特征和页面渲染。2026 年,YouTube 自动化访问校验更加复杂,选对抓取方式并优化网络环境,比反复修改代码更重要。本文将从工具选型、反爬机制和报错排查展开分析。
袁袁袁袁满7 小时前
爬虫·python·自动化·爬虫实战·多线程爬虫
AI Agent 如何“看懂“互联网?新手用户注册就送30刀试用金:点击免费体验亮数据官号:爬虫技巧/代理IP/粉丝福利
Helix2508 小时前
爬虫·python·beautifulsoup·excel·python教程·requests·网页数据
Python爬虫零基础实战:3步抓取网页数据并导出Excel在掌握了Python基础语法后,很多初学者会陷入“学完就忘”的困境。而网络爬虫作为Python最经典的应用场景之一,不仅能让你快速看到代码的实际效果,还能串联起文件操作、字符串处理、第三方库调用等多个核心知识点。本文将带你从零开始,用3个步骤完成一个完整的网页数据抓取项目,并将结果导出为Excel文件,真正实现学以致用。
深蓝电商API1 天前
爬虫·frida
Frida入门到实战:hook so层与Java层的姿势总结Frida 是一款跨平台的动态二进制插桩工具,凭借 JavaScript 脚本化、轻量灵活、全平台覆盖的特性,成为移动端逆向分析、安全测试领域的标配工具。无论是 Java 层的业务逻辑 Hook,还是 so 原生层的算法分析,Frida 都能提供统一的操作范式。本文将从基础环境搭建出发,系统总结 Java 层与 so 层的常用 Hook 姿势,结合实战案例梳理完整的分析链路,帮助读者快速掌握 Frida 的核心用法。
小静AI工程实验室1 天前
爬虫·python·缓存
robots.txt 不是门禁:RFC 9309 规则、缓存与 Python 爬虫的 10 个边界爬虫启动前,经常有人问“robots.txt 能不能爬”。更准确的说法是:它是站点公开给自动客户端的访问约定,不是登录鉴权,也不是防火墙。RFC 9309 将 Robots Exclusion Protocol 定义为服务方控制爬虫访问 URI 的规则,并明确这些规则不是访问授权。
远航计算机1 天前
人工智能·爬虫·aigc
AI 爬虫分三种,你 robots.txt 里挡的是哪一种?有位站长上周翻了服务器日志,越看越不对劲:GPTBot、ClaudeBot、PerplexityBot 轮着来,一天好几百次请求。可他让同事去 AI 里搜了十个行业问题,公司名一次都没出现。
深蓝电商API2 天前
爬虫·验证码
大厂验证码对抗升级:从“破解”到“养环境”的思路转变在很多人的认知里,验证码对抗的核心是 “解题”—— 用 OCR 识别字符、用 AI 模型点选图文、用脚本模拟滑块轨迹,只要答案正确就能通关。但随着国内大厂与海外主流风控体系的全面升级,这条路径正在快速失效。
Getgit2 天前
爬虫·亮数据·broowser api
亮数据 | Browser API 实战:Booking.com 动态页面抓取对比视频讲解:JS网站太难爬?Browser API处理动态网站全流程实战在做旅游、电商、社交平台这类网页采集时,很多页面已经不是简单的静态 HTML。页面内容需要 JS 渲染,还可能包含验证码、弹窗、搜索表单、日期选择器等交互流程。
深蓝电商API3 天前
爬虫·recaptcha·hcaptcha·turnstile
reCAPTCHA/hCaptcha/Turnstile三大国际验证码对比研究验证码(CAPTCHA)作为互联网人机身份鉴别基础防线,自 1997 年诞生以来经历了从字符扭曲、图像识别到行为分析的三代技术迭代。随着全球隐私监管趋严与用户体验要求提升,传统视觉验证码的局限性日益凸显,市场逐步形成 Google reCAPTCHA、Intuition Machines hCaptcha 与 Cloudflare Turnstile 三足鼎立的格局。
深蓝电商API3 天前
爬虫·验证码
从零训练自己的验证码识别模型:数据生成到部署验证码(CAPTCHA)是互联网最常见的人机验证手段之一,从早期的字符扭曲验证码到后来的点选、滑动、行为验证,技术形态不断演进。其中字符型验证码因实现简单、部署成本低,至今仍被大量网站使用。对于需要自动化业务流程的场景,训练一个专属的验证码识别模型,比调用第三方接口更灵活、成本更低。
wuyk5554 天前
开发语言·爬虫·python
Python 网络爬虫入门到实战 第 04 章:请求头、UA 伪装、超时、异常处理、基础反爬绕过📌 专栏:Python 网络爬虫入门到实战(零基础连载全套) 🎯 本章定位:爬虫入门防踩坑核心章节。很多新手写好 requests 代码,直接访问网站就 403 被拦截,根源就是缺少请求头伪装、没有超时与异常捕获。本章聚焦基础反爬手段,学会模拟真实浏览器行为,写出健壮、稳定的爬虫请求代码,为后面网页解析实战打下基础。 ✅ 学习目标
weixin_440401694 天前
爬虫·python·数据分析·pandas
质朴的爬虫+数据处理此次质朴学习源自“以赛促学”Xpath 在浏览器中安装扩展xpath helper插件,可以辅助解析xpath地址
沙漠之主5 天前
爬虫·python
Python 教学设计资料:从入门到实战的完整课程方案链接:https://pan.xunlei.com/s/VP1K52xAGt8JP3j9kYt8EarDA1 提取码:mw4p
深蓝电商API5 天前
爬虫·yolo·目标检测·目标跟踪
用YOLO训练验证码目标检测模型的全流程在爬虫逆向、自动化测试等场景中,验证码识别是高频需求。传统 OCR 方案面对带干扰线、噪点、字符粘连、旋转变形的复杂验证码时,识别率往往大幅下降;而基于 YOLO 的目标检测方案,通过 “先定位单个字符、再分类识别” 的思路,能够精准分离粘连字符、抵抗背景干扰,在复杂验证码场景下具备更强的鲁棒性和可优化空间。
wuyk5556 天前
爬虫·python·http
Python网络爬虫入门到实战 第02章:HTTP/HTTPS协议超通俗精讲(GET/POST、请求头、响应码、爬虫核心基础)📌 专栏:Python网络爬虫入门到实战(零基础连载全套)🎯 本章定位:爬虫核心底层原理课。90%爬虫报错、反爬拦截、访问失败,根源都是不懂网络协议。本章零基础吃透HTTP/HTTPS核心规则,不讲废话、只学爬虫能用的知识点,为后续requests实战、反爬绕过、接口抓包筑牢基础。
szial7 天前
爬虫·python·csrf
网络爬虫与 CDP 实战(二):浏览器能访问,Python 却被拒绝?拆开登录态与 CSRF配套实验网站: 实验 05:Session 账户 · 实验 06:CSRF 购物车 · 实验 07:Token 账户
梅雅达编程笔记7 天前
开发语言·爬虫·python·pandas·数据采集·csv
04-Python CSV数据保存与翻页抓取前几篇我们学会了发请求、提取数据。但你发现没有——数据抓到了,可都在 Python 变量里。程序一结束,就什么都没了。
梅雅达编程笔记7 天前
爬虫·python·beautifulsoup·pandas·数据采集
03_网页表格数据抓取网页里的信息很多,但表格是最特殊的一种——它天生就是结构化数据,一行一行、一列一列排好了,抓下来直接就能用,存成 CSV 打开就是整齐的表格。
傻啦嘿哟7 天前
网络·爬虫·tcp/ip
爬虫代理IP池从0到1:构建高可用代理池,彻底解决IP被封问题“代码写好了,请求发出去了,IP也被封了。”这是每一位爬虫开发者都经历过的痛。无论是电商价格监控、社交媒体数据采集,还是新闻舆情追踪,IP封禁始终是悬在头顶的达摩克利斯之剑。单个IP的请求频率一旦超过目标网站的阈值,轻则返回403,重则临时封禁数小时甚至永久拉黑。