技术栈
爬虫
szial
4 小时前
爬虫
·
python
·
csrf
网络爬虫与 CDP 实战(二):浏览器能访问,Python 却被拒绝?拆开登录态与 CSRF
配套实验网站: 实验 05:Session 账户 · 实验 06:CSRF 购物车 · 实验 07:Token 账户
梅雅达编程笔记
16 小时前
开发语言
·
爬虫
·
python
·
pandas
·
数据采集
·
csv
04-Python CSV数据保存与翻页抓取
前几篇我们学会了发请求、提取数据。但你发现没有——数据抓到了,可都在 Python 变量里。程序一结束,就什么都没了。
梅雅达编程笔记
18 小时前
爬虫
·
python
·
beautifulsoup
·
pandas
·
数据采集
03_网页表格数据抓取
网页里的信息很多,但表格是最特殊的一种——它天生就是结构化数据,一行一行、一列一列排好了,抓下来直接就能用,存成 CSV 打开就是整齐的表格。
傻啦嘿哟
18 小时前
网络
·
爬虫
·
tcp/ip
爬虫代理IP池从0到1:构建高可用代理池,彻底解决IP被封问题
“代码写好了,请求发出去了,IP也被封了。”这是每一位爬虫开发者都经历过的痛。无论是电商价格监控、社交媒体数据采集,还是新闻舆情追踪,IP封禁始终是悬在头顶的达摩克利斯之剑。单个IP的请求频率一旦超过目标网站的阈值,轻则返回403,重则临时封禁数小时甚至永久拉黑。
szial
18 小时前
网络
·
爬虫
·
python
·
网络爬虫
网络爬虫与 CDP 实战(一):网页数据到底在哪?从 HTTP 到分页采集
配套实验网站:网页数据实验场。网站只提供实验页面,教程与分析均在本系列博文中。浏览器能看到商品,Python 为什么只拿到空壳?接口已经找对,为什么复制请求还是失败?价格一直变化,为什么 Network 里没有新的普通请求?
深蓝电商API
19 小时前
爬虫
·
反检测浏览器
反检测浏览器(比特/AdsPower)原理剖析与自建替代方案
在当前互联网风控体系日趋严密的背景下,浏览器指纹已成为继 IP、Cookie 之后第三大身份识别维度。电商平台、社交媒体、广告系统、反爬防护墙普遍通过采集浏览器的硬件特征、渲染特性、协议行为等多维信息生成设备指纹,以此识别多账号操作、批量爬虫和自动化行为。
深蓝电商API
2 天前
爬虫
·
puppeteer
·
playwright
Puppeteer vs Playwright:多维度压测后的选型建议
Puppeteer 与 Playwright 是当前前端自动化领域最主流的两大工具,二者渊源颇深 ——Playwright 的核心开发团队正是 Puppeteer 的原班人马,2020 年从 Google 加入微软后推出了 Playwright,旨在从架构层面解决 Puppeteer 的固有局限。
压码路
2 天前
爬虫
·
语言模型
·
boss直聘
BOSS直聘网页端研究【2026年9月】
该文章古法创作,未使用ai,有耐心看完的请三连!本人从2022年开始因为一个私活开始研究boss直聘,一晃已经4年过去了,也经历boss网页端的几次升级(具体可以看我博客的其它几篇关于boss直聘的文章),最早的前端代码可读性还是很强的,甚至于还有中文注释,随着前端框架的升级,现在的代码都是打包压缩后的chunk,甚至还用上wasm,现在又增加开发者工具检测,如果你用playwright之类的无头浏览器去访问,立刻就能被识别,一旦做登录操作,页面就会自动关闭。下面是我遇到一些问题和解决方案。
深蓝电商API
2 天前
爬虫
·
cdp
用 CDP 协议直连浏览器:绕过框架做更底层的控制
在浏览器自动化领域,Selenium、Puppeteer、Playwright 等框架早已成为主流。它们封装了繁杂的底层细节,让开发者可以用几行代码完成页面操作、元素定位、数据抓取等工作。但当你需要极致性能、深度定制能力,或是要对抗越来越严格的反爬检测时,框架的 “黑盒封装” 反而会成为瓶颈。
深蓝电商API
2 天前
爬虫
从元素定位到等待策略:写出稳定不出错的自动化脚本
在 UI 自动化测试、爬虫模拟交互、RPA 流程自动化等场景中,很多开发者都会遇到同一个共性难题:脚本在本地调试次次通过,一到正式环境 / 流水线就随机报错;上午跑还完全正常,下午页面改了个布局就全面崩溃。绝大多数自动化脚本的不稳定问题,根源都不在框架本身,而在于元素定位的脆弱性和等待策略的不合理性。
禹凕
2 天前
爬虫
·
python
·
selenium
·
测试工具
·
机器学习
机器学习之Selenium(Machina Learning about Selenium)
在之前的文章中我们能够深刻学习到使用 request 库进行网页爬取。requests 只能获取服务器返回的 HTML 源码,但是现在网页越来越复杂,很多东西都是通过 JavaScript 进行动态加载。
梅雅达编程笔记
3 天前
开发语言
·
爬虫
·
python
·
beautifulsoup
·
数据采集
02_BeautifulSoup网页数据提取
上一篇我们用 requests 把网页源码"拿下来"了。但拿到手的是什么?一大坨 HTML 标签,尖括号套尖括号,密密麻麻的。你想要的标题、链接、价格、正文,全混在里面。总不能手动一条条复制粘贴吧?
零域码客
3 天前
爬虫
·
python
·
http
零基础Python爬虫入门:从HTTP协议到 requests + BeautifulSoup 实战
📌 适合人群:完全没有爬虫经验的初学者 🛠️ 涉及工具:Python 3、requests、BeautifulSoup4、浏览器开发者工具 🎯 学习目标:看懂网页本质 → 发送请求 → 解析数据 → 批量爬取
TomEval
3 天前
人工智能
·
爬虫
·
python
·
scrapy
·
自动化
【测AI】第05篇:Python 爬虫进阶 —— 动态页面爬取与 Scrapy 框架
上一篇我们完成了完整的岗位数据爬虫,但有一个前提假设:数据直接在 HTML 源码里。问题是,现实中很多网站根本不是这样的。你在浏览器里明明白白看到一堆职位数据,按 Ctrl+U 查看源码,里面却空空如也。你用 requests 去请求,拿回来的 HTML 里找不到任何有用的数据。这类页面叫动态页面,需要用完全不同的技术来处理。
老王生涯
4 天前
爬虫
·
cloudflare
·
cdp
·
反爬
针对cloudflare防护的爬虫策略——CDP
使用requests爬虫时经常碰到cloudflare防护的网站,即使从浏览器中复制包含cookie在内的所有请求参数扔到requests的headers中,返回的仍然是"Just a moment..."对你发出无情的嘲讽,这是因为CF还要验证浏览器指纹,这不是简单地加个UA参数就能解决的。
禹凕
4 天前
人工智能
·
爬虫
·
python
·
机器学习
·
数据挖掘
机器学习之数据清洗(Machine Learning about Data Cleaning)
爬虫获取的原始数据往往存在各种问题:这些问题如果不解决,将会影响后续的数据分析与挖掘工作。数据清洗是整个爬虫项目不可或缺的一环,其决定了最终数据的质量。
数据狐(Datafox)
4 天前
开发语言
·
前端
·
数据库
·
爬虫
·
json
淘宝商品详情API实战:多语言代购商城自动同步数据完整方案
在多语言淘宝代购、跨境代发、反向海淘商城项目中,绝大多数开发者初期会采用网页爬虫采集淘宝商品数据。但爬虫存在频繁风控、IP封禁、页面DOM改版、图片防盗链、数据脏字段多、无法长期稳定运维等致命问题,尤其不适合跨境多语言站点的常态化自动铺货、价格库存同步业务。
梅孔立
11 天前
爬虫
Fiddler 工具安装抓包 教程 https
一、Fiddler 工具安装教程 1、官网下载链接:http://www.telerik.com/fiddler 点击可执行文件一路安装,安装完会弹出如下网页,表示安装成功
feasibility.
11 天前
爬虫
·
抖音
·
小红书
·
微博
·
bili
MediaCrawler媒体采集平台安装与使用
MediaCrawler是 GitHub 上最受欢迎的社媒数据采集工具之一——截至 2026 年 9 月22日,65,470 个 Star,12,650 次 Fork,覆盖小红书、抖音、快手、B 站、微博、贴吧、知乎七个平台。
Patrick在香港
11 天前
爬虫
·
python
·
api
·
claude
·
香港
Claude 工具调用返回空:8 次失败里只有 1 次状态码不对,其余全带 200
给 Claude 接工具,最烦的不是报错,是「没拿到数据」——返回是空的,任务卡住,你却说不清是接口坏了、参数写错了,还是真的没数据。