技术栈
爬虫
老王生涯
16 小时前
爬虫
·
cloudflare
·
cdp
·
反爬
针对cloudflare防护的爬虫策略——CDP
使用requests爬虫时经常碰到cloudflare防护的网站,即使从浏览器中复制包含cookie在内的所有请求参数扔到requests的headers中,返回的仍然是"Just a moment..."对你发出无情的嘲讽,这是因为CF还要验证浏览器指纹,这不是简单地加个UA参数就能解决的。
禹凕
18 小时前
人工智能
·
爬虫
·
python
·
机器学习
·
数据挖掘
机器学习之数据清洗(Machine Learning about Data Cleaning)
爬虫获取的原始数据往往存在各种问题:这些问题如果不解决,将会影响后续的数据分析与挖掘工作。数据清洗是整个爬虫项目不可或缺的一环,其决定了最终数据的质量。
数据狐(Datafox)
20 小时前
开发语言
·
前端
·
数据库
·
爬虫
·
json
淘宝商品详情API实战:多语言代购商城自动同步数据完整方案
在多语言淘宝代购、跨境代发、反向海淘商城项目中,绝大多数开发者初期会采用网页爬虫采集淘宝商品数据。但爬虫存在频繁风控、IP封禁、页面DOM改版、图片防盗链、数据脏字段多、无法长期稳定运维等致命问题,尤其不适合跨境多语言站点的常态化自动铺货、价格库存同步业务。
梅孔立
8 天前
爬虫
Fiddler 工具安装抓包 教程 https
一、Fiddler 工具安装教程 1、官网下载链接:http://www.telerik.com/fiddler 点击可执行文件一路安装,安装完会弹出如下网页,表示安装成功
feasibility.
8 天前
爬虫
·
抖音
·
小红书
·
微博
·
bili
MediaCrawler媒体采集平台安装与使用
MediaCrawler是 GitHub 上最受欢迎的社媒数据采集工具之一——截至 2026 年 9 月22日,65,470 个 Star,12,650 次 Fork,覆盖小红书、抖音、快手、B 站、微博、贴吧、知乎七个平台。
Patrick在香港
8 天前
爬虫
·
python
·
api
·
claude
·
香港
Claude 工具调用返回空:8 次失败里只有 1 次状态码不对,其余全带 200
给 Claude 接工具,最烦的不是报错,是「没拿到数据」——返回是空的,任务卡住,你却说不清是接口坏了、参数写错了,还是真的没数据。
小静AI工程实验室
9 天前
字符编码
·
爬虫
·
python
Python 爬虫中文乱码排查:严格解码、UTF-8 BOM 与 JSON 转义的 12 项实验
爬到的中文变成奇怪字符时,先保留响应字节,再确定在哪一步把字节变成了字符串。直接轮流尝试 UTF-8、GBK,直到程序不报错,容易得到一份“能够保存、内容却已经错了”的结果。
咖啡星人k
10 天前
爬虫
·
数据采集
·
mcp
从自建爬虫到托管工具:数据采集选型对照表
做数据采集,第一反应常常是"写个爬虫"。多数情况下这不是坏主意,而是算错了账。本文给出一张对照表,帮你在两类方案间做决定。
电商API_18007905247
10 天前
大数据
·
爬虫
·
数据挖掘
·
数据分析
·
代采api
拍照找同款是怎么实现的?淘宝以图搜图接口 item_search_img 对接实战
面向人群:做反向寻源、选品工具、比价应用、穿搭类产品的开发者与产品负责人。 读完你能搞清楚:以图搜图背后的原理、item_search_img 接口怎么对接、怎么提升搜同款的准确率、成本怎么控制。
Patrick在香港
10 天前
爬虫
·
python
·
api
·
claude
·
香港
Python 抓 0.91 GB 香港法例:Agent 的进度该写进磁盘,不是写进上下文
做香港职场自动化,绕不开法例——《雇佣条例》《最低工资条例》《职业安全及健康条例》这些决定了 HR 流程里每一条硬性规则。香港把全部现行法例做成了开放数据,整包 0.91 GB。
Experience-摆渡
11 天前
爬虫
·
docker
·
开源
·
rag
开源RAG知识库WeKnora深度调研:让知识自己长成体系
今天不发软文,只给你一手事实 + 一份独立评审。先看它到底是不是又一个 RAG 套件,再决定要不要了解。
孙启超
11 天前
人工智能
·
分布式
·
后端
·
爬虫
·
spring cloud
·
架构
·
rust
【AI开发之Rust】第 7 课:错误处理 —— panic、Result 与 `?`
预计时间:75-90 分钟 | 难度:⭐⭐⭐ | 前置:第 6 课(struct/enum/Option/Result)、第 10 课会用到本课的自定义错误
该逃避避
12 天前
爬虫
IP代理类型介绍:住宅IP、机房IP、移动IP等区别与选择
在分布式网络、公开数据研究、多区域业务测试等场景中,选择合适的网络出口IP是常见基础工作。不同IP类型在来源、信任度、速度、稳定性和成本上差异明显。本文从网络属性、生命周期、协议与功能等维度梳理分类,并给出一般选型建议。
科技苑
12 天前
爬虫
·
python
Python简单网络爬虫教程
⚠️重要提醒:爬虫请遵守网站 robots.txt 协议,不要高频爬取,禁止爬取隐私、付费、受版权保护内容,部分网站严禁爬虫,违规会有法律风险。
szephyr
12 天前
爬虫
·
python
·
requests
·
playwright
·
反爬
Python 爬虫合规与反爬实战:从 requests 到 Playwright
“写爬虫不难,难的是写得既抓得到数据、又睡得着觉。”这两年我带过不少大学生做数据采集的小项目,几乎每个人第一版代码都是直接 requests.get 然后疯狂循环。结果不是被封 IP,就是收到律师函警告。这篇就把我从"野蛮抓取"到"合规可控"的完整经验拆给你,覆盖合规边界、技术选型、基础抓取、JS 渲染处理、登录态、反爬应对和落坑清单。
深蓝电商API
13 天前
爬虫
·
agent
·
mcp
MCP 与 AI Agent 如何改变爬虫开发模式?
传统网络爬虫历经二十余年发展,形成了以 Scrapy、Playwright 为代表的成熟技术栈,但本质始终是「规则驱动」的工程范式:开发者预先定义请求逻辑、页面选择器、分页规则、反爬策略,脚本严格按照预设流程执行。这种模式在今天正遭遇越来越明显的瓶颈:
小花皮猪
13 天前
爬虫
·
数据采集
·
代理
2026 代理网络选型指南:住宅/机房/ISP/移动代理怎么选?(附 Bright Data / Oxylabs / Decodo 实测对比)
选代理网络平台,别从哪家 IP 最多下手。先匹配代理类型——住宅抗反爬、机房跑量、ISP 保会话、移动模拟手机端——再用 IP 池、地域、协议、反封锁、合规五项缩候选,POC 验证单次成功成本。按场景对照:亮数据(Bright Data)的代理网络服务适合跨国合规与多类型切换;Oxylabs 适合邮编/坐标定向;Decodo 适合百 GB 控单价;IPRoyal 适合小流量试跑。“点击注册 Bright Data 账号,免费领取测试流量”
数据狐(Datafox)
13 天前
java
·
开发语言
·
数据库
·
爬虫
·
json
1688商品列表API接口解析(附 JSON 样例)
1688 商品列表 API,属于 1688 开放平台提供的数据接口,用于批量获取店铺内商品清单,可返回商品 ID、标题、主图、价格、库存、上架状态等基础商品信息。 在供应链、跨境铺货、竞品监控场景中,可替代不稳定网页爬虫,合规拉取商品列表数据,降低反爬封禁、IP 限流风险。
深蓝电商API
13 天前
爬虫
·
js逆向
大语言模型能否自动完成 JS 逆向?
在前端反爬与逆向攻防持续升级的当下,JS 逆向早已成为爬虫、数据采集领域的核心技能。从简单的接口签名加密,到多层混淆的虚拟机保护,逆向的技术门槛与时间成本水涨船高。随着大语言模型代码理解与生成能力的突飞猛进,一个被行业反复讨论的问题是:大语言模型能不能自动完成 JS 逆向,实现 “输入混淆代码,输出可用算法” 的一键化落地?
不叫猫先生
13 天前
爬虫
·
网络代理
·
代理
·
住宅代理
2026 Web Scraping 代理服务商怎么选?住宅代理与代理网络对比指南
代理服务商真正难选的地方,不是 IP 池有多大,而是你的目标站点到底能拿到多少成功请求。如果要为企业级采集、价格监控或 AI Agent 选择代理,优先看亮数据(Bright Data)和 Oxylabs;预算更敏感、流量规模还不大,则从 Decodo 或 IPRoyal 开始验证。平台公布的 IP 总量只能说明供给上限,真正决定项目成败的是目标国家可用 IP、成功率、会话稳定性、合规审查和每次成功请求的成本。