爬虫

Minner-Scrapy2 小时前
java·爬虫·python·scrapy·网络爬虫·twisted
Scrapy 2.17 源码解析:Scheduler 调度器与磁盘/内存双队列本文基于 Scrapy 2.17.0 的真实源码逐行分析。 其中 SCHEDULER_START_MEMORY_QUEUE / SCHEDULER_START_DISK_QUEUE(起始请求独立队列)是 2.13+ 才有的机制,旧版本没有,网上资料基本没覆盖。
不叫猫先生7 小时前
爬虫·agent
2026 Web Scraping 实战:页面改 class 就归零?用 Bright Data 搭稳定的 Agent 爬虫之前有个需求要爬取某BOSS直聘的岗位信息, 我在Cursor 里让 Agent 去执行,它兴冲冲写出一堆 CSS 选择器,跑通了。过了一段时间,官方页面改了一个 class,整段 pipeline 直接归零,无力回天。
陈皮波比茶6 小时前
开发语言·网络·爬虫·python·机器人
Python项目实战-网络机器人(爬虫)爬虫:也称为网络爬虫(网络机器人),是一种按照一定的预设规则,自动浏览并抓取网络数据的程序或脚本场景搜索引擎(百度、Google)
tang777898 小时前
爬虫·tcp/ip·scrapy·架构·爬虫代理·动态ip
Scrapy框架动态IP自动轮换集成配置教程做爬虫开发的小伙伴基本都踩过封IP的坑:高频请求站点后IP被限流、封禁,爬虫直接瘫痪。手动换IP效率极低,而Scrapy原生支持代理中间件,搭配动态IP轮换就能完美解决这个问题。
傻啦嘿哟1 天前
java·c++·爬虫
英雄联盟皮肤爬虫:爬取全皮肤价格与特效,做比价工具在《英雄联盟》这款运营超过十五年的游戏中,皮肤早已超越了“外观装饰”的范畴,成为游戏文化的重要组成部分。截至2026年,游戏内已拥有超过160位英雄、超过1500款皮肤——从售价低廉的“勇士”系列,到高达数千元的“神话”限定,每一款皮肤的推出都牵动着亿万玩家的心。
Spider赵毅1 天前
爬虫·python·beautifulsoup
Python爬虫踩坑实录:BeautifulSoup使用中的高频问题排查多数场景下,CSS选择器或find_all直接定位到目标节点就够了。但有一类页面,目标数据的位置取决于上下文关系——比如"标题后面紧跟的那段价格文本",或者"某个特定标签的父级容器的兄弟节点里的字段"。这种定位依赖节点间关系,选择器写不出,就得手动在DOM树里走。
Patrick在香港1 天前
redis·爬虫·python
Python asyncio + aiohttp 并发抓取实战:把同步爬虫改造成 3 倍吞吐量的并发管道上个月我发了篇同步版 HKOpenDataClient(香港政府公开 API 的通用爬虫框架),文末说"如果你要批量抓多个 endpoint,请等下一篇文章"——今天就来填这个坑。
TlSfoward1 天前
爬虫·网络协议·http
TLS指纹库的数据质量与误判治理 TLSFOWARD TLS指纹库TLS指纹库的数据质量与误判治理:工程实践中的五个关键问题建立TLS指纹库并不困难,困难的是让数据长期保持准确。浏览器频繁升级、不同系统实现存在差异,GREASE和网络中间设备也可能改变握手特征。如果缺少数据治理,指纹库很快就会积累重复、过期或标签错误的样本。
天启HTTP1 天前
爬虫·网络协议·tcp/ip
住宅IP和机房IP有什么区别?爬虫场景实测对比在数据采集项目中,很多开发者都会把注意力集中在爬虫框架、请求头设置、并发控制等技术细节上,却忽略了一个影响采集成功率的重要因素——IP类型。
阿图灵1 天前
爬虫·playwright·反爬·z3·猫眼票房
猫眼票房监控系统实战:z3 约束求解破解字体混淆反爬项目地址(Gitee):https://gitee.com/Touari/boxoffice-monitor.git 项目定位:破解猫眼专业版字体混淆反爬,实时抓取解码票房,提供监控/报表/API 全链路服务 技术栈:Python 3.11 · Playwright 1.62 · z3-solver 5.1 · FastAPI 0.133 · SQLite 所有数据均为实测(2026-08-20)
小白学大数据2 天前
人工智能·pytorch·爬虫·python
CuPy vs Numba vs PyTorch:GPU 加速方案怎么选引言:数据进得来,才算得动大规模数据采集常被目标站点限流、封 IP、验证码拦截。企业级代理 IP 服务如 亿牛云可让采集在分布式节点间平滑切换出口,保障数据稳定入库。数据进来后,瓶颈转向算力——下面用代码直接对比 CuPy、Numba、PyTorch 三种上 GPU 的方式。
亿牛云爬虫专家2 天前
爬虫·python·隧道代理·舆情采集·媒体权重·频率控制·ip自动轮换
爬虫调度系统设计:用 Celery 实现按媒体权重动态调整的抓取频率控制做舆情采集的朋友大多遇到过这个两难:固定频率去抓全网媒体,要么低频漏掉突发热点,要么高频把代理流量烧光还被站点限流。我之前一套系统就是这么垮的——所有媒体一刀切每 5 分钟抓一次,结果低权重的边缘站点占了七成请求量,真正该盯紧的头部媒体反而因为代理配额被挤占,关键时刻没抓到关键稿件。
2601_966871402 天前
爬虫·python·数据挖掘
Python 爬虫 + 数据挖掘实战:数据抓取与深度挖掘分析全流程在数据驱动决策的时代,Python爬虫与数据挖掘的结合,正从单纯的“数据采集”升维为“构建智能决策系统的感知触角”。一个完整的全流程项目,绝非止步于将网页内容存入数据库,而是构建一个从感知外部世界到输出业务洞察的闭环系统。///“虾仔”>>>:jzit点top
pass_by_Z2 天前
开发语言·爬虫·python
Python异步爬虫实战:从零到一构建高性能并发爬虫随着互联网数据量的爆炸式增长,单线程的爬虫已经难以满足我们对数据采集效率的需求。传统的同步爬虫虽然代码简单,但每次请求都需要等待服务器响应,造成了大量的时间浪费在IO等待上。而异步爬虫能够充分利用等待时间,同时发起多个请求,极大地提升爬取效率。
netho03 天前
人工智能·爬虫
有没有能够通过AI实现自动爬虫的项目刚刚看到篇帖子: https://linux.do/t/topic/2599282/31 学到了一个新的格式: Har. 它比curl记载的信息更多, 基于json结构也比较易读.
傻啦嘿哟2 天前
开发语言·爬虫·python
王者荣耀爬虫:爬取全英雄皮肤数据,用Python做可视化分析在游戏数据日益成为玩家社区热门话题的今天,英雄皮肤数据不仅是玩家“厨力”的集中体现,更是游戏运营策略、角色人气和商业化成果的直观映射。王者荣耀作为国民级MOBA手游,截至2025年9月,游戏内已拥有超过105位可操作英雄,皮肤总数已突破700款,且数量仍在持续攀升。从伴生皮到荣耀典藏,从战令限定到KPL限定,每一款皮肤的推出都牵动着亿万玩家的心。
桃花键神3 天前
前端·人工智能·爬虫
Claude Code + Bright Data Web Scraping:2026 年 3 步搭建 AI 爬虫本文记录了我用 Claude Code + Bright Data CLI 搭建生产级爬虫的完整实践。核心思路很简单——不要让 Agent 自己裸写 CSS 选择器,而是通过 Bright Data CLI 让它调用真正的采集基础设施:住宅代理、JS 渲染、CAPTCHA 处理全部内置。
跨境技工小黎3 天前
爬虫·网络协议·tcp/ip
IPFoxy动态住宅IP实测:做数据采集和爬虫可行吗?最近在做跨境电商的数据监控项目,需要爬取几个友商的价格和评论数据,有朋友推荐了IPFoxy的动态住宅IP池,说是池子质量好,做采集比较稳,基础测试了之后干脆掏钱再试了一个月。这篇文章就把实测过程和数据整理出来,给有同样需求的朋友一个参考。
玫瑰互动GEO3 天前
爬虫·架构
企业官网SEO优化技术架构:从服务器配置到爬虫友好的全链路实践企业官网建了半年,百度搜品牌名前3页找不到自己,60篇新闻稿收录不到10篇。排查发现根因在技术架构层:robots.txt配置错误、sitemap未提交、前端SPA渲染爬虫读不到内容、页面加载过慢触发算法降权。本文从企业IT/运维视角拆解SEO优化的技术三原理与落地四步骤,含服务器配置、前端渲染改造、Schema部署、性能优化全链路实践,附脱敏案例。