爬虫

小白学大数据12 小时前
人工智能·pytorch·爬虫·python
CuPy vs Numba vs PyTorch:GPU 加速方案怎么选引言:数据进得来,才算得动大规模数据采集常被目标站点限流、封 IP、验证码拦截。企业级代理 IP 服务如 亿牛云可让采集在分布式节点间平滑切换出口,保障数据稳定入库。数据进来后,瓶颈转向算力——下面用代码直接对比 CuPy、Numba、PyTorch 三种上 GPU 的方式。
亿牛云爬虫专家11 小时前
爬虫·python·隧道代理·舆情采集·媒体权重·频率控制·ip自动轮换
爬虫调度系统设计:用 Celery 实现按媒体权重动态调整的抓取频率控制做舆情采集的朋友大多遇到过这个两难:固定频率去抓全网媒体,要么低频漏掉突发热点,要么高频把代理流量烧光还被站点限流。我之前一套系统就是这么垮的——所有媒体一刀切每 5 分钟抓一次,结果低权重的边缘站点占了七成请求量,真正该盯紧的头部媒体反而因为代理配额被挤占,关键时刻没抓到关键稿件。
2601_9668714013 小时前
爬虫·python·数据挖掘
Python 爬虫 + 数据挖掘实战:数据抓取与深度挖掘分析全流程在数据驱动决策的时代,Python爬虫与数据挖掘的结合,正从单纯的“数据采集”升维为“构建智能决策系统的感知触角”。一个完整的全流程项目,绝非止步于将网页内容存入数据库,而是构建一个从感知外部世界到输出业务洞察的闭环系统。///“虾仔”>>>:jzit点top
pass_by_Z17 小时前
开发语言·爬虫·python
Python异步爬虫实战:从零到一构建高性能并发爬虫随着互联网数据量的爆炸式增长,单线程的爬虫已经难以满足我们对数据采集效率的需求。传统的同步爬虫虽然代码简单,但每次请求都需要等待服务器响应,造成了大量的时间浪费在IO等待上。而异步爬虫能够充分利用等待时间,同时发起多个请求,极大地提升爬取效率。
netho02 天前
人工智能·爬虫
有没有能够通过AI实现自动爬虫的项目刚刚看到篇帖子: https://linux.do/t/topic/2599282/31 学到了一个新的格式: Har. 它比curl记载的信息更多, 基于json结构也比较易读.
傻啦嘿哟14 小时前
开发语言·爬虫·python
王者荣耀爬虫:爬取全英雄皮肤数据,用Python做可视化分析在游戏数据日益成为玩家社区热门话题的今天,英雄皮肤数据不仅是玩家“厨力”的集中体现,更是游戏运营策略、角色人气和商业化成果的直观映射。王者荣耀作为国民级MOBA手游,截至2025年9月,游戏内已拥有超过105位可操作英雄,皮肤总数已突破700款,且数量仍在持续攀升。从伴生皮到荣耀典藏,从战令限定到KPL限定,每一款皮肤的推出都牵动着亿万玩家的心。
桃花键神2 天前
前端·人工智能·爬虫
Claude Code + Bright Data Web Scraping:2026 年 3 步搭建 AI 爬虫本文记录了我用 Claude Code + Bright Data CLI 搭建生产级爬虫的完整实践。核心思路很简单——不要让 Agent 自己裸写 CSS 选择器,而是通过 Bright Data CLI 让它调用真正的采集基础设施:住宅代理、JS 渲染、CAPTCHA 处理全部内置。
跨境技工小黎2 天前
爬虫·网络协议·tcp/ip
IPFoxy动态住宅IP实测:做数据采集和爬虫可行吗?最近在做跨境电商的数据监控项目,需要爬取几个友商的价格和评论数据,有朋友推荐了IPFoxy的动态住宅IP池,说是池子质量好,做采集比较稳,基础测试了之后干脆掏钱再试了一个月。这篇文章就把实测过程和数据整理出来,给有同样需求的朋友一个参考。
玫瑰互动GEO2 天前
爬虫·架构
企业官网SEO优化技术架构:从服务器配置到爬虫友好的全链路实践企业官网建了半年,百度搜品牌名前3页找不到自己,60篇新闻稿收录不到10篇。排查发现根因在技术架构层:robots.txt配置错误、sitemap未提交、前端SPA渲染爬虫读不到内容、页面加载过慢触发算法降权。本文从企业IT/运维视角拆解SEO优化的技术三原理与落地四步骤,含服务器配置、前端渲染改造、Schema部署、性能优化全链路实践,附脱敏案例。
梅孔立2 天前
爬虫·docker·flask
Docker 部署 Python3\.11 Flask爬虫项目 终极稳定教程(解决线程报错/挂载失效/pip报错)系统:CentOS7/8 / Rocky Linux项目:Python3.11 + Flask + 爬虫 + Matplotlib 绘图
IPdodo_4 天前
网络·爬虫·python·网络协议·性能测试
Python 爬虫网络质量评估实战:成功率、P95 延迟与错误分布怎么测爬虫任务出现“偶发超时”时,最有价值的不是换一组配置继续跑,而是把失败拆成可量化的指标。同一目标站点在不同时间段可能出现连接超时、读取超时、429、5xx 或 DNS 解析失败。只看一次请求是否返回 200,无法判断问题在客户端、网络链路、目标服务还是请求频率。
傻啦嘿哟2 天前
爬虫·正则表达式
猫眼电影TOP100爬虫:Requests+正则表达式实战如果你正在学习Python爬虫,那么猫眼电影TOP100榜单一定是绕不开的经典案例。它几乎出现在每一本爬虫入门教材和每一篇爬虫教程中——原因很简单:页面结构清晰、数据规整、反爬策略温和但不失代表性,非常适合初学者理解HTTP请求、HTML解析和反爬应对的完整流程。
MgArcher2 天前
javascript·爬虫·python
抖音a_bogus参数逆向实战:JSVMP环境模拟与Hook技术(2025最新)本文为技术摘要版,完整教程(含完整代码、bdms提取方法、调试技巧)已发布在 道满PythonAI,建议搭配阅读。
MgArcher2 天前
爬虫
极验GT4滑块验证码全链路逆向:w参数生成与验证流程(2025最新)本文为技术摘要版,完整教程(含完整Python代码、demo.js提取方法、时区处理详解)已发布在 道满PythonAI,建议搭配阅读。
亿牛云爬虫专家3 天前
爬虫·爬虫代理·架构设计·隧道代理·大数据处理·压缩存储·数据分层存放
聊聊数据的“冷热分离“:如何对历史爬虫数据进行合理的归档与压缩存储?作者按:这是一篇写给爬虫工程师和数据处理同学的实战笔记。我们不谈虚的,直接从"数据是怎么堆成山的"讲起,再给一套能直接抄走的代码。文中的代理部分基于亿牛云的隧道代理产品,代码全部带中文注释。
袁袁袁袁满3 天前
爬虫·python·网络爬虫·爬虫实战·跨境电商·电商爬虫
Python爬虫实战:利用巨量IP获取跨境电商数据跨境电商数据贯穿选品、运营、营销、供应链、风控全业务链路,是企业洞察海外市场、降低试错成本、提升经营效益的核心依据。
拿本唠嗑AI研究3 天前
前端·爬虫·架构
现代前端架构爬虫指南:从静态页面到 React/Vue 单页应用如果你还在用 requests + BeautifulSoup 去爬一个 React / Vue 构建的网站,有时会拿到一个只有 <div id="root"></div> 的空壳 HTML。但这未必是代码问题,也未必适用于所有现代站点——关键在于它属于哪种渲染模式。
一个处女座的程序猿4 天前
爬虫·mediacrawler
Crawler之Tool:MediaCrawler的简介、安装和使用方法、案例应用之详细攻略Crawler之Tool:MediaCrawler的简介、安装和使用方法、案例应用之详细攻略目录MediaCrawler的简介
深蓝电商API4 天前
爬虫·hook canvas
Hook Canvas 获取浏览器指纹在用户隐私保护与反爬对抗持续升级的当下,浏览器指纹已成为设备识别领域的核心技术之一。传统基于 Cookie、LocalStorage 的标识方案极易被用户手动清除,而浏览器指纹通过采集浏览器与操作系统的各类特征信息生成唯一标识,具备无状态、强持久化的特点。