爬虫

小白学大数据2 小时前
开发语言·爬虫·测试工具
长周期爬虫的数据一致性:断点续爬 + 事务回滚保障采集质量一、重新定义问题:爬虫是一类有状态的流处理任务长周期爬虫(任务跨度数天、采集千万级页面)在工程上不应被当成"脚本",而应被建模为一条有状态的流处理管道:待爬 URL 是输入流,落库记录是副作用(side effect),采集进度是消费位点(offset)。一旦这样抽象,文章标题背后的真问题就浮现了——
正在走向自律8 小时前
人工智能·爬虫·ai编程·workbuddy·ai的力量
WorkBuddy AI工具使用介绍完全指南2026年,人工智能已经不再是科幻小说中的概念,而是深刻嵌入到每个人日常工作中的基础工具。从代码编写到文档创作,从数据分析到系统管理,AI助手正在以前所未有的速度改变着知识工作者的生产力边界。然而,传统的AI对话工具往往存在一个明显的短板:它们只能"说",不能"做"。你可以让ChatGPT帮你写一段代码,但它无法直接在你的电脑上创建文件、运行命令或操作浏览器;你可以让Claude帮你分析一份数据,但它无法直接访问你的本地文件系统进行处理。
雨晨源码(同名B站)8 小时前
开发语言·hadoop·爬虫·python·信息可视化·毕业设计
基于Python的网易云音乐评论数据情感化分析系统 音乐爬虫信息可视化 |SnowNLP评论情感分析🔥作者:雨晨源码🔥 💖简介:java、微信小程序、安卓;定制开发,远程调试 代码讲解,文档指导,ppt制作💖 精彩专栏推荐订阅:在下方专栏👇🏻👇🏻👇🏻👇🏻 Java精彩实战毕设项目案例 小程序精彩项目案例 Python大数据项目案例
鬼手点金12 小时前
开发语言·javascript·爬虫·python·scrapy·html·json
Scrapy + Playwright 完整示例(JS 动态渲染网页)作用:Scrapy 本身不执行 JS,Playwright 启动真实浏览器渲染页面,获取 ajax 动态加载出来的数据。
zhougl9961 天前
java·spring boot·爬虫
Java Spring Boot 爬虫技术全面介绍在 Java 生态中,Spring Boot 凭借其自动配置、依赖注入、定时任务等开箱即用的能力,成为构建企业级爬虫系统的理想框架。下面从工具选型、架构设计、代码实现到反爬策略,系统梳理 Spring Boot 爬虫开发的核心知识。
Cory.眼1 天前
开发语言·爬虫·python
Python爬虫实战:从入门到进阶使用requests和BeautifulSoup库可以快速实现基础爬虫功能。以下是一个完整的示例代码,用于抓取网页标题和链接:
python布道者05161 天前
爬虫·youtube
【技术分享】从零构建YouTube评论爬虫:TKinter + Pandas + 反反爬全解析本文对应仓库:https://github.com/mashukui/ytb_cmt_spiderYouTube 作为全球最大的视频平台,其评论区蕴藏着大量用户反馈和舆情数据。然而 YouTube 官方 API 有严格的配额限制,每天仅提供 10,000 单位的配额,对于大规模数据采集需求来说远远不够。
zhougl9961 天前
java·爬虫·腾讯云
Java实现腾讯云开发者社区列表爬虫文档版本:v1.0 适用源码:com.ruoyi.crawler.part1crawler.jishu.crawler4tx.TXListJsoup 适用工程:若依(RuoYi)系多站点爬虫子系统(part1crawler.jishu.crawler4tx) 编写目的:从「是什么、为什么、怎么做」三个层次,对该类做完整剖析,作为后续维护、扩展的参考手册。 仅供学习交流
Experience-摆渡2 天前
爬虫
Firecrawl深度调研报告:功能、实现原理、架构与自研落地建议调研时间:2026-08-12 数据来源:GitHub 官方仓库(firecrawl/firecrawl,main 分支实时抓取)、官方文档 docs.firecrawl.dev、源码关键文件 调研方式:GitHub API + raw 直链源码分析(未 clone,仓库 174MB)
深蓝电商API2 天前
爬虫·hook
Hook XMLHttpRequest 实战在前端逆向、爬虫对抗与安全测试中,Hook XMLHttpRequest(简称 XHR) 是最基础也最实用的技术之一。无论是定位加密参数、拦截接口数据,还是篡改请求 / 响应内容,掌握 XHR Hook 都能大幅提升调试效率。本文从原理到实战,一步步拆解完整的 Hook 方案,并给出可直接复用的代码模板。
quantdash_cc3 天前
开发语言·爬虫·python·pandas·量化·quantdash
告别自建 Requests/BS4 网页爬虫:基于 QuantDash 搭建零维保的高性能量化行情流水线量化交易开发中,使用 Requests/BS4/Selenium 编写网页爬虫面临反爬封禁、HTML 结构突变、复权因子计算复杂及多市场代码不统一等维保地狱。通过切换至标准化 Python 量化 API —— QuantDash (pip install quantdash),开发者只需几行原生代码即可直接获取经过服务器端精确复权(前复权/后复权)、涵盖 A 股/美股/港股(如 .SH, .SZ, .US, .HK)的标准 Pandas DataFrame 数据,将数据维护成本直接降为 0。本文将深入解析
Patrick在香港3 天前
java·开发语言·爬虫·python·ai编程·数据可视化·可用性测试
Python爬虫框架实战:优雅抓取香港政府公开API数据的通用方案那天我在 data.gov.hk 上统计了一下:5700个数据集,其中2500个提供API接口。城巴的实时到站、差饷署的30年租金指数、医管局的急症室轮候时间——全是免费、公开、实时更新的数据。
鬼手点金4 天前
爬虫·python·llm·post·request·firecrawl·crawl4ai
与LLM结合的主流智能爬虫框架目前市面上有几个非常有代表性的开源框架:1. Crawl4AI 这是一个强大的开源网页爬取工具,旨在为大模型应用提供高质量的数据5。它的特点包括: LLM驱动提取:可以直接集成各种大语言模型(如 GPT、DeepSeek 等),根据你的指令从网页中提取结构化数据。 AI清洗与格式化:能够自动去除网页中的广告、导航等噪音,提取主内容,并输出为 Markdown、JSON 等对LLM友好的格式。 引用与附件处理:具备处理网页引用和链接的能力,可以将页面中的参考文献或附件链接整理成有序列表,这与你整理附件链接的
天启HTTP5 天前
网络·爬虫·tcp/ip
爬虫频繁弹验证码?解析网站反爬检测机制在进行数据采集时,很多开发者都会遇到一个常见问题:程序运行一段时间后,网页开始频繁弹出验证码,甚至直接返回访问异常页面。明明代码逻辑没有变化,请求格式也保持一致,但爬虫任务却越来越难以稳定运行。
深蓝电商API5 天前
爬虫·加密函数
如何快速定位加密函数?在逆向分析、漏洞挖掘、CTF 解题与恶意代码分析中,加密函数的定位往往是破解数据交互、还原通信逻辑的第一步。面对无符号的二进制程序,盲目逐行阅读汇编效率极低,掌握一套从快到慢、从静到动的定位方法论,能将分析时间从数小时压缩到几分钟。
oh,huoyuyan6 天前
人工智能·爬虫·火车采集器
网页公开数据采集工具推荐🖥️火车采集器(LocoySpider,俗称火车头) 国内老牌桌面端采集软件,本地运行,偏专业向,站长、内容从业者使用非常多。 核心能力 1、支持 XPath、正则、前后截取提取网页内容;内置浏览器渲染,可处理 JS 动态加载页面、模拟登录保留 Cookie。 2、多线程采集、定时任务、无限级列表‑详情页抓取;支持 C# 脚本扩展,自定义数据清洗逻辑。 3、导出:Excel/CSV,支持直连 MySQL 等数据库,可直接把采集数据发布到 CMS 网站,实现采集‑入库‑发布全流程。 4、免费版永久可用,适
崔子末6 天前
爬虫·python
某影视库剧集列表以及查询接口逆向本文记录了对某影视库网站的剧集列表接口以及查询接口的逆向分析过程,主要包括网络请求分析、JS断点调试、加密参数定位以及解密函数的挖掘。
雪山青木6 天前
大数据·爬虫·python·数据挖掘·数据分析·新浪微博
全国微博签到数据201912-202004微博签到数据,一种社交媒体LBS时空大数据,指用户发布微博时主动关联地点(POI),使得该微博具有时空属性。具备大样本、高时间粒度特征,能够表征人群空间活动节律、热点分布、城际流动及场所感知,广泛应用于城市功能识别、旅游地理、社会感知等领域。
TlSfoward6 天前
爬虫·网络协议·https·自动化
DLL 指纹库 采集、检索 TLSFOWARD tls指纹库如何设计一个可靠的 DLL 指纹库?采集、检索与误报控制实践DLL 指纹库的建立看似简单:扫描文件、计算哈希、保存结果。 但如果系统需要长期运行,就会遇到版本爆炸、同名文件、重复数据、签名变化、误报以及样本来源不可信等问题。 一个可维护的 DLL 指纹库,不仅需要完成文件识别,还必须回答三个问题: 这个 DLL 是什么? 它与哪些文件相似? 这条识别结果有多可信? 一、先明确指纹库的建设目标 不同业务需要保存的指纹并不相同。 资产管理型 主要目标是识别企业终端中的 DLL 版本。 重点字段包括: 文件路径