爬虫

zhougl9966 小时前
java·spring boot·爬虫
Java Spring Boot 爬虫技术全面介绍在 Java 生态中,Spring Boot 凭借其自动配置、依赖注入、定时任务等开箱即用的能力,成为构建企业级爬虫系统的理想框架。下面从工具选型、架构设计、代码实现到反爬策略,系统梳理 Spring Boot 爬虫开发的核心知识。
Cory.眼6 小时前
开发语言·爬虫·python
Python爬虫实战:从入门到进阶使用requests和BeautifulSoup库可以快速实现基础爬虫功能。以下是一个完整的示例代码,用于抓取网页标题和链接:
python布道者05167 小时前
爬虫·youtube
【技术分享】从零构建YouTube评论爬虫:TKinter + Pandas + 反反爬全解析本文对应仓库:https://github.com/mashukui/ytb_cmt_spiderYouTube 作为全球最大的视频平台,其评论区蕴藏着大量用户反馈和舆情数据。然而 YouTube 官方 API 有严格的配额限制,每天仅提供 10,000 单位的配额,对于大规模数据采集需求来说远远不够。
zhougl99612 小时前
java·爬虫·腾讯云
Java实现腾讯云开发者社区列表爬虫文档版本:v1.0 适用源码:com.ruoyi.crawler.part1crawler.jishu.crawler4tx.TXListJsoup 适用工程:若依(RuoYi)系多站点爬虫子系统(part1crawler.jishu.crawler4tx) 编写目的:从「是什么、为什么、怎么做」三个层次,对该类做完整剖析,作为后续维护、扩展的参考手册。 仅供学习交流
Experience-摆渡1 天前
爬虫
Firecrawl深度调研报告:功能、实现原理、架构与自研落地建议调研时间:2026-08-12 数据来源:GitHub 官方仓库(firecrawl/firecrawl,main 分支实时抓取)、官方文档 docs.firecrawl.dev、源码关键文件 调研方式:GitHub API + raw 直链源码分析(未 clone,仓库 174MB)
深蓝电商API1 天前
爬虫·hook
Hook XMLHttpRequest 实战在前端逆向、爬虫对抗与安全测试中,Hook XMLHttpRequest(简称 XHR) 是最基础也最实用的技术之一。无论是定位加密参数、拦截接口数据,还是篡改请求 / 响应内容,掌握 XHR Hook 都能大幅提升调试效率。本文从原理到实战,一步步拆解完整的 Hook 方案,并给出可直接复用的代码模板。
quantdash_cc2 天前
开发语言·爬虫·python·pandas·量化·quantdash
告别自建 Requests/BS4 网页爬虫:基于 QuantDash 搭建零维保的高性能量化行情流水线量化交易开发中,使用 Requests/BS4/Selenium 编写网页爬虫面临反爬封禁、HTML 结构突变、复权因子计算复杂及多市场代码不统一等维保地狱。通过切换至标准化 Python 量化 API —— QuantDash (pip install quantdash),开发者只需几行原生代码即可直接获取经过服务器端精确复权(前复权/后复权)、涵盖 A 股/美股/港股(如 .SH, .SZ, .US, .HK)的标准 Pandas DataFrame 数据,将数据维护成本直接降为 0。本文将深入解析
Patrick在香港2 天前
java·开发语言·爬虫·python·ai编程·数据可视化·可用性测试
Python爬虫框架实战:优雅抓取香港政府公开API数据的通用方案那天我在 data.gov.hk 上统计了一下:5700个数据集,其中2500个提供API接口。城巴的实时到站、差饷署的30年租金指数、医管局的急症室轮候时间——全是免费、公开、实时更新的数据。
鬼手点金3 天前
爬虫·python·llm·post·request·firecrawl·crawl4ai
与LLM结合的主流智能爬虫框架目前市面上有几个非常有代表性的开源框架:1. Crawl4AI 这是一个强大的开源网页爬取工具,旨在为大模型应用提供高质量的数据5。它的特点包括: LLM驱动提取:可以直接集成各种大语言模型(如 GPT、DeepSeek 等),根据你的指令从网页中提取结构化数据。 AI清洗与格式化:能够自动去除网页中的广告、导航等噪音,提取主内容,并输出为 Markdown、JSON 等对LLM友好的格式。 引用与附件处理:具备处理网页引用和链接的能力,可以将页面中的参考文献或附件链接整理成有序列表,这与你整理附件链接的
天启HTTP4 天前
网络·爬虫·tcp/ip
爬虫频繁弹验证码?解析网站反爬检测机制在进行数据采集时,很多开发者都会遇到一个常见问题:程序运行一段时间后,网页开始频繁弹出验证码,甚至直接返回访问异常页面。明明代码逻辑没有变化,请求格式也保持一致,但爬虫任务却越来越难以稳定运行。
深蓝电商API5 天前
爬虫·加密函数
如何快速定位加密函数?在逆向分析、漏洞挖掘、CTF 解题与恶意代码分析中,加密函数的定位往往是破解数据交互、还原通信逻辑的第一步。面对无符号的二进制程序,盲目逐行阅读汇编效率极低,掌握一套从快到慢、从静到动的定位方法论,能将分析时间从数小时压缩到几分钟。
oh,huoyuyan5 天前
人工智能·爬虫·火车采集器
网页公开数据采集工具推荐🖥️火车采集器(LocoySpider,俗称火车头) 国内老牌桌面端采集软件,本地运行,偏专业向,站长、内容从业者使用非常多。 核心能力 1、支持 XPath、正则、前后截取提取网页内容;内置浏览器渲染,可处理 JS 动态加载页面、模拟登录保留 Cookie。 2、多线程采集、定时任务、无限级列表‑详情页抓取;支持 C# 脚本扩展,自定义数据清洗逻辑。 3、导出:Excel/CSV,支持直连 MySQL 等数据库,可直接把采集数据发布到 CMS 网站,实现采集‑入库‑发布全流程。 4、免费版永久可用,适
崔子末5 天前
爬虫·python
某影视库剧集列表以及查询接口逆向本文记录了对某影视库网站的剧集列表接口以及查询接口的逆向分析过程,主要包括网络请求分析、JS断点调试、加密参数定位以及解密函数的挖掘。
雪山青木5 天前
大数据·爬虫·python·数据挖掘·数据分析·新浪微博
全国微博签到数据201912-202004微博签到数据,一种社交媒体LBS时空大数据,指用户发布微博时主动关联地点(POI),使得该微博具有时空属性。具备大样本、高时间粒度特征,能够表征人群空间活动节律、热点分布、城际流动及场所感知,广泛应用于城市功能识别、旅游地理、社会感知等领域。
TlSfoward5 天前
爬虫·网络协议·https·自动化
DLL 指纹库 采集、检索 TLSFOWARD tls指纹库如何设计一个可靠的 DLL 指纹库?采集、检索与误报控制实践DLL 指纹库的建立看似简单:扫描文件、计算哈希、保存结果。 但如果系统需要长期运行,就会遇到版本爆炸、同名文件、重复数据、签名变化、误报以及样本来源不可信等问题。 一个可维护的 DLL 指纹库,不仅需要完成文件识别,还必须回答三个问题: 这个 DLL 是什么? 它与哪些文件相似? 这条识别结果有多可信? 一、先明确指纹库的建设目标 不同业务需要保存的指纹并不相同。 资产管理型 主要目标是识别企业终端中的 DLL 版本。 重点字段包括: 文件路径
有味道的男人6 天前
爬虫·亚马逊
基于 Codex 爬虫构建亚马逊无人上架系统|竞品详情采集到商品发布完整实现
张小凡vip7 天前
开发语言·爬虫·python
Python爬虫实战:高效稳定的文件下载模块设计与实现在数据采集工作中,下载文件(如图片、文档、压缩包)是极为常见的需求。无论是抓取电商平台商品图、采集公开数据集,还是备份网站资源,一个稳定高效的文件下载模块都是爬虫系统的重要组成部分。
tang777897 天前
爬虫·爬虫代理·动态代理ip·代理ip·503·407·爬虫报错
爬虫代理报错速查:407/408/409/410/503 从报错到根治(实测可用)做爬虫的基本都被代理报错坑过:明明代码没改,换个IP、跑久一点就疯狂抛异常,网上教程大多是通用HTTP解释,根本不贴合代理IP池、高频爬取、网站反爬场景。
小白学大数据7 天前
开发语言·爬虫·python·汽车
Python 爬虫实战:抓取汽车之家二手车成交价格与里程数据二手车是典型的非标品:同一款车,因为上牌年份、行驶里程、所在城市、车况等级不同,价格能差出好几万。汽车之家二手车(che168.com)聚合了全国大量真实成交记录,是做残值率分析、定价模型、区域行情监控最省钱的公开数据源。