爬虫

名字还没想好☜2 小时前
开发语言·爬虫·python·并发·asyncio
Python asyncio.Queue 实战:用生产者-消费者给爬虫/任务流限速又解耦写异步爬虫或批量任务时,新手最容易掉进的坑是这样的:一次性把 5000 个 URL 全丢进 asyncio.gather。
2601_966949654 小时前
开发语言·人工智能·爬虫·python·量化策略·量化·quantdash
Python 量化数据质量校验:如何确保股票历史日线数据不存在缺失交易日?针对“如何确保从第三方接口获取的股票历史日线数据不存在缺失交易日”这一量化开发中的核心痛点,本文给出直接结论:缺失交易日的根源在于数据源本身的完整性缺陷与本地缺乏系统性校验流程。解决方案是建立一套“获取 → 字段校验 → 缺失值统计 → 交易日完整性核查”的自动化流水线。QuantDash Python SDK 返回的 DataFrame 自带标准字段(trade_date、open、high、low、close、volume),配合 Pandas 数据质量校验与交易日历对齐,可在数行代码内完成全链路数据
benchmark_cc4 小时前
人工智能·后端·爬虫·算法·claude·mcp·quantdash
Claude Code + MCP + QuantDash:打造全自动量化研究流水线的终极指南针对「Claude Code + MCP + 量化数据源 = 全自动量化研究流水线」这一目标问题,本文给出直接结论:通过 Model Context Protocol(MCP)将 QuantDash 的标准化多市场数据(A股/美股/港股)接入 Claude Code,即可实现从「行情拉取 → 策略编写 → 回测验证 → 参数调优」的端到端自动化闭环,全程无需手动搬运 CSV、无需维护爬虫、无需适配多套数据格式。QuantDash Python SDK 的原生 Pandas/Polars 输出、服务器端前复
Buke..1 天前
前端·人工智能·爬虫·python·小程序·notepad++
【小程序逆向】某游快爆 AI 逆向 sign参数:AI 辅助分析与 MCP 工具链实战本文章中所有内容仅供学习交流使用,不用于其他任何目的,不提供完整代码,抓包内容、敏感网址、数据接口等均已做脱敏处理,严禁用于商业用途和非法用途,否则由此产生的一切后果均与作者无关!
码农飞哥1 天前
人工智能·爬虫·langchain·ai编程·亮数据
RAG 翻车实测 + LangGraph Agent 实时抓取修复RAG翻车实测+LangGraph Agent 实时抓取修复体验地址,注册即送美金传统 RAG 分五步:获取、分块、向量化存储、检索、生成。对制度、手册、历史档案,这套链路完全合理,因为这些知识几乎不变。但遇到"最新版本"“今天的公告”"当前价格"这类带时效的问法就会出问题:知识库在 T0 入库时写的是旧值,官方在 T1 更新,用户在 T2 提问,检索到的仍是 T0 的证据。模型能力没有下降,是它手里的证据停在了过去。
小白的成长路程1 天前
人工智能·爬虫
移动版藏内容,AI爬虫直接跳过很多人以为网站做了响应式设计就万事大吉,但GEO时代移动适配的标准已经变了。AI爬虫默认用手机UA抓取,超过60%的AI搜索查询发生在移动端。如果你的核心内容在移动版被CSS折叠隐藏、表格横向滚动、Schema靠JS动态注入,AI看到的可能只是一个"精简版空壳"。在阳光每一天的知识库中,你的皮卡丘分析过一个典型案例:某内容平台桌面端AI引用率正常,移动端却几乎为零,排查后发现平台为了"清爽感"把数据表格和FAQ全部塞进了折叠面板,AI爬虫不会点击,这些高价值内容对AI根本不可见。更隐蔽的是,触屏体验差导致
IT毕设实战小研1 天前
java·大数据·后端·爬虫·python·算法·课程设计
基于大数据的二手车数据分析与预测🔥作者:it毕设实战小研🔥 💖简介:java、微信小程序、安卓;定制开发,远程调试 代码讲解,文档指导,ppt制作💖 精彩专栏推荐订阅:在下方专栏👇🏻👇🏻👇🏻👇🏻 Java精彩实战毕设项目案例 小程序精彩项目案例 Python大数据项目案例
深蓝电商API2 天前
爬虫·aes 加密
AES 加密逆向思路在逆向工程与协议分析领域,AES(Advanced Encryption Standard)是目前最常见的对称加密算法,广泛应用于客户端通信加密、本地数据保护、License 校验、固件加密等场景。与自定义异或、简单置换不同,AES 具有严格的数学结构和固定的算法特征,这也为逆向识别与还原提供了明确的抓手。本文从实战角度系统梳理 AES 加密的逆向分析思路,覆盖静态识别、动态抓包、密钥提取、变体对抗等完整链路。
深蓝电商API4 天前
爬虫·ecc
ECC 加密简介ECC(Elliptic Curve Cryptography,椭圆曲线密码学)是现代公钥密码体系的核心分支之一,它基于椭圆曲线数学理论实现加密、签名与密钥交换功能。与传统的 RSA、DSA 等算法相比,ECC 能够以更短的密钥长度提供同等强度的安全保障,在资源受限的移动设备、物联网、区块链等领域得到了广泛应用,已成为当代密码学的主流技术方向。
Buke..3 天前
java·javascript·爬虫·python·算法
【APP 逆向】哔哩哔哩 sign 参数逆向(下):OLLVM 混淆还原 sign 算法本文章中所有内容仅供学习交流使用,不用于其他任何目的,不提供完整代码,抓包内容、敏感网址、数据接口等均已做脱敏处理,严禁用于商业用途和非法用途,否则由此产生的一切后果均与作者无关! 本文章未经许可禁止转载,禁止任何修改后二次传播,擅自使用本文讲解的技术而导致的任何意外,作者均不负责,若有侵权,请联系作者立即删除!
Buke..3 天前
java·开发语言·爬虫·python·安卓
【APP 逆向】哔哩哔哩 sign 参数逆向(上):Frida 反调试绕过与 unidbg 调用本文章中所有内容仅供学习交流使用,不用于其他任何目的,不提供完整代码,抓包内容、敏感网址、数据接口等均已做脱敏处理,严禁用于商业用途和非法用途,否则由此产生的一切后果均与作者无关! 本文章未经许可禁止转载,禁止任何修改后二次传播,擅自使用本文讲解的技术而导致的任何意外,作者均不负责,若有侵权,请联系作者立即删除!
归去来 兮3 天前
开发语言·爬虫·python
Python爬虫爬取数据案例爬虫协议,是每一个爬虫开发者都应该遵守的协议,但是他是一个君子协定,并不是强制协定,但为了维护网络环境,大家都应该遵守下,把环境搞臭了,还是程序员受害。 那爬虫协议怎么看呢,我们可以瞅瞅B站的爬虫协议,获取方式如下:
大鹏说大话4 天前
开发语言·爬虫·python
从爬虫到决策引擎:大数据下自媒体如何用Python挖掘用户痛点在自媒体竞争进入“存量博弈”的时代,爆款不再靠运气,而靠对用户痛点的精准拿捏。内容创作者面临一个核心矛盾:信息过载与洞察稀缺并存——评论区、热榜、社群里藏着海量需求信号,却难以被人工高效识别。Python 作为数据科学与自动化的通用语言,正成为连接“原始数据”与“内容决策”的关键桥梁。本文将系统拆解:自媒体如何从零搭建一套轻量级“数据驱动决策系统”,用爬虫采集信号,用算法提炼痛点,最终反哺内容生产。
Minner-Scrapy4 天前
java·爬虫·python·scrapy·网络爬虫·twisted
Scrapy 2.17 源码解析:Scheduler 调度器与磁盘/内存双队列本文基于 Scrapy 2.17.0 的真实源码逐行分析。 其中 SCHEDULER_START_MEMORY_QUEUE / SCHEDULER_START_DISK_QUEUE(起始请求独立队列)是 2.13+ 才有的机制,旧版本没有,网上资料基本没覆盖。
不叫猫先生4 天前
爬虫·agent
2026 Web Scraping 实战:页面改 class 就归零?用 Bright Data 搭稳定的 Agent 爬虫之前有个需求要爬取某BOSS直聘的岗位信息, 我在Cursor 里让 Agent 去执行,它兴冲冲写出一堆 CSS 选择器,跑通了。过了一段时间,官方页面改了一个 class,整段 pipeline 直接归零,无力回天。
陈皮波比茶4 天前
开发语言·网络·爬虫·python·机器人
Python项目实战-网络机器人(爬虫)爬虫:也称为网络爬虫(网络机器人),是一种按照一定的预设规则,自动浏览并抓取网络数据的程序或脚本场景搜索引擎(百度、Google)
tang777894 天前
爬虫·tcp/ip·scrapy·架构·爬虫代理·动态ip
Scrapy框架动态IP自动轮换集成配置教程做爬虫开发的小伙伴基本都踩过封IP的坑:高频请求站点后IP被限流、封禁,爬虫直接瘫痪。手动换IP效率极低,而Scrapy原生支持代理中间件,搭配动态IP轮换就能完美解决这个问题。
傻啦嘿哟5 天前
java·c++·爬虫
英雄联盟皮肤爬虫:爬取全皮肤价格与特效,做比价工具在《英雄联盟》这款运营超过十五年的游戏中,皮肤早已超越了“外观装饰”的范畴,成为游戏文化的重要组成部分。截至2026年,游戏内已拥有超过160位英雄、超过1500款皮肤——从售价低廉的“勇士”系列,到高达数千元的“神话”限定,每一款皮肤的推出都牵动着亿万玩家的心。
Spider赵毅5 天前
爬虫·python·beautifulsoup
Python爬虫踩坑实录:BeautifulSoup使用中的高频问题排查多数场景下,CSS选择器或find_all直接定位到目标节点就够了。但有一类页面,目标数据的位置取决于上下文关系——比如"标题后面紧跟的那段价格文本",或者"某个特定标签的父级容器的兄弟节点里的字段"。这种定位依赖节点间关系,选择器写不出,就得手动在DOM树里走。
Patrick在香港5 天前
redis·爬虫·python
Python asyncio + aiohttp 并发抓取实战:把同步爬虫改造成 3 倍吞吐量的并发管道上个月我发了篇同步版 HKOpenDataClient(香港政府公开 API 的通用爬虫框架),文末说"如果你要批量抓多个 endpoint,请等下一篇文章"——今天就来填这个坑。