我的个人网站流量暴涨了,Codex+SOL实战分析!

昨天刚发完文章,网站流量突然就增长了好几倍,而且一直持续到了现在,这效果简直无敌。

但是细看了一下,数据明显不正常,不像真实的人类行为。

我只能看出不正常,这看起来很像爬虫行为,但背后的抓取逻辑是什么,是谁在抓,抓去干嘛用的,我是完全没有思路!

所以我又来了一次实战测试,让 Codex+GPT-5.6 Sol 对真实的流量数据进行分析,探索流量异常的本质。

最后发现好像问题不大!

基本确定不是真人,但是无恶意!

下面我就来和大家分享一下真实的数据分析过程。现在还在搞网站或者想搞网站的可以关注一下,实践数据非常宝贵。

我都是边干边学!

1、人工分析

首先来看一下 GA4 的统计数据:

数据变化非常明显,直接从 1000 左右到了 3300,今天估计得破万了!

汇总数据中显示活跃用户涨了 471%,然后有一个对比数据中涨了 4265%(40 倍)

这波动,肯定是超过正常范围了!

我刚开始是怀疑:我分享了网站链接之后,其他人转发了,所以流量一下子大了。

但是当我看了一些具体数据之后,基本上排除了这种情况。

下面是来源和城市分析:

首先大部分都是直接访问,其次大量新加坡用户,然后还有一些乱七八糟的国家的 IP。这些人肯定不是我网站的目标用户,我的用户基本在中国、美国。新加坡也有,但是占比不会这么高!

另外看了下过去30分钟的数据:

30 分钟有 600 多人,而浏览次数也是 600 多次。这一看就有问题!

再看看下面的受访地址,一看就是机器拼接的,目的是遍历潜在的网站内容。

(这遍历有点呆吧,如果是 AI 处理,一下子能找出所有正确的链接)

这一波太明显了,装都不装!

看右边的柱状图,基本上也能感受出来,这是机器行为。

但是这种爬虫好像比直接抓取的爬虫要高级一点,它还假装访问了一下首页,还模拟浏览器来进行抓取的。

说起流量分析,网站防御,那不就巧了么,我刚把网站托管在 CF 上啊!

CF 是"老司机",看看它的统计数据:

它这里显示大部分数据来自美国、新加坡、中国,然后就是一些乱七八糟的国家了。

访问的顶级路径是 cdn-cgi/rum,

访问的顶级域名是 doc.jarvisuni.com

访问最多的 IP 是......单个 IP 这么多量么?我不是很确定这个数据是指什么量!

另外看了一下浏览器,操作系统,排在第一个的都是未知!排在第二的才是 Chrome 和 MacOSX

浏览器 Agents 排第一的是:Mozilla/5.0 AppleWeb!

然后看看它的网站浏览分析:

从昨天晚上八点多开始,就出现了明显的异常流量,半夜搞得特别凶,今天早上还在持续,但是低调很多了。

下面的访问国家地区又给我整迷糊了,排在第一个的是 Brazil(巴西),排第二的是 Vietnam(越南),后面是中国、美国,接下来有一些奇奇怪怪的国家,反正看起来就不是我的目标用户。

再看一下子项:

这个数据和之前的数据又有些不一样!但是单条记录特别突出,肯定不正常!

整个看下来,这数据肯定不正常,但是具体哪里有问题,我也说不清楚!

2、AI分析

遇事不决问 AI,这个任务给 Codex 比较适合!

它办事儿,我还是放心的。

有人可能要问,为啥不用我天天吹的Claude?

因为它有其它重要的任务,在帮我开发坦克世界的联机对战功能呢,这个"延迟"处理是真的难搞,由于服务器在国外,真的很难搞。国内又要备案,也很麻烦。目前只能是在技术上做优化,我已经和 Claude 开房间打了好久了。

说回正题,先来分析今天这个问题!

我的提问是这样的:

因为事关真实的网站安全,所以我是选择了 GPT-5.6 Sol。这次没有用那个 Luna,它应该也可以,但是我希望能用一个脑子更好的模型。

它给我的结论是:

diff 复制代码
账户流量面板约 71.2 万次请求,其中 doc.jarvisuni.com 约 59.6 万次。
安全分析记录约 35.8 万次请求:- 30 万次到达源站,约 84%
- Cloudflare 实际缓解的只有 58 次
- "可疑活动"显示 0,但这不代表流量正常。

最大异常来源是:- ShapBot/0.1.0:约 37.4 万次请求
- 主要来自 Google Cloud ASN 396982
- Cloudflare 将它认定为"已验证自动程序 / AI Search"
- 它大量拼接不存在的路径,例如重复出现 /openai/cn/api/docs/、categories/categories/

另外它还看了AI爬虫的情况:

diff 复制代码
AI Crawl Control 还显示:
- GPTBot:28,810 次失败请求,只有 1 次成功
- PerplexityBot:约 8,130 次
- ChatGPT-User:约 4,420 次
- BingBot:864 次
- AI 爬虫请求中约 29,440 次为 404

我之前都不知道,有这么多类型的爬虫。

要制定规则也不容易,既要拦住恶意流量,又不能误伤正常的用户和正常的爬虫!

它的结论是:

这批 Direct/macOS/Chrome 不能按真人理解,更像会执行 JavaScript 或伪装浏览器指纹的自动化流量。

同时它也帮我看了下目前CF配置规则:

markdown 复制代码
- 自定义规则:**0/5**
- 速率限制规则:**0/1**
- Bot Fight Mode:关闭
- AI Maze:关闭
- AI Crawl Control 中各爬虫阻止开关均关闭

也就是没有开启任何特定的防御,全部属于 CF 的默认状态!确实如此,我没有手动配置过任何特殊防御。

一般来说,默认配置就是最佳配置。只有需要的时候才开启特定设置。

推荐的防御方案

它根据看到的数据,给我定制了防御方案。

它建议分两阶段,避免影响 Bing、Google 和有价值的 AI 引荐。

第一阶段立即执行,误伤风险最低:

1、建立精确的 ShapBot 自定义规则

2、建立异常路径规则,拦截已观察到的重复拼接路径。

3、在 AI Crawl Control 中只阻止 GPTBot(抓训练数据的 bot)

4、增加一条脚本客户端规则,对空 UA、python-requestsscrapyhttpclient 等执行 Managed Challenge。

第二阶段观察约 30 分钟后启用:

5、建立唯一一条免费速率限制规则......

6、为静态文档和短期 404 响应增加边缘缓存,减少爬虫漏网时对 Vercel 源站的消耗

它不建议现在开启全局 Bot Fight Mode 或 Under Attack Mode,因为它们会覆盖整个 jarvisuni.com Zone,可能影响其他子域名、搜索引擎和 AI 引荐。

这个方案看起来还是比较稳的!

我只要确认方案,它可以立马帮我设置好。

到这里我已经大概知道情况了。

这个事情主要来自ShapBot! 我只要确定这个机器人是良性的还是恶意的就好了。

然后我让它分析了一下这个机器人。

结论是:

ShapBot 不是一个普通用户在偷偷镜像你的网站,而是 Parallel Web Systems 的官方商业爬虫。它属于"AI 搜索索引/内容检索基础设施",但确实会复制、保存并结构化公开网页内容,供第三方 AI 应用调用。

Parallel 官方说明:

markdown 复制代码
- `ShapBot` 自动抓取公开网页,用于建立和维护 Parallel 的搜索索引。
- 该索引服务于 Parallel 的搜索 API、AI Agent、聊天机器人和工作流。
- 与之区分的 `Shap-User` 才是某个用户发起请求后、临时读取指定网页的访问。

因此它更准确的分类是:

性质 判断
Google/Bing 式传统搜索收录 不是
AI 搜索索引
模型训练爬虫 官方没有把它描述为训练爬虫
用户实时请求 不是,实时请求使用 Shap-User
商业内容采集
某个人针对你的网站做镜像 暂无证据

根据这个信息,Codex 也做了一定的风险判断:

  • 有人专门盗取并克隆你的网站:目前证据较低
  • Parallel 将你的内容收入商业索引、供第三方 AI 提取:确定存在
  • ShapBot 当前的异常抓取损害网站资源:证据很强
  • 完全放行对你是否有实际流量价值:目前看不到明显价值

因此,它建议修改第一阶段:暂时不全面封禁 ShapBot,先实施"异常路径阻止 + ShapBot 专属限速 + 404 缓存",同时保留正常页面收录。若它仍持续失控,或者你不接受 Parallel 商业化提取内容,再升级为完全阻止。

看到这里基本上明白了,就是有一个商业爬虫在爬我的数据!

这么一看问题不是太大,还好我刚从 Vercel 转到了 CF,否则要被刷破产了!

现在还没消停:

我严重怀疑是我的读者驱动了这个事情。因为这个链接我只在文章中发过!

抓一下也问题不大,反正我也是从OpenAI和Claude那里住过来的。

不过我也是花了一些功夫的。

当时为了保证整个网页高度还原官方的结构和样式,以及让所有内链的正常工作,还是花了些功夫的。全部用LLM来翻译,也是消耗了巨多的Tokens!

我先观察一下吧,我怎么感觉这个爬虫策略不太对,起的有点猛,而且不太聪明的样子。

我准备按兵不动,给它24小时,吃饱了,就可以停了啊。

这个ShapBot给我一种网站流量爆了的错觉,让我很伤心😭!

有本事,你给我搞一些真人来,我就原谅你了!

在这个场景中,其实Codex是完全可以读取和操作CloudFlare的,在功能上绝对没有任何问题!而且搞起来也非常快。

但是,我觉得作为人类有必要搞清楚前因后果,以及不同操作的后果,然后做出最合适的选择!

AI可以快速分析问题,给出建议,辅助我理解各种概念,但是我必须真的能理解这个事情,然后才能掌控全局。

我这里分析的都是真实的AI测试结果,看到的都是真人真事儿,欢迎持续关注!

相关推荐
sarasuki1 小时前
如何让 Agent 获取更多的能力?插件 / 技能系统
人工智能·设计模式·agent
mit6.8241 小时前
Cursor 的记忆导出
人工智能
阡陌数智1 小时前
基于大语言模型的通用可配置 PII 隐私数据检测方案
人工智能·语言模型·自然语言处理
weixin_435208161 小时前
【大模型面试宝典】开源啦!!!
人工智能·职场和发展·agent·deepseek
user_admin_god1 小时前
第 11 篇:实践三 —— 表单 / 合同字段抽取
java·人工智能·spring boot·语言模型
北极有牛1 小时前
cuda算子--矩阵转置
人工智能·算法
诺鸭船长1 小时前
上帝之手Blender丨从入门到榨干
人工智能
lucas_AI1 小时前
第 9 讲 · 编译期优化:让编译器和反汇编告诉你真相
人工智能
无限压榨切图仔1 小时前
加了“去 AI 味”Skill,水稿还是水:AI 写作流程缺的不是润色
人工智能·程序员