有没有能够通过AI实现自动爬虫的项目

前言

刚刚看到篇帖子: https://linux.do/t/topic/2599282/31 学到了一个新的格式: Har. 它比curl记载的信息更多, 基于json结构也比较易读.

HAR 是 HTTP Archive 的缩写,后缀 .har,是 JSON 格式的文件,用来记录浏览器一次页面加载完整网络请求日志,由 Chrome、Edge、Firefox 开发者工具导出。

帖子中的需求和我类似, 也是通过对网站进行分析, 获取调用顺序对数据进行处理. 通常的步骤都是:

  • 抽取公共参数
  • 解决加密sign
  • 记录前后请求逻辑
  • 程序实现验证

之前是如何做的

说实话这是我第一次知道Har格式. 之前我收集请求都是F12看请求, 右键复制为curl保存到md文件中, 另外再把响应体粘贴进去. 大概结构如下:

md 复制代码
## xx网站处理流程
## 页面上下文

| 字段 | 值 |
| --- | --- |
| companyId | `xxxx` |
| userId | `xxxx` |
| companyName | `xxxx` |
### 1.登录接口
curl 'https://a.domain.com/login' \
  -X POST \
  -H 'token: <PTX_TOKEN>' \
  -H 'userId: xxx' \
  -H 'Content-Type: application/x-www-form-urlencoded;charset=UTF-8' \
  -H 'DNT: 1' \
  --data-raw 'id=xxx'
响应体:
{
  "data": {
    "token": "x-x-x-x-x",
    "expireTime": "2026-06-06 11:00:00"
  },
  "code": 200,
  "success": true
}
### 2.查询接口
xxx省略

之后根据自己的操作步骤, 完善请求直接的调用顺序, 补充文档:

md 复制代码
### 登录调用
先调用encry方法对pwd进行加密, 然后调用/login方法传参, 解析数据中的token.
判断响应体中的结果是否有token, 如果xxx就xx, 如果xx就xxx

总体来说就是多记录, 多测试. 尽可能的让程序一遍跑通. 遇到了加密也需要自行打断点调试.

之前和AI工作

在半年前或去年之前, 让ai完成爬虫处理也是我把上述文档丢给ai, 让他读取然后进行代码实现.

text 复制代码
我有某系统的curl数据记录 @数据记录.md, 你帮我实现其中的 逻辑A的功能, 执行顺序如下:
xxx/ xxx/ xxx
要求请求工具使用 @reqUtils.ts, 入参/出差根据业务描述放到 @shared/types/业务名 中, 系统工具类方法在 @commUtils中, 代码写详细注释, 类型确保正确, 禁止unkow/any. xxx其他规则

基本就是把文档变成了提示词文档, 里面写给ai的提示词, 让ai实现代码, 最后再测试.

现在和AI工作

现在ai都支持调用浏览器, 所以现在把之前的接口文档省了, 但是操作过程 还是口述给ai的:

现在的提示词就变成:

复制代码
再继续处理 功能1->账号开具中的请求, 有搜索页面/新增页面, 新增里面有不同的账号类型/标签类型/清单类型, 还需要选择主体名称或应税劳务、服务名称中的商品搜索 然后支持暂存和保存, 这些都需要收集整理
另外账号开具的搜索列表有查看操作, 也需要整理

这时候的ai能把绝大部分的数据整理清晰, 包括基础的curl,请求/响应, 下拉框数据从哪来, 各请求间的调用嵌套.

有些网站的加密简单, ai能直接获取到相对应的密钥.

而且ai处理的时候也能看到界面, 有问题可以第一时间优化. 同时我发现, ai有时候不是点击按钮触发请求进行抓包的. 它会直接分析页面对应的js源码找到入参/出差.

因为有一次我让ai抓取保存请求, 我看着界面它并没有点按钮, 但还是输出了数据, 我就问他没点击按钮怎么来的数据. 相关截图找不到了

但还是少不了写提示词, 你要给ai说请求如何进入界面, 如何点击按钮.

以后

同时我看到有篇帖子说了一个自动化渗透系统, ai对渗透的解释是这样的:

我个人的理解就是对系统进行漏洞测试的, 并不适合做项目的爬虫.

所以现在或以后有没有能够对某个网站进行抓包扫描的系统? 能够让大模型理解网站是干什么的, 通过不同的身份让ai理解那些是网站重点.

或者还可以由人工规划执行路径: 先点这, 再点哪 一步步的操作

结束

现在让ai做的系统都是简单的, 无复杂加密的. 不像Boss或淘宝, 连真人操控都会弹验证码, 这种复杂网站不在讨论范围之内.

我感觉随着ai的能力提高, 爬虫简单网站会变得越来越简单. 就像之前做个页面写几个按钮要2天, 现在就要2分钟.

而且ai应该对这种网站爬虫很高效, 巨量的上下文对ai来说没有任何难度. 而同样的内容, 让人来分析/debug就要几个小时或几天.

同时咱们处理请求都是看f12, ai的好处是能够直接读混淆后的源码. 源码的变量名/函数加密但不影响接口url和请求体的生成.

所以想问下, 现在还有更好的爬虫方式吗

相关推荐
科技发布2 小时前
传播易整合商圈媒体,商场停车场灯箱广告高效落地
大数据·人工智能·媒体
今天AI了吗2 小时前
从聊天到委派:AI Agent 如何推进长期任务
数据库·人工智能·python·sql·rust
IvanCodes2 小时前
RAG 实战教程(三):向量数据库检索算法,KNN、IVF、HNSW 与 Faiss 实战
人工智能·算法·agent
lxw18449125142 小时前
PHP5、PHP7、PHP8 版本核心区别与特性
人工智能·php
MindUp2 小时前
大模型在命理排盘场景下的多平台功能对比与工程化思考
大数据·人工智能
傻啦嘿哟2 小时前
王者荣耀爬虫:爬取全英雄皮肤数据,用Python做可视化分析
开发语言·爬虫·python
两万五千个小时2 小时前
DeepSeek Harness 从 0 开始:08 Compaction 模块(上下文压缩)
人工智能·程序员·架构
BOBY_KEJI2 小时前
技术实践:AI 数字人一体机在政务与线下商业场景的落地研究
人工智能
阿里云大数据AI技术2 小时前
阿里云 Milvus AI Function | 低成本和高稳定的双重加强
人工智能·agent
小刘快学习2 小时前
印刷包装企业的工艺问答与报价,为什么从直连模型改成了聚合网关
大数据·人工智能