有没有能够通过AI实现自动爬虫的项目

前言

刚刚看到篇帖子: https://linux.do/t/topic/2599282/31 学到了一个新的格式: Har. 它比curl记载的信息更多, 基于json结构也比较易读.

HAR 是 HTTP Archive 的缩写,后缀 .har,是 JSON 格式的文件,用来记录浏览器一次页面加载完整网络请求日志,由 Chrome、Edge、Firefox 开发者工具导出。

帖子中的需求和我类似, 也是通过对网站进行分析, 获取调用顺序对数据进行处理. 通常的步骤都是:

  • 抽取公共参数
  • 解决加密sign
  • 记录前后请求逻辑
  • 程序实现验证

之前是如何做的

说实话这是我第一次知道Har格式. 之前我收集请求都是F12看请求, 右键复制为curl保存到md文件中, 另外再把响应体粘贴进去. 大概结构如下:

md 复制代码
## xx网站处理流程
## 页面上下文

| 字段 | 值 |
| --- | --- |
| companyId | `xxxx` |
| userId | `xxxx` |
| companyName | `xxxx` |
### 1.登录接口
curl 'https://a.domain.com/login' \
  -X POST \
  -H 'token: <PTX_TOKEN>' \
  -H 'userId: xxx' \
  -H 'Content-Type: application/x-www-form-urlencoded;charset=UTF-8' \
  -H 'DNT: 1' \
  --data-raw 'id=xxx'
响应体:
{
  "data": {
    "token": "x-x-x-x-x",
    "expireTime": "2026-06-06 11:00:00"
  },
  "code": 200,
  "success": true
}
### 2.查询接口
xxx省略

之后根据自己的操作步骤, 完善请求直接的调用顺序, 补充文档:

md 复制代码
### 登录调用
先调用encry方法对pwd进行加密, 然后调用/login方法传参, 解析数据中的token.
判断响应体中的结果是否有token, 如果xxx就xx, 如果xx就xxx

总体来说就是多记录, 多测试. 尽可能的让程序一遍跑通. 遇到了加密也需要自行打断点调试.

之前和AI工作

在半年前或去年之前, 让ai完成爬虫处理也是我把上述文档丢给ai, 让他读取然后进行代码实现.

text 复制代码
我有某系统的curl数据记录 @数据记录.md, 你帮我实现其中的 逻辑A的功能, 执行顺序如下:
xxx/ xxx/ xxx
要求请求工具使用 @reqUtils.ts, 入参/出差根据业务描述放到 @shared/types/业务名 中, 系统工具类方法在 @commUtils中, 代码写详细注释, 类型确保正确, 禁止unkow/any. xxx其他规则

基本就是把文档变成了提示词文档, 里面写给ai的提示词, 让ai实现代码, 最后再测试.

现在和AI工作

现在ai都支持调用浏览器, 所以现在把之前的接口文档省了, 但是操作过程 还是口述给ai的:

现在的提示词就变成:

复制代码
再继续处理 功能1->账号开具中的请求, 有搜索页面/新增页面, 新增里面有不同的账号类型/标签类型/清单类型, 还需要选择主体名称或应税劳务、服务名称中的商品搜索 然后支持暂存和保存, 这些都需要收集整理
另外账号开具的搜索列表有查看操作, 也需要整理

这时候的ai能把绝大部分的数据整理清晰, 包括基础的curl,请求/响应, 下拉框数据从哪来, 各请求间的调用嵌套.

有些网站的加密简单, ai能直接获取到相对应的密钥.

而且ai处理的时候也能看到界面, 有问题可以第一时间优化. 同时我发现, ai有时候不是点击按钮触发请求进行抓包的. 它会直接分析页面对应的js源码找到入参/出差.

因为有一次我让ai抓取保存请求, 我看着界面它并没有点按钮, 但还是输出了数据, 我就问他没点击按钮怎么来的数据. 相关截图找不到了

但还是少不了写提示词, 你要给ai说请求如何进入界面, 如何点击按钮.

以后

同时我看到有篇帖子说了一个自动化渗透系统, ai对渗透的解释是这样的:

我个人的理解就是对系统进行漏洞测试的, 并不适合做项目的爬虫.

所以现在或以后有没有能够对某个网站进行抓包扫描的系统? 能够让大模型理解网站是干什么的, 通过不同的身份让ai理解那些是网站重点.

或者还可以由人工规划执行路径: 先点这, 再点哪 一步步的操作

结束

现在让ai做的系统都是简单的, 无复杂加密的. 不像Boss或淘宝, 连真人操控都会弹验证码, 这种复杂网站不在讨论范围之内.

我感觉随着ai的能力提高, 爬虫简单网站会变得越来越简单. 就像之前做个页面写几个按钮要2天, 现在就要2分钟.

而且ai应该对这种网站爬虫很高效, 巨量的上下文对ai来说没有任何难度. 而同样的内容, 让人来分析/debug就要几个小时或几天.

同时咱们处理请求都是看f12, ai的好处是能够直接读混淆后的源码. 源码的变量名/函数加密但不影响接口url和请求体的生成.

所以想问下, 现在还有更好的爬虫方式吗

相关推荐
m4Rk_3 小时前
【论文阅读】Agent 记忆机制(83):Inside Out——用可演化 PersonaTree 构建 Agent 的核心长期记忆
论文阅读·人工智能·学习·开源·github
运行时异常3 小时前
【WMS 仓储系统集成 AI Agent 实战】第 8 讲(终篇):生产部署与并发安全——Semaphore 放进 Flux.defer 的坑,压测抓了一晚上
人工智能·安全
杨杨杨大侠3 小时前
Jev、Kev、Laya:决策模型怎么选,什么时候需要微调?
人工智能·python·agent
代码方舟4 小时前
零信任架构实战:基于天远人企关联构建自动化供应链金融网关
运维·人工智能·架构·自动化
虹科网络安全4 小时前
“顶会”看安全(十八):超越越狱:揭示由能力边界模糊引发的 LLM 应用安全风险
人工智能·安全
Maiko Star4 小时前
* LangChain 提示词模板详解:ChatPromptTemplate 的使用与高级特性
java·人工智能·langchain
鬓戈4 小时前
Rust 语言与 AI 应用生态调研及学习路径
人工智能·学习·rust
天远API4 小时前
零信任架构实战:基于天远人企关联构建自动化图谱网关
网络·人工智能·架构·自动化
爱吃提升4 小时前
文生视频模型发展趋势(2026)
人工智能·音视频
AIGS0015 小时前
什么是本体语义平台?和知识图谱、传统数据中台的区别在哪
人工智能·知识图谱·数据中台·ai问数·本体语义平台·智能数据中台