一个高效的阿里云漏洞库爬虫工具,用于自动化爬取和处理CVE数据

工具介绍

阿里云漏洞库爬虫 (AliyunCVE_Crawler),一个高效的阿里云漏洞库爬虫工具,用于自动化爬取和处理CVE(Common Vulnerabilities and Exposures)数据。

🚀 功能特性

  • 批量爬取: 支持批量爬取阿里云漏洞库的CVE数据
  • 增量更新: 支持增量爬取,只获取指定日期后的新漏洞
  • 详细信息: 提取完整的CVE详情,包括描述、解决方案、CVSS评分等
  • 数据标准化: 自动转换为标准CVEInfo格式,便于后续处理
  • 并发处理: 支持异步并发爬取,提高效率
  • 智能重试: 内置错误处理和重试机制
  • 数据持久化: 自动保存爬取结果到JSON文件
  • 性能监控: 提供详细的爬取统计和性能指标
  • 🎨 现代GUI: 基于ttkbootstrap的现代化图形界面
  • 📊 数据可视化: 实时统计和结果展示
  • ⚙️ 可视化配置: 直观的参数设置和管理
  • ⏹️ 安全停止: 支持爬取过程中的安全中断和停止

🛠️ 安装

1. 克隆项目

bash 复制代码
git clone https://github.com/vistaminc/AliyunCVE_Crawler.git
cd AliyunCVE_Crawler

2. 安装依赖

bash 复制代码
pip install -r requirements.txt

3. 安装浏览器驱动

bash 复制代码
playwright install chromium

📖 快速开始

🎨 图形界面(推荐)

bash 复制代码
# 启动现代化GUI界面
python run_gui.py

GUI界面提供:

  • 🖱️ 直观的点击操作
  • 📊 实时数据展示
  • ⚙️ 可视化配置管理
  • 📈 爬取进度监控
  • 💾 一键导出功能

💻 命令行使用

bash 复制代码
# 爬取前10页数据
python main.py --pages 10

# 从第5页开始爬取10页
python main.py --pages 10 --start-page 5

# 增量爬取最近7天的数据
python main.py --incremental --days 7

# 显示浏览器界面(调试模式)
python main.py --pages 5 --no-headless

🐍 Python API

python 复制代码
import asyncio
from main import crawl_aliyun_cves

async def main():
    # 爬取前5页的CVE数据
    cve_infos = await crawl_aliyun_cves(max_pages=5)
    print(f"成功爬取 {len(cve_infos)} 个CVE")

asyncio.run(main())

工具下载

https://github.com/Vistaminc/AliyunCVE_Crawler

相关推荐
OidEncoder44 分钟前
绝对值编码器在AGV舵轮上的应用与调试(含硬件对接+故障排查+代码实例)
人工智能·物联网·自动化·智慧城市·信息与通信
wzl202612131 小时前
基于规则引擎的新客欢迎语自动化:从0到1搭建智能破冰系统
大数据·运维·自动化
信也科技布道师1 小时前
打破“知识孤岛”:微服务架构下的自动化业务图谱构建
微服务·架构·自动化
MadPrinter2 小时前
OpenClaw更换stepfun/step-3.5-flash模型报错:Unknown model 解决(核心:漏加前缀)
网络·ai·自动化·openclaw
朗宇芯工控2 小时前
机器人示教器如何使用按键旋钮的功能
机器人·自动化·制造·运动控制系统·机械手
WeeJot嵌入式3 小时前
爬虫对抗:ZLibrary反爬机制实战分析
爬虫·python·网络安全·playwright·反爬机制
进击的雷神3 小时前
攻克JSON嵌套HTML的双重解析难题:基于多层数据提取的精准爬虫设计
爬虫·html·json·spiderflow
前端小趴菜~时倾4 小时前
自我提升-python爬虫学习:day05-函数与面向对象编程
爬虫·python·学习
进击的雷神4 小时前
攻克JSON接口分页与对象数组处理:基于AJAX数据源的精准博客爬虫设计
爬虫·ajax·json·spiderflow
志栋智能4 小时前
低成本构建:企业级IT运维自动化中台实践方案
运维·自动化